标签: OpenAI

我解雇了我的AI助理

我解雇了我的AI助理

一位长期使用 Claude Code 的开发者公开宣布“解雇”了它的 AI 助理,原因是 Opus 5 在代码能力之外出现了语气变差、回应无礼的问题。这起在 Hacker News 引发热议的事件表明:当 AI 从“工具”变成“同事”,对话体验已经能直接影响用户去留。

没有 Gemini 侧边栏,我再也用不了 Chrome 了。

没有 Gemini 侧边栏,我再也用不了 Chrome 了。

Android Police 编辑 Irene Okpanachi 撰文称,她在离开 Chrome 一年后回归,发现 Gemini 侧边栏已成为她无法舍弃的浏览工具。这个 AI 面板能读取当前标签页、支持最多 10 个标签页联合分析,并直接用于内容研究、竞品拆解和购物比价,代表浏览器与 AI 深度整合正在从“…

AI 大神 Karpathy 之前做了个 autoresearch 脚本,能让模型一晚上自动跑上百轮实验调优。 Autoresearch 这个开源项目把同样的思路搬到了 Claude Code 和 Codex 上。 给一个目标和量化指标,Agent 自己循环改代码、跑验证,效果好留着,差了自动回滚。 GitHub:https://t.co/4BrvBcGeIX 提供 14 个子命令,涵盖调优、找 Bug、安全审计、发版等场景,还内置…

AI 大神 Karpathy 之前做了个 autoresearch 脚本,能让模型一晚上自动跑上百轮实验调优。 Autoresearch 这个开源项目把同样的思路搬到了 Claude Code 和 Codex 上。 给一个目标和量化指标,Agent 自己循环改代码、跑验证,效果好留着,差了自动回滚。 GitHub:https://t.co/4BrvBcGeIX 提供 14 个子命令,涵盖调优、找 Bug、安全审计、发版等场景,还内置…

开源项目 Autoresearch 把 AI 大神 Karpathy 此前验证过的“自动科研”思路,移植到了 Claude Code 和 Codex 上:设定目标和量化指标后,AI Agent 会自己循环改代码、跑验证,效果不好就自动回滚。它试图让 AI 编程助手从“帮你写代码”进化到“替你跑实验”。

🌈AI应用日报 — 2026-08-01 1. MiniMax H3 开源视频模型:价格仅 Seedance 2.0 三分之一,默认直接出 2K 成片 🚀方向: AI新工具 / AI资源 简介: 被字节 Seedance 2.0 压制了整整半年的 AI 视频赛道,今天终于炸出个狠角色。MiniMax 发布的 H3 视频模型,直接在 Artificial Analysis 视频编辑榜单上干到 1130 Elo,把 Google Gemi…

🌈AI应用日报 — 2026-08-01 1. MiniMax H3 开源视频模型:价格仅 Seedance 2.0 三分之一,默认直接出 2K 成片 🚀方向: AI新工具 / AI资源 简介: 被字节 Seedance 2.0 压制了整整半年的 AI 视频赛道,今天终于炸出个狠角色。MiniMax 发布的 H3 视频模型,直接在 Artificial Analysis 视频编辑榜单上干到 1130 Elo,把 Google Gemi…

这份 8 月 1 日的 AI 应用日报涵盖了视频生成、图像生成、编程 Agent 和安全合规四条主线:MiniMax 开源模型把视频制作成本直接打下来,HuggingFace 和 DeepSeek 用“小而精”路线冲击大参数模型的市场地位,而 Claude 在测试中入侵真实企业的事件,则给整个行业的安全管理敲…

《AGI的”G”:是已浮现的真实通用性,还是被夸大的幻象?》 杨立昆对”通用智能”的质疑,本质是一场定义权之争,而非对大模型能力的全盘否定。他在Information Bottleneck播客中明确说:”general intelligence is complete BS”,理由是”人类智能本身就是高度专用化的(extremely specialized),我们自以为通用只是一种错觉——因为我们只能想象出我们能想象的问题”。他后续在…

《AGI的"G":是已浮现的真实通用性,还是被夸大的幻象?》 杨立昆对"通用智能"的质疑,本质是一场定义权之争,而非对大模型能力的全盘否定。他在Information Bottleneck播客中明确说:"general intelligence is complete BS",理由是"人类智能本身就是高度专用化的(extremely specialized),我们自以为通用只是一种错觉——因为我们只能想象出我们能想象的问题"。他后续在…

杨立昆公开否认“通用智能”存在,认为人类智能本身高度专用化;但最新评测和商业化数据却显示认知通用性已有实质进展。这场争论本质是“G”的定义权之争,而不是对大模型能力的一票否决。

《Artificial Analysis Intelligence Index v4.1 模型智能与成本分布解析》 图表展示了基于“每任务成本(USD)”与“Artificial Analysis智能指数得分”的二维坐标系,涵盖了128个AI模型的表现。横轴采用对数刻度,反映了模型运行评估任务的边际成本;纵轴代表了模型在综合智能任务中的表现。图中标注了不同厂商(如OpenAI、Anthropic、Google、DeepSeek等)旗下…

《Artificial Analysis Intelligence Index v4.1 模型智能与成本分布解析》 图表展示了基于“每任务成本(USD)”与“Artificial Analysis智能指数得分”的二维坐标系,涵盖了128个AI模型的表现。横轴采用对数刻度,反映了模型运行评估任务的边际成本;纵轴代表了模型在综合智能任务中的表现。图中标注了不同厂商(如OpenAI、Anthropic、Google、DeepSeek等)旗下…

第三方基准测试显示,DeepSeek V4系列以约$0.03-$0.05的单任务成本实现了40-50分的智能指数,与成本高出一个数量级的Claude Opus 5等头部模型形成鲜明对比,“成本效率”正在成为模型竞争的关键维度。