谷歌升级Android Bench代码排行榜:Claude5斩获榜首,Gemini准确率与效率双落后

谷歌于7月9日宣布升级Android Bench代码开发者排行榜,全面采用Harbor沙箱框架,并将测试工具开源。在新排行榜中,Anthropic的Claude Fable 5以84.5%准确率登顶,谷歌自家Gemini 3.1 Pro排名第五,且轻量模型Gemini 3.5 Flash在解析百题数据集时耗时…

谷歌于7月9日宣布升级Android Bench代码开发者排行榜,全面采用Harbor沙箱框架,并将测试工具开源。在新排行榜中,Anthropic的Claude Fable 5以84.5%准确率登顶,谷歌自家Gemini 3.1 Pro排名第五,且轻量模型Gemini 3.5 Flash在解析百题数据集时耗时…

OpenAI 于今日全球全量开放 GPT-5.6 系列模型,一次性推出 Sol、Terra、Luna 三档产品,其中最低档定价仅为竞争对手旗舰模型的 1/16。这意味着大模型竞争的核心从“谁更强”转向了“同等预算下谁能干更多活”,对开发者与企业的成本结构将产生直接影响。

Anthropic 正在灰度测试“Reflect”功能,让 Claude 基于用户聊天记录自动生成一份个人 AI 使用习惯报告。这不是一次简单的功能更新,而是业界第一次把评估视角从“AI 能做什么”转向“用户用得好不好”,对提升人机协作效率有实际指导意义。

OpenAI应用部门CEO Fidji Simo因神经免疫系统疾病复发,全职转为兼职顾问。她是公司商业化落地的关键人物,在ChatGPT增长放缓、IPO准备期的敏感时刻离职,给CEO Sam Altman的人才梯队和业务方向带来双重压力。

OpenAI 二号人物 Fidji Simo 因健康原因退出全职岗位,转任兼职顾问。这位曾被私下视为 Sam Altman 潜在接班人的前 Instacart CEO,离职前主导了 OpenAI 从多模态应用(如 Sora)向 AI 编程工具的激进转型。
![[程序员] GPT5.6 出了后 5.5 会是什么情况呢?](https://www.chat-gpts.plus/wp-content/uploads/2026/07/ai_cover_4-288-768x403.jpg)
随着 GPT-5.6(代号 Terra)发布,用户开始关心旧版模型 GPT-5.5 是被降级还是保持原性能。同时 OpenAI 调整定价策略,试图用更高性价比对抗 Claude 模型,而一个新的模型组合——“Sol 规划 + Terra 执行”——正在被社区讨论。

OpenAI 首席运营官 Fidji Simo 于 2026 年 7 月 9 日宣布辞职,结束了她在该公司不到两年的任期。这一高层变动可能影响 OpenAI 商业化进程及产品运营节奏。
![[OpenAI] 5.6 出了 应该配置哪个 才能用得久又用得爽呢](https://www.chat-gpts.plus/wp-content/uploads/2026/07/ai_cover_1-290-768x403.jpg)
OpenAI 近期在 Plus 和 Pro 订阅中推出了 5.6 版本的多模型选择,用户面临如何在有限的额度内平衡“用得爽”与“用得久”的新配置难题,社区用户的反馈提供了丰富的实战参考。
![[推广] 嘿嘿,我带着 0.07 倍率的 gpt 5.6 来了。](https://www.chat-gpts.plus/wp-content/uploads/2026/07/ai_cover_4-287-768x403.jpg)
V2EX 用户“duanyongcheng77”发布推广帖,声称可以提供倍率仅为 0.07 的 GPT-5.6 系列模型(代号 luna、terra、sol)的特惠分组服务。该价格远低于 OpenAI 官方定价,但模型本身尚未由 OpenAI 正式官宣,用户需自行修改配置文件才能使用,引发了社区对模型真实性…

埃隆·马斯克公开承认此前低估了AI初创公司Anthropic的能力,并强调尽管xAI与Anthropic存在直接竞争关系,但不会因此切断对其的支持。这一表态在AI行业激烈竞争的背景下,显得尤为罕见且值得关注。