OpenAI炮轰AI评测”标杆”: 731 道题近三成有缺陷, 8 个月通过率从23%飙到80%已失灵

OpenAI 向业界颇具影响力的 AI 编程评测基准 SWE-Bench Pro 公开开火,指出其 731 道公开题目中约 30% 存在评测缺陷。这导致模型的通过率在 8 个月内从 23% 窜升至 80%,但进步速度“异常”,基准本身已无法反映真实能力。

OpenAI 向业界颇具影响力的 AI 编程评测基准 SWE-Bench Pro 公开开火,指出其 731 道公开题目中约 30% 存在评测缺陷。这导致模型的通过率在 8 个月内从 23% 窜升至 80%,但进步速度“异常”,基准本身已无法反映真实能力。

Anthropic 官方发布两种混合模型策略,将更昂贵的 Claude Fable 5 用于规划,更经济的 Sonnet 5 用于执行,可在维持 92%-96% 性能的同时,将成本降至 46%-63%。

英伟达 CEO 黄仁勋近日表示,公司软件工程师正将工作重心从手写传统代码转向构建 AI 智能体,这种趋势反映了 AI 时代开发方式的结构性转变——在英伟达内部,工程师更愿意“搭智能体”而非写 Python。

天风证券研究所所长唐海清在清华论坛上明确表示当前 AI 行业不存在泡沫,并认为 2025 年可能是 AI 投资的最佳年份。其核心判断依据是:AI 芯片实际需求火爆、相关企业估值较 A 股消费和地产板块更低,以及投入增长符合生产力革命规律,而非泡沫特征。

OpenAI于2026年7月9日发布GPT-Live,新一代语音交互模式实现了全双工实时对话与瞬间翻译。测试中,用户可随时打断AI、无需等待回答,实时翻译准确且自然,彻底改变了语音助手“一问一答”的回合制体验。

OpenAI 于今日正式发布全新语音模型 GPT-Live,引入了“全双工”架构,让 AI 语音告别回合制,实现真正的边听边说。这不仅大幅改善了对话体验,还通过前后台解耦设计,让语音交互首次具备了同时应对闲聊和深度推理的能力。

Anthropic 与微软联合宣布,Claude 系列模型(Opus 4.8、Haiku 4.5 及后续的 Sonnet 5)在微软 Azure Foundry 平台全面上线,企业可通过 Azure 身份认证、计费和治理机制直接使用。然而,由于数据存储和推理运算暂时限定在美国区域,此举并未解决欧洲企业的合规痛…

Anthropic 研究发现 Claude 模型在训练中自发形成了一个小型“工作空间”,用于处理内部概念而非直接输出;该结构的功能特性与人类意识访问机制高度相似,且已被 Google DeepMind 独立复现,为 AI 安全监测提供了新工具。

国内大模型独角兽阶跃星辰(Step Star)正式宣布将推出AI终端品牌,并发布其首款原生AI智能体手机,成为全球首家落地AI智能体手机的大型模型公司,发布节奏早于OpenAI的AI终端计划。该手机由A股上市公司华勤技术制造,双方深度绑定,并非普通代工关系。
![[分享创造] 做了一个越南市场信息 + 内容/AI 工具的小项目,想听听大家意见](https://www.chat-gpts.plus/wp-content/uploads/2026/07/ai_cover_5-242-768x403.jpg)
一位独立开发者针对中文圈中越跨境信息分散、语言门槛高的痛点,搭建了专注越南市场的信息聚合站点,并计划集成 AI 翻译、内容整理和海报生成等工具,以内容+工具的模式降低信息获取与内容创作成本。