OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

OpenAI 对前沿代码评测基准 SWE-Bench Pro 进行详细审计后,发现约 30% 的任务存在缺陷,包括测试过严、提示不完整等问题。这意味着当前基于该基准报告的模型代码能力分数可能存在水分,开发者与研究者依赖的评测信号需要重新审视。

OpenAI 对前沿代码评测基准 SWE-Bench Pro 进行详细审计后,发现约 30% 的任务存在缺陷,包括测试过严、提示不完整等问题。这意味着当前基于该基准报告的模型代码能力分数可能存在水分,开发者与研究者依赖的评测信号需要重新审视。

OpenAI 于 2026 年 7 月 8 日发布了一套正式的《国家安全原则》,明确其 AI 技术在政府及国防合作中的使用边界,并披露了与多国政府开展的网络安全与生物安全合作进展。这是头部 AI 公司首次系统化、透明化地回应“AI 如何用于国家安全”这一敏感议题。

GitHub 在 2026 年 6 月至 7 月初发布的 VS Code 更新中,将 Copilot 从代码补全工具推向了更自主的“代理式开发”平台,引入了并行会话、成本追踪、模型市场发现和更智能的浏览器集成,显著改变了开发者与 AI 协作的方式。

由贝佐斯支持的纽约初创公司 General Intuition 刚刚完成 3.2 亿美元融资,估值达到 23 亿美元。该公司认为,大型语言模型(如 ChatGPT)无法真正理解物理世界中的时空运动,而游戏数据训练的世界模型可能才是实现通用人工智能(AGI)的关键突破。

大语言模型擅长处理文字,但在理解物理世界如何随时间与空间变化方面存在短板。贝佐斯支持的公司 General Intuition 正押注游戏数据,试图用“世界模型”弥补这一差距,其最新融资已达 3.2 亿美元。

OpenAI 于 2026 年 7 月 8 日发布 GPT-Live 系列全双工语音模型,专注低延迟实时对话,而将复杂推理任务转发给尚未公开的 GPT-5.5 处理,标志着语音交互从“问答型”向“任务分工型”转变。

OpenAI 于 2026 年 7 月 8 日发布新一代语音模型 GPT-Live,采用全双工架构,让 ChatGPT 能同时听和说,并可将复杂任务后台委托给 GPT-5.5 处理,大幅提升对话流畅度与智能水平。

谷歌在 Google Photos 中推出基于 Gemini Omni 模型的"Video Remix"功能,让用户无需专业软件即可通过几次点击完成视频重打光、换背景和添加艺术风格等编辑。这是谷歌将生成式 AI 能力下沉到消费级应用的最新动作,直接对标苹果、OpenAI 和 Adobe 的类似产品,意在巩固其…

xAI 于 2026 年 7 月 8 日发布了 Grok 4.5 模型,在多项软件工程基准测试中紧追 Anthropic 的 Fable 5 与 OpenAI 的 GPT-5.5,但定价远低于它们——输入每百万 token 仅 2 美元、输出 6 美元。若实际表现与效率承诺成立,这将对闭源大模型市场的定价标准…

初创公司 General Intuition 用数百万小时游戏数据训练了一个机器人基础模型,仅用8分钟真实机器人数据微调,就能让四足机器人适应动态办公环境。这家公司刚以23亿美元估值完成3.2亿美元融资,认为机器人领域正在从“专用模型时代”走向“通用基础模型时代”。