推出全球首个双盲 AI 评估

Google DeepMind 正在试点全球首个双盲 AI 评估机制,试图通过隐藏模型身份和评估者身份,减少主观偏好对 AI 能力测评的干扰,为行业建立更可信的模型比较标准。

Google DeepMind 正在试点全球首个双盲 AI 评估机制,试图通过隐藏模型身份和评估者身份,减少主观偏好对 AI 能力测评的干扰,为行业建立更可信的模型比较标准。

InfoQ 刊发了一篇来自 vivo 工程师的 KDC 理论补篇,探讨 Agent 不能只“会推理”,还必须把判断、授权和行动变成可恢复、可审计的软件事实,否则刷新页面或重启进程就可能丢失现场甚至重复退款。

Claude Code 新增 SendFeedback 工具,用户可以直接用自然语言让 Claude 自动撰写并提交产品反馈报告,取代过去手动填写 /feedback 的流程。开发者 Thariq 在 2026 年 8 月 26 日公开了这一变更,意味着 AI 编程工具开始尝试把“收集用户反馈”这一步也交给模…

Anthropic 为 Claude 桌面版 Cowork 功能内置了独立浏览器,Claude 可直接打开网页、填写表单并完成任务,无需用户安装插件或切换应用。这一功能将在一周内覆盖所有付费套餐桌面用户。

AI 研究实验室 DeepCogito 宣布完成 4300 万美元 A 轮融资,总融资额超过 5600 万美元。这家公司押注“后训练”(post-training)与大规模强化学习路线,试图证明 AI 能力提升的关键阶段正在从预训练转向后训练环节。

Vercel 将 Sandbox 云沙箱服务扩展到多个地理区域,并默认支持故障转移与更高的并发上限,让 AI 智能体(Agent)可以在靠近数据的位置运行代码,从而降低调用延迟。

Anthropic 宣布 Claude 桌面应用将内置一个与用户本地浏览器完全隔离的浏览器,无需额外安装,未来一周内向所有付费计划用户开放。这标志着 AI 助手从“读取网页链接”向“自主操作浏览器”迈出实质性一步。

Anthropic 旗下 Claude 正式将浏览器扩展“Claude in Chrome”推向所有付费套餐,用户无需切换应用即可在已登录的 Chrome 浏览器中直接调用 Claude 完成写作、总结或编程辅助。这意味着 AI 助手正从独立对话框向“随叫随到”的浏览器原生层渗透。

开发者 Peter Steinberger 在 X 上公开称赞 OpenAI Codex 的可视化功能“真的变得很棒了”,引发大量开发者共鸣,显示出 AI 编程助手正从“能写代码”向“能看懂过程”进化。

据多家外媒报道,英伟达接近以约129亿美元收购开源AI模型平台Hugging Face,交易若完成,将大幅强化英伟达在开源AI生态和算力分发上的控制力。