推出全球首个双盲 AI 评估

Google DeepMind 正在试点全球首个双盲 AI 评估机制,试图通过隐藏模型身份和评估者身份,减少主观偏好对 AI 能力测评的干扰,为行业建立更可信的模型比较标准。

Google DeepMind 正在试点全球首个双盲 AI 评估机制,试图通过隐藏模型身份和评估者身份,减少主观偏好对 AI 能力测评的干扰,为行业建立更可信的模型比较标准。

Google DeepMind 于 8 月 27 日发布 Gemini Omni 1.1 Flash,为开发者提供场景延伸、首尾帧插值和 4K 超分等生成式视频控制能力,标志着生成式视频从实验走向可商用的生产阶段。

Anthropic 为 Claude 桌面版 Cowork 功能内置了独立浏览器,Claude 可直接打开网页、填写表单并完成任务,无需用户安装插件或切换应用。这一功能将在一周内覆盖所有付费套餐桌面用户。

AI 研究实验室 DeepCogito 宣布完成 4300 万美元 A 轮融资,总融资额超过 5600 万美元。这家公司押注“后训练”(post-training)与大规模强化学习路线,试图证明 AI 能力提升的关键阶段正在从预训练转向后训练环节。

OpenAI 通过 Codex 推出了原生应用功能,让 AI 代理可以直接在本地环境访问文件并后台运行,这意味着 AI 正从聊天对话框走向实际工作场景,变成更接近“同事”的存在。

Vercel 将 Sandbox 云沙箱服务扩展到多个地理区域,并默认支持故障转移与更高的并发上限,让 AI 智能体(Agent)可以在靠近数据的位置运行代码,从而降低调用延迟。

Anthropic 宣布 Claude 桌面应用将内置一个与用户本地浏览器完全隔离的浏览器,无需额外安装,未来一周内向所有付费计划用户开放。这标志着 AI 助手从“读取网页链接”向“自主操作浏览器”迈出实质性一步。

Anthropic 旗下 Claude 正式将浏览器扩展“Claude in Chrome”推向所有付费套餐,用户无需切换应用即可在已登录的 Chrome 浏览器中直接调用 Claude 完成写作、总结或编程辅助。这意味着 AI 助手正从独立对话框向“随叫随到”的浏览器原生层渗透。

OpenAI 前研究人员 Thibault Sottiaux 在 X 上发文称,在 OpenAI 工作几周的工作量相当于在其他公司干几年,并感叹高强度节奏让人“老得很快”。这条帖子获得超过 75 万次浏览,侧面印证了顶级 AI 实验室内部的极端工作强度。

成立仅一年的 AI 初创公司 Instinct 宣布完成 2.5 亿美元 B 轮融资,估值达 25 亿美元。这款主打“帮你搞定生活”的 AI 助手虽然在隐私权限上引发争议,但仍以惊人的速度获得了资本市场的重金押注。