AI基准测试存在信任问题,Google想解决

Google DeepMind 正尝试用密码学方法解决 AI 基准测试的“泄题”问题——通过“双重盲测”协议,让外部评测机构无需交出测试题目、AI 公司也无需交出模型权重,就能完成对前沿大模型的可信评估。这项技术若能推广,将直接影响未来大模型的能力排名和安全性审查方式。

Google DeepMind 正尝试用密码学方法解决 AI 基准测试的“泄题”问题——通过“双重盲测”协议,让外部评测机构无需交出测试题目、AI 公司也无需交出模型权重,就能完成对前沿大模型的可信评估。这项技术若能推广,将直接影响未来大模型的能力排名和安全性审查方式。

Anthropic 发布 Claude Code 命令行工具 v2.1.251 更新,新增模型切换钩子、前台子代理实时流式输出和花费限制显示等能力,同时修复了多个涉及文件越权、路径穿越与隐私边界的安全漏洞。对使用 Claude Code 的开发者来说,这是一次以安全加固和可观测性为核心的版本迭代。

KV 缓存、前缀缓存、提示词缓存和语义缓存,这四类机制共同决定了 LLM 推理的速度和成本,但它们各自存储的对象、匹配方式和风险完全不同。理解这四者的区别,是判断 API 定价和优化应用延迟的关键。

一篇面向非技术用户的 Codex 实操教程在社区流传,它把 AI 编程助手的使用场景从“写代码”扩展到了电脑配置、文件夹整理等日常任务,说明 AI 工具正在从开发者专属走向普通办公人群。

Anthropic 正式发布面向硬件设备的 MHS(Model Hardware Standard)标准,让大模型驱动的 AI 智能体能安全操控实体设备。它把硬件集成时间从数周甚至数月压缩到几小时,是 AI 从数字世界走向物理世界的关键基础设施。

Anthropic 于 8 月 27 日发布“模型硬件标准”(MHS)研究预览,让 AI 智能体直接控制显微镜、机械臂等物理设备。这是 Anthropic 首次公开布局具身智能与物理 AI,意味着大模型竞争正从“会聊天”延伸到“会干活”。

Anthropic 让 Claude 以“自动研究员”的身份自主训练模型,在 10 类对齐失败任务上均实现显著改善,且方法能迁移到更大的模型上。这意味着 AI 安全研究开始出现“AI 自我改进”的自动化闭环。

开源项目 Experiential 发布了一个面向 Agent 工作流的网关与路由器,可以把生产流量中的使用数据转化为更聪明的模型路由策略,甚至用于微调自有模型。它试图解决大模型调用成本失控和模型选择复杂的问题。

美国联邦法官裁定,国防部将 AI 公司 Anthropic 列入供应链风险黑名单的行为“非法且毫无依据”,并予以阻止。这一裁决不仅为 Anthropic 解除了潜在的业务限制,也为 AI 公司在政府合同中免受“安全黑名单”影响提供了重要司法先例。

Alphabet 股价较 5 月高点下跌超 15%,市值蒸发约 7000 亿美元,导火索是 AI 投入成本持续攀升、Gemini 新模型延期,以及核心 AI 人才流失。市场开始重新审视这家巨头在生成式 AI 竞赛中的防守姿态。