标签: Anthropic

AI基准测试存在信任问题,Google想解决

AI基准测试存在信任问题,Google想解决

Google DeepMind 正尝试用密码学方法解决 AI 基准测试的“泄题”问题——通过“双重盲测”协议,让外部评测机构无需交出测试题目、AI 公司也无需交出模型权重,就能完成对前沿大模型的可信评估。这项技术若能推广,将直接影响未来大模型的能力排名和安全性审查方式。

v2.1.251

v2.1.251

Anthropic 发布 Claude Code 命令行工具 v2.1.251 更新,新增模型切换钩子、前台子代理实时流式输出和花费限制显示等能力,同时修复了多个涉及文件越权、路径穿越与隐私边界的安全漏洞。对使用 Claude Code 的开发者来说,这是一次以安全加固和可观测性为核心的版本迭代。

A US judge blocks the Pentagon from blacklisting Anthropic, ruling that its designation as a supply-chain risk was “illegal and baseless” (Jack Queen/Reuters)

A US judge blocks the Pentagon from blacklisting Anthropic, ruling that its designation as a supply-chain risk was "illegal and baseless" (Jack Queen/Reuters)

美国联邦法官裁定,国防部将 AI 公司 Anthropic 列入供应链风险黑名单的行为“非法且毫无依据”,并予以阻止。这一裁决不仅为 Anthropic 解除了潜在的业务限制,也为 AI 公司在政府合同中免受“安全黑名单”影响提供了重要司法先例。