标签: ChatGPT

AI基准测试存在信任问题,Google想解决

AI基准测试存在信任问题,Google想解决

Google DeepMind 正尝试用密码学方法解决 AI 基准测试的“泄题”问题——通过“双重盲测”协议,让外部评测机构无需交出测试题目、AI 公司也无需交出模型权重,就能完成对前沿大模型的可信评估。这项技术若能推广,将直接影响未来大模型的能力排名和安全性审查方式。

v2.1.251

v2.1.251

Anthropic 发布 Claude Code 命令行工具 v2.1.251 更新,新增模型切换钩子、前台子代理实时流式输出和花费限制显示等能力,同时修复了多个涉及文件越权、路径穿越与隐私边界的安全漏洞。对使用 Claude Code 的开发者来说,这是一次以安全加固和可观测性为核心的版本迭代。