标签: OpenAI

AI基准测试存在信任问题,Google想解决

AI基准测试存在信任问题,Google想解决

Google DeepMind 正尝试用密码学方法解决 AI 基准测试的“泄题”问题——通过“双重盲测”协议,让外部评测机构无需交出测试题目、AI 公司也无需交出模型权重,就能完成对前沿大模型的可信评估。这项技术若能推广,将直接影响未来大模型的能力排名和安全性审查方式。