一句话看懂:斯坦福大学团队联合多学科专家发布 Terminal-Bench-Science 0.1,用 70 个真实科研工作流测试 AI 智能体。目前最强模型 Claude Opus 5 的解决率只有 30%,说明 AI 离真正走进科研一线仍有明显距离。
事件核心:发生了什么
Terminal-Bench-Science 是由斯坦福大学研究人员牵头、Terminal-Bench 团队与全球多学科专家合作构建的连续评测基准。它不像传统基准那样使用教科书题目,而是直接采用研究人员日常工作流作为测试任务,涵盖数据分析、统计推断、仿真、优化、定理证明、图像重建、信号处理、模型拟合等类型。
0.1 版本共包含 70 个任务,分布在生命科学(19 个)、数理科学(17 个)、数学科学(17 个)、地球科学(8 个)和工程科学(9 个)五个方向。评测结果显示,表现最好的 Claude Opus 5 配合 Claude Code 工具也只有 30% 的任务解决率;GPT-5.6 Sol 配合 Codex 为 22.4%,其余模型普遍在 10% 以下。
值得注意的是,该基准采用开放贡献机制,全球科研人员可以通过 GitHub 提交新任务,并在 Discord 上参与讨论,形成持续进化的反馈闭环。
为什么重要
现有 AI 评测大多由模型开发商自主设定题目,容易陷入“考什么就会什么”的循环。Terminal-Bench-Science 把定义权交给一线科学家,让真正使用科研工作流的人来决定 AI 能力高低的标尺。这在评测范式上是一次明确转向:从“模型能否答对题”转向“模型能否完成真实科研任务”。
从结果看,30% 的解决率暴露了一个关键事实:即便在最先进的大模型加持下,AI 智能体在科研领域的能力仍处于早期阶段。这也间接说明,具备科研能力的高水平智能体不只是算力和参数的比拼,更依赖对复杂工具链、领域知识和任务验证机制的综合理解。
该基准的“连续评测”设计也值得关注。它不是一次性论文产出,而是通过定期更新任务库,使科研需求与 AI 开发形成动态反馈,避免基准发布后被快速刷爆、失去区分度的常见问题。
对用户/开发者/创作者的影响
对科研人员和高校实验室来说,这个基准提供了一个可量化的工具来评估 AI 辅助科研的真实边界,可用于判断哪些环节可以交给智能体执行、哪些还需要人工介入。科学家也可以通过贡献任务直接参与标准制定,而不是被动接受厂商评测结论。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对 AI 开发者和 API 调用方来说,该基准发布意味着继软件工程之后,科研自动化正在成为智能体竞争的下一个考核方向。未来在 Agent 开发、工具调用和推理能力优化的产品宣传中,Terminal-Bench-Science 分数可能会成为类似 SWE-Bench 的重要参考指标。
对模型服务商而言,若想进入科研自动化市场,仅靠提升基础模型能力远远不够,需要同时完善代码执行、数据分析和专业工具集成等配套能力。目前公开信息显示,Claude 系模型在该评测中整体领先,但优势并不稳固。
值得关注的后续
第一,后续版本会否扩充任务数量并增加更多学科方向,例如社会科学或临床医学,这将决定基准的代表性和广度。
第二,各模型厂商是否会针对该基准进行针对性优化,以及优化后分数提升多少,能反映模型真实科研能力的增量在何处。
第三,该基准能否像 SWE-Bench 那样成为行业默认评测标准,被第三方机构和大模型厂商广泛引用,是判断其影响力的关键观察点。


