Terminal-Bench-Science:评估 AI agents 在科学研究工作流中的表现

Hacker News 上出现了一个名为 Terminal-Bench-Science 的新基准测试项目,专门用于评估 AI 智能体在真实科研工作流中的表现,但目前讨论焦点却集中在 Claude 与 Codex 等模型处理数学与科学问题的能力差异上。

Hacker News 上出现了一个名为 Terminal-Bench-Science 的新基准测试项目,专门用于评估 AI 智能体在真实科研工作流中的表现,但目前讨论焦点却集中在 Claude 与 Codex 等模型处理数学与科学问题的能力差异上。

Homebrew 维护者公开抱怨开发者为刷简历而向项目提交大量无意义的 AI 生成 PR,并讨论是否该自动封禁这类账号。这场争论的实质不是“该不该用 AI”,而是“低质量自动化贡献正在污染开源协作”。

美国联邦法官裁定,特朗普政府将 AI 公司 Anthropic 列入黑名单的行为非法。这意味着政府以行政手段限制 AI 企业合作的尝试受到司法制约,也殃及了依赖其模型 API 的开发者生态。

有开发者发布了一套名为“AI Engineer Notebooks”的 Colab 笔记本资源,主打无需额外框架即可在免费环境中实现 RAG、agents 和 evals 流程,目前正在 Hacker News 上引发关于工具链和“AI 全栈工程师”概念的讨论。

Wired 记者 Will Knight 今夏走访中国 AI 实验室后发现,面对 AI Agent 自主攻击系统等日益失控的安全风险,中美研究人员正在从“零和竞争”转向寻求安全合作——这可能是两个大国在 AI 领域罕见的共识交汇点。

Anthropic 将 Claude Code 的“自动模式”设为默认安全防线后,知名提示注入研究者 Johann Rehberger 发现了一种成功率约 80% 的攻击方式,且该模式有时会反过来阻止 Claude 终止恶意进程。这说明当前 AI 编程助手的自保机制仍不可靠,沙箱隔离可能是更必要的兜底方案。

Cloudflare 把工程规范从静态文档改造成了 AI 可强制执行的管控系统,AI 代码审查工具在数月内发现近 23 万个不合规问题、驳回约 1.6 万次审批,这家公司正试图让工程治理从“人查文档”变成“机器守门”。

美国联邦法官周四裁定,五角大楼将AI公司Anthropic列为“供应链风险”并禁止其参与联邦合同的行为属于违宪报复,已撤销相关惩罚措施。这一裁决暂时平息了因军方使用Claude模型引发的法律争端,也限制了行政机构以国家安全为由打压AI供应商的边界。

Snowflake 宣布为 Cortex Agents 扩展一系列新能力,覆盖构建、运行和管理三个环节,试图解决 AI Agent 从原型走向企业级规模化部署时遇到的工具复用、长任务执行和权限治理等运营难题。

英伟达通过投资和扶持AI实验室,正在把GPU采购、模型训练和云服务打包进一个闭环生态,预计明年其收入的四分之一将来自这些由它资助的实验室。这不再只是卖芯片,而是深度介入AI产业链的上下游。