ScarfBench:企业 Java 框架迁移的 AI 代理基准测试

IBM 研究院发布了 ScarfBench,一个专门评测 AI 代理在企业 Java 框架间迁移能力的新基准。测试表明,当前最先进的编码代理在保证迁移后应用行为正确方面成功率不足 10%,远低于传统代码修复基准的表现。

IBM 研究院发布了 ScarfBench,一个专门评测 AI 代理在企业 Java 框架间迁移能力的新基准。测试表明,当前最先进的编码代理在保证迁移后应用行为正确方面成功率不足 10%,远低于传统代码修复基准的表现。

英国央行副行长Sarah Breeden公开警告,能够自主执行交易任务的AI智能体(AI Agent)可能因“羊群效应”放大市场波动,甚至引发崩盘,并形容AI模型“像会说谎的青少年”,需要人类严格监管。

字节跳动CEO梁汝红在2026年6月23日的火山引擎大会明确将AI视为“最重要的事”,随后彭博社报道字节正洽谈约200亿美元离岸贷款用于AI基础设施。更关键的是,字节已悄然调整战略重心——从C端AI应用转向B端企业级AI服务,试图用“场景+工具链”走出烧钱困局。

OpenAI 首席经济学家 Ronnie Chatterji 在欧洲央行活动上公开表示,人工智能不会使人类劳动者变得多余。他强调,仅因为任务中引入了 AI,并不代表它能替代人类,需要更深入地思考工作本身将如何演变。

Anthropic 在其 Claude Code 产品的 JavaScript 客户端代码中,嵌入了一段域名字典,用于通过隐写术(Steganography)标记来自特定代理/转售服务商的 API 请求。这一做法旨在检测和阻止第三方未经授权转售 Claude 模型推理能力的行为,但也暴露了 AI 公司在模型安…

亚马逊云服务(AWS)宣布成立一个全新的内部组织,专门部署“前向部署工程师”(FDE),以帮助客户在其环境中构建和运行定制化的 AI 代理系统。该项目承诺投入 10 亿美元的内部资源,紧随 OpenAI 和 Anthropic 同类举措之后,标志着 AI 落地服务正在从单纯的模型供给向深度集成与工程服务转型。

旧金山AI爆发带动房价和租金飙升,即便年薪18万美元的招聘人员和18.5万美元的软件工程师,也找不到月租低于5,000美元的公寓。OpenAI和Anthropic的万亿级IPO预期,可能进一步固化少数人的财富,挤压普通技术工人的生存空间。

Anthropic 于 2026 年 6 月 30 日宣布 Claude Desktop 正式推出 Linux(Ubuntu 和 Debian)公测版,将原本仅限浏览器和终端的使用体验延伸到桌面端,所有付费计划的用户均可通过桌面应用使用 Claude Code、Claude Cowork 及聊天功能。

OpenAI 于 2026 年 6 月 30 日发布的 Signals 数据显示,ChatGPT 的用户基数正变得愈发全球化与多样化,用户使用频次和任务广度在六个月内显著提升,非英语用户占比已超过半数。

Autoharness 是一个为 Claude Code 设计的开源插件,能从用户真实工作会话中自动学习、合并、更新和淘汰技能(skill),从而让模型在不依赖人工重编的情况下持续提升特定任务表现——在 CORE-Bench 测试中,将成绩从 42% 提升至 78%。