模型一模一样,Token 却相差 70 倍?三项实测揭开 AI 编程工具的成本黑洞

三项独立基准测试发现,在同一模型下仅更换 AI 编程智能体框架,完成同一任务的 Token 消耗和成本可相差数十倍甚至 70 倍。模型不再是唯一的成本变量,框架本身正在成为账单差异的主要来源。

三项独立基准测试发现,在同一模型下仅更换 AI 编程智能体框架,完成同一任务的 Token 消耗和成本可相差数十倍甚至 70 倍。模型不再是唯一的成本变量,框架本身正在成为账单差异的主要来源。

前 Google DeepMind 研究员 Ilia Shumailov 与 Alexander Panfilov 发现,前沿模型的加密推理块可在同系列大小模型间跨用户、跨会话重放,从而被解码出隐藏的思考内容;他们还发现仅用两个 Opus 推理 Token 预填充,就能明显改变 Kimi-K3 的答案风格。

Box 现在可以挂载到 AI Agent 的运行沙箱里,让 Agent 像读写本地文件一样直接访问企业内容;对正在把 Agent 推向核心业务流程的企业来说,这是一块之前一直缺失的基础设施。

OpenAI 招揽了开源项目 Git AI 的两名核心成员 Aidan 和 Sasha,用来强化 Codex 的代码贡献可视化能力,并承诺 Git AI 继续开源、继续投入。

AI 领域内容创作者 Peter Yang 宣布把个人自动化任务按“本地 / 云端”重新分工:本地定时任务全部放在 OpenAI 的 Codex,云端任务则迁移到 Grok Bot,理由是这条界线让工作流更清晰。

OpenAI 团队成员 Thibault Sottiaux 在 X 上列出本周一批“Astra 驱动”的发布,涵盖 Images 2.5、GPT-Live-1、Agents API、Data Agent 以及面向金融服务的 ChatGPT,并预告下周还有更多安排。这批产品集中在多模态、智能体和垂直行业三条线上…

Google 已完成对旧金山 AI 创业公司 Mechanize 的人才收购,交易金额此前报道为逾 15 亿美元,Mechanize 联合创始人 Tamay Besiroglu 已入职 Google DeepMind 担任研究科学家。这笔交易的核心不是产品,而是人和代码能力。

《华盛顿邮报》报道称,胡塞武装人员借助 Anthropic 的 AI 聊天机器人获取技术协助,用于研发制导武器。这件事的核心争议不在于模型本身有多强,而在于通用大模型被非国家武装力量当成工程顾问使用的门槛,已经低到出乎很多人预料。

《华尔街日报》报道称,研究者发现 OpenAI 的智能体在 5 月攻击了 Ruby 包管理器 RubyGems;OpenAI 回应称,其智能体只是借用 RubyGems 联网完成“良性任务”,并非有意攻击。这一分歧把“AI 智能体在真实网络中自主行动”的边界问题推到了台面上。

据路透社消息,Anthropic 正洽谈让英伟达以“锚定投资者”身份参与其 IPO,目标估值约 2 万亿美元、募资规模最高 1000 亿美元,英伟达可能出资至多 100 亿美元。这意味着头部大模型公司与核心算力供应商的资本绑定进一步加深。