一句话看懂:本周三篇高关注度论文分别瞄准智能体长上下文成本、自我改进智能体的评估开销,以及一个刚露面的写作相关方向,前两者都拿出了可量化的成本下降数据,指向同一个趋势:AI 智能体的“跑得久、改得动”正在从概念走向可负担。
事件核心:发生了什么
据 DAIR.AI 整理的 9 月 21 日至 27 日论文清单,小米 MiMo 团队发布 HySparse2,这是即将推出的 MiMo-V3 所采用的注意力架构。它通过两级 KV 共享和预填充提前退出,在 80B-A3B MoE 模型上把预填充 FLOPs 相比 MiMo-V2 的混合 SWA 设计降低 5.02 倍,KV 缓存从 12.09 GB 压到 2.69 GB;轻量后训练后在 MRCR-v2 上比 HySparse 高 11.30 分,RULER-v2 高 19.81 分。
MIT 与 Sakana AI 的 SIFT 针对能改写自身代码的编码智能体,把昂贵的基准测试评估前移为更便宜的 LLM 法官打分加 Bradley-Terry 模型排序。使用 o3-mini,30 次扩展后在 Polyglot 上达到 35.1%,而 DGM 在 80 个节点后为 30.7%,CPU 耗时不到 50 小时,整体约为 DGM 基线的十分之一。第三篇 GAVEL 目前公开信息较少,素材未给出具体结论。
为什么重要
两篇论文打的是同一类痛点:智能体工作负载天然会积累长轨迹和多轮观察结果,预填充和 KV 缓存成本会随对话持续上涨。HySparse2 把这类成本压下来,直接关系到长上下文推理能否在真实产品里跑得起。SIFT 则指出自我改进循环的瓶颈往往不在生成候选补丁,而在评估,把法官前置能显著降低搜索算力门槛。这意味着“让模型自己改自己”这件事,可能从少数团队的昂贵实验变成更常规的工程手段。
对用户/开发者/创作者的影响
对开发者而言,HySparse2 若随 MiMo-V3 落地,意味着同样显存下可支撑更长的智能体上下文,API 调用中的长检索结果和工具输出不再那么烧钱。SIFT 的思路对做自动化代码迭代、Agent 评测的团队有直接参考价值:与其反复跑全量基准,不如先训练或选一个可靠的法官模型做初筛。对普通用户和创作者,短期感知不强,但成本下降通常会先体现在 Agent 类产品的响应速度和订阅价格上。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 MiMo-V3 是否正式开源或开放 API,以及 HySparse2 的实际推理表现是否与论文数据一致。二是 SIFT 中“法官质量决定结果”这一结论,是否会促使更多团队把评测模型本身当作核心资产来投入。三是 GAVEL 的具体内容与适用场景目前公开信息不足,需等待原文补充后再判断其分量。


