
一句话看懂:蚂蚁集团副总裁周俊在 AICon 会议上指出,万亿参数大模型运行 15 分钟的算力成本已相当于一辆特斯拉,团队提出从“更多 Token”转向“更高 Token 密度”的策略,并通过混合线性注意力架构和 Kpop 算法,让十亿参数模型在 Agent 任务上超越更大模型,且推理成本降低十倍以上。
事件核心:发生了什么
7 月 8 日,在 AICon 大会上,蚂蚁集团副总裁周俊发表演讲,核心观点是:大模型效率已成为 AI 代理时代必须解决的关键问题。周俊和团队提出“从追求 Token 数量转向提升 Token 密度”的技术路线。他们采用名为“7 部分 Lightning Attention 加 1 部分 MLA”的混合线性注意力架构,将处理 256K 长上下文的计算成本从指数级降到线性级。同时引入 Kpop 算法,专门区分工具调用与自然语言 Token,配合思维链剪枝和自蒸馏技术,在保持模型能力的前提下,将 Token 输出量压缩约四倍。蚂蚁的十亿参数模型在 LongBench、BFCL 等多个基准测试的 Agent 任务上已超过部分更大模型,小模型的闪存吞吐量达到 2.4 倍,五轮对话的算力成本下降超过十倍。
为什么重要
周俊的发言直接回应了当前大模型行业最紧迫的瓶颈:算力成本。万亿参数模型单次 15 分钟推理成本高达一辆特斯拉,意味着即使拥有强大算力,规模化部署仍不现实。蚂蚁的技术方向——不靠堆参数,而靠提高每个 Token 的信息“密度”——提供了另一条路径:用更小的模型、更少的计算资源完成同等甚至更好的推理任务。若这一路线被验证可复制,将挑战“更大模型等于更强智能”的主流叙事,推动行业从“参数军备竞赛”转向“效率竞赛”。对依赖大模型 API 的企业而言,这意味着未来可能获得更便宜、更可控的模型服务。
对用户/开发者/创作者的影响
对于使用大模型 API 的开发者,蚂蚁的成果意味着:相同的任务可能用更便宜的模型完成,尤其长上下文场景(如文档分析、多轮对话)的成本有望大幅下降。对于构建 AI Agent 的团队,Kpop 算法和剪枝技术提示了一条平衡工具调用与自然语言生成的优化路径,可能降低 Agent 系统的 token 消耗。对于创作者和企业客户,若该技术落地,未来的 AI 应用在复杂推理和工具使用上的表现可能不弱于更大模型,但响应更快、调用成本更低。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,蚂蚁是否计划开源其 Lightning Attention 混合架构或 Kpop 算法,这将决定该技术能否被行业快速采纳。第二,此方案在更大规模(如千亿参数)模型上的表现尚未公开,缩放能力仍需验证。第三,其他大模型公司会否跟进类似“密度优先”路线,例如 Google、Meta 是否会在下一代模型设计中引入类似注意力机制优化。第四,该技术对现有推理芯片(如英伟达 GPU)的适配情况——若能在消费级硬件上运行,将极大拓宽 AI Agent 的应用场景。
来源:AIbase


