蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

蚂蚁集团副总裁周俊在AICon大会上提出,万亿参数大模型的算力成本已达到“每运行15分钟消耗一辆特斯拉”的惊人水平,行业必须从追求Token数量转向提升Token密度,即用更少Token完成同等智力任务。核心解法是协同改造模型架构、训练策略和智能体能力,而非单点优化。

蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

一句话看懂:蚂蚁集团副总裁周俊在AICon大会上提出,万亿参数大模型的算力成本已达到“每运行15分钟消耗一辆特斯拉”的惊人水平,行业必须从追求Token数量转向提升Token密度,即用更少Token完成同等智力任务。核心解法是协同改造模型架构、训练策略和智能体能力,而非单点优化。

事件核心:发生了什么

在AICon全球人工智能开发与应用大会(上海站)上,蚂蚁集团副总裁周俊分享了蚂蚁百灵在万亿参数模型效率上的实践路径。核心观点是:当前大模型面临一个“不可能三角”——低成本小模型能力有限、强模型因算力成本不愿放弃GQA机制(其复杂度随上下文平方级增长)、直接将对话模型改造成智能体几乎不可行。蚂蚁的解法是一套协同设计:架构上采用7份Lightning Attention加1份MLA的混合线性注意力机制,将256K长上下文下的算力成本从指数级降为线性级;训练上从预训练第一天就引入高难度真实数据(含2400多个真实工具与197个MCP服务器),并在强化学习阶段使用Kpop算法区分工具调用与自然语言Token;最终Token输出减少约4倍,能力强于部分更大参数模型,千亿模型在真实Agent任务表现超过万亿级别对手。

为什么重要

长期以来,大模型行业的竞赛聚焦于“参数量”和“上下文长度”的暴力堆叠,而周俊的演讲揭示了两个深层问题:一是GQA等注意力机制存在严重的算力浪费——当上下文从32K翻8倍至256K时,注意力计算的FLOPs占比从60%飙升至85%,模型用于“思考”的算力反而被“阅读”消耗殆尽;二是聊天模型直接改造智能体存在理论缺陷——对话场景的错误可纠偏,但工具调用的错误不可逆。蚂蚁的实践表明,效率本身即是能力:通过架构与训练协同,将算力红利释放到推理和规划上,而不是堆在注意力计算中。这使长期受成本制约的复杂场景(如多轮智能体交互、长周期任务)变得商业化可用。

对用户/开发者/创作者的影响

对于开发者而言,蚂蚁推出了instant系列小模型,在工具调用和Agent任务上达到SOTA,五轮对话成本可下降10倍以上、吞吐达2.4倍。这意味着,中小团队可以直接调用低推理成本的小模型来构建复杂的多智能体系统,而无需承担万亿参数级别的算力开销。对于使用API的创作者或企业用户,如果蚂蚁开放相关接口(目前公开信息显示已发布蚂蚁百灵系列模型),长上下文任务(如对话历史+实时数据+工具调用的复杂场景)的账单将明显降低。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,蚂蚁介绍的“7:1注意力配比”和Kpop训练算法是否会被同行验证或复现,这直接关联到混合注意力机制能否成为行业新标准。第二,蚂蚁提到的IO类训练数据缺口是目前其模型在SWE等复杂任务上的短板,后续是否通过更多真实环境数据缩小差距值得注意。第三,演讲中反复强调“智能体能力必须原生训练”,这可能推动行业从“聊天模型打补丁”转向早期预设智能体能力的设计范式,竞品(如OpenAI、Google)会如何响应——是继续堆参数量,还是调整架构方向,将是2025年下半年AI工程化的关键博弈点。

来源:公众号:蚂蚁百灵(Ling)

celebrityanime
celebrityanime
文章: 15073

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注