大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

腾讯混元与新南威尔士大学联合提出 E-GRM 框架,通过检测模型自身对答案的“自信程度”来决定是否进行深度思考,在奖励模型推理中实现了延迟降低 62%、算力节省近半的同时准确率反而提升 3.3%。这一成果被 ACL 2026 收录,为 RLHF 系统的成本优化打开了新路径。

腾讯混元与新南威尔士大学联合提出 E-GRM 框架,通过检测模型自身对答案的“自信程度”来决定是否进行深度思考,在奖励模型推理中实现了延迟降低 62%、算力节省近半的同时准确率反而提升 3.3%。这一成果被 ACL 2026 收录,为 RLHF 系统的成本优化打开了新路径。

蚂蚁集团副总裁周俊在AICon大会上提出,万亿参数大模型的算力成本已达到“每运行15分钟消耗一辆特斯拉”的惊人水平,行业必须从追求Token数量转向提升Token密度,即用更少Token完成同等智力任务。核心解法是协同改造模型架构、训练策略和智能体能力,而非单点优化。

Feyn Labs 于 2025 年 6 月 25 日发布 Pulpie 模型系列,以 1/20 的成本实现了与现有最佳网页内容提取器相当的精度,其最小模型在参数量仅为对手 1/3 的情况下,处理速度提升 20 倍,每处理 10 亿页的成本从 15.9 万美元降至 7,900 美元。这意味着大规模高质量网页数…

英伟达研究团队正式发布了名为 Audex 的统一音频-文本大语言模型,旨在解决当前多模态模型中音频处理与文本逻辑能力难以兼得的问题。该模型基于 MoE 架构,在音频理解、生成等任务上表现优异,同时几乎无损地保留了原始大模型的推理与文本处理能力。

蚂蚁集团副总裁周俊在 AICon 会议上指出,万亿参数大模型运行 15 分钟的算力成本已相当于一辆特斯拉,团队提出从“更多 Token”转向“更高 Token 密度”的策略,并通过混合线性注意力架构和 Kpop 算法,让十亿参数模型在 Agent 任务上超越更大模型,且推理成本降低十倍以上。

美国中西部铁锈地带的制造业工厂正因AI数据中心的电力需求激增而面临电费飙升,这直接挤压了钢铁、砖材等行业的利润空间,与特朗普政府“美国制造”的复兴目标形成冲突。电力成本占钢铁生产的20%至40%,部分企业电费已上涨70%。

美国能源部(DOE)在清理核废料场时,因过早否决了成本更低的技术方案,可能导致纳税人多支付数十亿美元。这一事件对依赖大规模算力的AI行业是一个重要警示:政府项目的决策效率与成本控制直接影响清洁能源和工业用地释放,进而影响数据中心与算力基础设施的建设速度。

AI公司Anthropic与数据中心运营商TeraWulf签订了一份为期20年、总容量约401兆瓦的电力租赁合同,预计将为TeraWulf带来约190亿美元收入。同时,TeraWulf以5.3亿美元出售其在得克萨斯州合资项目的控股权,回笼资金用于自持AI基础设施的扩张。

自2026年7月初以来,以半导体和存储芯片为代表的AI热门股遭遇显著资金流出,但资金并未离场,而是转向Meta、微软、MercadoLibre、DLocal和Robinhood等基本面扎实却年内大幅回调的高质量股票。这些公司近期均交出超预期的盈利增长,目前估值较低,且部分出现内部买入等技术性底部信号。

投资银行B. Riley Securities维持对AI数据中心开发商TeraWulf的“买入”评级,目标价32美元,基于该公司近期完成的两项重大交易:与AI公司Anthropic签署价值190亿美元的20年算力租赁协议,以及出售其在得克萨斯州Abernathy合资企业的控股权。这标志着TeraWulf从比特…