上海AI Lab与上交大抛出NCP预训练新范式,8.9B隐空间模型用一半Token追平对手

上海AI Lab与上海交大LUMIA Lab提出"下一概念预测"(NCP)预训练任务,发布8.9B参数的离散隐空间基座模型NCP-ArchPreview,用约一半Token预算追平OLMo-3-7B的预训练Loss,收敛速度提升1.95倍。

一句话看懂:上海AI Lab与上海交大LUMIA Lab提出”下一概念预测”(NCP)预训练任务,发布8.9B参数的离散隐空间基座模型NCP-ArchPreview,用约一半Token预算追平OLMo-3-7B的预训练Loss,收敛速度提升1.95倍。

事件核心:发生了什么

这项研究由上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队完成,核心是改变大模型”逐词预测”的预训练方式,转而预测隐空间中的”概念”。发布的NCP-ArchPreview是全球首个8.9B规模的离散隐空间基座模型。据素材数据,它在5.73T Dolma-3数据上预训练,仅用51.3%的Token预算便达到OLMo-3-7B的最终预训练Loss,计算帕累托效率提升1.74倍;下游任务平均高出2.45分,GSM8K数学推理提升接近6分。技术路径上,模型先用乘积量化构建大规模离散概念表示空间,再通过可微的下一概念预测、因果防泄漏反馈机制和分层残差路由完成三阶段处理。团队同时开源了全阶段checkpoint与评测框架。

为什么重要

当前主流大模型几乎都建立在next token prediction之上,NCP的价值在于从训练目标层面提出一条不同路线。如果”用一半Token达到同等Loss”在更大规模上可复现,直接对应的就是算力与时间成本的下降,这对训练侧的效率竞争有实际意义。另一个信号来自微调与推理:团队发现仅微调17M隐空间参数即可超过LoRA且不易遗忘,概念表示注入draft model后,投机解码平均接受长度提升4.17%,代码任务达7.59%。这说明隐空间概念不只服务预训练,也可能成为微调和推理加速的通用组件。

对用户/开发者/创作者的影响

对开发者而言,最直接的机会是开源资产:全阶段checkpoint和评测框架已放出,可用来验证NCP在自有数据上的收敛表现,或尝试把概念表示接入现有微调流程,降低显存与训练开销。对推理侧工程团队,投机解码接受长度的提升意味着同等硬件下可能获得更高吞吐,值得在服务框架中做对照测试。对普通用户和创作者,目前公开信息显示这只是基座模型层面的研究进展,尚不涉及可直接使用的产品、API或AI应用,短期内不会改变现有工具的能力边界;但如果效率优势成立,未来更便宜的模型训练成本可能间接传导到推理价格上。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是NCP能否在更大参数规模上保持收益,8.9B的结果需要更大模型验证;二是隐空间概念表示与现有微调生态(如LoRA、全参微调)的兼容性和稳定性;三是开源checkpoint后的社区复现情况,以及是否有厂商将其引入推理加速栈。这三点将决定NCP是停留在论文范式,还是进入实际训练与部署流程。

来源:AIbase

celebrityanime
celebrityanime
文章: 24917

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注