英伟达 Nemotron 微调后在 IOI 2026 与 IMO 2026 达到金牌线

英伟达基于 Nemotron 3 系列,通过监督微调、强化学习和生成-验证-修正推理流程,在 IOI 2026 和 IMO 2026 的非官方基准中达到金牌水平,展示了一条可复用的领域专家模型打造路径。

一句话看懂:英伟达基于 Nemotron 3 系列,通过监督微调、强化学习和生成-验证-修正推理流程,在 IOI 2026 和 IMO 2026 的非官方基准中达到金牌水平,展示了一条可复用的领域专家模型打造路径。

事件核心:发生了什么

根据 Hugging Face Blog 2026 年 10 月 7 日发布的文章,英伟达团队从 Nemotron 3 出发,用监督微调、强化学习以及反馈驱动的推理循环,分别针对信息学奥赛和数学奥赛做了专门化训练。

IOI 方向,Nemotron-3-Ultra-CC 结合 SFT 与 GenCorrect 迭代生成-评估-修正策略,在 600 分制下取得 535.4 分,高于 361.12 的金牌门槛,也超过人类最高分 498.27。该结果是在与人类选手相同时间、联网和提交限制下进行的非官方、无监督基准测试,未计入 IOI 官方排名。

IMO 方向,系统由 Nemotron 3 Ultra 通用模型、SFT 检查点和 RL 检查点组成,采用生成-验证-修正流程,全程自然语言、不依赖形式化证明器或外部工具。最终提交的证明由官方 IMO 评分员批改,得分 30/42,超过 29 分的金牌线,六题中四题满分。

为什么重要

这说明基础模型经过领域定向微调,可以覆盖推理要求差异很大的任务:IOI 强调算法与代码在隐藏测试下的正确性,IMO 强调严谨的自然语言证明。英伟达将其总结为四步配方——强基座、领域数据与推理轨迹、SFT/RL 后训练、推理循环。对行业而言,这降低了对“每个挑战重造基础模型”的依赖,也强化了开源与可微调基座在专业场景中的价值。

对用户/开发者/创作者的影响

开发者可关注这条路径的可复现性:IOI 实验中 Nano 从后训练前 130 分提升到 SFT 后 280 分、RL 后 291 分,加 GenCorrect 后达 468 分;Ultra 仅一个 SFT epoch 就在 IOI、ICPC 和 LiveCodeBench Pro 上超过完全后训练的 Nano。这提示模型规模与后训练策略需要匹配,SFT 与 RL 的收益在不同量级上并不相同。对教育、竞赛辅导和代码生成类应用,这种“专家模型 + 推理循环”的组合有直接参考意义,但需注意当前结果针对特定基准和评测条件,不等于通用产品能力。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是英伟达是否公开更多训练细节、数据配方或检查点;二是该配方能否迁移到其他推理密集领域,如物理、化学或企业代码库;三是这类微调专家模型与闭源前沿模型在真实产品环境中的成本、延迟和可靠性对比。目前公开信息显示,这些结果是竞赛导向的评测,尚未表明已转化为可购买的产品或 API。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 27794

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注