一句话看懂:英伟达基于 Nemotron 3 系列,通过监督微调、强化学习和生成-验证-修正推理流程,在 IOI 2026 和 IMO 2026 的非官方基准中达到金牌水平,展示了一条可复用的领域专家模型打造路径。
事件核心:发生了什么
根据 Hugging Face Blog 2026 年 10 月 7 日发布的文章,英伟达团队从 Nemotron 3 出发,用监督微调、强化学习以及反馈驱动的推理循环,分别针对信息学奥赛和数学奥赛做了专门化训练。
IOI 方向,Nemotron-3-Ultra-CC 结合 SFT 与 GenCorrect 迭代生成-评估-修正策略,在 600 分制下取得 535.4 分,高于 361.12 的金牌门槛,也超过人类最高分 498.27。该结果是在与人类选手相同时间、联网和提交限制下进行的非官方、无监督基准测试,未计入 IOI 官方排名。
IMO 方向,系统由 Nemotron 3 Ultra 通用模型、SFT 检查点和 RL 检查点组成,采用生成-验证-修正流程,全程自然语言、不依赖形式化证明器或外部工具。最终提交的证明由官方 IMO 评分员批改,得分 30/42,超过 29 分的金牌线,六题中四题满分。
为什么重要
这说明基础模型经过领域定向微调,可以覆盖推理要求差异很大的任务:IOI 强调算法与代码在隐藏测试下的正确性,IMO 强调严谨的自然语言证明。英伟达将其总结为四步配方——强基座、领域数据与推理轨迹、SFT/RL 后训练、推理循环。对行业而言,这降低了对“每个挑战重造基础模型”的依赖,也强化了开源与可微调基座在专业场景中的价值。
对用户/开发者/创作者的影响
开发者可关注这条路径的可复现性:IOI 实验中 Nano 从后训练前 130 分提升到 SFT 后 280 分、RL 后 291 分,加 GenCorrect 后达 468 分;Ultra 仅一个 SFT epoch 就在 IOI、ICPC 和 LiveCodeBench Pro 上超过完全后训练的 Nano。这提示模型规模与后训练策略需要匹配,SFT 与 RL 的收益在不同量级上并不相同。对教育、竞赛辅导和代码生成类应用,这种“专家模型 + 推理循环”的组合有直接参考意义,但需注意当前结果针对特定基准和评测条件,不等于通用产品能力。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是英伟达是否公开更多训练细节、数据配方或检查点;二是该配方能否迁移到其他推理密集领域,如物理、化学或企业代码库;三是这类微调专家模型与闭源前沿模型在真实产品环境中的成本、延迟和可靠性对比。目前公开信息显示,这些结果是竞赛导向的评测,尚未表明已转化为可购买的产品或 API。


