先看证据
同一模型家族,不是同一个竞赛模型
NVIDIA在Hugging Face发布的Nemotron竞赛结果,讨论的是从Nemotron 3出发,为国际信息学奥林匹克(IOI)和国际数学奥林匹克(IMO)分别构建专用系统。IOI要求模型设计算法、提交代码并通过隐藏测试,IMO则要求它用自然语言给出严谨证明。两种任务面对的失败方式不同,一个程序可能思路正确却超时,另一个证明可能结论正确却缺少关键论证。
因此,“一个模型家族拿到两项金牌级成绩”并不等于一个通用检查点在两项比赛里直接通吃。IOI使用了Nano-CC和Ultra-CC等编程专用模型,IMO则从Nemotron 3 Ultra训练了数学证明专用检查点,并在最终流程中组合通用模型与两个专用版本。能迁移的是基础模型及其适配思路,不是某个未经区分的单一模型能力。
IOI分数显示训练和推理各自有作用
IOI 2025的实验给出了一个有用的过程切片。Nano-CC在后训练前得130分,经过监督微调(SFT)后升至280分,再经过强化学习(RL)后为291分。这个变化说明SFT贡献了主要跃升,RL在此基础上带来较小但仍为正的增益,而不是每一步都同样重要。
随后加入GenCorrect,分数升至468,超过该届438.3分的金牌线。GenCorrect不是另一轮训练,而是在推理时反复生成候选代码、评估并修订方案。Ultra-CC配合同一策略得502分。由此能得出的稳妥判断是,专门训练与测试时的生成、筛选和修正共同影响结果,不能把分数变化简化成“RL带来了金牌”或“模型规模决定一切”。
模型规模改变了适配配方
编程训练使用了整理过的22,000道题和合成推理轨迹,但两个模型的训练方式并不相同。Nano-CC有300亿总参数、30亿激活参数,接受SFT和RL。Ultra-CC有5500亿总参数、550亿激活参数,只进行SFT。材料还称,更强的Ultra模型经过一个SFT训练周期后,在IOI、ICPC和LiveCodeBench Pro上的表现就超过了完成全部后训练的Nano模型。
这组对照不支持“越大就不需要训练”,也不能证明RL没有价值。它更具体地提示,基础模型的能力水平会影响后训练的边际收益:Nano从SFT中获得最大提升,RL再补上一段;Ultra则在SFT后已经达到更强表现。对工程团队来说,训练配方不应被当成固定流水线,应该通过任务验证来判断是否需要继续做RL,以及推理时搜索能否比追加训练带来更有效的增益。
IMO把检查和修订纳入证明流程
数学证明专训覆盖的不只是最终答案。SFT语料包含414,890条经过质量筛选的样例,涉及15,818道不同证明题,训练内容包括生成证明、改进证明、验证论证和检查验证过程。RL则选取了9,597道接近模型能力边界的证明题。这样的数据设计把“发现论证缺口并判断证明是否完整”也作为模型需要学习的能力。
最终系统没有只让某个检查点一次写完证明,而是让通用模型、SFT检查点和RL检查点生成候选,给候选打分、提出批评,再修订较有希望的尝试,最后用高计算量阶段选择提交答案。NVIDIA报告得分为30/42,六题中四题满分,材料所列金牌线为29分,提交证明由官方IMO阅卷人员评分。这里的关键不是证明流程必然成功,而是把候选生成、质量判断和修订拆成相互反馈的环节。
成绩的评测身份和复现成本都要说清
两项结果的证据口径并不相同。IMO提交的证明由官方阅卷人员评分,因而30分与材料所列29分金牌线可以直接比较。IOI 2026的535.4/600则来自按竞赛时间、联网和提交限制进行的前瞻性测试,超过材料列出的361.12分金牌线,也高于498.27分的最高人类选手得分,但NVIDIA明确说明这是一项非官方、非监督式基准,不计入IOI正式排名。把两者都称为金牌线水平可以,把它们说成同等的官方奖牌认证则不行。
对技术负责人而言,可复用的是“领域数据—专用后训练—反馈式推理”的系统拆分,而不是某个分数承诺。NVIDIA称训练和推理运行都相当庞大,但给定材料没有提供足以估算计算预算的具体数字。公开材料提到IMO项目发布了训练数据、专用检查点、推理代码,以及包含200道新奥赛级题目的Nemotron-IMO-Bench,这些资产提供了检查和尝试复现的入口,却不能替代独立验证。实际决策应先明确目标任务的评分标准和预算,再逐项测量数据、训练与推理循环带来的收益。