Nemotron 微调系统在 IMO 2026 与 IOI 2026 双双达到金牌水平并开源配方
One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
NVIDIA 团队基于 Nemotron 3,通过 SFT、RL 与生成-验证-改进的推理系统,在 IMO 2026 得 30/42 分(金牌线 29),在 IOI 2026 的非官方测试中 Nemotron-3-Ultra-CC 得 535.4/600(金牌线 361.12)。
原文给出从基座到金牌的完整微调与推理配方,并附带开源权重、数据与流水线,读者可以复现这套领域专精方法。
国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考验的是不同的能力。IOI 要求算法和代码在严格的时间和提交次数限制下通过隐藏测试。IMO 则要求严谨的自然语言证明。在任一竞赛中取得成功都很困难,而在两项竞赛中双双成功则指向更广泛的能力。
我们最近的结果表明,Nemotron 是构建世界级专家模型的强大而灵活的基础。从 Nemotron 3 开始,我们的团队使用监督微调(SFT)、强化学习(RL)和基于反馈的推理,打造了在 IMO 2026 和 IOI 2026 上均达到金牌水平的系统。
| 竞赛 | Nemotron 专项化 | 结果 |
|---|---|---|
| IOI 2026 | Nemotron-3-Ultra-CC,采用 SFT 和 GenCorrect | 535.4/600,高于 361.12 的金牌线和人类最高分 498.27 |
| IMO 2026 | Nemotron 3 Ultra 的通用、SFT 和 RL 检查点,置于生成-验证-改进系统中 | 30/42,高于官方金牌线 29 |
IOI 的成绩来自一次实时、前瞻性的运行,与人类选手受同样的时间、网络访问和提交次数限制。这是一次非官方、非监督的基准测试,未计入 IOI 官方排名。IMO 系统提交的证明则由 IMO 官方评分员评阅。
一套可复用的专项化方案
“易于微调”的含义不应止于让一个检查点可以被训练。它应该意味着一个强大的基础模型能够通过清晰、可复用的方案适配到要求严苛的领域。
纵观这两个项目,该方案包含四个部分:
- 从一个强大的 Nemotron 基础模型开始。
- 精心整理领域特定的问题和高质量的推理轨迹。
- 应用标准的后训练方法,如 SFT,并在有用时使用 RL。
- 将专家模型与一个生成、评估并改进候选答案的推理循环相结合。
训练和推理的运行规模可观,但底层方法是人们熟悉的、可复现的。我们不需要为每个挑战都构建一个新的基础模型。我们只是将 Nemotron 专项化以适配任务。
从通用编程能力到 IOI 金牌
对于竞赛编程,我们精心整理了 22,000 道题目并生成合成推理轨迹,用于训练两个专家模型。Nemotron-3-Nano-CC 拥有 300 亿总参数和 30 亿激活参数,接受了 SFT 和 RL。Nemotron-3-Ultra-CC 拥有 5500 亿总参数和 550 亿激活参数,接受了 SFT。
在 IOI 2025 上的进展使专项化的价值一目了然。Nano 在后训练前为 130 分,SFT 后为 280 分,RL 后为 291 分。借助 GenCorrect——我们的迭代式生成-评估-改进策略——它达到了 468 分,跨过了 438.3 的金牌线。Ultra-CC 使用同样的测试时策略达到了 502 分。
这些实验还表明,适配方式不必在每个规模上都相同。SFT 带来了 Nano 的大部分提升,RL 则附加了较小但稳定的改进。对于更强的 Ultra 模型,一个 SFT epoch 就足以在 IOI、ICPC 和 LiveCodeBench Pro 上超越经过完整后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,该系统在 600 分中取得了 535.4 分。
教会 Nemotron 证明、检查与修订
IMO 项目将同样的思路应用到了奥数领域。从 Nemotron 3 Ultra 出发,我们用 SFT 训练了一个专家模型,又用 RL 训练了另一个。
SFT 语料库包含 414,890 条经过质量筛选的样本,覆盖 15,818 道不同的证明题。它不只是教模型最终答案。数据涵盖了证明生成、改进、验证和元验证,因此模型学会了构建论证、发现漏洞、回应批评,以及判断一个证明是否完整。RL 模型则在 9,597 道接近模型能力前沿的证明题上训练。
在开发实验中,两个后训练检查点都优于通用可用版本模型。SFT 检查点在第一轮搜索中最强,而 RL 检查点取得了单个检查点的最佳总体成绩。两者的优势互补,因此最终系统同时使用了这两个专家模型和通用模型。
对于每道 IMO 题目,各模型生成候选证明、为其打分、产出批评意见,并改进最有希望的结果。一个单独的高算力阶段选出最终提交答案。整个系统以自然语言运行,不使用形式化证明器、外部工具或互联网。它取得了 42 分中的 30 分,包括六道题中的四道获得满分,并超过了官方金牌线。
微调与测试时算力协同发力
我们早前的 IOI 2025 Hugging Face 文章展示了测试时算力如何将开放权重模型推向金牌水平的表现。新结果补充了重要一环:更好的专业化让推理系统获得更好的候选答案、更好的评判者和更好的改进。
在 IOI 上,GenCorrect 将微调带来的增益转化为多轮反馈下更大的改进。在 IMO 上,使用互补的 SFT 和 RL 检查点比单纯从一个检查点抽取更多样本更有价值。在两个案例中,最佳结果都来自把一个能力出众的专家模型与一个能够搜索、验证和改进的系统相结合。
这一区别很重要。奖牌并非仅靠微调获得,也不是仅靠暴力采样获得。它们来自对模型、数据和推理回路的协同设计。
Hugging Face 上的开放模型、数据与配方
我们希望这些成果在竞赛之外也能派上用场。Nemotron Labs IMO 2026 合集汇集了 SFT 和 RL 检查点、两个训练数据集,以及包含 200 道奥赛级别题目的新基准 Nemotron-IMO-Bench。IMO 论文介绍了训练方法和生成-验证-改进系统,而 NeMo-Skills 仓库包含 IMO 推理管线、提示词、提交的证明以及可复现的快速入门。对于竞技编程,Nemotron-3-Ultra-CC 模型已在 Hugging Face 上提供,IOI 论文提供了训练配方和 GenCorrect 方法论。IOI 的评测和推理管线也可在 NeMo-Skills 中获取。
IMO 和 IOI 共同为一个简单的理念提供了异常严苛的验证:Nemotron 可以通过微调成为世界级的领域专家,再与透明的推理工作流相结合,解决处于人类竞赛前沿的问题。
我们很期待看到 Hugging Face 社区接下来会构建什么。
来源:Hugging Face Blog · huggingface.co


