英文原标题:One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO
本文为英文原文的机器翻译摘要,原文见:Hugging Face Blog ↗
- NVIDIA 团队基于 Nemotron 3 基础模型,通过监督微调(SFT)、强化学习(RL)和反馈驱动的推理流程,构建出在 IOI 2026 和 IMO 2026 达到金牌水平的专用系统。
- IOI 2026 中,Nemotron-3-Ultra-CC 结合 SFT 和 GenCorrect 策略,在实时、无监督的基准测试中得分 535.4/600,超过 361.12 的金牌阈值和人类最高分 498.27。
- IMO 2026 中,系统使用 Nemotron 3 Ultra 的通用、SFT 和 RL 检查点,通过生成-验证-精炼流程,得分 30/42,超过官方金牌阈值 29,且证明由官方评分员评定。
- 可复用的专业化配方包括:选择强基础模型、整理领域问题和高质量推理轨迹、应用 SFT/RL 后训练、搭配生成-评估-改进的推理循环。
- IOI 2025 实验显示,Nano 模型经 SFT 和 RL 后从 130 分提升至 291 分,结合 GenCorrect 达到 468 分,超过金牌阈值 438.3;Ultra-CC 使用相同测试时策略达到 502 分。
关键数据
- IOI 2026 得分 535.4/600,金牌阈值 361.12,人类最高分 498.27
- IMO 2026 得分 30/42,官方金牌阈值 29
- IOI 2025 中 Nano 从 130 分提升至 291 分,结合 GenCorrect 达 468 分,金牌阈值 438.3
- Ultra-CC 在 IOI 2025 测试时策略下达到 502 分
- SFT 语料包含 414,890 个示例,覆盖 15,818 个证明问题
- RL 模型在 9,597 个证明问题上训练
- Nemotron-3-Nano-CC 有 300 亿总参数和 30 亿活跃参数
- Nemotron-3-Ultra-CC 有 5500 亿总参数和 550 亿活跃参数
为什么值得看:该结果展示了通过微调和推理循环协同设计,开源基础模型可被专业化为世界级竞赛级系统,且模型、数据和配方已在 Hugging Face 开放。