跳到正文
Hugging Face Blog·· 3 小时前精选AI 评分67

Nemotron 微调后在 IOI 2026 与 IMO 2026 均达金牌水平

One Model Family, Two Gold-Level Results: Fine-Tuning Nemotron for IOI and IMO

AI 导读

英伟达团队从 Nemotron 3 出发,用监督微调、强化学习和生成-验证-改进推理流程,让模型在 IOI 2026 与 IMO 2026 双双达到金牌水平。IOI 2026 中 Nemotron-3-Ultra-CC 得 535.4/600,高于 361.12 的金牌线;IMO 2026 系统得 30/42,高于 29 的官方金牌线,六题中四题满分。

推荐理由

原文给出了从 Nemotron 3 微调到 IOI、IMO 金牌级成绩的完整配方,读者可据此复用其数据与推理流程。

正文 · AI 翻译

国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)考查的是不同的能力。IOI 要求算法和代码在严格的时间和提交限制下通过隐藏测试。IMO 则要求严谨的自然语言证明。在这两项竞赛中取得好成绩都很困难。而在两者中都取得成功,则指向更广泛的能力。

我们近期的结果表明,Nemotron 是构建世界级专家模型的强大且适应性强的基座。从 Nemotron 3 开始,我们的团队使用监督微调(SFT)、强化学习(RL)和反馈驱动的推理,构建出在 IMO 2026 和 IOI 2026 上均达到金牌水平的系统。

fig_ioi_imo_gold_results_headline

竞赛 Nemotron 专业化 结果
IOI 2026 采用 SFT 和 GenCorrect 的 Nemotron-3-Ultra-CC 535.4/600,高于 361.12 的金牌门槛以及人类最高分 498.27
IMO 2026 在生成-验证-改进系统中使用 Nemotron 3 Ultra 的通用、SFT 和 RL 检查点 30/42,高于 29 的官方金牌门槛

IOI 的成绩来自一次实时、前瞻性的运行,其时间、互联网访问和提交限制与人类参赛者相同。这是一项非官方、无监督的基准测试,未被纳入官方 IOI 排名。IMO 系统提交的证明由官方 IMO 评分员评分。

可复用的专业化配方

“易于微调”不应仅仅意味着让检查点可训练。它应该意味着一个有能力的基础模型可以通过清晰、可复用的配方适配到要求严苛的领域。

在这两个项目中,该配方包含四个部分:

  1. 从强大的 Nemotron 基础模型开始。
  2. 整理领域特定问题和高品质推理轨迹。
  3. 应用标准的后训练方法,如 SFT,并在有用时应用 RL。
  4. 将专家模型与一个生成、评估并改进候选答案的推理循环配对。

训练和推理运行规模可观,但底层方法熟悉且可复现。我们不需要为每个挑战都构建新的基础模型。我们为任务对 Nemotron 进行了专业化。

从通用编程能力到 IOI 金牌

对于竞技编程,我们整理了 22,000 道题目并生成合成推理轨迹,以训练两个专家模型。Nemotron-3-Nano-CC 总参数量 300 亿、激活参数量 30 亿,同时接受了 SFT 和 RL。Nemotron-3-Ultra-CC 总参数量 5500 亿、激活参数量 550 亿,接受了 SFT。

IOI 2025 上的进展让专业化的价值一目了然。Nano 从后训练前的 130 分提升到 SFT 后的 280 分,再到 RL 后的 291 分。借助 GenCorrect——我们的迭代式生成-评估-改进策略——它达到 468 分,越过了 438.3 的金牌门槛。Ultra-CC 在相同的测试时策略下达到 502 分。

fig_main_capability_progression_previous_style

这些实验还表明,适配在每个规模上不必看起来都一样。SFT 贡献了 Nano 的大部分提升,RL 则带来了较小但持续的改进。对于更强的 Ultra 模型,一个 SFT 轮次就足以在 IOI、ICPC 和 LiveCodeBench Pro 上超越完全后训练的 Nano 模型。这一发现指导了用于 IOI 2026 的竞赛专用 Ultra-CC 系统,该系统得分 535.4(满分 600)。

教会 Nemotron 证明、检查与修订

IMO 项目将同样的思路应用于奥林匹克数学。从 Nemotron 3 Ultra 出发,我们分别用 SFT 训练了一个专家模型,用 RL 训练了另一个。

SFT 语料库包含 414,890 个经过质量过滤的样本,覆盖 15,818 道独特的证明题。它不仅仅是教授最终答案。数据涵盖了证明生成、改进、验证和元验证,因此模型学会了构建论证、识别漏洞、回应批评,并判断证明是否完整。RL 模型则在 9,597 道接近模型能力前沿的证明题上进行了训练。

在开发实验中,两个后训练检查点都优于通用可用模型。SFT 检查点在第一轮搜索中表现最强,而 RL 检查点取得了最佳的单检查点整体结果。它们的优势互补,因此最终系统将两个专家模型与通用模型一起使用。

对于每道 IMO 题目,模型生成候选证明、对其评分、给出批评意见,并改进最有希望的尝试。一个单独的高算力阶段选出最终提交答案。整个系统以自然语言运行,没有形式化证明器、外部工具或互联网访问。它获得了 42 分中的 30 分,其中六道题中有四道获得满分,并超过了官方金牌分数线。

image

微调与测试时计算协同工作

我们之前的 IOI 2025 Hugging Face 博文 展示了测试时计算如何将开放权重模型推向金牌级表现。新结果补充了重要的一环:更好的专业化让推理系统拥有更好的候选答案、更好的批评者和更好的改进。

在 IOI 中,GenCorrect 将微调带来的增益转化为多轮反馈中的更大提升。在 IMO 中,使用互补的 SFT 和 RL 检查点比简单地从单个检查点抽取更多样本更有价值。在两种情况下,最佳结果都来自将一个有能力的专家模型与一个能够搜索、验证和改进的系统相结合。

这一区别很重要。这些奖牌不是仅靠微调产生的,也不是仅靠暴力采样产生的。它们来自模型、数据和推理循环的协同设计。

在 Hugging Face 上开放模型、数据和配方

我们希望这些结果在竞赛之外也有用。Nemotron Labs IMO 2026 合集 汇集了 SFT 和 RL 检查点、两个训练数据集,以及 Nemotron-IMO-Bench——一个包含 200 道奥林匹克级别题目的新基准。IMO 论文 描述了训练方法和生成-验证-改进系统,而 NeMo-Skills 仓库 包含 IMO 推理流水线、提示词、提交的证明以及可复现的快速入门。对于竞技编程,Nemotron-3-Ultra-CC 模型 已在 Hugging Face 上提供,IOI 论文 提供了训练配方和 GenCorrect 方法论。IOI 评估和推理流水线也可在 NeMo-Skills 中获取。

IMO 和 IOI 共同为一个简单的理念提供了异常严苛的证据:Nemotron 可以被微调成世界级的领域专家,然后与透明的推理工作流组合,解决人类竞赛前沿的问题。

我们很期待看到 Hugging Face 社区接下来会构建什么。

来源:Hugging Face Blog · huggingface.co