返回行业动态
研究前沿

英伟达开源 IMO 金牌级数学推理方案:42 分制取得 30 分,不用形式化证明器,检查点与 200 题基准全部公开

英伟达研究团队公布一套纯自然语言推理的奥赛数学方案,以 Nemotron 3 Ultra 为基础后训练出两个专家检查点,在 2026 年国际数学奥林匹克中取得 42 分制下的 30 分,达到金牌线。系统全程不使用 Lean 等形式化证明器、不调用外部工具也不联网,模型自身同时承担生成与验证职责。检查点、训练数据、代码、提交解答与含 200 题的新基准同步公开。

来源:arXiv(英伟达 Nemotron IMO 技术报告)原标题:An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics查看原文
深色台面上悬浮半透明玻璃多面体与金属球体,上方是金色网状曲面与多层同心椭圆光轨,聚光灯斜射打光

图片来源:北京拓实科技原创(AI 生成配图)

发生了什么

英伟达研究团队公布了一套纯自然语言推理的数学奥赛方案:以 Nemotron 3 Ultra 为基础,经后训练得到两个专家检查点,在 2026 年国际数学奥林匹克(IMO)中取得 42 分制下的 30 分,达到金牌线。技术报告于 9 月 9 日发布在 arXiv,检查点、训练数据、训练与推理代码、实际提交的解答以及一套含 200 道新题的基准同步公开。

技术路径

  • 基础模型为 Nemotron 3 Ultra,混合专家架构,总参数 5500 亿,单次激活约 550 亿。
  • 两个专家检查点分别通过监督微调与强化学习得到;监督数据约 41.5 万条,其证明由 DeepSeek-V4-Pro 生成。
  • 推理阶段完全在自然语言内完成,不使用 Lean 等形式化证明器、不调用外部工具、不联网,模型自身同时承担生成与验证职责。
  • 每个问题产生 384 份候选证明,两个专家各判定 8 次,只有全部 16 次判定一致才被接受;被拒证明最多修订 8 轮,最终候选再经 48 次奥赛式评分排序。

算力账目与开放边界

团队公开了完整算力口径:定位最终提交证明约消耗 1464 个 GB200 GPU 小时,全流程约 4800 GPU 小时。检查点以英伟达 OpenMDW 许可发布,单个检查点下载量达 1.12 TB,模型卡建议至少 8 张 B200、合计约 1.5 TB 显存。新增的 Nemotron-IMO-Bench 含 200 道奥赛题,由资深命题人 Titu Andreescu 参与编写,用于缓解竞赛题目被训练数据污染的长期问题。

解读时需要注意的地方

报告本身披露了验证环节的偏差:基于模型的评分器给出的成绩约为 32 分,比官方评定的 30 分高 2 分,作者称这是「模型验证共有的盲区」。此外,比赛计时结束后系统仍继续搜索,八个多小时后为最难的第六题生成了一份新证明,其自建验证器并未接受该证明,但非官方的人工重新评分为 4/7 分,额外消耗 890 GPU 小时——官方成绩仍记为 30 分。

对计划复现的应用方而言,真正的门槛不在模型权重,而在测试时算力预算:要让这套流程跑出金牌级结果,需要 GB200 级集群与数千 GPU 小时的投入,这更适合作为专用推理服务的后端,而非通用对话场景。该工作的方法论价值在于证明了一件事——把通用基础模型转化为领域专家,可以用「后训练出专家检查点 + 编排式推理流水线」这一可复制的组合来完成,而不必依赖符号系统。

编辑说明

本文由北京拓实科技根据公开信息整理,核心事实与数据请以原始来源为准。

英伟达开源IMO金牌级数学推理方案Nemotron|北京拓实科技