Post-Training Language Models for Gold-Medal Performance in Coding Competitions
竞赛编程已成为检验大语言模型推理能力的关键场景,而 IOI 和 ICPC 等国际赛事代表了其中最富挑战性的设置。我们提出一种端到端的专业化流水线,结合大规模题目筛选、合成推理轨迹、监督微调(SFT) 与强化学习(RL)。利用 22,000 道精选题目,我们通过 SFT 和 RL 训练了 Nemotron-3-Nano-CC(30B-A3B),并仅用 SFT 训练了 Nemotron-3-Ultra-CC(550B-A55B)。 我们进一步引入 GenCorrect,一种反馈驱动的测试时计算策略,可迭代地生成、评估并优化多样化解答。在 IOI 2025 上,经过后训练的 Nano-CC 得分从 130 提升至 291,结合 GenCorrect 后达到 468,超过了 438.3 的金牌线;Ultra-CC 则达到 502。基于这些结果,我们开发了面向竞赛的 Ultra-CC 系统,并在 IOI 2026 上进行了前瞻性评估。在与人类选手相同的时间、网络访问和提交限制下,该系统获得 535.4 分(满分 600),超过了 361.12 的金牌线与 498.27 的人类最高分。据我们所知,这是首个在 IOI 题目集上超越最高分人类选手的 AI 系统。
论文精读
TL;DR 通过大规模策展问题后训练与反馈驱动测试时修正,Nano/Ultra-CC 在 IOI 2026 上得分 535.4,首次超越人类最高分。
问题
问题背景:竞争编程已成为评估大语言模型(LLM)高级推理能力的核心场景,IOI、ICPC 等国际赛事代表了最严格的算法设计与实现测试。
现有方法局限:早期工作如 AlphaCode 依赖大规模采样与过滤,缺乏针对性后训练;通用 LLM 在合成新颖算法、处理复杂约束和生成可编译实现上错误率较高。单纯使用 SFT 或 RL 往往无法同时覆盖问题多样性、代码正确性和竞赛限制下的效率。现有测试时计算策略多为独立生成或简单重排序,缺少基于执行反馈的迭代修正闭环,导致模型在边界条件和隐藏测试用例上失分严重。
为什么这个问题难/重要:竞赛问题要求从自然语言描述出发,进行算法推理、复杂度优化和无 bug 实现,且评测环境封闭、时限严格。人类顶尖选手依赖多年训练形成的模式识别与试错策略,而模型必须通过有限的推理时间和提交次数逼近这一能力。业界将 IOI 金牌视为 LLM 推理能力的标志性里程碑,该任务同时考验数据规模、训练范式与测试时计算策略的协同设计。
行业类比:这类似于自动驾驶中的闭环仿真测试,不仅需要生成轨迹,更需根据碰撞反馈实时修正策略,最终在真实路况下通过安全验证。
核心洞察
- 后训练专业化与测试时计算的结合,让中等规模模型在竞赛编程上逼近甚至超越大模型。该论文用 22,000 个策划问题配合合成推理轨迹进行 SFT 和 RL,并引入 GenCorrect 反馈驱动迭代优化,使 30B 参数的 Nano-CC 在 IOI 2025 上从 130 分提升到 468 分,接近 550B 参数的 Ultra-CC。这与以往只强调预训练规模或静态推理的工作不同,突出测试时动态反馈闭环对复杂算法推理的放大效应。
- 将模型打造为符合真实竞赛约束的 AI 系统,其工程化难度不亚于算法创新。论文在 IOI 2026 评估中,系统在与人类选手相同的时间、网络访问和提交限制下运行,还要处理 Ultra SFT with GLM-5.2 data、扩展最终轮选择、NVFP4 量化等适配,最终得分 535.4 超过人类最高分 498.27。这揭示了从 benchmark 分数到实际可用系统的差距,提示 AI 从业者关注评测协议与部署约束之间的鸿沟。
方法
输入
核心输入 为 22,000 道经过策展的竞赛编程问题,附带可执行验证环境与评估污染检查。问题来自 IOI、ICPC 等高水平竞赛,覆盖算法设计、复杂约束推理与实现。
关键模块
数据策展与合成推理轨迹
构建大规模问题集,并在验证环境中确保题目可解、测试用例有效。为每道题生成多样化的合成推理轨迹(synthetic reasoning traces),作为监督信号。模型训练
- Nemotron-3-Nano-CC (30B-A3B):先进行 监督微调(SFT),再使用 强化学习(RL) 进一步优化,rollout 与 reward 配置面向编程正确性。
- Nemotron-3-Ultra-CC (550B-A55B):仅使用 SFT,避免大规模 RL 的过高成本。
测试时计算策略 GenCorrect
迭代执行以下流程:生成多个候选解 → 评估正确性 → 过滤低质量解 → 相似度聚类 → 无偏排序 → 选择代表性解 → 基于反馈细化并带入下一轮。该策略显著提升最终提交质量。
输出
在 IOI 2025 上,Nano-CC 从基线 130 分提升至 291 分(SFT+RL 后),配合 GenCorrect 达到 468 分,超过金牌线 438.3 分;Ultra-CC 达到 502 分。更进一步,针对 IOI 2026 的竞赛专用 Ultra-CC 系统在相同时间、网络和提交限制下获得 535.4 / 600 分,超过该届最高人类选手的 498.27 分。
与同类方法的差异点
该工作的差异化在于将大规模问题策展、合成推理轨迹、RL 与反馈驱动的多轮测试时计算完整集成,并在严格竞赛约束下首次让 AI 系统超越最高分人类选手。
实验
实验设计
基于 22,000 道 curated competitive programming problems 构建训练数据,通过合成推理轨迹执行监督微调(SFT)与强化学习(RL)。Nemotron-3-Nano-CC (30B-A3B) 同时使用 SFT 与 RL,Nemotron-3-Ultra-CC (550B-A55B) 仅使用 SFT。评测采用 IOI 2025 与 IOI 2026 问题集,并引入 GenCorrect 作为反馈驱动的 test-time compute 策略,迭代生成、评估与细化多种解法。
关键发现
- Nano-CC 在 IOI 2025 基础得分 130,post-training 提升至 291;添加 GenCorrect 后达到 468,超过金牌线 438.3。
- Ultra-CC 在 IOI 2025 直接达到 502,未使用 GenCorrect 即超过金牌线。
- 针对 IOI 2026 的竞赛专用系统获得 535.4/600,超过金牌线 361.12 与人类最高分 498.27,首次在 IOI 问题集上超过人类最高分。
与基线对比
从 130 到 291 的 post-training 提升体现了 SFT+RL 在竞赛编程上的显著收益;Nano-CC 与 Ultra-CC 的分数差异也提示模型规模与训练数据策略对最终能力的影响。GenCorrect 通过迭代反馈进一步增加 177 分(291→468),表明 test-time compute 可以大幅修复首次生成的错误。IOI 2026 系统的高分(535.4)相比 IOI 2025 基准(502)提升 33.4 分,可能源于竞赛特定适配(如扩大候选选择、量化优化),但需注意两次评测的题目难度与判分阈值不同。
行业影响
落地场景
竞赛级代码推理与验证能力可直接嵌入开发者工具链:IDE 代码助手(如 GitHub Copilot 类)、代码评审机器人、自动化测试生成器、以及面向算法竞赛/技术面试的在线判题与培训平台。模型在有限时间内完成复杂算法设计与正确性验证,适合处理高性能交易系统、推荐系统召回/排序模块、资源调度等对算法复杂度敏感的业务代码。
商业价值
主要降本:将资深工程师从重复性算法实现与调试中解放,缩短复杂模块开发周期;对创业公司或 AI 原生团队,能快速产出原型替代外包。增收/体验提升:在线编程教育产品可提供即时反馈与个性化训练;代码托管平台可提供更强自动修复,提升用户留存。竞赛级表现证明模型可处理边际案例和长尾 bug,减少线上事故,降低维护成本。
与现有产品/工作流的接口
管线可拆分为:问题数据管理(如内部题库/业务需求)、合成推理轨迹生成、SFT/RL 训练、以及 GenCorrect 测试时计算模块。工程上可复用现有 LLM 推理框架(vLLM/TensorRT-LLM)与 CI/CD 中的代码执行沙箱。GenCorrect 可封装为插件,接入代码助手或评审机器人,对候选补丁进行迭代生成、执行测试、相似度聚类筛选。训练数据需来自内部代码库与模拟业务约束,形成持续微调闭环。
具体落地 use case
- 电商平台的高并发促销系统:在活动前自动生成并验证库存扣减、限流降级、分布式事务等关键代码,利用 GenCorrect 对并发压力测试失败用例迭代修复,减少人工重构。
- 金融科技公司的量化策略回测引擎:将策略描述转译为可执行 Python/C++ 代码,自动修补边界条件(如停牌、涨跌停)并运行测试,辅助研究员快速验证策略,缩短从想法到回测的周期。
局限
- **数据依赖与泛化性**:训练依赖 22,000 道竞赛题目,虽然做了 evaluation contamination 过滤,但 IOI/ICPC 评测集与训练集在问题风格、测试数据上仍可能存在隐性重叠,模型的泛化难以严格证明;在真实软件工程任务或非竞赛开放题目上的表现未做系统性评估。
- **计算成本极高**:Ultra-CC 550B 参数模型仅 SFT 即需大量算力,Nano-CC 30B 需 SFT+RL,且 GenCorrect 在推理时迭代生成、执行、筛选多个候选解,单题消耗的 token 与 GPU 时间远超人类选手,实际部署门槛极高,限制其广泛应用。
- **算法创新有限**:核心方法(大规模问题策展、合成推理轨迹、SFT、RL、test-time compute)均为已有技术,GenCorrect 本质是反馈驱动的候选筛选与精化,未引入新的学习范式或模型架构;相较 AlphaCode、Codeforces 系列工作,主要贡献在规模与工程系统整合,算法创新性有限。