知识卡片:后训练语言模型在编程竞赛中达到金牌水平
英文标题:Post-Training Language Models for Gold-Medal Performance in Coding Competitions
英文关键词(从标题/摘要中提取):Post-Training; Language Models; Coding Competitions; Gold-Medal Performance; IOI
一句话结论
作者提出了一套结合题目筛选、合成推理轨迹、监督微调(SFT)与强化学习(RL)的语言模型后训练方案,并引入反馈驱动的测试时计算策略 GenCorrect;据摘要报告,该系统在 IOI 2025 和 IOI 2026 题目/赛制中均超过金牌线,其中 IOI 2026 的竞赛专用系统在 535.4/600 的分数上超过了最高分人类选手 498.27,作者称这是他们已知的第一个在 IOI 题目集上超过人类最高分的 AI 系统。
事件概述或研究问题
- 竞赛编程已成为测试大语言模型推理能力的重要场景,国际竞赛如 IOI、ICPC 被视为最具挑战性的设置之一。
- 论文关注的问题是:如何通过后训练让语言模型在竞赛编程中达到金牌级表现。
- 摘要中报告的方法并非简单增大模型或预训练规模,而是对模型进行竞赛场景的端到端专门化。
方法/产品要点
- 大规模题目筛选:使用约 22,000 道筛选后的竞赛编程问题。
- 合成推理轨迹:使用合成的推理过程数据用于训练。
- 监督微调(SFT)与强化学习(RL):
- Nemotron-3-Nano-CC(30B-A3B):使用 SFT + RL。
- Nemotron-3-Ultra-CC(550B-A55B):仅使用 SFT。
- GenCorrect:一种反馈驱动的测试时计算策略,迭代式地生成、评估并改进多样化解决方案。
主要结果或产业意义
- IOI 2025:
- Nano-CC 得分从 130 分提升到后训练后的 291 分。
- 使用 GenCorrect 后进一步达到 468 分。
- IOI 2025 金牌线为 438.3 分。
- Ultra-CC 达到 502 分。
- IOI 2026:
- 作者开发了竞赛专用 Ultra-CC 系统并进行了前瞻性评估。
- 在与人类选手相同的时间、互联网访问和提交限制下,得分 535.4/600。
- IOI 2026 金牌线为 361.12 分。
- 最高分人类选手为 498.27 分。
- 产业意义上,若结果经过独立验证,“AI 在竞赛编程中超过人类顶级选手”将成为编程工具、算法自动化、推理模型评估等领域的重要信号。具体产品发布计划不在摘要范围内,待核实。
为什么重要
- 摘要给出了一个可量化的“AI 超过人类顶尖选手”的竞赛编程里程碑:535.4 分超过最高分人类选手 498.27 分。
- 它把“后训练”和“测试时计算”作为关键贡献,而不只是堆叠预训练规模。
- 与已有相关卡片中涉及视觉语言模型、数学泛化、语音自然度评估的内容不同,本条聚焦编程竞赛场景中的端到端后训练与反馈驱动测试时计算;其增量信息是:作者报告称该路线首次在 IOI 题目集上超越人类最高分。
局限与不确定性
- 本知识卡片仅基于 arXiv 摘要,尚未阅读全文或进行独立复核,待核实。
- “首次超过人类最高分”是作者“To our knowledge”范围内的声明,并非独立第三方确认。
- 摘要未详细说明“130 分”对应的是哪一种基座模型或评估设置,待核实。
- IOI 2025、IOI 2026 的官方成绩、金牌线、题目信息和赛制细节需要以官方来源为准,待核实。
- 模型权重、数据、代码是否公开,GenCorrect 的具体奖励反馈来源,以及训练算力成本均未在摘要中说明,待核实。
- 竞赛专用 Ultra-CC 系统与 Ultra-CC 之间的具体差异未在摘要中展开,待核实。
可用于图书/PPT/简报的角度
- 用分数曲线呈现“后训练 + 测试时计算”的价值:130 → 291 → 468(Nano-CC,IOI 2025)。
- 用“金牌线”对比代替简单的“能不能做对”,展示竞赛级评价的严苛程度。
- 用“与人类选手相同的时间、联网、提交限制”说明 AI 评估的公平性。
- 用 IOI 2026 的 535.4 分对比金牌线 361.12 分与人类最高分 498.27 分,引出“AI 是否正在跨越竞赛编程人类上限”的讨论。
原始材料
- 英文标题:Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- arXiv ID:2609.02849v1
- 作者:Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg
- 发布/更新:2026-09-02T17:33:37Z
- 主要分类:cs.LG;同时标注 cs.AI, cs.CL, cs.MA, cs.SE
- 来源 URL:https://arxiv.org/abs/2609.02849v1
- PDF URL:https://arxiv.org/pdf/2609.02849v1