LLM推論重要度 ★10
コーディングコンペティションでの金メダルパフォーマンスに向けたポストトレーニング言語モデル
Post-Training Language Models for Gold-Medal Performance in Coding Competitions
https://export.arxiv.org/api/query·2026/9/2
AI要約
コーディングコンペティションにおけるLLMの性能向上のための専門化パイプラインを提示する。大規模な問題キュレーション、合成推論トレース、SFT、RLを組み合わせ、Nemotronモデルを訓練する。
AI要点
- プログラミングコンテストでの金メダル獲得を目指すポストトレーニング手法が提案された。
- 大規模な問題データセット、合成的な推論トレース、SFT、RLを組み合わせたパイプラインを開発した。
- Nemotron-3-Nano-CC (30B-A3B) と Nemotron-3-Ultra-CC (550B-A55B) モデルを学習させた。
- GenCorrectというテスト時計算戦略により、解の生成・評価・洗練を反復する。
- IOI 2025ではNano-CCが金メダル閾値を超え、Ultra-CCは金メダル獲得者のスコアを上回った。
なぜ重要か
AIがプログラミングコンテストで人間を超えるパフォーマンスを発揮できることを実証したこの研究は、AIの高度な推論能力と問題解決能力の限界を押し広げ、将来のAI応用における新たな可能性を示唆する。