LLM推論初出 9/9 05:00
IMOゴールドのオープンレシピ: オリンピック数学のためにNemotronをトレーニングする
An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
https://huggingface.co/api/daily_papers2026/9/9
AI要約
「IMO Goldへのオープンレシピ」は、オリンピック数学のためのモデル後処理と推論設計を研究。Nemotron 3 Ultraをベースに、教師ありファインチューニングと強化学習で専門チェックポイントを訓練。検証と洗練を伴うテスト時計算パイプラインを提案。 formal proverや外部ツール、インターネットなしで自然言語のみで動作する。
AI要点
- オリンピック数学(IMO)レベルの問題に対する自然言語での証明生成に焦点を当て、Nemotronモデルのファインチューニングと推論設計を研究した。
- Nemotron 3 Ultraをベースに、教師ありファインチューニングと強化学習で2つの専門チェックポイントを訓練した。
- 検証、洗練、候補証明の生成・検証・洗練を繰り返す、自然言語のみで動作するテスト時計算パイプラインを構築した。
- IMO 2026で30/42点を獲得し、金メダル基準に到達した。関連データセットやコード、チェックポイントも公開する。
なぜ重要か
高度な数学的問題に対する自動証明生成能力の向上は、定理発見や教育、AIの推論能力の限界を探求する上で学術的・実用的に大きな意義を持つため。