LLM推論初出 7/29 02:59
バトンを渡す:軌道中継によるOn-Policy Distillation
Pass the Baton: Trajectory-Relayed On-Policy Distillation
https://export.arxiv.org/api/query·2026/7/28
AI要約
この論文は、オンポリシー蒸留(OPD)における「プレフィックス失敗」問題を解決する手法を提案しています。プレフィックス失敗とは、学生モデルが誤った推論を開始すると、その誤りが後続の生成全体に影響し、不正確な教師信号を生み出す問題です。本研究では、教師と学生モデルの継続性の非対称性を特定し、この問題を緩和することで、より信頼性の高い蒸留を実現します。
AI要点
- 軌道中継によるOn-Policy Distillation (Relay-OPD) が提案された。
- 学生モデルの推論方向の誤りを早期に検出し、教師モデルが介入して軌道を修正する。
- 「バトンを渡す」ように、教師モデルが一部の生成を担当し、学生モデルがそれに続く。
- 限られた中継予算により、重要な初期段階での介入を集中させる。
- 複数の数学的推論ベンチマークで、標準的なOPDや他のベースラインを上回る性能を示した。
なぜ重要か
On-Policy Distillationにおけるprefix failure問題を解決するRelay-OPDは、AIモデルの学習効率と推論精度を大幅に改善し、特に複雑な推論タスクにおける性能向上に貢献する。