LLM推論重要度 ★10
Distributional DAggerによるリッチフィードバックからの強化学習
Reinforcement Learning from Rich Feedback with Distributional DAgger
https://export.arxiv.org/api/query·2026/6/3
AI要約
推論モデルの高度化に対し、RLVRは単一ビットの報酬に依存。本研究では、実行トレース、ツールの出力、専門家の修正など、豊富なフィードバックを利用する方法を、古典的なDAggerの分布変異体で研究。
AI要点
- 多様なフィードバック(実行トレース、ツールの出力、専門家の修正など)を活用する強化学習手法「Distributional DAgger」が提案された。
- 従来のRLVR(検証可能な報酬からの強化学習)が単一の正誤フィードバックに限定されていたのに対し、本手法はよりリッチな情報で学習できる。
- 提案手法は、順方向クロスエントロピー目的関数を使用し、教師との不一致を過去の決定に伝播させることで、単調な方策改善を保証する。
- 科学的推論、コーディング、数学的問題解決などのドメインにおいて、既存手法よりも優れた性能を示した。
なぜ重要か
Distributional DAggerは、人間のような多様なフィードバックから学習する能力をAIに付与し、より複雑で実用的なタスクへの応用を可能にする。これにより、AIの学習効率と汎用性が大幅に向上する。