LLM推論初出 8/25 02:59
批評家を安定的かつ効率的に訓練する方法
How to Train a Critic Stably and Efficiently
https://export.arxiv.org/api/query2026/8/25
AI要約
標準的な手法では不安定になりがちな大規模言語モデルの批評家(critic)の学習を、DPPO、報酬範囲に制限された値予測、モンテカルロ目標などを組み合わせた「Best-Practice Critic Optimization (BPCO)」により、安定的かつ効率的に行う手法を提案しています。
AI要点
- 大規模言語モデル(LLM)の強化学習において、批評家(Critic)を安定かつ効率的に訓練する手法「BPCO」を提案する。
- 従来のグループベース手法は複数の応答をサンプリングする必要があったが、BPCOは単一応答からトークンレベルの利得を推定できる。
- BPCOは、DPPO、報酬範囲に制限された価値予測、モンテカルロ価値ターゲットなどを組み合わせた。
- 批評家は訓練中のみ使用されるため、ポリシーには隠された報酬定義情報(参考回答や評価基準)で条件付けできる。
- BPCOは、様々なサイズのモデルとタスクにおいて、既存手法と同等以上の性能を示した。
なぜ重要か
BPCOは、批評家モデルの訓練を安定化・効率化することで、個別応答に基づく強化学習を可能にし、LLMの性能向上と開発コスト削減に貢献する。