LLM推論初出 8/20 02:54
Teacher Likelihoodを超えて:長文脈推論のためのグループキャリブレーションされたOn-Policy Distillation
Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning
https://export.arxiv.org/api/query2026/8/20
AI要約
この研究は、長文脈タスクにおけるオンポリシー蒸留(OPD)の課題に取り組みます。従来のトークンレベルの教師ガイダンスは、局所的に尤もらしいが全体的な証拠を見落とす応答を助長する可能性があります。タスク固有の検証器は応答レベルで評価し、部分的な成功を反映する報酬を返すことができます。このミスマッチを解決するための新しいアプローチを提案します。
AI要点
- 長文脈推論タスクにおいて、トークンレベルの教師指導と検証報酬の不一致を解消するGC-OPDを提案
- GC-OPDは、検証報酬と教師指導スコアの差分を「不一致残差」として計算し、トークンに割り当てる
- RACA(Relative-Advantage-based Credit Assignment)により、この残差をトークンへ効果的に分配する
- GC-OPDは、Qwen3-4BとQwen3-8Bモデルの性能を大幅に向上させ、従来のOPD手法を上回った
なぜ重要か
長文脈タスクにおけるAIの推論能力を向上させるこの手法は、複雑な文書理解や要約、質問応答など、実社会での応用範囲を広げる可能性があります。