LLM推論重要度 ★10
LongTraceRL: ルーブリック報酬を用いた検索エージェント軌道からの長文コンテキスト推論学習
LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards
https://export.arxiv.org/api/query·2026/5/29
AI要約
LongTraceRLは、長文脈推論の課題に対し、探索エージェントの軌跡とルーブリック報酬を用いた強化学習手法を提案。既存手法の限界(低識別度なノイズ、結果のみの報酬)を克服し、中間的な推論ステップの監督を可能にする。
AI要点
- 「LongTraceRL」は、検索エージェントの行動軌跡とルーブリック報酬を用いて、長文コンテキスト推論能力を学習する手法である。
- 既存手法の課題である、誤解を招きやすい分散情報や、中間推論を監視できない報酬信号の問題を解決する。
- 検索エージェントが参照したが引用しなかった文書(高難易度)や、検索結果に表示されたが参照されなかった文書(低難易度)を訓練データに含める。
- ルーブリック報酬は、正解した回答に対し、推論過程の各段階を評価する細粒度な報酬を与える。
- 実験により、LongTraceRLは既存手法を上回り、包括的で証拠に基づいた推論を促進することが示された。
なぜ重要か
長文コンテキストにおける推論能力の向上を目指し、検索エージェントの行動軌跡と細粒度なルーブリック報酬を組み合わせることで、より高精度で信頼性の高いAI推論を実現する新しい学習フレームワークを提案している。