LLM推論初出 8/5 02:59
TurnSight: ツール統合型推論のためのターンレベルHindsight自己蒸留
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
https://export.arxiv.org/api/query·2026/8/4
AI要約
TurnSightは、ツール利用型推論(TIR)における長期間のタスク実行を支援する自己蒸留手法である。従来の軌跡レベルの監督ではなく、各ターンの状態に基づいた詳細な報酬信号を提供することで、より精緻な信用割り当てを可能にする。これにより、LLMがツールを iteratively に利用して複雑な問題を解決する能力が向上する。
AI要点
- ツール統合型推論(TIR)におけるLLMの性能向上のため、ターンレベルHindsight自己蒸留フレームワーク「TurnSight」を提案する。
- 従来の評価手法は軌跡レベルの監督に依存し、長い推論過程での詳細な評価が困難だった。
- TurnSightは、実行結果を条件とするHindsight情報から直接監督信号を生成する。
- 複数のHindsightビューを構築し、異なる展望期間での信頼できる監督信号を選択する。
- 提案手法は、3つのベンチマークでの実験で有効性が実証された。
なぜ重要か
長期間にわたるツール利用を伴うLLMの推論において、ターン単位での過去の失敗から学習する「Hindsight」を自己蒸留に活用することで、よりきめ細かく効率的な学習を可能にし、複雑なタスク解決能力の向上に寄与する。