エージェント初出 7/28 02:55
マルチターン長ホライズンプランニングの物理: シングルおよびマルチティーチャーオンポリシーエージェント蒸留による事前学習から事後学習まで
The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
https://export.arxiv.org/api/query·2026/7/27
AI要約
財団モデルエージェントにおけるマルチターンの長期計画能力向上を目指す。制御可能なマルチターン環境を構築し、計画能力の獲得、形成、統合のプロセスを体系的に研究。事前学習から事後学習までの段階的なアプローチを提案する。
AI要点
- 財団モデルエージェントにおけるマルチターン長ホライズンプランニング能力の向上を目的とした研究。
- 制御可能なマルチターン環境を構築し、事前学習から事後学習までの計画能力の獲得、形成、統合の各段階を体系的に分析した。
- CoT(Chain-of-Thought)を用いた世界モデル構築が長ホライズン汎化に有効だが、不適切な軌道データは性能を著しく低下させる。
- シングルおよびマルチティーチャーオンポリシーエージェント蒸留(OPD/MOPD)による計画知識の転移と統合のメカニズムを明らかにした。
なぜ重要か
長期間にわたる複雑なタスクを実行するAIエージェントの計画能力を体系的に研究し、その学習プロセスと改善方法を解明することで、より高度なAIエージェントの開発に貢献するため重要です。