エージェント初出 8/26 02:52
SPO++: 非同期エージェントRLのためのストリーム整合ポリシー最適化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
https://export.arxiv.org/api/query2026/8/26
AI要約
非同期強化学習におけるグループ相対強化学習のコスト問題を解決するため、SPO++を提案。プロンプトレベルの価値推定を維持しつつ、単一ストリームで効率的な学習を実現し、長期的・変動的なツール使用軌道に対応する。
AI要点
- 非同期エージェント強化学習(RL)における、SPO(Single-stream Policy Optimization)の依存関係を解消する新しい手法「SPO++」が提案された。
- SPO++は、プロンプトレベルの価値推定を維持しつつ、トークンごとのアドバンテージを標準化することで、学習効率を向上させる。
- プロンプトの証拠を学習者の受信順ではなく、ポリシーイベントごとに整理する。
- ALFWorldとMath-TIRのタスクでSPO++は、SPOと比較してオンライン学習効率を向上させることが示された。
- 特に、アクション・トークン尺度正規化が性能向上に最も寄与する要素であることが特定された。
なぜ重要か
SPO++は、長期間で変動しやすいツール使用軌道を持つ非同期エージェントRLにおいて、学習効率と安定性を向上させるための重要な手法であり、実応用への道を開く。