LLM推論初出 8/3 21:06
長時間エージェントが自分で書く要約を強化学習で鍛えるCompactionRL
https://qiita.com/tags/AI/feed.atom2026/8/3
AI要約
CompactionRLは、長時間稼働するコーディングエージェントの挙動鈍化問題に対処するため、作業ログの自動要約(コンパクション)を強化学習で鍛える手法を提案する。これにより、文脈ウィンドウの限界に達した際の要約の質を向上させ、エージェントの性能維持を目指す。
AI要点
- 長時間稼働するAIエージェントの文脈ウィンドウ飽和問題を解決するため、CompactionRLが提案されています。
- CompactionRLは、エージェントが生成する文脈圧縮時の要約を、タスク成功のために学習可能な方策(ポリシー)として扱います。
- 従来の自動要約機能では要約の質がタスクに与える影響を評価していませんでしたが、CompactionRLは強化学習で要約を最適化します。
- 圧縮回数の偏りによる学習の不均衡を、トークン単位の損失正規化や軌跡位置を考慮したGAE補正で解決しています。
- 特に30Bのような小型モデルにおいて、文脈圧縮の巧拙がタスク成否に直結するため、CompactionRLの効果が顕著に見られました。
なぜ重要か
AIエージェントが生成する要約を強化学習で最適化するCompactionRLは、長時間タスクにおける文脈管理の効率と精度を向上させ、エージェントの持続的なパフォーマンス維持に貢献する技術です。