LLM推論重要度 ★9
SPADE:適応型合成実行可能環境における自己プレイ
SPADE: Self-Play in Adaptive Synthetic Executable Environments
https://export.arxiv.org/api/query·2026/8/19
AI要約
SPADEは、LLMが環境デザイナーとエージェントの両方を演じる自己対戦RLフレームワークです。これにより、LLMは継続的な自己改善のために、多様で適応性のあるトレーニング環境を生成できます。固定された環境プールに依存する既存の手法とは異なり、SPADEは進化し続ける学習目標に対応します。
AI要点
- SPADEは、LLMが環境デザイナーと推論エージェントの二役を担う自己プレイRLフレームワークである。
- 環境デザイナーは実行可能なコードとして訓練環境を生成し、推論エージェントがその中で学習する。
- エージェントの不満(regret)を指標とし、環境デザイナーはエージェントの能力の限界に挑戦する環境を生成する。
- 30Bパラメータモデルで、8つのベンチマークにおいて既存手法を平均+5.3上回る性能向上を達成した。
- 特に、ツール使用タスクにおいてBFCL-v4で+5.7、ACEBench-Agentで+13.9の性能向上を示した。
なぜ重要か
SPADEは、LLM自身が学習環境を生成・適応させることで、言語エージェントの能力を飛躍的に向上させる可能性を示唆しており、AIエージェントの継続的自己改善に貢献する。