エージェント初出 8/28 02:58
SWE-Prime: より少ない軌跡で、より良いパフォーマンスを
SWE-Prime: Fewer Trajectories, Better Performance
https://export.arxiv.org/api/query·2026/8/27
AI要約
SWE-Primeは、実世界のソフトウェア問題を解決するLLMの能力を向上させるため、少数の高品質な軌跡データのみを用いた教師ありファインチューニング(SFT)を提案する。これにより、不十分な軌跡データによるノイズの多い監督や望ましくない挙動の模倣を防ぐ。
AI要点
- SWE-Primeは、AIエージェントのソフトウェア問題解決能力向上のため、質の低い軌跡を除外するデータ選別手法です。
- 軌跡レベルとセグメントレベルで段階的にデータをフィルタリングし、ノイズの多い教師データ導入を防ぎます。
- SWE-Bench ProとVerifiedでの実験では、SWE-Primeで選別された10%のデータで学習した方が、全データで学習するより性能が向上しました。
- 従来手法では成功した軌跡でも非効率なステップが含まれ、モデルが望ましくない行動を模倣する可能性がありましたが、SWE-Primeはこれを改善します。
なぜ重要か
SWE-Primeは、AIエージェントの学習データ選別プロセスを高度化し、より効率的で質の高い学習を実現することで、実世界のソフトウェア問題解決能力の向上に貢献します。