エージェント初出 8/25 02:59
SWE Refactor Bench: コーディングエージェントは長期的なリポジトリ全体のスタック移行を完了できるか?
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
https://export.arxiv.org/api/query·2026/8/24
AI要約
既存のコード生成エージェントのベンチマークでは評価できなかった、リポジトリ全体の大規模なコード移行タスクを評価する「SWE Refactor Bench」を提案。エージェントが単にテストをパスさせるだけでなく、実際の移行を完了できるかを検証します。
AI要点
- 「SWE Refactor Bench」は、コーディングエージェントがリポジトリ全体のスタック移行を完了できるかを評価する新しいベンチマークである。
- 従来のベンチマークは動作の正しさしか評価せず、移行の完了を確認できなかったが、本ベンチマークは移行監査、動作テスト、エージェント検証の3段階で評価する。
- 8つの先進モデルによる520回の試行では、わずか5.4%しか全評価段階を通過できず、多くのタスクで解決策が得られなかった。
- 移行の完了と動作の正確さは別個の能力であり、多くのエージェントは動作を維持するために移行を回避するか、移行中に動作を壊してしまう。
- エージェントの能力は移行の種類によって異なり、ビルドツールチェーンの書き換えよりも言語の書き換えの方が低いスコアを示した。
なぜ重要か
このベンチマークは、コーディングエージェントが単なるバグ修正を超え、大規模なリポジトリ全体の技術的負債解消やスタック移行といった複雑で長期的なタスクを自律的に実行できるかの能力を厳密に評価する。これにより、実用的なソフトウェア開発におけるAIエージェントの信頼性と適用範囲の向上に貢献する。