エージェント初出 8/14 02:57
QuoteBench:一致スコアはコマンドパスの失敗をどのように隠すか
QuoteBench: How Matched Scores Can Hide Command-Path Failures
https://export.arxiv.org/api/query·2026/8/13
AI要約
QuoteBenchは、LLMコーディングエージェントがBashコマンドを発行する際のエラーを検出するベンチマークである。コマンド生成エラーと、生成後のインターフェース処理で発生するエラーを区別し、正確な最終状態検証によって評価する。
AI要点
- LLMコーディングエージェントは、コマンド実行の成果スコアだけでは、生成エラーと後続処理での失敗を区別できない。
- 「QuoteBench」は、コマンド生成と実行パスの境界を検証し、56個のタスクでスコアの隠蔽効果を測定する新しいベンチマークである。
- 意図的にエスケープ処理を挟んだparserを導入することで、生成されたコマンドが実行パスでどのように失敗するかを正確に検証できる。
- 境界の開示により、モデルの生成能力が向上する一方、境界適応がモデル間の性能差を生む主要因となっていることが示された。
- コマンド発行エージェントの評価では、モデル設定、生成契約、実行パス、最終状態バリデーターを報告すべきである。
なぜ重要か
QuoteBenchは、LLMコーディングエージェントの真の性能を評価するために、単なる実行スコアではなく、コマンド生成から実行までのプロセス全体を検証することの重要性を示し、より信頼性の高いエージェント評価手法の確立に貢献する。