エージェント初出 9/2 02:59
CordisBench:動的なエージェントハーネスにおいて、言語モデルはコンポーネントのライフサイクルを推論できるか?
CordisBench: Can Language Models Reason About Component Lifecycles in Dynamic Agent Harnesses?
https://export.arxiv.org/api/query2026/9/2
AI要約
動的なエージェント環境におけるLLMのコンポーネントライフサイクル推論能力を評価するベンチマーク「CordisBench」を提案。1200の質問から成り、プラグイン変更が依存関係やクリーンアップに与える影響をモデルに推論させることで、エージェントの堅牢性を検証する。
AI要点
- 動的なエージェントハーネスにおけるコンポーネントライフサイクル推論能力を評価するベンチマーク「CordisBench」が提案された。
- CordisBenchは、1,200の質問からなり、コンポーネントの依存関係とクリーンアップを管理するランタイム「Cordis」上で実行される。
- LLMは、小規模システムでは良好な性能を示すが、関連インタラクションが増加すると信頼性が低下し、特に最終状態の予測やテアダウン順序の推論が困難になる。
- 推論コストは高く、GPT-5.6 Lunaは中程度の推論努力で質問あたり約3,000トークンを消費する。
なぜ重要か
CordisBenchは、動的なエージェントハーネスにおけるLLMのコンポーネントライフサイクル推論能力を体系的に評価する手法を提供し、ソフトウェアエージェントの信頼性と安全性を向上させるための課題を明らかにする。