ツール/フレームワーク重要度 ★9
時系列根本原因帰属のためのLLM Agent制御評価ベンチマーク (TraceBench)
TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution
https://export.arxiv.org/api/query·2026/8/27
AI要約
時系列データからの根本原因特定タスクにおけるLLMエージェントの性能を体系的に評価するフレームワーク「TraceBench」を開発。シミュレーションにより制御されたデータセットを生成し、エージェントの能力を検証する。
AI要点
- 時系列データにおける根本原因帰属タスクを制御された条件下で評価するシミュレーションフレームワーク「TraceBench」が提案された。
- 4つのLLMエージェントを評価した結果、エージェントはドメイン知識や数値コンソール出力を重視する傾向があった。
- Pythonスクリプト生成よりも直接的な予測の方が、エージェントのパフォーマンスは一般的に良好であった。
- データセット、エージェントの軌跡、実験結果、リーダーボードが公開された。
なぜ重要か
LLMエージェントが実世界のシステム異常検知や根本原因分析に適用される際の、系統的かつ制御された評価手法を提供し、その挙動と限界を明らかにするための基盤となる。