研究/論文初出 8/2 18:42
AIセキュリティに関する論文メモ⓷〜AgentDojo編〜
https://zenn.dev/topics/ai/feed2026/8/2
AI要約
信頼できないデータ(メールやウェブ等)をツール経由で扱うLLMエージェントの「実用性」と「安全性」のトレードオフを測定する方法を解説。プロンプトインジェクション耐性とタスク遂行能力を、動的かつステートフルな環境で測定する手法について論じている。
AI要点
- AgentDojoは、LLMエージェントがツール経由で信頼できないデータ(メール、ウェブ等)を扱う際の「実用性」と「安全性」のトレードオフを測定するベンチマークです。
- プロンプトインジェクションに対する耐性とタスク遂行能力を、動的かつステートフルな環境で評価します。
- 74種類のツールが利用可能で、間接的プロンプトインジェクションは外部データから侵入します。
- 「ユーティリティ関数」でタスク達成度、「セキュリティ関数」で攻撃成功度を定量的に評価します。
- 画像を含むマルチモーダル攻撃や、長期対話シナリオにおける脆弱性は測定対象外です。
なぜ重要か
AgentDojoは、LLMエージェントの安全性と実用性のバランスを定量的に評価するための重要なフレームワークを提供し、より堅牢なAIエージェント開発に貢献します。