LLM推論初出 9/5 02:37
必要か十分か?行動証拠を用いたLLM説明の評価
Necessary or Sufficient? Evaluating LLM Explanations With Behavioural Evidence
https://export.arxiv.org/api/query2026/9/5
AI要約
LLMの行動判断根拠となる説明が、実際の行動と一致するかを評価する手法を提案する。説明された要因が「必要」か「十分」かという観点から、LLMの出力挙動を分析し、説明の信頼性と、エージェントワークフローにおける説明の有用性を検証する。
AI要点
- LLMの説明が、その行動決定とどの程度一致するかを評価する手法を提案した。
- 「必要性(necessity)」と「十分性(sufficiency)」の2つの解釈で説明の妥当性を検証した。
- Claude, GPT, Gemini ファミリーの8モデルを対象に、2つの合成ユースケースで評価した。
- 説明に挙げられた要因と、実際の行動決定に影響を与える要因の間には相関があったが、完全ではなかった。
- 説明されていない要因が、説明されている要因よりも影響力が大きい場合があることが示された。
なぜ重要か
LLMの意思決定プロセスにおける説明の信頼性を定量的に評価するフレームワークを提供し、エージェントの監視やデバッグにおける説明の有用性を検証する上で重要である。