LLM推論初出 7/23 02:10
モデルを学習させるのであって、読者を学習させるのではない:検証可能な活性化説明のためのデコーダビリティ(Decodability)制御
Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
https://export.arxiv.org/api/query·2026/7/22
AI要約
LLMの解釈可能性における検証可能な説明生成のため、デコーダビリティ監督を提案。「モデルを訓練するのではなく、読者を訓練する」アプローチで、誤った主張を検出・ペナルティを与えることを目指す。
AI要点
- モデルの解釈可能性における「デコーダビリティ(Decodability)」の有効性に疑問を呈している。
- 従来の再構築スコアに基づく評価では、モデルが個別の誤った主張を回避しやすい。
- Qwen-2.5-7BやPythia-160Mを用いた実験で、スコアが実質的な事実よりも「大意」を反映してしまうことを示す。
- 検証可能な説明のための新手法「RECAP」を提案、モデル内部の特定情報をプローブで独立して検証可能にする。
- RECAPは、モデルの誤情報や操作に対して頑健であり、AIの安全性向上に寄与するとされる。
なぜ重要か
AIモデルの説明可能性において、単なる再構築精度ではなく、主張の真偽を検証可能にすることで、AIの信頼性と安全性を高めるための新たな評価・制御手法を提供する点で重要である。