LLM推論初出 7/1 02:59
内省的カップリング:固定された監督にもかかわらず行動変化を追跡する自己説明トレーニング
Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
https://export.arxiv.org/api/query2026/7/1
AI要約
この研究では、言語モデルが予測の説明を生成するように訓練された際に、単なる表面的な模倣ではなく、忠実な内省を達成できるかを調査します。固定された対立説明による教師あり学習で、モデルの振る舞いの変化を追跡する手法を提案しています。
AI要点
- 教師あり学習で、言語モデルが予測の説明を生成する際の忠実な内省を調査。
- 固定された対立説明(counterfactual explanations)を用いて訓練。
- モデルの振る舞いの変化を追跡し、内省の質を評価する。
- 単なる表面的な模倣に留まらない、真の理解に基づく説明生成を目指す。
なぜ重要か
LLMが自身の推論過程を説明する能力の信頼性を高め、ブラックボックス化しがちなAIの意思決定プロセスを可視化・解釈可能にすることで、AIの信頼性と説明責任を向上させる。