LLM推論初出 9/11 02:39
パラメータから回答へ: LLMは内部知識をどのように取得し使用するか
From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge
https://export.arxiv.org/api/query2026/9/11
AI要約
大規模言語モデル(LLM)が質問に答える際に、内部知識をどのように検索・利用するかを調査。Qwen、Llama、Gemmaモデルを使用し、質問の隠れ状態に対する層ごとの介入を通じて、クエリールーティング情報とターゲット知識への依存度が変化する様子を分析。国・大陸の質問と名詞、形容詞、コードの回答を比較し、モデルの内部知識利用メカニズムを解明する。
AI要点
- LLMが質問に答える際、クエリールーティング情報とターゲット知識への依存度がどのように変化するかを調査した。
- Qwen, Llama, Gemmaの3つのモデルで、レイヤーごとの介入を通じて知識取得と利用のメカニズムを分析した。
- 質問に答える過程で、ルーティング指示は初期レイヤーで、知識依存は後期レイヤーで重要になることが示された。
- モデルごとに知識取得のタイミングやルーティング効果の持続時間に違いが見られた。
なぜ重要か
LLMが内部知識をどのように取得し利用するかのメカニズムを解明することで、モデルの挙動理解を深め、より信頼性の高いAIシステムの開発に貢献する。