LLM推論初出 6/13 02:59
Gaze Heads:VLMsは記述するものをどのように見ているか
Gaze Heads: How VLMs Look at What They Describe
https://export.arxiv.org/api/query2026/6/13
AI要約
この論文は、大規模言語モデル(LLM)が画像の説明を生成する際に、説明対象の画像領域を追跡する「視線ヘッド」と呼ばれる内部メカニズムを発見したことを報告しています。コミックストリップを用いた実験で、このメカニズムの存在を実証し、LLMの視覚的説明生成プロセスにおける注意機構の役割を明らかにしました。
AI要点
- 視覚言語モデル(VLM)が記述対象をどのように見ているかを分析する「Gaze Heads」を特定
- 少数のアテンションヘッドが記述対象の画像領域を追跡していることを発見
- これらのアテンションヘッドへの介入により、モデルの記述対象を制御可能
- 再学習なしに、マルチモーダルモデルの挙動を制御する実用的な手法を示唆
なぜ重要か
VLMの内部メカニズムを解明し、再学習なしにモデルの出力を制御する新たな手法を提示することで、より安全で意図した通りのAI生成物を実現する可能性を開くため。