LLM推論初出 7/31 02:43
VAD:マルチモーダルOn-Policy Distillationにおけるターゲット再構築のための視覚的証拠の帰属
VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
https://export.arxiv.org/api/query2026/7/31
AI要約
マルチモーダルオンポリシー蒸留(OPD)は、学生モデルの軌跡を教師モデルで監督することで、詳細な視覚知識を転移させます。しかし、その補正は視覚信号と言語的先行知識が混在しています。本研究では、視覚的証拠に裏打ちされた補正を推定するVADを提案します。
AI要点
- マルチモーダルOn-Policy Distillationにおいて、教師モデルの修正が視覚情報にどの程度基づいているかを推定する手法VADを提案。
- VADは、教師モデルに視覚情報を与えた場合と与えない場合での生徒モデルの予測確率の変化を測定し、視覚的証拠の影響を定量化。
- 提案手法VADは、従来の教師あり学習や視覚優位性重み付け手法と比較して、6つのベンチマークで性能を向上。
- VADは、特に教師モデルが誤った回答を提示した場合に、視覚情報がトークン選択に与える影響をより正確に捉えられることを確認。
なぜ重要か
マルチモーダル学習において、教師モデルの出力を生徒モデルへ効果的に蒸留するために、視覚情報がどの程度寄与しているかを定量的に評価する新しいフレームワークを提供し、より高精度な知識転移を実現する可能性を示唆している。