LLM推論初出 8/11 02:59
特徴発見と制御のためのマルチモーダルモデル差分
Multimodal Model Diffing for Feature Discovery and Control
https://export.arxiv.org/api/query2026/8/11
AI要約
マルチモーダルLLMの内部特徴を特定・監査・制御することは困難である。MMDiffは、SAEの限界を克服し、特徴の変更追跡とターゲット制御を可能にする。
AI要点
- マルチモーダル大規模言語モデル(MLLM)の内部特徴を特定・制御するためのフレームワーク「MMDiff」を提案した。
- SAE(Sparse Autoencoder)を拡張し、マルチモーダル学習によって変化した特徴を分離・検出する。
- 特定された特徴の操作により、視覚空間理解、安全性、OCRタスクの性能を改善または低下させることができた。
- MLLMの解釈可能性を高め、安全で高機能な生成を可能にするための制御メカニズムを提供する。
なぜ重要か
マルチモーダルモデルの内部動作の解釈可能性と制御性を向上させ、モデルの信頼性、安全性、および性能を改善するための具体的な手法を提供し、MLLMの応用範囲を広げる。