LLM推論初出 8/27 02:57
継続学習のためのマルチモーダル教師なし学習における視覚的依存関係を考慮したフレームワーク
A Visual Dependence-Aware Framework for Multimodal Unsupervised Continual Post-Training
https://export.arxiv.org/api/query2026/8/27
AI要約
本研究は、デプロイされたMLLMがラベルなしストリーミングデータから継続的に進化することを可能にする、マルチモーダル教師なし継続的ポストトレーニング(MU-CPT)という新しいタスクを探求します。既存手法はトークンの視覚的依存性を均一に最適化しますが、本手法はその構造的歪みがクロスモーダル破滅的忘却の指標となることを明らかにします。
AI要点
- MU-CPT(Multimodal Unsupervised Continual Post-Training)は、展開済みの多モーダル大規模言語モデル(MLLM)がラベルなしデータから継続的に進化することを可能にする新しいタスクである。
- 既存手法はターゲットトークンを均一に最適化するが、本研究ではトークンレベルの視覚的依存関係(VD)が重要であることを発見した。
- VD構造の歪みがクロスモーダル破滅的忘却の指標となり、VDの異質性が新タスク学習の指針となることを明らかにした。
- 提案手法VDA(Visual Dependence-Aware)は、VC-OT(Visually Constrained Optimal Transport)とVMA(Visually Modulated Adaptation)の2つのコンポーネントから構成される。
- VC-OTは忘却を軽減し、VMAは新タスク学習を促進することで、旧タスクの安定性と新タスクの可塑性を同時に維持する。
なぜ重要か
このフレームワークは、MLLMが継続的に学習し適応する能力を向上させ、展開後のモデルの陳腐化を防ぎ、最新のデータに適応させ続けることを可能にするため、AIモデルの長期的な有効性と持続可能性に貢献する。