LLM推論重要度 ★10
マルチモーダルコードスイッチング:明示的なオブジェクトレベルのアライメントのための言語への視覚オブジェクトの挿入
MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment
https://export.arxiv.org/api/query·2026/8/11
AI要約
マルチモーダルコードスイッチング: 視覚オブジェクトを言語に挿入し、明示的なオブジェクトレベルの整合性を実現。既存のMLLMは画像-テキストペアに依存するが、グローバルな画像表現と長いテキスト説明の整合性は曖昧さを生む。本手法は、オブジェクトレベルの整合性を強化する。
AI要点
- 既存のマルチモーダル大規模言語モデル(MLLM)は、画像とテキストのペアで学習するが、オブジェクトレベルの対応付けに課題があった。
- 「マルチモーダルコードスイッチング(MMCS)」は、テキスト中のエンティティを対応する視覚オブジェクトに置き換える新しい事前学習パラダイムである。
- MMCSは、オブジェクトレベルの明示的な教師信号を提供し、局所的な視覚と言語の関連付けを強化する。
- MMCSは、773Kサンプルのデータセットを用いて学習効率の高さを実証した。
- MMCSは、わずか50Kサンプルで600Kペアで学習したモデルに匹敵または凌駕する性能を示し、視覚的グルーピング能力を向上させる。
なぜ重要か
MMCSは、既存の画像レベルアライメントの曖昧さを解消し、オブジェクトレベルでの精密な視覚と言語の関連付けを可能にするため、マルチモーダルAIの理解力とデータ効率を大幅に向上させる可能性があります。