LLM推論初出 7/31 02:59
ReToken:視覚検索のためのVision-Language Modelを改善する1つのトークン
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
https://export.arxiv.org/api/query·2026/7/30
AI要約
長大な視覚コンテキストは、ビジョン言語モデルにとって課題です。本研究では、ReTokenという単一の学習可能埋め込みを提案します。これは、事前定義されたKVキャッシュからクエリ関連の視覚トークンを効率的に選択し、GPUメモリの制約下でも視覚検索タスクの性能を向上させます。
AI要点
- 長文の視覚コンテキストにおけるVision-Language Modelの性能低下と計算コスト増大の問題に対応するReTokenを提案。
- ReTokenは、学習可能な単一のトークンとして、事前設定されたKVキャッシュから検索関連性の高い視覚トークンを選択。
- 小規模な画像QAデータセットで学習させたReTokenは、Qwen3VL-8Bで13.4ポイント、InternVL3.5で12.4ポイントの性能向上を達成。
- ReTokenは軽量設計のため、単一のGPUで学習と長動画推論が可能。
なぜ重要か
長大な視覚コンテキストの処理能力を向上させるための効率的な手法ReTokenは、計算リソースの制約下でもVision-Language Modelの視覚検索性能を大幅に改善し、大規模なマルチモーダルAIアプリケーションへの応用を促進する。