LLM推論初出 6/11 02:59
Reroute, Don't Remove:Vision-Language Modelのための回復可能なVisual Token Routing
Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models
https://export.arxiv.org/api/query2026/6/11
AI要約
Vision-Language Models (VLMs)における推論コスト削減のため、画像トークンを単に削除せず、後で復元可能な形でルーティングする手法を提案。トークンの重要度はデコーダーの深さによって変化するため、不可逆な削除は脆弱であるという課題に対応。
AI要点
- Vision-Language Modelの計算コスト削減のため、不要なVisual Tokenを削除せず、後段の処理で再利用する「Reroute」手法を提案。
- Rerouteは、各処理段階で重要度が変化するVisual Tokenを、一時的にバイパスさせて次の段階で候補プールに戻すことで、削除による情報損失を防ぐ。
- 既存のトークン削減手法にプラグインするだけで利用可能で、計算量やメモリ予算クラスを維持しつつ、特に接地(Grounding)タスクの性能を向上させる。
- 従来の「削除」ではなく「回復可能なルーティング」という新たなVLMトークン削減の視点を提示している。
なぜ重要か
Visual Tokenの削除ではなく再利用を可能にすることで、計算リソースを節約しつつ、重要な情報を見落とすリスクを低減できるため、VLMの効率と精度を両立させる上で実用的な貢献が期待できる。