LLM推論重要度 ★9
高速VLM推論のための統一凝縮・抽出パラダイム (PACE)
PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference
https://export.arxiv.org/api/query·2026/8/27
AI要約
VLM推論のコストを削減するため、Vision Encoder前の段階でトークンを凝縮・抽出する新しいパラダイム「PACE」を提案。既存手法の課題(Vision Encoder後の処理のみ、全体的文脈と細粒度の維持困難)を解決し、高速化と精度維持を目指す。
AI要点
- Vision-Language Models (VLMs) の推論速度を向上させるため、統一的な「凝縮・抽出」パラダイム「PACE」が提案された。
- PACEは、Vision Encoder前の段階で冗長なピクセル情報を適応的に削減する「Adaptive Pixel Compressor (APC)」を導入した。
- 抽出段階では、エンコーダー内部の信号とLLMのセマンティック信号を融合して重要なトークンを選択する「Dynamic Dual-Attention Extractor (DDAE)」を使用した。
- Qwen2.5-VL-7BモデルにPACEを適用した結果、93.8%の性能を維持しつつ、視覚トークンを10%に削減し、TTFT(First Tokenへの時間)を3.1倍高速化した。
なぜ重要か
VLMの計算コストを大幅に削減する新しいフレームワークを提案し、画像エンコーディングとLLM推論の両方を最適化することで、リアルタイムアプリケーションへのVLMsの適用可能性を広げる。