LLM推論初出 5/27 02:59
LocateAnything:並列ボックスデコーディングによる高速・高品質なビジョン・言語グラウンディング
LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding
https://export.arxiv.org/api/query2026/5/27
AI要約
画像とテキストを統合するモデルにおいて、バウンディングボックスの生成とデコードを並列化することで、推論速度と品質を向上させる「LocateAnything」を提案。従来の逐次処理のボトルネックを解消する。