LLM推論初出 5/28 15:43
Nvidia LocateAnything - 並列ボックスデコーディングによる高速かつ高品質なビジョン言語グラウンディング。(Qwen3-VLの10倍高速)
Nvidia LocateAnything - Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding. (10x faster than Qwen3-VL)
https://www.reddit.com/r/LocalLLaMA/.rss2026/5/28
AI要約
NvidiaのLocateAnything-3Bは、高速かつ高品質なビジョン・言語グラウンディングを実現するモデルです。並列ボックスデコーディング技術により、従来のモデル(Qwen3-VL)と比較して10倍高速化されています。画像内のオブジェクト認識と関連付けに優れています。