LLM推論初出 7/24 02:59
陰的・陽的ジオメトリを持つ3D認識VLMs
3D-Aware VLMs with Implicit and Explicit Geometries
https://export.arxiv.org/api/query·2026/7/23
AI要約
2D画像ベースのVLMsは3D空間理解に課題がある。本研究では、RGB動画から学習した暗黙的・明示的3Dジオメトリを統合するVLM-IE3Dを提案し、VLMsの3D空間認識能力を向上させる。
AI要点
- 2D画像ベースのVLMは3Dタスクで空間理解や推論に苦労する傾向がある。
- 本論文は、RGBビデオから学習した暗黙的・明示的3Dジオメトリを統合する3D認識VLMフレームワークVLM-IE3Dを提案。
- IGT(Implicit Geometry Tokens)とEGT(Explicit Geometry Tokens)が3Dジオメトリ情報を捉える。
- 3D-awareアダプタが、2D視覚情報と2種類のジオメトリ表現を効果的に融合する。
- VLM-IE3Dは、3Dビデオ検出、3D視覚的グラウンディング、3D密なキャプショニングなどのタスクで優れた性能を示す。
なぜ重要か
RGBビデオのみから高精度な3D空間認識・推論能力をVLMに付与するフレームワークを提供し、ロボティクスやAR/VRなど、3D空間インタラクションが不可欠な応用分野の発展を加速させる。