LLM推論重要度 ★10
SceneBind: Vision, Audio, Languageを横断する「何」と「どこ」の束縛
SceneBind: Binding What and Where Across Vision, Audio and Language
https://export.arxiv.org/api/query·2026/7/16
AI要約
「SceneBind」は、視覚・音声・言語を横断する、意味論的・3D空間的理解を統合したシーン表現を提案。オブジェクト中心のセマンティック・スパシャルスロットとグローバル埋め込みを組み合わせ、網羅的なシーン理解を実現。
AI要点
- SceneBindは、視覚、音声、言語を横断して現実世界のシーンを理解する新しいオムニモーダル表現を提案します。
- 従来のモデルが苦手としていた、シーン内のオブジェクトの「何」という意味情報と「どこ」という3D空間情報を統合します。
- オブジェクト中心の「意味-空間スロット」という表現を採用し、不確実性も考慮に入れた空間情報を明示的に捉えます。
- SceneBind Matchingにより、シーン全体の類似性とオブジェクトレベルでの位置合わせを統合したクロスモーダル検索を実現します。
- 実世界の音響・視覚データに構造化された意味・空間アノテーションを付与した新しいデータセットで学習・評価されています。
なぜ重要か
SceneBindは、視覚、音声、言語の情報を統合してシーンを理解する能力を向上させ、ロボットやAR/VRアプリケーションにおけるより高度な状況認識とインタラクションを可能にします。