ハードウェア重要度 ★9
TANGO: 全身ビジョン・言語・行動モデルによる混雑環境でのヒューマノイドナビゲーション
TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model
https://export.arxiv.org/api/query·2026/9/8
AI要約
TANGOは、人間型ロボットが雑然とした屋内環境をナビゲートするための、全身のビジョン・言語・アクションモデルを提案する。従来の2D経路計画とは異なり、3D空間での衝突回避のため、腕の配置、胴体の調整、歩行の変調といった連続的かつ幾何学的に認識した全身の適応を必要とする。これは、言語条件付きのナビゲーションを実現する最初の全身モデルである。
AI要点
- 混雑した屋内環境におけるヒューマノイドロボットのナビゲーション手法TANGOを提案。
- TANGOは、視覚と言語、そして全身の運動を統合した初のフレームワークである。
- RGB画像と自然言語指示から、29自由度の関節空間アクションを直接予測する。
- シミュレーションで学習し、実環境でのゼロショットデプロイメントに成功している。
なぜ重要か
この研究は、ヒューマノイドロボットが複雑な3次元空間を安全かつ効率的に移動するための、新しい全身制御アプローチを提示し、実世界での応用可能性を広げます。