ハードウェア重要度 ★9
Patch Policy: 密な視覚表現による効率的な具現化制御
Patch Policy: Efficient Embodied Control via Dense Visual Representations
https://export.arxiv.org/api/query·2026/7/20
AI要約
Vision Transformer (ViT) の強力な事前学習済み表現をロボット制御に活用する新しい手法「Patch Policy」を提案。従来の手法が持つ空間的詳細の損失や、スクラッチからの学習といった課題を解決し、効率的なロボット制御を実現する。
AI要点
- ロボット学習において、Vision Transformer (ViT) の事前学習済み密な視覚特徴の活用が不十分であった。
- 既存手法は、観測を単一トークンに圧縮するか、ゼロから学習させるため、空間的詳細や事前学習の利点を失っていた。
- Patch Policyは、VLMの計算コストなしに、事前学習済みパッチトークンを直接利用できる最小限のアーキテクチャ拡張である。
- ブロック因果アテンションマスクにより、時間的因果関係を維持しつつ、多数のパッチトークンに注意を払うことを可能にする。
- Patch Policyは、シミュレーションおよび実環境で、既存手法より40%の相対改善、OpenVLA-OFTより18%の性能向上を達成しつつ、パラメータ数は0.7%に抑えられた。
なぜ重要か
Patch Policyは、ロボット学習における高頻度・反応的制御に必要な、学習効率と推論速度を犠牲にすることなく、視覚表現学習の進歩を活用するための効果的なパイプラインを提供する。