LLM推論初出 8/29 02:25
ビデオ生成モデルによるジオメトリ学習
Video Generative Models as Geometry Learner
https://export.arxiv.org/api/query2026/8/29
AI要約
最近の幾何推定への生成アプローチは、事前学習済み画像拡散モデルを適応させ、タスクを画像条件付き生成として扱う。既存手法は、幾何ターゲット間の相関探索を逃すか、拡散モデルのバックボーンを共同でファインチューニングする。本研究では、これを改善する。
AI要点
- ビデオ生成モデルをジオメトリ推定に応用する新しいフレームワーク「GeoNeXt」が提案されました。
- 画像生成モデルとは異なり、ビデオモデルの時空間的知識と豊富な事前知識を活用します。
- 単眼深度推定や法線推定タスクにおいて、データ効率的かつ効果的な学習を実現します。
- 既存の最先端手法と比較して、大幅に少ない学習データで同等以上の性能を示します。
なぜ重要か
GeoNeXtは、ビデオ生成モデルの持つ潜在能力をジオメトリ推定に活用する新しいアプローチであり、少ないデータでの高精度な3D情報推定を可能にすることで、コンピュータビジョン分野における応用範囲を広げる可能性があります。