LLM推論初出 9/10 05:00
World in World: World Modelsで世界を探求する
World in World: Explore the World with World Models
https://huggingface.co/api/daily_papers2026/9/10
AI要約
World in Worldは、自動回帰型ビデオワールドモデルにおける柔軟な制御を可能にする、トレーニング不要な推論時インターフェース。ソース動画を新しい視点から探索する際に、生成されるロールアウトが記録されたイベントと同期し、指定されたビューにコンテンツを配置し、新規領域を補完し、再訪時に以前生成された外観を回復する。
AI要点
- 凍結された因果的ビデオモデルを活用し、トレーニング不要で多様な制御下での動画探索を可能にするインターフェース「World in World」を提案している。
- ソース動画、ターゲット視点、ジオメトリレンダリングなどの異種制御証拠を、カメラと時間でラベル付けされたクリーンな視覚状態に変換する。
- このインターフェースは、カメラ制御による再レンダリング、長期間の再訪、人物モーション転送などを単一のバックボーンでサポートする。
- 多様な視点変化下での動画再レンダリングタスクで評価され、知覚品質、時間的整合性、カメラ追従精度を向上させた。
なぜ重要か
既存の動画生成モデルを再学習させることなく、多様な視点や時間軸での動画操作を可能にする技術は、インタラクティブなコンテンツ作成や再編集の効率を大幅に向上させるため。