LLM推論初出 8/13 02:58
AVA-Encoder:Agent-Native Video Representation Learningに向けて
AVA-Encoder: Towards Agent-Native Video Representation Learning
https://export.arxiv.org/api/query2026/8/13
AI要約
高品質な人間映画から学習する能力がクリエイティブエージェントには不足しており、映画品質のビデオ制作能力を制限しています。この課題に対処するため、エージェントによる自己エンコードを通じて、エージェントネイティブなビデオ表現を学習するフレームワーク「AVA-Encoder」を提案します。
AI要点
- クリエイティブエージェントが高品質な人間映画から学習するための、エージェントネイティブな動画表現学習フレームワークAVA-Encoderを提案。
- 動画を知識グラフ(KG)表現に変換し、再構築することで学習。階層ノードとアセットレイヤーが構造化された情報とメディアを保持。
- エージェントが理解・クエリ・編集しやすい形式で、テキスト記述とアセットの関係性を型付きエッジで保存。
- 動画再構築誤差をテキスト勾配最適化に利用し、データ独立エンコーディングポリシー擬似学習とデータ依存KG表現洗練を組み合わせる。
- 実験で、外部ベースラインを20.7%ポイント上回り、擬似学習されたショットレベルエンコーダは人間調整済みポリシーより効率的。
なぜ重要か
動画コンテンツをエージェントが直接操作・編集可能な知識グラフ形式に変換・学習する新しい手法を提案し、AIによる高品質な映像制作の実現に貢献します。