LLM推論初出 9/1 05:00
TempCloze: 動画言語モデルは欠落した中間部分を特定できるか?
TempCloze: Can Video-LLMs Identify the Missing Middle?
https://huggingface.co/api/daily_papers2026/9/1
AI要約
TempClozeは、Video-LLMの視覚的時系列推論を評価するためのビデオ穴埋めベンチマーク。動画の開始と終了クリップが与えられ、モデルは4つの候補から真の欠落中間部分を特定する必要がある。言語的ショートカットを減らすため、意味、タイミング、進行の3次元に沿った選択肢を構築する。
AI要点
- 動画言語モデル(Video-LLMs)の時空間的推論能力を評価する新たなベンチマーク「TempCloze」を提案している。
- 動画の開始部分と終了部分から、欠落した中間部分を4つの候補から特定させるタスクを設計した。
- 既存のVideo-LLMs 31モデルを評価した結果、意味内容や局所的な進行は理解できるものの、時間的整合性に課題があることが判明した。
なぜ重要か
動画内の時間的整合性を正確に理解する能力は、動画要約、異常検知、コンテンツ推薦など、多様な応用分野におけるVideo-LLMsの信頼性と性能向上に不可欠であるため。