LLM推論重要度 ★9
合成前の可視化:弱教師あり密ビデオキャプションのためのVLM誘導遷移イベント発見
Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning
https://export.arxiv.org/api/query·2026/9/3
AI要約
弱教師あり高密度動画キャプション生成において、VLMを活用した遷移イベント発見手法SBSを提案。LLM生成キャプションの視覚的根拠の欠如や固定的な割り当て問題を解決する。
AI要点
- 弱教師あり密ビデオキャプションのための「Seeing Before Synthesizing (SBS)」フレームワークが提案された。
- VLM(Vision-Language Model)を用いて、視覚的に根拠のある言語的ガイダンスを適応的に生成する。
- 遷移イベントを検出し、イベント間の時間マスクを調整して、映像と言語の整合性を最大化する。
- ActivityNet CaptionsとYouCook2のデータセットで、キャプション生成と局在化の両方で最先端の性能を達成した。
なぜ重要か
SBSは、VLMを活用することで、弱教師ありビデオキャプションの精度と局在化能力を向上させ、より詳細で正確なビデオ理解を可能にする。