LLM推論2本の記事が同じ件を報じた初出 9/2 02:08
Geminiによるエージェント型ビデオ理解の紹介
Introducing agentic video understanding with Gemini
https://deepmind.google/blog/rss.xml2026/9/2
AI要約
Geminiを活用したエージェント型動画理解の紹介。動画内のオブジェクトやイベントを識別し、それらを基に質問応答や要約などのタスクを実行するエージェントを構築する。この技術は、動画コンテンツの分析と活用の可能性を広げるものである。
AI要点
- Googleは、Gemini 3.7/3.6/3.5 Flashモデルに「エージェント型ビデオ理解」機能を導入しました。
- この機能は、動画の特定部分を動的にスキャンし、トークン消費量を最大88%削減、コストを最大66%削減します。
- 精度も最大7%向上し、サブ秒単位の瞬間検索や異常検知などの新機能が利用可能になります。
- API設定で「agentic」を選択することで、Google AI StudioやGemini Enterprise Agent Platformで利用開始できます。
なぜ重要か
Geminiのエージェント型ビデオ理解機能は、動画分析における計算コストと処理時間を大幅に削減しつつ精度を向上させる画期的な技術であり、長尺動画の分析や、より高度な動画インテリジェンスへの応用が期待されます。