ツール/フレームワーク初出 8/19 19:25
YouTube動画を映像ごとAIに読ませるCLIを作った(Gemini API、Python標準ライブラリのみ)
https://zenn.dev/topics/ai/feed2026/8/19
AI要約
YouTube動画の内容をAIに理解させるためのCLIツールを開発。字幕だけでは失われる映像情報(図やデモ)を補完するため、映像ごとAIに読ませる仕組みをPython標準ライブラリとGemini APIで構築。
AI要点
- YouTube動画の映像と音声をAIに読ませるためのCLIツール「video2md」がPythonで開発された。
- Gemini APIのgenerateContent機能を利用し、動画URLを直接渡すことで音声と映像の両方を解析できる。
- 従来の文字起こしツールでは拾えなかった、画面上の図やコードなどの視覚情報をテキスト化できる。
- 長尺動画で著作権保護の逐語再現フィルタがかかった場合、要点形式で自動的に再取得するフォールバック機能を実装した。
- MITライセンスで公開されており、Python標準ライブラリのみで動作するため、pip install不要で利用可能。
なぜ重要か
動画内の視覚情報をAIが理解できるようになることで、解説動画の内容をより深く、正確にAIに学習させることが可能になり、高度なAI活用への道を開く。