LLM推論初出 9/2 14:09
テキスト・画像・音声全部扱えるGemini Embedding2を触ってみた!
https://zenn.dev/topics/ai/feed2026/9/2
AI要約
Gemini Embedding 2のテキスト・画像・音声の横断検索機能を検証。異なるモダリティ間の概念的な近さを計測し、テキストと音声で「猫」の類似性を実験した結果を報告。
AI要点
- Gemini Embedding 2は、テキスト・画像・音声・動画を同一ベクトル空間に変換し、クロスモダリティ検索を可能にする。
- 「猫」というテキストクエリに対し、最も類似度が高かったのは「猫についての話し声」であり、次いで「単語:自動車」となった。
- 画像素材(猫の写真、「猫」の文字画像)は、他のモダリティと比較して類似度が著しく低く、上位11位外となった。
- 検証環境では、Gemini Embedding 2 (GA版) を使用し、出力次元768、コサイン類似度で比較した。
- モダリティを問わず同じAPIでベクトル化でき、返り値の768次元ベクトルはL2正規化済みのため、そのまま内積計算で類似度を算出できる。
なぜ重要か
Gemini Embedding 2のクロスモダリティ検索能力を実験的に検証し、テキスト、画像、音声間の概念的な近さを定量的に示しており、マルチモーダルAIの応用可能性を示唆している。