LLM推論初出 3/3 08:29
[モデル公開] openai/clip-vit-base-patch32
https://huggingface.co/api/models2022/3/3
AI要約
openai/clip-vit-base-patch32は、OpenAIが開発したCLIPモデルのベースバージョンです。zero-shot-image-classificationタスクで利用され、2100万以上のダウンロード数を記録しています。テキストと画像の関連性を理解する能力に長けており、多様なビジョンタスクに応用可能です。画像認識の新しいパラダイムを提示しました。
AI要点
- openai/clip-vit-base-patch32は、画像とテキストのマルチモーダル理解モデルであるCLIPの、ViT-Baseモデルをパッチサイズ32で実装したもの。
- 自然言語による画像検索や、画像の内容に基づいたゼロショット分類タスクなどに利用可能。
- Hugging Face Transformersライブラリで利用でき、PyTorch、TensorFlow、JAXに対応している。
- 2022年3月2日に公開され、多数のダウンロード実績がある。
- 画像認識と自然言語処理を連携させるための基盤モデルとして広く利用されている。
なぜ重要か
画像とテキストの意味的な関連性を学習するCLIPモデルの公開は、画像検索、画像キャプション生成、ゼロショット学習など、多様なマルチモーダル応用を容易にし、研究開発を加速させる。