研究/論文初出 6/29 10:01
Meta AIが発表した「DINOv3」:70億パラメータで全能の視覚AIへ。微調整なしでSOTAを圧倒
https://zenn.dev/topics/ai/feed2026/6/29
AI要約
Meta AIが発表した最新のビジョン基盤モデル「DINOv3」について解説する。70億パラメータモデルで、従来のビジョンモデルのスケーリングにおける課題であった「密な特徴の劣化」を克服する技術的回答を示し、微調整なしでSOTAを圧倒する性能を持つことを紹介する。高品質画像16.89億枚を学習データとしている。
AI要点
- Meta AIが70億パラメータの全能視覚AI「DINOv3」を発表した。
- 「Gram Anchoring」手法で、大規模化による画像詳細の劣化問題を解決した。
- 微調整なしで既存のSOTAモデルを上回る性能を達成した。
- ProxyCLIPなどのフレームワークと連携し、学習不要で精度向上を実現する。
なぜ重要か
大規模化による画像認識の精度低下という長年の課題を解決し、微調整なしで多様なタスクに対応できる汎用性の高い視覚基盤モデルを提供することで、AI開発の新たな地平を切り開くからだ。