LLM推論2本の記事が同じ件を報じた初出 7/24 19:53
ローカルLLM study1-b: Hugging Faceオリジナル版Gemma 4を動かしてみた
https://zenn.dev/topics/ai/feed2026/7/24
AI要約
Hugging Faceで公開されたGoogleのGemma 4ファミリー(FA4アテンション、チャットテンプレート修正)を、Ollamaを経由せずTransformersライブラリで直接ローカル実行した検証記事。Ollama版との比較により、最新モデルの性能を評価している。
AI要点
- GoogleのHugging Face公開版Gemma 4ファミリー(改善版)を、transformersライブラリで直接動作させた。
- Apple Silicon(M4)上で、MPSを利用し、Gemma 4 (E2B/E4B)のbf16非量子化モデルのロードと推論に成功。
- 環境構築のハードルは高いが、Aiderとの連携はtransformers serveコマンドで実現可能。
- デフォルト設定(temperature=1.0)では、出力に無関係なトークン混入やコード構文破壊の品質問題を発見。
- GGUF量子化版の直接pullは現状機能せず、Ollama版より遅く、品質問題の修正にはgreedy設定が必要だった。
なぜ重要か
Hugging Face版Gemma 4をApple Silicon上で直接動作させた検証は、最新LLMのローカル実行可能性を示す一方、品質問題や環境構築の課題も浮き彫りにし、今後のLLM活用における留意点を提供する。