ハードウェア初出 8/12 01:39
M4 Max上でカスタムWebGPUカーネルを使用し、Muse Glimmer 30Bをローカルブラウザ内で約25 tok/sで実行(llama.cppと同じ速度)
Muse Glimmer 30B running locally in-browser with custom WebGPU kernels at ~25 tok/s on an M4 Max (same speed as llama.cpp)
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/12
AI要約
Muse Glimmer 30BをカスタムWebGPUカーネルを用いてM4 Max上でローカル実行した事例です。ブラウザ上で約25トークン/秒の速度を実現し、llama.cppと同等の性能を示しています。
AI要点
- Muse Glimmer 30BモデルをM4 Max上でローカル実行する事例が紹介されている。
- カスタムWebGPUカーネルを利用することで、約25トークン/秒の推論速度を達成した。
- この速度はllama.cppと同等であり、ブラウザ内での実用的な動作が可能であることを示している。
なぜ重要か
ローカル環境のブラウザでllama.cppと同等の速度で大規模言語モデルを実行可能にしたことは、プライバシーを保ちつつ高性能なAI機能をデバイス上で利用できる可能性を示唆し、アプリケーション開発に影響を与える。