LLM推論初出 7/4 03:04
Gemma 4、ブラウザで255トークン/秒: Fable 5によって書かれたWebGPUカーネル
Gemma 4 a 255 token/s nel Browser: i Kernel WebGPU Scritti da Fable 5
https://pasqualepillitteri.it/feed2026/7/4
AI要約
Fable 5のWebGPUカーネルにより、ブラウザ上でGemma 4をサーバーレスで255トークン/秒の速度で実行可能になった。しかし、Anthropicはその後、セーフガードを削除し、モデルを一時停止した。
AI要点
- Fable 5のWebGPUカーネルにより、Gemma 4をブラウザで高速実行できるようになった。
- サーバーレス環境で255トークン/秒の推論速度を達成した。
- Anthropicはこの後、セーフガードを削除し、モデルを一時停止した。
- ブラウザ上での大規模言語モデル実行の可能性を示唆している。
なぜ重要か
WebGPUカーネルを用いたブラウザ上でのGemma 4の高速実行は、クライアントサイドAIの可能性を広げる。これにより、サーバーリソースへの依存を減らし、ユーザーのプライバシーを保護しつつ、リッチなAIアプリケーションをより多くのデバイスで提供できるようになる可能性がある。