LLM推論2本の記事が同じ件を報じた初出 6/18 02:06
Fable 5が記述したWebGPUカーネルを使用した、ブラウザで255 tok/sで実行されるGemma 4 E2B
Gemma 4 E2B running in-browser at 255 tok/s using WebGPU kernels written by Fable 5
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/18
AI要約
Gemma 4 E2Bモデルが、Fable 5によって書かれたWebGPUカーネルを使用し、ブラウザ上で255トークン/秒の速度で実行されているという報告です。これは、Webブラウザ上でのLLM実行の可能性とパフォーマンス向上を示唆しています。
AI要点
- Gemma 4 E2Bモデルが、ブラウザ上で255トークン/秒で実行された。
- WebGPUカーネルはFable 5によって記述された。
- この高速実行は、Webブラウザ上でのLLM利用の可能性を示している。
- ウェブベースのAIアプリケーション開発に新たな道を開く可能性がある。
なぜ重要か
ブラウザ上で高速にLLMを実行できる技術は、特別なソフトウェアのインストールなしに高度なAI機能へアクセス可能にし、Webアプリケーションのインタラクティビティを飛躍的に向上させ、AIの普及を加速させるためです。