LLM推論初出 6/7 03:53
12GB VRAMで120トーク/秒、Gemma 4 12B QAT MTP
120 tok/s on 12GB VRAM with Gemma 4 12B QAT MTP
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/7
AI要約
GoogleのGemma 4 12BモデルのQAT(Quantization-Aware Training)版がリリースされ、12GB VRAMで120トークン/秒の推論速度を達成した。llama.cppとUnslothライブラリを組み合わせることで、ローカル環境での高速な推論が可能になったことを示している。