LLM推論初出 9/6 19:38
48 tokens/s 440 prefill を私の祖母のクラスター(2xP40)で(なんとか)実行
48 tg/s 440 prefill on my grandma's cluster (2xP40) (sort of)
https://www.reddit.com/r/LocalLLaMA/.rss2026/9/6
AI要約
MTPとngramを使用する際にKVキャッシュをf16に切り替えることで、推論速度が向上する可能性について言及。2x P40 GPU(総額約1100ドル)を搭載した自作クラスターでのQwen 3.8 27B Denseモデルの性能向上について報告。
AI要点
- 個人所有のクラスター(2x P40 GPU)でQwen 3.8 27B Denseモデルを実行し、48 tokens/sの推論速度を達成した。
- KVキャッシュをf16に切り替えることで、推論速度の向上が期待できることが示唆された。
- この構成は、比較的低コスト(約1100ドル)で高性能なAIモデルの実行を可能にする。
- 個人的な環境での大規模モデル実行の実現可能性を示した事例報告である。
なぜ重要か
個人レベルのハードウェアで大規模言語モデルの実行速度を向上させる技術(KVキャッシュのf16化)の報告は、AIリソースへのアクセスを民主化し、より多くの研究者や開発者が高度なAIモデルを実験・活用できる機会を広げる可能性があります。