ツール/フレームワーク初出 6/5 06:25
BeeLlama v0.3.1 – 最新のllama.cppにextrasを追加! DFlash、MTP、q6_0キャッシュ、TurboQuant。Single RTX 3090: Qwen 3.6 27B & Gemma 4 31B 最大177.8 tps (ベースラインの4.93倍)
BeeLlama v0.3.1 – latest llama.cpp with extras! DFlash, MTP, q6_0 cache, TurboQuant. Single RTX 3090: Qwen 3.6 27B & Gemma 4 31B up to 177.8 tps (4.93x over baseline)
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/5
AI要約
llama.cppの最新版v0.3.1(BeeLlama)に関する紹介。DFlash、MTP、q6_0キャッシュ、TurboQuantなどの新機能が追加され、Qwen 3.6 27BやGemma 4 31Bで大幅な高速化を実現。ローカルLLM環境の強化に貢献。