LLM推論初出 6/9 10:50
2倍のtk/s (19.4 -> 38.1 tk/s on 1 x MI50) スペキュレーティブデコーディングのような仮説を検証中… ただし、追加のサイドモデルの代わりに、Qwen3.6-27Bをメモリに2つロードしているかのように複数の計算を並行して実行できることを利用 — 小規模クオンタイゼーションは利用可能な全計算能力を使用しない
2X tk/s (from 19.4 -> 38.1 tk/s on 1 x MI50) Playing with a hypothesis like speculative decoding.. but instead of an additional side model, exploiting that I can run multiple computations side-by-side AS IF I had Qwen3.6-27B loaded twice in memory - small quants don't use all the available compute.
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/9
AI要約
Qwen3.6-27BモデルをMI50 GPUで2倍のトークン/秒(19.4→38.1)で実行する手法について述べている。speculative decodingの応用や、small quantsが計算能力をすべて使用しないという仮説に基づいた最適化を試みている。