Tag
[2394] HiSpec: LLM向け階層的推測デコーディング
Speculative decodingは、LLMの推論スループットを向上させるための効率的な手法です。この手法では、小さなドラフトモデルがトークンを予測し、大きなターゲットモデルがそれらを検証します。これにより、推論速度が向上しつつも、ターゲットモデルと同等の精度が維持されます。しかし、検証フェーズがドラフト生成よりも遅いという課題があります。