LLM推論★8· Speculative Decoding [2394] HiSpec: LLM向け階層的推測デコーディング
Speculative decodingは、LLMの推論スループットを向上させるための効率的な手法です。この手法では、小さなドラフトモデルがトークンを予測し、大きなターゲットモデルがそれらを検証します。これにより、推論速度が向上しつつも、ターゲットモデルと同等の精度が維持されます。しかし、検証フェーズがドラフト生成よりも遅いという課題があります。
LLM推論★8· Speculative Decoding [114] LLM ServingにおけるSpeculative Decodingのための解釈可能なレイテンシモデル
Speculative Decoding(SD)は、より小さなドラフトモデルでトークンを提案し、より大きなターゲットモデルで並列検証することでLLM推論速度を向上させます。これにより、コストのかかるターゲットモデルのデコードステップ数を大幅に削減できます。しかし、リクエスト負荷が変動する動的な本番環境でのパフォーマンスは十分に調査されていません。