LLM推論★8· Speculative Decoding [5357] Speculative Decoding:LLMが回答を変えずにトークンをより速く生成する方法
投機的デコーディングは、より小さい高速な「ドラフト」モデルで次のトークンを予測し、より大きい「ターゲット」モデルで並列検証することにより、LLM推論を高速化する技術である。これにより、ターゲットモデルが出力分布を標準の自己回帰デコーディングと同じに保つため、出力品質を損なうことなくレイテンシとコストを大幅に削減できる。LLM推論のボトルネックである逐次処理を回避し、大規模展開を可能にする。