LLM推論★8· Speculative Decoding Speculative Decoding:2つのモデルで1つの声を実現
Speculative Decodingは、LLM推論を高速化する技術です。まず高速なドラフトモデルが複数のトークンを予測し、次に大規模なターゲットモデルがそれらを並列検証します。この「ドラフト&検証」アプローチにより、出力品質を損なわずに2〜3倍の速度向上が実現します。ターゲットモデルは、最終出力が従来の自己回帰生成と数学的に同一であることを保証します。この技術は、ハードウェアの並列検証能力を活用し、安価に推測を生成し、余剰計算能力を検証に費やすことで生成を高速化します。