LLM推論重要度 ★8
[188] Speculative DecodingによるLarge Language Model推論の高速化
Speculative Decoding Accelerates Large Language Model Inference
Speculative Decoding·2026/5/20
AI要約
Speculative Decoding(SD)は、ドラフトモデルで候補トークンを提案し、それをより大きなターゲットモデルで並列検証することにより、LLM推論を高速化します。この「ドラフト・アンド・検証」アプローチは、ターゲットモデルの実行とメモリアクセスオーバーヘッドを複数の候補に分散させ、バッチサイズとGPU利用率を効果的に向上させます。