LLM推論重要度 ★9
投機的デコーディングガイド
Speculative Decoding Guide
Speculative Decoding·2026/5/22
AI要約
Speculative Decoding(SD)は、小規模なドラフトモデルで将来のトークンを予測し、大規模モデルで検証することでLLM推論を高速化します。これにより、メモリ帯域幅のボトルネックを回避し、EAGLE-3などのモデルで大幅な高速化を実現。H100/H200での最適化により、コストを50-70%削減可能です。