Tag
投機的デコーディングガイド
Speculative Decoding(SD)は、小規模なドラフトモデルで将来のトークンを予測し、大規模モデルで検証することでLLM推論を高速化します。これにより、メモリ帯域幅のボトルネックを回避し、EAGLE-3などのモデルで大幅な高速化を実現。H100/H200での最適化により、コストを50-70%削減可能です。