LLM推論★8· Speculative Decoding 次世代のSpeculative Decoding:DFlashとSpec V2
LLM推論を高速化する投機的デコーディングにおいて、DFlashは軽量なブロック拡散モデルを用いた並列ドラフティングにより、ドラフトモデルの計算コストを大幅に削減する新しいアプローチを提案。KVインジェクションと組み合わせることで、トークン受容率を向上させる。SGLangのSpec V2エンジンと統合することで、EAGLEやMTPなどの既存手法を上回る最先端のLLM推論レイテンシを達成した。