Tag
NVIDIA BlackwellでDFlash Speculative Decodingを使用し、推論パフォーマンスを最大15倍向上
オープンソースのブロック拡散モデル「DFlash」は、NVIDIA Blackwell GPU上でLLM推論速度を大幅に向上させる。これは、トークンブロック全体の並列ドラフト生成と検証を可能にすることで達成される。gpt-oss-120bで最大15倍のスループット増加、Llama 3.1 8Bでインタラクティブ性がほぼ倍増し、EAGLE-3などの既存手法を上回る。
Speculative Decoding:vLLMにおける理論と実装
Speculative decodingは、LLMの生成速度を劇的に向上させる技術であり、ターゲットモデルとドラフトモデルの「ドラフト・アンド・ベリファイ」パイプラインを利用します。ドラフトモデルが候補トークンを高速に生成し、ターゲットモデルがそれを一度に検証することで、メモリ帯域幅のボトルネックを解消します。この手法は、モデルの出力を一切変更せずに、生成速度を2〜3倍に向上させることが可能です。