LLM推論重要度 ★9
[7355] NVIDIA BlackwellでDFlash Speculative Decodingを使用し、推論パフォーマンスを最大15倍向上
Boost Inference Performance up to 15x on NVIDIA Blackwell Using DFlash Speculative Decoding
Speculative Decoding·2026/6/23
AI要約
オープンソースのブロック拡散モデル「DFlash」は、NVIDIA Blackwell GPU上でLLM推論速度を大幅に向上させる。これは、トークンブロック全体の並列ドラフト生成と検証を可能にすることで達成される。gpt-oss-120bで最大15倍のスループット増加、Llama 3.1 8Bでインタラクティブ性がほぼ倍増し、EAGLE-3などの既存手法を上回る。
AI要点
- NVIDIA Blackwell GPU上でDFlash Speculative Decodingを使用し、LLM推論速度を最大15倍向上させることが発表された。
- DFlashは、トークンブロック全体の並列ドラフトと検証を可能にするオープンソースのブロック拡散モデルである。
- gpt-oss-120bで最大15倍のスループット増加、Llama 3.1 8Bでインタラクティビティをほぼ倍増させる。
- 従来の逐次的な生成プロセスに代わり、ドラフトをブロック並列GPUワークとして扱うことでGPU利用率を向上させる。
なぜ重要か
LLM推論におけるボトルネックを解消し、GPUの計算能力を最大限に活用することで、リアルタイム応答性が求められるアプリケーションのパフォーマンスを大幅に向上させることが期待されるため。