Tag
[7355] NVIDIA BlackwellでDFlash Speculative Decodingを使用し、推論パフォーマンスを最大15倍向上
オープンソースのブロック拡散モデル「DFlash」は、NVIDIA Blackwell GPU上でLLM推論速度を大幅に向上させる。これは、トークンブロック全体の並列ドラフト生成と検証を可能にすることで達成される。gpt-oss-120bで最大15倍のスループット増加、Llama 3.1 8Bでインタラクティブ性がほぼ倍増し、EAGLE-3などの既存手法を上回る。
DFlash Speculative DecodingでNVIDIA Blackwellの推論パフォーマンスを最大15倍向上
DFlashは、LLM推論を高速化するために、従来の逐次的なトークン生成ではなく、ブロック拡散ドラフターを用いて一度に複数のトークンブロックを並列生成する新しい推論手法です。これにより、NVIDIA Blackwell GPU上で最大15倍のスループット向上を実現し、特にGPT-OSS-120BやLlama 3.1 8Bなどのモデルで顕著な性能向上を示しています。