ツール/フレームワーク★8· Speculative Decoding DFlash Speculative DecodingでNVIDIA Blackwellの推論パフォーマンスを最大15倍向上
DFlashは、LLM推論を高速化するために、従来の逐次的なトークン生成ではなく、ブロック拡散ドラフターを用いて一度に複数のトークンブロックを並列生成する新しい推論手法です。これにより、NVIDIA Blackwell GPU上で最大15倍のスループット向上を実現し、特にGPT-OSS-120BやLlama 3.1 8Bなどのモデルで顕著な性能向上を示しています。