Tag
Speculative Vocabularyを用いたSpeculative Decoding
本論文では、言語モデル(LM)推論の高速化における主要なアプローチであるSpeculative Decodingに焦点を当て、その効率と有効性をさらに向上させるための新しい手法「SpecVocab」を提案する。SpecVocabは、従来の縮小語彙サイズのアプローチとは異なり、各デコーディングステップで語彙サブセットを選択する「語彙的推測」を採用する。
[7355] NVIDIA BlackwellでDFlash Speculative Decodingを使用し、推論パフォーマンスを最大15倍向上
オープンソースのブロック拡散モデル「DFlash」は、NVIDIA Blackwell GPU上でLLM推論速度を大幅に向上させる。これは、トークンブロック全体の並列ドラフト生成と検証を可能にすることで達成される。gpt-oss-120bで最大15倍のスループット増加、Llama 3.1 8Bでインタラクティブ性がほぼ倍増し、EAGLE-3などの既存手法を上回る。
D-cut:バッチ処理された投機的デコーディングのための適応的検証深度プルーニング
本論文では、バッチ処理された推論におけるSpeculative Decodingの効率を向上させるためのD-cutという適応的検証深度プルーニング戦略を提案する。高並列シナリオでは、長いドラフトが却下されたトークンで多くの計算資源を浪費するため、Speculative Decodingが最適でなくなるという課題に対処する。D-cutは、リクエスト全体でドラフトトークンを選択し、検証予算を最も受け入れられる可能性のあるトークンに集中させることで、この問題を解決する。実験により、D-cutは高並列下で平均速度向上を1.26倍から1.65倍に向上させ、MoEモデルでは最大3.0倍の速度向上を達成する。