Tag
Speculative Vocabularyを用いたSpeculative Decoding
本論文では、言語モデル(LM)推論の高速化における主要なアプローチであるSpeculative Decodingに焦点を当て、その効率と有効性をさらに向上させるための新しい手法「SpecVocab」を提案する。SpecVocabは、従来の縮小語彙サイズのアプローチとは異なり、各デコーディングステップで語彙サブセットを選択する「語彙的推測」を採用する。
[6299] Block VerificationによるSpeculative Diffusionsの高速化
投機的デコーディングを拡散モデルに適用する際の課題(連続空間での残差分布からのサンプリングの難しさ)に対し、ブロック検証を可能にする新しいスキームを提案。これによりドラフト受容率が向上し、「Free Drafter」ヒューリスティック(学習不要)を用いることで最大6.3%の速度向上が見込める。