Tag
Speculative Vocabularyを用いたSpeculative Decoding
本論文では、言語モデル(LM)推論の高速化における主要なアプローチであるSpeculative Decodingに焦点を当て、その効率と有効性をさらに向上させるための新しい手法「SpecVocab」を提案する。SpecVocabは、従来の縮小語彙サイズのアプローチとは異なり、各デコーディングステップで語彙サブセットを選択する「語彙的推測」を採用する。
推論用語彙を用いた推論的デコーディング
Speculative Decodingは、ドラフトモデルが生成したトークンをターゲットモデルが検証することでLLM推論を高速化する技術です。本稿では、出力分布計算のオーバーヘッドを削減するため、ドラフトモデルにSpeculative Vocabularyを導入します。あまり使われないトークンの埋め込みを枝刈りすることで、生成品質を損なわずにレイテンシを削減し、効率を向上させることを目指します。また、ドラフト用に従来のニューラル言語モデルに代わる選択肢も検討し、プロセスをさらに最適化する可能性を探ります。