LLM推論★9· Speculative Decoding Speculative Vocabularyを用いたSpeculative Decoding
本論文では、言語モデル(LM)推論の高速化における主要なアプローチであるSpeculative Decodingに焦点を当て、その効率と有効性をさらに向上させるための新しい手法「SpecVocab」を提案する。SpecVocabは、従来の縮小語彙サイズのアプローチとは異なり、各デコーディングステップで語彙サブセットを選択する「語彙的推測」を採用する。