Tag
推論用語彙を用いた推論的デコーディング
Speculative Decodingは、ドラフトモデルが生成したトークンをターゲットモデルが検証することでLLM推論を高速化する技術です。本稿では、出力分布計算のオーバーヘッドを削減するため、ドラフトモデルにSpeculative Vocabularyを導入します。あまり使われないトークンの埋め込みを枝刈りすることで、生成品質を損なわずにレイテンシを削減し、効率を向上させることを目指します。また、ドラフト用に従来のニューラル言語モデルに代わる選択肢も検討し、プロセスをさらに最適化する可能性を探ります。
[2394] HiSpec: LLM向け階層的推測デコーディング
Speculative decodingは、LLMの推論スループットを向上させるための効率的な手法です。この手法では、小さなドラフトモデルがトークンを予測し、大きなターゲットモデルがそれらを検証します。これにより、推論速度が向上しつつも、ターゲットモデルと同等の精度が維持されます。しかし、検証フェーズがドラフト生成よりも遅いという課題があります。