Tag
Speculative Vocabularyを用いたSpeculative Decoding
本論文では、言語モデル(LM)推論の高速化における主要なアプローチであるSpeculative Decodingに焦点を当て、その効率と有効性をさらに向上させるための新しい手法「SpecVocab」を提案する。SpecVocabは、従来の縮小語彙サイズのアプローチとは異なり、各デコーディングステップで語彙サブセットを選択する「語彙的推測」を採用する。
変動的推論による解法:トークン尤度からシーケンス受容へのドラフト学習の再考
Speculative decodingはLLMの推論を高速化するが、訓練と推論の乖離が課題となっていた。本研究では、Draftモデルの訓練を潜在的なDraftパスに対する変分推論として定式化するVariational Speculative Decoding (VSD)を提案する。VSDは、ターゲットモデルの受理確率を最大化することで、高品質な潜在パスを促進しつつ、ターゲット分布からの乖離を最小限に抑えるELBOを導出する。
D-cut:バッチ処理された投機的デコーディングのための適応的検証深度プルーニング
本論文では、バッチ処理された推論におけるSpeculative Decodingの効率を向上させるためのD-cutという適応的検証深度プルーニング戦略を提案する。高並列シナリオでは、長いドラフトが却下されたトークンで多くの計算資源を浪費するため、Speculative Decodingが最適でなくなるという課題に対処する。D-cutは、リクエスト全体でドラフトトークンを選択し、検証予算を最も受け入れられる可能性のあるトークンに集中させることで、この問題を解決する。実験により、D-cutは高並列下で平均速度向上を1.26倍から1.65倍に向上させ、MoEモデルでは最大3.0倍の速度向上を達成する。