Tag
変動的推論による解法:トークン尤度からシーケンス受容へのドラフト学習の再考
Speculative decodingはLLMの推論を高速化するが、訓練と推論の乖離が課題となっていた。本研究では、Draftモデルの訓練を潜在的なDraftパスに対する変分推論として定式化するVariational Speculative Decoding (VSD)を提案する。VSDは、ターゲットモデルの受理確率を最大化することで、高品質な潜在パスを促進しつつ、ターゲット分布からの乖離を最小限に抑えるELBOを導出する。
推論用語彙を用いた推論的デコーディング
Speculative Decodingは、ドラフトモデルが生成したトークンをターゲットモデルが検証することでLLM推論を高速化する技術です。本稿では、出力分布計算のオーバーヘッドを削減するため、ドラフトモデルにSpeculative Vocabularyを導入します。あまり使われないトークンの埋め込みを枝刈りすることで、生成品質を損なわずにレイテンシを削減し、効率を向上させることを目指します。また、ドラフト用に従来のニューラル言語モデルに代わる選択肢も検討し、プロセスをさらに最適化する可能性を探ります。
Speculative Decoding解説:Draft ModelsはAI Agentsをどう高速化するか
Speculative decodingは、LLMの逐次的なトークン生成のボトルネックを解消する技術です。小型で高速なドラフトモデルがトークンを予測し、大型で高精度なターゲットモデルがそれらを並列に検証します。これにより、出力品質を維持したまま推論速度を2〜3倍向上させることが可能です。特に、AIエージェントのような多段階のワークフローでは、レイテンシの累積が解消されるため、その効果は顕著です。
Speculative Decoding
Speculative Decodingは、ドラフトモデルで複数トークンを先行予測し、メインモデルが単一バッチで検証することでトークン生成を大幅に高速化する技術です。バッチ処理の効率を活用し、ドラフト予測が正確な場合に大幅な速度向上を実現します。パラメータ調整により、速度と受容率を最適化できます。