LLM推論重要度 ★8
変動的推論による解法:トークン尤度からシーケンス受容へのドラフト学習の再考
Variational Speculative Decoding: Rethinking Draft Training from Token Likelihood to Sequence Acceptance
Speculative Decoding·2026/7/24
AI要約
Speculative decodingはLLMの推論を高速化するが、訓練と推論の乖離が課題となっていた。本研究では、Draftモデルの訓練を潜在的なDraftパスに対する変分推論として定式化するVariational Speculative Decoding (VSD)を提案する。VSDは、ターゲットモデルの受理確率を最大化することで、高品質な潜在パスを促進しつつ、ターゲット分布からの乖離を最小限に抑えるELBOを導出する。
AI要点
- LLMの推論を高速化するSpeculative decodingには、訓練と推論の乖離という課題があった。
- 本研究では、Draftモデルの訓練を潜在的パスに対する変分推論として定式化するVSDを提案している。
- VSDは、ターゲットモデルの受理確率を最大化し、高品質な潜在パスを促進しつつ、ターゲット分布からの乖離を最小限に抑える。
- これにより、Speculative decodingの訓練と推論の乖離問題を緩和し、より効率的なLLM推論の実現が期待される。
なぜ重要か
提案手法VSDは、Speculative decodingにおける訓練と推論の乖離問題を解消し、LLMの推論効率を大幅に向上させる可能性があり、大規模言語モデルのさらなる活用に貢献する。