Tag
[90] Speculative Decoding: パフォーマンスか、それとも幻想か?
Speculative Decodingは、小さなドラフトモデルでトークンを提案し、大きなターゲットモデルで検証するLLM推論高速化技術ですが、ターゲットモデルと完全に一致しない有効なトークンも拒否してしまう課題がありました。本論文では、LLM-as-a-judgeフレームワークに着想を得た「Judge Decoding」を提案。