LLM推論重要度 ★8
[114] LLM ServingにおけるSpeculative Decodingのための解釈可能なレイテンシモデル
An Interpretable Latency Model for Speculative Decoding in LLM Serving
Speculative Decoding·2026/5/15
AI要約
Speculative Decoding(SD)は、より小さなドラフトモデルでトークンを提案し、より大きなターゲットモデルで並列検証することでLLM推論速度を向上させます。これにより、コストのかかるターゲットモデルのデコードステップ数を大幅に削減できます。しかし、リクエスト負荷が変動する動的な本番環境でのパフォーマンスは十分に調査されていません。