LLM推論★8· Speculative Decoding [114] LLM ServingにおけるSpeculative Decodingのための解釈可能なレイテンシモデル
Speculative Decoding(SD)は、より小さなドラフトモデルでトークンを提案し、より大きなターゲットモデルで並列検証することでLLM推論速度を向上させます。これにより、コストのかかるターゲットモデルのデコードステップ数を大幅に削減できます。しかし、リクエスト負荷が変動する動的な本番環境でのパフォーマンスは十分に調査されていません。