Tag
D-cut:バッチ処理された投機的デコーディングのための適応的検証深度プルーニング
本論文では、バッチ処理された推論におけるSpeculative Decodingの効率を向上させるためのD-cutという適応的検証深度プルーニング戦略を提案する。高並列シナリオでは、長いドラフトが却下されたトークンで多くの計算資源を浪費するため、Speculative Decodingが最適でなくなるという課題に対処する。D-cutは、リクエスト全体でドラフトトークンを選択し、検証予算を最も受け入れられる可能性のあるトークンに集中させることで、この問題を解決する。実験により、D-cutは高並列下で平均速度向上を1.26倍から1.65倍に向上させ、MoEモデルでは最大3.0倍の速度向上を達成する。