LLM推論重要度 ★8
D-cut:バッチ処理された投機的デコーディングのための適応的検証深度プルーニング
D-cut: Adaptive Verification Depth Pruning for Batched Speculative Decoding
Speculative Decoding·2026/7/17
AI要約
本論文では、バッチ処理された推論におけるSpeculative Decodingの効率を向上させるためのD-cutという適応的検証深度プルーニング戦略を提案する。高並列シナリオでは、長いドラフトが却下されたトークンで多くの計算資源を浪費するため、Speculative Decodingが最適でなくなるという課題に対処する。D-cutは、リクエスト全体でドラフトトークンを選択し、検証予算を最も受け入れられる可能性のあるトークンに集中させることで、この問題を解決する。実験により、D-cutは高並列下で平均速度向上を1.26倍から1.65倍に向上させ、MoEモデルでは最大3.0倍の速度向上を達成する。
AI要点
- D-cutは、バッチ処理された推論におけるSpeculative Decodingの効率を向上させる適応的検証深度プルーニング戦略である
- 高並列シナリオでSpeculative Decodingが非効率になる課題に対処する
- リクエスト全体でドラフトトークンを選択し、検証予算を最も受け入れられる可能性のあるトークンに集中させる
- 実験では、高並列下で平均1.26倍から1.65倍、MoEモデルでは最大3.0倍の速度向上を達成した
なぜ重要か
D-cutは、大規模言語モデルの推論速度を大幅に向上させることで、リアルタイムアプリケーションや大規模なバッチ処理における計算コストを削減し、LLMの利用可能性を広げることが期待されます。