Tag
[5357] Speculative Decoding:LLMが回答を変えずにトークンをより速く生成する方法
投機的デコーディングは、より小さい高速な「ドラフト」モデルで次のトークンを予測し、より大きい「ターゲット」モデルで並列検証することにより、LLM推論を高速化する技術である。これにより、ターゲットモデルが出力分布を標準の自己回帰デコーディングと同じに保つため、出力品質を損なうことなくレイテンシとコストを大幅に削減できる。LLM推論のボトルネックである逐次処理を回避し、大規模展開を可能にする。
[141] より高速、より低コスト、そして賢さもそのまま:Speculative Decoding による LLM 推論の経済性の改善
Speculative Decodingは、より小さく高速なドラフトモデルでトークンを提案し、より大きく能力の高いモデルで検証することで、LLM推論を改善します。このアプローチは、出力品質を損なうことなくレイテンシとコストを大幅に削減し、LLM展開をより実用的にし、リアルタイムアプリケーションを可能にします。