LLM推論★8· Speculative Decoding [141] より高速、より低コスト、そして賢さもそのまま:Speculative Decoding による LLM 推論の経済性の改善
Speculative Decodingは、より小さく高速なドラフトモデルでトークンを提案し、より大きく能力の高いモデルで検証することで、LLM推論を改善します。このアプローチは、出力品質を損なうことなくレイテンシとコストを大幅に削減し、LLM展開をより実用的にし、リアルタイムアプリケーションを可能にします。