LLM推論★8· Speculative Decoding [2834] Speculative Decoding in Production LLM Inference 2026: EAGLE-3、Medusa、vLLM、およびスループット3倍
Speculative decodingは、2026年のLLM推論において、既存ハードウェアで2.0〜3.2倍のスループット向上を実現する未活用最適化技術です。vLLMなどのサービングスタックと容易に統合でき、EAGLE-3やMedusaといった手法をサポートします。特にRAGワークロードで効果的ですが、長文コンテキストでは性能低下の可能性も指摘されています。