LLM推論初出 5/19 07:06
プレフィックスキャッシング | LLM推論ハンドブック - BentoML
Prefix caching | LLM Inference Handbook - BentoML
Prefix Caching2026/5/19
AI要約
Prefix caching(プロンプトキャッシュ、コンテキストキャッシュ)は、チャットシステムやRAGパイプラインのように繰り返しプロンプト構造を持つワークロードで、LLM推論の遅延とコストを削減する重要な技術です。処理済み入力プレフィックスのKVキャッシュを保存・再利用することで、同一プレフィックスを持つ新しいクエリの再計算をスキップします。これにより、計算量と遅延が大幅に削減されます。