LLM推論初出 7/18 02:58
PagedWeight: 動的品質考慮型重み量子化による効率的なMoE LLMサービング
PagedWeight: Efficient MoE LLM Serving with Dynamic Quality-Aware Weight Quantization
https://export.arxiv.org/api/query·2026/7/17
AI要約
PagedWeightは、MoE LLMのサービングにおいて、モデルの重みを実行時に動的に量子化し、エキスパートの重みの精度とKVキャッシュのサイズをバランスさせる新しい管理手法です。これにより、GPUメモリ要件とKVキャッシュの増加というトレードオフを解消します。
AI要点
- MoE (Mixture-of-Experts) LLMのサービング効率を向上させる「PagedWeight」を提案。
- PagedWeightは、実行時にMoEモデルの重みを動的に量子化し、重みの精度とKVキャッシュサイズをバランスさせる。
- モデルのタスク精度、メモリ消費、スループット/レイテンシ間のトレードオフを効果的に管理。
- メモリに制約のあるシナリオにおいて、既存の量子化ベースラインよりも優れた品質-メモリトレードオフを実現。
- FP16相当の精度で最大72.0%のGPUメモリ削減と1.94倍のスループット向上を達成。
なぜ重要か
大規模言語モデル、特にMoEアーキテクチャのサービングにおけるメモリ使用量と計算コストを大幅に削減し、より多くのユーザーが、より高速に、より低コストで大規模言語モデルを利用可能にする技術的ブレークスルーとなる。