LLM推論重要度 ★10
[10230] DepthWeave-KV: 長コンテキストKVキャッシュ圧縮のためのトークン適応型クロスレイヤー残差分解
DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression
https://export.arxiv.org/api/query·2026/7/7
AI要約
長文脈KVキャッシュ圧縮のためのDepthWeave-KVを提案。レイヤー間・トークン間の適応的な圧縮により、メモリ帯域幅と容量の制約を緩和し、LLM推論の効率と性能を向上させる。
AI要点
- DepthWeave-KVは、長コンテキストKVキャッシュ圧縮のためのトークン適応型手法を提案する。
- 隣接するTransformer層間でキーとバリューの状態を分解し、低ランクチャネル基底を共有する。
- 命令や検索に重要なトークンには、より高い再構築ランクを割り当てる。
- インコンテキスト学習や長文QAタスクにおいて、メモリ使用量を大幅に削減しつつ高い性能を維持する。
なぜ重要か
DepthWeave-KVは、長文コンテキストを扱うLLMのメモリ効率を劇的に改善し、より長い文書の処理や複雑な推論を低リソースで実現可能にします。これにより、LLMの応用範囲がさらに拡大します。