LLM推論初出 8/8 02:51
CoinRAG: 長コンテキストRAGのためのコンテキスト化された情報ナゲットKVキャッシュ再利用
CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
https://export.arxiv.org/api/query·2026/8/7
AI要約
長文RAGにおける情報冗長性やノイズを解決するため、CoinRAGを提案。情報ナゲット単位でのKVキャッシュ再利用により、低レイテンシかつ高精度なRAGを実現する。
AI要点
- 長文コンテキストRAGにおける効率化のため、情報ナゲットKVキャッシュの再利用を提案する「CoinRAG」を開発しました。
- 粗いチャンクではなく、クエリに関連する意味単位(ナゲット)のKV表現を効率的に再利用します。
- 2段階検索により、チャンク内の関連ナゲットを特定し、コンテキストと組み合わせて表現を生成します。
- LongBenchマルチホップQAタスクで、運用コストを大幅に削減し、精度を平均5.3%向上させました。
- 低プリフィル遅延制約下で、精度を最大化する新たなパレートフロンティアを達成しました。
なぜ重要か
長文コンテキストのRAGにおいて、意味のある情報ナゲット単位でKVキャッシュを再利用することで、計算コストを削減しつつ、精度を向上させる効率的な方法論を提供します。これは、LLMの推論効率と性能の両立に貢献します。