LLM推論初出 8/4 23:06
[Deepseek-V4-Flash-0731] VLLM CPU/Ram Offloading搭載のRTX5090 + DDR5デスクトップセットアップで1Mコンテキストを実現、約800 tps pp & 15+ tps デコード [Agentic Coding]
[Deepseek-V4-Flash-0731] Full 1M context on a single RTX5090 + DDR5 Desktop Setup with VLLM CPU/Ram Offloading, ~800 tps pp & 15+ tps decode [Agentic Coding]
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/4
AI要約
Deepseek-V4-Flashモデルは、1Mコンテキスト長をRTX5090とVLLMのCPU/RAMオフローディングを活用して実行可能である。Agentic Codingの文脈で、大規模コンテキスト処理における性能を示している。
AI要点
- Deepseek-V4-FlashモデルがVLLMのCPU/RAMオフローディング技術を利用しRTX5090で1Mコンテキスト長を実現した。
- RTX5090とDDR5メモリのデスクトップ構成で、約800 tpsのプレフィルと15 tps超のデコード性能を達成した。
- 大規模コンテキスト処理において、Agentic Codingなどの応用が期待できる性能を示した。
- VLLMのCPU/RAMオフローディング機能が、限られたGPUメモリ環境での長文コンテキスト処理を可能にした。
なぜ重要か
GPUメモリの制約を超えて超長文コンテキストの処理を可能にする技術であり、AIエージェントや複雑なタスク実行における応用範囲を大きく広げる可能性がある。