LLM推論初出 8/5 00:35
DeepSeek V4 Flash 0731 (Q4) がRTX PRO 6000 1基で1,328 tok/sのプリフィルと約29 tok/sのデコードを達成
DeepSeek V4 Flash 0731 (Q4) now reaches 1,328 tok/s prefill and ~29 tok/s decode on one RTX PRO 6000
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/5
AI要約
DeepSeek V4 Flash 0731 (Q4) モデルは、RTX PRO 6000で1,328 tok/sのプレフィルおよび約29 tok/sのデコード速度を達成した。長文コンテキストの処理速度が大幅に向上している。
AI要点
- DeepSeek V4 Flash 0731 (Q4) モデルがRTX PRO 6000 1基で達成した性能が報告された。
- 具体的には、1,328 tok/sのプレフィル速度と約29 tok/sのデコード速度を記録した。
- この性能は、長文コンテキストの処理速度が従来と比較して大幅に向上していることを示している。
- Q4量子化モデルでありながら、高性能なGPUでの高速処理を実現している。
なぜ重要か
高性能GPUと量子化技術の組み合わせにより、長文コンテキストを高速に処理できるようになったことは、リアルタイムでの応答性が求められるアプリケーションや、より複雑な推論タスクの効率化に繋がる。