LLM推論3本の記事が同じ件を報じた初出 7/24 04:01
Deepseek V4 Flash、vLLMでNvidia 4090d 48G (ada) 2基で約105 t/s
Deepseek V4 Flash ~105 t/s on two Nvidia 4090d 48G (ada) in vLLM
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/24
AI要約
Deepseek V4 Flashモデルを2つのNvidia 4090d(48GB)でvLLMを使用し、105トークン/秒で動作させたという報告です。高性能GPU環境での推論速度に関する具体的なデータを提供しています。
AI要点
- Deepseek V4 Flashモデルの推論速度が、Nvidia 4090d 2基で約105 t/sであることが報告された。
- vLLMライブラリを使用し、48GBのVRAMを持つGPU環境での計測結果である。
- 高性能GPU環境におけるLLMの推論パフォーマンスを具体的に示している。
- 大規模言語モデルのリアルタイム応答性能の指標となる数値である。
なぜ重要か
大規模言語モデルの推論速度は、リアルタイムでの対話やアプリケーションへの組み込みにおいて非常に重要であり、この報告は高性能GPU環境でのモデル性能評価の指標となるため重要です。