ハードウェア初出 8/4 19:08
Optimised DSv4-Flash for 2x GH200: SGLangで10,000 tok/s PP、300 tok/s TG超え
Optimised DSv4-Flash for 2x GH200: 10,000 tok/s PP, >300 tok/s TG on SGLang
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/4
AI要約
2基のGH200 GPU環境でSGLangを使用し、DeepSeek v4 Flashモデルを最適化した結果、10,000 tok/s (PP) および300 tok/s以上 (TG) の高いパフォーマンスを達成したことが報告されています。
AI要点
- GH200 GPU 2基環境でSGLangを使用し、DeepSeek v4 Flashモデルを最適化した。
- 最適化されたモデルは、10,000 tok/s (PP) という高いパフォーマンスを達成した。
- さらに、300 tok/s (TG) を超える推論速度も確認された。
- GH200 GPU 2基でのSGLang活用によるモデル最適化の成功事例が示された。
なぜ重要か
GH200 GPU 2基という環境でSGLangを利用したモデル最適化により、従来比で大幅な性能向上が見込まれ、LLMの推論速度と効率が向上する可能性を示唆しているため。