ハードウェア2本の記事が同じ件を報じた初出 6/23 12:29
Qwen3.6-27B Q8で5090 + 3090 Ti使用時100 t/s超え - Tensor Splitモードへの切り替えで70から100+に向上
100+ t/s on Qwen3.6-27B Q8 across a 5090 + 3090 Ti — switching to tensor split-mode got me from 70 to 100+
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/23
AI要約
Qwen3.6-27BモデルをRTX 5090とRTX 3090 Tiの2枚のGPUで実行し、Q8量子化で100 t/s以上を達成した報告です。特に、スプリットモードを「tensor」に変更したことで、70 t/sから大幅に向上したとのことです。これはハードウェア構成と最適化による推論速度向上の事例です。
AI要点
- Qwen3.6-27BモデルをRTX 5090とRTX 3090 Tiで実行し、Q8量子化で100 t/s超えを達成した。
- スプリットモードを「tensor」に変更することで、70 t/sから100 t/s以上に速度が向上した。
- これはハードウェア構成と最適化による推論速度向上の実例である。
なぜ重要か
Tensor Splitモードの活用は、複数のGPUを用いたLLMの推論速度を大幅に向上させる可能性を示しており、高性能コンピューティング環境でのAI活用を加速させる。