ハードウェア初出 8/20 21:48
RTX 5060 Tiを追加購入する直前に、RTX 4070 Ti SUPER 16GB単体でQwen 3.8 27Bを試してみた
https://zenn.dev/topics/ai/feed2026/8/20
AI要約
ローカルLLM運用のため、RTX 4070 Ti SUPER 16GBに加えてRTX 5060 Ti 16GBの追加購入を検討。Qwen 3.8 27Bモデルを長いコンテキストで利用する際のVRAM不足を補うため、GPUを2枚に分散させる構成を試した。
AI要点
- VRAM 16GBのRTX 4070 Ti SUPERでQwen 3.8 27Bモデルをローカル実行する際のVRAM使用量と速度を検証した。
- コンテキスト長73KでKVキャッシュを量子化しない場合、VRAM使用量が15.7GBに達し、生成速度は13.2 tokens/secに低下した。
- KVキャッシュをQ4_1に量子化することでVRAM使用量が14.3GBに減少し、生成速度は30.9 tokens/secまで向上した。
- Speculative Decodingも試用し、速度向上の可能性を確認したが、KVキャッシュ量子化の効果が顕著であった。
- 今回の検証結果から、RTX 5060 Tiの追加購入は現時点では不要と判断した。
なぜ重要か
VRAM 16GB環境での大規模LLM実行における、コンテキスト長、KVキャッシュ量子化、Speculative Decodingの影響を定量的に評価し、ローカルLLMのパフォーマンスチューニングにおける実践的な知見を提供する。