LLM推論初出 6/6 19:05
Qwen 3.6 27B MTP - spec-typeとspec-draft-n-maxの追加がtpsを低下させ、GPU使用率を削減
Qwen 3.6 27B MTP - Adding spec-type and spec-draft-n-max is dropping tps and reducing GPU utilization
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/6
AI要約
Qwen 3.6 27B MTPモデルにおいて、spec-typeやspec-draft-n-maxの追加がスループット(tps)の低下とGPU使用率の減少を引き起こすという問題について報告している。パフォーマンスチューニングに関する具体的な事例である。