LLM推論初出 9/6 17:42
Qwen3.8-Flash-Next-oQ4e-mtp:M4 Max で 45 tok/s、M2 Ultra で 25 tok/s(ローカル推論)— llm-bench.io
Qwen3.8-Flash-Next-oQ4e-mtp: 45 tok/s on M4 Max, 25 tok/s on M2 Ultra for local inference — llm-bench.io
https://www.reddit.com/r/LocalLLaMA/.rss2026/9/6
AI要約
Qwen3.8-Flash-Next-oQ4e-mtpモデルのローカル推論性能について、M4 Maxで45 tok/s、M2 Ultraで25 tok/sというベンチマーク結果を報告。LLMの推論速度に関するハードウェア性能比較データを提供。
AI要点
- Qwen3.8-Flash-Next-oQ4e-mtpモデルのローカル推論性能に関するベンチマーク結果が報告されている。
- Apple M4 Max環境で45 tok/s、M2 Ultra環境で25 tok/sの推論速度が記録されたことが示されている。
- llm-bench.ioのデータに基づき、異なるハードウェアでのLLM推論速度を比較している。
なぜ重要か
主要なハードウェアプラットフォームにおける最新LLMの具体的な推論速度データを提供することは、ユーザーが自身の環境に最適なモデルとハードウェア構成を選択する際の貴重な参考情報となるためです。