LLM推論初出 7/20 23:48
Qwen3.6-35B-A3B、65Kトークンデコードで1つのRTX 5090上で543 tok/sのシングルリクエスト
543 tok/s single-request Qwen3.6-35B-A3B on one RTX 5090 over a 65K-token decode
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/20
AI要約
NInferという新しいC++/CUDA推論エンジンが公開された。Qwen3.6-35B-A3Bモデルを単一のRTX 5090 GPUで65Kトークンのコンテキスト長で543トークン/秒という高速な推論速度を実現している。
AI要点
- NInferという新しいC++/CUDA推論エンジンが公開された。
- このエンジンを使用することで、Qwen3.6-35B-A3Bモデルは単一RTX 5090 GPUで65Kトークン長を543トークン/秒で処理できる。
- これは、大規模モデルの長文コンテキスト処理における推論速度の大幅な向上を示すものである。
なぜ重要か
NInferエンジンは、限られたハードウェアリソースでも大規模言語モデルの長文コンテキスト処理を高速化できるため、より多くの開発者や企業が高度なAI機能を低コストで利用できるようになり、応用範囲が拡大する。