LLM推論初出 7/28 04:17
Niferは驚異的。Qwen 3.6 35Bで700t/s(思考なし)。RTX5090専用設計。フル250kコンテキストも対応
Nifer is insane. 700t/s with Qwen 3.6 35B (no thinking). Purpose build for RTX5090. Full 250k context too.
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/28
AI要約
Niferというシステムが、Qwen 3.6 35BモデルをRTX 5090で700兆トークン/秒という高速で実行できると報告されています。このシステムは、250kのコンテキスト長をフルに活用できるように最適化されています。
AI要点
- NiferというシステムがQwen 3.6 35Bモデルを高速処理すると報告された。
- RTX 5090 GPUを使用し、700兆トークン/秒の処理速度を達成したとされる。
- 思考プロセスを含まない場合の速度であり、最適化された設計が特徴である。
- 250kトークンのコンテキスト長をフルに活用できる。
- RTX5090専用設計であることが示唆されている。
なぜ重要か
大規模言語モデルの処理速度とコンテキスト長を大幅に向上させる技術は、より複雑なタスクや長文の理解・生成を可能にし、AIの応用範囲を拡大するため。