エージェント初出 9/10 05:48
NVIDIA GB300 NVL72でQwen3.8-Flash-NextをAgentic Codingのために実験する
Experiment with Qwen3.8-Flash-Next on NVIDIA GB300 NVL72 for Agentic Coding
https://developer.nvidia.com/blog/feed/2026/9/10
AI要約
AlibabaのQwen3.8-Flash-NextモデルをNVIDIA GB300 NVL72でエージェントコーディング用に実験する内容。Qwen4アーキテクチャのプレビューとして、開発者がモデルを評価・実験できる機会を提供しています。
AI要点
- Qwen3.8-Flash-Nextは、125Bパラメータ(トークンあたり6Bアクティブ)のマルチモーダルMoEモデルで、ネイティブ262,144トークンコンテキストウィンドウを持つ。
- Gated DeltaNetとQwen Sparse Attentionを組み合わせ、長コンテキスト処理を効率化し、1Mトークンワークロードで最大7.6倍のプリフィル速度向上を達成する。
- NVIDIA GB300 NVL72上で、GPUあたり16,000トークン/秒超、ユーザーあたり200トークン/秒超のパフォーマンスを提供する。
- SGLang、vLLM、TokenSpeedなどの推論エンジンによるデプロイメントや、NVIDIA NeMo AutoModelによるファインチューニングがサポートされる。
なぜ重要か
Qwen3.8-Flash-NextモデルとNVIDIA GB300 NVL72の組み合わせは、長大なコンテキストを扱うエージェント型コーディングアプリケーションに、前例のないパフォーマンスと効率性をもたらす。