LLM推論初出 8/14 01:12
124Bモデル、DGX Spark 1台で単一応答で15,128トークンを生成、デコード速度は全体で35.62 → 35.68 tok/s
A 124B emitted 15,128 tokens in a single response on one DGX Spark, decode went 35.62 → 35.68 tok/s across the whole thing
https://www.reddit.com/r/LocalLLaMA/.rss2026/8/14
AI要約
124Bパラメータのモデルが、単一のDGX Spark上で15,128トークンを生成し、デコード速度も示されたという報告です。大規模モデルの推論性能に関する具体的なデータを提供しています。
AI要点
- 124Bパラメータを持つ大規模モデルの性能に関する報告があった。
- 単一のDGX Spark上で15,128トークンを生成できた。
- デコード速度は35.68トークン/秒を記録した(以前は35.62トークン/秒)。
- 大規模モデルの推論における具体的な処理能力と速度が示された。
- ハードウェアリソースに対するモデルのパフォーマンスデータを提供する。
なぜ重要か
124Bという巨大なパラメータを持つモデルが、単一の高性能GPU上で長大なトークン列を効率的に生成・デコードできることを示したこの報告は、大規模言語モデルの推論性能の限界を押し広げ、より高度なAIアプリケーションの実用化を加速させる。