メインコンテンツへスキップ
Cernoval
トップ
Topic
Qwen3.8-Flash-Next
モデル
関連トピック
同じ記事で一緒に扱われたトピックです。
ExLlamaV3
判明している事実
GPUあたりのトークン生成速度:
80-120 tokens/s
プレフィル速度:
12k tokens/s
関連レポート・記事
Qwen3.8-Flash-Next、4台のR9700でローカルAIパワーハウス化!最適化されたvLLMで単一リクエスト120 t/s TG、12k t/s PP
★9
トピック一覧
トップに戻る