ハードウェア初出 6/20 08:30
$1800(GPUコスト)でP2P実行、Qwen/Qwen3.6-27b-FP8を262KコンテキストとBF16 KVキャッシュで55 tok/sで実行
$1800 (in GPU cost running with P2P running Qwen/Qwen3.6-27b-FP8 with 262K context and BF16 KV cache at 55 tok/s
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/20
AI要約
GPUコスト1800ドルで、Qwen/Qwen3.6-27b-FP8モデルを262Kコンテキスト長、BF16 KVキャッシュで55トークン/秒で実行できたという報告。推論専用のシングルユーザー用途に焦点を当てている。
AI要点
- GPUコスト1800ドルでQwen/Qwen3.6-27b-FP8モデルを262Kコンテキスト長で実行。
- BF16 KVキャッシュを使用し、55トークン/秒の推論速度を達成した。
- 推論専用のシングルユーザー用途に最適化された実行環境について報告。
なぜ重要か
低コストで大規模コンテキスト長かつ高速な推論を実現する手法は、個人の研究者や開発者が最先端のLLMをより身近に利用できる機会を広げるため、重要です。