LLM推論2本の記事が同じ件を報じた初出 5/28 20:12
Qwen3.6-35B-A3B-APEX / 128K ctx RTX 3060 12GB 上で — 72k ctx記入で37 t/s生成、PPL 3.25、17GBモデルオフロード
Qwen3.6-35B-A3B-APEX / 128K ctx on RTX 3060 12GB — 37 t/s gen with 72k ctx filled, PPL 3.25, offloading 17GB model
https://www.reddit.com/r/LocalLLaMA/.rss2026/5/28
AI要約
Qwen3.6-35B-A3BモデルをRTX 3060 GPUで128Kのコンテキスト長で高速に実行する手法に関する投稿。LLMの長文対応とハードウェア最適化に関する実践的な知見であり、重要度9と評価します。