LLM推論初出 7/18 02:05
GPT-OSS-120B、Qwen 30B、Gemma 26BをAndroidフォンで1~5 tok/sで実行:+60GBモデル、11GB RAM、CPUのみ
GPT-OSS-120B, Qwen 30B and Gemma 26B on an Android phone at 1-5 tok/s: +60GB model, 11GB of RAM, CPU only
https://www.reddit.com/r/LocalLLaMA/.rss2026/7/18
AI要約
GPT-OSS-120B、Qwen 30B、Gemma 26Bといった複数のLLMが、Androidスマートフォン上でCPUのみで1~5トークン/秒の速度で動作する事例です。モバイルデバイスでのLLM実行の可能性を示しています。
AI要点
- GPT-OSS-120B、Qwen 30B、Gemma 26Bといった複数のLLMがAndroidフォンで動作した。
- CPUのみを使用し、1~5トークン/秒の実行速度を達成した。
- 60GBのモデルサイズと11GBのRAMというリソース制約下での実行事例が報告されている。
なぜ重要か
モバイルデバイス上での大規模言語モデルの実行可能性を示すものであり、オフライン環境やエッジコンピューティングでのAI活用を促進するため、重要です。