LLM推論初出 8/21 05:47
P100 x2で Qwen3.8:27b を Ollamaで動かすとどうなるか
https://zenn.dev/topics/ai/feed2026/8/21
AI要約
P100 GPU x2環境でOllamaを使用してQwen3.8:27bモデルを動かす方法を解説。Ollamaのインストール、モデルのプル、CUDA_VISIBLE_DEVICESを指定したモデル起動コマンドが示されています。複数GPUでのLLM実行環境構築の参考になります。
AI要点
- OllamaでQwen3.8:27bモデルをP100 GPU 2枚で実行する際、CUDA_VISIBLE_DEVICESの設定が意図通りに機能しない場合がある。
- P100 GPUに余裕があるにも関わらず、GTX 1060 GPUへモデルレイヤーが漏れる現象が観測された。
- OllamaのrunコマンドではGPUのレイヤー数(--ngl)を指定できず、Modelfileからの指定が必要となる。
- モデルのダウンロード(pull)と同時にrunコマンドを実行すると、CPU RAMを占有しハングする可能性がある。
- AIモデルのGPUへの割り当ては、環境設定によっては予期せぬ挙動を示すことがあると示唆されている。
なぜ重要か
AIモデルのGPUへの効率的な割り当ては、推論速度とコストに直結するため、Ollamaのようなツールの挙動理解と設定最適化が重要である。