LLM推論初出 6/8 06:09
llama-serverルーター:1つのGPUにピン留めされたモデルでも、すべてのカードでCUDAコンテキストを取得するため、他のカードが満杯になるとOOMになります。フラグを見逃しているか、これはただそういうものですか?
llama-server router: a model pinned to one GPU still grabs a CUDA context on every card, so it OOMs when my others are full. Am I missing a flag or is this just how it is?
https://www.reddit.com/r/LocalLLaMA/.rss2026/6/8
AI要約
llama-serverのルーターモードにおけるGPUメモリ管理の問題について議論。複数のGPUを搭載した環境で、モデルによっては意図せずCUDAコンテキストがロードされ、メモリ不足(OOM)を引き起こす可能性があるという報告。