ハードウェア初出 8/19 09:04
744BのGLM-5.2を25GBのRAMで動かすcolibri、エキスパートをディスクから流す
https://zenn.dev/topics/ai/feed2026/8/19
AI要約
GPUなし・25GB RAMのノートPCで744BのGLM-5.2モデルを動作させるColibriエンジンを紹介。速度は遅いものの、大規模モデルを低リソース環境で動かすためのメモリ効率的なアプローチと、その達成までの過程に焦点を当てる。
AI要点
- 744Bパラメータの巨大LLM「GLM-5.2」を25GBのRAMで動かす「colibri」エンジンが開発された。
- MoEアーキテクチャの特性を利用し、使用頻度の低いエキスパートをディスクに配置してメモリ使用量を削減している。
- これにより、GPUなしのノートPCでも大規模モデルの実行が可能になったが、速度は0.1トークン/秒程度に留まる。
- OSのデマンドページングの仕組みをモデルの重み管理に応用し、ストレージをメモリの代替として活用している。
なぜ重要か
大規模言語モデルを低リソース環境で実行可能にする新たなメモリ管理手法を提示し、AIアクセシビリティを大幅に向上させる可能性を示すとともに、モデル実行の前提条件を再定義する点で重要です。