Colibrì 讓一般電腦跑超大 MoE

2026/09/09(三) 11:10・精選・原始出處

Colibrì 是一套用純 C 打造的開源推論引擎,目標是讓一般電腦也能執行數千億、甚至兆級參數的 Mixture-of-Experts(MoE)模型。它不把全部權重塞進 RAM 或 VRAM,而是把 VRAM、RAM 與 NVMe 視為同一套分層記憶體:常用權重留在快取,其他 expert 需要時才從磁碟讀取。以 744B 的 GLM-5.2 為例,每個 token 實際只啟用約 40B 參數,Colibrì 便利用這種稀疏性完成本機聊天、Web UI,以及 OpenAI/Anthropic 相容 API。

現實應用

這東西最適合 AI 系統研究者、Homelab 玩家、模型工程師,以及需要資料留在內網的團隊。你可以拿它研究 expert routing、量化、快取與 CPU/GPU/SSD 協作,也能把既有支援 OpenAI API 的工具接到本機模型。它不要求 GPU,但快速 NVMe 幾乎是必要條件;一般硬碟雖然能跑,互動速度可能慢到不實用。

期望評估

**低標期望:**我認為至少能把以前因記憶體容量而完全載不動的 MoE 模型「正確跑起來」,適合離線測試與系統研究。官方資料中的 25GB 主機冷啟動案例約為 0.05~0.1 token/s,不能把「能跑」誤解成「跑得順」。

**高標期望:**我猜在大容量 RAM、多顆高速 NVMe 或多 GPU 全駐留環境下,它有機會成為便宜且可控的私有推論節點。專案公布的測試中,128GB CPU 主機暖快取約 1.8 token/s,六張 RTX 5090 全駐留則約 5.8~6.8 token/s;這些仍是專案方數據,實際表現要看模型、快取命中率與硬體配置。

商業策略分析

我認為 Colibrì 真正有價值的地方,不是立刻取代雲端 API,而是證明「模型容量」不一定要與昂貴 VRAM 綁死。它會影響本機 AI 軟體、工作站、NVMe 儲存與私有部署市場,也替硬體較弱的小團隊增加實驗大型模型的機會。

短期來看,速度、耗電、372GB 起跳的模型空間,以及缺乏 SLA,都讓它比較像研究平台而非正式服務。值得跟進,但公司若要上線,應先用自己的工作負載測量延遲、品質與每 token 成本,別只看參數規模。

實作細節

可從 Releases 下載 Linux、macOS 或 Windows 預編譯版本;要自行編譯則需具備 OpenMP 的 gcc/clang:

git clone https://github.com/JustVugg/colibri.git
cd colibri/c
./setup.sh

接著下載官方文件建議的 GLM-5.2 gs64 int4 容器,約需 372GB,再執行:

COLI_MODEL=/nvme/glm52_i4 ./coli chat

./coli serve 可啟動相容 API,./coli web 則提供瀏覽器介面。已知限制是磁碟速度直接左右生成速度;官方也警告舊版 per-row int4 容器品質約低 9 個百分點,並可能出現思考迴圈或無法停止,應使用 gs64 與 int8 MTP head。

延伸連結