工具 / colibrì

colibrì

  • inference
  • cli

纯 C 推理引擎,25 GB 消费机上跑 744B MoE,专家从磁盘流式加载

colibrì 是一个纯 C 推理引擎,在约 25 GB RAM 的消费级机器上运行 GLM-5.2(744B 参数 MoE)模型。核心理念:模型的密集部分(~17B 参数)以 int4 驻留在 RAM(~9.9 GB),而 21,504 个路由专家留在磁盘上(~370 GB),按需流式加载,配合逐层 LRU 缓存和 OS 页缓存。引擎本身是单个 C 文件(c/glm.c,约 2,400 行),零运行时依赖,无需 GPU(可选 CUDA 后端用于常驻张量)。支持 MTP 推测解码(作者自测 2.2–2.8 token/forward)、MLA 注意力压缩 KV-cache(57× 更小)、DSA 稀疏注意力、语法引导推测解码、会话 KV 持久化及学习缓存(越用越快)。提供 CLI 聊天、OpenAI 兼容 HTTP API 和社区维护的 Web UI。开发机(WSL2,12 核,25 GB RAM)上冷启动约 0.05–0.1 tok/s;社区实测 Apple M5 Max(Metal 后端)上达 1.83 tok/s。

社区实测

Colibrì 是一个概念验证性质的架构验证,能在 25GB RAM 上跑 744B 参数 MoE 模型令人印象深刻,但当前推理速度仅 0.05–0.1 t/s,完全无法用于实际对话。

  • 在仅约 25GB RAM 的消费级硬件上加载并运行 744B 参数 MoE 模型
  • 证明快速内存容量不必成为可运行模型大小的绝对上限,未来可通过 VRAM/RAM/SSD 分层分发权重
  • 利用 MoE 架构的特性,每 token 仅激活约 40B 参数,按需从 SSD 流式加载路由专家
  • 当前推理速度仅 0.05–0.1 tokens/s,无法用于实际对话,一次提问可能耗时数小时
  • 仍处于实验性概念验证阶段,远非生产可用
  • 频繁的 SSD 读写对存储 I/O 和内存带宽造成巨大压力,架构上天然受限于此

截至 2026-07-22

cd c && ./setup.sh

← 返回工具库