GitHub近期最火的大模型开源项目之一,是一只"小蜂鸟"Colibrì——纯C实现、零引擎依赖的分层推理框架。它做了一件反直觉的事:让25GB内存的笔记本跑起744B参数的GLM-5.2,不需要GPU;32GB内存可挑战2.8T参数的Kimi K3(需约1.6TB硬盘空间)。
核心思路:SSD当显存
诀窍在MoE(混合专家)架构的"稀疏性"。GLM-5.2总参数744B,但每个Token实际只激活约40B——注意力、Embedding、共享专家等每次都要用的Dense部分约17B参数,int4量化后仅约9.9GB,常驻内存即可;真正占地方的19456个路由专家(int4后约370GB),全部放进NVMe SSD,等Router点名谁、再临时把谁捞进内存计算。作者JustVugg把它类比为"针对模型权重的JIT":不预载整个程序,只处理真正在运行的热点路径。
三层存储 + 预取
为避免"每生成一个Token都读一次盘",Colibrì把VRAM、RAM与NVMe组织成层级缓存:最近用过的专家留在RAM,高频"常客"获得更高缓存优先级;甚至利用相邻层专家路由的相关性提前一层预测并后台预取,让计算与SSD I/O重叠进行;有双SSD还能放两份模型副本并行分摊带宽。关键原则是:专家放哪只决定速度、不改变模型——不因内存小就偷偷少算专家或改路由。
📊 实测速度阶梯
· 12核CPU + 25GB RAM(冷缓存):可运行,速度感人
· 128GB RAM 纯CPU桌面:约 1.8 token/s
· 6×RTX 5090(专家全常驻):5.8~6.8 token/s
· 已覆盖9个模型家族(GLM-5.2、Kimi K3、Qwen3.8-Flash-Next等)
配套的Web Dashboard甚至把GLM-5.2全部19456个专家可视化:谁刚被Router点名、住在哪层存储、调用热度几何,一目了然。
为什么重要
Colibrì的走红不是猎奇。它证明在MoE成为主流架构的今天,"模型必须整体塞进显存"的旧范式正在松动:容量最大最慢的NVMe兜底、RAM缓存常用专家、VRAM接住最热部分——分层调度让前沿大模型的本地化门槛从机房级降到桌面级。对数据敏感的政企场景,"笔记本跑700B模型"不只是极客玩具,更是私有化推理成本曲线下移的信号。九天技术在天行大模型上推行的轻量化部署与国产算力适配,正是这条路线在产业侧的延伸。
(事件信息综合自公开报道)