把 TB 级大模型塞进 8GB 级内存电脑,有点像不把整座仓库搬进屋,而是用到哪箱就临时取哪箱。社区开发者 FareedKhan557 为 Kimi K3 写了一个 C99 推理引擎——C99 是一版通用的 C 语言标准。它不让全部权重常驻内存,而是利用 MoE(混合专家模型每次只调用少数“专家”模块)的特点,从 NVMe 固态硬盘按需读取。
作者称,K3 的 1.56 TB 检查点中,93% 是可路由专家;每生成一个 token,只启用 896 个专家中的 16 个。引擎直接读取压缩成 4-bit 的专家权重并计算,无需先完整解压;其测试机器峰值内存为 8.24 GB,但速度约为 33 秒一个 token。即使把内存提高到约 128 GB,也只有约 20 秒一个 token。
这不是实用部署方案:作者明确表示,它还需要约 1.7 TB 空闲磁盘,也没有 GPU、BLAS 或框架加速。它的意义更像一次下限测试:权重流式读取确实能把容量门槛压得很低,但代价会转移到硬盘吞吐和等待时间上。