大模型想在普通笔记本上本地运行,常见难题不是算不动,而是装不下。Reddit 用户 alfredr 展示的新推理引擎 Cherenkov,声称让 Qwen3.8–Flash-Next 在一台 32GB、无风扇的 M4 MacBook Air 上,以约 21GB 内存分配运行,速度达到每秒 8 至 22 个 token——token 是模型生成文字时处理的基本单位。
关键是少搬一些“暂时用不到的零件”。Qwen3.8–Flash-Next 属于 MoE(混合专家)模型,每一步通常只调用少数专家模块。Cherenkov 不把全部专家权重塞进 Apple Silicon 的统一内存——CPU 和 GPU 共用的内存池——而只保留容量受控的工作集。它提前一层预测接下来需要哪些专家,并从 SSD 读取;若来不及读入完整专家,还可临时改用更小的 Q3/Q2 量化版本,也就是用更低精度存储权重。
这把本地推理的硬件边界推进到轻薄笔记本,但“纪录”及速度均来自作者自述,供稿未提供独立复现或精度对比。