把 35B 大模型装进只有 12GB 内存的手机,好比让一支大团队挤进小办公室:办法不是让所有人同时进场,而是需要谁就临时叫谁。Reddit 用户 Aromatic_Ad_7557 借助 BigMoeOnEdge,在改装的小米 12 Pro“Zeus”上成功运行 Qwen 3.6 35B MoE。MoE 是“混合专家”模型,每次生成只调用部分专家子网络,因此 35B 总参数不必始终全部驻留内存。
原帖最有信息量的数字,是专家缓存常驻约 2998.5 MiB,命中率 70.8%;每生成一个 token(模型处理文字的基本单位),仍需从闪存读取约 136.35 MiB 数据。最终实测生成速度为每秒 2.428 token,模型加载耗时 14.421 秒。换句话说,它用频繁搬运专家权重换来了更低的内存占用,但存储读写也成了明显瓶颈。
受内存限制,目前上下文窗口——模型一次能记住的输入与对话范围——最多为 8192 token;图像转文字能力尚未测试。以上结果来自作者自述及其实时录像,尚无独立核查,但它清楚展示了按需加载正在把端侧大模型的边界往前推。