把一个92B参数的大模型搬到本地,像是把整支专家团队请进家里,但每次只叫少数人干活。openPangu-2.0-Flash采用MoE(混合专家)架构,总参数约92B,每步仅激活约6B;如今 ik_llama.cpp 的适配PR和GGUF量化模型,已让本地玩家开始实际测试它。更值得看的是,它把几条降低长文本推理成本的路线放在一起:MLA潜变量缓存压缩注意力的“草稿纸”,稀疏注意力减少需要关注的历史位置,多头MTP则尝试一次预测多个后续Token。
不过,这次适配也暴露了架构落地与纸面设计之间的距离。PR讨论显示,当前实现只有“内存稀疏”,还没有“计算稀疏”:它虽用遮罩限制哪些历史位置能影响结果,底层计算仍会扫过全部缓存。测试者因此观察到性能随上下文长度明显下降,32K上下文、2K微批次时计算缓冲区约25.9 GiB。贡献者自测称,f16潜变量缓存可让CPU预填充提速约24%,卸载又带来约4.4倍提升,并完成32K“针藏文本”检索;但解码仍受约49 GiB常驻内存的专家参数拖累。换句话说,GGUF适配已经打开试玩入口,真正吃到稀疏架构的速度红利还要等推理引擎继续补课。