Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.016 — 2026-07-20
NEWS 约 1 分钟

openPangu Flash亮出92B稀疏架构

92B总参数每步仅激活6B,但本地适配仍未兑现稀疏计算红利

IMAGE — r/LocalLLaMA 日榜

把一个92B参数的大模型搬到本地,像是把整支专家团队请进家里,但每次只叫少数人干活。openPangu-2.0-Flash采用MoE(混合专家)架构,总参数约92B,每步仅激活约6B;如今 ik_llama.cpp 的适配PR和GGUF量化模型,已让本地玩家开始实际测试它。更值得看的是,它把几条降低长文本推理成本的路线放在一起:MLA潜变量缓存压缩注意力的“草稿纸”,稀疏注意力减少需要关注的历史位置,多头MTP则尝试一次预测多个后续Token。

不过,这次适配也暴露了架构落地与纸面设计之间的距离。PR讨论显示,当前实现只有“内存稀疏”,还没有“计算稀疏”:它虽用遮罩限制哪些历史位置能影响结果,底层计算仍会扫过全部缓存。测试者因此观察到性能随上下文长度明显下降,32K上下文、2K微批次时计算缓冲区约25.9 GiB。贡献者自测称,f16潜变量缓存可让CPU预填充提速约24%,卸载又带来约4.4倍提升,并完成32K“针藏文本”检索;但解码仍受约49 GiB常驻内存的专家参数拖累。换句话说,GGUF适配已经打开试玩入口,真正吃到稀疏架构的速度红利还要等推理引擎继续补课。


供稿材料 SOURCES — 1

← 返回 2026-07-20 · 开源板块