让 AI 读一摞超长材料,难点不只是“读懂”,还要看到最后仍记得开头。openPangu 2.0 Pro 把上下文窗口——模型一次处理的信息范围——扩到 512K,并开放了一款在昇腾(华为的 AI 计算硬件与软件栈)上训练的超大模型,值得关注的是它同时押注了大规模、长文本和非 CUDA 训练生态。
据 Reddit 用户 langsfang 发布的信息,这是一款 505B-A18B 的 MoE(混合专家)模型:约有 5050 亿总参数,但处理每个 Token——文字被模型切分后的基本单位——时只激活约 180 亿参数。说白了,它像一间规模很大的专家办公室,每次只叫少数合适的人参与,以折中模型容量和计算成本。其预训练数据量为 34T Token;后训练还使用了 SFT(用示范答案进行监督微调)、多类专家 RL(通过奖励信号调整行为)和蒸馏。现有材料未提供评测成绩或实际推理成本,因此目前更明确的看点是开放权重、512K 上下文与昇腾训练路线,而非已经得到独立验证的能力提升。