让 AI 读一份很长的材料,难点不只是“记住前文”,还在于文本越长,计算和内存负担越重。GigaChat 3.5 Reasoning 给出的思路是:模型可以很大,但每一步不必全员上场。它共有 432B(4320亿)参数,处理每个 token——模型读写文本的基本单位——时只激活 28B。这里的激活参数,指当下真正参与计算的部分,比总参数更接近单步推理成本。
它还采用 Gated DeltaNet——一种用压缩状态持续吸收前文信息的序列结构,目标是减轻长上下文带来的计算和内存压力。团队先分别训练代码、数学和通用等领域专家,再通过 on-policy distillation 合成一个模型:学生从自己实际会走到的生成轨迹出发,学习教师给出的更好行为。发布者自述,其评测表现接近 DeepSeek V4 Flash Preview,同时推理轨迹少用 37% 的 token;不过材料未披露具体评测集与分项结果,现阶段更值得关注的是这套“高总容量、低激活量、压缩长上下文”的组合路线。模型权重已以 MIT 许可发布在 Hugging Face。