Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.070 — 2026-09-12
NEWS 约 1 分钟

28B激活的长上下文新模型

432B总参数、每次仅激活28B,GigaChat用压缩状态探索更省算力的长文本推理。

IMAGE — r/LocalLLaMA 日榜

让 AI 读一份很长的材料,难点不只是“记住前文”,还在于文本越长,计算和内存负担越重。GigaChat 3.5 Reasoning 给出的思路是:模型可以很大,但每一步不必全员上场。它共有 432B(4320亿)参数,处理每个 token——模型读写文本的基本单位——时只激活 28B。这里的激活参数,指当下真正参与计算的部分,比总参数更接近单步推理成本。

它还采用 Gated DeltaNet——一种用压缩状态持续吸收前文信息的序列结构,目标是减轻长上下文带来的计算和内存压力。团队先分别训练代码、数学和通用等领域专家,再通过 on-policy distillation 合成一个模型:学生从自己实际会走到的生成轨迹出发,学习教师给出的更好行为。发布者自述,其评测表现接近 DeepSeek V4 Flash Preview,同时推理轨迹少用 37% 的 token;不过材料未披露具体评测集与分项结果,现阶段更值得关注的是这套“高总容量、低激活量、压缩长上下文”的组合路线。模型权重已以 MIT 许可发布在 Hugging Face。


供稿材料 SOURCES — 1
01
GigaChat-3.5-Reasoning r/LocalLLaMA 日榜 · NEWS
原文 ↗

← 返回 2026-09-12 · 开源板块