如果把大模型比作一支施工队,芯片就是工人,软件工具则是图纸、吊车和调度系统。只换一批工人,却没有配套工具,工程不会自动变快。DeepSeek V4 值得关注,正因为它不只是一款新模型:模型结构、昇腾芯片和底层软件正在被放进同一套工程里共同调整。
这不等于 DeepSeek 已经摆脱 Nvidia,也不等于昇腾已经追平 CUDA。CUDA——Nvidia 围绕 GPU 积累的编程平台、计算库和开发工具——真正难替代的地方,正是这套长期磨合的软件生态。眼下更准确的说法是:昇腾第一次被推到了新模型发布、推理部署和部分训练工作的前线。
从“发布后移植”变成“首日可用”
据新浪刊载的报道,DeepSeek 在 4 月 24 日发布并开源 V4 系列预览版,华为同期宣布昇腾超节点全系列支持 V4。这里的“超节点”,可以理解为把许多芯片用高速连接组织成一台更大的计算机。V4 发布首日,Nvidia 的 CUDA 和华为的 CANN 都提供了完整支持;CANN 是昇腾对应的底层软件栈。昇腾 A3、昇腾 950 等平台也已适配 V4 推理。
这和过去“模型先在 Nvidia 平台完成,再移植到国产芯片”不同。报道还称,V4 同时在 GPU 和昇腾 NPU 上验证了细粒度专家并行方案。专家并行,是把混合专家模型中的不同子网络分给多颗芯片计算。模型团队因此必须提前考虑通信方式,而不是等模型定型后再补兼容。
V4 本身也在降低硬件压力。据同一报道,在 100 万 Token——模型处理文字时使用的基本单位——上下文下,V4 的推理计算量是 V3.2 的 27%,KV cache 则是后者的 10%。KV cache 是模型阅读长文时留下的“草稿”,可以避免反复重算,但会占用大量内存。两项开销下降,都有利于在更多硬件上部署。
另一个配合点是 FP4,即用较低精度保存数字的四位浮点格式。V4 的混合专家层用 FP4 存储专家权重,昇腾 950 新增了相应硬件支持。这就是“芯模协同”:模型结构、算子和芯片软件一起调整,让模型更贴合特定硬件,而不是单纯把同一份程序搬过去。
正式版先把“小模型”推到前台
7 月 31 日,DeepSeek-V4-Flash 正式版 API 上线公测,App 和网页端暂未开放。据集微网转述的官方更新日志,这次模型结构和尺寸没有变化,只重新进行了后训练。后训练,是在基础预训练结束后,再用指令数据、偏好反馈或任务强化调整模型,常用于改善推理、工具使用和 Agent 表现。
V4-Flash 总参数为 2840 亿,但每次计算只调用其中 130 亿。后者叫“激活参数”,比总参数更直接影响一次推理的计算成本。V4-Pro 则有 1.6 万亿总参数和 490 亿激活参数。
官方公布的 V4-Flash 成绩包括 Terminal Bench 2.1 的 82.7、NL2Repo 的 54.2、Cybergym 的 76.7,以及 Toolathlon verified 的 70.3。这些测试分别从终端操作、代码仓库生成、网络安全任务和工具使用等角度观察 Agent——能规划步骤、调用工具并执行任务的模型系统——是否好用。
不过,这些数字只能说明 Flash 在相应测试中的表现,不能直接证明它已经超过 Pro。材料中的 Pro 成绩来自 Terminal Bench 2.0,与 Flash 使用的 2.1 不是同一版测试集。更稳妥的观察是:DeepSeek 正尝试用后训练,把较少激活参数的模型推向 Agent 场景。
真正的战场在模型下面
本刊此前拆解过 DeepSeek 为昇腾开放的编译、计算和通信组件。9 月 30 日,DeepSeek 与华为围绕昇腾平台开源相关底层编程基础设施,至少涉及计算库、分布式通信库和 TileLang 相关项目。
计算库决定单颗芯片怎样执行注意力、量化和专家路由等操作;通信库则决定多颗芯片怎样交换数据。对于混合专家模型,后者尤其关键:不同“专家”分散在不同芯片上,如果通信拥堵,再多芯片也难形成有效算力。据凤凰科技报道,双方还在推进由 128 颗昇腾 950 组成的 Supernode 方案,但这一细节目前只有单一信源支持。
这条基础设施线比一次跑分更重要。模型适配只能证明“可以运行”;工具链、通信和超节点共同成熟,才可能支撑稳定训练、大规模推理和开发者迁移。与此同时,V4-Pro 当前服务吞吐量据报道仍“十分有限”,降价还要等待昇腾 950 超节点批量上市。软件适配、芯片供给和实际服务能力并不是一回事。
昇腾进了训练场,但还没接管全场
据 Reuters 此前报道,V4 发布前,DeepSeek 没有按行业惯例提前把模型交给 Nvidia 和 AMD 优化,却让华为等中国厂商获得数周提前量。随后出现的昇腾首日支持,使这段提前量更像一次生态优先级调整,而不只是普通兼容工作。
训练端的证据仍弱于推理端。华为称 V4 的部分训练过程使用了昇腾芯片;另据 Tom's Hardware 报道,华为参与的团队曾宣称使用至少 1000 颗 Ascend 910C 完成 V4-Pro 的全参数后训练。但发布方没有提供耗时、效率或对照数据,DeepSeek也未置评。后训练进入昇腾,不等于最昂贵的基础预训练已经主要由昇腾完成。
因此,“把昇腾推上主战场”更适合描述角色变化:它从发布后的适配对象,变成 V4 架构、首日推理、部分训练和底层工具建设共同考虑的平台。至于这套栈能否真正绕开 CUDA,还要看它能否长期稳定地完成大规模训练,并形成足够成熟的软件和开发者生态。
局限与未知
- 目前没有明确证据证明 V4 的前沿预训练主要依靠昇腾,更不能写成“完全由昇腾训练”。
- 多数性能、规模和发布时间信息来自单篇材料或官方披露,尚缺独立交叉验证。
- 首日适配与开源组件证明了可用性的推进,但不能自动推出其性能、稳定性、产能和生态已经达到 CUDA 水平。