Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.081 — 2026-09-23
NEWS 6 信源 约 6 分钟

阿里押注20GW算力帝国

阿里同时抛出新芯片、20GW数据中心与万亿参数模型,要把AI的“大脑、发电机和电网”连成一体。

IMAGE — Bloomberg Technology (via Google News)
阿里押注20GW算力帝国

你让AI连续工作一天,它不只需要一个聪明模型,还需要芯片不停计算、数据中心稳定供电、云平台把算力送到用户手里。任何一环跟不上,AI能力就难以大规模供应。9月22日,阿里把这三环放在同一张路线图上:训练更大的千问模型,推出真武V900芯片,并计划到2032年让阿里云运营的全球数据中心规模超过20GW。

这不是三项互不相干的发布。阿里同时经营千问模型、平头哥芯片和阿里云,想做的是一套纵向技术栈:自己设计“大脑”,自己造“发电机”,再通过自己的“电网”对外供给算力。本刊9月21日关注的是中国模型如何凭低价和开放生态进入全球企业工作流;这一次,问题转向供给侧:如此庞大的模型和使用量,靠什么托住。

需要先说明,20GW规划和新芯片发布获得了多个媒体信源印证,但多数详细性能数据、自我改进实验和开源生态数字仍来自阿里披露,尚缺少独立测试。

20GW不是现状,而是一张远期施工图

阿里提出,到2032年,阿里云运营的全球数据中心规模要超过20GW。GW即十亿瓦,在数据中心语境里通常表示供电或设施容量。它不是芯片跑得多快的指标,而是衡量一整套算力基础设施能扩到多大的尺度。

这里最容易产生的误解,是把20GW当成阿里现在已经拥有的容量。它实际上是2032年的目标。Bloomberg以“新AI芯片驱动20GW数据中心”为题报道了这项规划;阿里则称,客户的中长期AI需求已经超过供给能力,而数据中心相关供应链的全球性紧缺正在限制扩张速度。

阿里CEO吴泳铭把云比作电网:芯片生产Token——模型处理文字等信息时使用的基本单位,云再把这些Token送到需要它们的设备和应用。这套说法带有战略宣示色彩,但也点出了20GW的用途。未来如果大量模型持续训练、Agent长时间执行任务,企业购买的就不只是一款模型,而是随时可调用的计算服务。

真武V900要做那台“发电机”

与数据中心目标一起发布的,是平头哥新一代AI芯片真武V900。阿里称,其算力达到上一代真武M890的3倍,基于它构建的单一集群最多可扩展至50万卡,用于前沿模型的训练和推理。

这两个数字都要谨慎理解。“3倍”没有同时披露计算精度、工作负载和测试条件,暂时不能直接转换成真实应用中的三倍速度;“50万卡”说的是架构可扩展上限,不代表阿里已经建成一座拥有50万张芯片的集群。

真正值得观察的是协同方式。阿里称,它正在把芯片、服务器、网络、模型和推理系统放在一起调优。单独看,每一层都可以向外采购;把它们连起来,则可能让模型从设计阶段就适应自家硬件,让云平台也围绕同一套系统安排资源。平头哥这个名字始于2018年阿里组建半导体公司。据Engineering.com报道,时任阿里CTO张建锋用“聪明,而且什么都不怕”解释这一命名。八年后,这个带着互联网公司气质的芯片部门,被放到了阿里AI基础设施战略的中心。

模型不只要变大,还要参与改进自己

模型一侧,阿里计划把后续千问模型扩展至5万亿至10万亿参数。参数是模型训练后保存的内部数值,常用来描述模型规模,但更多参数不自动等于更强能力,效果还取决于架构、数据和训练方法。不同材料对具体型号的表述略有差异:阿里供稿转载将规划关联到Qwen4.5、Qwen5,吴泳铭演讲则只称将训练5至10T参数的全新模型。因此,更稳妥的说法是,这是一条后续模型路线,而非已经完成的产品。

阿里同时披露,采用新架构的Qwen4已经投入训练,Qwen4.5和Qwen5正在推进。比参数数字更有意思的,是所谓递归自我改进(RSI):让AI参与发现缺陷、设计实验、构造数据和改进软件,缩短原本依赖研究人员反复操作的迭代周期。

据阿里披露,Qwen3.8-Max曾在人类不参与的情况下连续迭代一个多月,完成33轮有效迭代,在Artificial Analysis评测中的得分从40升至45。它还为一款新GPU适配Qwen3.8-Flash的推理框架,使单实例吞吐量提升96%。在芯片设计实验中,模型调用EDA工具——用于电子设计自动化的软件——超过一万次,将一项总线模块的物理实现面积减少42%,标准单元数降低29%,功耗降低59.5%。这些结果展示了RSI可能覆盖训练、推理乃至芯片设计,但目前均为阿里单方实验结果。

另一项披露是,Qwen3.8-Flash通过架构改动将训练成本降低近90%。截至2026年9月,阿里称已开源460多个Qwen模型,累计下载超过30亿次,衍生模型超过30万个。这解释了阿里为何急于扩充供给:模型一旦成为大量开发者继续加工的底座,算力需求便不再只来自阿里自己的产品。

这场豪赌,赌的是完整闭环

吴泳铭把AI模型、AI芯片和AI云称为机器智能时代的三大基石。三者对应一条清楚的循环:更大的模型需要更多芯片和数据中心;更多用户产生真实任务和反馈;这些反馈又可用于模型迭代;模型还可能反过来优化推理软件和芯片设计。

这正是本次发布最值得关注之处。单看5至10万亿参数、50万卡或20GW,都是遥远而醒目的大数字。把它们连起来,才看得出阿里的真正下注:它不满足于提供某一款热门模型,而是希望控制从模型到芯片、再到云服务的完整生产链。

局限与未知

  • 20GW是2032年目标,材料没有给出当前容量、分年度建设节奏和投资规模。
  • 真武V900的3倍算力缺少测试条件,50万卡集群也只是可扩展上限,实际部署能力仍待验证。
  • RSI实验、96%吞吐提升、芯片设计优化、近90%训练成本降幅及生态数据主要来自阿里自述;5至10万亿参数模型也仍处于规划阶段。

供稿材料 SOURCES — 6

← 返回 2026-09-23 · 科技板块