一条输电线路出故障,附近的数据中心几乎同时切到备用电源。对单个机房来说,这是保护设备;对电网来说,却像一群人同时松开绳子:原本紧绷的供需平衡突然被打破。北弗吉尼亚这次险情没有造成停电,却让一个问题浮出水面:数据中心越集中,它们自保时越可能一起给电网制造新的冲击。
本文依据 TechCrunch 7月25日的单篇报道。关键数字尚无第二个独立信源直接复核;报道也没有证明涉事设施正在运行 AI 负载,因此更准确的说法是:这是数据中心事件,也是 AI 算力扩张必须正视的基础设施风险。
一次自保,怎样放大了故障?
PJM Interconnection 是协调美国东部跨州电网运行的区域输电组织,覆盖新泽西州至伊利诺伊州,服务约6700万用户。北弗吉尼亚的数据中心集群位于其辖区内。据 TechCrunch 报道,这里拥有全球最密集的数据中心集群。
事件的起点,是华盛顿特区附近一条输电线路故障。此类电网扰动会让电压或频率短暂偏离正常范围,保护和调度机制随后介入。报道说,类似事件通常数秒便能恢复,这次却用了超过10分钟。
原因不只在断线本身。数据中心检测到电压波动后切换备用电源,约3.1 GW负荷在约30秒内从PJM电网消失。这里的“负荷脱落”,就是用电设备突然停止从电网取电。PJM看似短暂恢复后,又有更多负荷退出。电力供需余量最高达到3.49 GW,约11分钟后才稳定下来。
这两个数字含义不同:3.1 GW是约30秒内消失的用电负荷;3.49 GW是事件中的峰值电力余量,不能视为同一指标。Reuters经TechCrunch转述称,脱网的数据中心约占PJM当时总需求的3%。比例看似不大,但电网要求发电与用电时刻接近平衡。需求骤降,来不及收回的电力就会推高电压。
Ting Labs通过部署在民用插座中的物联网传感器观察到,电压异常从北弗吉尼亚延伸至芝加哥。多地灯光闪烁,但没有停电。其传感器网络的覆盖度、校准方式和代表性,报道没有交代。
软肋不是备用电源,而是大家同时动作
单个数据中心快速脱网并不难理解。问题在于,位置相近、保护逻辑相似的设施可能在几秒内作出同一个决定。于是,最初的小幅供电下降,被放大为更大的需求骤降和电压上冲。
受访专家提出两条思路。第一,让相邻的大负荷按顺序退出或重新接入,给电网留下调整时间。第二,让数据中心具备“穿越”扰动的能力——电压短暂变化时先留在电网上,而不是立即脱离。
ON.Energy称,它正用电池和电力转换设备为整个数据中心园区提供不间断电源,不只覆盖服务器,也覆盖冷却设备。对电网而言,园区由此更像一个稳定负荷:多余电力可用于充电,供电下降时则由电池补给服务器。该公司还称,系统能在毫秒内跟随电网变化,目前正为四个数据中心园区安装合计3 GW的系统。这些说法来自企业及其CTO,报道未提供独立测试结果。
为什么现在值得关注?
这并非PJM第一次遭遇大规模数据中心负荷脱落。报道提到,约两年前曾发生类似事件。这说明算力设施不只是电网的用电客户,也开始成为会反过来影响区域供电的超大型负荷。
AI训练可以让计算负载升降,但本次报道没有证明AI任务参与了事故。真正确定的警示更朴素:当数据中心继续集中扩张,供电韧性不能只看每座机房有没有备用电源,还要看它们能否与电网协调行动。
局限与未知
- 报道未给出线路故障的确切日期,也未披露涉事数据中心的数量、名单和保护策略。
- 关键数字均来自单篇报道转述,尚缺第二个独立信源直接复核。
- ON.Energy方案的成本、部署条件及实际效果没有公开对照数据,能否成为通用解法仍待验证。