本周三,华盛顿特区外一根输电线路发生故障,自动断开了服务。这本是电网的日常事件——正常情况下,电网在几秒内就能恢复。但这一次,恢复花了超过 10 分钟。
不是因为线路本身有多严重,而是因为线路故障触发了北弗吉尼亚「数据中心巷」(Data Center Alley)——全球数据中心最密集的区域——数百个设施的保护系统在毫秒级时间内集体做出同一个决定:脱离电网,切换至备用电源。
结果是约 3.1 GW 的电力负载在约 30 秒内从 PJM 电网消失。根据电网数据,峰值时电网多出 3.49 GW 的富余电力。PJM 互联电网——覆盖从新泽西到伊利诺伊的 13 个州和华盛顿特区、服务 6700 万用户的美国最大电网运营商——经历了从北弗吉尼亚到芝加哥的电压尖峰。Ting Labs 部署在家庭插座中的 140 万个物联网传感器记录到了这一扰动。居民报告灯光闪烁、空调和冰箱发出异常声响。
没有发生停电。PJM 称事件「未影响电网可靠性」。但一位行业分析师对 Data Center Knowledge 的表述更接近本质:「3 GW 的客户响应已不再是客户行为,而是电网行为。」
一根电线杆如何撬动 3GW:数据中心的「集体行动」悖论
要理解这个事件,需要先理解数据中心的供电架构。
绝大多数现代数据中心使用双变换式(double-conversion)UPS:市电先转换为直流给电池充电,再逆变为交流供给服务器。这种设计使 IT 设备与电网完全隔离——电网的任何波动都被 UPS 吸收,服务器看到的始终是「完美电力」。
当电网电压出现扰动——比如一根输电线故障造成的电压骤降——UPS 检测到输入电压低于设定阈值(约 0.5 pu,即标称电压的 50%),会在几毫秒内切断电网连接,完全由电池供电。从单个数据中心角度看,这是正确的工程设计:宁可短暂脱离电网,也不能让价值数亿美元的 GPU 集群暴露在电压波动中。
问题出在规模上。北弗吉尼亚的 Loudoun 县集中了超过 200 个数据中心,它们连接着同一条输电网络,使用着同类型的 UPS 保护逻辑,设定着相似的电压阈值。当输电线路故障产生的电压扰动同时到达这些设施时,它们做出了完全相同的瞬时决策。
「它们都在几秒钟内决定脱离电网,」安大略独立电力系统运营商(IESO)高级市场模型专家 Ali Zain Banatwala 对 TechCrunch 表示。他指出了一个关键问题:「我们需要想办法让这些相邻的负载有序地断开或重新连接。」
这正是个体理性导致集体风险的经典案例。单个数据中心的 N+1 冗余在设施层面保证了可用性,但当数百个设施的地理密度、技术架构和保护逻辑高度同质化时,它们在电网层面制造了一种新的系统性脆弱性。
还有一个让问题更复杂的事实:数据中心的 UPS 切换是自动的,但重新连接电网往往需要人工干预。2024 年的同类事件中,数据中心的负载在脱离电网后数小时才恢复——这不是几分钟就能自我修复的问题。
从 1.5GW 到 3.1GW:症状在加速
这不是第一次。
2024 年 7 月 10 日傍晚,一场雷暴导致北弗吉尼亚 Fairfax 附近 Ox-Possum 230kV 输电线路上的避雷器失效,引发六次电压骤降。约 60 个数据中心同时脱离电网,带走了约 1.5 GW 负载——相当于弗吉尼亚州近三分之一家庭的用电量。北美电力可靠性公司(NERC)事后称之为「可靠性的五级火警」。PJM 电网频率飙升至 60.047 Hz,远超 ±0.036 Hz 的目标区间。Dominion Energy 不得不紧急移除本地电容器组以恢复电压。
两年后,同样地点,同样机制,规模翻倍。
Neil Osnato,Persistence Analytics Group 创始人,对 Data Center Knowledge 表示,如果规模在两年内从 1.5 GW 增长到 3 GW 以上,「这表明运营后果正在随着 AI 基础设施的集中度扩大而增长。」
他指出,行业面临的挑战已不再是评估单个设施的保护设置,而是一个更大的问题:是否成百上千兆瓦——甚至吉瓦级别——的超大规模容量共享着相似的电压阈值、切换逻辑和时序。每个设置单独看都是合理的,但当它们同时对同一扰动做出反应时,就产生了「共模响应」(common-mode response)。
Osnato 还提出了另一个尚未被充分讨论的风险:重新连接。让几吉瓦的负载同时回到电网,如果协调不当,可能制造第二次扰动。
AI 的电力账本:6% 到 24%
将这些孤立事件放在 PJM 的负荷预测中看,才会理解问题的紧迫性。
根据 Synapse Energy Economics 2024 年 12 月的建模报告,数据中心目前占 PJM 电网负荷的约 6%。到 2040 年,这一比例预计将达到 24%。数据中心的年用电量将增加 313 TWh,峰值负荷增加 49 GW——这意味着仅数据中心就会使 PJM 总峰值负荷增加约 20%。
PJM 自身的 2026 年长期负荷预测更激进:夏季峰值将从 2025 年的 160 GW 增长到 2046 年的 253 GW,增幅 58%,主要由数据中心驱动。未来五年内,大型负载(主要是数据中心)将贡献超过 100% 的峰值需求增长——也就是说,除数据中心外的传统需求实际上在收缩。
但与之对应的灵活调节能力严重不足。Grid Status 的分析指出,PJM 目前仅有约 400 MW 的电池储能容量,相比之下 ERCOT 约 8 GW,CAISO 约 12 GW。PJM 曾是美国电池储能的先行者——2012 至 2017 年间超过 100 MW 电池上线——但此后因市场规则变更和经济性恶化,这些项目大量退役,新项目推进缓慢。
换句话说,PJM 正在引入历史上最集中、最灵活的负载类型——GPU 集群可以在亚秒级从满载切换至近乎空闲——却没有配备同等灵活性的调节资源。
解决方案正在出现,但远未跟上建设速度
这个问题的解决方案在技术上已经存在,但部署速度远落后于风险积累速度。
Campus 级 UPS。 迈阿密创业公司 ON.Energy 开发了一种中压不间断电源系统(AI UPS™),部署在整个数据中心园区与电网之间,而非单个设施内部。电网只「看到」一个行为良好、恒定的负载,而不是数百个设施各自独立的功率峰谷。当电网出现扰动时,系统可以吸收或释放电力,使数据中心在不脱离电网的情况下穿越(ride-through)电压波动,同时继续正常运行。ON.Energy CTO Ricardo de Azevedo 对 TechCrunch 表示,公司正在四个数据中心园区安装总计 3 GW 的系统。7 月 21 日,ON.Energy 与 Crusoe 宣布合作部署 5 GW 的 AI UPS。该技术已在美国能源部国家实验室完成独立验证,达到了 ERCOT 正在拟议的 ride-through 标准。
监管要求。 德克萨斯州的 ERCOT 正在走得更远。德州公共事业委员会(PUC)已批准规则,要求大型电子负载(LEL)——主要是数据中心——在电网频率和电压发生特定幅度扰动时必须保持连接,而不是切换到备用电源。ERCOT 在监管文件中指出,自 2023 年初以来,已记录了 28 起 100 MW 以上的 LEL 脱网事件,并警告「随着 LEL 的显著增长,这一风险将呈指数级上升」。NOGRR 282 提案进一步细化了 ride-through 的技术标准。
UPS 厂商的响应。 施耐德电气的 Galaxy V Series UPS 和伊顿的电网交互式 UPS 也已在设计中纳入 ride-through 能力。伊顿与微软在 PJM 区域内合作测试了用于频率调节的 UPS 系统——证明同一套电池不仅可以保护服务器,还可以主动参与电网稳定。
但这些方案面临的是一个时间错配问题。数据中心可以在 18 到 24 个月内建成投产;一条高压输电线路的规划和建设周期通常需要 7 到 10 年。即使 PJM 已批准了约 60 亿美元的弗吉尼亚输电升级计划——包括扩展 765kV 线路至 Data Center Alley——这些项目投入运营的速度仍远远落后于 AI 基础设施的扩张。
在这个错配被弥合之前,北弗吉尼亚不会是最后一个经历「3 GW 消失」的地方。正如 ON.Energy 的 de Azevedo 所说:「这是煤矿里的金丝雀。」
