AREX Feed Article
Bloomberg:AI负载尖峰超设计容量50%,数据中心关键设备加速损毁
AI数据中心的电力负载正在以工程设计从未预料到的方式剧烈波动:有时在几毫秒内尖峰超出设计容量50%,导致电池、发电机和冷却系统故障或提前报废。
这是 记者 Naureen S. Malik 在8月6日发布的调查报道中揭示的核心发现。该报道基于对美国和欧洲36位以上电力专家、数据中心开发商、电网运营商、公用事业公司、投资者、标准制定者和监管机构的访谈。
"一个1GW的设施可能在瞬间吃掉1.5GW的电力,"前 Tesla 高管、现 Heron Power Electronics 创始人 Drew Baglino 在报道中说。他的公司正在为 Nvidia 下一代能耗更高的服务器开发电力波动管理设备,预计2027年面世。
而问题已经迫在眉睫:部分数据中心的实际在线率仅约80%,远低于融资时假设的24/7/365全天候运行,每分钟宕机造成的收入损失可达数千至数十万美元。
为什么AI在物理层面摧毁自己的家?
报道揭示了五条相互关联的核心发现:
- 毫秒级负载震荡:AI模型训练时,数十万块GPU同步启动和停止,像一个数字化的"蜂群效应",在毫秒级别上制造出等同于整座工厂或城镇用电量的负荷涨落。Mainspring Energy 创始人兼总裁 Shannon Miller 描述:一个1GW的数据中心相当于波士顿全市用电量,其中一半可能在几秒钟内反复开关。
- 设备加速损毁:天然气内燃机的曲轴断裂、燃气轮机出现裂纹、用于平抑波动的电池在数周甚至数月内就需要更换。这些本应服役多年的资产正变成消耗品。
- 全球性现象:从 xAI 在孟菲斯的 Colossus 设施到英国的小型数据中心,设备故障在各地出现。Uptime Institute 首席顾问 Amber Villegas-Williamson 确认问题遍及中东、非洲、欧洲和美国。
- 在线率远低于设计假设:一位参与数据中心融资的人士透露,部分设施实际在线率仅约80%,如果问题不解决,未来12到24个月内某些项目的投资者将受到冲击。
- 电网级风险:北美电力可靠性公司()今年5月发出罕见的最高级别三级警报,评估发现美国超过33GW运营中数据中心的约四分之三"负载模型不足以反映数据中心动态行为"。
几十万块GPU像蜂群一样同步开关
传统数据中心已经存在了几十年,但AI训练设施有着根本性的不同。在得克萨斯州和中西部规划的一些AI园区,平均用电量接近纽约市,规模是一个1GW设施的五倍以上。
问题出在AI训练的工作模式上。训练一个大模型需要调动所有GPU同时运算,数十万块芯片在毫秒级别上同步升降功率,像一个数字化的"蜂群效应"或鱼群转向。储能开发商 Terraflow Energy 的 CEO Jon Parrella 把这个过程比作"开法拉利从六挡直接切到一挡。你没办法这么快地变速。"
Uptime Institute 首席顾问 Amber Villegas-Williamson 给出了另一个比喻:"就像持续超转速驾驶会比匀速行驶更快地磨损发动机。"("It's like over-revving your car wears out the engine faster than keeping a constant speed.")而传统数据中心的负载,更像是高速公路上稳定巡航的轿车。
从孟菲斯到英国,涡轮机都在裂
设备损坏的案例正在积累。多位知情人士透露,用于数据中心发电的小型天然气内燃机曲轴已经断裂。在 xAI 位于田纳西州孟菲斯的 Colossus 计算设施,燃气轮机出现了裂纹,运营方随后在系统中安装了电池来平抑功率波动、减轻旋转涡轮的应力。SpaceX(xAI的母公司)未回应置评请求。
在英国规模小得多的数据中心,涡轮机同样出现了裂纹,GeoPura 公司 CEO Andrew Cunningham 证实了这一点。UL Solutions 的 CEO Jennifer Scanlon 进一步警告,设备上的裂纹或磨损可能引发电弧闪光(electrical arc flashes),即电流在导体之间跳跃,从而损坏AI芯片本身。
理论上,电池、电容器、变压器和飞轮等设备可以用来稳定电力流。但多位受访者指出,在快速建设AI算力的竞赛中,新建数据中心并没有充分部署这些技术。Uptime Institute 及其他与运营商合作的人士表示,为此目的安装的电池有时在数周甚至数月内就需要更换,远超正常损耗速度。
75%的数据中心负载模型不合格
设备层面的损毁只是问题的一半。更令人担忧的是,AI数据中心的功率波动正在通过输电线向整个电网传导。
施耐德电气电力质量专家兼全球产品经理 Sreemant Roy 指出,这些负载"极其动态或波动,会导致电网不稳定,如果不加以纠正,可能引发停电或电力中断。"他特别担心数据中心产生的次同步振荡(sub-synchronous oscillations),这种振荡可能损坏连接在电网其他部分的设备。"这让全球的电力公司都非常担忧,"Roy说。
NERC在过去两年内多次发出警告,将数据中心列为电网稳定性的最大风险之一。2026年5月4日,NERC发布了罕见的三级"必要行动"(Essential Action)警报,这是该机构的最高警戒级别,要求输电规划者、运营商和平衡机构在8月3日前提交响应方案。警报列出了七项必须实施的行动,包括改进负载建模、建立新设施的调试流程、安装动态故障记录设备等。
公民行动联盟(Citizens Action Coalition)项目总监 Ben Inskeep 对 警告称,数据中心导致的电网不稳定"可能变得相当严重——甚至引发大范围停电。"
每分钟宕机损失可达数十万美元
可靠性问题已经在影响项目进度。在得克萨斯州西部,Joulent 公司与能源巨头 Chevron 共同为 Microsoft 开发一个2.67GW的AI园区。Joulent CEO Chris James 透露,为确保达到 Microsoft 要求的99.999%可靠性,工程阶段额外增加了时间,电力交付将从2027年推迟到2028年。
数据中心建造商和运营商 Switch 的首席战略官 Jason Hoffman 指出,如果关键设备提前故障,"财务后果主要不是更换一台泵或一个断路器——而是那些昂贵的算力因为下线而无法产生收入。"停机造成的收入损失估计从每分钟数千美元到数十万美元不等,取决于设施类型和工作负载。
数据中心融资时假设一旦上线就将全年无休运行,但现实是部分设施的在线率仅约80%。在投资者对 hyperscaler 数千亿美元AI支出的回报越来越紧张之际,这些可靠性问题正在加剧对行业盈利能力的质疑。GPU机架本身的折旧速度已经引发了类似的讨论。
Nvidia从Blackwell开始把电力专家请进了工程团队
AI行业从芯片到数据中心运营商,都已经意识到问题的严重性。
Nvidia 超大规模基础设施解决方案高级总监 Dion Harris 告诉 Bloomberg,公司在开发2024年首发的 Blackwell GPU 时就开始与电力专家更紧密地合作。"我们不仅在造芯片和处理器,"Harris说,Nvidia还在自己的数据中心中使用这些产品,并致力于让部署"在数据中心建设、设计和工程阶段以及电力输送方面都更加平滑。"
一些数据中心用户已经采取了权宜之计:在AI训练任务之外运行"假数学"(dummy math),本质上是不属于训练过程的辅助计算,来让GPU保持稳定运行。但这种做法被批评为在电力需求飙升时浪费电力。
在美国政府层面,位于科罗拉多州丹佛附近的落基山国家实验室(National Laboratory of the Rockies)去年代表美国能源部建立了一个测试平台。该平台配备GPU和现场发电能力,开发者可以用来测试其设置是否能承受AI的负载变化。DOE电力办公室项目负责人 Martha Symko-Davies 说:"我们现在有机会把事情做对。"
与此同时,NERC的三级警报响应截止日期(8月3日)刚刚过去,行业仍在等待监管机构对数据中心提交方案的具体反馈。Digital Power Optimization CEO Andrew Webber 在接受 Utility Dive 采访时表示,制定新法规、理解设备限制、重新排定社会各类负载的优先级"需要多年的协调努力。"
AI基础设施的折旧速度,比投资人想象的快得多
Bloomberg这篇报道揭示的核心矛盾是:AI行业在追求算力规模时,沿用了一套为稳定负载设计的电力基础设施范式,而AI工作负载的本质恰恰是极不稳定的。
三个走向值得关注。
第一,短期内,数据中心运营商将被迫在"跑满GPU"和"保护设备"之间做取舍:要么接受更高的设备更换频率和计划外停机,要么限制算力利用率,二者都会压缩利润空间。
第二,电力基础设施供应链,从固态变压器到飞轮储能,可能迎来一轮由AI需求驱动的升级周期。Heron Power Electronics、Mainspring Energy 等公司正在这个方向上押注。
第三,如果80%的实际在线率成为普遍现象,hyperscaler 数千亿美元AI资本支出的回报模型将被强制重写。一位参与数据中心融资的人士已经警告,某些项目的投资者可能在未来12到24个月内感受到冲击。
前 Tesla 高管 Baglino 的判断直指问题本质:Nvidia 下一代服务器的能耗将更加密集,而他在做的,是在2027年到来之前准备好能承受这种冲击的电力设备。时间窗口正在收窄。