①Meta推出首款AI智能体Muse Code的测试版;
②OpenAI要求美法官驳回苹果诉讼,称“窃取商业机密”指控“毫无依据”;
③亚马逊旗下Zoox将在美国拉斯维加斯启动付费自动驾驶出行服务。
财联社8月6日讯(编辑 李莹)AI对电力的巨大需求早已众所周知。但鲜为人知的是,AI数据中心电力的剧烈波动可能会损坏内部关键电力设备,加速设备的折旧或导致报废。电力设备磨损后,如不及时检修更换,可能进一步损害芯片。
市场日益担忧相关设备的实际折旧速度可能远快于预期,投资者对超大规模云厂商数千亿美元的支出感到不安。
电力剧烈波动损害设备
几十年来,数据中心一直在大量消耗电力,但专为AI计算设计的数据中心有所不同:其电力需求极为庞大,且波动要剧烈得多。
数据中心和电力供应商咨询机构Uptime Institute英国首席顾问Amber Villegas-Williamson表示:
“AI确实创造了‘异常’的电力需求。这就像让汽车引擎超频运转,会比保持恒定车速更快地磨损发动机。”
业内指出,AI数据中心训练新模型时,需要调动全部GPU同时投入运算。数十万颗GPU在毫秒之间同步启停,就好比蜂群集结、鱼群同步转向。
工业及数据中心微电网服务商Mainspring Energy Inc.创始人兼总裁Shannon Miller表示:一个吉瓦级的数据中心耗电规模相当于波士顿,其一半的用电量可能每隔几秒就会启停一次;部分AI园区规模甚至还要大五倍以上,平均耗电量与纽约市相当。
电力波动管理设备研发商Heron Power Electronics Co.创始人、特斯拉前高管Drew Baglino表示,AI有时会导致用电量激增至设计容量的150%,因此一个1吉瓦的设施可能会在极短的时间内使用1.5吉瓦的电力。
绝大多数设备在设计之初,并未考虑应对幅度如此剧烈的电力波动。能源储存开发商Terraflow Energy首席执行官Jon Parrella将其比作驾驶一辆法拉利并直接从六档换到一档。
他表示:“你无法做到那么快地切换。”
有媒体近期采访了美国和欧洲三十多位电力专家,多名人士表示,数据中心所用小型天然气内燃机已发生曲轴断裂故障。
有知情人士透露,在xAI位于田纳西州的Colossus数据中心中,燃气轮机出现了裂纹。
氢燃料电池服务商GeoPura Ltd.首席执行官Andrew Cunningham表示,英国规模小得多的数据中心内的轮机也出现了裂纹。
测试与认证服务机构UL Solutions Inc.首席执行官Jennifer Scanlon表示,设备的裂纹或磨损可能会导致电弧闪络(电流在导体之间跳跃),从而损坏AI芯片。
几位知情人士表示,在快速推进数据中心建设的过程中,并未充分配置电池、电容器、飞轮、变压器等多种可平抑电力波动的设备。
据数据中心咨询机构Uptime Institute以及其他与运营商合作的人士称,为平抑电力波动安装的电池,高负荷下有时需要在几个月甚至几周内更换。
Uptime Institute的Villegas-Williamson指出,从中东、非洲到欧洲和美国,全球各地的数据中心都存在这一问题。
收益承压
业内指出,这些问题已经在导致部分AI数据中心建设延期或缩减运营规模,进而影响收益。
基础设施开发商Joulent Inc.正与能源巨头雪佛龙公司共同开发得克萨斯州西部一个规划为2.67吉瓦的AI园区。
Joulent Inc.首席执行官Chris James表示,为了确保该园区能够达到微软公司所需的99.999%基础设施可用性,规划日程中额外预留了工程时间。他透露,这意味着供电开始时间将从2027年推迟至2028年。
数据中心建设及运营商Switch首席战略官Jason Hoffman表示,如果关键设备提前故障,财务后果主要不在于更换水泵、断路器或某种电力部件,而在于计算能力因关机而无法产生的收入。
业内指出,停机所造成的收入损失因设施类型和工作负载而异,估计从每分钟数千美元到数十万美元不等。
有知情人士称,数据中心的建设预设是,项目投用后便可实现全年365天不间断运转。但该人士透露,部分数据中心实际可用率仅接近80%;若相关问题得不到解决,未来一至两年内,部分项目的投资者或将因此遭受损失。
与此同时,GPU机架受芯片技术快速迭代影响而加快的折旧速度,同样让市场对该行业的盈利兑现能力打上问号。
威胁大电网
业内指出,上述隐患还可能波及整个大电网的稳定。
施耐德电气电力质量专家兼全球产品经理Sreemant Roy表示:
“这些负荷极具动态性且波动剧烈,会导致电网不稳定,如果不加以改善,可能导致停电。”
他特别指出,数据中心容易在电流量中引起亚同步振荡,这可能会损坏连接到网络其他部分的设备。
Roy表示:
“这让全球的公用事业公司感到非常担忧。”
在过去两年中,北美电力可靠性公司(NERC)——美国负责制定电网供电可靠性标准的核心机构——已多次发出警告和警报,指出数据中心是电网稳定性的最大风险之一。
NERC此前对美国总规模超 33 吉瓦的在运数据中心开展评估,发现约四分之三的负荷模型 “无法反映数据中心的动态用电特征”。今年早些时候,该机构罕见发布三级警报,要求大型数据中心处置上述紧迫风险,并于8月3日前提交整改反馈。
仍在寻求解决方案
AI行业已经意识到这些问题并正在积极寻求解决方案。
英伟达基础设施解决方案高级总监Dion Harris表示,英伟达在2024年开发Blackwell GPU时,就开始与电力专家开展更紧密的合作,致力于让数据中心的设计、建设、工程实施以及电力供给各个环节都更加顺畅。
Harris表示:
“我们正在制造芯片和处理器,但也将其应用于公司自己的数据中心。”
部分数据中心运营方正通过执行辅助计算平抑电力波动。但该方案也饱受诟病,原因是在用电紧张的背景下,这种做法会造成电力浪费。
辅助计算是和模型训练无关的虚拟运算。当真实训练任务负荷下降时,通过额外运行无效运算,强制让GPU保持高负载运行,避免用电量急剧跌落,以此抹平电力波动。
落基山国家实验室(NLR)的美国能源部电力办公室项目经理Martha Symko-Davies表示,该实验室去年代表美国能源部设立了一个测试平台,以研究如何安全地将AI用电整合到电网中。
该站点配备本地GPU及发电设施,可供开发者测试自有配置能否应对AI业务的用电波动。
NLR的Symko-Davies表示:“我们现在有机会把它做好。”