财联社
财经通讯社
打开APP
上线超节点实例、欲将数据中心产能增超两倍 阿里云的AI算盘怎么打?
①阿里云正计划将模块化数据中心的全球产能提升两倍以上。记者了解到,阿里自研芯片平头哥的产能正在持续提升,未来在其算力体系中的占比将越来越高。
                ②目前以推理为中心的算力则呈现从西往东下沉的趋势。未来长三角、大湾区、京津冀三大经济圈,将来会出现大量的推理型算力集群。

《科创板日报》8月12日讯(记者 黄心怡)阿里云今日宣布灵骏真武M890超节点实例正式上线,首批已在乌兰察布地域开售。就在前一日,《科创板日报》记者获悉,阿里云正计划将模块化数据中心的全球产能提升两倍以上。记者从采访中了解到,阿里自研芯片平头哥的产能正在持续提升,未来在其算力体系中的占比将越来越高。

▍平头哥AI芯片产能逐步提升

阿里云灵骏真武M890超节点是国内首个成功运行超2万亿参数大模型的超节点形态算力,Kimi K3和Qwen3.8 Max均已通过该实例对外提供服务。

据悉,灵骏真武M890超节点实例支持 FP8/FP4 低精度计算,通过ICN Switch 1.0 芯片Scale-up 互联规模由16卡拉升至64卡,卡间互联提升至800GB/s。在智能驾驶、具身智能等训练场景中,相比上一代真武810E,训练性能提升三倍。

支撑超节点集群的,是阿里云灵骏智算平台。依托HPN 8.0 训推一体网络,单集群最高支持 13 万卡异构算力混布,并可扩展至百万卡级。

截至今年4月,平头哥真武AI芯片累计出货56万片,阿里云全球数据中心总经理王朝阳介绍,平头哥的产能在逐渐提升。“未来非常确定性的是,国产自有芯片的产能会持续提升,占比越来越高。而产能提升时间大概不需要三年。

AI时代来临,数据中心进入第四代——智算中心(AIDC)。数据中心的规模是过去的十倍,密度是十倍甚至几十倍,芯片也更加多样,需要兼容多种架构。阿里云也推进“一云多芯”战略,对多种芯片异构兼容。“其他的一些芯片我们也愿意去适配模型、适配应用。”王朝阳称。

据了解,基于全模块化设计架构CUBE 5.0,阿里云已将大型AIDC数据中心的交付工期缩短至100天。同样的工期,国内传统交付周期为6至12个月,美国为12至18个月。在大幅缩短工期的同时,阿里云数据中心整体建设成本反而降低10%以上。

目前,CUBE 5.0架构已在阿里云乌兰察布、中卫等数据中心试点跑通,并获得基于EN标准的欧洲CE认证和基于IEC标准的东南亚产品准入。今年,阿里云正计划将模块化数据中心的全球产能提升两倍以上。

王朝阳介绍,AI算力需求爆发,数据中心交付的速度要求变高。传统的工期为串行施工,每一步都依赖上一步的完工,比如先安装供配电,再接空调。阿里云通过全模块化的设计理念,各个环节并行生产,工厂制造后,预调至集装箱,再运抵数据中心,现场像搭积木一样吊装。

▍AI推理算力呈现从西往东下沉的趋势

本次超节点实例首发地域乌兰察布是阿里云五大超级数据中心之一,该数据中心的绿电占比约 45%。

王朝阳表示,选择乌兰察布的核心因素就是电价。“这个地方的电价大概是在3毛2到3毛5之间。而华东、华南普遍六毛到九毛。一个吉瓦级的数据中心,放在乌兰察布和放在东部,每年电费相差50亿元。

根据王朝阳对AI算力分布规律的观察,以训练为中心的算力呈现从东往西纵深的趋势。西部有最便宜的电,结合西部土地广阔、气候凉爽,天然适合高能耗、对延迟不敏感的训练任务。这使得千卡、万卡集群最早出现在京津冀、长三角、大湾区,但万卡、十万卡集群基本都搬到了"胡焕庸线"以西。据了解,“胡焕庸线”即“瑷珲—腾冲线”,北起黑龙江黑河,南至云南腾冲,呈东北—西南走向,倾斜约45度,全长约4000公里。

而以推理为中心的算力则正好相反,呈现从西往东下沉的趋势。这是由于东部地区是AI推理需求的主力爆发点,用户在这里,数据和业务在这里,AI推理必须靠近用户。

王朝阳说预计,未来长三角、大湾区、京津冀三大经济圈,将来会出现大量的推理型算力集群,并逐步形成产业群的覆盖。“举个例子,新兴的产业,数字化基础非常好的产业一定会成为Token使用聚集区域。”

▍未来单机柜平均功率或将突破1000千瓦

随着数据中心进入智算中心(AIDC)时代。数据中心的规模是过去的十倍,密度是十倍甚至几十倍,芯片也更加多样,需要兼容多种架构。这都必须要有大量的电力供应。

王朝阳表示,这使得数据中心选址需要选择能源富集的地方,才能发展大规模的算力。其次,功率密度越来越大,特别是AIDC时代单机柜功率密度已经达到了100千瓦,未来两年之内还会出现1000千瓦的机柜。

与此同时,供给端的瓶颈正在从芯片向更上游蔓延。王朝阳举例:“最早是GPU产能不足,存储是一个瓶颈,后来电力供给又成为瓶颈,再后来光纤也出现瓶颈。中国一年生产6亿公里光纤,但仍然会出现瓶颈——因为一个十万卡集群就需要几十万公里光纤。而各个光模块也会出现瓶颈。”

谈及产能瓶颈,王朝阳表示,此前做过评估,在目前全中国产能约8吉瓦的情况下,可以比较好地覆盖当下芯片的产能需求。“可能会出现局部的问题、短期的问题,但整体上没有大问题。”

王朝阳还提到高压直流技术的重要性。“下一代数据中心如果采用240伏交流电,已无法承载当前密度,电缆在物理空间上超出物理极限。所以必须把电压升至400伏,甚至800伏、1500伏。随着密度继续升高,电压还在往上走。”

此外,风冷和液冷兼容几乎是AIDC的标配,如何实现更高配比、更好效果是持续优化的方向。

在算电协同方面,王朝阳认为,GPU时代功耗呈现垂直增长,这意味着需要用全新的技术来解决,目前中美在算电协同方面都进行了大量的尝试,但是仍然处在非常初级的阶段。相信随着算力中心的发展,会对当前的框架,包括电网的稳定性,包括发电企业等造成冲击,从而产生新的业态。

人工智能 TMT行业观察
财联社声明:文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
商务合作
热门解锁
相关阅读
评论
发送
复制
取消
垃圾广告
政治激进内容
色情低俗内容
取消