黔山智算:贵阳南明数据中心AMD算力集群的落地实践与协议启示

在“东数西算”工程纵深推进的背景下,贵阳南明区凭借年均气温15℃的天然冷却优势与绿电资源富集,正从“数据仓库”向“智算枢纽”跃迁。近期,某头部AI训练平台与本地IDC服务商签署的“AMD算力服务器托管协议”成为行业焦点——该协议不仅涉及单机柜功率密度突破30kW的液冷改造,更首创了“算力可用性SLA+故障响应分级”的弹性条款。本文基于这一真实机房案例,拆解高性能计算场景下托管协议的关键博弈点。

一、机房改造:从“通用机柜”到“高密智算单元”

该案例托管主体为南明区某三级等保机房,原设计以2U机架式通用服务器为主,单机柜供电上限8kW。引入AMD EPYC(霄龙)9004系列Genoa处理器后,单节点TDP达400W,若按传统风冷布局,单机柜最多部署8台即触发过热降频。协议执行前,IDC方完成三项核心改造:其一,将原冷通道封闭系统升级为“背板换热+局部液冷”混合方案,对GPU直连节点采用冷板式液冷,CPU区保留高效风冷;其二,将电力路由从单路UPS切换为2N冗余的市电+高压直流,保障AMD平台特有的PCIe 5.0高速互联对电压波动的敏感度;其三,在楼宇级部署智能巡检机器人,针对液冷管路接头进行红外热成像预检。

二、协议条款的“算力温度”设计

与普通服务器租用不同,该协议将“性能连续性”列为第一级指标。双方约定:当机房进风温度高于28℃或冷却水流量低于设定值15%时,IDC须在10分钟内启动备用冷机,否则按每分钟扣减当日租金的0.3%赔付。更值得关注的是“故障责任倒置”条款——因AMD平台特有的CXL内存扩展模块对物理震动敏感,协议明确机柜相邻区域禁止进行冲击性施工(如打孔、搬运重型电池组),违规操作导致的非预期重启,由IDC方承担全部算力损失补偿。

三、运营数据与能耗博弈

协议生效三个月后,该机房单机柜平均算力密度提升至21.6kW,PUE(电能利用效率)从1.42压降至1.19。但运维日志显示,夜间低谷电价时段,客户会主动下调20%CPU占用率以换取“绿色算力积分”,而IDC方则利用该时段对液冷CDU(冷量分配单元)进行在线清洗。这一动态平衡策略,使双方在电费分摊上达成“基础电费包干+峰谷价差共享”的折中方案——客户承担70%基础电费,但若月度PUE低于1.25,IDC返还其8%的托管服务费。

四、启示:托管协议正从“资源租赁”转向“性能契约”

贵阳南明这一案例揭示,AMD高密度算力服务器托管已非简单机位出租。协议附件中长达23页的《环境振动与微尘控制规范》,以及针对EPYC安全加密虚拟化特性的“物理隔离+逻辑隔离”双重要求,均指向未来智算中心的服务本质——即IDC必须对芯片级运行特征负责。对于计划在西南节点部署大模型训练集群的企业而言,签约前务必实测机房在20kW以上负载时的冷量冗余、柴油发电机带载切换时间,以及网络端到端时延的抖动率。南明的实践表明,唯有将算力硬件的极限参数与机房基础设施的动态响应深度耦合,方能在高山流水间真正释放AMD平台的峰值性能。

在线客服