上个月去参观一个中型算力项目,站在机房门口就感觉到凉气扑面而来,带队的工程师说,这里算力中心冷却系统的功耗占比快到总功耗的三成了,我当时就挺惊讶,原来这套看不见的系统居然这么吃资源,那它到底为啥这么重要呢?今天就拉出来唠唠,给想要入行或者好奇的朋友理理清楚。

其实很多人对算力中心的印象,就停留在“有很多服务器能算东西”,顶多关心下有多少P的算力,多少钱一度电,很少有人会想到冷却这件事。但现在不一样了,AI大模型火了之后,算力中心的算力密度越来越高,十年前一个标准机柜也就三五千瓦的发热量,现在一个高密度AI机柜,发热量能到几十千瓦,翻了快十倍。这么多热量堆在封闭机房里,要是散不出去,用不了半小时机房温度就能飙到五六十度,服务器直接就宕机罢工了。所以说,冷却系统从一开始就是算力中心必不可少的配套,不是什么可加可不加的“锦上添花”。
不管是CPU还是GPU,只要跑起来就会发热,温度越高,电子元件的老化速度就越快,寿命也就越短。我之前听一个做了十年运维的老大哥说,他们早年建的一个小算力中心,图省钱用了劣质的冷却方案,结果不到三年,GPU的故障率翻了一倍,换硬件花的钱,比当初省下来的冷却投入多了快十倍,你说坑不坑?好的算力中心冷却系统,能把机房和硬件的温度稳定控制在设计范围内,不让元件长期在高温下工作,无形中就延长了硬件的整体使用寿命,对企业来说,这就是省了后期的更换成本。
现在不管是AI训练还是大规模数据计算,都是让服务器满负荷持续跑,很多任务一跑就是好几天甚至十几天。要是温度控制不好,芯片自带的过热保护就会触发自动降频,本来一块GPU能跑100T算力,温度一高可能只能跑60T,本来一周就能跑完的训练,硬生生拖到十天半个月,对企业来说,这就是工期延误,就是损失。靠谱的冷却系统,能让芯片一直工作在合理的温度区间,不会因为过热触发降频,能一直稳定输出额定算力,不会掉链子。我那个做算力项目的朋友说,他们现在做AI训练,最看重的就是冷却,冷却稳了,算力才能稳,不然钱花了,时间也耽误了,太不值当。
肯定有人会说,冷却系统本身就耗那么多电,还说降成本?其实这里面的门道不少,低效的冷却系统,不仅散热差,还费电,而高效的冷却系统,虽然初期投入高一点,但长期算下来,反而能省不少钱。比如现在很多算力中心会利用自然冷源,北方冬天的冷空气,或者附近江河的冷水,来辅助散热,能大幅降低冷却系统本身的功耗。现在电费本来就是算力中心运营的大头,冷却效率每提一个百分点,一度电就能省几分钱,一年下来,一个中型算力中心就能省出几十万甚至上百万,这个账算下来,其实很划算。而且刚才也说了,冷却好能延长硬件寿命,不用频繁换硬件,这又是一笔不小的节省。
现在常见的冷却方案有风冷、液冷还有浸没式液冷,不同方案的作用也不一样。传统风冷成本低,适合低密度的算力机房,但是高密度的AI机柜,风冷就压不住温度了,所以现在新建的AI算力中心,大多都改用液冷了。液冷的散热效率比风冷高很多,能扛得住高密度的发热量,还能降低噪音,就是初期投入高一点。至于浸没式液冷,就是把整个服务器泡在绝缘冷却液里,散热效果更好,不过现在成本还比较高,用的还不多,但未来如果算力密度继续涨,说不定会越来越普及。不管用什么方案,核心都是把热量及时散出去,保障整个算力中心的稳定运行。
其实说了这么多,总结下来就是一句话,很多人建算力中心,把钱都砸在买服务器芯片上,却忽略了冷却系统的投入,其实算力中心冷却系统才是算力稳定输出的幕后保障。选不对冷却方案,哪怕买了最好的芯片,也发挥不出应有的性能,还会平白多出很多运营成本。所以不管是做算力项目的企业,还是普通用户想租用算力,都别忘了把冷却系统的配置也纳入考虑范围,毕竟只有冷却稳了,算力才能真的稳。
【版权声明】:本站所有内容均来自网络,若无意侵犯到您的权利,请及时与我们联系将尽快删除相关内容!