几十年来,数据中心一直在推动数字时代的发展;如今,数据中心正在支撑各种人工智能 (AI) 应用,这些应用正在改变世界和我们的生活。但数据中心的电力需求直到最近才出现爆发式增长,且增速极快。
德州仪器 (TI) 数据中心热管理总经理 Patrick Zeng 表示:“25 年前,一个典型的数据中心机架功耗可能约为 5kW。如今,机架功耗可超过 100kW;几年内,部分机架功耗可能会超过 1MW。”
服务器消耗的几乎每一瓦特电力都会在数据中心机房内转化为热量。控制服务器的热量是当今数据中心设计面临的最严峻工程挑战之一。
Patrick 表示:“在阳光下跑步时,身体会变热。新陈代谢会使身体降温,避免中暑。这正是散热管理对数据中心所起的作用。”
当服务器过热时,性能会下降,成本也会增加。
以大语言模型为例。AI 模型使用 Token 来处理和生成语言;Token 是作为基本计算单元的短文本片段。然而,“当 GPU 过热时,生成 Token 的速度会变慢。因此,最终用户感受到的响应速度较慢,而数据中心运营商提供响应的成本则更高。”
传统的散热基础设施已无法跟上步伐。工程师们正竞相重新思考数据中心的散热方式,无论是在设施层面还是在服务器托盘层面。
仅靠风冷已难以为继
过去数十年,风冷一直能够满足需求。风扇将冷空气吹过发热组件并带走热量,从而保障数据中心可靠运行。但随着 AI 将机架功率推高至 20kW 甚至 40kW 以上,仅靠空气已无法足够快地散热。工程师正采用风冷和液冷的混合方案来应对上述问题。
液冷并非冷却服务器周围的空气,而是直接从源头散热。冷板紧贴服务器托盘内的芯片,使液体带走热量的效率远高于空气。
目前,工程师正在整个数据中心设施内应用于这种方案,范围涵盖在服务器机架与外部设施基础设施之间循环冷却液的冷却液分配单元 (CDU),直至各个托盘。然而,让液体如此靠近电子设备可能会导致成本极高;解决这一挑战需要构建一个能够输送、监测和控制冷却液的组件生态系统。
液冷系统的基础组件
Patrick 表示:“监测液冷所用的冷却液对于整个散热管理系统的可靠运行至关重要。”因此,工程师会持续监控冷却液,追踪温度和湿度,以及时发现任何异常迹象。
CDU 内置构成循环回路机械核心的泵和风扇,负责在系统中循环冷却液。电机驱动器控制上述泵和风扇,并内置故障保护功能。阀门根据实时需求开启或关闭,以调节流向每个托盘的冷却液流量。
传感器监测流量、温度、湿度和压力,以便尽早发现泄漏或组件故障的迹象。微控制器将所有部件整合在一起,实时处理传感器数据并相应调整系统。
“对于数据中心而言,可靠性始终是首要考虑因素。”泵发生故障或传感器读数错误都可能导致整个机架的 AI 计算组件下线。
要满足可靠性标准,每个环节都必须精准无误。TI 的产品组合覆盖了完整的冷却液路径,从冷却整个数据中心设施的暖通空调 (HVAC) 系统,到为机架供应冷却液的 CDU,再到单个服务器托盘。
Patrick 表示:“我们并非从零开始。我们以多年来应用于楼宇自动化和家电领域的商用暖通空调 (HVAC) 系统技术为基础。这意味着产品上市时间更短,因为技术基础已经具备。这也意味着可靠性更有保障,因为此项技术已经过验证。”
散热管理的未来发展方向
即使机架功率攀升至兆瓦级,且运营商相应采用了新型散热技术,工程师仍将面临一项持久的设计挑战:可靠性。
数据中心散热可靠性的下一个前沿领域是通过边缘 AI 和传感器融合技术整合多种传感器。现有系统通常依赖单一传感器来检测泄漏。未来的系统将分析由电机电流、压缩机转速、湿度、压力和温度组成的实时信号网络,以识别单一传感器无法检测到的细微模式。对于传统的基于规则的软件而言,关联上述信号过于复杂。
边缘 AI 具有的独特优势:响应时间短且延迟低。
无论散热管理采取何种形式,其核心目的始终不变:为工程师提供工具,以保持 AI 服务响应迅速和数据中心运行可靠,帮助运营商控制成本,并确保支撑现代计算的基础设施能够满足 AI 当前所需的运行速度。
来源:德州仪器