首页 > 新闻

芯片越强,热越贵!曙光8000用液冷给智能“降价”

2026-09-30 12:25:57        


  十万颗芯片全速运转一年半释放的热量,注入西湖足以让水瞬间沸腾。

  这组数字背后,藏着十万卡级算力系统一笔关键的账。热,就是算力的成本。

  热带不走,芯片就得降频,昂贵的电力和算力卡也就无法充分工作。对十万卡级机器来说,散热决定系统能否在高负载下,把芯片性能稳定释放出来。

  曙光8000的刀片服务器只有六十多毫米厚,里面塞进了5层主板,20颗计算芯片。单颗芯片满载功耗超过办公电脑CPU的5倍。高功耗计算单元被压进有限空间,换来更高的算力密度,也把热管理推到整机设计的前面。

  最近,央视纪录片《超级工程》记录了曙光8000液冷系统科学家常乾坤和团队的一场极限攻关。距离交付只剩6个月时,常乾坤做了一个大胆决定,砍掉处理器金属上盖,把散热器直接焊到芯片裸片上。

  这场50天的攻关,为十万颗芯片找到了一条更短的散热路径。

  50天极限攻关,一场压哨绝杀

  此前,浸没相变液冷已经是一条成熟度很高的顶级散热路径。主板和芯片被浸入冷媒中,冷媒在约五十摄氏度时沸腾汽化,将热量带走。

  可到了曙光8000,已有方案也要面对新的压力。

  2024年,常乾坤团队开始为这台十万卡级机器研发液冷系统,留给他们的时间不足两年。

  第一道关卡落在材料上,团队把数十种候选材料逐一送进实验室,最后留下的是金刚石粉。

  金刚石拥有极强的导热能力,将它与铜结合,做成金刚石铜合金材料,材料散热能力达到铜的2倍以上。

  即便如此,散热系统的满载测试依旧没有达标。

  传统散热路径上,热量要先穿过处理器金属上盖,再经过多层导热介质,最后才抵达散热器。每多一层,热量就多一道阻力。

  常乾坤团队决定去掉金属上盖,让金刚石铜散热器直接焊到芯片裸片上。导热路径从四层压缩到两层,热量离开芯片的距离被进一步缩短。但焊接界面里只要留下一点空洞,局部导热能力就会迅速下降。

  量产一度暂停。

  白天,团队在工厂生产样件。晚上,他们坐卧铺把样件送到焊接厂。每一批样件都要经过X光扫描,确认焊接界面是否还残留空洞。50天后,焊接参数终于被锁定。

  常乾坤后来形容,这次产品落地像一场压哨绝杀。

  给智能降价,液冷开始决定算力账本

  液冷团队解决的是一套散热系统,背后却是一道至关重要的产业算术题。

  一座高密度智算中心,成本从芯片采购开始,也会落到电费,机房面积,供电能力和冷却系统上。功率密度越高,热量越集中,为散热预留的空间和电力也越多。

  液冷抬高的是算力中心的密度上限。同样一块地,同样的供电条件,散热能力更强,能够部署的计算资源就更多,电力也能更多地转化为有效计算。

  曙光8000给出了这套考题的实际答案。

  2026年2月,系统先以3万卡规模上线试运行。6月,十万卡完成部署。每扩大一轮,供电、散热、通信和可靠性都要重新接受验证。

  真正的极限测试里,系统负载能在几十毫秒内从20兆瓦拉到近100兆瓦,相当于一座城市里几十万家同时开了电。算力负载突然拉升,热量也会随之集中涌出。液冷系统能否及时响应,决定这台机器能不能把高密度部署变成持续运行的能力。

  这也是曙光8000液冷方案的技术逻辑。

  散热器直封芯片,解决的是热量从芯片向散热器传导的第一段路径。浸没相变液冷,解决的是散热器与冷媒之间的热交换。前一段追求更短的传导距离,后一段承担更大面积的热量带走。两段接上,金刚石铜材料的导热能力才有机会进入整机运行。

  曙光的相变浸没液冷散热系统,已经形成整机柜级方案,最高支持单机柜兆瓦级功率,支持全年自然冷却,数据中心PUE低至1.04,也能够通过超高密度部署节省机房占用面积。

  PUE越接近1,辅助系统消耗的额外电力就越少。对一座长期运行的智算中心来说,这意味着更高的能效空间,也打开了更清晰的运营账本。

  对用户而言,液冷决定机房里能装多少设备,决定供电和冷却该怎样预留,也决定未来扩容时还有多少余地。过去被放在机房角落的散热问题,如今已经进入算力中心的核心规划。

  曙光8000上线首周,日均处理应用需求超过15万个,模型调用,科研任务和应用响应不断涌入。这组结果来自计算、网络、存储、供电和冷却的一体协同。

  液冷,为集群高密度协同运行提供了稳定的底盘。

  从千瓦到兆瓦级,为全场景计算松绑

  每一代通用技术的普及,都要先解决一笔代价。

  蒸汽机完成了把热转化为持续动力的过程,动力革命才得以扩散。电网解决了远距离输电和电压控制的问题,电才走进千家万户。今天的智能计算和高性能计算,同样要先解决热量。

  液冷之于高密度算力,就像冷凝器之于蒸汽机,它处理的是技术走向大规模应用前,绕不开的物理代价。

  然而,在不同的算力场景中,散热密度、改造成本和运维习惯都存在差异,单凭一套液冷方案很难通关——为多元化计算需求匹配定制化液冷方案,成为算力规模化落地前的终极一战。

  在大算力集群散热中的深厚积淀,正在让曙光液冷技术快速开枝散叶。从冷板到相变浸没液冷,其技术体系成功覆盖了几十kW到1MW+的全密度区间。

  其中,曙光8000在用的最新一代C8000 V3.0,正是全球首个规模落地的兆瓦级相变浸没基础设施整体解决方案。在技术路线规划上,直面下一代AI芯片架构对散热能力的极致需求。

  面对高密计算场景下的效能考题,曙光还提供了国内首个相变间接液冷方案,一举攻克传统水冷痛点,凭借无水、无腐蚀、无泄漏等优势,在高能效、高安全、高可靠方面大幅提升。

  此外,针对当前应用最广泛的中密计算场景,曙光冷板液冷补全了主流市场的关键一环,单机柜可支持30kW-100kW散热能力,且运维模式与风冷机房相仿,便于用户大规模改造升级。

  这种分层设计、按需匹配的全栈液冷技术布局,让智能时代的全场景计算逐步放下能效包袱,也让每一位用户在先进生产力场景中,跑得更快、更稳、更高效。

  智能时代的用算成本,显然不仅取决于供应链上的市场起伏、价格跌宕。真正的较量早已延伸到上游定价权之外,取决于系统级的硬实力和软实力融汇之间。正如散热系统的材料、焊接、管路、供电.....任何一环出现短板,整套系统都可能停在临门一脚。

  未来,谁能把技术能力和工程能力做成稳定的全案交付能力,谁就更有条件把智能计算成本降到规模应用可以承受的区间。

  这场压哨绝杀守住的,早已超过一个交付节点。它让曙光8000从能点亮走向敢满载,也让智能时代的地基里,多了一块经得起考验的砖。

相关阅读

    无相关信息