首页 > 新闻

中国算力,改写下一代大气模式

2026-09-16 18:22:11        


  一座大型算力中心尴尬的时刻,可能不在建设延期,反倒在于建成之后没有合适的任务可跑。

  过去几年,中国算力规模快速增长,一批智算中心相继落地。供给和需求之间却没有自动完成连接。相关数据显示,部分地区中小规模智算中心的利用率不足三成。

  如何让算力集群在投运之初解决问题,也是全球高性能计算领域面对的难题。世界级算力设施不能只在性能排行榜上证明自己。机器能否迅速进入真实任务,才真正决定基础设施的价值。

  9月15日,中国气象局地球系统数值预报中心与中科曙光联合宣布,MCV下一代大气模式在全国产十万卡AI超集群曙光8000上完成GPU全模式异构并行移植,成功将全球五公里分辨率下未来十天的预报计算压缩至约一小时。而解锁此项成就,距离曙光8000上线刚一个多月。

  五公里是一道窄门

  天气预报,是超级计算机很难糊弄过去的考场。

  天气可不是不会停下来等机器,新的观测资料不断进入,预报结果还要留出制作产品的时间。计算慢了,算出来的天气就成了过去。样本量复杂、计算速度,让这里成为大国超级计算设备的试炼场。

  而五公里,更是一道计算设备难以逾越的窄门。

  1952年,英国研究人员用间距约二百六十公里的网格,计算未来二十四小时的天气,仍然需要四小时。中国从1954年开始数值天气预报研究,但直到1991年,我们网格范围还是300公里,而这种还是依托中国在国产银河大型机去的,彼时我们还需要运行以欧洲模式为基础的全球预报系统。

  此后,中国开始建设自主模式。2009年,GRAPES全球模式进入准业务运行。2016年,自主全球预报系统正式投入业务,CMA全球模式将水平分辨率推进到十二点五公里。

  从十二点五公里走向五公里,网格变小背后,计算任务却迅速膨胀。

  水平网格缩小到原来的五分之二,全球需要处理的格点数量会增加到原来的六点二五倍。为了保证计算稳定,模式还要缩短时间步长。仅计算次数就可能达到原来的十几倍,通信和数据读写的压力也会同步增加。数千张卡必须持续交换信息,某些节点慢下来,其他节点便只能等待。

  海外气象强国依靠长期运行的模式体系和持续升级的超级计算机,跨过了这些门槛。

  德国气象局的全球ICON模式采用约十三公里网格,每天运行四次,在其超级计算机上完成一百八十小时预报大约需要一小时。欧洲中期天气预报中心的业务全球模式已经运行在九公里级。继续向公里级推进时,欧洲又调动LUMI,Leonardo,MareNostrum和JUPITER等超级计算机,支撑目的地地球计划开展四点四公里全球模拟,并向二至四公里推进。

  美国全球预报系统每天运行四次,两套超级计算系统长期互为备份。美国国家海洋和大气管理局又在推动全球模式迁往云端高性能计算平台。欧美的模式,资料同化,超级计算和业务流程经过多年磨合,机器既要算得快,也要长期稳定运行。

  曙光8000,补上了自主MCV走向全球公里级预报所需要的计算底座。

  MCV采用自主动力框架,也面向新型高性能计算体系设计。动力、物理和插值模块进入异构计算,以此实现了全球五公里模式向前计算十天,约一小时完成。

  曙光8000目前也已完成全球三公里模拟试验,展示了系统向精细尺度推进的能力。此次五公里运行把未来十天的计算控制在约一小时,让高分辨率模式接上了气象业务的时间窗口。

  过去,中国依靠引进模式在国产银河大型机上建立全球预报业务。今天,自主MCV模式运行在国产十万卡系统上,国产加速卡、通信、调度和输入输出共同支撑全球五公里计算。变化已经覆盖整条技术链。

  曙光8000让自主模式获得了匹配的计算底座,也让中国天气预报真正进入全球公里级竞争,稳稳上桌。

  大机器要带着应用出生

  对大型算力基础设施来说,开机和开工是两码事。

  2023年6月,美国极光超级计算机的10624个计算刀片全部安装完成。直到2025年1月,这套系统才正式向科研用户开放,中间隔着约19个月。早期科学项目不断把真实程序送进去,测试硬件,寻找故障,迁移代码,调整计算流程。等到正式开放时,70多个科研和工程项目已经可以在上面运行。

  日本富岳从2014年开始由理化学研究所和富士通联合研发,2021年完成并投入共享使用。新冠疫情暴发时,机器仍在安装,部分资源已经开放给药物筛选和飞沫传播研究。富岳能够提前接住任务,靠的是应用开发早已进入系统建设过程。

  这些超级计算机有着共同的工程规律。规模越大的机器,从设备安装到稳定运行真实程序,中间越需要漫长的联调,应用准备不能等到通电之后再开始。

  曙光8000产品上线1个多月便助力MCV取得世界级成果,其间究竟发生了什么?

  作为首个全国产十万卡级AI超集群,曙光8000采用国产CPU和GPU异构体系,计算精度覆盖FP64至INT8。高精度计算可以求解大气方程,较低精度计算可以承担模型训练与推理。

  能力强,但工程难度也被推到十万卡规模。

  1张卡运行顺利,放进大规模卡群里,情况便会改变。某些节点提前算完,只能等待其他节点。卡与卡之间交换数据,可能堵在通信网络。计算结果快速生成,又可能堆在存储入口。规模扩大会把微小波动放大,故障隔离,任务调度,液冷,供电和能效管理必须共同维持系统运行。

  MCV进入曙光8000,先要完成全模式异构移植。动力,物理和插值等关键模块经过改造,MPI,OpenMP和OpenACC共同承担并行任务。同套代码既要适应国产加速器,也要保留CPU运行能力。

  程序能够启动,只是迁移起点。后面还有单元测试,全模式联调,结果校验和10天预报绘图验证。代码必须连续运行,计算结果还要保持一致,流程也要能够复现。否则,任何问题都可能迫使团队回到前面的环节重新检查。

  费力的部分,往往藏在数据流动途中。

  围绕这条链路,中科曙光与研发团队进行了多轮调整。计算资源利用率提高约10%,通信模块相关算法加速3.7倍,输入输出性能提升超30倍。

  截止目前,曙光8000已经适配近200项行业应用,近百项应用实现万卡规模扩展。MCV进入的并非空白系统。此前积累的迁移,优化和规模调度经验,为这次全球天气预报运行铺好了路。

  即便如此,曙光8000接下来也要接受长期业务的考验。但上线1个多月能够跑起MCV,已经把建成即用落到了真实计算里。

  10万张卡摆进机房只是起点,机器开机以后,真实任务无需继续等待,才算大集群开始工作。

  大国算力要有自己的时钟

  MCV进一步证明了曙光8000从开机到开工的跨越,也把这次气象计算推到了大国算力竞争的坐标上。

  过去几年,外界习惯用卡数,精度和峰值性能衡量算力。但国家需要计算时,任务还要经过网络,存储,调度和基础软件。任何环节撑不住,卡数就只能留在报表里。

  大国算力有两本账。硬件账记录卡数和性能,任务账记录能解决什么问题,需要多久交付。前一本账体现投入,后一本账决定投入能否转化为国家能力。

  美国在1992年停止地下核试验后,开始依靠高性能计算维护核武库。近30年后,百亿亿次超级计算机El Capitan投入这项任务,模拟材料变化和核武器内部的极端物理过程,为安全性与可靠性评估提供依据。

  美国橡树岭国家实验室则用Frontier研究聚变装置中的等离子体湍流。过去受到算力限制,研究人员只能分别处理离子或电子。Frontier投入运行后,两者的复杂作用可以进入同次模拟,计算结果将影响未来聚变装置的加热方式和运行方案。

  核安全无法反复试爆,聚变研究也无法把所有方案送进真实装置。超级计算机让国家在虚拟环境中排除错误,压缩研发周期,在蛋白质、星际探索、数学等重大科学研究上扮演者基础设施级的重要作用。

  在这一轮的比拼中,中国AI竞争也正加速进入系统阶段,成为基础科学研究的重要支撑。无论大模型训练,还是工业仿真和地球系统模拟等,也有都需要大规模卡群稳定协同。

  曙光8000承担的,是把国产算力组织成系统。这套十万卡级AI超集群覆盖FP64至INT8精度,可以支持科学计算与人工智能任务,还接入国家超算互联网。

  MCV给这套基础设施安排了一次国家级考试。国产加速卡共同运行完整大气模式,动力,物理和插值模块完成异构迁移,通信与输入输出承受全球高分辨率预报的数据压力。

  天气预报在这里承担试金石角色。任务复杂、数据量大、交付时间固定场景下,某处出现瓶颈,结果就会迟到。曙光8000接住这项任务,国产芯片、网络、存储和软件也开始围绕重大任务协同。

  El Capitan、Frontier和曙光8000,它们服务的领域不同,但却共同指向大国竞争的新战场——谁能更快把科学问题转化为计算任务,谁能让庞大系统稳定交付结果,谁就能把计算优势变成科研速度、产业效率和决策能力。

  大国算力的分量,正写进MCV下一代大气模式,更写在国家面对重大问题时的求解能力。

相关阅读

    无相关信息