2026-09-23 17:27:47 中华网
2026人工智能计算大会(AICC2026)上,浪潮信息发布元脑HC2000多元算力机组。元脑HC2000是采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化的多元算力AI服务器机组。同等投资Token产能提升10倍,为容量型智算扩产。

随着大模型与Agent的发展,AI正在从“回答问题”走向“解决问题”,智能也逐步成为可以规模化生产和供给的资源。浪潮信息认为,Agent时代的AI计算要以Capability AI Compute能力型智算不断突破智能上限,以Capacity AI Compute容量型智算推动智能规模化供给。元脑HC2000是面向容量型智算需求的多元算力机组,以开放汇聚多元,以协同实现全局最优,让每一份计算资源产生更多的智能。
Agent规模化应用,对智能供给提出更高要求
生产足够多、足够便宜的智能并不容易。复杂Agent任务包含持续推理、工具调用、结果反馈和重新规划,需要计算系统持续提供推理服务。随着任务规模扩大、上下文持续增长,系统需要在满足服务水平要求的同时,提高资源利用效率,让算力投入转化为更多Token产出。因此,Capacity的扩展不能只是增加算力,更要让不同算力与不同负载精准匹配,让每一份计算资源产生更多的智能。
重新认识负载:AI推理不是一种单一的计算负载,把“大模型推理”真正拆开就会发现,不同计算负载有不同的计算特征。Prefill具有高并行、高计算密度的特点;Decode是逐Token串行执行,更依赖内存带宽;Attention需要频繁访问不断增长的KV Cache;MoE包含稀疏计算和大规模All-to-All通信。不同计算阶段、不同模型模块,有着独特的计算和数据特征。
重新配置算力:不同负载还会随着上下文长度、输出长度和并发规模动态变化,系统瓶颈可能在计算、显存容量、带宽和网络通信之间不断转移。这意味着,只用同一种芯片和同一种服务器形态,并不是最高效的算力组织方式。需要按照不同的计算负载重新配置算力,不再要求一种芯片什么都做,而是让不同算力承担最适合自己的负载。
重新组织系统:简单增加更多的服务器,不仅无法带来线性的容量增长,还可能因为资源配比失衡、跨节点通信和任务排队,使部分算力长期闲置,另一部分资源持续拥塞。因此,需要通过统一软件栈,把不同芯片、推理阶段、存储层级组织成高效协同的整体。
元脑HC2000,同等投资Token产能提升10倍
面向智能规模化供给需求,浪潮信息发布元脑 HC2000 多元算力机组。元脑HC2000是采用DirectCom 2.0极速架构,基于高密液冷AI整机柜、搭配MCIS推理软件栈,实现计算负载按需匹配、动态优化的多元算力AI服务器机组。同等投资Token产能提升10倍。
高密液冷AI整机柜。元脑HC2000的核心组件是高密液冷AI整机柜,采用全液冷设计和高通流供电,突破传统风冷机柜的散热与供电瓶颈,单柜最大承载256张AIPU,算力密度实现4倍跃升,并支持标准开放加速模组,适配多元本土算力芯片。同时,DirectCom 2.0极速架构让通信能力与算力密度同步扩展,实现计算与通信1∶1均衡配比,柜内聚合带宽可达200Tbps,支持跨柜多平面无损扩展。

多元算力承载。在高密部署和算网均衡的基础上,元脑HC2000进一步将不同算力与计算负载精准匹配。在Prefill阶段,可选择大算力芯片搭配LPDDR颗粒,匹配高并行、计算密集的特点,并兼顾配置成本。在Decode阶段,可选择具有大容量HBM的AI芯片,兼顾显存容量和带宽;针对计算稀疏、IO敏感的FFN环节,可选择3D DRAM堆叠芯片,缩短数据搬运路径、提高访存带宽。通过这样的分工,让多元芯片充分发挥各自的能力优势,再通过软件栈组织起来,共同完成推理任务,提升整个机组的Token产出效率。

为充分释放元脑HC2000的性能,浪潮信息打造了「MCIS多元算力协同推理软件栈」,覆盖请求路由、P/D分离推理、算力动态调整和KV Cache管理等关键环节。MCIS支持多元算力的P/D分离计算框架,兼容主流本土AI芯片及SGLang、vLLM等推理框架,让不同类型的算力能够灵活组合、协同计算。

Prefill与Decode算力动态调整。面向多元算力“选型难、部署难、定位难、优化难”的问题,MCIS构建了“测量、分配、监控、调整”的优化闭环。部署前,通过性能仿真评估不同芯片、并行方式和P/D组合,找到更合适的配置方案;方案确定后,根据现有资源自动完成资源分配、环境配置和P/D实例部署。系统上线后,通过贯通请求、计算、缓存和传输的全链路监控,及时识别性能瓶颈及实际运行与模型预测之间的偏差。当业务负载发生变化时,重新评估并调整P/D配比、实例数量和负载分配,再通过实际运行验证调整效果,将部署前的方案设计与部署后的运行优化贯通起来。

支持多元算力的KV Cache管理框架。算力规模越大,KV Cache流动的效率就越重要。MCIS打通不同类型算力之间的点对点数据直传,避免CPU中转和重复拷贝,小数据量传输性能最高提升约5倍。同时,根据KV Cache数据的冷热程度构建分级存储体系,结合其数据结构特点,通过多级流水、并行聚合等技术优化,在相关多盘测试中,将节点内本地磁盘IO性能提升约32倍。通过突破KV Cache的存储与传输瓶颈,让数据更高效地流动,将多元算力的潜能转化为大模型推理的实际效能。

同时,浪潮信息面向能力型智算需求发布元脑SD200 Ultra超节点AI服务器。元脑SD200 Ultra基于本土AI芯片,单机承载运行2.8万亿参数的Kimi K3大模型,Token生成时延首次突破5.85毫秒。元脑SD200 Ultra以开放系统设计紧耦合128芯本土AI芯片,实现统一内存寻址超低延迟通信,支持10万亿参数规模前沿模型,打造面向Agent时代的能力型智算标杆。
从“提供算力”走向“生产智能”,计算系统需要在拓展智能能力边界的同时,持续提高智能供给效率。浪潮信息将围绕模型和Agent的实际需求,通过全栈规划与跨层协同推进贯穿式系统创新,以开放的系统架构汇聚多元算力,让高水平智能以可负担的成本进入更多企业和行业应用。