2026-08-26 17:42:12
8月26日,武汉,2026全球闪存峰会。
中科曙光北京公司总裁助理、分布式存储产品部总经理石静公布了几组数字:根据赛迪顾问《中国分布式存储市场研究报告(2026)》,中科曙光在AI大模型、教育、具身智能、自动驾驶四个行业蝉联中国市场第一。其中AI存储连续三年第一、教育存储连续四年第一。
同时,她预告了即将推出全新的词元加速方案,基于存算协同,直指大模型推理的性能释放。
结合两个月前ISC 2026的背景看,信号更完整——曙光ParaStor F9000刚在大会上拿下IO500生产型榜单双榜第一。全球顶级存储榜单榜首,和四个垂直行业的份额第一,落在同一家公司身上。

但真正值得拆解的问题不是“曙光的存储有多强”,而是存储这个长期被当作配角的基础设施,为什么在AI竞赛进入深水区之后,开始成为决定牌局走向的关键变量。
市场天平翻过来了
AI竞赛的叙事长期围绕GPU展开。但大模型训练的真实瓶颈,已经从“算不动”转移到了“喂不饱”。存储I/O跟不上,再贵的加速卡也只能空转。
赛迪报告给出了一个值得注意的结构性变化。在AI场景广泛应用的分布式存储,其市场规模从2022年的104.2亿元增长到2025年的289.4亿元,累计增幅177.8%。
数字背后是需求逻辑的根本变化。大规模分布式训练中,网络通信耗时占比已达30%至50%。一个万卡集群对存储的要求远不止“容量够大”——海量训练数据集的高并发读取,CheckPoint的秒级快照恢复,这些需求逼着存储系统做架构层的革新,而不是容量层的加法。
全闪存的渗透也在加速。分布式全闪存占比从2022年的16.8%升至2025年的24.5%,驱动力来自AI训练对TB/s级带宽和百万级IOPS的刚性需求。但报告同时指出,当前全闪存增速正在放缓——要突破30%的渗透率,得等QLC成本下探或CXL等新介质技术成熟。
这个放缓本身就是信号:全闪存已经完成了从"尝鲜"到"标配"的跨越,剩下的问题交给成本曲线,不是认知曲线。
四个行业第一,凭什么
赛迪报告公布的四项第一,含金量不在“第一”本身,而在四个场景对存储的极端要求几乎互不重叠。
大模型训练拼的是吞吐。万亿参数模型,训练数据集以PB计,CheckPoint写入动辄数TB。曙光把训练周期从数月压到数周,靠的是220GB/s带宽和千万级IOPS。这些数字只有放在真实训练场景里才有意义——实验室峰值说明不了什么。
具身智能的命门在时延。在中科曙光与智元机器人的合作中,多模态数据的读取模式比文本训练复杂得多,存储层每卡一下,机器人的响应就慢一拍。这个场景要的是"稳定地快",不是"偶尔地快"。
自动驾驶的挑战在多源异构。摄像头、激光雷达、毫米波雷达产出的数据格式和读取模式各不相同,存储系统得同时扛住高并发小文件读写和大块顺序写入。曙光给国内头部造车新势力提供海量存储资源,模型研发周期缩短40%以上,TCO降低40%——两个40%叠在一起,说明优化发生在工程层,不是参数表上。
教育科研的壁垒在扩展性。北大、西湖大学、同济、华南理工都在用。赛迪报告的评价是"EB级扩展能力和高性能非结构化数据处理"。高校科研的特点是任务类型极度分散,从基因组学到天文数据,存储系统得在不牺牲性能的前提下接住完全不同的负载。中科曙光不仅顺畅承接了这些差异化任务,还帮助北京大学现代农业研究院将科研作业速度提升40%。
四个场景的共同点:通用存储全部失效。中科曙光能同时拿下这四块,靠的不是某项指标的领先,而是深入场景做定制化的能力——把存储从"通用设备"做成"场景解决方案"。
存储的下一步,从训练走向推理
相比于过往,行业未来的走向更值得关注。
石静预告的词元加速方案,指向一个更重要的趋势:大模型产业重心正在从训练侧向推理侧迁移,存储的边界也跟着拓展。
训练侧要解决的是"喂饱"——海量数据高吞吐加载,CheckPoint秒级恢复。推理侧要解决的是"快读"——KV-Cache的高频随机读取,直接卡住推理响应延迟。赛迪报告说得很清楚:传统存储撑不住KV-Cache的高频随机读取,分布式全闪存靠亚毫秒级延迟和百万级IOPS补上了这个缺口。
可以大胆推断,词元加速方案要做的事,是把训练侧已经跑通的存算协同逻辑搬到推理场景——存储层与推理引擎深度协同,压低词元生成时延,拉高推理吞吐。到了这一步,它已经不只是一个存储产品,更接近"推理基础设施"。
赛迪报告预测,2026至2028年中国分布式存储市场规模将从428.3亿元增至838.4亿元,三年增量超410亿元。市场在扩容,产品形态也在变——从"通用基础设施"转向"场景定制化解决方案"。报告对竞争格局的判断同样直白:AI适配能力是分水岭。能不能撑住万卡集群的高吞吐、快照恢复和弹性扩展,决定厂商在下一轮竞争中的位置。
回到武汉这场闪存峰会。中科曙光拿出的其实是一张能力版图:IO500证明了单点技术的上限,四个行业第一证明了场景落地的广度,词元加速方案预示了技术路线的下一步。
三者拼在一起,指向一个判断:存储的问题,从来不是能不能存下。而是存下之后,数据能不能在正确的时间、以正确的速度、流向正确的地方?
在这个问题上,中国厂商正试图主动定义。