阿里云推出新一代全栈自研高性能存储CPFS:为百万卡模型训练加速

2026-09-22 17:32:45 世界浙商

世界浙商客户端讯(记者 姚恩育)9月22日,2026云栖大会上,阿里云正式推出面向下一代AI训练集群的新一代高性能存储CPFS(Cloud Parallel File Storage),提供高达百TB/s级吞吐和亿级IOPS,单文件系统规模提升5倍至100PiB,为百万卡模型训练加速,支撑大规模模型训练和多模态数据处理。在实际训练中,可将模型启动平均耗时降低50%、峰值算力利用率提升30%、AI存储成本降低69%,业务承载能力翻倍。

 

随着大模型训练进入规模化阶段,数据集由文本扩展至图片、视频和语音,规模可增长50倍甚至百倍;模型参数规模增长约10倍,Checkpoint保存也更加频繁。海量小文件并发读取和 Checkpoint 突发写入由此成为新瓶颈,存储如果无法跟上,昂贵的GPU集群就会因数据供给不足而空转。

针对这一问题,新一代CPFS采用数据服务与元数据服务分离架构,实现容量和性能的水平扩展。GPU、CPU节点通过EFC弹性客户端和虚拟存储通道,接入分布式元数据和数据服务;结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成从客户端、协议处理到数据落盘的全链路自研链路。

据悉,新一代CPFS文件系统容量规模提升5倍、元数据性能提升10倍、文件数量规模提升100倍,单文件系统可扩展至百PiB并承载万亿级文件。企业无需为不同训练阶段反复拆分或迁移数据,即可在统一文件系统中管理训练语料、模型参数、Checkpoint和实验结果,并随GPU集群同步扩展容量与吞吐。

针对冷热数据长期并存带来的成本压力,CPFS还提供智能生命周期管理和冷热分层存储,使不同访问频率的数据自动匹配合适的存储介质,在保障训练性能的同时,整体存储成本最高降低69%。以Qwen大模型训练为例,采用新一代CPFS后,模型启动平均耗时降低50%,峰值算力利用率提升30%,业务承载能力翻倍。

面向大模型推理,阿里云同时推出KVCache加速引擎——KVCacheStore。它位于GPU显存、主机内存与远端共享存储之间,是基于近计算部署、高性能网络和弹性共享存储构建的新型G3.5存储层,以“存储换计算”承接长上下文、多轮对话和复杂Agent任务产生的大量缓存。KVCacheStore支持与算力亲和部署,单计算节点吞吐达到40GB/s,通过Batch接口实现百万QPS,单实例可满足千亿级KV存储规模,实测缓存命中率提升20%以上。

“每一次模型的跃迁,都是云存储自我革新的最佳契机。”阿里云存储产品负责人蒋江伟表示,阿里云将持续推进算、网、存协同创新,让数据更快进入计算、GPU得到更充分利用,为大模型训练和AI应用提供高性能、可扩展且成本可持续优化的存储底座。

来源:世界浙商客户端