AI时代数据存储架构如何创新?西部数据在WAIC公布路线图
先说个核心判断:AI能不能真正实现可持续、经济高效的规模化发展,关键就看数据怎么存、怎么管、怎么保。在刚刚结束的WAIC 2026上,西部数据通过展台和专题分论坛,把这事掰开揉碎讲了一遍。
展台上,他们亮出了两项业界首创的HDD技术——高带宽硬盘技术和双枢轴硬盘技术,再加上HAMR、ePMR和UltraSMR这些硬核技术。这些技术并非孤立存在,而是跟整个平台产品线深度绑定,专门为规模化AI基础设施量身定做。

其中,高带宽硬盘技术很有意思——多磁头同时在多个磁道上读写,功耗不增加,带宽却能达到传统HDD的两倍。而且这东西还有清晰的拓展路径,未来最高能实现8倍的带宽增益,目前已经交付客户做验证了。双枢轴技术则在独立枢轴上增加了第二组独立运行的执行器,在3.5英寸硬盘里能提供2倍顺序IO性能增益。跟以往那些牺牲容量、还要客户大改软件的双执行器设计不同,它通过缩小磁碟间距,在单盘里塞进更多磁碟,容量也跟着上去了。
这两项技术组合在一起,能把HDD的顺序IO性能整体拉到4倍,实现100TB容量不说,还能保持每TB的IO速率不变。这意味着客户在扩容时,不用急着加SSD或者重构服务架构了。
当然,展出的不止这些。还有面向大规模数据存储环境的Ultrastar企业级HDD系列:40TB和34TB的Ultrastar DC HC6100 UltraSMR硬盘、30TB和28TB的Ultrastar DC HC5090 CMR硬盘、采用HAMR技术的40TB Ultrastar DC HCS100 UltraSMR硬盘,以及用上高带宽和双枢轴技术的性能优化型硬盘。值得注意的是,采用UltraSMR ePMR技术的40TB HDD已经进入客户认证阶段,预计2026年下半年量产。
存储平台方面,全新Ultrastar Data60 3000混合存储平台、OpenFlex Data24 4200存储平台以及RapidFlex C2000网络交换桥接适配器也一并亮相,目标很明确:支持可扩展部署,灵活用资源,满足现代数据基础设施的要求。
7月19日下午,西部数据办了一场以“面向AI时代的数据存储架构创新”为主题的分论坛。西部数据开发工程高级副总裁Tim Rausch做了主题演讲,他从一个很关键的差异点切入:计算周期可以重复利用,但数据会持续累积。
Tim强调,AI本质上不光是计算系统,更是数据系统。训练和推理循环往复,每一次交互都会产生新数据,这些数据被存储下来,再重新纳入训练,去改进后续模型。存储需求由此变得持续且累积。怎么高效管理这些海量数据,才是行业真正的核心挑战。
他重点讲了三类工作负载:
第一类是训练数据。通常一次写入,放在HDD上,周期性读取——因为模型不是24小时都在训。随着用户生成的内容回流到AI数据循环里,训练数据量还会持续增长。所以这一层,最看重的就是能扩展到EB级、成本还划算的存储——这正好是HDD的用武之地。
第二类是推理。比如你让AI给个晚餐食谱、生成一张图片,同时还有几百万用户也在这么干。这会产生大量随机小数据读取,还得用内存来保留对话上下文。所以这层既需要高带宽和高IOPS,也需要持久化存储——这正是SSD的舞台。
第三类是推理输出。AI生成的食谱、图片、日志、追踪记录、合规记录和元数据,都在这儿。很多数据最初在HBM或DRAM里,但很快会向下迁移到HDD做持久化存储。
有意思的是,AI存储栈跟传统云应用的存储栈不太一样。传统应用可能就两个层级:闪存和HDD。比如一个应用里有几千张图,用户打开时最先看到的10到20张从闪存出,快速呈现;再往下翻,就从HDD加载,因为HDD更划算。开发者根据性能和成本,把内容放到合适的层。AI构建者沿用同一套原则,但层级更多。
最上层是模型权重和GPU显存溢出,也就是HBM或DRAM,紧挨着昂贵的GPU,持续给它喂数据。下一层是KV缓存,也就是AI系统的短期记忆,主要用DRAM和SSD。再下一层是语义数据库,存向量、嵌入和RAG数据,通常跑在SSD上的高性能数据层。最底层就是HDD大容量存储,用来保存日志、用户生成内容副本和训练数据。

“在规模化发展中,经济性决定架构。”Tim这句话说得很到位。用闪存处理性能敏感型的小数据读取,用HDD承载不断累积的写入流——这种智能数据分层和均衡的存储架构,不仅扛得住持续增长的数据规模,还能让AI基础设施变得务实、优雅且经济可行。
他举了个例子:生成一个3.97MB的视频,需要在整个存储栈里完成46.5GB的读写,最终在后端留下506MB数据。当推理输出被存储、重新纳入系统并用作合成训练数据后,就会形成“模型改进—更多推理—更多输出被留存”的自我强化循环,持久存储层也就越滚越大。

Tim认为,成功的AI企业会把数据放在正确的层级,并且让数据在AI存储栈的4个层级里持续迁移。“目前我们看到,约80%的AI内容存储在HDD上,20%在SSD上。”他特别强调,这不是说HDD的市场份额应该更高,而是数据总量本身在增长,HDD和SSD不是存量竞争,而是互补。HDD、SSD、DRAM、HBM,各按性能和成本部署在最合适的位置。
最后,西部数据还透露了未来五年的路线图。他们将采取ePMR与HAMR并行发展的路径,帮助客户平稳迈向2029年单盘100TB以上的容量。对于需要高性能的工作负载,用高带宽和双枢轴技术来提供带宽和IO性能增益。针对AI交互生成并需要持久留存的数据,则用功耗优化型HDD来提供经济可持续的解决方案。此外,他们还会利用智能平台,把HDD的经济性和优势延伸到更广的客户群体。

