
【内容目录】
一 、AI开始需要更大的工作台
二、 HBM与HBF提供两种不同的能力
三 、HBM热潮如何影响其他存储产品
四、新的记忆层已经有了硬件形态
五、长鑫与长江存储的机会在哪里
六、需求最终落到材料和工艺
摘要
过去几年,AI服务器的存储故事,主角几乎总是HBM。现在,热度开始向外扩散:专用缓存服务器出现,闪存参与推理,国内存储厂也在加快工艺和产品布局。AI需要的存储正在变多,放置数据的位置也在改变。
2026年3月16日,Penguin推出专门保存推理缓存的服务器;同日,NVIDIA公布了支持共享上下文存储的系统方案。9月17日,华为发布OceanStor M900 AI记忆存储。这些产品共同回应一个问题:当AI需要记住越来越多内容,哪些数据值得留在昂贵的显存里,哪些可以放到其他地方?
一、AI开始需要更大的工作台
以前让AI回答问题,像请人查一页资料;现在让Agent分析一批财报,它要翻文件、查数据、做计算,还要记住前面做了什么。为了避免反复从头读,模型会保留一部分中间计算结果,这就是键值缓存KV Cache。可以把它理解为AI工作台上暂时摊开的资料。
工作台越大,做事越方便,但没必要把所有资料都堆在最贵的位置。一种思路是,先把暂时用不到、以后还可能复用的数据移出去,需要时再取回来。省下的显存可以服务更多请求,但搬运数据也要花时间。新的“记忆层”,就是要在这里找到速度和成本的平衡。
二、HBM与HBF提供两种不同的能力
高带宽内存HBM与常见的内存条,都以DRAM技术为基础,适合频繁读写。不同的是,HBM将多层芯片堆叠起来,通过大量并行连接给GPU供数。它像紧贴计算核心的高速工作台,优势是数据来得快,代价是制造、封装和扩容都不轻松。

图1 NVIDIA Grace Blackwell Ultra官方板级图:上方为两颗GPU,中部为Grace CPU,下方为ConnectX-8网络芯片。GPU配HBM3E,CPU配LPDDR5X。
高带宽闪存HBF,以NAND闪存为基础,常见固态硬盘(SSD)也使用这种存储介质。它尝试让更多数据同时读出,在计算芯片附近提供更大容量。但NAND读取一次数据通常比DRAM慢,反复写入还会消耗擦写寿命。因此,HBF主要面向模型权重等读多写少的数据,不能只凭读取带宽判断它能替代HBM。
Sandisk与SK海力士正在推动HBF规格和标准化。Sandisk的配置示意展示了两者配合的思路:保留一部分高速内存,再用闪存增加容量。图中的数字属于选定方案,并不代表现有GPU已普遍采用。

图2 Sandisk官方HBF结构示意。图内8—16倍容量为厂商定位,非行业统一实测。

图3 Sandisk选定配置:8个HBM为192GB;6个HBF加2个HBM为3120GB;8个HBF为4096GB。并非HBM容量上限或量产配置证明。
H³论文也在研究HBM与HBF怎样配合,用缓冲和调度减少GPU等待闪存数据的时间。目前仍是论文和仿真方案。如果原本增加GPU只是因为模型装不下,那么HBF扩容就可能减少这部分投入;前提是数据读取不会拖慢计算。
三星也在探索另一条路。2026年8月展示的zHBM,是把HBM向AI计算芯片上方堆叠的三维内存概念,目标是缩短数据传输距离、改善带宽与能效。它仍属概念路线,却提醒我们:存储竞争已经延伸到芯片怎样摆放、怎样连接和怎样散热。

图4 三星zHBM官方概念模型。Core Die为存储芯片,xPU为计算芯片;图中标语属于概念目标。
三、HBM热潮如何影响其他存储产品
AI服务器并非只有显存。美光在2026年6月的产品说明中,除了强调HBM,还介绍了系统内存如何支撑更长上下文,以及数据中心固态硬盘如何保存可复用缓存。Agent任务增加,新增需求因此可能同时落到几类存储产品上。
另一方面,扩产有资源约束。美光在6月24日业绩会中指出,HBM需求增长、每代产品需要更多制造资源,都会挤压其他DRAM产品的供给。部分厂商把原用于NAND的洁净室空间转向DRAM,也会限制闪存扩产。这里争夺的是厂房、资金和设备投入,并非两类芯片可以随意换线生产。
客户也开始提前锁定供给。美光同次披露已签署16份战略客户协议,典型期限覆盖2026至2030年。长期承诺有助于支持扩产,但不会立刻变出厂房和合格产品。需求增长、价格上涨、产能增加之间,仍隔着建设、验证和良率提升的时间。
四、新的记忆层已经有了硬件形态
用于保存和复用推理上下文的存储资源,被称为上下文内存(Context Memory)。这个名字说明的是用途,并不特指一种新芯片。专用内存服务器和共享闪存,都可以承担其中的工作。
Penguin的MemoryAI最容易理解:单独做一台保存推理缓存的服务器。它在机内配置3TB主存,再通过内存互连协议CXL接入最多8TB扩展内存,合计最高11TB。这里扩充的是缓存服务器的内存。客户可以单独增加这部分容量,不必每次都连GPU一起购买。

图5(左)SMART CXA-8F2W CXL扩展卡,含8个DDR5内存插槽。
图6(右)Penguin CXL内存服务器官方产品图,展示可单独配置的容量设备。
NVIDIA的CMX则把固态硬盘组成共享缓存,供一组计算节点使用。BlueField-4负责管理这些硬盘,再配合网络和软件,将需要复用的上下文送回计算节点。这样,闪存开始直接参与推理过程,帮助减少重复计算。
华为OceanStor M900也瞄准了保存和复用上下文的需求。这几家的产品形态不同,但都在尝试把部分“记忆容量”单独配置,让客户不必只靠增加昂贵的显存来扩容。
能否省钱,还要看取回数据的代价。如果GPU因此长时间等待,节省的内存成本就可能被抵消。对产业而言,值得跟踪的是这些设备能否获得持续采购,以及实际带来多少内存、硬盘和控制芯片需求。
五、长鑫与长江存储的机会在哪里
国内最直接的新进展来自长鑫。9月20日,公司宣布第五代DRAM技术平台G5量产,并展示两款单颗容量24Gb的LPDDR5X产品。它们首先面向手机和便携设备,不能据此认定长鑫已经供应HBM或上下文服务器,但更高密度的DRAM工艺,是扩大产品能力的基础。
比一串制程参数更容易理解的是晶圆产出。按长鑫官方统一换算到8Gb颗粒的口径,G5每片晶圆的毛裸片数较第四代提升至少50%。同一片晶圆能容纳更多芯片,为成本改善提供空间;最终良品成本仍取决于加工步骤、良率和产线利用率。

图7 长鑫G5平台官方发布图。图中参数为厂商披露;裸片数增幅按8Gb基准比较,不代表良率或利润同步增长。
长江存储则拥有3D NAND和企业级SSD产品基础。其Xtacking架构将存储阵列与外围电路分别制造,再通过晶圆键合连在一起。当闪存开始保存部分推理上下文,客户关心的不只是能存多少,还包括数据能否及时取回、设备能否长期稳定工作。已有产品为进入这类应用提供了基础,能否形成订单,还要看具体系统的验证和采购。

图8 长江存储Xtacking官方3D NAND结构示意:外围电路与存储阵列分别制造,再通过晶圆键合集成。
两家企业的业务边界也值得观察。路透9月18日援引知情人士称,长鑫计划在北京新厂建立NAND研发产线,并已与客户讨论相关计划。报道同时说明,启动时间以及是否走向大规模商业制造尚不明确。这条消息的价值,是出现了跨向闪存的布局意向,而不是“长鑫NAND已经量产”。
对国内存储企业,更值得追踪的是良率、客户导入和持续交付。技术进展跨过这些环节,才有条件转成收入。
六、需求最终落到材料和工艺
对材料和工艺企业来说,需求最终要变成能稳定量产的芯片。HBM扩容涉及把更多、更薄的DRAM芯片叠在一起。层间连接是否可靠、薄芯片会不会翘曲、热能否及时散出,都会影响良率和寿命。
SK海力士对MR-MUF封装的介绍就是一个例子:芯片之间的填充材料既要保护堆栈,也要帮助散热、控制翘曲。这里的竞争涉及材料配方与工艺配合。带宽继续提高时,导热与可靠性也会影响芯片能否长期维持性能。

图9 SK海力士官方封装示意。左为TC-NCF膜状材料,右为MR-MUF模塑底填料;示意不按比例。
3D NAND提高密度,主要是在单颗芯片内部增加存储层数。层数越多,深孔刻蚀、薄膜沉积和应力控制的难度越高;采用晶圆键合的路线,还要控制表面状态与连接缺陷。这些要求能否变成订单,取决于供应商能否通过验证,并在量产线上持续控制缺陷和成本。
因此,观察这轮存储变化,可以沿着产品发布往后追:客户有没有采用,出货能否持续,新增容量是否真正降低系统成本。存储涨价会影响投资意愿,却不能保证每种材料、每台设备同时受益。
AI需要记住的内容越来越多,行业开始为这些数据单独配置存储。扩容是否划算,要看取回数据的速度和整个系统的成本。对材料和工艺企业,下一步值得追踪的是:哪些产品开始持续出货,又带动了哪些产线扩建和材料验证。
参考文献:(上下滑动可查看):
[1] Penguin Solutions.MemoryAI KV Cache Server发布公告.2026-03-16。
[2] NVIDIA.CMX Context Memory Storage Platform.官网产品页。
[3] Huawei.OceanStor M900 Context Memory Storage发布公告.2026-09-17。
[4] vLLM.Automatic Prefix Caching.官方技术文档。
[5] NVIDIA.Inside NVIDIA Blackwell Ultra: The Chip Powering the AI Factory Era.2025-08-22;官网板级原图及内存配置说明。
[6] Sandisk.HBF Fact Sheet.2025-07;结构和容量配置原图。
[7] IEEE.H³架构研究 文献号11371745.论文及仿真。
[8] Samsung Semiconductor.FMS 2026下一代3D内存愿景.2026-08-04;概念模型及原图。
[9] 长鑫存储.第五代技术平台正式量产 实现微缩工艺新突破.2026-09-20;公告及原图。
[10] 长江存储.晶栈Xtacking先进架构;企业级固态硬盘产品目录.官网技术说明、结构原图与产品资料。
[11] Sandisk与SK hynix.HBF全球标准化进展.2026-08-03。
[12] Penguin Solutions.CXL Memory Expansion Servers.官网产品页及产品图。
[13] NVIDIA.BlueField-4 STX Storage Architecture.2026-03-16;发布公告与系统图。
[14] SMART Modular.CXA-8F2W CXL扩展卡.官网产品页与硬件图。
[15] Micron.Micron Powers AI Everywhere at COMPUTEX 2026.2026-06-01。
[16] Micron.FY2026 Q3 Earnings Call Prepared Remarks.2026-06-24,第2—3页;供给约束和战略客户协议。
[17] Reuters.China’s CXMT eyes flash-memory push amid global shortage.2026-09-18;Investing.com刊载路透全文,匿名消息源。
[18] SK hynix.How MR-MUF’s Heat Control Breakthrough Elevated HBM to New Heights.2024-07-30;材料与封装说明及原图。
[19] Lam Research.Advanced Memory Solutions.官网技术说明;刻蚀、沉积与堆叠应力。
[20] Micron.High-bandwidth memory (HBM).官网技术介绍;HBM与DRAM的关系。
资料核对日期:2026年9月22日。插图版权归原权利人;厂商目标、论文研究与媒体报道均按原有证据性质表述。

点森科技 - 科技资讯_数码产品_互联网观察_智能硬件


