内存短缺已成为本轮AI建设周期中最持久的结构性制约,而AI算力扩张的脚步不会等待新晶圆厂落地。面对这一矛盾,整个产业链正在探索三条绕道而行的路径——降低内存规格、拆解推理负载,以及通过CXL技术实现内存池化共享——并在此过程中催生出新的投资机会。
摩根士丹利在最新研究报告中指出,英伟达CEO黄仁勋近期已明确表态,行业需要以全新思维应对内存瓶颈。这并非悲观信号,而是产业界对未来数年持续短缺的主动预判。内存紧缺的烈度或有起伏,但AI将在可预见的未来基本吸收全部可用供应。
在投资层面,摩根士丹利将Astera Labs(ALAB)和Marvell(MRVL)列为CXL及规模扩展方向的潜在受益者,将Cerebras(CBRS)列为推理负载分离架构的核心受益标的,同时维持对Micron(MU)和SanDisk(SNDK)的增持评级,逻辑在于内存短缺周期远未终结。
降规:治标之策,压力转移而非消除
面对DRAM和NAND价格双双走高,生态链企业最直接的应对是压缩单设备或单服务器的内存配置。
摩根士丹利指出,英伟达正在为Rubin平台向客户提供多个规格版本:LPDDR5每机架容量从原定54TB压缩至28TB,对应模组从192GB SOCAMM2缩减至96GB;HBM方面,Rubin原计划每GPU搭载288GB HBM(8叠12hi HBM4),目前预计将推出192GB版本(8叠8hi HBM4)。对于Rubin Ultra,相关规格也从1TB HBM4e下调,实际可比基准或降至192GB至384GB区间。
然而,降规并非真正意义上的解决方案。报告强调,当一层内存容量被削减,数据压力必然向下转移,HBM和LPDDR的缩水正在为NAND和网络互联带来增量需求,内存瓶颈发生了位移而非消失。
推动AI内存需求持续扩张的结构性因素包括三个维度:模型规模在LLM时代每6个月翻倍;上下文窗口长度以每年约5倍的速度扩张;推理并发量的增加使每个会话均需独立存储KV缓存。
摩根士丹利认为,这三个向量的持续演进决定了降规只能是临时性措施,一旦供应缓解,行业将迅速回补至更高规格,被压制的需求将更容易被吸收。
负载分离:为不同推理阶段配置专属硬件
推理过程由两个截然不同的阶段构成:预填充(prefill)以并行方式处理输入提示词,计算密集;解码(decode)逐token生成输出,对内存带宽和容量的依赖更为突出。将二者分离,分别交由最适合各自特性的硬件处理,是提升内存使用效率的第二条路径。
这一趋势在2025年底前后明显提速。英伟达收购Groq后,将其LPU(基于高带宽片上SRAM)整合进Vera Rubin平台,由Rubin GPU负责预填充及需要大容量KV缓存的解码环节,Groq处理前馈和专家混合部分,英伟达Dynamo负责协调与激活值传输。AWS随后宣布以Trainium负责预填充、Cerebras负责解码的异构架构,并计划于2027年第一季度在Amazon Bedrock上线;Cerebras与AMD的类似合作方案则预计于2026年第四季度投入生产。Matrix的Corsair也已进入量产阶段。
摩根士丹利将Cerebras列为负载分离架构中最直接的纯正受益标的。Cerebras晶圆级处理器将大量SRAM与计算单元集成于同一硅片,显著降低数据在处理器与外部内存间的移动频率,在解码阶段优势突出。更重要的是,负载分离可实质性改善Cerebras Cloud的经济模型——据Cerebras与AMD披露,联合系统可在维持Cerebras推理速度的前提下将吞吐量提升最高5倍,每部署单元可产生更多收入,每token成本同步下降。
CXL:从内存扩展到AI推理的新战场
CXL(Compute Express Link)是一种基于PCIe物理层的高速互联协议,核心价值在于允许多个处理器访问同一内存资源池,从根本上打破了内存与特定CPU绑定的传统架构。
其三种主要应用形态为:内存扩展(为单处理器添加超出本地内存通道上限的容量)、内存共享(多处理器访问同一数据)以及内存池化(跨处理器或服务器动态分配内存,减少闲置浪费)。
摩根士丹利指出,过去CXL主要服务于通用CPU计算场景,在AI领域的渗透因延迟劣势而受限。但随着推理场景对长上下文、代理型工作负载和KV缓存的容量需求急剧扩张,大量数据并不需要始终驻留在HBM中,CXL挂载DRAM作为更低成本、更大容量的内存分层由此获得立足空间。
市场规模方面,摩根士丹利将CXL的可寻址市场预测从原先以CPU为基础测算的逾40亿美元上调至2030年约60亿美元,增量主要来自AI服务器侧的新部署场景。Astera Labs的Leo内存控制器系列(含针对KV缓存卸载的定制设计,预计2027年量产)以及Marvell覆盖内存扩展(Structera X)和机架级池化(Structera S)的全线产品组合,是摩根士丹利看好的两个核心标的。Marvell管理层此前已将CXL定位为2028年前后逾10亿美元的收入贡献来源,摩根士丹利预计在即将举行的投资者日上将获得更多细节披露。
对内存股的影响:周期逻辑以时长而非振幅为锚
摩根士丹利坦承,从短期盈利最大化角度看,上述绕道策略对DRAM厂商存在一定负面影响——若AI生态因内存短缺而完全停摆,近期定价可能更为有利。但这一情形从未现实,报告强调,分析本轮内存周期应以"持续时长"为主要驱动逻辑,而非价格振幅。
核心论据在于:降规源于供应约束而非需求消退,一旦供应改善,行业将迅速回补至更高规格,被压抑的需求将轻易消化新增产能。摩根士丹利同时提示了一个风险因素:若AI放缓并非由于需求下降,而是源于土地、电力或厂房等基础设施瓶颈,此类暂停可能对内存板块造成不同于算力板块的特有冲击。
基于上述判断,摩根士丹利维持对MU和SNDK的增持评级,认为内存短缺周期尚未终结,两者的配置价值仍然成立。
