SemiAnalysis表示,英伟达 将 Rubin Ultra 的 HBM 从 12-Hi 下调至 8-Hi,核心原因并非单纯降低容量,而是当前 AI 推理真正受限的是 每单位带宽成本($/bandwidth),而非每单位容量成本($/capacity)。
HBM 堆叠层数主要决定容量,而总带宽更多取决于 HBM 堆栈数量、接口宽度和传输速率。因此,从 12-Hi 降至 8-Hi,可以减少约 1⁄3 的 DRAM 裸片用量,缓解当前紧张且昂贵的 HBM 供应压力,同时在堆栈数量和接口配置不变的情况下,仍可维持甚至提高整体带宽。
这意味着 英伟达 正在主动用更少的 HBM 容量换取更高的带宽经济性。对于越来越以推理为主的 AI 工作负载而言,模型并不只是需要“装下更多数据”,更需要持续、快速地搬运模型权重和 KV Cache,因此内存带宽的重要性正在上升。
Rubin Ultra 的调整反映出 HBM 竞争逻辑正在发生变化:AI 芯片追求的已经不再是单纯堆高 HBM 容量,而是在有限的 DRAM、功耗和成本约束下,获得尽可能高的有效带宽。HBM 的核心瓶颈正在从“容量够不够”,转向“每一美元能买到多少带宽”。