亚洲财经

☰ 搜索

定制AI芯片如何与英伟达GPU竞争?

英伟达主导AI计算,但科技巨头正加速自研专用芯片

尽管英伟达在AI计算领域占据主导地位,但谷歌、Meta、亚马逊等超大规模云服务商正日益投入资源,构建专为自身AI工作负载设计的处理器。其核心差异在于“专业化”。

英伟达的GPU旨在处理广泛的加速计算任务;而定制化的AI加速器则通过剔除企业不需要的功能模块,将更多的硅片面积、内存带宽和电力资源集中于特定且狭窄的计算场景,从而实现效率最大化。

谷歌TPU架构:专业化的典范

谷歌的TPU(张量处理单元)架构清晰地展示了这一逻辑。其中,TPU 8t专注于大规模模型训练,而TPU 8i则针对推理任务进行了优化,相比谷歌上一代推理产品,其在单位成本下的性能表现更优。

英伟达的优势:灵活性与生态系统

英伟达的领先优势不仅体现在芯片的原始性能上,更在于其卓越的灵活性。其GPU能够胜任前沿模型的训练、推理运行、科学计算,甚至应对数据中心建设时尚未出现的新兴工作负载。

这种灵活性至关重要,因为AI软件迭代迅速。拥有数千套英伟达系统的云服务商可以根据需求变化灵活调配GPU资源,而非被锁定在单一狭窄的工作负载中。此外,英伟达还拥有CUDA生态、成熟的网络产品以及完善的开发者社区。这些软件层面的优势使得GPU在不同模型和客户群体中的部署更加便捷。

这也解释了为何那些致力于开发自有芯片的公司仍会采购英伟达硬件。即便是谷歌的基础设施,也是将TPU与英伟达GPU结合使用,而非将二者视为完全相互替代的关系。

规模化效应:定制芯片的经济性优势

当同一工作负载以百万或十亿次级别运行时,经济账本便会发生变化。推理(Inference)是最典型的例子。如果谷歌明确知道Gemini模型的请求处理方式,它就可以围绕这些计算优化硬件设计,从而避免为极少使用的灵活性支付额外费用。

这种做法不仅能降低功耗和单次查询的成本,还能提高硬件利用率。以下是不同方案的关键对比:

特性 英伟达 GPU 定制 AI 芯片
灵活性 极高 较低
软件生态系统 成熟且广泛 通常为专有封闭
最佳应用场景 训练及混合工作负载 大规模重复性工作负载
前期开发成本 对客户而言较低 非常高
大规模下的效率 强劲 潜在更高
改变工作负载的能力 高 更为有限

Meta遵循类似的策略开发MTIA芯片,而亚马逊则为云基础设施开发了Trainium和Inferentia系列芯片。这也是为何博通(Broadcom)和英伟达都能从日益增长的AI支出中获益的原因:英伟达提供灵活的加速器,而博通则协助超大规模云服务商设计针对特定工作负载优化的芯片。

超大规模云服务商仍需外部芯片专家支持

设计定制加速器并不意味着所有组件都需内部制造。云厂商通常与博通、美满电子(Marvell)等专业公司合作,涉及物理设计、网络、接口及生产等环节。

例如,美满电子与谷歌的合作关系已扩展至涵盖定制推理加速器、网络控制器以及与谷歌TPU生态系统相连的近内存计算等领域。这也进一步解释了为何AI基础设施投资的范围远超GPU制造商本身。

定制芯片难以完全取代英伟达

更可能出现的结果是“混合架构”的普及。一家公司可能使用英伟达GPU进行大型模型训练,利用自有加速器处理海量推理任务,并采用独立的定制芯片负责网络传输或内存移动。

定制芯片在可预测的工作负载中通过降低成本和提升效率来竞争;而英伟达则凭借其在几乎所有领域的适用性保持竞争力。随着AI基础设施支出的增长,这两种路径将同步扩张,而非一方彻底淘汰另一方。