亚洲财经

搜索

Meta定制版AMD MI450芯片算力减半、内存大缩水,SemiAnalysis:这是Meta公司文化的悲哀

Meta定制版AMD MI450芯片算力减半、内存大缩水,SemiAnalysis:这是Meta公司文化的悲哀

Meta在AI基础设施领域的一系列决策失误,正以数十亿美元的代价暴露出其组织文化的深层问题。

据芯片行业研究机构SemiAnalysis最新披露,Meta正要求AMD为其定制一款大幅削减规格的MI450X芯片——计算单元减半、HBM内存堆叠数从12层降至8层,内存容量缩水近三分之二。SemiAnalysis直接将这一决定定性为"灾难性",并公开呼吁AMD绕开Meta基础设施团队,直接与Meta旗下超级智能实验室TBD Lab对接,推动采购标准版MI450X。

这一事件并非孤立。SemiAnalysis指出,从逾25亿美元的Rivos收购案,到H100定制服务器Grand Teton、再到GB200定制方案Ariel,Meta基础设施团队的决策模式呈现出一贯的过度工程化、缺乏软硬件协同设计、以及短期政治导向压倒长期技术合理性的特征。"Meta基础设施团队需要一次文化重置,"SemiAnalysis写道。

AMD最强芯片遭"阉割",GenAI性能严重受损

AMD MI450X是目前市场上硅工程规格最为激进的GPU之一:采用2纳米制程、混合键合封装技术、12层HBM4内存堆叠,以及市场上最大的CoWoS光罩尺寸,代表了当前封装与存储密度的天花板。

然而据SemiAnalysis披露,Meta所订购的定制版本将计算硅面积减半、HBM堆叠从12-Hi降至8-Hi,相当于同时压缩了算力与内存带宽两项核心指标。Meta基础设施团队给出的理由是:该配置面向推荐系统(RecSys)工作负载设计,旨在提升CPU与GPU的计算比例。

问题在于,这一决定是在TBD Lab成立之前作出的,后者作为Meta核心大模型研究团队,对这款芯片毫无兴趣。SemiAnalysis明确表示,相较于英伟达的Vera Rubin,被削减规格的MI450对TBD Lab毫无吸引力,"TBD将大幅倾向于Rubin"。这意味着AMD在Meta的出货量将因这一决策受到严重冲击。

SemiAnalysis在报告中罕见地直接向AMD喊话:"AMD需要站出来,直接与TBD团队合作,确保他们拿到正常版MI450,而不是这个对GenAI毫无价值的阉割版。"

Rivos收购:逾25亿美元换来一地鸡毛

Meta基础设施决策失误的另一典型案例,是2024年以逾25亿美元完成的Rivos收购。

据SemiAnalysis,Meta内部芯片部门鲜有人真正理解这笔收购的战略逻辑,当初推动该交易的人士此后已趋于沉默。主流看法是:Meta资金充裕,定制芯片赛道升温,加之此前已在授权Rivos知识产权,管理层认为不如将其整体收入囊中。

然而交易结构本身已埋下隐患。Rivos创始团队坚持全员打包出售,Meta不得不买下整家公司,随后大幅裁撤其不需要的部门。报道援引前Meta芯片员工称,收购由Meta硅片负责人Yee Jiun Song主导,过程中遭遇内部反对,但交易完成后其本人兴趣已然减退。现有芯片团队管理者将Rivos工程师视为"免费人力",各自划入麾下,原有团队架构迅速瓦解。

从技术层面看,收购的核心价值——Rivos的SIMT架构GPU IP——已随着原计划搭载该技术的"Olympus"芯片项目被取消而烟消云散。接替方案"Phoebe"项目预计最早2028年流片,但SemiAnalysis指出,内部对其能否落地并不乐观。

人员流失同样触目惊心。据SemiAnalysis,约30%的Rivos员工在近期裁员中离职,联合创始人Mark Hayter已经离开,另有多名前Rivos人员在首批RSU于今年5月归属后转投Gerard Williams创立的芯片初创公司Nuvacore。SemiAnalysis还透露,Rivos首席执行官兼联合创始人Puneet Kumar可能在其Meta股份全部归属后一两年内离职。

Grand Teton与Ariel:重复上演的设计代价

Meta的定制化偏执并非新近才有。其H100定制服务器Grand Teton,在标准HGX服务器基础上额外增加了一个交换机托盘,搭载四颗博通PCIe交换机、16块SSD和八块网卡,目的是为每台服务器提供更多直连存储,用于训练检查点保存。

然而实际投入生产后,模型团队对这些存储的使用远低于预期,该设计最终被放弃。SemiAnalysis指出,这是Meta硬件与软件团队缺乏协同设计的典型体现——基础设施团队为未被充分使用的功能付出了更高的物料成本与功耗代价,同时还增加了对博通的依赖,而这与Meta试图降低对英伟达网络设备依赖的初衷背道而驰。

进入Blackwell时代,Meta的定制方案"Ariel"延续了类似逻辑。标准GB200规格为每颗Grace CPU搭配两颗B200 GPU,而Ariel将其改为一对一配置,GPU数量减半。理由同样是为RecSys工作负载提升CPU比例。

据SemiAnalysis测算,Ariel NVL36x2方案的总拥有成本(TCO)比标准GB200 NVL72高出14%,而额外支出换来的更多CPU与DRAM资源,恰恰是大模型团队不需要的。由于采用跨机架连接方案以弥补GPU数量减少导致的组网缺口,网络延迟与可靠性问题随之而来。与此同时,最初被认为不稳定的NVL72背板已逐渐成熟,Meta对这一技术风险的判断事后证明有误。

SemiAnalysis表示,Meta的GB300服务器已回归标准配置——这本身即是对Ariel方案的否定。

文化根源:短期考核压倒长期战略

SemiAnalysis将上述问题归因于Meta基础设施团队的组织文化。

该机构指出,Meta的六个月绩效考核周期每轮淘汰最末10%至15%的员工,导致团队倾向于追求短期可见成果而非长期技术布局。部分管理者热衷于推动高曝光度但快速可交付的项目,交付后迅速转向,这一做法被内部称为"粉刷门面"(window washing)。与此同时,鲜少有人公开挑战上级决策,导致错误难以被及时纠正。

供应链团队在工程决策中话语权有限,进一步放大了上述问题。SemiAnalysis指出,部分供应商已因Meta频繁的方向变动而降低对其新项目的优先级,转而优先保障亚马逊或谷歌的需求。

SemiAnalysis将这一现象类比于Meta旗下Reality Labs的扩张历程——在大规模裁员到来之前,数十亿美元被投入庞大的工程团队与研发项目之中。如今,随着Meta着手向外部客户出售算力,这种内部文化的代价将更加直接地暴露在市场面前。

风险提示及免责条款
市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。

资讯来源:华尔街见闻