郭明錤:英伟达重启推理预填充优化芯片Rubin CPX项目
英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,计划于2027年第一季度开始生产。该产品针对长上下文预填充场景设计,配备168GB HBM4显存,算力接近标准Rubin GPU,单卡功耗达2300瓦。产品采用独立MGX ETL机架设计,支持64至256张GPU的灵活部署配置。互联架构采用分层设计,单托盘内部使用NVLink,托盘间采用以太网,在性能和成本间取得平衡。Rubin CPX将作为预填充加速器与标准Rubin GPU配合使用,按照1:1比例分工协作,CPX负责预填充和KV Cache生成,Rubin GPU负责解码,专为长上下文推理场景优化。
文章作者、来源:华尔街见闻
英伟达悄然重启一项一度被市场认为已经放弃的芯片项目,目标直指AI推理成本较高的预填充(Prefill)环节。
英伟达已重新启动AI推理预填充加速GPU项目“Rubin CPX”,并对产品设计进行大幅调整。按照目前规划,新版Rubin CPX预计于2027年第一季度开始生产。
此次项目重启释放出一个明确信号:英伟达正在加码解决AI推理阶段的预填充性能与成本瓶颈。随着大模型上下文长度持续增加,预填充阶段需要处理大量输入信息并生成KV Cache,其效率直接影响AI推理的整体成本和部署经济性。
郭明錤称,目前超过50%的AI推理工作负载来自输入上下文处理及KV Cache构建。
芯片规格大幅调整,算力接近标准Rubin
在算力和功耗方面,新版CPX的性能已接近标准Rubin GPU,单卡最高功耗同样达到2300瓦。内存方面,新版CPX改用168GB HBM4显存,较此前方案的128GB GDDR7明显升级,但仍低于标准Rubin GPU的288GB HBM4。
按照郭明錤的说法,8卡CPX计算托盘的HBM4容量合计约1.34TB,能够覆盖大多数长上下文预填充工作负载及对应的KV Cache需求。这意味着,Rubin CPX并非单纯追求更高的通用算力,而是针对长上下文场景对显存容量和预填充效率进行了重新设计。
从共享机架转向独立部署,配置更加灵活
机架架构也是此次调整的重点。
此前方案中,CPX计划与Rubin GPU共享机架;新版则改为采用独立的MGX ETL机架,从而允许客户根据实际需求单独扩展CPX算力。
具体来看,客户可以选择64、128、192或256张CPX GPU的部署规模。每64张CPX GPU构成一个机架模块,包括8个计算托盘,每个托盘搭载8张CPX GPU,同时配备一个交换机托盘。
模块化设计意味着,客户无需按照固定的大规模Rubin机架进行采购,可以根据预填充负载的实际需求灵活增加CPX算力。
分层互联设计,降低预填充部署成本
在互联架构上,Rubin CPX采用分层设计,在性能与成本之间进行取舍。
在单个计算托盘内部,8张CPX GPU通过NVLink进行Scale-up扩展。每张CPX GPU的NVLink带宽为1至1.5TB/s,低于标准Rubin GPU的3.6TB/s。
在托盘之间以及机架模块内部的Scale-out层面,CPX采用Spectrum-6以太网全铜L1链路;跨机架模块连接时,则通过各模块的Spectrum-6交换机,经OSFP光纤链路完成互联。
相比完全依赖高带宽GPU互联的方案,这种分层架构更强调针对预填充场景进行成本优化。
与Rubin GPU协同,瞄准长上下文推理
Rubin CPX并不是独立运行的通用GPU,而是作为预填充加速器与Vera Rubin NVL72配套使用。
按照郭明錤的说法,英伟达推荐CPX与Rubin GPU按照1:1的比例部署:CPX负责预填充阶段的计算并生成KV Cache,随后通过以太网RDMA将KV Cache传输至Rubin GPU,由后者完成后续解码。
从产品定位来看,Rubin CPX的核心并不是取代标准Rubin GPU,而是将AI推理流程进一步拆分,让不同GPU分别承担预填充和解码任务。
郭明錤将其定位为“长上下文预填充的最佳性价比方案”。随着AI模型上下文窗口不断扩大,预填充阶段的计算量和KV Cache规模持续增长,英伟达此次重启CPX项目,或正是试图通过专用硬件和异构部署方式,进一步降低长上下文推理的成本。
免责声明:文章中的所有内容仅代表作者的观点,与本平台无关。用户不应以本文作为投资决策的参考。
你也可能喜欢
Standard Reserve:“链上央行”的尝试
美国财央百年博弈:历史复盘与2026趋势推演

被“抢饭碗”吓崩Howmet(HWM.US)!花旗、伯恩斯坦高呼被错杀:SpaceX(SPCX.US)入局恰恰说明需求太强
花旗和伯恩斯坦均认为,SpaceX下场造涡轮叶片这一消息表明整个行业正面临产能不足的问题,而这种行业背景最终可能强化Howmet的市场地位,而非削弱它。

库克退而不休,苹果新CEO迎来最大考验:如何在“老老板”注视下掌舵AI转型?
苹果CEO库克于9月1日正式卸任,由硬件负责人特努斯接棒,库克转任执行董事长继续参与外部事务。51岁的特努斯以产品见长,契合苹果AI转型对创新硬件的需求,但在政商关系上经验不足。分析认为,库克留任有助平稳过渡,但也可能束缚新CEO的自主权。真正的考验在于特努斯能否在借鉴库克经验的同时,逐步树立自身领导力,带领苹果完成AI转型。
