Bitget App
Trade smarter
Acheter des cryptosMarchésTradingFuturesEarnAICommunautéPlus
Guo Mingqi : Nvidia relance le projet de puce d’optimisation de préchargement d’inférence Rubin CPX

Guo Mingqi : Nvidia relance le projet de puce d’optimisation de préchargement d’inférence Rubin CPX

华尔街见闻华尔街见闻2026/09/01 11:01
Afficher le texte d'origine
Par:华尔街见闻

Selon une enquête du célèbre analyste Ming-Chi Kuo, Nvidia relance sa puce d’inférence AI pré-remplissage « Rubin CPX », dont la production en série est prévue pour début 2027. La nouvelle version utilise une mémoire HBM4 de 168GB, avec une consommation de 2300 watts et des performances proches du GPU Rubin standard. Cette puce adopte une conception modulaire indépendante de rack et d'interconnexion hiérarchisée, et sera déployée en collaboration 1:1 avec le GPU Rubin, se concentrant sur le pré-remplissage et la génération de KV Cache afin de réduire le coût des inférences contextuelles longues.

Nvidia a discrètement relancé un projet de puce que le marché considérait comme abandonné, ciblant spécifiquement l'étape de préremplissage (Prefill) à coût élevé dans l'inférence IA.

Selon la dernière enquête industrielle du célèbre analyste Ming-Chi Kuo, Nvidia a redémarré le projet GPU d’accélération de préremplissage pour l’inférence AI, dénommé "Rubin CPX", tout en procédant à d’importants ajustements de conception. D’après la planification actuelle, la nouvelle version de Rubin CPX devrait entrer en production au premier trimestre 2027.

La relance de ce projet envoie un signal clair : Nvidia mise fortement sur la résolution des goulets d’étranglement en termes de performance et de coût lors de l’étape de préremplissage dans les tâches d’inférence IA. Avec l’allongement continu du contexte des grands modèles, la phase de préremplissage doit traiter de grands volumes d'informations et générer un KV Cache, son efficacité impactant directement le coût global de l’inférence IA et la viabilité économique du déploiement.

D’après Ming-Chi Kuo, plus de 50% de la charge de travail en inférence IA provient actuellement du traitement du contexte d'entrée et de la construction du KV Cache.

Ajustement majeur des spécifications des puces, puissance de calcul proche du Rubin standard

Les spécifications principales du nouveau Rubin CPX diffèrent nettement par rapport à la version précédente.

En termes de performance et de consommation, le nouveau CPX offre une puissance presque équivalente au GPU Rubin standard, avec une consommation maximale par carte atteignant également 2300 watts. Côté mémoire, le nouveau CPX adopte 168Go de mémoire HBM4, une amélioration notable par rapport aux 128Go de GDDR7 de la version précédente, bien que toujours inférieure aux 288Go de HBM4 du GPU Rubin standard.

Selon Ming-Chi Kuo, la capacité totale de HBM4 sur un plateau de calcul CPX à 8 cartes est d’environ 1,34To, suffisant pour la plupart des charges préremplissage à long contexte et leurs besoins de KV Cache correspondants. Cela signifie que le Rubin CPX ne poursuit pas simplement une puissance de calcul plus élevée, mais a été repensé pour optimiser la capacité mémoire et l’efficacité du préremplissage dans les scénarios de long contexte.

Passage du rack partagé au déploiement indépendant, configuration plus flexible

L’architecture des racks est également un axe majeur de cette révision.

Dans la version précédente, le CPX devait partager son rack avec le GPU Rubin ; la nouvelle version opte pour des racks indépendants MGX ETL, permettant aux clients d’étendre la capacité CPX selon leurs besoins réels.

Concrètement, les clients peuvent choisir un déploiement de 64, 128, 192 ou 256 GPU CPX. Chaque module de rack de 64 GPU CPX inclut huit plateaux de calcul, chacun équipé de 8 GPU CPX et d’un plateau de switch.

La conception modulaire implique que les clients ne sont pas limités à acquérir de grands racks Rubin fixes, mais peuvent ajuster librement la puissance CPX selon les besoins réels de la charge de préremplissage.

Architecture d’interconnexion hiérarchisée, réduction des coûts de déploiement du préremplissage

Côté architecture d’interconnexion, Rubin CPX utilise une conception hiérarchique pour trouver un compromis entre performance et coût.

À l’intérieur d’un seul plateau de calcul, les 8 GPU CPX sont interconnectés via NVLink pour une extension Scale-up. Chaque GPU CPX dispose d’une bande passante NVLink comprise entre 1 et 1,5To/s, inférieur aux 3,6To/s d’un GPU Rubin standard.

Pour l’extension Scale-out entre les plateaux et à l’intérieur du module de rack, le CPX emploie un lien tout cuivre L1 Ethernet Spectrum-6 ; pour les connexions entre modules de racks, l’interconnexion passe par des switches Spectrum-6 de chaque module via des liens optiques OSFP.

Par rapport aux solutions reposant seulement sur une interconnexion GPU haut débit, cette architecture hiérarchisée vise d’avantage l’optimisation des coûts pour les scénarios de préremplissage.

Synergie avec Rubin GPU, ciblant l’inférence à long contexte

Rubin CPX n’est pas un GPU universel indépendant mais sert d'accélérateur de préremplissage en complément de Vera Rubin NVL72.

D’après Ming-Chi Kuo, Nvidia recommande un déploiement avec un ratio 1:1 entre CPX et Rubin GPU : le CPX réalise le calcul de préremplissage et génère le KV Cache, qui est ensuite transféré via RDMA Ethernet au Rubin GPU, chargé du décodage subséquent.

En termes de positionnement produit, l’objectif principal du Rubin CPX n’est pas de remplacer le GPU Rubin standard, mais de subdiviser davantage le processus d’inférence IA, chaque GPU gérant respectivement les tâches de préremplissage ou de décodage.

Ming-Chi Kuo le définit comme "la meilleure solution qualité/prix pour le préremplissage à long contexte". Avec l’élargissement constant de la fenêtre de contexte des modèles IA, le volume de calcul pour le préremplissage ainsi que l’échelle du KV Cache continuent de croître. Le redémarrage de CPX par Nvidia vise probablement à abaisser encore les coûts du long contexte, grâce à du matériel spécialisé et des déploiements hétérogènes.

0
0

Avertissement : le contenu de cet article reflète uniquement le point de vue de l'auteur et ne représente en aucun cas la plateforme. Cet article n'est pas destiné à servir de référence pour prendre des décisions d'investissement.

PoolX : Bloquez vos actifs pour gagner de nouveaux tokens
Jusqu'à 12% d'APR. Gagnez plus d'airdrops en bloquant davantage.
Bloquez maintenant !

Vous pourriez également aimer

Citadel : Les marchés américains pourraient connaître une « fenêtre de repli tactique » en septembre, il est conseillé de réduire les positions lors des hausses et d’acheter des protections à bas prix

Le stratège en chef des actions chez Citadel Securities met en garde : avec l'épuisement des bénéfices des résultats du deuxième trimestre des marchés américains, la demande des particuliers et les rachats entrant dans une phase de faiblesse saisonnière, ainsi que l'expiration massive des options et le retour de risques macroéconomiques importants, le risque d'une baisse tactique des marchés américains en septembre augmente. Étant donné que le coût de couverture est actuellement faible, il conseille aux investisseurs de « réduire leurs positions lors des hausses et d’acheter des protections à bas prix », en attendant une opportunité de positionnement plus constructive à la mi-octobre.

华尔街见闻2026/09/01 12:06

Le "ballast" du marché obligataire mondial s'affaiblit : que signifie le retour du rendement japonais à 10 ans à 3 % ? Analyse de plusieurs experts

Les rendements des obligations d'État japonaises ont grimpé sur toute la courbe, le rendement de référence à 10 ans atteignant pour la première fois depuis 1996 le seuil de 3%.

智通财经2026/09/01 11:56
Le "ballast" du marché obligataire mondial s'affaiblit : que signifie le retour du rendement japonais à 10 ans à 3 % ? Analyse de plusieurs experts