De Blackwell à Rubin : Plateformes, Puissance et Refroidissement
Rubin est la nouvelle génération de calcul IA de NVIDIA. Le moteur conçu pour faire tourner la prochaine vague de grands modèles de langage, de systèmes de raisonnement et d'agents IA. Rubin n'est pas une simple puce, mais un système complet et co-conçu : processeurs, mémoire et réseau construits pour fonctionner ensemble, de sorte qu'un rack de serveurs entier se comporte comme un seul et immense accélérateur.
NVIDIA appelle ces déploiements des « usines IA », car leur rôle est de transformer l'électricité en intelligence utile aussi efficacement que possible.
Ce guide explique, en termes accessibles, comment Rubin a évolué par rapport à la génération Blackwell précédente, ce qu'il exige désormais d'un centre de données en termes d'alimentation électrique et de refroidissement liquide, et comment choisir entre les deux façons de l'acheter : le Vera Rubin NVL72 à l'échelle du rack et le HGX Rubin NVL8, plus compact et plus flexible.
Comment nous en sommes arrivés là : de Hopper à Rubin
NVIDIA lance désormais une avancée majeure environ tous les ans. Chaque génération conserve le même concept de base, mais augmente les performances et réduit le coût d'exploitation de l'IA :
- Hopper (2022) : l'ère du H100 qui a alimenté la première génération de grands modèles de langage.
- Blackwell (2024) : a introduit le premier design « à l'échelle du rack », où 72 GPU dans un seul rack fonctionnent comme un système unique plutôt que comme des serveurs séparés.
- Blackwell Ultra (2025) : une mise à niveau intermédiaire de la mémoire et des performances.
- Rubin / Vera Rubin (2026) : la nouvelle génération présentée ici, dont la montée en production est prévue pour le second semestre 2026.
Blackwell a démontré que le rack, et non le serveur, devrait être le bloc de construction de base d'un centre de données IA. Rubin reprend cette idée éprouvée et la pousse simultanément sur tous les fronts : des puces plus rapides, beaucoup plus de mémoire, et des connexions entre GPU considérablement plus rapides. Le résultat est une génération conçue spécifiquement pour les charges de travail les plus exigeantes d'aujourd'hui, comme les modèles de raisonnement et les systèmes mixture-of-experts qui transfèrent en permanence des données entre de nombreux GPU.
Ce qui a réellement changé
Ce que ça signifie | Blackwell Ultra (B300) | Rubin GPU |
Calcul IA (inférence NVFP4) | 15 PFLOPS | 50 PFLOPS (~3.3x) |
Mémoire embarquée | HBM3e, jusqu'à 288 Go | HBM4, jusqu'à 288 Go |
Vitesse mémoire | ~8 To/s | Jusqu'à 22 To/s (~2,8x) |
Lien GPU à GPU | 1,8 To/s (NVLink 5) | 3,6 To/s (NVLink 6, 2x) |
Transistors | 208 milliards | 336 milliards |
CPU associé | Grace (72 cœurs Arm) | Vera (88 cœurs Arm personnalisés) |
Plus de mémoire signifie qu'un seul GPU peut héberger des modèles plus grands et des conversations plus longues. Des liens GPU à GPU plus rapides signifient que les grands modèles répartis sur de nombreux GPU passent moins de temps à attendre et plus de temps à travailler. C'est pourquoi, ensemble, Rubin peut accomplir bien plus de travail pour la même consommation électrique et le même coût, mais il concentre aussi davantage ce travail dans chaque rack, ce qui explique pourquoi l'alimentation et le refroidissement sont désormais plus importants que jamais.
Découvrez les deux plateformes Rubin
Les deux plateformes utilisent exactement le même GPU Rubin et le même réseau rapide. Elles diffèrent par leur échelle (le nombre de GPU fonctionnant ensemble comme un seul système) et par leur flexibilité. C'est là le cœur de la décision.
Vera Rubin NVL72 : le monstre de puissance à l'échelle du rack
Le NVL72 transforme un rack entier refroidi par liquide en un seul et gigantesque accélérateur : 72 GPU Rubin et 36 CPU Vera tous interconnectés de sorte que n'importe quel GPU peut communiquer avec n'importe quel autre à pleine vitesse.
Il offre 3,6 EFLOPS de calcul d'inférence, 20,7 To de mémoire HBM4 ultra-rapide, et est conçu pour les plus grands entraînements de modèles et les services IA à fort trafic.
C'est la configuration vers laquelle se tournent les hyperscalers et les laboratoires d'IA lorsque le modèle est trop grand pour tenir ailleurs.
HGX Rubin NVL8 : le bloc de construction flexible
Le NVL8 intègre les mêmes GPU Rubin dans un serveur compact de 2U avec 8 GPU, consommant environ 24 kW par nœud.
Il offre 400 PFLOPS de calcul d'inférence et, point crucial, peut être associé soit au CPU Vera d'NVIDIA, soit à des processeurs x86 standard (Intel Xeon ou AMD EPYC).
Cela facilite son intégration dans des centres de données existants, sa réplication sur de nombreux racks, et son utilisation pour un mix de calcul IA et de calcul haute performance traditionnel.
Comme tout système Rubin, il est uniquement refroidi par liquide. Il n'existe pas de version refroidie par air. C'est la voie d'accès pratique à Rubin pour la plupart des entreprises.
Bien qu'il soit livré en tant que nœud unique, le NVL8 est également conçu pour fonctionner à l'échelle du rack : plusieurs nœuds 2U sont installés dans une même armoire et reliés via le réseau scale-out, permettant d'atteindre des dizaines de GPU Rubin par rack.
La différence avec le NVL72 réside dans l'interconnexion. Chaque nœud NVL8 est son propre domaine NVLink autonome à 8 GPU, relié aux autres par Ethernet ou InfiniBand, plutôt que par le fabric NVLink unifié à 72 GPU du NVL72. Pour de nombreuses charges de travail, cette indépendance est un atout : les nœuds peuvent être alloués, mis à l'échelle et entretenus séparément, et un rack peut être rempli progressivement.
Topologies d'interconnexion

Gauche : un rack de nœuds HGX Rubin NVL8 indépendants : chacun est un domaine NVLink autonome à 8 GPU relié via Ethernet/InfiniBand.
Droite : le fabric NVLink unifié à 72 GPU du Vera Rubin NVL72, dans lequel chaque GPU peut atteindre tous les autres à pleine vitesse.
Les deux plateformes côte à côte
En un coup d'œil | Vera Rubin NVL72 | HGX Rubin NVL8 |
Form Factor | Rack entier refroidi par liquide | Nœud 2U (extensible en rack) |
GPU Rubin | 72 | 8 |
Options CPU | 36 CPU Vera | Vera ou x86 (Xeon / EPYC) |
Calcul d'inférence | 3.6 EFLOPS | 400 PFLOPS |
Bande passante mémoire | 1,6 Po/s | 176 To/s |
Alimentation (approx.) | ~190–230+ kW / rack | ~24 kW / 2U node |
Refroidissement | Direct-to-chip liquid (obligatoire) | Direct-to-chip liquid (obligatoire) |
Conçu pour | Les plus grands modèles, échelle maximale | Déploiement flexible et reproductible |
Où la différence se manifeste : les modèles mixture-of-experts
Le mixture-of-experts (MoE) est l'architecture qui sous-tend presque tous les modèles de pointe aujourd'hui : les systèmes de type GPT, DeepSeek, Mixtral et les derniers modèles agentiques. Au lieu d'un unique réseau dense, un modèle MoE divise ses couches en de nombreux « experts » plus petits, et une couche de routage envoie chaque token vers seulement une poignée d'entre eux.
Étant donné que les experts résident sur différents GPU, chaque étape de routage déclenche une rafale de communication tous-vers-tous : chaque GPU envoie des tokens à de nombreux autres et en reçoit en retour, le tout simultanément. La vitesse de cette étape détermine souvent la vitesse de l'ensemble du modèle.
C'est précisément là que les deux plateformes divergent. Sur le Vera Rubin NVL72, le trafic tous-vers-tous reste à l'intérieur du fabric NVLink unifié à 72 GPU à 3,6 To/s par GPU en bidirectionnel, avec une latence uniforme et sans goulots d'étranglement. NVIDIA annonce jusqu'à 2x un débit tous-vers-tous MoE plus élevé par rapport à la génération précédente, et le calcul en réseau (NVIDIA SHARP) accélère les opérations collectives directement à l'intérieur du commutateur NVLink, faisant se comporter le rack, pour l'inférence MoE, comme un seul et gigantesque accélérateur à 72 GPU.
Sur le HGX Rubin NVL8, la même étape MoE se divise sur deux réseaux : le NVLink rapide au sein de chaque nœud à 8 GPU, puis une descente vers le réseau scale-out (ConnectX-9 via Ethernet ou InfiniBand à environ 1,6 Tb/s par GPU) dès qu'un token doit quitter son nœud.
C'est environ 18 fois moins de bande passante GPU à GPU que le fabric NVLink du NVL72, avec en plus une latence supplémentaire due aux sauts réseau. Pour les modèles qui tiennent dans un seul nœud à 8 GPU, le NVL8 est parfaitement adapté ; pour les très grands modèles MoE qui alimentent les déploiements les plus ambitieux d'aujourd'hui, le NVL72 est spécifiquement conçu pour ça.
Alimenter et refroidir Rubin : la réalité du centre de données
Les performances de Rubin s'accompagnent d'une réalité physique sans détour : ces racks sont d'une densité extraordinaire, et le bâtiment qui les accueille doit être prêt. Pour la première fois, NVIDIA rend le refroidissement liquide obligatoire : il n'existe pas de version de Rubin refroidie par air. La planification de l'alimentation et du refroidissement n'est plus une réflexion après coup ; elle fait partie intégrante du choix de la plateforme.
Alimentation : des racks plus denses, une nouvelle tension
Un rack Blackwell Ultra (GB300) NVL72 consomme déjà environ 140 kW, soit à peu près l'électricité d'une centaine de foyers concentrée dans une seule armoire. Un Vera Rubin NVL72 dépasse largement ce chiffre, les estimations du secteur et les conceptions de référence des fournisseurs le situant dans une plage de 190 à 230 kW par rack, selon le SKU Rubin (jusqu'à ~220 kW TDP pour la variante 2 300 W).
Pour délivrer cette puissance efficacement, NVIDIA prépare une transition vers une architecture d'alimentation en 800 VCC qui remplacera progressivement les alimentations traditionnelles en 415/480 VCA et la distribution en rack à 48V. Une tension plus élevée signifie moins de courant, des conducteurs plus fins et moins de pertes de conversion, essentiel alors que la feuille de route s'oriente vers des racks de 600 kW (Rubin Ultra « Kyber », 2027) et à terme des racks d'un mégawatt.
Pour l'instant, les racks Vera Rubin NVL72 sont livrés dans la configuration traditionnelle, avec quatre alimentations de 110 kW convertissant le 415/480 VCA en 48 VCC et alimentant un busbar refroidi par liquide supportant jusqu'à 5 000 A, le 800 VCC étant disponible en option complémentaire pour les opérateurs souhaitant anticiper la prochaine génération (Rubin Ultra).
Les racks Rubin introduisent également l'Intelligent Power Smoothing pour amortir les brusques variations de puissance que génèrent les grands travaux IA lorsque des milliers de GPU montent et descendent en charge simultanément, réduisant les pics de demande de courant jusqu'à 25 % et diminuant le besoin de massives batteries externes.
Refroidissement : un circuit d'eau chaude, pas d'air
Rubin utilise un refroidissement liquide direct sur puce DLC à 100 %. Au lieu de ventilateurs soufflant de l'air froid, le liquide de refroidissement circule à travers des plaques froides métalliques pressées directement sur chaque GPU et CPU, absorbant la chaleur à la source, où il peut capturer environ 98 % de la chaleur produite par un rack. Le système est un DLC monophasique à eau chaude : le liquide de refroidissement entre dans le rack à environ 45 °C et en ressort à environ 55–65 °C après avoir collecté la chaleur.
L'utilisation d'eau chaude plutôt que d'eau glacée est délibérée. Elle supprime le besoin de refroidisseurs mécaniques énergivores dans de nombreux climats, permet aux centres de données d'évacuer la chaleur avec des refroidisseurs secs plus simples, et (parce que l'eau ressort suffisamment chaude) ouvre la porte à la réutilisation de la chaleur : chauffage urbain, préchauffage industriel ou traitement de l'eau.
Un équipement appelé CDU s'intercale entre deux circuits : le circuit technologique fermé qui traverse les racks, et le circuit d'eau du bâtiment qui évacue la chaleur vers l'extérieur. En règle générale, un CDU dessert environ une dizaine de racks, et les CDU de centres de données évoluent vers des capacités d'évacuation de chaleur de plusieurs mégawatts.
Ce que Rubin exige du bâtiment, par rapport à Blackwell
Alimentation & refroidissement | Grace Blackwell Ultra NVL72 (génération précédente) | Vera Rubin NVL72 |
Puissance rack (approx.) | ~135 kW | ~190–230 kW (variante CPX ~370 kW) |
Distribution électrique | 415/480 VCA + 48V en rack | 415/480 VCA + 48V en rack Passage au 800 V CC |
Méthode de refroidissement | Air (10%), Refroidissement liquide direct (90%) | 100% Refroidissement liquide direct |
Temp. d'entrée du liquide | Jusqu'à 45°C (eau chaude, monophasique) | Jusqu'à 45°C (eau chaude, monophasique) |
Les chiffres sont des estimations du secteur ; à confirmer auprès des spécifications du fournisseur pour votre configuration. Sources : NVIDIA, DataCenterDynamics, The Cooling Report.
Votre centre de données est-il prêt ?
Les deux plateformes Rubin nécessitent un refroidissement liquide direct sur puce, il n'existe pas d'alternative par air. Avant de commander, vérifiez trois points :
- une capacité électrique suffisante et la transition vers une alimentation en haute tension/courant continu ;
- un circuit d'eau du bâtiment avec des CDU dimensionnés pour votre nombre de racks ; et
- un plan pour la chaleur, rejet ou réutilisation. La disponibilité des installations, et non celle des puces, est la chose la plus courante qui retarde un déploiement Rubin.
Lequel devriez-vous choisir ?
La façon la plus simple de décider : commencez par l'ampleur de vos ambitions, puis vérifiez ce que votre infrastructure peut fournir en alimentation et en refroidissement. Si vous entraînez ou déployez les plus grands modèles de pointe et souhaitez le coût par token le plus bas possible à l'échelle maximale, le NVL72 est conçu exactement pour cela, à condition de pouvoir fournir 150 kW ou plus et un refroidissement liquide haute température par rack.
Si vous souhaitez des performances de niveau Rubin qui s'intègrent à une montée en puissance plus progressive et à vos standards x86 existants, le NVL8 offre les mêmes GPU Rubin sous forme de nœuds 2U flexibles (déployables individuellement ou regroupés en rack à grande échelle), tout en nécessitant toujours un refroidissement liquide direct.
Si cela vous ressemble… | Meilleur choix |
Vous entraînez des modèles à l'échelle frontier ou de très grands modèles mixture-of-experts | Vera Rubin NVL72 |
Vous exploitez des services IA à haute concurrence au coût par token le plus bas | Vera Rubin NVL72 |
Votre infrastructure peut fournir une très haute densité de puissance et du DLC par rack | Vera Rubin NVL72 |
Vous voulez les performances Rubin sans reconstruire votre centre de données | HGX Rubin NVL8 |
Vous avez besoin de la compatibilité CPU x86 (Intel / AMD) | HGX Rubin NVL8 |
Vous prévoyez d'augmenter la capacité progressivement, rack par rack | HGX Rubin NVL8 |
Vous souhaitez introduire le refroidissement liquide à une densité par rack plus modérée | HGX Rubin NVL8 |
Vous voulez Rubin à l'échelle du rack sous forme de nœuds indépendants à 8 GPU, et non un domaine unique à 72 GPU | HGX Rubin NVL8 |
Vous exécutez des charges de travail mixtes IA + HPC ou faites beaucoup de fine-tuning | HGX Rubin NVL8 |
Les deux partagent le même GPU Rubin et nécessitent toutes deux un refroidissement liquide: le choix porte sur l'échelle, la flexibilité et la quantité d'alimentation et de refroidissement que vous pouvez fournir par rack.
Choisissez le NVL72 lorsque l'échelle et le coût par token au niveau frontier comptent le plus et que votre infrastructure peut alimenter et refroidir un rack de 220 kW et plus. Choisissez le NVL8 lorsque la flexibilité, la compatibilité x86 et une montée en puissance progressive comptent le plus.
Dans tous les cas, le refroidissement liquide est désormais le ticket d'entrée: de nombreuses organisations commenceront avec des nœuds NVL8 et évolueront vers des racks NVL72 au fur et à mesure que leurs charges de travail et leurs infrastructures mûriront.
Au-delà du rack : le Vera Rubin POD
Les deux plateformes présentées dans ce guide, le NVL72 et le HGX NVL8, sont les blocs de construction. L'ambition totale de NVIDIA avec Rubin se situe un cran au-dessus : le Vera Rubin POD, annoncé comme « cinq systèmes à l'échelle du rack interconnectés, un seul supercalculateur IA », conçu spécifiquement pour l'ère des agents IA. Là où un seul NVL72 se comporte déjà comme un gigantesque GPU unique, le POD traite 40 racks comme un seul supercalculateur cohérent : 1 152 GPU Rubin, environ 60 exaflops de calcul, et 10 Po/s de bande passante totale de montée en charge.
Ce qui distingue le POD, c'est qu'il est co-conçu à partir de sept types de puces regroupés en cinq types de racks dédiés, chacun répondant à une étape différente de la boucle de travail d'un agent IA :
- Vera Rubin NVL72 : le cœur du calcul GPU, dédié à l'entraînement et à l'inférence à haut débit.
- Le rack Groq 3 LPX : 256 LPU par rack, pour des réponses à ultra-faible latence sur des modèles à contexte long et à mille milliards de paramètres.
- Le rack Vera CPU : jusqu'à 256 CPU Vera par rack, fournissant les « bacs à sable » CPU denses dans lesquels les agents exécutent en toute sécurité des outils, font tourner du code et valident les résultats.
- Le rack de stockage BlueField-4 STX : un stockage natif IA avec la nouvelle plateforme de mémoire contextuelle CMX, qui décharge le cache KV et le restitue entre les tours, les sessions et les agents.
- Le rack réseau Spectrum-6 SPX : un Ethernet/InfiniBand à photonique sur silicium qui relie l'ensemble du POD avec une faible latence et une bande passante effective quasi parfaite.
La raison pour laquelle ces cinq éléments existent est qu'un agent IA ne fait pas que de l'inférence : il planifie, appelle des outils, exécute du code, récupère des données, puis boucle, parfois sur des milliers d'étapes par requête.
Ces étapes reposent sur différents types de matériel : le GPU pour le raisonnement, le CPU pour le bac à sable, l'accélérateur pour la réponse instantanée, le stockage pour le contexte. En co-concevant les cinq racks pour fonctionner comme un seul système, NVIDIA annonce jusqu'à 10 fois plus de débit d'agents à grande échelle par rapport à la génération Grace Blackwell précédente. Le Vera Rubin POD est, en substance, la réponse de NVIDIA à la question : à quoi ressemble une usine IA dédiée aux agents IA ?
Ce qu'il faut retenir
Rubin poursuit le virage amorcé par Blackwell : l'infrastructure IA est désormais conçue à l'échelle du rack, avec le matériel, l'alimentation et le refroidissement co-conçus pour maximiser l'intelligence utile par watt et par dollar.
La contrepartie de cette densité est une exigence d'infrastructure stricte : alimentation haute tension et refroidissement liquide à eau chaude obligatoire. Avec une montée en production prévue au second semestre 2026 et Rubin Ultra déjà sur la feuille de route pour 2027, les organisations planifiant leur infrastructure IA devraient choisir le point d'entrée qui correspond à la fois à leurs charges de travail et à leurs installations actuelles, que ce soit le NVL72 à l'échelle du rack ou le NVL8 flexible, en sachant que les deux font tourner le même moteur Rubin de nouvelle génération et que les deux nécessitent un environnement refroidi par liquide et à haute densité de puissance.
Et à mesure que les charges de travail évoluent vers les agents IA, les deux s'intègrent naturellement dans le Vera Rubin POD plus grand : cinq racks dédiés fonctionnant comme un seul supercalculateur pour l'ère agentique.