NVIDIA mesurait jusqu’à 30 fois plus de performance par MW avec Vera Rubin par rapport à Blackwell

NVIDIA mesurait jusqu'à 30 fois plus de performance par MW avec Vera Rubin par rapport à Blackwell

NVIDIA a publié de nouveaux résultats préliminaires concernant Vera Rubin NVL72, qui indiquent une amélioration significative de l’efficacité de l’inférence pour l’intelligence artificielle agentique. Lors de tests effectués par l’entreprise elle-même avec le benchmark AgentX de SemiAnalysis, la nouvelle plateforme atteint un débit jusqu’à 30 fois supérieur par mégawatt par rapport à la GB300 NVL72 et réduit le coût par million de tokens jusqu’à 35 fois dans certaines conditions. Ces résultats sont encore en cours de validation par SemiAnalysis.

Les points clés de NVIDIA Vera Rubin en 30 secondes

  • Vera Rubin NVL72 offre jusqu’à 30 fois plus de débit par mégawatt que la GB300 NVL72 sur DeepSeek V4 Pro.
  • NVIDIA estimé réduire le coût par million de tokens jusqu’à 35 fois par rapport à Blackwell lors de ces tests.
  • AgentX simule des sessions de programmation avec agents, contexte évolutif et appels à des outils.
  • Blackwell s’améliore également : la GB300 atteint jusqu’à 15 fois le rendement par MW de la H200 avec DeepSeek V4 Pro.
  • Les chiffres de Vera Rubin ont été mesurés par NVIDIA et restent en attente de validation par SemiAnalysis.

La comparaison revêt un intérêt particulier car NVIDIA ne se limite pas à mesurer combien de tokens une GPU peut générer dans un test statique. AgentX cherche à reproduire un scénario beaucoup plus proche du fonctionnement réel des nouveaux agents IA, où une même tâche peut enchaîner raisonnement, appels à des outils, sous-agents, et requêtes successives avec un contexte qui s’étend au fil de la session.

Cela modifie également les métriques devenant essentielles dans les centres de données. La performance maximale d’un accélérateur reste importante, mais pour les opérateurs déployant des dizaines ou des centaines de racks, des indicateurs comme les tokens par mégawatt, la latence, le temps jusqu’au premier token, et le coût par million de tokens prennent une importance cruciale.

Vera Rubin atteint jusqu’à 30 fois le débit par mégawatt

AgentX fait partie d’InferenceX, la suite de benchmarks ouverts de SemiAnalysis. Au lieu d’utiliser uniquement des séquences artificielles à longueurs fixes, il reproduit des sessions d’agents de programmation déployées et préenregistrées.

Les tests conservent des éléments tels que la croissance du contexte, la variabilité des longueurs d’entrée et de sortie, aussi que les temps de raisonnement et les pauses dues aux appels d’outils. La concurrence est aussi modulée pour analyser la relation entre performance globale et réactivité pour chaque utilisateur.

Dans DeepSeek V4 Pro, NVIDIA affirme que Vera Rubin NVL72 permet jusqu’à 30 fois plus de débit par mégawatt que la GB300 NVL72, pour une moyenne d’environ 160 tokens par seconde et par utilisateur.

Ce n’est pas une indication que Vera Rubin est 30 fois plus rapide que Blackwell dans toutes les configurations. Ce chiffre correspond à un point précis de la courbe de performance d’AgentX, dans une configuration spécifique de modèle, de concurrence et d’interactivité.

Ce niveau de précision est important car NVIDIA indiquait auparavant que Vera Rubin apportait des améliorations d’environ 10 fois le rendement par watt et le coût par token par rapport à Blackwell, dans d’autres scénarios d’inférence. Les nouveaux résultats ne contredisent pas nécessairement ces chiffres : ils proviennent d’une charge agentique différente et d’une méthodologie distincte.

Dans AgentX, la plateforme peut également atteindre des niveaux d’interactivité supérieurs à ceux de la GB300 NVL72. Les graphiques fournis par NVIDIA montrent que Vera Rubin continue de progresser vers des niveaux où Blackwell commence à atteindre ses limites.

NVIDIA lie cette amélioration à une démarche plus globale que la simple GPU Rubin. L’architecture Vera Rubin intègre toute la chaîne : GPU, CPU, mémoire, interconnexion, réseaux et logiciel, qui coopèrent pour réduire les échanges de données, les temps d’attente, et les récalculs inutiles.

Jusqu’à 35 fois moins de coûts par million de tokens

L’autre chiffre remarquable concerne un impact économique direct. NVIDIA affirme que Vera Rubin NVL72 peut réaliser jusqu’à 35 fois moins de coûts par million de tokens que la GB300 NVL72 dans ces nouvelles évaluations de charges agentiques.

Encore une fois, il s’agit d’un maximum dans des conditions spécifiques établies par NVIDIA, et non d’une réduction automatique applicable à tous les services IA migrés de Blackwell à Rubin.

Cependant, cette métrique illustre la direction prise par la concurrence en matière d’infrastructure IA.

Au tout début de l’ère de l’IA générative, l’attention se concentrait principalement sur le nombre de GPU déployés. Avec l’inférence à grande échelle, l’efficacité se mesure aussi en termes de travail utile réalisé par chaque GPU, et surtout par chaque mégawatt d’énergie disponible dans le centre de données.

Pour un opérateur ayant une capacité électrique limitée, augmenter le nombre de tokens produits dans le même budget énergétique permet d’accéder à davantage de requêtes sans devoir augmenter proportionnellement l’infrastructure électrique ou de refroidissement.

NVIDIA pousse ce concept encore plus loin avec sa technologie DSX MaxLPS qui gère la puissance à l’échelle du GPU, du rack, et de la charge, permettant selon ses dires d’installer jusqu’à 40 % de GPU supplémentaires dans le même budget d’un mégawatt.

Ainsi, la consommation électrique devient une unité de mesure essentielle pour évaluer la capacité réelle d’une infrastructure IA.

Blackwell s’améliore également face à Hopper

Les nouveaux résultats ne concernent pas seulement Vera Rubin. NVIDIA a également utilisé AgentX pour comparer l’évolution de sa génération Blackwell par rapport à Hopper.

Avec DeepSeek V4 Pro 1.6T, GB300 NVL72 atteint jusqu’à 15 fois le débit par mégawatt de la H200 NVL8, selon les résultats fournis. Le coût par million de tokens peut aussi être jusqu’à dix fois moindre.

L’écart se creuse avec des modèles de taille plus importante.

Dans les tests avec Kimi K3 2.8T, NVIDIA situe la GB300 NVL72 à environ 80 fois au-dessus de la H200 NVL8 en débit par mégawatt à niveaux d’interactivité comparables. Blackwell peut également assurer un niveau d’interactivité d’environ 215 tokens par seconde et par utilisateur dans ce scénario.

Une partie de ces avancées provient du hardware, mais NVIDIA attribue aussi une part significative au software. Parmi les technologies employées figurent SGLang, TensorRT-LLM, vLLM pour la distribution des modèles Mixture of Experts (MoE), ainsi que des kernels DeepGEMM, des formats de précision réduite comme MXFP4 et MXFP8, et NVIDIA Dynamo.

Dynamo permet de séparer les phases de pré-remplissage et de décodage, en les déléguant à différents groupes de ressources. Son système de routage optimise également l’utilisation de la mémoire cache KV pour éviter de retraiter certains contextes.

NVLink complète cette architecture en connectant les 72 GPU d’un NVL72 en un domaine de calcul haute vitesse. La génération Rubin augmente la bande passante totale NVLink de NVL72, passant de 130 TB/s pour Blackwell à 260 TB/s, selon les spécifications préliminaires de NVIDIA.

Les résultats de Vera Rubin actuellement communiqués ne représentent pas encore toutes les capacités de la plateforme. NVIDIA indique notamment que ces mesures n’incluent pas la performance du Vera CPU pour les appels aux outils, une fonction importante pour les agents qui alternent la génération de tokens et l’exécution de code ou l’accès à des services externes.

Ces chiffres restent donc préliminaires. La validation indépendante par SemiAnalysis, ainsi que les déploiements commerciaux, seront essentielles pour confirmer dans quelle mesure ces avantages se traduisent concrètement dans des infrastructures de production.

Questions fréquentes

Quelle est l’amélioration de NVIDIA Vera Rubin par rapport à Blackwell ?

NVIDIA a mesuré jusqu’à 30 fois plus de débit par mégawatt pour Vera Rubin NVL72 par rapport à GB300 NVL72 avec DeepSeek V4 Pro dans AgentX. Il s’agit d’un maximum, valable dans des conditions spécifiques du benchmark, et non d’une amélioration universelle de 30 fois pour toutes applications.

Vera Rubin réduit-il réellement le coût de 35 fois par token ?

NVIDIA affirme avoir atteint jusqu’à 35 fois moins de coût par million de tokens avec Vera Rubin dans ces tests agéntiques. Les résultats restent en attente de validation par SemiAnalysis.

Qu’est-ce qu’AgentX ?

AgentX est un benchmark de SemiAnalysis intégré à InferenceX, qui reproduit des sessions d’agents de programmation. Il prend en compte la croissance du contexte, la variabilité des longueurs de l’entrée et de la sortie, ainsi que la latence, la concurrence et les appels d’outils.

Pourquoi le rendement par mégawatt est-il important pour l’IA ?

Les grands centres de données disposent d’une puissance électrique limitée. Produire plus de tokens par mégawatt permet d’accroître la capacité d’inférence sans augmenter proportionnellement la consommation électrique.

source : blogs.nvidia

le dernier