NVHBM : NVIDIA loge le contrôleur mémoire dans le HBM et libère 25 % du chip

NVIDIA déplace le contrôleur de mémoire à l'intérieur du HBM et libère jusqu'à 25 % du chip

NVIDIA a dévoilé NVHBM, une architecture mémoire à haut débit qui déplace le contrôleur depuis l’accélérateur vers le socle de la pile HBM. Selon l’entreprise, ce déplacement offre jusqu’à 30 % de bande passante supplémentaire, réduit la consommation mémoire de 15 % et libère jusqu’à 25 % de l’espace sur le XPU comparé à une implémentation classique en HBM4E. La technologie s’intègre à NVLink Fusion, et Annapurna Labs, la division puces d’Amazon Web Services, en sera le premier partenaire.

L’annonce arrive alors que la mémoire devient un facteur aussi déterminant que le calcul pour la performance des accélérateurs IA. Des modèles de plusieurs centaines de milliards, voire de plusieurs trillions de paramètres, imposent un déplacement massif de données entre mémoire et unités de calcul : augmenter les FLOPS disponibles ne sert à rien si le processeur passe son temps à attendre que les données arrivent. NVHBM s’attaque directement à cette relation entre calcul et mémoire.

Le contrôleur quitte le XPU pour rejoindre la pile HBM

Dans une architecture HBM classique, le contrôleur chargé de la communication mémoire se trouve dans l’accélérateur lui-même, ce qui réserve une partie du silicium du XPU à cette tâche plutôt qu’au calcul. NVIDIA propose l’inverse avec NVHBM : le contrôleur personnalisé rejoint le socle de la pile HBM tridimensionnelle, hors du die principal du XPU.

Couche d’infrastructureTechnologies NVIDIA
CalculGPU, Grace et plateformes à l’échelle rack
MémoireNVHBM et contrôleurs
Scale-upNVLink et NVLink Switch
Communication chip à chipNVLink-C2C
RéseauSpectrum-X et InfiniBand
SystèmesMGX et racks NVIDIA
LogicielsCUDA et bibliothèques IA
Puces personnaliséesNVLink Fusion

NVIDIA n’a donc plus besoin de fabriquer tous les composants d’un système pour que sa technologie en fasse partie intégrante. Un hyperscaler peut concevoir sa propre XPU en s’appuyant sur NVLink pour la connectivité et NVHBM pour la mémoire, tout en intégrant les autres briques NVIDIA à l’échelle du rack, sans devoir tout redévelopper à chaque nouvelle charge de travail.

Reste à vérifier combien de ces 30 % de bande passante et 15 % d’économie d’énergie se maintiendront une fois NVHBM commercialisé, et quels fabricants de mémoire rejoindront cette norme. Mais la direction est claire : la compétition ne consiste plus seulement à fabriquer le GPU le plus rapide, elle porte désormais sur qui contrôle la communication entre calcul, mémoire et centaines d’accélérateurs au sein d’un même système.

Questions fréquentes

Qu’est-ce que NVIDIA NVHBM ?

Une technologie de mémoire à haut débit qui intègre le contrôleur personnalisé de NVIDIA directement dans le socle de la pile HBM, plutôt que dans le XPU lui-même.

Quels avantages NVHBM offre-t-il face à HBM4E ?

Jusqu’à 30 % de bande passante supplémentaire, une réduction de 15 % de la consommation mémoire, et jusqu’à 25 % de surface libérée sur le XPU comparé à une architecture HBM4E classique.

NVHBM sera-t-il réservé aux GPU NVIDIA ?

Non. L’intégration dans des processeurs tiers via NVLink Fusion est au cœur de l’annonce, et NVIDIA prévoit une norme commune proposée par plusieurs fournisseurs de mémoire.

Quel est le lien avec AWS ?

Annapurna Labs, la division puces d’Amazon, sera le premier partenaire de NVHBM, dans le cadre d’une stratégie plus large autour de NVLink Fusion et des futures générations Trainium d’AWS.

source : blogs.nvidia

CaractéristiqueHBM4E conventionnelNVHBM de NVIDIA
Contrôleur mémoireDans le XPUDans le socle de HBM
Bande passanteRéférenceJusqu’à +30 %
Consommation HBMRéférence-15 %
Surface disponible en plus sur le XPUJusqu’à +25 %

Les chiffres publiés par NVIDIA restent des estimations préliminaires, à confirmer sur des produits concrets une fois NVHBM commercialisé. Et cela ne garantit pas 25 % de performance en plus pour tout accélérateur : NVIDIA parle d’optimisation de la surface silicium, pas de rendement supplémentaire direct en calcul. L’intérêt pour les concepteurs tient surtout à la liberté d’usage de cet espace libéré, qu’ils peuvent consacrer à plus d’unités de calcul, à des caches plus grands, à des accélérateurs spécialisés ou à un XPU globalement plus efficace.

NVIDIA veut aussi s’inviter dans les puces personnalisées de ses clients

NVHBM prend tout son sens comme brique de NVLink Fusion, la stratégie par laquelle NVIDIA veut que les puces personnalisées de ses concurrents utilisent aussi NVLink. Les grands fournisseurs cloud développent depuis plusieurs années leurs propres accélérateurs pour réduire leurs coûts et coller aux besoins de leurs charges de travail : Google avec ses TPU, AWS avec Trainium et Inferentia, Microsoft avec Maia, Meta avec MTIA. Chaque puce sur mesure déployée par un hyperscaler pourrait réduire d’autant la dépendance aux GPU NVIDIA.

NVLink Fusion propose une autre lecture de ce mouvement. Plutôt que d’obliger ses clients à choisir entre un accélérateur NVIDIA ou un ASIC maison, NVIDIA veut que ces processeurs spécifiques utilisent aussi ses composants : NVLink, NVLink-C2C, NVLink Switch, MGX, et désormais NVHBM. L’entreprise décrit cette stratégie comme une architecture « verticalement intégrée et horizontalement ouverte », une façon de participer économiquement à l’écosystème IA même quand le processeur principal porte la marque d’un concurrent.

AWS, premier partenaire de NVHBM

Annapurna Labs, la division d’Amazon responsable d’une bonne partie des circuits personnalisés d’AWS, collaborera avec NVIDIA sur NVHBM et sur la plateforme NVLink pour le déploiement en rack. Ce partenariat élargit l’accord existant autour de NVLink Fusion : AWS prévoit d’intégrer la technologie dès Trainium4, la prochaine génération de ses accélérateurs maison, qui a déjà pris le relais de Trainium3 présenté lors d’AWS re:Invent et qui génère déjà plus de 25 milliards de dollars par an pour Amazon.

L’objectif : faire cohabiter puces Amazon et GPU NVIDIA dans une architecture commune à l’échelle du rack. Même en construisant ses propres accélérateurs, AWS peut ainsi exploiter la technologie d’interconnexion et de gestion mémoire de NVIDIA pour assembler des systèmes hétérogènes, adaptés charge par charge.

La course à l’IA se joue aussi sur la mémoire

Au début de l’essor de l’IA, la performance se mesurait surtout en TFLOPS ou en PFLOPS. À mesure que les modèles grossissent, la capacité et la largeur de la mémoire pèsent tout autant. Le HBM empile plusieurs couches de DRAM reliées par des interfaces ultrarapides, et les générations se sont succédé depuis HBM2 jusqu’à HBM4 et au-delà. Déplacer le contrôleur vers le socle de la pile va plus loin : la mémoire cesse d’être un simple composant connecté au processeur pour assumer des fonctions autrefois réservées au CPU.

NVIDIA veut aussi généraliser une implémentation standardisée de NVHBM, proposée par plusieurs fabricants de mémoire, ce qui allégerait le travail d’intégration et de validation pour les concepteurs d’ASIC et permettrait à NVIDIA d’étendre son emprise sur cette couche stratégique sans devenir fabricant de DRAM.

De CUDA et des GPU à toute l’infrastructure du rack

NVHBM s’inscrit dans une logique plus large, celle d’une société dont le Data Center représente désormais environ 92,5 % des revenus trimestriels. Son offre ne se limite plus à vendre des accélérateurs : GPU, CPU, réseaux, NVLink, systèmes rack-scale, logiciels et architectures complètes pour l’IA en data center. NVLink Fusion étend cette stratégie jusqu’à la conception de processeurs personnalisés.

Couche d’infrastructureTechnologies NVIDIA
CalculGPU, Grace et plateformes à l’échelle rack
MémoireNVHBM et contrôleurs
Scale-upNVLink et NVLink Switch
Communication chip à chipNVLink-C2C
RéseauSpectrum-X et InfiniBand
SystèmesMGX et racks NVIDIA
LogicielsCUDA et bibliothèques IA
Puces personnaliséesNVLink Fusion

NVIDIA n’a donc plus besoin de fabriquer tous les composants d’un système pour que sa technologie en fasse partie intégrante. Un hyperscaler peut concevoir sa propre XPU en s’appuyant sur NVLink pour la connectivité et NVHBM pour la mémoire, tout en intégrant les autres briques NVIDIA à l’échelle du rack, sans devoir tout redévelopper à chaque nouvelle charge de travail.

Reste à vérifier combien de ces 30 % de bande passante et 15 % d’économie d’énergie se maintiendront une fois NVHBM commercialisé, et quels fabricants de mémoire rejoindront cette norme. Mais la direction est claire : la compétition ne consiste plus seulement à fabriquer le GPU le plus rapide, elle porte désormais sur qui contrôle la communication entre calcul, mémoire et centaines d’accélérateurs au sein d’un même système.

Questions fréquentes

Qu’est-ce que NVIDIA NVHBM ?

Une technologie de mémoire à haut débit qui intègre le contrôleur personnalisé de NVIDIA directement dans le socle de la pile HBM, plutôt que dans le XPU lui-même.

Quels avantages NVHBM offre-t-il face à HBM4E ?

Jusqu’à 30 % de bande passante supplémentaire, une réduction de 15 % de la consommation mémoire, et jusqu’à 25 % de surface libérée sur le XPU comparé à une architecture HBM4E classique.

NVHBM sera-t-il réservé aux GPU NVIDIA ?

Non. L’intégration dans des processeurs tiers via NVLink Fusion est au cœur de l’annonce, et NVIDIA prévoit une norme commune proposée par plusieurs fournisseurs de mémoire.

Quel est le lien avec AWS ?

Annapurna Labs, la division puces d’Amazon, sera le premier partenaire de NVHBM, dans le cadre d’une stratégie plus large autour de NVLink Fusion et des futures générations Trainium d’AWS.

source : blogs.nvidia

le dernier