NVIDIA envisage de réduire la quantité de mémoire HBM prévue pour Rubin Ultra, sa prochaine génération d’accélérateurs d’intelligence artificielle, en réponse à la pénurie de DRAM et au coût de la mémoire, ainsi qu’aux difficultés de fabrication des configurations les plus complexes. TrendForce confirme que la société étudie des alternatives à 8 ou 12 couches, aussi bien en HBM4 qu’en HBM4E, sans que la spécification définitive soit encore arrêtée. La possibilité d’utiliser moins de mémoire par GPU soulève une question de fond : les charges d’IA dépendent désormais davantage de la bande passante et d’une hiérarchie mémoire complète que du simple stockage de toutes les données directement en HBM.

Les points clés en 20 secondes

Ce changement marque d’autant plus les esprits que Rubin Ultra avait été présenté autour d’une idée presque opposée : associer de très grandes quantités de mémoire au processeur. En 2026, on évoquait des configurations allant jusqu’à 1 To de HBM4E, mais l’état du marché de la mémoire oblige à revoir ce qui reste économiquement viable. Cela ne veut pas dire que la HBM perd en importance : la demande continue de dépasser la capacité de production, et TrendForce estime que la quantité de bits HBM expédiés progressera d’environ 50 % à 60 % d’une année sur l’autre en 2027, tout en restant inférieure à la croissance de la demande.

De 12 à 8 couches pour maximiser la fabrication d’accélérateurs

HBM signifie High Bandwidth Memory, mémoire à haut débit : des puces DRAM empilées verticalement et reliées par des vias en silice (TSV), pour un débit très élevé dans un espace réduit à côté du processeur. Mais fabriquer ces piles est bien plus complexe que produire de la DRAM conventionnelle : plus il y a de couches, plus le processus de fabrication, d’assemblage et de validation devient exigeant, et un défaut sur un seul composant peut faire chuter le rendement global.

TrendForce évoque deux difficultés précises pour Rubin Ultra. La disponibilité mondiale de DRAM devrait rester limitée en 2027, ce qui restreint le nombre de wafers que Samsung, SK hynix et Micron peuvent consacrer au HBM, un rapport de force qui alimente aussi la guerre des ingénieurs HBM4 en Corée du Sud. Et il subsiste des incertitudes sur les délais de validation et l’amélioration du rendement de fabrication du HBM4E à 12 couches.

En 2025 et durant la première moitié de 2026, NVIDIA a retenu une configuration 12-Hi HBM4E comme référence pour Rubin Ultra. Depuis le début du troisième trimestre, l’entreprise a élargi ses options à des configurations 8-Hi HBM4E, 12-Hi HBM4 et 8-Hi HBM4, sans avoir encore annoncé laquelle sera retenue. Réduire le nombre de couches offre un avantage simple : avec un nombre donné de puces DRAM, on peut produire davantage de piles mémoire, car une configuration à huit couches nécessite moins de dies qu’une à douze. Si l’approvisionnement en DRAM est limité, cela permet de fabriquer de la mémoire pour un plus grand nombre d’accélérateurs. Pour NVIDIA, la décision revient donc à arbitrer entre capacité mémoire par GPU et nombre de GPU commercialisables.

TrendForce pense que l’accélération des vitesses d’entrée-sortie sera l’une des priorités de Rubin Ultra. Si le processus de validation du HBM4E à 12 couches aboutit rapidement, la vitesse par pin pourrait passer d’environ 8-11,7 Gb/s pour Rubin à environ 14-16 Gb/s, tandis qu’une version optimisée du HBM4 resterait autour de 11 à 12 Gb/s selon les estimations de la société de veille. La mémoire pourrait donc être moins volumineuse, mais plus rapide.

L’IA n’a plus besoin de tout stocker en HBM

Une évolution technique explique aussi pourquoi réduire la capacité ne se traduit plus forcément par une perte de performance aussi critique qu’il y a quelques années. Les modèles d’IA ont longtemps traité la HBM comme un espace de stockage unique, mais ce n’est plus le cas : NVIDIA a développé des architectures où différents types de mémoire et de stockage remplissent des fonctions distinctes. La HBM reste la couche la plus rapide et la plus proche du GPU, réservée aux données immédiatement nécessaires, alors que LPDDR, la mémoire connectée via CXL ou le stockage NAND peuvent prendre en charge d’autres charges de travail selon leur fréquence d’utilisation — une logique qui rejoint la montée en puissance de la LPDDR6 chez CXMT pour les charges d’IA embarquées.

NVIDIA applique déjà ce principe à la mémoire de contexte. La plateforme Vera Rubin embarque une architecture appelée Inference Context Memory Storage Platform, conçue pour utiliser du stockage flash connecté via BlueField-4 comme extension de la hiérarchie mémoire lors de charges de grande inférence de contexte. L’évolution logicielle aide aussi à réduire les besoins : des techniques comme la quantification permettent de représenter les poids des modèles avec moins de bits, et d’autres architectures réduisent la taille mémoire nécessaire au KV cache, l’une des composantes les plus gourmandes lors de l’inférence sur de grands modèles. La séparation entre les phases de pre-fill et de decode s’intensifie aussi, ces deux étapes pouvant s’exécuter sur des ressources différentes.

Au final, la hiérarchie mémoire se complexifie : le GPU garde en HBM le lot de données sur lequel il travaille immédiatement, tandis que les informations moins fréquemment utilisées résident dans des couches plus économiques mais de plus grande capacité. Cela ne signifie pas pour autant que disposer de plus de HBM devienne inutile : le Rubin actuel offre 288 Go de HBM4 par GPU et jusqu’à 22 To/s de bande passante, des chiffres qui montrent que la mémoire reste centrale dans l’architecture pour traiter des modèles de plusieurs centaines de milliards de paramètres et de larges fenêtres de contexte. La différence tient au fait qu’une fois la capacité minimale atteinte pour maintenir l’ensemble de données actif, augmenter la bande passante peut apporter plus de performance qu’augmenter la capacité.

Moins de HBM par GPU ne veut pas dire moins de business pour les fabricants

La réduction potentielle de la mémoire de Rubin Ultra pourrait sembler défavorable pour Samsung, SK Hynix et Micron, mais la réalité est plus nuancée. Si réduire la hauteur des piles améliore le rendement de fabrication et permet de produire plus de mémoire pour un plus grand nombre d’accélérateurs, NVIDIA pourrait vendre davantage de GPU, et donc installer plus de piles HBM en volume absolu. Il n’y a pas non plus d’indication claire d’un excès d’offre imminent : TrendForce prévoit que la demande de DRAM restera sous tension en 2027, ce qui permettrait aux fournisseurs de HBM de continuer à négocier les prix.

Micron, par exemple, a démarré au premier trimestre 2026 la production en volume de HBM4 36 Go à 12 couches pour NVIDIA Vera Rubin, avec des vitesses supérieures à 11 Gb/s par pin et plus de 2,8 To/s de bande passante par pile, et a déjà envoyé des échantillons de HBM4 de 48 Go à 16 couches. L’industrie sait donc fabriquer des piles de capacité croissante ; la vraie question est de savoir si les utiliser dans tous les produits a du sens. C’est le cœur de la décision qu’étudie NVIDIA : réduire la HBM dans Rubin Ultra ne signifie pas que l’industrie a trouvé une alternative meilleure, ni que le « memory wall » (la difficulté à alimenter des processeurs plus rapides avec assez de données) a disparu. Cela montre plutôt jusqu’où a été poussé le coût d’une stratégie qui consistait à résoudre le problème en ajoutant toujours plus de mémoire, la plus rapide possible, à chaque GPU.

L’analyse de TrendForce va plus loin, en suggérant que l’utilisation à grande échelle de la HBM a absorbé une part importante de la capacité de fabrication, ce qui pourrait atténuer la nature cyclique traditionnelle du marché de la DRAM ; certains anticipent aussi une architecture future intégrant davantage de mémoire et de logique ensemble. Ce ne sont là que des pistes d’évolution, pas des spécifications confirmées par NVIDIA. Pour l’instant, un fait reste concret : NVIDIA étudie l’utilisation de moins de HBM dans Rubin Ultra tout en visant des vitesses d’entrée-sortie plus élevées, et ce n’est pas une tendance isolée puisque plusieurs fournisseurs cloud envisagent aussi de réduire la capacité HBM de leurs futurs ASIC dédiés à l’IA, selon TrendForce.

La course aux accélérateurs pourrait ainsi entrer dans une nouvelle phase. Après plusieurs années où chaque génération ajoutait davantage de mémoire et un débit plus élevé, la pénurie et les prix de la mémoire obligent désormais à examiner la rentabilité de chaque part de capacité. La question n’est plus seulement combien de HBM on peut associer à un GPU, mais aussi combien en a-t-on réellement besoin, et à quelle vitesse le processeur doit-il recevoir ces données.

Questions fréquentes

NVIDIA a-t-elle décidé de réduire définitivement la mémoire de Rubin Ultra ?

Non. TrendForce confirme que NVIDIA évalue plusieurs configurations, dont HBM4E à 8 couches et HBM4 à 8 ou 12 couches, en plus du design initial à 12 couches HBM4E. La configuration finale n’a pas encore été annoncée.

Pourquoi NVIDIA souhaite-t-elle utiliser moins de HBM ?

TrendForce cite principalement la pénurie prévue de DRAM en 2027, ainsi que les incertitudes sur la validation et le rendement de fabrication du HBM4E à 12 couches. Réduire la hauteur des piles permettrait aussi de produire plus de mémoire pour davantage de GPU.

La vitesse ou la capacité de la HBM sont-elles prioritaires ?

Cela dépend de la charge de travail. La capacité reste essentielle pour maintenir les données actives, mais les architectures d’IA modernes transfèrent une partie de l’information moins utilisée vers d’autres couches mémoire ou de stockage, ce qui donne à la bande passante de la HBM une priorité croissante.

La réduction de HBM nuira-t-elle à Samsung, SK Hynix et Micron ?

Pas nécessairement. Si la réduction du nombre de couches améliore le rendement de fabrication et permet de vendre plus d’accélérateurs, la demande globale de HBM pourrait continuer de croître. TrendForce anticipe une hausse de 50 à 60 % des bits HBM expédiés en 2027, avec une offre qui restera sous pression face à la demande.

via : Jukan05