d-Matrix a présenté lors de Hot Chips 2026 de nouveaux détails sur Raptor, sa prochaine génération d’accélérateurs pour l’inférence en intelligence artificielle, bâtie sur une architecture peu conventionnelle : intégrer la puce de calcul directement sur une DRAM conçue sur mesure. Le résultat promis atteint jusqu’à 100 To/s de bande passante par carte avec 32 Go de mémoire, une valeur qui vise à repousser l’un des principaux obstacles de l’inférence générative : déplacer les données vers les unités de calcul assez vite, sans faire exploser la consommation.

Raptor et sa mémoire 3D en 30 secondes

La proposition compte parce qu’une grande partie du débat autour des accélérateurs IA s’est concentrée ces dernières années sur la capacité et la vitesse de la mémoire HBM, de plus en plus rare. d-Matrix propose une approche différente : rapprocher encore davantage la mémoire du calcul, au point d’en faire quasiment une structure tridimensionnelle unique. L’entreprise avait déjà montré sa technologie 3DIMC en 2025 via la puce expérimentale Pavehawk. Raptor sera la première implémentation commerciale de cette architecture, succédant à Corsair, l’accélérateur d’inférence que d-Matrix produit actuellement.

Le vrai problème n’est pas seulement de calculer plus vite

La génération token par token d’un modèle de langage a une caractéristique gênante pour qui conçoit du matériel : pendant une grande partie du décodage, les unités mathématiques de l’accélérateur ont largement assez de capacité de calcul, mais réclament en permanence l’arrivée de poids, de caches et d’autres données depuis la mémoire. Le goulet d’étranglement se déplace alors du traitement arithmétique vers la bande passante mémoire. L’article académique Early Silicon of Raptor: The First 3D-DRAM Accelerator for Generative Inference, présenté au Symposium International sur l’Architecture Informatique (ISCA) 2026, décrit précisément l’inférence générative comme une charge principalement limitée par la mémoire.

La SRAM offre un débit énorme, mais intégrer de grandes capacités en surface de silicium coûte très cher. La HBM augmente considérablement la capacité tout en gardant un débit élevé, mais oblige toujours à transporter l’information entre puces séparées via l’encapsulation. Raptor cherche à réduire encore cette distance : son die de calcul se pose directement sur un die DRAM développé spécifiquement pour cet accélérateur, les deux étant unis face-à-face par des connexions de 36 micromètres qui forment une interface verticale très dense. La différence physique paraît mineure, mais déplacer un bit sur quelques micromètres consomme bien moins d’énergie que sur des liens plus longs. Selon Sudeep Bhoja, cofondateur et directeur technique de d-Matrix, le silicium testé par la société a mesuré environ 0,37 pJ/bit pour ce mouvement vertical, une valeur cohérente avec les 0,4 pJ/bit déjà communiqués lors des tests Pavehawk.

100 To/s avec seulement 32 Go : un choix délibéré

La caractéristique la plus remarquée reste la bande passante : chaque carte Raptor dispose de 32 Go de mémoire et peut atteindre jusqu’à 100 To/s, largement au-dessus de la bande passante actuelle de la HBM. Nuance importante : Raptor ne cherche pas à rivaliser sur une capacité mémoire énorme par carte, son pari se joue ailleurs.

CaractéristiqueRaptor 3D-DRAMDesign typique avec HBM
Intégration mémoire-calculDRAM empilée directement sur la logiqueHBM placée à côté de l’accélérateur
Capacité par carte32 GoPeut être bien plus grande
Bande passanteJusqu’à 100 To/sPlusieurs To/s selon l’implémentation
Distance de déplacement des donnéesTrès réduite via interface verticalePlus grande, via encapsulation
Objectif principalInférence à faible latenceCapacité et bande passante élevées

Comparer uniquement ces 100 To/s à une GPU HBM peut induire en erreur. Raptor cible un pattern de travail spécifique, pas un accélérateur généraliste capable d’accueillir tous les modèles et d’exécuter n’importe quelle opération IA comme une GPU classique. d-Matrix construit son architecture autour de l’inférence générative avec de petits lots, une faible latence et un nombre élevé d’utilisateurs simultanés. La capacité limitée à 32 Go oblige aussi à répartir les grands modèles sur plusieurs cartes, ce qui donne un rôle crucial au logiciel, à l’organisation mémoire et au réseau interne.

D’où vient le ratio de 4,71 fois

L’article académique associé à Raptor compare l’architecture 3D-DRAM à des versions hypothétiques utilisant HBM et SRAM, sur des modèles comme Llama 3.1 70B, DeepSeek-V3, Kimi K2, GPT-OSS, Whisper et Canary. Résultat : la configuration 3D-DRAM fournit 4,71 fois plus de débit que la variante HBM et 2,44 fois plus que SRAM. Le chiffre impressionne, mais ne veut pas dire que Raptor exécutera n’importe quel modèle 4,7 fois plus vite qu’une GPU HBM commerciale : la comparaison isole l’effet de l’architecture mémoire en gardant les autres éléments du design dans des conditions similaires. C’est une étude académique, pas un benchmark indépendant face à des produits commerciaux NVIDIA, AMD ou autres, et certains résultats viennent de modélisation architecturale combinée à des mesures initiales de silicium.

L’intérêt réside justement là : Raptor n’est plus une simple simulation, la société a fabriqué et mesuré des puces qui permettent de vérifier des paramètres fondamentaux comme la consommation, le comportement thermique et la fiabilité de l’interface 3D.

Déplacer des données coûte de plus en plus cher en énergie

La puissance d’un accélérateur ne se limite pas aux multiplications matricielles, il faut aussi transporter les données. d-Matrix compare environ 0,37 pJ/bit pour son interface verticale à environ 2,4 pJ/bit pour déplacer l’information vers la puce de base dans une implémentation HBM4. Ce n’est pas directement comparable pour le coût total en énergie, les chemins, interfaces et fonctions étant différents, mais ça illustre le principe physique poursuivi : plus la distance entre mémoire et calcul est courte, moins il faut d’énergie pour déplacer chaque bit. Dans une inférence qui relit sans cesse de gros volumes de données, cette différence devient vite critique. d-Matrix affirme que son approche réduit à la fois consommation et latence par rapport aux architectures où mémoire et calcul restent plus séparés, une hypothèse déjà validée avec Pavehawk avant son transfert vers Raptor.

Une DRAM pensée pour vivre sous l’accélérateur

d-Matrix ne place pas simplement une puce de mémoire commerciale sous son processeur : le die de DRAM est conçu spécifiquement pour cette architecture. La société n’a pas communiqué publiquement le fabricant de cette mémoire lors de Hot Chips, mais elle a confirmé que le die de calcul utilise un procédé TSMC de 4 nm.

Cette intégration soulève des enjeux qu’un système classique avec HBM ne connaît pas. Le premier concerne la température : poser la logique directement sur la DRAM la fait fonctionner plus chaud, ce qui affecte la durée de conservation des données et oblige à adapter les politiques de rafraîchissement. L’article académique décrit des mécanismes de rafraîchissement conscient de la température, de redondance et de correction d’erreurs (ECC) pour garantir la fiabilité. Autre enjeu : le nombre élevé de banques mémoire qui doivent fonctionner simultanément. Raptor utilise une technique de stream-blocking pour répartir les flux, y compris la cache KV des modèles génératifs, entre des canaux configurables de la 3D-DRAM afin de garder le parallélisme, et intègre aussi une variante de Data Bus Inversion adaptée à l’interface verticale pour réduire les transitions électriques et la consommation. Des détails moins spectaculaires que les 100 To/s, mais essentiels pour que la technologie fonctionne en conditions réelles.

La cache KV, un cas d’usage taillé pour cette conception

La mémoire est devenue un problème majeur à mesure que les contextes des modèles s’étendent. Lors de l’inférence, un modèle maintient une cache KV avec les informations générées lors du traitement des tokens précédents, et plus le contexte et le nombre d’utilisateurs simultanés augmentent, plus cette structure réclame de mémoire, tout en devant y accéder rapidement. Raptor est conçu avec ces flux en tête : l’article d’ISCA explique comment la cache KV se répartit sur les canaux mémoire sans perdre le parallélisme entre banques. L’architecture vise à concilier deux objectifs souvent contradictoires, disposer d’une quantité raisonnable de DRAM tout en la plaçant assez près du calcul pour un débit proche de celui de la SRAM, ce qui permet à d-Matrix de parler d’une capacité comparable à la DRAM, avec une localité et une bande passante proches de la SRAM.

Le réseau reste indispensable au-delà d’une carte

Les 32 Go par carte posent une question évidente : des modèles comme Llama 3.1 70B, DeepSeek-V3 ou Kimi K2 peuvent réclamer bien plus de mémoire, même après quantification, et Raptor doit alors répartir ces modèles entre plusieurs accélérateurs. La performance du système dépend donc aussi de la façon dont ces cartes communiquent. L’étude indique que l’architecture 3D-DRAM est moins sensible à la latence et au débit réseau que ses alternatives, en partie grâce à son large débit interne qui permet de terminer très vite les opérations locales, mais le réseau n’est pas pour autant abandonné : coordonner les accélérateurs, transporter les activations et répartir le travail restent nécessaires sur les déploiements à grands modèles. d-Matrix travaille depuis plusieurs années sur une plateforme à base de chiplets et d’interconnexions haute vitesse, et son architecture Corsair utilise déjà un design modulaire pour étendre la capacité au-delà d’une seule puce.

Raptor intégrera aussi des cœurs basés sur RISC-V : en novembre 2025, d-Matrix avait annoncé avoir choisi AndesCore AX46MPV d’Andes Technology comme CPU d’orchestration et pour le calcul vectoriel de sa prochaine architecture. Ces cœurs gèreront la distribution des charges, la coordination mémoire et le contrôle du runtime, tout en déléguant certaines opérations comme les fonctions d’activation. C’est secondaire face à l’innovation mémoire, mais ça montre à quel point Raptor s’éloigne d’un GPU classique : logique d’inférence propre, DRAM 3D, cœurs RISC-V et architecture de chiplets pensée dès le départ autour du déplacement de données. D’où l’intérêt de ne pas le voir simplement comme une « GPU plus rapide ».

L’inférence se joue de plus en plus dans la mémoire

Raptor arrive au moment où l’industrie explore plusieurs réponses au même problème. La HBM continue d’évoluer vers la génération HBM4 et au-delà, la High Bandwidth Flash envisage d’ajouter une couche de capacité énorme entre HBM et SSD, les fabricants de CPU intègrent des extensions matricielles, et des entreprises comme d-Matrix tentent de rapprocher physiquement calcul et mémoire pour réduire au minimum le coût du transfert d’informations. Ces stratégies peuvent coexister, elles répondent à des problèmes différents. Pour entraîner des modèles géants, les GPU avec beaucoup de HBM restent une combinaison difficile à surpasser : capacité, bande passante, interconnexion et logiciel. Pour l’inférence interactive, où produire chaque token rapidement pour des millions d’utilisateurs compte parfois plus qu’une puissance FP4 théorique énorme, l’équilibre change, et c’est là que d-Matrix veut positionner Raptor.

La société devra encore prouver sur des systèmes commerciaux que ses résultats initiaux et ses modèles de performance tiennent à l’échelle, dans des applications réelles et face aux futures générations de GPU. Mais le travail présenté à ISCA et Hot Chips envoie un signal clair : l’amélioration des performances IA ne dépend plus seulement de la fabrication d’unités mathématiques plus rapides, le coût du transport des données devient de plus en plus déterminant. Raptor pousse cette idée à l’extrême en plaçant la mémoire juste sous le calcul, connectée par des milliers de liens microscopiques. Si l’architecture parvient à transférer ses 100 To/s de la démonstration technique à des serveurs compétitifs commercialement, d-Matrix aura transformé l’un des plus grands défis de l’inférence générative, la distance entre mémoire et calcul, en caractéristique centrale de son accélérateur.

Questions fréquentes

Qu’est-ce que Raptor de d-Matrix ?

La prochaine génération d’accélérateurs de d-Matrix pour l’inférence IA. Elle adopte une architecture 3DIMC qui superpose directement la logique de calcul et la DRAM pour réduire la latence et la consommation liées au déplacement des données.

Quelle bande passante offre Raptor ?

Jusqu’à 100 To/s de bande passante par carte, avec 32 Go de mémoire 3D-DRAM.

Raptor est-il plus rapide qu’un GPU avec HBM ?

L’étude présentée à ISCA estime un débit 4,71 fois supérieur à une variante basée sur HBM pour les charges évaluées. Ce chiffre dépend de l’architecture et des scénarios analysés, ce n’est pas une avance universelle sur tous les GPU commerciaux.

Quel procédé de fabrication utilise Raptor ?

Le die de calcul utilise un procédé TSMC 4 nm. d-Matrix n’a pas communiqué publiquement le fabricant de la DRAM intégrée lors de Hot Chips.