Huawei a présenté OceanStor M900 Context Memory Storage, un système de stockage conçu pour accélérer l’inférence en intelligence artificielle dans les centres de données à grande échelle. Cette solution élargit la mémoire disponible pour le cache KV, utilisé lors de l’inférence de grands modèles, en passant de la mémoire des accélérateurs et de la DRAM jusqu’aux unités SSD, avec une capacité totale que Huawei estime pouvant atteindre 64 pétaoctets par cluster.
Les points clés d’OceanStor M900 en 20 secondes
- Huawei étend le cache KV des SuperPoD jusqu’à 64 PB par cluster.
- Le système combine la mémoire des accélérateurs, la DRAM et le SSD via UniversalBus.
- Huawei annonce une réduction de la latence d’accès de plusieurs millisecondes à seulement 60 microsecondes.
- Le fabricant revendique une bande passante agrégée jusqu’à 40 TB/s et un doublement des performances en tokens.
- Une technologie de stockage adaptatif vise à augmenter la durée de vie des SSD jusqu’à 16 fois.
Huawei a dévoilé l’OceanStor M900 le 17 septembre lors de HUAWEI CONNECT 2026, organisé à Shanghai. Ce système s’inscrit dans une stratégie visant à étendre l’architecture des SuperPoD au-delà du simple calcul, en coordonnant étroitement calcul, réseau et stockage.
Cette démarche répond à l’évolution des modèles d’IA. À mesure que les fenêtres de contexte s’allongent et que les agents maintiennent des conversations ou exécutent des tâches plus complexes, la quantité de données à conserver durant l’inférence augmente. Huawei identifie le cache KV comme un des éléments qui commencent à mettre sous pression la capacité et le coût de la mémoire disponible, tant pour les accélérateurs que pour la DRAM.
Le fabricant propose OceanStor M900 comme une couche supplémentaire pour stocker et réutiliser ces données, sans dépendre uniquement de la mémoire située à proximité immédiate des unités de traitement.
Un cache KV allant jusqu’aux SSD
Le cache KV stocke les données de type Clé et Valeur générées lors de l’inférence d’un modèle. Lorsque tout ou partie du contexte peut être réutilisé, le système peut récupérer ces données au lieu de recalculer certains éléments.
Ce mécanisme prend une importance accrue avec des modèles capables de gérer des fenêtres de contexte de plus d’un million de tokens, selon Huawei. Lors de conversations multi-tours ou tâches complexes, l’accumulation d’informations stockables pour une utilisation ultérieure devient cruciale.
Le défi réside dans la capacité limitée de la mémoire des accélérateurs et de la DRAM, ainsi que dans le coût croissant associé à l’extension à de grands volumes.
OceanStor M900 utilise UnifiedBus, le réseau d’interconnexion de Huawei, pour créer un espace global de cache KV à stockage hiérarchisé. Les données peuvent être réparties entre la mémoire des accélérateurs, la DRAM et les SSD, augmentant ainsi la capacité totale sans dépendre uniquement de la mémoire la plus proche du processeur.
Huawei affirme qu’un seul cluster peut atteindre 64 PB de capacité pour le cache KV. La capacité par NPU (Unité de traitement neuronal) passerait de gigaoctets à téraoctets.
Cette augmentation de capacité permettrait de stocker, partager et réutiliser davantage de contexte, améliorant potentiellement le taux de réussite du cache. Cependant, ces chiffres restent des déclarations du fabricant, sans validation indépendante à ce stade.
De millisecondes à 60 microsecondes, selon Huawei
La deuxième composante majeure concerne la rapidité d’accès aux données stockées.
Huawei garantit que l’OceanStor M900 intègre une architecture combinant CPU, contrôleur réseau et contrôleur NAND. Cette conception permet une sémantique intégrée pour le cache KV et une connectivité d’un seul saut entre les NPUs du SuperPoD et les SSD.
Selon Huawei, cette architecture évite les conversions de protocoles et certaines opérations de transfert via la CPU. La réduction de la latence d’accès passerait ainsi de plusieurs millisecondes à seulement 60 microsecondes, soit une amélioration de 90 % selon leurs calculs.
Le système atteindrait également jusqu’à 40 TB/s de bande passante agrégée par cluster, une valeur qui dépasserait de 1,5 fois celle des solutions concurrentes, selon le fabricant.
L’objectif est de diminuer le temps d’attente des accélérateurs pour l’accès aux données. Dans les charges de travail IA où le calcul et la récupération de contexte sont étroitement liés, une capacité de stockage plus grande est inutile si l’accès demeure lent.
Huawei assure que, dans des scénarios d’IA courants, l’OceanStor M900 peut doubler le rendement en tokens du cluster d’inférence et réduire de moitié le temps jusqu’au premier token (Time To First Token, TTFT). Ces résultats proviennent également de tests réalisés par Huawei dans leurs propres environnements de référence.
Le stockage doit aussi supporter l’usure
Une écriture intensive sur les SSD soulève la question de la durabilité des unités.
Pour y faire face, Huawei intègre ce qu’il nomme KV-aware adaptive storage technology. Cette technologie prend en compte le comportement et la durée de vie prévue des données dans le cache KV pour décider de leur stockage optimal.
L’idée est d’identifier la valeur et la longévité estimée des données afin d’adapter leur emplacement, évitant ainsi une concentration excessive d’écritures sur certains appareils.
Huawei indique que l’OceanStor M900 peut atteindre jusqu’à 24 écritures par jour par unité (DWPD) et que cette technologie peut multiplier par 16 la résistance des SSD. La durée de vie stabilisée est estimée à environ trois ans dans les conditions spécifiées.
L’objectif est de limiter les remplacements et de réduire les coûts d’exploitation et de maintenance liés à de grandes infrastructures d’IA en inférence.
D’une infrastructure centrée sur le calcul à une autre basée sur trois couches
La présentation du M900 s’inscrit dans une stratégie plus large de Huawei pour ses systèmes d’IA. L’entreprise considère que l’augmentation des modèles et des agents rend la gestion du contexte de plus en plus importante dans l’architecture.
Jusqu’à présent, la majorité des systèmes d’IA se concentraient principalement sur l’accroissement des capacités de calcul via GPU ou NPU. Huawei propose désormais une architecture où calcul, réseau et stockage doivent fonctionner de manière coordonnée.
Dans les grands SuperPoD, la quantité d’informations échangée entre accélérateurs et mémoire peut devenir une limite. Une cache KV distribuée et partagée permet, selon Huawei, de conserver davantage de contexte et de le réutiliser depuis différentes ressources de calcul.
Cela est particulièrement pertinent pour des systèmes d’inférence avec des niveaux de contexte étendus ou des tâches multi-étapes. Dans ces cas, une partie du travail consiste précisément à récupérer des informations précédemment générées et à les mettre à disposition du modèle au bon moment.
L’OceanStor M900 vise à faire des SSD une extension de cette mémoire de contexte, avec une hiérarchie différente en capacité et en accès comparée à la mémoire présente dans l’accélérateur lui-même.
Cette stratégie s’inscrit dans le cadre des annonces de Huawei lors de HUAWEI CONNECT 2026, où la société a également présenté ses nouvelles architectures SuperPoD et SuperCluster. Ensemble, elles visent à créer une infrastructure où la performance de l’IA ne dépend pas uniquement du nombre d’unités de traitement, mais aussi de la rapidité d’accès au contexte nécessaire.
Foire aux questions
Qu’est-ce que l’OceanStor M900 ?
Un système de stockage Huawei destiné à l’inférence en IA dans les centres de données à grande échelle. Il vise principalement à étendre et partager le cache KV entre la mémoire des accélérateurs, la DRAM et les SSD.
Quelle capacité peut-il atteindre ?
Huawei affirme qu’un cluster doté de l’OceanStor M900 peut fournir jusqu’à 64 PB de capacité pour le cache KV.
Qu’est-ce que le cache KV ?
Une structure qui stocke les données générées lors de l’inférence d’un modèle, permettant leur réutilisation pour éviter de recalculer certains éléments. Son volume augmente avec les fenêtres de contexte longues et les tâches multi-ronde.
Quelles améliorations de performance Huawei annonce-t-elle ?
Réduction de la latence jusqu’à 60 microsecondes, bande passante de 40 TB/s, doublement du rendement en tokens et réduction de moitié du temps jusqu’au premier token dans certains scénarios.