Huawei a présenté l’Atlas 960E SuperPoD, un système de calcul dédié à l’intelligence artificielle qui intègre la technologie optique Near-Packaged Optics (NPO) et peut escalader jusqu’à 4 096 unités de traitement neuronal (NPU) au sein d’un seul SuperPoD. La société l’a dévoilé le 17 septembre lors de HUAWEI CONNECT 2026, organisé à Shanghai, comme une infrastructure orientée à la formation et à l’inférence de modèles comptant jusqu’à 10 milliards de paramètres.

Les points clés de l’Atlas 960E SuperPoD en 30 secondes

  • L’Atlas 960E intègre jusqu’à 4 096 NPUs et atteint 8 EFLOPS en FP8 ainsi que 16 EFLOPS en FP4.
  • Il utilise 5 500 moteurs optiques Hi-ONE basés sur la technologie NPO pour connecter ses composants.
  • Huawei affirme qu’il évite 48 000 modules optiques 800G et réduit la consommation électrique de plus de 550 kW.
  • Le système offre, selon Huawei, une disponibilité de 99,8 % et peut accueillir jusqu’à 1 PB de mémoire HBM.
  • Plusieurs SuperPoD peuvent former un SuperCluster jusqu’à 512 000 NPUs, avec une architecture pouvant atteindre un million de processeurs.

L’offre de Huawei repose sur deux technologies maison : UnifiedBus, utilisée comme architecture d’interconnexion, et Hi-ONE, un moteur optique basé sur la technologie NPO. La société présente ces deux solutions comme parties intégrantes de sa stratégie pour bâtir des systèmes d’IA à grande échelle où processeurs, mémoire, stockage et réseaux travaillent avec une interconnexion commune.

4 096 NPUs dans un seul SuperPoD

L’Atlas 960E SuperPoD adopte une architecture orthogonale et une réfrigération entièrement liquide. UnifiedBus offre une gestion unifiée de la mémoire, permettant au système d’intégrer jusqu’à 4 096 NPUs. Huawei revendique une capacité de calcul de 8 EFLOPS en FP8 et 16 EFLOPS en FP4, ainsi qu’une mémoire HBM pouvant atteindre 1 pétaoctet, selon les informations communiquées lors de l’événement.

Ces chiffres ciblent des charges de travail requérant de vastes capacités de calcul et une communication intensive entre accélérateurs. Huawei associe cette architecture à la formation et à l’inférence de modèles à l’échelle, près de 10 milliards de paramètres.

L’interconnexion est un point central du design. Plutôt que de s’appuyer uniquement sur des modules optiques classiques entre composantes, l’Atlas 960E intègre 5 500 unités Hi-ONE.

Huawei affirme que cette organisation évite l’utilisation des 48 000 modules optiques 800G nécessaires dans une connexion conventionnelle. La configuration permettrait ainsi de réduire la consommation électrique de plus de 550 kW et de doubler la durée de fonctionnement sans panne, avec une disponibilité déclarée de 99,8 %.

Ces données sont celles avancées par Huawei, qui attribue ces performances à son système. Aucune comparaison indépendante n’a été fournie pour valider ces métriques par rapport à d’autres architectures commerciales.

Hi-ONE : rapprocher l’optique du système

La technologie NPO, sigle de Near-Packaged Optics, vise à rapprocher l’interconnexion optique des composants qui génèrent et traitent les données. Dans le cas de l’Atlas 960E, Huawei utilise Hi-ONE comme un élément de connexion haute vitesse au sein du SuperPoD.

La société décrit Hi-ONE comme un moteur optique de nouvelle génération capable de transmettre jusqu’à 7,2 Tbit/s par unité. Elle affirme aussi qu’il s’agit de son premier produit NPO prêt pour la production en série, et le seul NPO avec une source lumineuse intégrée à ce jour, selon ses propres données.

Huawei a également présenté une proposition d’implémentation de NPO auprès de l’Optical Internetworking Forum (OIF), organisme de normalisation dans le secteur, dans le but de contribuer au développement de l’écosystème de cette technologie.

L’importance de l’optique dans ces systèmes réside dans l’augmentation des distances de transmission et du volume de données échangés par les accélérateurs. Plus le nombre de NPUs augmente, plus le réseau interne devient crucial, influençant directement les performances, la consommation et la possibilité de faire évoluer le système.

UnifiedBus vise à résoudre ce problème via une architecture d’interconnexion uniforme. Huawei le présente comme un protocole permettant de connecter processeurs, NPUs, mémoire, SSD, cartes réseaux et commutateurs par des interconnexions pair-à-pair.

Du SuperPoD au million de NPUs

L’Atlas 960E n’est pas conçu comme une unité isolée. Huawei a aussi dévoilé une architecture permettant de relier plusieurs SuperPoD et de créer des systèmes de plus grande taille.

Selon la société, plusieurs Atlas 960E peuvent être connectés via UnifiedBus ou RoCE pour former un SuperCluster jusqu’à 512 000 NPUs. Avec une topologie multi-rail, Huawei garantit qu’il est possible d’aller jusqu’à un million de NPUs.

La société a présenté cette stratégie en lien avec une nouvelle architecture de calcul nommée Peerium, dans laquelle UnifiedBus joue le rôle d’interconnexion. Huawei envisage ainsi que des processeurs à l’échelle d’un million puissent fonctionner comme un système de calcul coordonné, avec gestion unifiée de la mémoire et interconnexions pair-à-pair.

L’objectif ne se limite pas à l’entraînement de modèles. Huawei adapte également cette infrastructure pour les charges de travail liées aux agents d’IA, où processeurs, mémoire et stockage échangent des informations très fréquemment.

TaiShan 950 et stockage de contexte pour compléter l’écosystème

L’entreprise a également actualisé sa plateforme de calcul général TaiShan 950 SuperPoD. La nouvelle version repose sur un réseau optique basé sur UnifiedBus et supporte jusqu’à 4 096 nœuds avec un espace mémoire unifié allant jusqu’à 256 To.

Huawei associe cette capacité à des applications d’agents d’IA. Lors de ses tests internes, la société indique pouvoir accélérer le démarrage de 100 000 sandboxes jusqu’à 30 fois par rapport à des serveurs traditionnels, tout en augmentant la densité de ces environnements de 25 %. Elle revendique aussi une double efficacité dans les recherches vectorielles sur 10 milliards de vecteurs de 1 000 dimensions. Ces chiffres, communiqués par Huawei, ne font pas l’objet d’évaluation indépendante.

Ce système est complété par OceanStor M900, une solution de stockage de mémoire de contexte basée sur UnifiedBus. Huawei l’a conçue pour offrir un accès direct en un saut et un cache KV à échelle de pétaoctets pour ce qu’elle nomme la couche L3.5.

L’ensemble illustre comment Huawei oriente son architecture Ascend : pas seulement vers des accélérateurs plus puissants, mais vers des systèmes intégrés où calcul, mémoire, stockage et interconnexion sont conçus comme une seule et même infrastructure.

Un autre aspect mis en avant lors de la présentation est CANN, la plateforme logiciel Huawei pour Ascend. La société assure qu’elle a adopté un modèle de développement open source, maintenu par la communauté. Ce mouvement vise à élargir le nombre de développeurs et d’applications compatibles avec l’écosystème Ascend.

L’Atlas 960E SuperPoD représente ainsi une initiative pour faire évoluer l’infrastructure IA en multipliant les accélérateurs, mais aussi en rendant leur interconnexion plus cohérente. La combinaison de NPO, UnifiedBus, refroidissement liquide et mémoire partagée cherche à dépasser certains limites physiques apparaissant lorsque les systèmes gagnent en taille, passant de quelques centaines à des milliers de processeurs.

Questions fréquentes

Qu’est-ce que l’Atlas 960E SuperPoD ?

C’est une plateforme de calcul pour l’intelligence artificielle de Huawei, utilisant des NPUs Ascend, l’interconnexion UnifiedBus et des moteurs optiques Hi-ONE basés sur la technologie NPO.

Combien de NPUs peut-elle intégrer ?

Un Atlas 960E SuperPoD peut évoluer, selon Huawei, jusqu’à 4 096 NPUs, avec 8 EFLOPS en FP8 et 16 EFLOPS en FP4.

Quelle est la contribution de la technologie NPO ?

NPO, ou Near-Packaged Optics, rapproche l’interconnexion optique des composants qui communiquent. Huawei utilise son moteur Hi-ONE, avec une capacité déclarée de 7,2 Tbit/s par moteur.

Peut-on connecter plusieurs SuperPoD ?

Oui. Huawei indique que plusieurs Atlas 960E peuvent former un SuperCluster allant jusqu’à 512 000 NPUs, et qu’une topologie multi-rail permettrait d’atteindre un million de NPUs.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *