La startup chinoise Dongfang Suanxin, DFSX, tente de changer les règles du marché des puces IA sans passer par la course aux processus de gravure les plus fins. Sa future plateforme TY64 SuperNode, bâtie autour des accélérateurs DF2000 gravés en 14 nanomètres, promet jusqu’à 960 To/s de bande passante mémoire, contre 576 To/s pour le système NVIDIA GB200 NVL72, selon les chiffres communiqués par l’entreprise elle-même.
Ce qu’il faut retenir
- DFSX mise sur l’architecture et l’encapsulage 3D plutôt que sur la compétition dans les nœuds de fabrication.
- Le futur DF2000 garde un procédé de 14 nm, mais portera le débit à 15 To/s par puce.
- La plateforme TY64 SuperNode atteindrait 960 To/s de bande passante agrégée, selon la société.
- L’objectif est de réduire la dépendance chinoise à la mémoire HBM et aux technologies soumises aux restrictions américaines.
- Ces chiffres n’ont pas encore été vérifiés par des évaluations indépendantes.
Contexte et enjeux
Pendant des années, la course aux semi-conducteurs s’est jouée sur deux indicateurs, la taille du nœud de fabrication et le nombre de FLOPS. L’explosion de l’IA a remis sur le devant de la scène un problème connu depuis des décennies, le memory wall, ou mur de mémoire. Les GPU actuels exécutent d’énormes volumes d’opérations mathématiques, mais restent souvent partiellement inactifs à attendre que les données arrivent depuis la mémoire, ce qui réduit l’utilisation réelle de matériel coûtant des millions de dollars. DFSX affirme que c’est là que se joue la vraie bataille, et a conçu une architecture où mémoire et logique de calcul sont physiquement beaucoup plus proches, plutôt que de poursuivre des processus de 2 ou 3 nanomètres.
Cette approche s’inscrit dans une tendance plus large chez les fabricants chinois de mémoire. CXMT rapproche par exemple sa LPDDR6 de la production en misant sur une stratégie similaire de réduction de la dépendance aux fournisseurs étrangers, comme on le détaillait dans notre article sur l’accélération chinoise vers la LPDDR6. Les deux entreprises partent du même constat : la mémoire, pas seulement le calcul, est devenue le terrain où se joue l’indépendance technologique chinoise.
Les faits
Le premier accélérateur de la société, le DF1000, utilise déjà un procédé mature de 14 nm associé à une architecture Near-Memory Computing. Son design élimine les micro-bumps traditionnels grâce au hybrid bonding au niveau de la wafer, qui connecte directement la logique à la mémoire par des millions de connexions verticales. Selon DFSX, cela permet d’atteindre 6,4 To/s en utilisant sa propre mémoire, sans passer par la HBM soumise aux restrictions commerciales américaines.
La génération suivante, le DF2000, va plus loin encore : au lieu d’empiler une seule couche de mémoire sur la logique, elle utilisera plusieurs tours de mémoire et de calcul regroupées via une architecture appelée 3.5D Infinity Chiplet. Selon la feuille de route de l’entreprise, le DF2000 devrait atteindre 15 To/s par puce, pour une plateforme TY64 SuperNode de 64 puces culminant à 960 To/s, contre 576 To/s pour le NVIDIA GB200 NVL72. Ces chiffres proviennent uniquement de DFSX et n’ont pas encore été vérifiés par des tiers indépendants.
Cette bande passante a un prix : la puissance de calcul brute reste nettement inférieure à celle de NVIDIA. Selon les chiffres fournis par DFSX, le TY64 avec DF2000 atteint 64 PFLOPS en BF16, contre 360 PFLOPS pour le GB200 NVL72. L’écart reste considérable, et la thèse de la société chinoise repose sur l’idée que de nombreux modèles d’IA n’exploitent pas pleinement ces FLOPS parce qu’ils attendent en permanence les données depuis la mémoire.
Analyse et implications
Le pari de DFSX ne se joue pas dans le vide. AMD vient tout juste de sécuriser auprès de Samsung sa propre mémoire HBM4 pour la puce Helios, avec 432 Go de mémoire par puce, dans le cadre d’un accord détaillé dans notre article sur cette course à la mémoire face à NVIDIA. AMD et DFSX partent d’un même constat, la bande passante mémoire est devenue un argument de vente aussi important que la puissance de calcul brute, mais les deux entreprises n’ont pas le même point de départ : AMD reste dépendante des fournisseurs coreens de HBM, tandis que DFSX cherche précisément à s’en affranchir.
Si l’hypothèse de DFSX se vérifie, une architecture avec une puissance brute moindre mais un accès mémoire plus rapide pourrait offrir une meilleure efficacité réelle dans certains scénarios d’inférence, là où les FLOPS théoriques restent souvent sous-exploités. Mais l’écart de 64 contre 360 PFLOPS reste normément un handicap pour l’entraînement de grands modèles, un usage où la puissance de calcul brute pese encore lourd. DFSX se positionne donc davantage comme une alternative pour l’inférence à grande échelle que comme un concurrent direct sur l’entraînement.
Le contexte géopolitique pèse aussi lourd dans cette équation. Les restrictions américaines limitent l’accès chinois à la lithographie avancée et à la mémoire HBM de dernière génération, ce qui pousse plusieurs entreprises chinoises à concurrencer via de nouvelles architectures plutôt qu’en suivant NVIDIA, AMD ou TSMC sur leur propre terrain. Cette stratégie de contournement explique en partie pourquoi le marché mondial des puces reste sur une trajectoire de croissance aussi forte malgré les tensions commerciales, un marché qui devrait dépasser le billion de dollars en 2026 selon nos données sur la croissance du secteur portée par l’IA.
Perspectives
DFSX prévoit les livraisons du DF1000 avant la fin 2026, celles du DF2000 au dernier trimestre 2026, et vise déjà un DF3000 pour fin 2027 avec un objectif de 20 To/s par puce. Reste à vérifier si cette feuille de route tient, sachant que l’empilement tridimensionnel pose des défis industriels connus, notamment sur les rendements de fabrication quand le nombre de couches augmente. La société elle-même reconnaît cette difficulté.
Le succès commercial de DFSX dépendra autant du logiciel que du silicium : maturité de l’écosystème, compilateurs et bibliothèques pour l’IA, capacité à monter en échelle sur des milliers d’accélérateurs, rendements de fabrication et efficacité énergétique. Ce qui devient évident, c’est que la prochaine génération d’accélérateurs IA ne se jouera plus uniquement sur la finesse du nœud de gravure : la mémoire, l’encapsulage avancé et la vitesse de transfert des données pèsent désormais presque autant que le nombre brut de FLOPS.
Questions fréquentes
Qu’est-ce que DFSX ?
Dongfang Suanxin, DFSX, est une startup chinoise spécialisée dans les accélérateurs pour l’intelligence artificielle, qui privilégie des architectures proches de la mémoire et une chaîne d’approvisionnement nationale.
Pourquoi utilise-t-elle un procédé de 14 nm ?
La société privilégie une architecture différente basée sur l’encapsulation 3D et la mémoire intégrée, pour réduire la dépendance aux nœuds avancés et à la mémoire HBM.
Est-ce que le DF2000 sera plus rapide que NVIDIA ?
Pas nécessairement. DFSX annonce un débit mémoire supérieur, mais reconnaît une puissance de calcul BF16 inférieure à celle du système NVIDIA GB200 NVL72.
Ces chiffres ont-ils été vérifiés ?
Non. Les données concernant le DF2000 et le TY64 SuperNode proviennent de la société elle-même et n’ont pas encore été confirmées par des tests indépendants.
vía : wccftech