Jalapeño d’OpenAI dépasse NVIDIA Blackwell en inférence par watt

OpenAI affronte Jalapeño face à NVIDIA Blackwell et gagne en inférence par watt

OpenAI a publié les premiers résultats de Jalapéño, son premier accélérateur ASIC conçu en interne pour l’inférence en intelligence artificielle. Les chiffres montrent un avantage net face aux systèmes NVIDIA Blackwell GB200 et GB300 sur les trois charges de travail testées. Sur GPT-OSS 120B, Jalapéño atteint 85 448 tokens mixtes par seconde et par kilowatt, soit 1,9 fois le résultat de la référence, tout en réalisant 1 459 tokens par seconde et par utilisateur avec la latence la plus faible. Ces mesures viennent du benchmark InferenceX de SemiAnalysis — rien ne permet en revanche d’affirmer que Jalapéño devance systématiquement Blackwell sur toutes les charges d’IA.

L’essentiel : Jalapéño offre entre 1,5 et 1,9 fois plus de performance par watt sur les trois modèles publiés, et atteint 1 459 tokens/sec par utilisateur avec GPT-OSS 120B. Les comparaisons portent sur NVIDIA GB200 et GB300 selon le modèle testé ; OpenAI a aussi évalué DeepSeek R1 670B et Kimi K2.5 1T. Le déploiement interne de la puce devrait démarrer avant la fin 2026.

Cette annonce compte autant par ses résultats que par sa provenance. OpenAI reste un très gros acheteur d’accélérateurs NVIDIA et prévoit de continuer, mais Jalapéño ouvre une autre voie, celle du silicium conçu sur mesure pour ses propres besoins en inférence, en intégrant accélérateur, mémoire, interconnexion, logiciel et conception système. Une stratégie que le groupe avait déjà posée en présentant Jalapéño comme son entrée dans la guerre du silicium.

Les résultats publiés couvrent des modèles très différents : GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5, avec un billion de paramètres pour ce dernier. SemiAnalysis précise que Jalapéño a devancé lors de ses tests les accélérateurs NVIDIA, AMD et Google évalués sur plusieurs grands modèles open source, ce qui élargit la portée de l’évaluation, même s’il faut distinguer ces résultats de ceux, spécifiques à NVIDIA, qu’OpenAI présente dans ses propres graphiques.

Jusqu’à 1 459 tokens par seconde pour un utilisateur

La mesure la plus frappante concerne la vitesse maximale de décodage par utilisateur. Avec GPT-OSS 120B, Jalapéño atteint 1 459 tokens/sec par utilisateur, contre 535 tokens/sec pour le système de référence GB200, soit environ 2,7 fois plus rapide. L’écart se creuse avec DeepSeek R1 : 700 contre 169 tokens/sec, soit 4,1 fois plus. Avec Kimi K2.5, Jalapéño obtient 694 tokens/sec contre 182 pour GB300, soit 3,8 fois plus.

ModèleJalapéñoComparaison NVIDIAAvantage
GPT-OSS 120B1 459 tokens/sec/utilisateurGB200 : 5352,7x
DeepSeek R1 670B700GB300 : 1694,1x
Kimi K2.5 1T694GB300 : 1823,8x

Cette métrique parle directement aux assistants et agents IA, où le temps de génération de chaque réponse conditionne la durée totale d’une tâche composée de plusieurs étapes. OpenAI voulait justement éviter le compromis habituel entre débit et latence : un système peut traiter beaucoup de requêtes en parallèle via batching, sans pour autant garantir la réponse la plus rapide à chaque utilisateur pris individuellement. Jalapéño cherche à tenir les deux dimensions dans la même architecture, ce qui se ressent aussi sur la latence globale : 1,03 seconde contre 1,80 avec GPT-OSS, 1,65 contre 5,99 secondes pour DeepSeek R1, et 1,56 contre 5,31 secondes pour Kimi K2.5.

La vraie bataille se joue en tokens par kilowatt

Pour un centre de données, la vitesse absolue ne raconte qu’une partie de l’histoire. La disponibilité électrique est devenue une contrainte majeure pour déployer de grandes infrastructures IA, et OpenAI utilise donc la performance par unité de puissance comme métrique clé.

ModèleJalapéñoNVIDIADifférence
GPT-OSS 120B85 448 tokens/sec/kWGB200 : 44 9601,9x
DeepSeek R1 670B19 641 tokens/sec/kWGB300 : 11 7811,7x
Kimi K2.5 1T18 195 tokens/sec/kWGB300 : 11 8621,5x

La comparaison est normalisée sur la puissance nominale de chaque accélérateur : 700 W pour Jalapéño, 1 200 W pour GB200 et 1 400 W pour GB300, avec une puce OpenAI maintenue en charge à une consommation soutenue de 550 W ou moins. Détail important : les 85 448 tokens/sec/kW ne signifient pas qu’un seul Jalapéño produit cette cadence en continu, la métrique normalise simplement la performance par la puissance pour comparer l’efficacité. Autre précaution à garder en tête : ces chiffres ne prouvent pas que Jalapéño est 90 % plus puissant que Blackwell en général, ils indiquent seulement que sur GPT-OSS 120B, et selon la méthodologie InferenceX, Jalapéño obtient environ 1,9 fois le throughput brut par kilowatt du GB200 utilisé pour la comparaison. InferenceX propose d’ailleurs des résultats pour de multiples configurations, où rendement, coût et efficacité varient selon le modèle, la précision, la séquence ou le niveau d’interactivité choisi — une variabilité que confirme aussi l’annonce récente de NVIDIA sur les gains de Vera Rubin face à Blackwell.

Comment expliquer le facteur 104

Un troisième résultat est encore plus spectaculaire : 104,3 fois. Mais conclure que Jalapéño serait 104 fois plus rapide qu’une NVIDIA GB300 serait une erreur de lecture. OpenAI fait ici un calcul différent : pour chaque système, l’entreprise fixe la vitesse maximale par utilisateur atteinte par la plateforme NVIDIA, puis calcule le throughput que chaque architecture peut maintenir à ce niveau, rapporté à la consommation électrique.

Avec GPT-OSS, en se calant sur environ 535 tokens/sec/utilisateur, Jalapéño atteint 22 935 tokens mixtes/sec/kW contre 427 pour le GB200, soit 53,7 fois plus. Avec DeepSeek R1, sur une base d’environ 169 tokens/sec/utilisateur, l’écart passe à 12 258 contre 118, soit 104,3 fois. Et avec Kimi K2.5, à 182 tokens/sec/utilisateur, cela donne 6 744 contre 120, soit 56,1 fois. Cette méthode révèle surtout le coût énergétique nécessaire pour pousser une architecture vers ses latences les plus basses, un terrain où le système Blackwell peine davantage à maintenir une vitesse par utilisateur élevée. C’est précisément là qu’OpenAI veut faire la différence avec son ASIC.

L’inférence d’un modèle de langage ne se résume pas à répéter le même type d’opérations. Lors du préchargement, l’accélérateur traite le prompt et demande beaucoup de calcul. Lors du décodage, il génère les tokens un à un, ce qui sollicite davantage la mémoire. Jalapéño a été conçu pour réduire au maximum les transferts de données entre ces deux phases : OpenAI explique pouvoir placer explicitement l’état du modèle, y compris le KV cache, en le conservant localement pendant que calcul, mémoire et communication réseau s’adaptent à chaque étape. Ce choix pèse face aux architectures qui séparent préchargement et décodage sur des ressources différentes, sans que ce soit une limitation inévitable : NVIDIA et d’autres moteurs modernes d’inférence obtiennent aussi de très bons résultats avec ces techniques, InferenceX mettant par exemple en avant des configurations GB200 et GB300 en inférence décomposée pour équilibrer performance et interactivité.

OpenAI veut maîtriser chaque brique de son infrastructure

Jalapéño ne marque pas une rupture avec NVIDIA. OpenAI affirme qu’il continuera à déployer largement des accélérateurs NVIDIA et d’autres fournisseurs pour l’entraînement et l’inférence, dans la lignée de la mobilisation de 500 milliards de dollars par NVIDIA auprès de Wall Street pour financer ses infrastructures IA. Son ASIC vient s’ajouter à une infrastructure qui demande des capacités toujours plus importantes, mais ce qui change, c’est qu’OpenAI reprend la main sur une partie du silicium sur lequel il fait tourner ses services, un mouvement comparable à celui d’AWS avec ses propres puces Trainium 3.

SemiAnalysis précise que le développement a été mené avec Broadcom, et que le projet a démarré mi-2024. Pour une entreprise qui utilise des accélérateurs à l’échelle des centres de données, améliorer la performance en tokens par mégawatt peut peser lourd économiquement, même sans remplacer complètement les GPU. Autre détail notable : l’IA elle-même a servi à concevoir et programmer cet accélérateur. OpenAI raconte être passé d’un design initial au tapeout en neuf mois grâce à ses propres modèles, utilisés pour étudier les implémentations, raccourcir les cycles de conception et de vérification, et travailler sur les circuits arithmétiques. Ensuite, Codex et GPT-Astra ont permis d’adapter trois modèles de poids ouverts à Jalapéño en environ deux mois.

Dans certains blocs d’attention et de Mixture of Experts de GPT-OSS, les versions générées par IA tournaient entre 1,5 et 1,8 fois plus vite que celles conçues à la main par des spécialistes — une comparaison qui concerne uniquement ces blocs, précise OpenAI, pas la performance globale du modèle. Le vrai test arrive maintenant : OpenAI prévoit d’intégrer Jalapéño à son infrastructure avant la fin 2026, tout en poursuivant la qualification pour la production. Une seconde génération est déjà en route, et une troisième en préparation. Reste une étape essentielle avant le déploiement à grande échelle : vérifier comment ces chiffres se traduisent en disponibilité, coût total de possession et performance réelle sous charge opérationnelle.

Les premiers résultats montrent néanmoins qu’un ASIC de première génération signé OpenAI peut déjà rivaliser avec Blackwell en inférence, et même dépasser les systèmes NVIDIA sur la latence et la performance par watt dans les tests publiés. Pour une société dont la consommation de tokens ne cesse de grimper, cette efficacité pourrait compter davantage à terme que la simple puissance brute en FLOPS.

Questions fréquentes

Jalapéño est-il plus rapide que NVIDIA Blackwell ?

Dans les tests publiés avec GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T, Jalapéño dépasse les systèmes GB200 ou GB300 de référence en performance par watt et en vitesse de décodage. Cela ne permet pas d’affirmer que cet avantage est universel pour tous les modèles.

Combien de tokens par seconde Jalapéño peut-il atteindre ?

Son maximum publié par utilisateur est de 1 459 tokens/sec avec GPT-OSS 120B, contre 700 tokens/sec avec DeepSeek R1 et 694 tokens/sec avec Kimi K2.5.

Jalapéño va-t-il remplacer les GPU NVIDIA d’OpenAI ?

Non. OpenAI continuera à déployer largement des accélérateurs NVIDIA et d’autres fournisseurs pour l’entraînement et l’inférence, tout en intégrant progressivement sa propre conception silicium.

Quand OpenAI commencera-t-il à utiliser Jalapéño ?

Le déploiement dans son infrastructure est prévu avant la fin 2026. Jalapéño est la première génération d’une famille dont la version 2 est déjà en développement, et la version 3 en préparation.

le dernier