OpenAI a publié les premiers résultats de Jalapeño, son premier accélérateur ASIC conçu en interne pour l’inférence en intelligence artificielle. Les chiffres montrent un avantage significatif par rapport aux systèmes NVIDIA Blackwell GB200 et GB300 dans les trois charges de travail analysées. Sur GPT-OSS 120B, Jalapeño atteint 85,448 tokens mixtes par seconde et par kilowatt, soit 1,9 fois le résultat de la référence, tout en réalisant 1 459 tokens par seconde par utilisateur avec la latence la plus faible. Ces mesures ont été effectuées avec le benchmark InferenceX de SemiAnalysis, mais il reste prudent d’affirmer que Jalapeño est systématiquement plus rapide que Blackwell dans toutes les charges d’IA.
Les points clés de l’annonce OpenAI Jalapeño en 20 secondes
- Jalapeño offre entre 1,5 et 1,9 fois plus de performance par watt dans les trois modèles publiés.
- Il atteint 1 459 tokens/sec par utilisateur avec GPT-OSS 120B.
- Les comparaisons utilisent NVIDIA GB200 et GB300 selon le modèle.
- OpenAI a également testé DeepSeek R1 670B et Kimi K2.5 1T.
- Son déploiement interne devrait commencer avant la fin 2026.
L’importance de cette annonce réside autant dans les résultats que dans leur provenance. OpenAI a longtemps été un grand acheteur d’accélérateurs NVIDIA et prévoit de continuer à les déployer. Jalapeño introduit une nouvelle voie : concevoir du silicium spécifiquement adapté à ses besoins en inférence, en intégrant accélérateur, mémoire, interconnexion, logiciel et conception de système.
Les résultats publiés concernent également des modèles très différents : GPT-OSS 120B, DeepSeek R1 670B et Kimi K2.5, avec un milliard de paramètres. SemiAnalysis indique que Jalapeño a dépassé lors de ses tests les accélérateurs NVIDIA, AMD et Google évalués avec plusieurs grands modèles open source. Cela élargit la portée des évaluations, mais il faut distinguer ces résultats de ceux spécifiques de NVIDIA que OpenAI présente dans ses graphiques.
Jusqu’à 1 459 tokens par seconde pour un utilisateur
Une des mesures les plus impressionnantes concerne la vitesse maximale de décodage par utilisateur.
Avec GPT-OSS 120B, Jalapeño atteint 1 459 tokens/sec par utilisateur, contre 535 tokens/sec pour le système de référence GB200. Cela représente environ 2,7 fois plus rapide.
Ce différentiel s’accroît avec DeepSeek R1 : 700 contre 169 tokens/sec, soit 4,1 fois plus. Avec Kimi K2.5, il obtient 694 tokens/sec contre 182 pour GB300, soit 3,8 fois plus.
| Modèle | Jalapeño | Comparaison NVIDIA | Avantage |
|---|---|---|---|
| GPT-OSS 120B | 1 459 tokens/sec/utilisateur | GB200 : 535 | 2,7x |
| DeepSeek R1 670B | 700 | GB300 : 169 | 4,1x |
| Kimi K2.5 1T | 694 | GB300 : 182 | 3,8x |
Cette métrique est particulièrement pertinente pour les assistants et agents IA, où le temps de génération de chaque réponse conditionne la durée totale de tâches comprenant plusieurs étapes successives.
OpenAI souligne que l’un des objectifs de Jalapeño était d’éviter le compromis habituel entre débit et latence. Un système peut traiter de nombreuses requêtes simultanément via batching, mais cela ne garantit pas la réponse la plus rapide pour chaque utilisateur.
Jalapeño cherche à maintenir ces deux dimensions dans une même architecture.
Le résultat se voit également dans la latence globale. OpenAI annonce 1,03 secondes contre 1,80 secondes avec GPT-OSS, 1,65 contre 5,99 secondes pour DeepSeek R1, et 1,56 contre 5,31 secondes pour Kimi K2.5.
La véritable compétition réside dans les tokens par kilowatt
Pour un centre de données, la vitesse absolue n’est qu’une partie de l’histoire. La disponibilité électrique devient une contrainte majeure pour déployer de grandes infrastructures IA.
OpenAI utilise donc la performance par unité de puissance comme une métrique clé.
Les résultats sont les suivants :
| Modèle | Jalapeño | NVIDIA | Différence |
|---|---|---|---|
| GPT-OSS 120B | 85 448 tokens/sec/kW | GB200 : 44 960 | 1,9x |
| DeepSeek R1 670B | 19 641 tokens/sec/kW | GB300 : 11 781 | 1,7x |
| Kimi K2.5 1T | 18 195 tokens/sec/kW | GB300 : 11 862 | 1,5x |
La société a normalisé la comparaison en utilisant la puissance nominale fournie pour chaque accélérateur : 700 W pour Jalapeño, 1 200 W pour GB200, et 1 400 W pour GB300. OpenAI précise que son puce a été maintenue en charge avec une consommation soutenue inférieure ou égale à 550 W.
Ce détail est important. Les 85 448 tokens/sec/kW ne signifient pas qu’un seul Jalapeño produit cette cadence en continu. La métrique normalise la performance par puissance pour comparer l’efficacité.
Il faut aussi éviter une autre simplification : ces chiffres ne prouvent pas que Jalapeño est 90 % plus puissant que Blackwell en général. Ils indiquent simplement qu’en GPT-OSS 120B, et selon la méthodologie InferenceX, Jalapeño obtient environ 1,9 fois le throughput brut par kilowatt du GB200 utilisé pour la comparaison.
InferenceX propose des résultats pour de multiples configurations et illustre comment rendement, coût et efficacité peuvent varier selon le modèle, la précision, la séquence ou le niveau d’interactivité choisi.
Il faut aussi expliquer la valeur de 104 fois plus vite
Un troisième résultat, encore plus spectaculaire : 104,3 fois.
Mais il serait erroné de conclure de cette métrique que Jalapeño est 104 fois plus rapide qu’une Nvidia GB300.
OpenAI effectue ici une évaluation différente : pour chacun des deux systèmes, ils fixent la vitesse maximale par utilisateur atteinte par la plateforme Nvidia, puis calculent le throughput que chaque architecture peut maintenir à ce niveau en fonction de la consommation électrique.
Avec GPT-OSS, en se basant sur environ 535 tokens/sec/utilisateur, Jalapeño atteint 22 935 tokens mixtes/sec/kW contre 427 pour le GB200 : 53,7 fois plus.
Avec DeepSeek R1, en fixant environ 169 tokens/sec/utilisateur, on trouve 12 258 contre 118, soit 104,3 fois d’écart.
Et avec Kimi K2.5, à environ 182 tokens/sec/utilisateur, cela donne 6 744 contre 120, soit 56,1 fois.
Ce que révèle cette méthode c’est le coût d’amener une architecture à ses faibles latences extrêmes. La capacité du système Blackwell à maintenir une vitesse par utilisateur si élevée est fortement limitée dans ces conditions.
C’est précisément là que OpenAI veut faire la différence avec son ASIC.
L’inférence d’un modèle de langage ne consiste pas seulement à effectuer continuellement le même type d’opérations. Lors du précharge, le accélérateur traite le prompt et demande beaucoup de calculs. Lors du décodage, il génère les tokens de façon successive, ce qui sollicite davantage la mémoire.
Jalapeño a été conçu pour réduire au maximum les transferts de données entre ces phases. OpenAI explique qu’il peut placer explicitement l’état du modèle, y compris le KV cache, en le conservant localement pendant que le calcul, la mémoire et la communication réseau sont adaptés à chaque étape.
Ce choix est important face aux architectures séparant précharge et décodage sur des ressources différentes. Il ne s’agit pas inévitablement d’une limitation, car NVIDIA et d’autres moteurs modernes d’inférence obtiennent aussi des résultats très compétitifs avec ces techniques. InferenceX met en avant, par exemple, des configurations GB200 et GB300 utilisant l’inférence décomposée pour équilibrer performance et interactivité.
OpenAI cherche à maîtriser chaque composante de son infrastructure
Jalapeño ne constitue pas une rupture avec NVIDIA.
OpenAI affirme qu’il continuera à déployer largement des accélérateurs NVIDIA et d’autres fournisseurs pour la formation et l’inférence. Son ASIC doit donc s’inscrire comme un élément supplémentaire dans une infrastructure qui demande des capacités de plus en plus importantes.
Ce qui change, c’est qu’OpenAI commence à prendre en main une partie du silicium sur lequel ils exécutent leurs services.
SemiAnalysis indique que le développement a été réalisé en collaboration avec Broadcom, et que le projet a débuté à la mi-2024. Pour une entreprise qui utilise des accélérateurs à l’échelle des centres de données, améliorer la performance en tokens par mégawatt pourrait avoir des implications économiques significatives, même sans remplacer complètement les GPU.
Une autre particularité est que l’IA a été utilisée pour concevoir et programmer le propre accélérateur.
OpenAI raconte être passé d’un design initial à l’tapeout en neuf mois, en utilisant ses modèles pour étudier les implémentations, raccourcir les cycles de conception et de vérification, ainsi que travailler sur les circuits arithmétiques. Ensuite, ils ont employé Codex avec GPT-Astra pour adapter trois modèles de poids ouverts à Jalapeño en environ deux mois.
Dans certains blocs d’attention et de Mixture of Experts de GPT-OSS, les versions générées par IA fonctionnaient entre 1,5 et 1,8 fois plus vite que celles conçues manuellement par des spécialistes. OpenAI précise que cette comparaison concerne uniquement ces blocs, et pas la performance globale du modèle.
Le prochain test sera bien plus ambitieux qu’un simple benchmark. OpenAI prévoit d’incorporer Jalapeño dans son infrastructure avant la fin 2026, tout en poursuivant la qualification pour la production et le développement logiciel. Une seconde génération est déjà en route, et une troisième est en préparation.
Il restera cependant une étape essentielle avant la déploiement à grande échelle : vérifier comment ces chiffres se traduisent en disponibilité, coût total de propriété, et performance réelle sous charges opérationnelles.
Les premiers résultats montrent néanmoins une évidence : un ASIC de première génération d’OpenAI peut déjà rivaliser avec Blackwell en inférence, et dans les tests publiés, dépasser les systèmes NVIDIA en termes de latence et de performance par watt. Pour une société dont la consommation de tokens ne cesse d’augmenter, cette efficacité pourrait devenir plus cruciale que la simple puissance brute en FLOPS.
Questions fréquentes
Jalapeño est-il plus rapide que NVIDIA Blackwell ?
Dans les tests publiés avec GPT-OSS 120B, DeepSeek R1 670B, et Kimi K2.5 1T, Jalapeño dépasse les systèmes GB200 ou GB300 de référence en performance par watt et en vitesse maximale de décodage. Toutefois, ces résultats ne permettent pas d’affirmer que cet avantage est universel pour tous les modèles ou toutes les charges.
Combien de tokens par seconde OpenAI Jalapeño peut-il atteindre ?
Son maximum publié par utilisateur est de 1 459 tokens/sec avec GPT-OSS 120B. Il obtient également 700 tokens/sec avec DeepSeek R1, et 694 tokens/sec avec Kimi K2.5.
Jalapeño remplacera-t-il les GPU NVIDIA d’OpenAI ?
Ce n’est pas l’annonce. OpenAI indique qu’il continuera à déployer largement des accélérateurs NVIDIA et d’autres fournisseurs pour la formation et l’inférence, tout en intégrant progressivement sa propre conception silicium.
Quand OpenAI commencera-t-il à utiliser Jalapeño ?
L’entreprise prévoit de commencer son déploiement dans son infrastructure avant la fin 2026. Jalapeño est la première génération d’une famille qui inclut déjà une version 2 en développement, et une version 3 en préparation.