OpenAI prépare Jalapeño pour sa propre infrastructure, mais n’exclut pas de le vendre à l’extérieur

OpenAI affronte Jalapeño face à NVIDIA Blackwell et gagne en inférence par watt

OpenAI développe Jalapeño en tant qu’accélérateur d’inférence principalement conçu pour répondre à ses propres besoins en ressources informatiques. Richard Ho, responsable du matériel chez l’entreprise, a expliqué à Tom’s Hardware que cette puce pourrait être utilisée pour d’autres clients, bien que la priorité pour les prochaines années sera de satisfaire la demande interne croissante d’OpenAI.

Les points clés de Jalapeño en 20 secondes

  • Jalapeño est le premier accélérateur d’inférence développé par OpenAI en interne, conçu en partenariat avec Broadcom.
  • L’entreprise prévoit de l’intégrer dans son infrastructure de calcul d’ici la fin 2026.
  • OpenAI affirme qu’il fonctionne aussi avec des modèles externes tels que DeepSeek R1 et Kimi K2.5.
  • Ho indique que sa disponibilité pour des tiers pourrait être envisagée à l’avenir, mais que la priorité actuelle reste l’usage interne.
  • Ce design fait partie d’une plateforme multigénérationnelle, avec la Gen 2 déjà en développement.

La position d’OpenAI est plus pragmatique que commerciale. L’entreprise ne présente pas Jalapeño comme un produit prêt à concurrencer immédiatement les accélérateurs de NVIDIA, mais comme une composante de sa propre infrastructure. Ho reconnaît que le hardware pourrait être utilisé en dehors d’OpenAI, mais estime que la demande en capacité au sein de l’entreprise sera suffisante pour occuper une grande partie de la production pendant longtemps.

Un processeur conçu pour l’inférence

OpenAI a présenté Jalapeño en juin 2026, en collaboration avec Broadcom. La société le définit comme son premier processeur dédié à l’intelligence, marquant le début d’une plateforme de calcul en plusieurs générations. La puce a été conçue spécifiquement pour les charges d’inférence de grands modèles de langage (LLM), plutôt que d’adapter un accélérateur existant aux besoins d’OpenAI.

Le projet a été développé de la conception initiale à la fabrication en seulement neuf mois, selon OpenAI. Broadcom fournit la mise en œuvre du silicium et les technologies réseau, tandis que Celestica participe à la fabrication des cartes, des systèmes en racks et d’autres éléments nécessaires à l’installation à grande échelle. De son côté, OpenAI a conçu l’architecture à partir de ses modèles, kernels, logiciels d’inférence et exemples de service réels.

L’un des objectifs principaux était d’améliorer l’efficacité énergétique. Dans un centre de données dédié à l’intelligence artificielle, augmenter le travail utile par watt peut avoir un impact direct sur la capacité de déploiement en fonction de l’infrastructure énergétique disponible.

Les premiers résultats publiés par OpenAI en août confirment cette orientation. Lors de tests avec GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T, Jalapeño a permis d’obtenir entre 1,5 et 1,9 fois plus de travail d’IA par watt en performance maximale comparé aux systèmes de référence. La société a également mesuré une latence de bout en bout entre 1,7 et 3,6 fois inférieure, et en charges très interactives, entre 2,1 et 4,1 fois plus de performance. Ces chiffres, fournis par OpenAI, reflètent leurs propres mesures et méthodologies.

Une porte ouverte aux tiers

La possibilité que Jalapeño soit exploité en dehors d’OpenAI n’est pas exclue. Ho a expliqué à Tom’s Hardware que l’accélérateur est programmable et polyvalent dans son domaine d’application, et que l’équipe a pu faire fonctionner des modèles que l’entreprise n’avait pas utilisés lors du développement initial.

Ce point est important car une question courante concernant un ASIC, un circuit intégré conçu pour une application spécifique, concerne son degré de dépendance à un seul modèle ou charge de travail. OpenAI garantit que Jalapeño n’est pas codé exclusivement pour ses propres modèles.

L’équipe a testé cette compatibilité avec des modèles extérieurs. Selon OpenAI, Jalapeño a exécuté GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T. Ho a également indiqué que les ingénieurs ont réussi à faire fonctionner DeepSeek et Kimi environ deux mois après réception d’une version A0 du prototype, avant la présentation des résultats à Hot Chips.

Cela ne signifie pas qu’OpenAI va commercialiser Jalapeño comme un produit destiné au marché. La réponse de Ho clarifie la situation actuelle : l’entreprise doit d’abord répondre à sa demande interne croissante en calcul, alimentée par ses utilisateurs, ses nouveaux modèles, Codex et autres fonctions. La possibilité de l’utiliser dans d’autres contextes reste ouverte, sans calendrier précis ni annonce commerciale pour le moment.

Il existe aussi une contrainte en capacité de production. Déployer des accélérateurs propriétaires à grande échelle implique non seulement la fabrication du chip, mais aussi la fourniture de mémoire, de réseaux, de cartes et de systèmes complets, ainsi que de capacités dans les centres de données. La stratégie annoncée avec Broadcom prévoit des déploiements à l’échelle de gigawatts sur plusieurs générations, tandis qu’OpenAI continue d’utiliser des accélérateurs NVIDIA et d’autres fournisseurs pour l’entraînement et l’inférence.

Jalapeño s’inscrit dans une stratégie plus globale

OpenAI ne voit pas Jalapeño comme un projet isolé. La société évoque déjà une seconde génération en développement et une troisième en début de conception. L’objectif est que chaque nouvelle génération s’appuie sur l’expérience acquise pour améliorer vitesse et efficacité.

Cette approche reflète l’intérêt croissant des grands développeurs de modèles à prendre le contrôle de plus en plus vaste sur leur infrastructure. Concevoir conjointement modèles, logiciels d’inférence, mémoire, réseaux et silicium permet d’adapter précisément le hardware aux charges de production réelles, que seul un fabricant dédié pourrait fournir.

Pour OpenAI, cette intégration a une application directe : exécuter ses propres modèles avec une consommation énergétique réduite et une latence plus faible peut augmenter la capacité disponible sans dépendre exclusivement de l’achat de nouveaux accélérateurs généralistes. Cependant, l’entreprise continue de suivre une stratégie multi-fournisseurs, et Jalapeño ne remplace pas immédiatement NVIDIA ou d’autres composants utilisés dans ses centres.

Ainsi, la dimension commerciale reste secondaire. OpenAI dispose d’un accélérateur capable, selon ses propres tests, de faire fonctionner ses modèles internes et externes avec de bonnes performances, mais sa priorité est de répondre à ses besoins internes. Si, à l’avenir, la capacité de production augmente et que l’architecture conserve ses avantages, ce même design pourrait être déployé en dehors d’OpenAI. Pour l’instant, cette possibilité demeure ouverte et ne constitue pas un produit destiné à des clients tiers.

Questions fréquentes

Qu’est-ce que Jalapeño d’OpenAI ?

Jalapeño est le premier accélérateur d’inférence conçu par OpenAI. Il est destiné à exécuter de grands modèles de langage avec un accent sur l’efficacité et la faible latence.

Jalapeño sera-t-il vendu à d’autres entreprises ?

OpenAI n’a pas annoncé de commercialisation pour des tiers. Richard Ho a indiqué que le chip pourrait être utilisé en dehors de l’entreprise, mais la priorité est actuellement de répondre aux besoins internes en calcul.

Quels modèles Jalapeño peut-il exécuter ?

OpenAI a publié des résultats avec GPT-OSS 120B, DeepSeek R1 et Kimi K2.5 1T, en plus de ses propres charges de travail.

Quand OpenAI commencera-t-elle à utiliser Jalapeño ?

OpenAI prévoit de déployer le chip dans son infrastructure de calcul d’ici la fin 2026. La société travaille déjà sur une deuxième génération.

le dernier