IBM et Together AI ont签署 un accord pluriannuel d’une valeur de 240 millions de dollars pour déployer sur IBM Cloud un vaste cluster d’infrastructure NVIDIA dédié spécifiquement à l’inférence en intelligence artificielle. La plateforme utilisera des systèmes NVIDIA HGX B300 avec GPU Blackwell Ultra et des réseaux Spectrum-X Ethernet, avec une mise en service prévue pour le premier trimestre de 2027.
Les points clés de l’accord entre IBM et Together AI en 30 secondes
- Le contrat pluriannuel entre IBM et Together AI s’élève à 240 millions de dollars.
- IBM déploiera un cluster de systèmes NVIDIA HGX B300 sur IBM Cloud, prévu pour le premier trimestre de 2027.
- Together AI utilisera cette infrastructure principalement pour servir des modèles ouverts en production.
- La société indique actuellement traiter environ 400 milliards de tokens par mois.
- Ce partenariat reflète l’importance croissante de l’inférence par rapport à la formation au sein de l’écosystème IA.
Cette opération rassemble trois acteurs du marché. IBM fournit l’infrastructure cloud et sa capacité à gérer des environnements d’entreprise ; NVIDIA fournit la plateforme accélérée et les réseaux connectant les GPU ; et Together AI intègre sa plateforme deInference, d’entraînement, de réglage fin des modèles et de gestion des charges de travail avec agents.
Selon IBM, le résultat sera le premier cluster de grande envergure dédié à l’inférence construit sur IBM Cloud avec des systèmes HGX B300.
Le nombre exact de serveurs ou de GPU composant le cluster n’a pas été communiqué, ce qui empêche de traduire directement les 240 millions de dollars en une capacité spécifique en accélérateurs ou puissance informatique.
NVIDIA B300 pour une inférence de plus en plus exigeante en infrastructure
Le choix du NVIDIA HGX B300 illustre la direction vers laquelle se tournent une part importante des investissements en IA.
Chaque système HGX B300 intègre huit GPU NVIDIA B300 Blackwell Ultra, reliés via NVLink et NVSwitch de cinquième génération. La documentation technique de NVIDIA indique 288 Go de mémoire HBM3e par GPU, portant la mémoire totale à environ 2,3 To par nœud. La bande passante interne atteint 14,4 To/s.
La connectivité réseau est également un élément clé de l’architecture. NVIDIA prévoit l’utilisation de HGX B300 avec ConnectX-8 et Spectrum-X Ethernet pour permettre aux GPU de communiquer rapidement et en grande quantité, avec une faible latence.
Selon la configuration de référence, NVIDIA propose des configurations de 32, 64 et 128 nœuds, correspondant respectivement à 256, 512 et 1024 GPU B300. Chaque GPU peut être connectée via Ethernet à des débits allant jusqu’à 800 Gb/s avec ConnectX-8.
Cela ne signifie pas que le futur cluster d’IBM et Together AI adoptera nécessairement l’une de ces configurations spécifiques. Les détails précis du déploiement, tels que le nombre de systèmes ou la localisation, n’ont pas été divulgués, mais cela offre un contexte sur le type d’infrastructure en préparation.
L’inférence à grande échelle ne se limite plus à charger un modèle sur quelques GPU et répondre à des requêtes. La complexité croissante des modèles, des contextes étendus, des applications avec agents, et un nombre élevé d’utilisateurs simultanés, nécessitent davantage de mémoire, de capacités de communication, et de puissance de calcul.
NVIDIA affirme que ses architectures HGX actuelles sont conçues pour conjuguer entraînement et inférence de modèles de taille moyenne à grande.
Together AI traite déjà 400 milliards de tokens mensuellement
Pour Together AI, le nouveau cluster représente une augmentation de capacité à un moment où son service d’inférence connaît une croissance rapide.
L’entreprise assure qu’elle traite actuellement 400 trillions de tokens par mois, soit environ 400 milliards en utilisant la nomenclature numérique en espagnol.
Créée en 2022, la société est spécialisée dans l’infrastructure et les services pour modèles open source. Sa plateforme inclut l’inférence, l’entraînement, le fine-tuning, et des outils pour les applications basées sur des agents.
Together AI a récemment levé 800 millions de dollars lors d’une série C, avec une valorisation de 8,3 milliards de dollars, selon les données communiquées par IBM dans l’annonce de l’accord.
L’infrastructure dédiée offre également à Together AI un meilleur contrôle sur l’un des facteurs clés du coût de l’inférence : le coût de génération de chaque token.
Lorsque des millions de requêtes utilisent les mêmes GPU, de petites améliorations en termes d’utilisation, de mémoire, de batching, de réseaux ou de logiciels peuvent entraîner des différences significatives dans le coût total du service.
Together AI commercialise déjà plusieurs générations de GPU NVIDIA. En août 2026, ses options incluent entre autres H100, H200 et B200, tandis que des configurations HGX B300 restent accessibles sur demande commerciale.
L’infrastructure redevient un enjeu central dans la compétition IA
Ce partenariat illustre également l’évolution des investissements dans le domaine de l’intelligence artificielle.
Au cours des premières années de l’ère de l’IA générative, l’attention s’est principalement portée sur la construction et l’entraînement de modèles de taille toujours croissante. Aujourd’hui, le déploiement massif de ces modèles déplace une partie importante du défi vers l’inférence.
Chaque requête d’un assistant, d’une application d’entreprise ou d’un agent consomme des ressources informatiques. Lorsqu’un service traite des centaines de milliards de tokens, les performances par GPU et le coût par token deviennent un critère déterminant pour sa viabilité économique.
Together AI justifie son choix d’IBM et NVIDIA par la nécessité d’obtenir une capacité GPU à la hauteur de sa croissance tout en réduisant le coût par token.
IBM, de son côté, renforce aussi sa position en tant que fournisseur d’infrastructure IA. La société promeut depuis plusieurs années une stratégie hybride permettant aux clients de combiner centres de données privés, cloud, et logiciels d’entreprise.
Ce partenariat s’inscrit également dans la continuité de la collaboration préexistante entre IBM et NVIDIA, annoncée en mars 2026, visant à développer conjointement des solutions en analytique accélérée par GPU, traitement de données non structurées, et infrastructure IA dans les centres de données privés comme dans le cloud.
Together AI ajoute désormais la couche spécialisée dans l’exécution de modèles open source.
Une différence majeure par rapport à une simple location de GPU à la demande réside dans le fait que l’accord prévoit une capacité dédiée à grande échelle sur plusieurs années, offrant à Together AI une meilleure prévisibilité pour soutenir la croissance de ses services.
La mise en production est envisagée si le calendrier est respecté, pour le premier trimestre de 2027. D’ici là, il reste encore à connaître plusieurs détails importants : nombre de systèmes HGX B300, capacité totale en GPU, localisation du cluster, puissance électrique dédiée, et capacité finale d’inférence.
Questions fréquentes
Quel est le montant de l’accord entre IBM et Together AI ?
L’accord pluriannuel, d’une valeur de 240 millions de dollars, vise à déployer une infrastructure IA sur IBM Cloud pour accompagner les services de Together AI.
Quelles GPU seront utilisées dans le nouveau cluster ?
Le cluster sera basé sur des systèmes NVIDIA HGX B300, comprenant chacun huit GPU B300 Blackwell Ultra. Les détails précis quant au nombre de nœuds ou de GPU n’ont pas été divulgués par IBM ni Together AI.
Comment Together AI utilisera-t-elle cette infrastructure ?
Principalement pour effectuer de l’inférence à grande échelle sur des modèles open source. La plateforme comprend aussi des services d’entraînement, de réglage fin et des applications basées sur des agents.
Quand le cluster sera-t-il opérationnel ?
IBM prévoit sa mise en service pour le premier trimestre de 2027. La société précise que ses annonces concernant ses plans futurs sont indicatives et susceptibles d’évoluer.
Sources : newsroom.ibm