Les Machines Pensantes paient 65 millions par an pour l’inférence tandis qu’Anthropic cherche à contrôler 1 GW

Alice Recoque : voici le superordinateur exascale qui veut faire de l'Europe une puissance d'IA souveraine

L’infrastructure en intelligence artificielle commence à se diviser en deux modèles d’acquisition très différents. Thinking Machines Lab a signé un contrat annuel de 65 millions de dollars avec Crusoe pour réaliser des inférences gérées sur un déploiement dédié NVIDIA HGX B200, tandis qu’Anthropic se livre à des négociations préliminaires pour louer jusqu’à 1 gigawatt (GW) directement auprès de Stream Data Centers. Cette différence met en évidence une question de plus en plus cruciale : quand est-il plus efficace d’acheter de la capacité en tant que service, et quand une entreprise d’IA doit-elle prendre en main une part plus importante de son infrastructure ?

Les points clés de l’infrastructure IA de Thinking Machines et Anthropic en 20 secondes

  • Thinking Machines Lab versera 65 millions de dollars par an à Crusoe pour l’inférence gérée.
  • Le déploiement utilise des systèmes NVIDIA HGX B200 et des réseaux Quantum-2 InfiniBand.
  • Anthropic envisage de louer jusqu’à 1 GW directement à Stream Data Centers.
  • Le contrat d’Anthropic est encore en discussion et sa structure n’est pas finalisée.
  • Les deux initiatives illustrent combien les laboratoires d’IA séparent de plus en plus inférence, entraînement, chips, centres de données et financement.

Ce contraste est intéressant car aucune des deux entreprises ne procède de la même façon. Thinking Machines Lab souscrit un service d’inférence dédié : Crusoe gère le cluster, maintient l’infrastructure et fournit un point d’accès avec des conditions de service. Anthropic, d’après les discussions relayées par The Information, étudie à devenir directement locataire d’installations chez Stream Data Centers, afin de prendre en main une part plus grande de la capacité physique utilisée.

Cette différence est importante, car l’inférence possède une caractéristique qui la distingue de l’entraînement : une fois qu’un modèle est en production, il nécessite une capacité informatique continue pour répondre aux requêtes des utilisateurs. Le coût ne se limite donc pas aux campagnes d’entraînement massives, mais inclut aussi l’exploitation quotidienne des modèles.

Thinking Machines achète l’inférence en service

L’accord annoncé par Crusoe le 23 septembre prévoit 65 millions de dollars par an pour les charges d’inférence en production de Thinking Machines Lab. Parmi les modèles déployés figurent ceux du laboratoire, tels que Inkling, GLM 5.2 et 5.3, ainsi que des variantes personnalisées.

L’infrastructure comprendra un déploiement dédié basé sur NVIDIA HGX B200, connecté via NVIDIA Quantum-2 InfiniBand. Crusoe qualifie cette configuration de Tailored Deployment, un déploiement réservé et soutenu par un accord de niveau de service (SLA) géré directement par Crusoe.

Cela modifie la responsabilité du client : Thinking Machines Lab n’a plus à gérer directement la mise en place des serveurs, l’exploitation du réseau d’accélérateurs ou la maintenance de la plateforme d’inférence. Crusoe assume cette charge, tandis que le laboratoire consomme la capacité fournie.

L’entreprise indique également qu’elle envisage d’étendre le service à l’inférence par lots pour la génération de données synthétiques, un scénario différent de la prise en charge des requêtes utilisateur en temps réel.

Pour Crusoe, ce contrat signifie aussi que son activité de Managed Inference dépasse les 100 millions de dollars de revenus récurrents annuels contractés, selon ses propres chiffres. Ce service, lancé il y a moins d’un an, s’inscrit donc dans une croissance rapide.

Ce modèle est avantageux lorsque un laboratoire souhaite une capacité dédiée et des performances prévisibles, sans vouloir prendre en charge toute l’opération physique et logicielle sous-jacente à un service d’inférence.

Anthropic explore une autre voie pour atteindre le gigawatt

Le mouvement d’Anthropic est différent, et pour l’instant, il doit être considéré comme une négociation préliminaire. The Information rapporte que la société est en discussion pour louer jusqu’à 1 GW de capacité informatique à Stream Data Centers, un développeur de centres de données majoritairement détenu par Apollo Global Management.

Les informations publiées suggèrent qu’Anthropic pourrait devenir directement locataire des infrastructures, qui pourraient intégrer divers accélérateurs, comme les unités de traitement tensoriel (TPU) de Google et Broadcom, ou encore des GPU NVIDIA ou d’autres puces IA. Google aurait également étudié la possibilité d’offrir une garantie financière pour ce projet, sans que le périmètre précis de cette garantie soit fixé.

Une telle échelle change totalement la nature de l’opération : selon les estimations relayées par The Information, un déploiement de 1 GW pourrait nécessiter au minimum 40 milliards de dollars d’investissement. Cela implique qu’une infrastructure de cette envergure ne dépend pas uniquement de l’acquisition de puces : il faut aussi des financements, des installations, de l’énergie, des réseaux, des systèmes de refroidissement et des contrats pluriannuels.

De plus, Anthropic dispose déjà de grands accords avec des fournisseurs d’infrastructure : en avril, elle a annoncé un engagement avec Amazon de plus de 100 milliards de dollars sur dix ans pour les technologies AWS et jusqu’à 5 GW de capacité basée sur les générations futures de Trainium. La société indique aussi utiliser un mix de matériel AWS, Google et NVIDIA.

En mai, elle a également annoncé un partenariat avec SpaceX pour utiliser plus de 300 MW de capacité dans le centre de données Colossus 1, ainsi que des accords avec Google, Broadcom, Microsoft et d’autres fournisseurs.

Ainsi, un possible contrat avec Stream ne signifierait pas que Anthropic abandonne le cloud : il s’inscrit plutôt dans une stratégie de diversification et de contrôle accru de la capacité physique.

L’infrastructure commence à ressembler à une opération financière

À mesure que les déploiements atteignent des dizaines voire des centaines de mégawatts et même des gigawatts, l’achat de capacité de calcul dépasse la simple sélection de GPU.

Un centre de données IA doit obtenir le terrain, l’alimentation électrique, la capacité de production ou de connexion réseau, des systèmes de refroidissement, des serveurs, des accélérateurs, des réseaux haute vitesse et des financements. Il doit également contractualiser pour justifier ces investissements sur plusieurs années.

Cela explique l’émergence de structures où des développeurs immobiliers, des fabricants de puces, des fournisseurs d’infrastructures, des banques, des fonds d’investissement et de grands clients d’IA participent à une opération commune.

Le marché recourt déjà à des mécanismes financiers pour partager ces risques. Le Financial Times rapporte que des sociétés telles que NVIDIA, Broadcom et Meta emploient des garanties sur la valeur résiduelle des puces et des centres de données pour soutenir le financement de projets IA, avec jusqu’à 300 milliards de dollars d’exposition de crédit liée à ces structures.

Toutes ces opérations ne suivent pas forcément la même structure, mais elles partagent un problème commun : les investissements initiaux dans la capacité IA sont énormes, et les actifs doivent être financés avant même de générer des revenus dans leur cycle de vie.

C’est là que se dessinent deux approches : Thinking Machines Lab externalise une part significative de cette logistique à Crusoe, en payant pour une capacité d’inférence dédiée, Crusoe gérant l’infrastructure ; tandis qu’Anthropic semble avancer vers une participation plus directe à l’acquisition de capacité physique, bien que le contrat avec Stream ne soit pas encore finalisé, il n’est pas encore certain que la société contrôle 1 GW ni le matériel qui sera installé.

Ce qui émerge clairement, c’est que l’infrastructure IA se désagrège. L’entraînement et l’inférence peuvent se contractualiser séparément ; les composants matériels peuvent provenir de fournisseurs différents ; les centres de données peuvent appartenir à des tiers ; et la finance peut être structurée de façon indépendante des contrats de calcul.

Pour les laboratoires exploitant de grands modèles, cette flexibilité peut être aussi cruciale que la puissance de chaque accélérateur. La question n’est plus seulement de savoir combien de GPU un modèle requiert : il faut aussi réfléchir à qui finance le centre de données, qui opère les serveurs, qui assume le risque de capacité, et quelle part de l’infrastructure le client souhaite contrôler directement.

Questions fréquentes

Combien Thinking Machines Lab va-t-elle payer à Crusoe ?

L’accord annoncé le 23 septembre prévoit 65 millions de dollars par an pour l’exécution des charges d’inférence en production via Crusoe Managed Inference.

Quel matériel sera utilisé par Thinking Machines Lab ?

Les charges seront traitées sur un déploiement dédié de systèmes NVIDIA HGX B200, connectés par NVIDIA Quantum-2 InfiniBand. Crusoe gérera directement le cluster.

Anthropic a-t-elle déjà signé un contrat pour 1 GW avec Stream Data Centers ?

Non. La documentation disponible mentionne uniquement des discussions préliminaires pour louer jusqu’à 1 GW. La structure, le volume définitif, et le matériel ne sont pas arrêtés.

Pourquoi Anthropic souhaite-t-elle contrôler davantage d’infrastructure ?

Le contrat potentiel permettrait à Anthropic d’établir une relation plus directe avec les centres de données et la capacité informatique. La société continue par ailleurs ses grands accords avec AWS, Google, NVIDIA, Microsoft et autres, ce qui cadre avec une stratégie de diversification de l’approvisionnement.

le dernier