Les CPU de serveur prennent déjà 25 à 30 semaines en raison des agents d’IA

AMD veut devenir le « CPU par défaut » dans le cloud : ainsi il gagne du terrain en 2025 (et pourquoi cela compte en 2026)

Les processeurs pour serveurs commencent à faire partie de la liste des composants en pénurie en raison de l’intelligence artificielle. La société de conseil TrendForce situe désormais les délais de livraison des CPU de serveur entre 25 et 30 semaines, contre 16 à 20 semaines dans un marché équilibré. Après les GPU, la mémoire HBM et les SSD d’entreprise, la tension se fait sentir sur une composante qui, ces dernières années, était passée au second plan face aux accélérateurs.

Les clés de la pénurie de CPU pour serveurs en 30 secondes

  • TrendForce augmente les délais de livraison des CPU de serveur à 25-30 semaines, contre 16-20 dans des conditions normales.
  • Des agents d’intelligence artificielle comme Meta Muse utilisent une machine virtuelle par utilisateur, avec CPU, mémoire et stockage dédiés.
  • Un scénario avec 100 millions d’utilisateurs quotidiens nécessiterait environ 12,5 millions de cœurs physiques, pas 50 millions.
  • Il n’existe pas de preuves que Muse soit la principale cause : la demande pour des serveurs d’IA et les achats anticipés pèsent également.

Ces chiffres proviennent du bulletin hebdomadaire de TrendForce, qui relie ce changement à la croissance des agents d’IA, et ont été relayés par des médias comme Wccftech. Il convient de les analyser avec nuance. Une extension des délais est un indicateur du marché, mais ne révèle pas à elle seule l’ampleur exacte de la demande nouvelle ni ses origines précises.

Pourquoi les agents ont-ils besoin de CPU et pas uniquement de GPU

Un chatbot traditionnel reçoit une question et retourne une réponse générée sur une GPU. Un agent d’IA réalise davantage d’opérations : exécute des tâches étape par étape, conserve son état, ouvre des fichiers, lance des commandes et sollicite des outils externes. Tout cela s’effectue dans un environnement de calcul classique, avec processeur, mémoire et stockage, tandis que le GPU n’intervient que lorsque le modèle doit réfléchir à l’action suivante.

Meta Muse, l’agent personnel lancé par Meta en septembre, en est l’exemple le plus visible. Chaque utilisateur dispose de sa propre machine dans le cloud, une machine virtuelle sous Linux configurée avec 2 vCPU, 8 GB de RAM et 100 GB de SSD. Selon des chercheurs ayant interrogé l’agent lui-même, cités par Tom’s Hardware, ces machines fonctionnent sur des serveurs équipés de processeurs AMD EPYC Turin. Muse a dépassé le demi-million d’utilisateurs actifs quotidiens lors de sa première semaine, et plusieurs sources indiquent déjà des problèmes de capacité.

Revista Cloud a déjà suivi la stratégie de Meta dans ce domaine avec Muse Code, son agent de programmation. Ce qui importe maintenant, c’est qu’un produit destiné à un vaste public, avec des centaines de millions d’utilisateurs potentiels, transforme chaque personne en une machine virtuelle allumée, ce qui se traduit en besoins pour des serveurs.

vCPU n’est pas synonyme de cœur physique

Le risque dans ce débat est de surestimer la demande. Attribuer 2 vCPU à une machine virtuelle ne signifie pas utiliser deux cœurs physiques en continu. Les agents passent une grande partie du temps à attendre : la réponse du modèle, celle de l’utilisateur, celle d’un outil ou du réseau. C’est pourquoi les fournisseurs de cloud peuvent sur-suscrire, c’est-à-dire allouer plus de vCPU qu’il n’y a de cœurs physiques disponibles.

L’exemple de DeepSeek illustre cela. Leur plateforme DSec, décrite dans un article technique publié ce mois-ci, gère plus de 380 000 environnements isolés simultanément (sandboxes) pour entraîner des agents sur une unité de production d’environ 160 nœuds. Selon leur propre documentation, environ 90 % de ces environnements n’utilisent pas plus de 5 % de la capacité processeur allouée. La différence entre ce qui est attribué et ce qui est consommé est considérable.

En suivant cette logique, l’analyste Freda Duan a imaginé un scénario pour Muse. Si celui-ci atteignait 100 millions d’utilisateurs quotidiens, avec une activité moyenne de deux heures par utilisateur, et en appliquant un facteur de 2,5 entre le pic et la moyenne, plus une marge de 20 %, il faudrait environ 25 millions de machines virtuelles actives en même temps. Avec 2 vCPU par VM, cela représenterait 50 millions de vCPU, mais en considérant qu’en moyenne chaque VM utilise seulement 0,5 cœur physique, la demande réelle serait d’environ 12,5 millions de cœurs physiques.

Hypothèse du scénario Valeur
Utilisateurs actifs quotidiens 100 millions (hypothétique)
Activité moyenne par utilisateur 2 heures/jour
Facteur pic-moyenne + marge 2,5x + 20 %
Machines virtuelles actives simultanément 25 millions
vCPU attribuées (2 par VM) 50 millions
Cœurs physiques (0,5 par VM) 12,5 millions

Il s’agit d’une estimation basée sur des hypothèses discutables, et non d’un chiffre précis de Meta. Aujourd’hui, Muse est encore loin de ces 100 millions d’utilisateurs, et l’utilisation réelle par machine peut varier. Cependant, cela permet d’appréhender l’ordre de grandeur et de comprendre pourquoi comparer des prix ou des capacités par vCPU peut être trompeur, comme l’explique également cet article sur le prix par vCPU.

Muse ne révèle pas toute la tension du marché

Rendre responsable uniquement Muse de l’allongement des délais serait hâtif. Le produit est sur le marché depuis peu, et les commandes de processeurs sont planifiées avec des mois d’avance. La pression a commencé avant : en avril, TrendForce a déjà revu à la baisse ses prévisions d’expédition de serveurs classiques pour 2026 en raison de la pénurie de composants, en soulignant que les fournisseurs priorisent la capacité pour les serveurs d’IA, plus rentables.

D’autres facteurs jouent également un rôle. Chaque serveur d’IA intègre des CPU haut de gamme orchestrant les GPU, et la demande pour ces configurations reste soutenue. Lorsque les délais s’allongent, nombreuses sont les entreprises qui effectuent des commandes anticipées pour sécuriser leur approvisionnement, ce qui tend encore davantage le marché. La pénurie de mémoire DRAM et de SSD d’entreprise complique aussi la mise en place complète de nombreux serveurs, entraînant des coûts supplémentaires et des retards.

Si cette demande se confirme, les bénéficiaires ne seront pas seulement Intel, AMD ou les architectures Arm. Les fabricants de serveurs, les fournisseurs de cloud, les producteurs de mémoire et de stockage, ainsi que les opérateurs de centres de données en profiteront. La vraie question reste de savoir si, dans les prochains trimestres, la croissance rapide des agents d’IA ou la capacité des fournisseurs cloud à multiplier les machines virtuelles par noyau physique aura le plus d’impact sur le marché.

Questions fréquemment posées

Combien de temps faut-il actuellement pour recevoir une CPU de serveur ?

Selon TrendForce, entre 25 et 30 semaines, contre 16 à 20 semaines dans un marché équilibré.

Pourquoi les agents d’IA ont-ils besoin de CPU ?

Parce qu’ils exécutent des tâches en plusieurs étapes, maintiennent leur état, et utilisent des outils au sein de machines virtuelles équipées de processeur, mémoire et disque, en complément de la GPU qui génère les réponses.

Quelle machine virtuelle Meta Muse attribue-t-elle à chaque utilisateur ?

Une machine avec 2 vCPU, 8 GB de RAM et 100 GB de SSD, hébergée sur des serveurs équipés de processeurs AMD EPYC Turin, d’après les informations publiques.

Pourquoi ne peut-on pas simplement estimer la demande en additionnant les vCPU ?

Parce que les agents passent beaucoup de temps à attendre, et que les fournisseurs sur-suscrivent les cœurs physiques. Une vCPU attribuée ne correspond pas nécessairement à un cœur actif en permanence.

Sources :

le dernier