Anthropic et CoreWeave : un accord pluriannuel pour Claude dans le cloud IA

Anthropic a conclu un accord pluriannuel avec CoreWeave pour utiliser son infrastructure cloud dans le développement et le déploiement de la famille de modèles Claude. CoreWeave a confirmé que la capacité contractée commencera à être déployée plus tard cette année. Anthropic possède déjà un partenariat stratégique avec Amazon (8 milliards investis, AWS comme fournisseur cloud […]
Uber et AWS : Trainium3 au service du moteur d’IA de la mobilité

Uber a renforcé sa collaboration avec AWS en étendant l’utilisation de Graviton4 pour ses Trip Serving Zones (infrastructure temps réel de chaque trajet/livraison) et en testant Trainium3 pour l’entraînement de modèles IA. Ce dépassement de la simple migration cloud illustre comment Uber choisit le type de silicium le plus adapté à chaque charge. AWS est […]
NVIDIA Blackwell domine 2026, Rubin risque un retard selon TrendForce

NVIDIA Blackwell dominera 2026 selon TrendForce, avec une demande supérieure à l’offre. Rubin risque un retard qui prolongerait la domination de Blackwell. Ce contexte explique pourquoi Meta et Broadcom développent leurs propres puces MTIA en 2 nm et pourquoi NVIDIA investit 1 Md$ dans Nokia pour transformer le télécom en infrastructure IA. La pénurie de […]
Google alerte : la mémoire freine les grands modèles d’IA

Google alerte : la mémoire, pas le calcul, est le vrai goulot d’étranglement des grands modèles d’IA. La bande passante mémoire est souvent le facteur limitant pour l’inférence, pas la puissance GPU. Solutions : architectures HBM plus rapides, quantification, caches KV optimisés. Cela explique pourquoi SK hynix mise sur la HBM5 hybride et pourquoi la […]
UC San Diego renforce sa recherche en inférence de LLM avec un système NVIDIA DGX B200

La course à la mise en service de modèles de langage à faible latence ne se résume plus seulement à des articles et des benchmarks : de plus en plus, la victoire se joue dans le laboratoire de systèmes, où le goulet d’étranglement réside souvent dans la façon dont le modèle est « servi » […]
Red Hat et Rebelles apportent les NPU à OpenShift AI pour favoriser une inférence plus efficace en entreprise

La course à la déploiement de l’Intelligence Artificielle en production ne se résume pas seulement au choix du modèle. De plus en plus, la discussion s’oriente vers l’infrastructure : quel est le coût de la mise en service d’un modèle, sa consommation énergétique, la gestion à grande échelle, et le niveau de contrôle et conformité […]
Google lance Ironwood (TPU v7) et de nouvelles VM Axion : inférence à l’échelle mondiale et réduction des coûts

Google Cloud a dévoilé Ironwood, sa septième génération de TPU, accompagnée de nouvelles instances Axion basées sur ARM Neoverse — N4A (en avant-première) et C4A métal (bare metal ARM, « prochainement » en aperçu) —, marquant ainsi un changement de cycle dans le domaine de l’Intelligence Artificielle : un déplacement du focus du entraînement vers […]
Akamai lance Inference Cloud avec NVIDIA : inférence IA distribuée du cœur au bord pour l’ère des agents et de la Physique IA

Akamai a présenté Inference Cloud, une plateforme conçue pour faire passer l’inférence de l’IA des centres de données centraux jusqu’au périmètre d’Internet, afin d’offrir faible latence, sécurité et évolutivité mondiale pour des applications d’IA agentique et de Physical AI (robots, véhicules, villes intelligentes). La solution exploite l’infrastructure NVIDIA Blackwell et le réseau mondial distribué d’Akamai […]
IBM et Groq s’associent pour mettre l’IA générative en production : watsonx Orchestrate ajoutera une inférence « ultrarapide » via LPU et GroqCloud

IBM et Groq ont annoncé une alliance stratégique en marketing et technologie, avec un objectif clair : permettre aux entreprises de passer des pilotes à la production en IA agentique, sans rencontrer les obstacles habituels liés à la latence, au coût et à l’échelle. L’accord intègre GroqCloud — la plateforme d’inférence accélérée par la LPU […]
Akamai Inference Cloud transforme l’IA du centre à l’Edge avec NVIDIA

Akamai Technologies, Inc. (NASDAQ : AKAM) a lancé Akamai Inference Cloud, une plateforme innovante qui bouleverse la manière et l’endroit où l’intelligence artificielle est déployée, en étendant les processus d’inférence des centres de données traditionnels jusqu’au front (Edge) d’Internet. Cette solution permet d’effectuer des inférences IA avancées et autonomes directement à la périphérie (Edge), c’est-à-dire […]