AMD achète Taalas et ouvre une nouvelle voie pour accélérer l’inférence IA

AMD achète Taalas et ouvre une nouvelle voie pour accélérer l'inférence IA

AMD a acquis Taalas, une petite entreprise canadienne innovant avec une idée radicalement différente de celle des GPU actuels : incorporer directement dans le silicium les poids d’un modèle d’intelligence artificielle. Son démonstrateur HC1 a atteint environ 16 960 tokens par seconde en exécutant Llama 3.1 8B, une performance difficile à obtenir avec des accélérateurs […]

IBM et Together AI investiront 240 millions pour déployer l’inférence avec NVIDIA B300

IBM X-Force 2026 : les attaquants ne changent pas le scénario, ils l'accélèrent avec l'intelligence artificielle

IBM et Together AI ont签署 un accord pluriannuel d’une valeur de 240 millions de dollars pour déployer sur IBM Cloud un vaste cluster d’infrastructure NVIDIA dédié spécifiquement à l’inférence en intelligence artificielle. La plateforme utilisera des systèmes NVIDIA HGX B300 avec GPU Blackwell Ultra et des réseaux Spectrum-X Ethernet, avec une mise en service prévue […]

Rebellions achète SqueezeBits pour boucler son offre d’inférence IA

Rébellions achète SqueezeBits pour clôturer la boucle de l'inférence IA

Rebellions a annoncé l’acquisition de SqueezeBits, une startup sud-coréenne spécialisée dans l’optimisation de l’inférence et la compression de modèles IA. Le message est clair : fabriquer des puces ne suffit plus pour convaincre dans les déploiements réels. Il faut aussi maîtriser le logiciel qui fait tourner ces modèles avec un coût maîtrisé et une latence […]

OpenAI entre dans la guerre du silicium avec Jalapeño, son premier processeur pour l’inférence en IA

OpenAI entre dans la guerre du silicium avec Jalapeño, son premier processeur pour l'inférence en IA

OpenAI ne se limite plus à entraîner des modèles, vendre l’accès à une API ou transformer ChatGPT en une plateforme de productivité. Avec Jalapeño, son premier processeur d’intelligence conçu en collaboration avec Broadcom, la société s’attaque directement à la couche la plus matérielle de l’intelligence artificielle : le silicium, le réseau, les racks et l’efficacité […]

NVIDIA arrive à GTC 2026 avec l’inférence au centre et des doutes sur le GPU unique

NVIDIA trace sa feuille de route au CES 2026 : Rubin, modèles ouverts et « mémoire » pour l’IA agissante

NVIDIA lance aujourd’hui la GTC 2026 à San José dans un contexte marqué par une approche différente de celle des années précédentes. La conférence se déroule du 16 au 19 mars, et la keynote de Jensen Huang est prévue pour ce lundi, lors d’un événement où la société elle-même annonce des nouveautés concernant l’Intelligence Artificielle, […]

NVIDIA Groq 3 LPX : le nouveau moteur pour l’inférence à faible latence

NVIDIA renforce son engagement dans l'infrastructure IA avec BlueField-4 STX, une architecture de stockage conçue pour les agents et les contextes longs

La grande course de l’IA ne se limite plus à la maîtrise de modèles de plus en plus gros. De plus en plus, le véritable goulet d’étranglement réside dans l’inférence: le temps nécessaire à un système pour commencer à répondre, la latence accumulée lorsque plusieurs agents interagissent et le coût pour maintenir cette rapidité à […]

Vultr s’appuie sur NVIDIA et NetApp pour accélérer l’inférence d’IA

Vultr intègre les GPU AMD Instinct MI355X dans son offre cloud et bare metal

La carrière de l’intelligence artificielle d’entreprise ne tourne plus uniquement autour de l’entraînement de modèles de plus en plus volumineux. Le véritable goulet d’étranglement commence à se situer ailleurs : comment déployer ces modèles, les alimenter avec des données pertinentes, assurer leur scalabilité et maîtriser les coûts d’inférence lors de leur mise en production. C’est […]

Akamai veut amener l’inférence de l’IA à la périphérie avec 4 400 emplacements

Rapport sur les ransomwares 2025 : Résilience dans un paysage de menaces alimenté par l'IA

Akamai marque une étape importante dans sa stratégie d’Intelligence Artificielle en dévoilant AI Grid Intelligent Orchestration, une nouvelle couche d’orchestration pour l’inférence distribuée. Selon l’entreprise, cette innovation transforme son réseau en la première mise en œuvre à l’échelle mondiale du design de référence NVIDIA AI Grid. Elle s’appuie sur l’infrastructure de Akamai Inference Cloud et […]