AMD achète Taalas et ouvre une nouvelle voie pour accélérer l’inférence IA

AMD a acquis Taalas, une petite entreprise canadienne innovant avec une idée radicalement différente de celle des GPU actuels : incorporer directement dans le silicium les poids d’un modèle d’intelligence artificielle. Son démonstrateur HC1 a atteint environ 16 960 tokens par seconde en exécutant Llama 3.1 8B, une performance difficile à obtenir avec des accélérateurs […]
IBM et Together AI investiront 240 millions pour déployer l’inférence avec NVIDIA B300

IBM et Together AI ont签署 un accord pluriannuel d’une valeur de 240 millions de dollars pour déployer sur IBM Cloud un vaste cluster d’infrastructure NVIDIA dédié spécifiquement à l’inférence en intelligence artificielle. La plateforme utilisera des systèmes NVIDIA HGX B300 avec GPU Blackwell Ultra et des réseaux Spectrum-X Ethernet, avec une mise en service prévue […]
Rebellions achète SqueezeBits pour boucler son offre d’inférence IA

Rebellions a annoncé l’acquisition de SqueezeBits, une startup sud-coréenne spécialisée dans l’optimisation de l’inférence et la compression de modèles IA. Le message est clair : fabriquer des puces ne suffit plus pour convaincre dans les déploiements réels. Il faut aussi maîtriser le logiciel qui fait tourner ces modèles avec un coût maîtrisé et une latence […]
OpenAI entre dans la guerre du silicium avec Jalapeño, son premier processeur pour l’inférence en IA

OpenAI ne se limite plus à entraîner des modèles, vendre l’accès à une API ou transformer ChatGPT en une plateforme de productivité. Avec Jalapeño, son premier processeur d’intelligence conçu en collaboration avec Broadcom, la société s’attaque directement à la couche la plus matérielle de l’intelligence artificielle : le silicium, le réseau, les racks et l’efficacité […]
L’inférence d’IA pressionne déjà les CPU et Intel voit une plus grande tension sur le marché

L’intelligence artificielle ne dépend plus uniquement des GPU, de la mémoire et des SSD. Intel a clairement indiqué lors de ses derniers résultats que la prochaine grande force du marché pourrait provenir des CPU pour serveurs, soutenues par le passage du entraînement de modèles à des charges axées sur l’inférence, les agents IA et des […]
L’inférence de l’IA chutera de plus de 90 %, mais la facture totale ne diminuera pas autant

L’économie de l’Intelligence Artificielle générative va radicalement se transformer au cours de cette décennie. Selon une nouvelle prévision de Gartner, d’ici 2030, l’inférence sur un grand modèle de langage de 1 billion de paramètres coûtera aux fournisseurs d’IA plus de 90 % de moins qu’en 2025. La société souligne également que les LLM de 2030 […]
NVIDIA arrive à GTC 2026 avec l’inférence au centre et des doutes sur le GPU unique

NVIDIA lance aujourd’hui la GTC 2026 à San José dans un contexte marqué par une approche différente de celle des années précédentes. La conférence se déroule du 16 au 19 mars, et la keynote de Jensen Huang est prévue pour ce lundi, lors d’un événement où la société elle-même annonce des nouveautés concernant l’Intelligence Artificielle, […]
NVIDIA Groq 3 LPX : le nouveau moteur pour l’inférence à faible latence

La grande course de l’IA ne se limite plus à la maîtrise de modèles de plus en plus gros. De plus en plus, le véritable goulet d’étranglement réside dans l’inférence: le temps nécessaire à un système pour commencer à répondre, la latence accumulée lorsque plusieurs agents interagissent et le coût pour maintenir cette rapidité à […]
Vultr s’appuie sur NVIDIA et NetApp pour accélérer l’inférence d’IA

La carrière de l’intelligence artificielle d’entreprise ne tourne plus uniquement autour de l’entraînement de modèles de plus en plus volumineux. Le véritable goulet d’étranglement commence à se situer ailleurs : comment déployer ces modèles, les alimenter avec des données pertinentes, assurer leur scalabilité et maîtriser les coûts d’inférence lors de leur mise en production. C’est […]
Akamai veut amener l’inférence de l’IA à la périphérie avec 4 400 emplacements

Akamai marque une étape importante dans sa stratégie d’Intelligence Artificielle en dévoilant AI Grid Intelligent Orchestration, une nouvelle couche d’orchestration pour l’inférence distribuée. Selon l’entreprise, cette innovation transforme son réseau en la première mise en œuvre à l’échelle mondiale du design de référence NVIDIA AI Grid. Elle s’appuie sur l’infrastructure de Akamai Inference Cloud et […]