Red Hat AI 3 apporte l’inférence distribuée en production : une plateforme ouverte pour les agents, Kubernetes et tout accélérateur

Red Hat a annoncé Red Hat AI 3, une évolution majeure de sa plateforme d’entreprise en intelligence artificielle qui intègre Red Hat AI Inference Server, RHEL AI et OpenShift AI. L’objectif est de répondre au principal défi de 2025 : opérationnaliser l’inférence à grande échelle (la phase du “faire”) et passer du prototype à la […]
Red Hat amène l’inférence d’IA distribuée aux charges de travail productives d’IA avec Red Hat AI 3

Red Hat, leader mondial dans les solutions logicielles open source, a présenté Red Hat AI 3, une mise à jour majeure de sa plateforme d’intelligence artificielle dédiée aux entreprises. Cette nouvelle version combine les innovations de Red Hat AI Inference Server, Red Hat Enterprise Linux AI (RHEL AI) et Red Hat OpenShift AI, dans le […]
NVIDIA Rubin CPX : le GPU qui redéfinit l’inférence de contexte longue à l’ère de l’IA

L’inférence est devient le nouveau champ de bataille de l’intelligence artificielle. Les modèles actuels ne se contentent plus d’être de simples générateurs de texte ou d’images : ils évoluent vers des systèmes agéntiques capables de raisonner sur plusieurs étapes, de maintenir une mémoire persistante et de gérer des contextes de plusieurs millions de tokens. Pour […]
NVIDIA Rubin CPX : la nouvelle GPU qui inaugure l’ère de l’inférence avec des contextes massifs

L’intelligence artificielle ne connaît pas de pause, et le développement du matériel capable de supporter des modèles de plus en plus complexes et exigeants continue d’évoluer. NVIDIA a présenté Rubin CPX, une GPU qui représente non seulement une évolution par rapport aux générations précédentes, mais ouvre également une nouvelle catégorie au sein de l’écosystème CUDA […]
D-Matrix présente 3DIMC : la mémoire 3D empilée qui veut détrôner HBM dans l’inférence d’IA

La startup affirme que sa technologie sera jusqu’à 10 fois plus rapide et efficace que la mémoire HBM pour les charges d’inférence, marquant ainsi un changement de paradigme dans la relation entre calcul et mémoire. La mémoire à large bande passante (HBM) est devenue la référence incontournable en intelligence artificielle et calcul haute performance. Utilisée […]
Google présente Ironwood : son TPU pour dominer l’inférence des modèles de raisonnement à l’ère exascale

Google a clôturé ses présentations sur le machine learning lors de la conférence Hot Chips en annonçant une avancée majeure : Ironwood, la nouvelle génération de ses unités de traitement tensoriel (TPU). Conçue spécifiquement pour l’inférence de modèles de langage et le raisonnement à grande échelle, cette nouvelle architecture dépasse largement ses prédécesseurs, qui se […]
NVIDIA et OpenAI portent l’inférence à 1,5 million de tokens par seconde avec les modèles GPT-OSS sur l’architecture Blackwell

NVIDIA et OpenAI ont franchi une nouvelle étape dans la performance de l’intelligence artificielle avec le lancement des modèles open source gpt-oss-20b et gpt-oss-120b, optimisés pour l’architecture Blackwell. Selon la société, le plus grand modèle atteint jusqu’à 1,5 million de tokens par seconde (TPS) sur un système NVIDIA GB200 NVL72, ce qui permettrait de servir […]
Kog AI stimule une révolution dans l’inférence avec AMD MI300X : jusqu’à 3,5 fois plus rapide que les moteurs actuels

Une startup française marque un tournant dans le domaine de l’inférence en intelligence artificielle en annonçant que son moteur d’inférence atteint une vitesse de génération de tokens jusqu’à 3,5 fois supérieure à celle des solutions leaders telles que vLLM et TensorRT-LLM, grâce à l’utilisation de GPUs AMD Instinct™ MI300X. Cette avancée positionne Kog AI à […]
Groq inaugure son premier centre de données en Europe pour dominer l’ère de l’inférence en intelligence artificielle

Alors que de nombreux géants de la technologie continuent de se concentrer sur la formation de modèles de plus en plus volumineux, une nouvelle course discrète mais tout aussi stratégique émerge : celle de l’exécution rapide, efficace et durable de ces modèles. Dans ce domaine, la startup américaine Groq gagne du terrain. Cette semaine, elle […]
Red Hat lance la communauté llm-d pour renforcer l’inférence distribuée de l’IA générative à grande échelle

Red Hat lance un projet innovant pour l’inférence à grande échelle en IA générative Red Hat, leader mondial des solutions open source, a dévoilé le lancement de llm-d, un projet ambitieux destiné à relever l’un des défis majeurs de l’avenir de l’intelligence artificielle générative : l’inférence à grande échelle. Ce développement vise à optimiser les […]