NVIDIA Rubin CPX : le GPU qui redéfinit l’inférence de contexte longue à l’ère de l’IA

NVIDIA Rubin CPX : le GPU qui redéfinit l'inférence de contexte longue à l'ère de l'IA

L’inférence est devient le nouveau champ de bataille de l’intelligence artificielle. Les modèles actuels ne se contentent plus d’être de simples générateurs de texte ou d’images : ils évoluent vers des systèmes agéntiques capables de raisonner sur plusieurs étapes, de maintenir une mémoire persistante et de gérer des contextes de plusieurs millions de tokens. Pour […]

NVIDIA Rubin CPX : la nouvelle GPU qui inaugure l’ère de l’inférence avec des contextes massifs

NVIDIA Rubin CPX : la nouvelle GPU qui inaugure l'ère de l'inférence avec des contextes massifs

L’intelligence artificielle ne connaît pas de pause, et le développement du matériel capable de supporter des modèles de plus en plus complexes et exigeants continue d’évoluer. NVIDIA a présenté Rubin CPX, une GPU qui représente non seulement une évolution par rapport aux générations précédentes, mais ouvre également une nouvelle catégorie au sein de l’écosystème CUDA […]

Google présente Ironwood : son TPU pour dominer l’inférence des modèles de raisonnement à l’ère exascale

Google présente Ironwood : son TPU pour dominer l'inférence des modèles de raisonnement à l'ère exascale

Google a clôturé ses présentations sur le machine learning lors de la conférence Hot Chips en annonçant une avancée majeure : Ironwood, la nouvelle génération de ses unités de traitement tensoriel (TPU). Conçue spécifiquement pour l’inférence de modèles de langage et le raisonnement à grande échelle, cette nouvelle architecture dépasse largement ses prédécesseurs, qui se […]

NVIDIA et OpenAI portent l’inférence à 1,5 million de tokens par seconde avec les modèles GPT-OSS sur l’architecture Blackwell

NVIDIA et OpenAI portent l'inférence à 1,5 million de tokens par seconde avec les modèles GPT-OSS sur l'architecture Blackwell

NVIDIA et OpenAI ont franchi une nouvelle étape dans la performance de l’intelligence artificielle avec le lancement des modèles open source gpt-oss-20b et gpt-oss-120b, optimisés pour l’architecture Blackwell. Selon la société, le plus grand modèle atteint jusqu’à 1,5 million de tokens par seconde (TPS) sur un système NVIDIA GB200 NVL72, ce qui permettrait de servir […]

Kog AI stimule une révolution dans l’inférence avec AMD MI300X : jusqu’à 3,5 fois plus rapide que les moteurs actuels

Kog AI stimule une révolution dans l'inférence avec AMD MI300X : jusqu'à 3,5 fois plus rapide que les moteurs actuels

Une startup française marque un tournant dans le domaine de l’inférence en intelligence artificielle en annonçant que son moteur d’inférence atteint une vitesse de génération de tokens jusqu’à 3,5 fois supérieure à celle des solutions leaders telles que vLLM et TensorRT-LLM, grâce à l’utilisation de GPUs AMD Instinct™ MI300X. Cette avancée positionne Kog AI à […]

Red Hat lance la communauté llm-d pour renforcer l’inférence distribuée de l’IA générative à grande échelle

Une nouvelle vision pour les télécommunications dans un environnement en constante évolution

Red Hat lance un projet innovant pour l’inférence à grande échelle en IA générative Red Hat, leader mondial des solutions open source, a dévoilé le lancement de llm-d, un projet ambitieux destiné à relever l’un des défis majeurs de l’avenir de l’intelligence artificielle générative : l’inférence à grande échelle. Ce développement vise à optimiser les […]