Red Hat, fournisseur mondial de solutions open source, a annoncé d’importantes nouveautés dans sa gamme Red Hat AI avec le lancement de Red Hat AI 3.5.

Alors que les entreprises progressent depuis les phases initiales d’expérimentation et de projets pilotes vers la mise en œuvre de l’intelligence artificielle, les responsables informatiques et d’ingénierie plateforme doivent relever le défi de gérer ces technologies avec le même niveau d’exigence opérationnelle que pour les infrastructures critiques.

Dans ce contexte, Red Hat AI 3.5 offre une base évolutive pour gérer, sécuriser et superviser les charges de travail IA dans des environnements de cloud hybride, afin de réduire l’écart entre les projets pilotes d’IA isolés et une architecture d’entreprise totalement gouvernée.

Qu’est-ce que Red Hat AI 3.5 ?

Red Hat AI 3.5 fournit aux organisations l’infrastructure opérationnelle nécessaire pour déployer l’intelligence artificielle en production et étendre son utilisation dans des environnements hybrides, en intégrant de nouvelles fonctionnalités de sécurité et d’observabilité. La nouvelle version permet d’évaluer les modèles avant déploiement grâce à EvalHub, avec des tests comparatifs de sécurité axés sur les risques et la possibilité de générer des certifications de conformité réglementaire.

Les nouveaux tableaux de bord d’observabilité offrent aux équipes plateforme des métriques complètes pour connaître en temps réel l’état de l’inférence, l’utilisation des GPU et la performance des modèles AI. En outre, les utilisateurs sans droits d’administration peuvent consulter des tableaux de bord dédiés à la répartition interne des coûts liés à la consommation de tokens par utilisateur et aux charges de travail d’inférence distribuée.

Par ailleurs, Red Hat AI 3.5 étend les capacités de la plateforme d’entreprise pour améliorer le support multi-locataire, notamment pour les fournisseurs de services AI et pour les cas d’usage nécessitant un isolement total, depuis le matériel jusqu’au logiciel. Elle intègre aussi un service basé sur la priorisation et sous architecture multi-locataire native pour les infrastructures de GPU partagées.

Pour les organisations nécessitant un level supérieur de séparation entre locataires, Red Hat AI supporte désormais officiellement le fonctionnement sur planes de contrôle hébergés par Red Hat OpenShift, déployés via Red Hat OpenShift Virtualization. Ces plans de contrôle permettent à chaque locataire d’avoir un cluster de contrôle indépendant tout en partageant le matériel sous-jacent.

De plus, l’exécution de charges de travail IA sur des machines virtuelles via Red Hat OpenShift Virtualization offre un isolement robuste à l’échelle VM dans des infrastructures partagées avec GPU. Ces fonctionnalités permettent aux fournisseurs d’infrastructure de gérer et de mettre à jour tout l’environnement à partir d’un point unique de contrôle.

Nouvelles fonctionnalités pour les agents IA

Red Hat AI 3.5 facilite également le développement d’agents IA soumis à des mécanismes de gouvernance. AutoRAG permet de connecter directement les repositories de données d’entreprise avec les applications d’agents et intègre des fonctionnalités telles que le support pour documents multilingues, les tests conversationnels et la récupération contextuelle.

Un pipeline visuel permet aux équipes de vérifier leurs configurations RAG avant leur mise en production. Les modèles d’agents incluent par ailleurs des déploiements préconfigurés pour des cas standards comme la revue de code, le traitement de documents ou les flux de recherche.

Une fois déployés, Inference-Time Scaling (ITS) optimise l’utilisation des GPU en ajustant dynamiquement la capacité de calcul selon la complexité de chaque requête.

Pourquoi Red Hat AI 3.5 est-il crucial ?

Alors que les pilotes d’IA à l’échelle de l’entreprise rencontrent du succès et que les résultats initiaux génèrent des retours positifs, les équipes IT doivent répondre au besoin d’échelle. Mais faire évoluer l’IA dans toute l’organisation exige autant de rigueur opérationnelle que pour toute infrastructure critique : sécurité vérifiée avant le déploiement, contrôles précis des ressources dans des environnements GPU partagés, comportement gouverné des agents et métriques d’utilisation transparentes. Aujourd’hui, la plupart des organisations font face à ces défis avec des outils fragmentés et des processus manuels, peu évolutifs. Red Hat AI 3.5 comble cette lacune en unifiant la sécurité, le support multi-locataire, le développement d’agents et l’observabilité en une plateforme d’entreprise unique. Résultat : une IA qui fonctionne comme une architecture responsable et gouvernée, et non comme un simple projet isolé, dans des environnements de cloud hybride.

Déclarations de Red Hat

« La discussion ne consiste plus simplement à déployer l’IA en production, mais à l’exécuter à l’échelle en tant qu’infrastructure d’entreprise fiable, nécessitant des preuves de sécurité, des agents gouvernés, une attribution des coûts et un support multi-locataire », explique Joe Fernandes, vice-président et directeur général de l’Unité Business AI, Red Hat. « Avec Red Hat AI 3.5, nous fournissons les contrôles opérationnels, la confiance vérifiable et les bases agéntiques dont les leaders IT ont besoin pour exécuter une architecture IA d’entreprise sûre, contrôlée et responsable dans le cloud hybride. »

Principales nouveautés :

  • Évaluation et sécurité vérifiables avant déploiement : Les modèles évalués du catalogue incluent des scores de référence intégrés via Garak, tandis que la disponibilité générale de EvalHub automatise les rapports de sécurité et de conformité pour des modèles personnalisés, RAG et agents.
  • Contrôle GPU partagé pour une inférence multi-locataires : La gestion équitable des GPU assure l’allocation des ressources entre locataires, avec un service prioritaire pour le contrôle de l’admission et le routage des requêtes selon leur priorité, protégeant ainsi l’inférence en temps réel et permettant aux charges de fond d’utiliser la capacité restante.
  • API pour agents et sécurité via gateway : La disponibilité générale de Responses API et RAG intégré offre une interface unifiée pour les conversations multi-tournants, renforcée par NeMo Guardrails pour prévenir l’utilisation malveillante des outils.
  • Ancrage aux données d’entreprise et raisonnement efficace : AutoRAG, support pgvector, AutoML intégré et ITS permettent aux modèles d’ajuster dynamiquement leur consommation de calcul selon la complexité des requêtes.
  • Supervision intégrée et attribution des coûts MaaS : La mesure de consommation de tokens par utilisateur, les dashboards de performance pour modèles et agents, le traçage visuel avec MLflow et les tableaux de bord GPU garantissent une transparence opérationnelle et d’usage optimale.
  • Modèles d’agents pré-configurés pour un développement accéléré : AI Hub propose des templates d’agents et des kits de démarrage avec des implémentations de référence pour des usages courants comme la revue de code, le traitement documentaire ou la recherche, facilitant un déploiement rapide.

Plus de détails

  • Support pour plans de contrôle hébergés et OpenShift Virtualization pour une meilleure gestion des ressources en multi-locataires : Red Hat AI supporte désormais officiellement les plans de contrôle hébergés, offrant à chaque locataire un cluster dédié tout en partageant le matériel. La compatibilité avec OpenShift Virtualization permet une exécution de charges IA en VM, offrant un isolement solide dans des environnements partagés avec GPU.
  • Nouveaux modèles validés avec scores de sécurité IA : Plus de 20 nouveaux modèles validés intègrent désormais des évaluations complètes, y compris la sécurité Garak, la sensibilité aux données personnelles (PII) et le risque de toxicité, apportant transparence et confiance pour l’évaluation des risques IA.
  • Modèles validés avec appels à outils : Certains modèles sont marqués comme certifiés pour effectuer des appels à des outils, garantissant leur fiabilité pour des scénarios agents.
  • Gestion de trafic et déploiements sûrs : La priorisation de requêtes permet d’assurer une inférence en temps réel tout en exploitant la capacité restante pour le traitement en arrière-plan, avec une gestion contrôlée lors des déploiements pour minimiser l’interruption des services.
  • Gestion efficace de la mémoire GPU : La prise en charge de la décharge vers le CPU permet de gérer de plus longues conversations ou documents volumineux avec moins de matériel GPU supplémentaire.
  • Service multimodal : Génération simultanée de texte, d’audio et d’images via vLLM Omni (accès anticipé).
  • Service de modèles en Kubernetes multicloud : Extention de l’inférence distribuée LLM-d au-delà d’OpenShift vers d’autres clouds comme CoreWeave CKS, Microsoft Azure, et en préversion sur Amazon EKS, pour une expérience cohérente.
  • Kits de développement d’agents : Templates et kits pour déployer rapidement des agents dans divers scénarios, tout en maintenant un contrôle opérationnel complet et une sécurité optimale.
  • Workload Data Platform : Kubeflow Spark Operator, en préversion, unifie traitement distribué de données et gestion de modèles, avec support GPU multi-locataires via namespaces et tableaux de bord en temps réel.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *