
NVIDIA établit un record mondial avec Llama 4 Maverick : plus de 1 000 tokens par seconde par utilisateur grâce à Blackwell
La société atteint une vitesse sans précédent dans l’inférence de modèles LLM, combinant optimisation matérielle, logicielle et techniques avancées de décodage spéculatif. NVIDIA a établi un nouveau record en matière de performance pour les modèles de langage de grande échelle (LLM). Un seul nœud NVIDIA DGX B200, équipé de huit GPU Blackwell, a atteint une vitesse de plus de 1 000 tokens par seconde par utilisateur avec le modèle Llama 4 Maverick, le modèle le plus performant de la collection Llama 4, possédant 400 milliards de paramètres. Cette marque a été vérifiée de manière indépendante par le service de benchmarking Artificial Analysis. Cet exploit fait de Blackwell la plateforme matérielle idéale pour exécuter Llama 4, que ce soit pour maximiser




