Anthropic a présenté Claude Opus 5, un modèle conçu pour occuper une position intermédiaire entre les assistants généralistes et les systèmes de haute capacité réservés aux tâches les plus complexes. La société affirme qu’il peut atteindre des performances proches de celles de Claude Fable 5 en programmation, automatisation et analyse professionnelle, tout en offrant un coût par tâche sensiblement inférieur. Ce nouveau modèle est désormais disponible, devenant la solution la plus avancée de Claude Pro et la configuration par défaut de Claude Max.
Les points clés de Claude Opus 5 en 20 secondes
- Opus 5 s’améliore en programmation, automatisation, analyses scientifiques et utilisation autonome de l’ordinateur.
- Anthropic affirme qu’il se rapproche de Fable 5 avec environ la moitié du coût par tâche dans certains tests.
- L’API maintient le même tarif qu’Opus 4.8 : 5 dollars par million de tokens en entrée et 25 dollars pour la sortie.
- Comparé à GPT-5.6 Sol, il est plus économique pour générer des réponses, bien que chaque modèle excelle dans des évaluations différentes.
La stratégie d’Anthropic est claire. Fable 5 reste la référence pour des projets longs, pouvant durer plusieurs jours, tandis qu’Opus 5 cible les développeurs, analystes et équipes qui doivent régulièrement exécuter des tâches complexes. L’objectif n’est pas seulement de figurer en tête des benchmarks, mais de fournir une capacité suffisante pour utiliser des agents d’IA en production sans que chaque tâche n’épuise le budget alloué aux modèles de pointe.
Un modèle qui contrôle son travail avant de le considérer terminé
La promesse principale de Claude Opus 5 ne se limite pas à une meilleure réponse. Anthropic garantit que le modèle fait preuve d’une plus grande initiative en révisant ses résultats, en détectant ses erreurs et en répétant des étapes lorsque la solution initiale échoue.
L’entreprise fournit plusieurs exemples issus de ses tests et de l’accès anticipé. Lors d’un test Frontier-Bench, Opus 5 a reçu le dessin d’une pièce mécanique devant la reconstruire via FreeCAD. N’ayant pas accès direct à l’image, il a créé un petit système de vision par ordinateur pour extraire la géométrie à partir des pixels, puis généré un modèle tridimensionnel.
Dans une autre évaluation, il a analysé une panne réelle d’un gestionnaire de paquets open source. Selon Anthropic, il ne s’est pas contenté de corriger le symptôme visible, mais a aussi identifié la cause et résolu un cas limite qui avait échappé à une précédente solution. Un ingénieur d’une société financière l’a également utilisé pour construire une source de données de marché ; le modèle a créé son propre environnement de test, n’ayant pas trouvé de connexion active pour valider le code.
Ces exemples sont sélectionnés par Anthropic et ne remplacent pas une évaluation indépendante, mais illustrent parfaitement le changement que la société cherche à promouvoir. Opus 5 vise à être un système capable de maintenir l’objectif sur une tâche prolongée, de manipuler des outils et de vérifier les résultats, pas simplement un chatbot fournissant du code sans tester sa fonctionnalité.
L’amélioration est particulièrement notable en programmation. Anthropic affirme qu’Opus 5 dépasse tous les autres modèles évalués dans Frontier-Bench v0.1, doublant le rendement de l’Opus 4.8 tout en conservant un coût par tâche inférieur. Dans CursorBench 3.2, avec le niveau maximal d’effort, il n’atteint que 0,5 % de la performance maximale de Fable 5, mais à un coût d’environ la moitié de celui du modèle plus coûteux.
Il est possible pour l’utilisateur d’ajuster ce niveau d’effort pour privilégier davantage le raisonnement ou une réponse plus rapide et économique. Cette option est particulièrement pertinente dans un contexte professionnel, où toutes les tâches ne justifient pas l’usage de la configuration la plus exigeante.
Claude Opus 5 face à GPT-5.6 : deux stratégies pour classer la gamme
Anthropic et OpenAI ont convergé sur une idée : un seul modèle ne peut plus efficacement couvrir tout le spectre des tâches. Les deux sociétés ont divisé leurs catalogues en plusieurs niveaux de capacité, rapidité et prix.
Opus 5 se présente comme le modèle avancé pour une utilisation quotidienne chez Anthropic, en dessous de Fable 5 pour les projets longs, et de Mythos 5 dans certains domaines scientifiques ou de cybersécurité. OpenAI propose une structure différente avec la famille GPT-5.6 : Sol pour le haut de gamme, Terra pour un équilibre entre capacité et coût, et Luna pour la vitesse et les coûts réduits.
| Modèle | Position dans la gamme | Prix pour 1 million de tokens | Objectif déclaré |
|---|---|---|---|
| Claude Opus 5 | Modèle performant pour usage quotidien | 5 $ entrée / 25 $ sortie | Code, analyses et agents professionnels |
| Claude Fable 5 | Haut de gamme d’Anthropic | Non précisé dans l’annonce | Projets longs, capacité maximale |
| Claude Mythos 5 | Modèle spécialisé | Accès restreint | Sciences avancées, cybersécurité offensive |
| GPT-5.6 Sol | Modèle phare d’OpenAI | 5 $ entrée / 30 $ sortie | Travail intensif avec agents |
| GPT-5.6 Terra | Option équilibrée | 2,50 $ entrée / 15 $ sortie | Usage professionnel à moindre coût |
| GPT-5.6 Luna | Option rapide et économique | 1 $ entrée / 6 $ sortie | Volume élevé, faible latence |
Les prix standards de OpenAI placent GPT-5.6 Sol à 5 dollars par million de tokens pour l’entrée et 30 dollars pour la sortie. Opus 5 propose un coût d’entrée identique, mais réduit la sortie à 25 dollars. Terra et Luna sont nettement moins chers, bien qu’ils occupent des niveaux différents dans la gamme GPT-5.6.
Cette différence peut paraître insignifiante à chaque consultation, mais elle s’accumule considérablement lorsque l’agent génère de nombreux codes, examine des documents volumineux ou enchaîne plusieurs appels. En réalité, le coût total ne dépend pas uniquement du tarif par token. La nécessité de plusieurs essais, l’utilisation des outils annexes, la longueur du raisonnement ou la fréquence des corrections influent aussi.
C’est précisément là que réside le commerce d’Anthropic : un modèle un peu plus cher par token peut s’avérer plus rentable par travail terminé si l’on requiert moins d’étapes, si le modèle fait moins d’erreurs et si le résultat demande moins de supervision.
Il n’existe pas encore de comparatif indépendant complet permettant d’affirmer que Opus 5 dépasse globalement GPT-5.6. Anthropic met en avant Frontier-Bench, CursorBench, ARC-AGI 3, AutomationBench et OSWorld 2.0, tandis qu’OpenAI publie ses propres tests. Les différences de configuration, d’outils et de niveau de raisonnement rendent toute comparaison directe difficile, comme si les résultats provenaient de tests distincts.
Automatisation, sciences et travail professionnel au-delà du simple code
Anthropic a également orienté Opus 5 vers des tâches en entreprise, combinant raisonnement et outils. Lors de l’évaluation Zapier AutomationBench, qui mesure la capacité à compléter des processus métier entiers, la société assure que son taux de succès est environ 1,5 fois supérieur à celui du second en coût équivalent.
Un exemple fourni est celui d’une analyse de feuille de calcul sur la santé de comptes clients, identifiant ceux à risque, alertant le responsable, puis générant un résumé pour l’équipe de rétention. Selon Anthropic, Opus 5 a réalisé tout le flux alors que des versions antérieures échouaient souvent à le terminer.
L’amélioration est aussi manifeste dans l’analyse financière, la documentation juridique ou la révision de vastes dépôts de données. Chez Box, des tests internes montrent que Opus 5 a surpassé Opus 4.8 d’environ 8 %, avec des augmentations de 11 % en analyse de données et de 17 % en diligence raisonnable. D’autres partenaires soulignent moins d’interruptions, une utilisation plus stable des outils, et moins de passages pour atteindre le même résultat.
Dans le domaine des sciences de la vie, Anthropic indique des avancées par rapport à Opus 4.8 en biologie structurale, chimie organique et bioinformatique : une hausse de 10,2 points en interprétation de spectres chimiques et de 7,7 en modélisation des impacts de mutations sur le fonctionnement des protéines.
Ces résultats sont encourageants, mais à prendre comme des comparaisons internes entre générations de Claude. Anthropic précise qu’Opus 5 ne remplace pas ses systèmes spécialisés les plus avancés, tels que Mythos 5, qui demeure en tête pour la recherche biologique complexe et la cybersécurité offensive.
Une capacité accrue avec des limites spécifiques en cybersécurité
Opus 5 peut analyser du code et repérer des vulnérabilités, mais Anthropic a instauré des restrictions concernant l’analyse de binaires, les tests d’intrusion et la création d’exploits. La société explique que le modèle se rapproche de Mythos 5 pour la détection de failles, mais qu’il reste nettement inférieur pour transformer cette détection en attaque opérationnelle.
Ce choix est volontaire, dans le but d’assurer que Opus 5 soit utile à des équipes de développement et de cybersécurité défensive sans leur donner un accès généralisé aux fonctionnalités les plus sensibles.
Anthropic estime que ses classificateurs de sécurité seront utilisés environ 85 % moins souvent que ceux déployés avec Fable 5, ce qui devrait réduire les blocages sur les tâches légitimes tout en permettant de canaliser des travaux spécialisés via leur programme de vérification dédié à la cybersécurité.
Lors de leur audit préalable, ils ont attribué à Opus 5 une note de 2,3 en comportements indésirables, la plus faible parmi leurs modèles récents. La société indique également qu’il affiche moins de comportements trompeurs ou de tendances à effectuer des actions difficiles à inverser sans vérification préalable.
Le coût par tâche, un enjeu supérieur au seul benchmark fini
Claude Opus 5 est désormais accessible sur les plateformes d’Anthropic et via l’API avec le nom d’utilisateur claude-opus-5. Il conserve le tarif d’Opus 4.8, en proposant également un mode rapide, déclaré par la société 2,5 fois plus rapide, mais deux fois plus cher en tarif de base.
Ce lancement indique une tendance marquante. La compétition entre OpenAI, Anthropic et d’autres laboratories ne dépend plus uniquement des scores lors de tests. Les entreprises doivent surtout connaître le coût réel pour accomplir un travail, le nombre d’erreurs à corriger, et si leur agent peut tenir une tâche pendant des heures sans déviation de l’objectif.
Opus 5 vise à répondre à cette problématique. Il n’est pas le modèle le plus avancé ou le plus économique, mais cherche à offrir une intelligence suffisante pour réaliser chaque jour des tâches difficiles, sans recourir systématiquement au modèle le plus coûteux.
Questions fréquentes
Qu’est-ce que Claude Opus 5 ?
Un modèle d’Anthropic destiné à la programmation, à l’analyse professionnelle, à l’automatisation et aux agents capables d’accomplir des tâches multi-étapes.
Claude Opus 5 est-il moins cher que GPT-5.6 Sol ?
Les deux coûtent 5 dollars par million de tokens en entrée. Opus 5 facture 25 dollars pour la sortie, contre 30 dollars pour GPT-5.6 Sol dans la tarification standard officielle.
Opus 5 remplace-t-il Claude Fable 5 ?
Non. Fable 5 reste l’option de référence pour les projets longs et exigeants. Opus 5 vise à atteindre ses performances avec un coût inférieur pour les tâches courantes.
Où peut-on accéder à Claude Opus 5 ?
Sur Claude.ai, Claude Code, Claude Cowork, ainsi que via l’API. C’est le modèle le plus puissant de Claude Pro et la configuration par défaut de Claude Max.