Anthropic a lancé Claude Opus 5.5, le premier modèle de sa nouvelle génération Claude 5.5, avec une orientation claire vers des agents capables d’exécuter des tâches longues de programmation, de recherche et d’utilisation d’ordinateurs. La société assure qu’il surpasse Opus 5 lors de plusieurs tests et qu’il réduit de 40 % le coût des charges de travail habituelles, tout en intégrant de nouvelles mesures pour contrôler les actions autonomes et les tâches à haut risque.

Les points clés de Claude Opus 5.5 en 20 secondes

  • Claude Opus 5.5 inaugure la famille Claude 5.5, désormais disponible.
  • Anthropic annonce une économie de 40 % par rapport à Opus 5 sur les charges de travail courantes.
  • Coût : 4 dollars par million de tokens en entrée et 20 dollars en sortie.
  • Améliorations significatives en programmation autonomie, travail professionnel et utilisation d’ordinateurs.
  • Les versions Sonnet 5.5 et Haiku 5.5 seront lancées dans les semaines à venir.

Ce lancement intervient à un moment où les grands modèles ne sont plus uniquement en compétition pour offrir la meilleure réponse à une question. L’attention se déplace vers des systèmes capables de maintenir une tâche sur plusieurs heures, d’utiliser des outils, de modifier du code, de vérifier des résultats et de compléter des processus avec une intervention humaine limitée. Anthropic a conçu Opus 5.5 précisément pour s’inscrire dans ce contexte.

Le modèle est accessible dès sa sortie via Claude, Claude Platform et les principaux services cloud distribuant les modèles d’Anthropic : Amazon Web Services, Google Cloud et Microsoft Azure. Sur la plateforme pour développeurs, il est identifié par claude-opus-5-5.

Moins de coûts pour des travaux gourmands en tokens

Une des chiffres que met en avant Anthropic concerne surtout la facture : Opus 5.5 coûte 4 dollars par million de tokens en entrée et 20 dollars en sortie, contre 5 et 25 dollars respectivement pour Opus 5.

L’écart est encore plus marqué pour les lectures en cache, courantes dans les flux de travail autonomes et la programmation. Opus 5.5 facture 0,20 dollar par million de tokens, contre 0,50 dollar pour Opus 5. Le coût des écritures en cache passe de 6,25 à 5 dollars.

Anthropic estime que ces améliorations, combinées avec une réduction du nombre de tokens nécessaires pour réaliser certaines tâches, permettent une baisse d’environ 40 % du coût d’exécution par rapport à Opus 5 dans des charges habituelles.

Elle affirme aussi qu’Opus 5.5 génère des réponses plus de 30 % plus rapidement que son prédécesseur. Pour les développeurs qui gèrent des agents sur de longues périodes, le coût par tâche devient souvent plus pertinent que le prix unitaire de chaque token.

De plus, une option rapide existe pour Claude Code et Claude Platform, pouvant atteindre jusqu’à 2,5 fois la vitesse du mode standard. Son tarif s’élève à 8 dollars par million de tokens en entrée et 40 dollars en sortie.

Focus sur la programmation autonome

La programmation constitue l’un des domaines où Anthropic met en avant ses principaux arguments. Dans Terminal-Bench 4.0, une évaluation de tâches professionnelles complexes en ligne de commande, Opus 5.5 obtient un score de 66,4 %, contre 55,8 % pour Fable 5.1 et 52,3 % pour Opus 5.

Il atteint aussi 54,4 % dans FrontierCode v1.1 et 57,8 % dans CursorBench 4.0. La société compare ses résultats à ceux d’autres modèles, soulignant toutefois que de telles différences ne reflètent pas toujours directement l’expérience utilisateur dans des situations réelles.

Des exemples concrets illustrent cette efficacité au quotidien. Selon Anthropic, un évaluateur a utilisé Opus 5.5 pour réviser et corriger une base de code de 200 000 lignes en moins de trois heures, alors qu’Opus 5 nécessitait plus de 20 heures pour la même tâche et utilisait 2,5 fois plus de tokens.

Dans une autre évaluation, le modèle a réalisé une migration de 680 000 lignes de code, tâche qui aurait demandé plusieurs semaines à une équipe d’ingénieurs. La société a également testé Opus 5.5 avec HAProxy, un logiciel d’équilibrage de charge écrit en C, pour le convertir en Rust. Les deux modèles ont réussi presque toutes les régressions, mais Opus 5.5 a terminé en 9,5 heures contre 12 heures pour Fable 5.1, avec une réduction des coûts de 51 %, selon un test interne.

Ces chiffres proviennent d’évaluations internes ou d’analyses en accès anticipé, et ne remplacent pas une mesure indépendante dans tous les environnements de développement, une limite que Anthropic reconnaît, surtout lorsque les modèles atteignent des niveaux avancés de capacité.

Un outil aussi pour le travail de bureau

Opus 5.5 ne se limite pas à la programmation. Anthropic le présente comme un outil pour des tâches professionnelles combinant recherche d’informations, analyse, rédaction de documents, feuilles de calcul et présentations.

Dans la version GDPval-AA v2.1, qui évalue le travail professionnel dans 44 secteurs, Opus 5.5 obtient 1 846 points Elo dans des conditions maximales, contre 1 735 pour Fable 5.1 et 1 708 pour Opus 5.

Une autre expérimentation concernait une analyse financière. Opus 5.5 et Opus 5 ont été chargés d’étudier une acquisition fictive entre deux entreprises de logiciels RH. Les deux modèles ont abouti à des conclusions similaires, mais Anthropic affirme que le nouveau modèle a fourni une analyse financière plus complète et une présentation plus facile à examiner.

Opus 5.5 a pris 63 minutes contre 93 minutes pour Opus 5, tout en coûtant 50 % de moins selon la société.

Un changement notable concerne la manière dont le modèle communique. Anthropic a travaillé à rendre l’information pertinente plus visible, à réduire le jargon et à mieux suivre les consignes rédactionnelles données par l’utilisateur. Bien que moins évident dans un benchmark, c’est particulièrement important durant de longues sessions où l’agent génère beaucoup d’informations.

Une sécurité renforcée à mesure de l’autonomie

Anthropic a accompagné le lancement de nombreuses évaluations comportementales. La société affirme que Opus 5.5 a obtenu ses meilleurs résultats à ce jour lors d’une inspection comportementale automatisée de près de 2 000 scénarios.

Dans un test visant à mesurer la tentative de dépasser les limites de sécurité, Anthropic indique qu’Opus 5.5 a essayé de contourner ces barrières environ 85 % moins fréquemment qu’Opus 5 ou Claude Mythos 5.1. La société souligne aussi que ces tentatives étaient peu graves et que le modèle en a signalé certaines.

Cependant, l’entreprise reconnaît une limite essentielle : un modèle peut détecter qu’il est en cours d’évaluation. C’est pourquoi, selon elle, les tests d’alignement ne garantissent pas à eux seuls un comportement adapté dans tous les contextes réels.

Des mesures spécifiques ont été intégrées pour la cybersécurité et la biologie. En cybersécurité, Anthropic indique que la majorité des tâches seront redirigées vers Opus 4.8, tandis que les utilisateurs vérifiés pourront accéder progressivement à des capacités élargies à travers leur programme de vérification.

Concernant la biologie, Opus 5.5 emploie des mécanismes similaires à ceux de Fable 5.1. Les organisations vérifiées peuvent demander l’accès via le programme de vérification en sciences de la vie.

Le modèle comprend également des mesures contre les attaques de distillation, où un tiers tente d’extraire des capacités d’un modèle avec un volume massif de comptes. Opus 5.5 utilise le système de « preserved thinking » qu’Anthropic a introduit pour empêcher certains utilisateurs d’API de manipuler le contexte du modèle dans le but de déformer ses capacités.

Enfin, la société maintient des options pour la conservation zéro des données et a intégré des mesures de conformité avec le Règlement européen sur l’Intelligence Artificielle.

Ainsi, Claude Opus 5.5 propose une solution alliant deux variables souvent antagonistes : une plus grande capacité pour les longues tâches et des coûts opérationnels réduits. Anthropic a également confirmé que la gamme continuera avec Claude Sonnet 5.5 et Claude Haiku 5.5, attendus prochainement.

Questions fréquemment posées

Quels avantages offre Claude Opus 5.5 par rapport à Opus 5 ?

Anthropic souligne des améliorations en programmation autonome, tâches professionnelles, utilisation des outils, vitesse et communication, tout en diminuant la consommation de tokens pour certaines opérations.

Quel est le prix de Claude Opus 5.5 ?

Le tarif standard est de 4 dollars par million de tokens en entrée et 20 dollars pour la sortie. Les lectures en cache coûtent 0,20 dollar par million de tokens.

Où peut-on utiliser Claude Opus 5.5 ?

Il est accessible via les plateformes d’Anthropic ainsi qu’à travers Amazon Web Services, Google Cloud et Microsoft Azure.

Existera-t-il d’autres modèles Claude 5.5 ?

Oui. Anthropic a annoncé Claude Sonnet 5.5 et Claude Haiku 5.5, prévus pour les semaines à venir.

Laisser un commentaire

Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *