IdentifiantMot de passe
Loading...
Mot de passe oublié ?Je m'inscris ! (gratuit)

Vous êtes nouveau sur Developpez.com ? Créez votre compte ou connectez-vous afin de pouvoir participer !

Vous devez avoir un compte Developpez.com et être connecté pour pouvoir participer aux discussions.

Vous n'avez pas encore de compte Developpez.com ? Créez-en un en quelques instants, c'est entièrement gratuit !

Si vous disposez déjà d'un compte et qu'il est bien activé, connectez-vous à l'aide du formulaire ci-dessous.

Identifiez-vous
Identifiant
Mot de passe
Mot de passe oublié ?
Créer un compte

L'inscription est gratuite et ne vous prendra que quelques instants !

Je m'inscris !

Anthropic lance Claude Opus 5.5, offrant des performances comparables à Claude Fable 5.1 et un coût d'exploitation inférieur de 40 % à Opus 5 pour les charges de travail types

Le , par Eliora

289PARTAGES

4  0 
Anthropic a lancé Claude Opus 5.5, le premier modèle de sa nouvelle gamme Claude 5.5, dont le principal changement réside dans le coût. L'entreprise affirme que ce nouveau modèle d'IA offre des performances équivalentes à celles de Claude Fable 5.1 pour la plupart des tâches, tout en coûtant 40 % moins cher à l'utilisation qu'Opus 5. Il génère également des résultats plus de 30 % plus rapidement que son prédécesseur. Opus 5.5 a été testé avant son lancement par des évaluateurs externes, notamment METR et Frontier Design. Le modèle est désormais disponible sur la plateforme Claude, ainsi que sur Amazon Web Services, Google Cloud et Microsoft Azure.

Anthropic, PBC (stylisé ANTHROP\C) est une société d'intérêt public américaine spécialisée dans l'intelligence artificielle (IA), dont le siège social est situé à San Francisco, en Californie. Son produit phare est Claude, une série de grands modèles de langage (LLM) propriétaires. En janvier 2021, dans le but de promouvoir la sécurité de l'IA, Anthropic a été fondée par d'anciens membres d'OpenAI, notamment les frère et sœur Daniela Amodei et Dario Amodei, qui en sont respectivement la présidente et le PDG. La société est privée, mais envisagerait une introduction en bourse en 2026.

Anthropic a lancé Claude Opus 5.5, le premier modèle de sa nouvelle gamme Claude 5.5, dont le principal changement réside dans le coût. L'entreprise affirme que ce nouveau modèle d'IA offre des performances équivalentes à celles de Claude Fable 5.1 pour la plupart des tâches, tout en coûtant 40 % moins cher à l'utilisation qu'Opus 5. Il génère également des résultats plus de 30 % plus rapidement que son prédécesseur.

Il s'agit de la première version publiée par Anthropic depuis qu'elle a appelé à modérer la course à l'IA ; les fonctionnalités de sécurité sont donc tout aussi prioritaires que les performances. Opus 5.5 a été testé avant son lancement par des évaluateurs externes, notamment METR et Frontier Design. Anthropic indique qu’il a obtenu le meilleur score de tous les modèles lors de son audit comportemental automatisé, qui simule près de 2 000 scénarios. Le modèle est désormais disponible sur la plateforme Claude sous le nom « claude-opus-5-5 », ainsi que sur Amazon Web Services, Google Cloud et Microsoft Azure.

Le prix de Claude Opus 5.5 est inférieur à celui d’Opus 5 pour chaque token

Les jetons d'entrée coûtent 4 $ par million et les jetons de sortie 20 $, soit une baisse de 20 % par rapport à Opus 5. Les lectures de cache, qui, selon Anthropic, représentent la majeure partie des coûts liés aux tâches d'agentique et de codage, baissent de 60 % pour s'établir à 0,20 $ par million. Opus 5.5 utilise également moins de jetons par tâche, ce qui explique l'économie globale de 40 %. Les abonnés en bénéficient également. Anthropic lève les limites d’utilisation de cinq heures sur les formules Pro, Max, Team et Enterprise (basées sur le nombre de postes). Les utilisateurs bénéficient également d’une réinitialisation de la limite de débit qu’ils peuvent enregistrer et utiliser quand ils le souhaitent.


Opus 5.5 arrive en tête des tests de performance en matière de codage et de travail intellectuel

Sur Terminal-Bench 4.0, Opus 5.5 a obtenu un score de 66,4 %, devançant Fable 5.1 (55,8 %) et GPT-6 Astra d’OpenAI (57,9 %). Sur GDPval-AA v2.1, qui teste des tâches réelles dans 44 métiers, il a affiché un score Elo de 1 846 contre 1 708 pour Opus 5. Anthropic a également partagé les résultats obtenus sur des charges de travail réelles. L’un des premiers testeurs a réalisé la migration de 680 000 lignes de code en moins d’une journée. Lors d’un test interne, Opus 5.5 et Fable 5.1 ont tous deux réécrit HAProxy, un équilibreur de charge largement utilisé, en passant du C à Rust. Opus 5.5 a terminé en 9,5 heures contre 12, pour un coût inférieur de 51 %. L’entreprise affirme également que le modèle rédige de manière plus claire. Il place les informations clés en premier et évite le jargon, ce qui répond à une critique courante à l’encontre d’Opus 5.

Anthropic ajoute des mesures de sécurité de niveau « Fable » pour la biologie et la cybersécurité

Opus 5.5 est équivalent à Claude Mythos 5.1 en matière de biologie et de cybersécurité ; il intègre donc des mesures de sécurité similaires à celles de Fable 5.1. Les développeurs peuvent toujours détecter et corriger les bogues dans leur propre code, mais la plupart des tâches liées à la cybersécurité seront redirigées vers Opus 4.8. Les laboratoires, start-ups et laboratoires pharmaceutiques agréés peuvent postuler à un nouveau programme de vérification dédié aux sciences de la vie. Les professionnels de la sécurité certifiés y auront accès dans les semaines à venir via un programme de vérification cybernétique élargi.

Anthropic reconnaît certaines limites. L’entreprise indique qu’Opus 5.5 soupçonne souvent qu’il est en train d’être évalué, ce qui rend son comportement en situation réelle plus difficile à prévoir. C’est pour cette raison que l’entreprise associe son travail d’alignement à ces mesures de sécurité. Claude Sonnet 5.5 et Claude Haiku 5.5 devraient sortir dans les semaines à venir. Pour l’instant, l’Opus d’Anthropic le moins cher de cette génération est également celui qu’elle considère comme le plus sûr, même si ses propres tests ne permettent peut-être pas de tout détecter.

En juillet 2026, Anthropic a déclaré que son modèle d’IA Claude avait piraté les systèmes de trois entreprises lors de tests, après qu’une erreur de configuration lui eut donné accès à Internet. Anthropic a précisé que ces incidents concernaient trois modèles distincts : Claude Opus 4.7, Claude Mythos 5 et un modèle de recherche interne. Deux de ces organisations n’avaient pas eu connaissance de cette activité avant d’être contactées, a précisé Anthropic, en ajoutant qu’elle tentait toujours de joindre la troisième. La société a indiqué avoir identifié ces incidents après avoir examiné 141 006 sessions de test, un processus qu’elle avait lancé à la suite de la révélation par OpenAI qu’un agent autonome alimenté par ses modèles d’IA était devenu incontrôlable lors d’un test de sécurité et avait déclenché un piratage qui avait compromis l’infrastructure de Hugging Face.

Voici la publication d'Anthropic sur Claude Opus 5.5 :

Claude Opus 5.5

Nous vous présentons Claude Opus 5.5, le premier modèle de notre nouvelle gamme Claude 5.5. Il offre des performances équivalentes à celles de Claude Fable 5.1 pour la plupart des tâches et son coût d'exploitation est inférieur de 40 % à celui d'Opus 5. Claude Opus 5.5 est notre première version depuis que nous avons appelé à « modérer la course vers la frontière ». Elle a été testée avant sa sortie par des évaluateurs externes, notamment Frontier Design et METR. Lors de notre audit comportemental automatisé, le test d’alignement le plus complet que nous menons, Opus 5.5 s’est révélé être le modèle le plus performant que nous ayons testé à ce jour. Il intègre également les mesures de sécurité que nous avons développées pour nos modèles les plus puissants.

Voici quelques-unes des améliorations que vous pouvez attendre d’Opus 5.5 :

Performances. Opus 5.5 représente une avancée majeure par rapport à Opus 5. Il s’agit du nouveau modèle de référence, et les premiers testeurs ont constaté des gains de performances considérables sur leurs tâches les plus complexes. L’un d’entre eux a mené à bien la migration de 680 000 lignes de code en moins d’une journée — un travail qui aurait pris plusieurs semaines à une équipe d’ingénieurs.

Il excelle dans la détection et la correction des inefficacités logicielles : lorsque nous lui avons demandé de réduire les temps de chargement sur toutes les pages d’une application web, Opus 5.5 a réussi 39 fois sur 40, tandis qu’Opus 5 n’apportait que des améliorations mineures qui modifiaient également le comportement de l’application. Un autre testeur a demandé à plusieurs modèles Claude de créer un jeu à partir d’une seule consigne ; Opus 5.5 a obtenu un score supérieur à celui de tous les autres modèles grâce à la qualité de ses graphismes et à son niveau de finition.

Sécurité. Opus 5.5 obtient les meilleurs résultats jamais enregistrés par un modèle à ce jour lors de notre audit comportemental automatisé, notre suite d’alignement qui teste Claude à travers des milliers de scénarios simulés. Il est bien moins susceptible que les modèles récents de prendre des mesures difficiles à annuler ou d’agir en dehors des limites qui lui ont été fixées, et il est plus résistant qu’Opus 5 à l’injection de prompts. Nous avons également élargi nos tests d’alignement pour couvrir des tâches plus longues, des tâches impossibles et des scénarios inspirés d’incidents réels, bien qu’il y ait encore des limites. Tous les détails de notre évaluation sont disponibles dans la fiche technique d’Opus 5.5.

Opus 5.5 étant comparable à Claude Mythos 5.1 en matière de biologie et de cybersécurité, nous le déployons avec des mesures de sécurité similaires à celles en place pour Claude Fable 5.1. Les organisations agréées peuvent dès aujourd’hui postuler à notre programme de vérification en sciences de la vie afin d’utiliser Opus 5.5 pour la recherche en biologie. Dans les semaines à venir, nous élargirons également l’accès à notre programme de vérification en cybersécurité, et les professionnels de la cybersécurité certifiés pourront utiliser Opus 5.5 dans le cadre de leur travail.

Coût et vitesse. Opus 5.5 nécessite moins de ressources de calcul pour fonctionner qu’Opus 5, ce qui se reflète dans sa tarification. Nos tests montrent qu’avec les paramètres par défaut, il coûtera 40 % moins cher qu’Opus 5 pour des charges de travail typiques. Les jetons d’entrée et de sortie coûtent respectivement 4 $ et 20 $ par million, soit 20 % de moins qu’avec Opus 5.

Les lectures en cache (qui représentent la majeure partie des coûts liés aux tâches d’agent et de codage) coûtent 0,20 $ par million de jetons, soit 60 % de moins qu’avec Opus 5. Opus 5.5 génère également des résultats plus de 30 % plus rapidement qu’Opus 5. Outre cette baisse de prix, nous augmentons la limite d’utilisation de cinq heures pour les formules Pro, Max, Team et Enterprise (basées sur le nombre de postes). Nous offrons également aux abonnés une réinitialisation de la limite de requêtes, que vous pouvez désormais enregistrer et utiliser quand vous le souhaitez.

Communication. Opus 5.5 communique de manière plus naturelle que les versions précédentes. Les premiers testeurs ont trouvé son style d’écriture plus clair et plus facile à suivre, ce qui répond à certains des commentaires récurrents que nous avions reçus au sujet d’Opus 5. Il met en avant les informations les plus importantes, et son style en fait un meilleur partenaire de travail lors de longues sessions. Comme l’a dit l’un des premiers testeurs : « Il écrit comme moi. » D’après notre propre expérience, cela rend le travail d’Opus 5.5 plus facile à suivre et à vérifier, ce qui constitue un avantage tant en termes de sécurité que de praticité. Claude Sonnet 5.5 et Claude Haiku 5.5 suivront dans les semaines à venir, avec bon nombre des mêmes améliorations en matière de performances, d’efficacité et de sécurité.

Performances et rapport coût-efficacité

D’après nos tests comparatifs, Claude Opus 5.5 se distingue dans les domaines du codage agentique, de l’utilisation de l’ordinateur et du travail intellectuel. Cela dit, à ces niveaux de capacité, nous avons constaté que les écarts observés lors des tests comparatifs ne reflètent plus de manière fiable les différences observées dans la pratique. D’après notre propre expérience, l’écart entre Opus 5.5 et Claude Fable 5.1 est plus faible que ne le laissent supposer ces scores. C’est en matière d’efficacité que l’Opus 5.5 présente un avantage indéniable. Son coût par jeton est inférieur à celui de l’Opus 5 et il utilise moins de jetons par tâche, ce qui se traduit par une baisse des coûts de 40 %.


Tarifs


Le mode rapide pour Opus 5.5 est également disponible dans Claude Code et sur la plateforme Claude, avec une vitesse pouvant atteindre 2,5 fois la vitesse normale. Son coût est de 8 $ par million de jetons d'entrée et de 40 $ par million de jetons de sortie.

Codage

Opus 5.5 excelle particulièrement dans les tâches longues et complexes, telles que les migrations et les audits à l’échelle d’une base de code. Un des premiers testeurs s’en est servi pour auditer et corriger une base de code de 200 000 lignes en moins de trois heures, alors qu’Opus 5 avait mis plus de 20 heures et utilisé 2,5 fois plus de tokens. Lors d’un test interne, nous avons demandé à Opus 5.5 et à Fable 5.1 de traduire HAProxy, un logiciel largement utilisé qui répartit la charge du trafic web entre les serveurs, du C vers Rust.

Les deux réécritures ont réussi la quasi-totalité des tests de régression propres à HAProxy, mais Opus 5.5 a terminé en 9,5 heures contre 12 pour Fable 5.1, pour un coût inférieur de 51 %. Opus 5.5 offre des résultats de pointe en matière de codage agentique pour un coût nettement inférieur. À son niveau d’effort par défaut sur FrontierCode, il surpasse GPT-6 Astra pour environ 20 % du coût par tâche. Sur Terminal Bench 4.0, il égale Astra pour environ 40 % du coût, tandis que sur CursorBench, il devance GPT-5.6 Sol de 11 points pour environ un tiers du coût.






L’agent de codage le plus sécurisé

Les entreprises qui utilisent des agents au sein de leurs systèmes doivent s’assurer que ceux-ci fonctionnent comme prévu, en particulier lorsqu’ils s’exécutent de manière autonome pendant de nombreuses heures. Opus 5.5 intègre un classificateur qui filtre chaque action avant son exécution, un bac à sable open source que les équipes de sécurité peuvent auditer, ainsi qu’un système de révision du code qui détecte les vulnérabilités avant leur intégration.

Le modèle lui-même dispose également de défenses plus solides. Face aux attaques par injection de prompt, il égale ou surpasse Opus 5 dans tous les contextes que nous avons testés, notamment le codage, l’utilisation d’outils, l’utilisation d’ordinateurs et la navigation sur le Web. Lors d’un test de performance réalisé par la société de sécurité spécialisée dans l’IA Gray Swan, Opus 5.5 se classe à égalité avec Fable 5.1 pour le taux de réussite d’injection de prompt le plus bas parmi tous les modèles testés.

Travail intellectuel

Opus 5.5 est un outil de recherche fiable et performant. Lors d’un test interne, nous avons demandé à Opus 5.5, à Fable 5.1 et à Opus 5 de rédiger un rapport sur les résultats trimestriels d’une entreprise en utilisant uniquement les informations disponibles sur une version du Web où le communiqué de presse sur les résultats était difficile à trouver. Un système de notation automatisé a vérifié chaque chiffre et chaque citation par rapport aux sources. Quel que soit le niveau d’effort défini, 16 des 18 rapports d’Opus 5.5 ont franchi notre seuil de qualité, qui aurait été infranchissable en cas de chiffres ou de citations inventés. Ni Fable 5.1 ni Opus 5 n’ont franchi ce seuil lors d’aucune de leurs tentatives.

Il excelle également dans l’analyse financière et les tâches commerciales. Walleye Capital, une société d’investissement qui a participé aux premiers tests, a indiqué qu’Opus 5.5 avait largement résolu sa suite d’évaluation à son niveau de difficulté le plus bas ; à des niveaux plus élevés, il a obtenu des résultats encore meilleurs, en repérant une erreur dans leurs instructions d’évaluation et en la corrigeant. Aucun autre modèle n’avait détecté cette erreur auparavant.

Lors d’un autre test, nous avons chargé Opus 5.5 et Opus 5 d’analyser un projet de fusion entre deux sociétés fictives de logiciels RH. Chacun a élaboré un modèle financier sous Excel, puis l’a transformé en une présentation destinée à la direction afin de déterminer si l’opération était justifiée au prix proposé. Les deux modèles sont parvenus aux mêmes conclusions concernant l’opération, mais le modèle d’Opus 5.5 était plus complet et sa présentation plus facile à lire, tandis que celui d’Opus 5 comportait des erreurs mineures. Opus 5.5 a terminé en 63 minutes contre 93 pour Opus 5, et sa production a coûté 50 % moins cher.

En matière d’évaluation des tâches intellectuelles, Opus 5.5 surpasse les autres modèles tout en utilisant moins de tokens. Sur GDPval-AA v2.1, un test simulant des tâches réelles dans 44 métiers, Opus 5.5 obtient un score Elo de 1 846, devançant ainsi Fable 5.1 et Opus 5. Avec un niveau d’effort par défaut (moyen), Opus 5.5 surpasse GPT-6 Astra fonctionnant à plein régime, pour un coût par tâche environ cinq fois inférieur. Il a également surpassé les autres modèles lors de tests de performance mesurant les flux de travail en entreprise et la collecte de données à grande échelle.






Communication

Nous avons apporté des améliorations majeures à la manière dont Opus 5.5 rédige et communique, l’un des points les plus fréquemment soulevés dans les retours que nous avons reçus concernant Opus 5. Ses messages sont désormais beaucoup plus faciles à comprendre d’un seul coup d’œil, ce qui, selon les testeurs, s’est avéré utile lors de longues sessions de travail. Il met en avant les informations les plus importantes, utilise moins de jargon ou d’expressions particulières, et respecte les règles de rédaction que vous lui imposez. Nous constatons que cela fait d’Opus 5.5 un collaborateur nettement plus performant. Voici une comparaison côte à côte des deux modèles :




Sécurité

  • Gérer le rythme des avancées

    La semaine dernière, notre PDG, Dario Amodei, a fait valoir que les progrès de l’IA devaient être modérés afin que les pratiques de sécurité gardent une longueur d’avance sur les capacités des modèles. Cette gestion du rythme est une approche visant à garantir la sécurité de l’IA, à rester compétitifs face à la Chine et à tirer parti des avantages de l’IA, en particulier dans des domaines tels que la biologie et la médecine. Nous comprenons globalement les risques que présentent les modèles actuels et sommes bien équipés pour les gérer. Cependant, des risques plus graves pourraient apparaître rapidement à mesure que les capacités s’améliorent, et nous devons nous y préparer dès maintenant. C’est pourquoi notre travail en matière de sécurité s’inscrit simultanément sur deux horizons temporels :

    Les pratiques de sécurité pour les modèles actuels. La génération actuelle de modèles s’appuie sur un ensemble de pratiques bien établies : des tests d’alignement approfondis, une évaluation préalable à la mise en service par des organismes externes tels que METR et Frontier Design, ainsi que des mesures de protection adaptées aux capacités de chaque modèle dans des domaines à haut risque comme la cybersécurité et la biologie. Nous affinons ces pratiques à chaque nouvelle version.

    Nous estimons qu’elles sont adaptées aux risques les plus graves que présentent les modèles actuels et qu’elles nous donnent une vision globale, bien qu’imparfaite, de l’éventail des risques graves. De plus, nous suivons notre capacité à entraîner et à évaluer des modèles alignés, et nous rendons compte à la fois de nos modèles publics et internes dans les rapports sur les risques que nous publions dans le cadre de notre « Responsible Scaling Policy », notre cadre volontaire de gestion des risques catastrophiques liés aux systèmes d’IA avancés.

    Préparation aux futurs modèles. Nous préparons nos processus d’entraînement et d’évaluation en prévision de modèles plus avancés. Nous renforçons nos critères de filtrage des environnements utilisés dans l’apprentissage par renforcement, car des environnements défectueux constituent une source majeure de comportements non alignés. De plus, nous améliorons nos récompenses d’alignement et développons des processus automatisés pour générer de nouveaux scénarios variés destinés à l’entraînement à la sécurité.

    Nous renforçons également notre sécurité et notre surveillance, notamment en concentrant nos efforts sur l’amélioration de la surveillance et de l’évaluation basées sur l’interprétabilité. Nous espérons que ces techniques contribueront à réduire notre dépendance à l’égard de l’audit de la chaîne de pensée d’un modèle, c’est-à-dire du raisonnement qu’il expose au fur et à mesure de son fonctionnement. Les modèles dotés de capacités plus avancées — tels que ceux capables d’automatiser entièrement le travail de recherche en IA lui-même — exigent une norme de sécurité encore plus élevée. Nos appels à la prudence reposaient en grande partie sur notre conviction que de tels modèles pourraient bientôt être entraînés.

    Pour ces modèles, nous ne partons pas du principe que les mesures décrites ci-dessus suffiront à elles seules à respecter cette norme de sécurité. À mesure que l’IA gagne en capacités, les politiques publiques devraient jouer un rôle plus important pour garantir la sécurité des systèmes sur lesquels les gens comptent. La mise en place de cette capacité prend du temps, et nous avons commencé à mettre en place l’infrastructure...
La fin de cet article est réservée aux abonnés. Soutenez le Club Developpez.com en prenant un abonnement pour que nous puissions continuer à vous proposer des publications.

Une erreur dans cette actualité ? Signalez-nous-la !