Anthropic a dévoilé Claude Opus 5 le 24 juillet 2026. Présenté comme une amélioration de niveau « changement de génération » dans la gamme Opus, son positionnement clé est d’offrir une intelligence proche de Fable 5 (modèle frontier) pour la moitié du prix.
Résumé des points clés
- Positionnement : intelligence proche du niveau frontier de Fable 5 pour moitié prix. Désigné comme nouveau modèle par défaut de Claude Max et comme modèle le plus puissant disponible dans Claude Pro.
- Benchmarks : nouveau SOTA sur des évaluations de code et de travail de connaissance comme Frontier-Bench et GDPval-AA. En revanche, il reste derrière Mythos 5 (le modèle le plus avancé d’Anthropic) sur les tâches de cybersécurité.
- Performances en code : meilleure performance tous modèles confondus sur Frontier-Bench v0.1, avec plus du double des performances d’Opus 4.8 à un coût inférieur. Sur le réglage d’efficacité maximal de CursorBench, il arrive à moins de 0,5 % du meilleur score de Fable 5 pour moitié prix.
- Travail de connaissance / résolution de problèmes : sur ARC-AGI 3, score 3 fois supérieur au modèle classé juste derrière ; sur Zapier AutomationBench, taux de réussite environ 1,5 fois supérieur ; sur OSWorld 2.0 (benchmark d’usage informatique), il dépasse le meilleur résultat de Fable 5 pour environ un tiers du coût.
- Recherche scientifique : amélioration par rapport à Opus 4.8 sur toutes les évaluations en sciences de la vie. +10,2 points en chimie organique (inférence de structure moléculaire à partir de données spectrales) et +7,7 points en prédiction séquence-fonction des protéines.
- Style de travail : forte progression de la capacité d’auto-vérification et d’itération. Sont cités comme exemples la reconstruction en code d’un modèle CAD 3D à partir de plans sans information visuelle, ou l’identification et la correction d’une cause racine manquée par un patch communautaire.
- Alignement : évalué comme le modèle le mieux aligné à ce jour dans les audits internes de comportement. Taux de comportements trompeurs plus faible qu’Opus 4.8, Sonnet 5 et Fable 5, et meilleur niveau d’évitement des comportements à risque irréversible.
- Sécurité : en biologie et en cybersécurité offensive, il reste en retrait par rapport à Mythos 5. La « détection » de vulnérabilités est d’un niveau comparable à Mythos 5, mais sa capacité de « développement d’exploits » est nettement plus faible (résultat d’une exclusion volontaire de l’entraînement sur les tâches cyber).
- Garde-fous : environ 85 % moins d’interventions du classificateur cyber que Fable 5. La détection de vulnérabilités dans le code source est autorisée, mais le scanning binaire, les tests d’intrusion et la génération d’exploits sont bloqués. Certaines requêtes liées à la biologie qui étaient bloquées avec Fable 5 sont désormais routées vers Opus 5.
Prix et disponibilité
- Disponible dès aujourd’hui sur toutes les plateformes, avec l’API
claude-opus-5 - Prix : 5 $ / 25 $ par million de tokens en entrée / sortie (identique à Opus 4.8)
- Mode Fast disponible (environ 2,5 fois plus rapide que le mode par défaut, pour un prix multiplié par 2)
- Aucune exigence de conservation des données (pour l’usage standard)
Deux bêtas lancées en même temps
- Changement d’outils en cours de conversation : possibilité de modifier les outils disponibles au milieu d’une conversation sans invalider le cache de prompt
- Fallback automatique : routage automatique des requêtes bloquées par le classificateur de sécurité vers un autre modèle (utilisation du meilleur modèle disponible par défaut au lieu du blocage)
Résumé additionnel GN⁺
Neo a ajouté cette synthèse à partir du texte d’origine
- Une intelligence proche de Fable 5 pour un coût par tâche divisé par deux, avec un rôle de modèle par défaut pour Claude Max et de meilleur modèle pour Claude Pro
- Des résultats au plus haut niveau sur des évaluations de code et de travail de connaissance comme Frontier-Bench et GDPval-AA, et un score ARC-AGI 3 atteignant 3 fois celui du modèle suivant
- La capacité à vérifier elle-même son travail et à itérer jusqu’au succès, jusqu’à construire un pipeline de computer vision, corriger la cause racine d’un bug open source et implémenter un flux de données de marché avec test harness
- 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, soit le même prix qu’Opus 4.8, avec un mode Fast environ 2,5 fois plus rapide facturé 2 fois le prix de base
- Des capacités à double usage dangereuses inférieures à Mythos 5 ; la découverte de vulnérabilités est autorisée, mais les scans binaires, tests d’intrusion et générations d’exploits sont bloqués, avec possibilité d’Opus 4.8 en remplacement automatique pour les requêtes signalées
Performances et efficacité coût
- Claude Opus 5 offre de meilleures performances au même prix qu’Opus 4.8
- le réglage
effortpermet de privilégier l’intelligence ou de choisir une exécution plus rapide et moins chère économisant des tokens - c’est le modèle par défaut de Claude Max et le modèle le plus puissant proposé dans Claude Pro
- le réglage
- Sur Frontier-Bench v0.1, il a dépassé tous les autres modèles et dépasse de plus de 2 fois les performances d’Opus 4.8 pour un coût par tâche plus faible
- il s’agit de résultats internes mesurés en récompense moyenne sur 5 tentatives par tâche, avec le harness mini-SWE-agent et un backend GKE
- pour les requêtes refusées par Opus 5 et Fable 5 en raison du classificateur de sécurité, Opus 4.8 est utilisé comme modèle de remplacement
- Sur CursorBench 3.2 en
max effort, il se situe à moins de 0,5 % du meilleur score de Fable 5, pour un coût par tâche divisé par deux- en
high,xhighetmax effort, il obtient de meilleurs résultats que tous les autres modèles au même niveau de coût
- en
- Il présente aussi une forte efficacité coût sur les évaluations de travail de connaissance et de résolution de problèmes
- sur ARC-AGI 3, son score de résolution de nouveaux problèmes est 3 fois supérieur à celui du modèle suivant
- sur Zapier AutomationBench, son taux de réussite au même coût par tâche est environ 1,5 fois supérieur à celui du modèle suivant, et même au plus bas niveau d’
effortil réussit plus de tâches que tous les autres modèles - sur OSWorld 2.0, il devance tous les autres modèles sur toutes les tranches de coût et dépasse le meilleur résultat de Fable 5 pour un peu plus d’un tiers du coût
Recherche scientifique et résultats visuels
- Il affiche de meilleures performances qu’Opus 4.8 sur toutes les évaluations en sciences de la vie, notamment en biologie structurale, chimie organique et bioinformatique
- sur le benchmark interne de chimie organique consistant à inférer une structure moléculaire à partir de données spectrales, il gagne 10,2 points
- sur la prédiction de l’impact fonctionnel des variations de séquence de protéines, il gagne 7,7 points
- Il peut produire des résultats visuels bien plus solides que les modèles précédents
Vérification du travail et itération autonome
- Sa capacité à vérifier lui-même ses résultats et à itérer prudemment jusqu’au succès a été renforcée
- Sur une tâche FreeCAD de Frontier-Bench, il a écrit son propre pipeline de computer vision pour extraire la forme à partir de pixels bruts et reconstruire une pièce 3D, dans une situation où il ne pouvait pas voir directement le plan de pièce mécanique
- après plusieurs itérations, il a réussi, alors que les modèles concurrents n’y sont pas parvenus même après 5 tentatives dans les mêmes conditions
- Sur un bug réel d’un gestionnaire de paquets open source très utilisé, il a trouvé la cause racine et corrigé jusqu’aux cas limites manqués par le patch de la communauté
- les modèles concurrents n’ont corrigé que les symptômes de surface avant de conclure à tort que le bug était résolu
- Un ingénieur d’une société de trading a construit en une seule session un flux de données de marché pour une nouvelle place d’échange
- les modèles précédents n’avaient pas réussi à terminer le travail, même avec un plan détaillé fourni par l’ingénieur
- faute de flux temps réel pour vérifier, il a créé son propre test harness afin de confirmer que les données de la place d’échange étaient correctement parsées
Évaluations de code et d’agents par les premiers utilisateurs
- Sur FrontierCode 1.1 de Devin, il s’est approché du niveau de Fable pour moitié prix et montre des points forts en debugging difficile et en analyse de cause racine
- Sur CursorBench, il reste légèrement derrière Fable 5 tout en montrant des caractéristiques de comportement proches, avec une intelligence proche de Fable 5 aux vitesses et coûts d’Opus
- Sur Zapier AutomationBench, il a pris la 1re place sans consommer plus de tokens que les précédents modèles Claude
- dans un workbook d’état des comptes, il a exécuté de bout en bout une procédure de rétention en identifiant les clients à risque, en alertant les responsables et en produisant un résumé pour l’équipe de rétention, avec 100 % de réussite
- En analyse génomique, il écarte les facteurs de confusion via des tests statistiques appropriés, croise les résultats avec des méthodes indépendantes et maintient des analyses longues en plusieurs étapes
- Dans les évaluations internes de Lovable, les tâches de code agentique les plus difficiles progressent de 22 % par rapport à Opus 4.7, avec aussi moins de variance entre les exécutions
- Sur la même construction d’application full-stack, il a produit les meilleurs travaux d’animation, de jeu et de 3D de la famille Opus, considérés comme la plus forte amélioration depuis Opus 4.5
- Dans les analyses ouvertes, plus les tâches étaient difficiles et ambiguës, plus le gain par rapport à Opus 4.8 était important ; les réponses sont devenues plus claires et plus concises, et l’efficacité à
high efforts’est aussi améliorée - Pour gérer des environnements de développement, il crée ses propres moniteurs et manipule chaque environnement en ne sollicitant l’humain que sur les points nécessitant un jugement
- Sur le codebase de Fundamental Research Assistant, il réalise des changements à grande échelle en s’adaptant au feedback, et traite dans un seul workflow agentique des travaux habituellement découpés en plusieurs parties
- Dans les évaluations frontend, il ouvre directement les pages en largeur desktop et mobile, puis trouve et corrige les produits cachés sous l’écran mobile et les boutons de paiement hors champ
- Avant de passer un PR, il vérifie les branches, templates et impacts sur les tests, sans se précipiter vers la publication avant validation comme les modèles précédents
- Lors des refontes, il distingue les avantages d’une conception proposée d’un point litigieux unique et suggère un compromis qui corrige les défauts tout en conservant les points forts
- Dans les modifications de code, il produit des diff concis sans code mort et repère mieux les risques subtils propres au codebase, ce qui mène à une adoption sur des charges de production
- Plusieurs cas d’usage et revues de code de la plateforme d’agents intégrés Cosmos doivent être migrés vers Opus 5
- Dans les évaluations de JetBrains, il examine plus en profondeur avant d’écrire du code, détecte les erreurs logiques dès la phase de planification et juge non seulement si une réponse fonctionne, mais aussi si elle est correcte pour les bonnes raisons
- Sur les benchmarks de trading, il obtient les meilleures performances de la famille Opus tout en réduisant les tokens de raisonnement à environ un septième de ceux d’Opus 4.8 et la latence à moins de la moitié
Évaluations en entreprise et métiers spécialisés
- En recherche financière, le raisonnement numérique, le travail sur tableaux et la pensée critique précise progressent par rapport à Opus 4.8
- Dans les évaluations internes de Box, les performances d’analyse de contenus d’entreprise spécialisés sont 8 % supérieures à Opus 4.8
- les workflows d’analyse de données progressent de 11 % et la due diligence de 17 %
- ces tâches ciblent des usages dans les secteurs technologique, médical et public
- Sur des tâches complexes de modélisation financière, la précision moyenne progresse de 9 points sur l’ensemble des niveaux d’
effort, tandis que le nombre de tours de dialogue et d’appels d’outils diminue d’un tiers et que le temps requis baisse de 60 % - Dans les tâches d’agents juridiques, les progrès sont particulièrement visibles en gouvernance d’entreprise et en arbitrage
- une qualité comparable est maintenue avec en moyenne 26 % de tokens en moins que le
max reasoningd’Opus 4.8
- une qualité comparable est maintenue avec en moyenne 26 % de tokens en moins que le
- Dès la première tentative de modification de contrat, il a obtenu le meilleur score parmi les modèles testés, presque 2 fois celui d’Opus 4.8
- les modifications de NDA sont également terminées avec moins de temps et d’itérations, tout en maintenant ou en améliorant la précision
- Sur les tâches longues, sa capacité à créer puis réviser une présentation complète s’améliore, avec de meilleurs résultats en compréhension visuelle, formatage et gestion des erreurs de slides
Alignement et capacités à risque
- Dans les audits automatiques de comportement avant déploiement, Opus 5 affiche le meilleur niveau d’alignement parmi les modèles Anthropic
- il respecte mieux la Constitution de Claude qu’Opus 4.8, Sonnet 5 et Fable 5
- il présente le plus faible taux de comportements trompeurs et la plus faible vulnérabilité aux incitations à l’usage abusif
- il évite aussi le mieux les comportements imprudents susceptibles d’entraîner des effets secondaires difficiles à inverser
- Il ne repousse pas la frontière des capacités dangereuses à double usage et, dans les évaluations menées avec des partenaires publics et privés, il montre des performances inférieures à Mythos 5 aussi bien en recherche biologique qu’en cybersécurité offensive
- une évaluation détaillée est disponible dans la System Card
- Comme Opus 4.8, il n’a pas été entraîné volontairement sur les tâches cyber, mais ses performances dans ce domaine progressent nettement avec l’amélioration générale de ses capacités
- la découverte de vulnérabilités est proche du niveau de Mythos 5
- en revanche, le développement d’exploits pour transformer une vulnérabilité trouvée en menace réelle reste nettement derrière Mythos 5
- Dans l’évaluation OSS-Fuzz, Opus 5 et Mythos 5 ont trouvé des vulnérabilités avec des taux de réussite comparables, mais le score d’Opus 5 en développement d’exploits est bien plus faible
Garde-fous en cybersécurité et biologie
- Les garde-fous sont conçus pour autoriser les usages bénéfiques en cybersécurité et en biologie, et restent proches de ceux d’Opus 4.8 à l’exception de restrictions renforcées sur un sous-ensemble étroit de tâches cyber
- Le classificateur cyber est relativement moins restrictif que celui de Fable 5
- il autorise la découverte de vulnérabilités dans le code source
- il bloque les scans de vulnérabilités basés sur des binaires, les tests d’intrusion et la génération d’exploits, davantage susceptibles d’être liés à des acteurs malveillants
- selon les tests d’Anthropic, il devrait y avoir environ 85 % moins d’interventions du classificateur que sur Fable 5
- Sur Claude.ai, Claude Code et Claude Cowork, les requêtes signalées sont remplacées par Opus 4.8 par défaut, et cela peut aussi être activé dans l’API
- Les entreprises et chercheurs participant au Cyber Verification Program peuvent utiliser immédiatement une version d’Opus 5 avec moins de restrictions de sécurité
- En biologie, il conserve des garde-fous similaires à ceux d’Opus 4.8 tout en devenant le modèle de recherche scientifique le plus puissant parmi les modèles généralement disponibles
- il existe toujours des limites importantes pour la recherche autonome de longue durée, et Mythos 5 reste plus performant sur ce type de tâches biologiques
- les requêtes biologiques bloquées sur Fable 5 sont désormais redirigées vers Opus 5 au lieu d’Opus 4.8
Prix et fonctions pour développeurs
- Il est disponible sur toutes les plateformes et son identifiant de modèle dans l’API Claude est
claude-opus-5- 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, soit le même prix qu’Opus 4.8
- l’accès général ne comporte pas d’exigence de conservation des données, comme pour les précédents modèles Opus
- Le mode Fast fonctionne à environ 2,5 fois la vitesse du mode standard
- sur Claude Platform, il est facturé 2 fois le prix de base ; dans Claude Code, il est fourni via des crédits d’usage
- Avec la bêta changement d’outils en cours de conversation de Claude Platform, Claude peut modifier les outils qu’il utilise au cours d’une conversation sans invalider le cache de prompt
- En activant la bêta fallback automatique de l’API, les requêtes Opus 5 ou Fable 5 signalées par le classificateur de sécurité sont automatiquement transmises à un autre modèle
- au lieu de bloquer la requête, le système la route par défaut vers le meilleur modèle disponible
- La manière d’utiliser le modèle est expliquée dans le guide de prompting d’Opus 5
1 commentaires
Avis sur Hacker News
Le point essentiel ici n’est pas la performance absolue, mais le fait que les organisations peuvent désormais utiliser un modèle de niveau Fable sans obligation de conservation des données pendant 30 jours
Opus 5, comme l’Opus précédent, n’impose pas d’exigence de conservation des données pour l’accès général, et si Fable n’a pas de score ARC-AGI, c’est aussi à cause de cette politique de conservation
https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344
C’est aussi une bonne chose que Fable 5 reste réservé aux crédits, et il est probable qu’à l’avenir les modèles haut de gamme soient de plus en plus placés derrière une API à l’usage ou des crédits, tandis que les autres seront proposés en complément via un abonnement mensuel
Dans ce cas, les informations sont bien stockées quelque part, donc il est difficile de comprendre le mode de conservation des données
Je teste actuellement la conversion image→HTML ; jusque-là, Fable était le meilleur, et Gemini 3.1 Pro arrivait étonnamment en deuxième position
Opus 5 respecte le design d’origine plus fidèlement que Fable, en implémentant les boutons comme des rectangles arrondis plutôt qu’en forme de pilule, et les images générées sont aussi plus proches de l’original
Original : https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
Opus 5 : https://html.non.io/solaraOpus/
Fable 5 : https://html.non.io/solara/
Le comportement responsive était décalé, mais on avait l’impression d’être arrivé à environ 90 % d’un produit fini
Original : https://image.non.io/9d5fed20-b476-49d3-841b-37eb553fb88e.we...
Opus 5 : https://html.non.io/neonRamen/
Inkling n’était pas très bon : https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Kimi 2.7, le prédécesseur du tout récent Kimi3, s’en est très bien sorti : https://cdn-uploads.huggingface.co/production/uploads/608b8b...
Environnement de test : https://huggingface.co/spaces/abidlabs/vlm-screenshot-to-web...
Il serait plus utile de vérifier à quel point le modèle retranscrit bien un design humain sans le dégrader
Vu le nombre de lancements, il n’est pas surprenant que le model routing soit l’un des domaines qui croît le plus vite dans l’IA
Plus de dix entreprises proposent chacune des modèles de formats et de tailles variés, avec différents niveaux de raisonnement, des modes agent·Pro·rapide, exécution standard·flexible·par lots, ainsi que des prix différents pour les tokens d’entrée·sortie·cache
Les entreprises qui envoient les prompts vers la combinaison la plus adaptée et la plus économique captent une grande valeur dans un vide que les développeurs de modèles laissent de côté
C’est une répétition de la Bitter Lesson, et les acteurs de tête finiront sans doute par proposer eux-mêmes cette fonction
La plupart des tâches de bureau n’ont pas besoin d’une AGI surpuissante, donc le trafic se dirige vers des modèles bon marché, mais les laboratoires de pointe se positionnent comme les seuls capables à la fois de produire une AGI puissante et de remplacer les cols blancs
Le routage vers des modèles low cost risque de percer des trous dans ce récit
Pour n’importe quelle tâche, il est difficile d’accepter autre chose que le tout dernier modèle au meilleur niveau, et la seule règle nécessaire est de choisir le modèle le plus puissant parmi ceux dont il reste du quota au forfait
En échange d’un coût moindre, il faut accepter des bugs dont on ne peut mesurer ni la gravité ni la fréquence, et on ne connaît ni la valeur de l’assurance consistant à confier tout le raisonnement au meilleur modèle, ni le coût des corrections ultérieures
Au niveau d’un projet, il n’existe pas non plus de moyen de tester à quel point le code aurait été différent avec d’autres modèles
Si vous n’avez pas envie de lire un PDF d’environ 190 pages, il y a ce billet de blog : https://www.anthropic.com/news/claude-opus-5
Si l’on compare le style d’Opus 5 et de Fable 5, Opus 5 continue d’utiliser, comme 4.8, les tournures typiques de Claude dont Fable s’était éloigné
Des expressions comme “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” reviennent sans cesse, donc il faudrait un benchmark de « l’anglais agaçant »
Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...
Le style typique de Claude semble en partie venir d’une tendance à faire progresser une conversation ou une tâche de manière « proactive », et un benchmark quantifiant l’amplitude stylistique selon le prompt pourrait aussi être utile
Les 55,7 % d’Anthropic et les ~21 % de l’article OSWorld 2.0 correspondaient à des métriques différentes
Opus 4.8 a complètement réussi environ 1 tâche sur 5, avec un taux d’achèvement de 20,6 %, et a obtenu des points partiels sur les autres, pour atteindre un score partiel de 54,8 %
Mais cette différence de métriques fait douter de la possibilité de comparer les benchmarks entre articles dans une marge d’erreur raisonnable : https://arxiv.org/pdf/2606.29537
Les créateurs de benchmarks préfèrent des chiffres bas qui montrent une marge de progression, alors que les créateurs de modèles préfèrent des chiffres élevés qui mettent en avant les capacités, mais les 55,7 % d’Anthropic et les 54,8 % de l’article sont en réalité quasiment le même résultat
Dire qu’« Opus 5 n’est pas globalement meilleur que Fable 5 », puis lister dans le blog qu’il est meilleur sur la plupart des benchmarks, rend la communication confuse
La system card indique aussi qu’il est similaire à Claude Mythos 5, considéré comme Fable sans restriction sur les capacités de R&D en IA
Opus 5 n’ayant pas été entraîné à exploiter des vulnérabilités logicielles, ses capacités de découverte sont proches de celles de Mythos 5, mais ses capacités d’exploitation pour les convertir en menace cyber réelle sont nettement en retrait
Même des modèles qui semblent bien supérieurs à Fable sont sortis sans problème particulier, faute de promotion apocalyptique de la part d’Anthropic
En théorie, selon les critères d’Anthropic, ce devrait être de l’AGI, mais en réalité ce n’est qu’un vendredi ordinaire
Il est dit que ces modèles sont fortement protégés, et que Mythos sans garde-fous n’a donc pas pu être publié
OpenAI avait eu une réaction similaire quand il a annoncé qu’un modèle sans garde-fous avait infiltré les serveurs de HuggingFace
Même si GPT-6 sort cet été, presque plus personne n’en attend désormais une AGI, et je me demande comment ils vont maintenir le cycle de hype
Le cas promotionnel selon lequel Opus 5 a créé en une seule session un flux de données de marché et des outils de validation pour une nouvelle plateforme d’échange est, de façon amusante, un projet qu’on confie souvent à un stagiaire dans une société de trading
Dans le graphique Frontier Code, je me demande pourquoi l’efficacité par tâche du mode de réflexion intermédiaire est de loin la plus élevée, et pourquoi les résultats d’évaluation se dégradent fortement à mesure que la quantité de raisonnement augmente
Il arrive qu’il y ait une légère baisse au niveau maximal, mais à ce point c’est inhabituel : https://imgur.com/a/Nv8V7Ry
Subjectivement, Opus 4.8 Medium aujourd’hui et Opus 5 Medium après l’annonce me semblent plus efficaces dans la tranche des 5 heures d’utilisation que l’Opus 4.8 de la semaine dernière
Cette limite peut apparaître dans un usage centré sur les prompts plutôt qu’en agentique, et il est possible que le niveau intermédiaire soit mieux équilibré
On peut se demander si trop réfléchir est mauvais, mais que réfléchir encore beaucoup plus finit par redevenir bénéfique