5 points par dunward 4 시간 전 | 1 commentaires | Partager sur WhatsApp

Anthropic a dévoilé Claude Opus 5 le 24 juillet 2026. Présenté comme une amélioration de niveau « changement de génération » dans la gamme Opus, son positionnement clé est d’offrir une intelligence proche de Fable 5 (modèle frontier) pour la moitié du prix.

Résumé des points clés

  • Positionnement : intelligence proche du niveau frontier de Fable 5 pour moitié prix. Désigné comme nouveau modèle par défaut de Claude Max et comme modèle le plus puissant disponible dans Claude Pro.
  • Benchmarks : nouveau SOTA sur des évaluations de code et de travail de connaissance comme Frontier-Bench et GDPval-AA. En revanche, il reste derrière Mythos 5 (le modèle le plus avancé d’Anthropic) sur les tâches de cybersécurité.
  • Performances en code : meilleure performance tous modèles confondus sur Frontier-Bench v0.1, avec plus du double des performances d’Opus 4.8 à un coût inférieur. Sur le réglage d’efficacité maximal de CursorBench, il arrive à moins de 0,5 % du meilleur score de Fable 5 pour moitié prix.
  • Travail de connaissance / résolution de problèmes : sur ARC-AGI 3, score 3 fois supérieur au modèle classé juste derrière ; sur Zapier AutomationBench, taux de réussite environ 1,5 fois supérieur ; sur OSWorld 2.0 (benchmark d’usage informatique), il dépasse le meilleur résultat de Fable 5 pour environ un tiers du coût.
  • Recherche scientifique : amélioration par rapport à Opus 4.8 sur toutes les évaluations en sciences de la vie. +10,2 points en chimie organique (inférence de structure moléculaire à partir de données spectrales) et +7,7 points en prédiction séquence-fonction des protéines.
  • Style de travail : forte progression de la capacité d’auto-vérification et d’itération. Sont cités comme exemples la reconstruction en code d’un modèle CAD 3D à partir de plans sans information visuelle, ou l’identification et la correction d’une cause racine manquée par un patch communautaire.
  • Alignement : évalué comme le modèle le mieux aligné à ce jour dans les audits internes de comportement. Taux de comportements trompeurs plus faible qu’Opus 4.8, Sonnet 5 et Fable 5, et meilleur niveau d’évitement des comportements à risque irréversible.
  • Sécurité : en biologie et en cybersécurité offensive, il reste en retrait par rapport à Mythos 5. La « détection » de vulnérabilités est d’un niveau comparable à Mythos 5, mais sa capacité de « développement d’exploits » est nettement plus faible (résultat d’une exclusion volontaire de l’entraînement sur les tâches cyber).
  • Garde-fous : environ 85 % moins d’interventions du classificateur cyber que Fable 5. La détection de vulnérabilités dans le code source est autorisée, mais le scanning binaire, les tests d’intrusion et la génération d’exploits sont bloqués. Certaines requêtes liées à la biologie qui étaient bloquées avec Fable 5 sont désormais routées vers Opus 5.

Prix et disponibilité

  • Disponible dès aujourd’hui sur toutes les plateformes, avec l’API claude-opus-5
  • Prix : 5 $ / 25 $ par million de tokens en entrée / sortie (identique à Opus 4.8)
  • Mode Fast disponible (environ 2,5 fois plus rapide que le mode par défaut, pour un prix multiplié par 2)
  • Aucune exigence de conservation des données (pour l’usage standard)

Deux bêtas lancées en même temps

  • Changement d’outils en cours de conversation : possibilité de modifier les outils disponibles au milieu d’une conversation sans invalider le cache de prompt
  • Fallback automatique : routage automatique des requêtes bloquées par le classificateur de sécurité vers un autre modèle (utilisation du meilleur modèle disponible par défaut au lieu du blocage)

Résumé additionnel GN⁺

Neo a ajouté cette synthèse à partir du texte d’origine

  • Une intelligence proche de Fable 5 pour un coût par tâche divisé par deux, avec un rôle de modèle par défaut pour Claude Max et de meilleur modèle pour Claude Pro
  • Des résultats au plus haut niveau sur des évaluations de code et de travail de connaissance comme Frontier-Bench et GDPval-AA, et un score ARC-AGI 3 atteignant 3 fois celui du modèle suivant
  • La capacité à vérifier elle-même son travail et à itérer jusqu’au succès, jusqu’à construire un pipeline de computer vision, corriger la cause racine d’un bug open source et implémenter un flux de données de marché avec test harness
  • 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, soit le même prix qu’Opus 4.8, avec un mode Fast environ 2,5 fois plus rapide facturé 2 fois le prix de base
  • Des capacités à double usage dangereuses inférieures à Mythos 5 ; la découverte de vulnérabilités est autorisée, mais les scans binaires, tests d’intrusion et générations d’exploits sont bloqués, avec possibilité d’Opus 4.8 en remplacement automatique pour les requêtes signalées

Performances et efficacité coût

  • Claude Opus 5 offre de meilleures performances au même prix qu’Opus 4.8
    • le réglage effort permet de privilégier l’intelligence ou de choisir une exécution plus rapide et moins chère économisant des tokens
    • c’est le modèle par défaut de Claude Max et le modèle le plus puissant proposé dans Claude Pro
  • Sur Frontier-Bench v0.1, il a dépassé tous les autres modèles et dépasse de plus de 2 fois les performances d’Opus 4.8 pour un coût par tâche plus faible
    • il s’agit de résultats internes mesurés en récompense moyenne sur 5 tentatives par tâche, avec le harness mini-SWE-agent et un backend GKE
    • pour les requêtes refusées par Opus 5 et Fable 5 en raison du classificateur de sécurité, Opus 4.8 est utilisé comme modèle de remplacement
  • Sur CursorBench 3.2 en max effort, il se situe à moins de 0,5 % du meilleur score de Fable 5, pour un coût par tâche divisé par deux
    • en high, xhigh et max effort, il obtient de meilleurs résultats que tous les autres modèles au même niveau de coût
  • Il présente aussi une forte efficacité coût sur les évaluations de travail de connaissance et de résolution de problèmes
    • sur ARC-AGI 3, son score de résolution de nouveaux problèmes est 3 fois supérieur à celui du modèle suivant
    • sur Zapier AutomationBench, son taux de réussite au même coût par tâche est environ 1,5 fois supérieur à celui du modèle suivant, et même au plus bas niveau d’effort il réussit plus de tâches que tous les autres modèles
    • sur OSWorld 2.0, il devance tous les autres modèles sur toutes les tranches de coût et dépasse le meilleur résultat de Fable 5 pour un peu plus d’un tiers du coût

Recherche scientifique et résultats visuels

  • Il affiche de meilleures performances qu’Opus 4.8 sur toutes les évaluations en sciences de la vie, notamment en biologie structurale, chimie organique et bioinformatique
    • sur le benchmark interne de chimie organique consistant à inférer une structure moléculaire à partir de données spectrales, il gagne 10,2 points
    • sur la prédiction de l’impact fonctionnel des variations de séquence de protéines, il gagne 7,7 points
  • Il peut produire des résultats visuels bien plus solides que les modèles précédents

Vérification du travail et itération autonome

  • Sa capacité à vérifier lui-même ses résultats et à itérer prudemment jusqu’au succès a été renforcée
  • Sur une tâche FreeCAD de Frontier-Bench, il a écrit son propre pipeline de computer vision pour extraire la forme à partir de pixels bruts et reconstruire une pièce 3D, dans une situation où il ne pouvait pas voir directement le plan de pièce mécanique
    • après plusieurs itérations, il a réussi, alors que les modèles concurrents n’y sont pas parvenus même après 5 tentatives dans les mêmes conditions
  • Sur un bug réel d’un gestionnaire de paquets open source très utilisé, il a trouvé la cause racine et corrigé jusqu’aux cas limites manqués par le patch de la communauté
    • les modèles concurrents n’ont corrigé que les symptômes de surface avant de conclure à tort que le bug était résolu
  • Un ingénieur d’une société de trading a construit en une seule session un flux de données de marché pour une nouvelle place d’échange
    • les modèles précédents n’avaient pas réussi à terminer le travail, même avec un plan détaillé fourni par l’ingénieur
    • faute de flux temps réel pour vérifier, il a créé son propre test harness afin de confirmer que les données de la place d’échange étaient correctement parsées

Évaluations de code et d’agents par les premiers utilisateurs

  • Sur FrontierCode 1.1 de Devin, il s’est approché du niveau de Fable pour moitié prix et montre des points forts en debugging difficile et en analyse de cause racine
  • Sur CursorBench, il reste légèrement derrière Fable 5 tout en montrant des caractéristiques de comportement proches, avec une intelligence proche de Fable 5 aux vitesses et coûts d’Opus
  • Sur Zapier AutomationBench, il a pris la 1re place sans consommer plus de tokens que les précédents modèles Claude
    • dans un workbook d’état des comptes, il a exécuté de bout en bout une procédure de rétention en identifiant les clients à risque, en alertant les responsables et en produisant un résumé pour l’équipe de rétention, avec 100 % de réussite
  • En analyse génomique, il écarte les facteurs de confusion via des tests statistiques appropriés, croise les résultats avec des méthodes indépendantes et maintient des analyses longues en plusieurs étapes
  • Dans les évaluations internes de Lovable, les tâches de code agentique les plus difficiles progressent de 22 % par rapport à Opus 4.7, avec aussi moins de variance entre les exécutions
  • Sur la même construction d’application full-stack, il a produit les meilleurs travaux d’animation, de jeu et de 3D de la famille Opus, considérés comme la plus forte amélioration depuis Opus 4.5
  • Dans les analyses ouvertes, plus les tâches étaient difficiles et ambiguës, plus le gain par rapport à Opus 4.8 était important ; les réponses sont devenues plus claires et plus concises, et l’efficacité à high effort s’est aussi améliorée
  • Pour gérer des environnements de développement, il crée ses propres moniteurs et manipule chaque environnement en ne sollicitant l’humain que sur les points nécessitant un jugement
  • Sur le codebase de Fundamental Research Assistant, il réalise des changements à grande échelle en s’adaptant au feedback, et traite dans un seul workflow agentique des travaux habituellement découpés en plusieurs parties
  • Dans les évaluations frontend, il ouvre directement les pages en largeur desktop et mobile, puis trouve et corrige les produits cachés sous l’écran mobile et les boutons de paiement hors champ
  • Avant de passer un PR, il vérifie les branches, templates et impacts sur les tests, sans se précipiter vers la publication avant validation comme les modèles précédents
  • Lors des refontes, il distingue les avantages d’une conception proposée d’un point litigieux unique et suggère un compromis qui corrige les défauts tout en conservant les points forts
  • Dans les modifications de code, il produit des diff concis sans code mort et repère mieux les risques subtils propres au codebase, ce qui mène à une adoption sur des charges de production
  • Plusieurs cas d’usage et revues de code de la plateforme d’agents intégrés Cosmos doivent être migrés vers Opus 5
  • Dans les évaluations de JetBrains, il examine plus en profondeur avant d’écrire du code, détecte les erreurs logiques dès la phase de planification et juge non seulement si une réponse fonctionne, mais aussi si elle est correcte pour les bonnes raisons
  • Sur les benchmarks de trading, il obtient les meilleures performances de la famille Opus tout en réduisant les tokens de raisonnement à environ un septième de ceux d’Opus 4.8 et la latence à moins de la moitié

Évaluations en entreprise et métiers spécialisés

  • En recherche financière, le raisonnement numérique, le travail sur tableaux et la pensée critique précise progressent par rapport à Opus 4.8
  • Dans les évaluations internes de Box, les performances d’analyse de contenus d’entreprise spécialisés sont 8 % supérieures à Opus 4.8
    • les workflows d’analyse de données progressent de 11 % et la due diligence de 17 %
    • ces tâches ciblent des usages dans les secteurs technologique, médical et public
  • Sur des tâches complexes de modélisation financière, la précision moyenne progresse de 9 points sur l’ensemble des niveaux d’effort, tandis que le nombre de tours de dialogue et d’appels d’outils diminue d’un tiers et que le temps requis baisse de 60 %
  • Dans les tâches d’agents juridiques, les progrès sont particulièrement visibles en gouvernance d’entreprise et en arbitrage
    • une qualité comparable est maintenue avec en moyenne 26 % de tokens en moins que le max reasoning d’Opus 4.8
  • Dès la première tentative de modification de contrat, il a obtenu le meilleur score parmi les modèles testés, presque 2 fois celui d’Opus 4.8
    • les modifications de NDA sont également terminées avec moins de temps et d’itérations, tout en maintenant ou en améliorant la précision
  • Sur les tâches longues, sa capacité à créer puis réviser une présentation complète s’améliore, avec de meilleurs résultats en compréhension visuelle, formatage et gestion des erreurs de slides

Alignement et capacités à risque

  • Dans les audits automatiques de comportement avant déploiement, Opus 5 affiche le meilleur niveau d’alignement parmi les modèles Anthropic
    • il respecte mieux la Constitution de Claude qu’Opus 4.8, Sonnet 5 et Fable 5
    • il présente le plus faible taux de comportements trompeurs et la plus faible vulnérabilité aux incitations à l’usage abusif
    • il évite aussi le mieux les comportements imprudents susceptibles d’entraîner des effets secondaires difficiles à inverser
  • Il ne repousse pas la frontière des capacités dangereuses à double usage et, dans les évaluations menées avec des partenaires publics et privés, il montre des performances inférieures à Mythos 5 aussi bien en recherche biologique qu’en cybersécurité offensive
    • une évaluation détaillée est disponible dans la System Card
  • Comme Opus 4.8, il n’a pas été entraîné volontairement sur les tâches cyber, mais ses performances dans ce domaine progressent nettement avec l’amélioration générale de ses capacités
    • la découverte de vulnérabilités est proche du niveau de Mythos 5
    • en revanche, le développement d’exploits pour transformer une vulnérabilité trouvée en menace réelle reste nettement derrière Mythos 5
  • Dans l’évaluation OSS-Fuzz, Opus 5 et Mythos 5 ont trouvé des vulnérabilités avec des taux de réussite comparables, mais le score d’Opus 5 en développement d’exploits est bien plus faible

Garde-fous en cybersécurité et biologie

  • Les garde-fous sont conçus pour autoriser les usages bénéfiques en cybersécurité et en biologie, et restent proches de ceux d’Opus 4.8 à l’exception de restrictions renforcées sur un sous-ensemble étroit de tâches cyber
  • Le classificateur cyber est relativement moins restrictif que celui de Fable 5
    • il autorise la découverte de vulnérabilités dans le code source
    • il bloque les scans de vulnérabilités basés sur des binaires, les tests d’intrusion et la génération d’exploits, davantage susceptibles d’être liés à des acteurs malveillants
    • selon les tests d’Anthropic, il devrait y avoir environ 85 % moins d’interventions du classificateur que sur Fable 5
  • Sur Claude.ai, Claude Code et Claude Cowork, les requêtes signalées sont remplacées par Opus 4.8 par défaut, et cela peut aussi être activé dans l’API
  • Les entreprises et chercheurs participant au Cyber Verification Program peuvent utiliser immédiatement une version d’Opus 5 avec moins de restrictions de sécurité
  • En biologie, il conserve des garde-fous similaires à ceux d’Opus 4.8 tout en devenant le modèle de recherche scientifique le plus puissant parmi les modèles généralement disponibles
    • il existe toujours des limites importantes pour la recherche autonome de longue durée, et Mythos 5 reste plus performant sur ce type de tâches biologiques
    • les requêtes biologiques bloquées sur Fable 5 sont désormais redirigées vers Opus 5 au lieu d’Opus 4.8

Prix et fonctions pour développeurs

  • Il est disponible sur toutes les plateformes et son identifiant de modèle dans l’API Claude est claude-opus-5
    • 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie, soit le même prix qu’Opus 4.8
    • l’accès général ne comporte pas d’exigence de conservation des données, comme pour les précédents modèles Opus
  • Le mode Fast fonctionne à environ 2,5 fois la vitesse du mode standard
    • sur Claude Platform, il est facturé 2 fois le prix de base ; dans Claude Code, il est fourni via des crédits d’usage
  • Avec la bêta changement d’outils en cours de conversation de Claude Platform, Claude peut modifier les outils qu’il utilise au cours d’une conversation sans invalider le cache de prompt
  • En activant la bêta fallback automatique de l’API, les requêtes Opus 5 ou Fable 5 signalées par le classificateur de sécurité sont automatiquement transmises à un autre modèle
    • au lieu de bloquer la requête, le système la route par défaut vers le meilleur modèle disponible
  • La manière d’utiliser le modèle est expliquée dans le guide de prompting d’Opus 5

1 commentaires

 
GN⁺ 4 시간 전
Avis sur Hacker News
  • Le point essentiel ici n’est pas la performance absolue, mais le fait que les organisations peuvent désormais utiliser un modèle de niveau Fable sans obligation de conservation des données pendant 30 jours
    Opus 5, comme l’Opus précédent, n’impose pas d’exigence de conservation des données pour l’accès général, et si Fable n’a pas de score ARC-AGI, c’est aussi à cause de cette politique de conservation
    https://support.claude.com/en/articles/15425996-data-retenti..., https://www.anthropic.com/news/claude-opus-5, https://xcancel.com/arcprize/status/2064399134099153344

    • Le coût par tâche semble aussi bien plus bas, et même inférieur à celui de Sonnet
    • La rumeur selon laquelle Opus 5 était en cours de finalisation pour sa sortie était donc vraie, et les performances sur GDPval-AA v2 ont aussi fortement progressé, ce qui le rend utile pour les tâches d’agent fondées sur le travail intellectuel
      C’est aussi une bonne chose que Fable 5 reste réservé aux crédits, et il est probable qu’à l’avenir les modèles haut de gamme soient de plus en plus placés derrière une API à l’usage ou des crédits, tandis que les autres seront proposés en complément via un abonnement mensuel
    • À propos des garde-fous de Fable, cela vaut le détour : https://x.com/cheatyyyy/status/2080693704290140330
    • L’entreprise utilise une licence entreprise sans conservation des données, mais Claude se souvient des conversations passées
      Dans ce cas, les informations sont bien stockées quelque part, donc il est difficile de comprendre le mode de conservation des données
    • Le document a seulement été mis à jour il y a plus de deux semaines, et je ne trouve rien qui mentionne explicitement la compatibilité ZDR, donc une vérification supplémentaire est nécessaire
  • Je teste actuellement la conversion image→HTML ; jusque-là, Fable était le meilleur, et Gemini 3.1 Pro arrivait étonnamment en deuxième position
    Opus 5 respecte le design d’origine plus fidèlement que Fable, en implémentant les boutons comme des rectangles arrondis plutôt qu’en forme de pilule, et les images générées sont aussi plus proches de l’original
    Original : https://image.non.io/73e239a3-880f-4793-b65f-4810be2d9378.we...
    Opus 5 : https://html.non.io/solaraOpus/
    Fable 5 : https://html.non.io/solara/

  • Vu le nombre de lancements, il n’est pas surprenant que le model routing soit l’un des domaines qui croît le plus vite dans l’IA
    Plus de dix entreprises proposent chacune des modèles de formats et de tailles variés, avec différents niveaux de raisonnement, des modes agent·Pro·rapide, exécution standard·flexible·par lots, ainsi que des prix différents pour les tokens d’entrée·sortie·cache
    Les entreprises qui envoient les prompts vers la combinaison la plus adaptée et la plus économique captent une grande valeur dans un vide que les développeurs de modèles laissent de côté

    • Le model routing finira par être mieux assuré par les modèles eux-mêmes, et le routage fait perdre du contexte, ce qui augmente les coûts et l’incertitude
      C’est une répétition de la Bitter Lesson, et les acteurs de tête finiront sans doute par proposer eux-mêmes cette fonction
    • Les développeurs semblent s’efforcer d’ignorer ce vide
      La plupart des tâches de bureau n’ont pas besoin d’une AGI surpuissante, donc le trafic se dirige vers des modèles bon marché, mais les laboratoires de pointe se positionnent comme les seuls capables à la fois de produire une AGI puissante et de remplacer les cols blancs
      Le routage vers des modèles low cost risque de percer des trous dans ce récit
    • Je me demande qui sont les clients
      Pour n’importe quelle tâche, il est difficile d’accepter autre chose que le tout dernier modèle au meilleur niveau, et la seule règle nécessaire est de choisir le modèle le plus puissant parmi ceux dont il reste du quota au forfait
    • En code, il est difficile de faire confiance à un routeur, et il faut prouver qu’il permet réellement d’économiser beaucoup d’argent
      En échange d’un coût moindre, il faut accepter des bugs dont on ne peut mesurer ni la gravité ni la fréquence, et on ne connaît ni la valeur de l’assurance consistant à confier tout le raisonnement au meilleur modèle, ni le coût des corrections ultérieures
      Au niveau d’un projet, il n’existe pas non plus de moyen de tester à quel point le code aurait été différent avec d’autres modèles
    • Il semble aussi possible que ce domaine revienne non pas à des routeurs spécialisés, mais au framework d’exécution du client
  • Si vous n’avez pas envie de lire un PDF d’environ 190 pages, il y a ce billet de blog : https://www.anthropic.com/news/claude-opus-5

    • Il est intéressant qu’Opus 5 soit mis en avant comme le meilleur modèle pour le coding agentique alors que ses chiffres sont légèrement inférieurs à ceux de Fable
    • En voyant ce benchmark, on comprend sans doute pourquoi Anthropic a continué à exclure Fable de l’abonnement Max
    • Je me demande pourquoi, dans les données FrontierCode v1.1, Opus 5 ressort au-dessus de Fable 5
    • Cela ressemble à l’exemple parfait d’une situation où un modèle de langage produit un long document, que les utilisateurs ne lisent même pas avant de le faire résumer à nouveau par un modèle de langage
  • Si l’on compare le style d’Opus 5 et de Fable 5, Opus 5 continue d’utiliser, comme 4.8, les tournures typiques de Claude dont Fable s’était éloigné
    Des expressions comme “carry the argument”, “worth stating plainly”, “and the trap”, “The X matters more”, “move” reviennent sans cesse, donc il faudrait un benchmark de « l’anglais agaçant »
    Fable 5 Max: https://gist.github.com/deet/3d97f854b48eac6658d642fa18bb24d...
    Opus 5 Max: https://gist.github.com/deet/1a43693a732dfccb4d0d914bfc42692...

    • Fable utilise peut-être moins ce genre d’expressions, mais le texte reste mauvais et fatigant à lire
    • Opus 4.8 et Fable 5 avaient un style irritant qui les rendait difficiles à utiliser pour l’apprentissage, et GPT 5.6 Sol était bien meilleur
    • S’il existe un style identifiable propre à Claude, c’est plutôt une bonne chose, car cela rend plus difficile de faire passer un texte IA pour un texte humain
    • 4.6 suivait mieux les consignes de style que 4.8, et il faut encore observer 5.0
      Le style typique de Claude semble en partie venir d’une tendance à faire progresser une conversation ou une tâche de manière « proactive », et un benchmark quantifiant l’amplitude stylistique selon le prompt pourrait aussi être utile
    • Opus 5 semble être un modèle basé à l’origine sur Opus 4.8, auquel ont été appliquées les techniques de raisonnement long de Kimi K3, et il ne semble être Fable sous aucune forme
  • Les 55,7 % d’Anthropic et les ~21 % de l’article OSWorld 2.0 correspondaient à des métriques différentes
    Opus 4.8 a complètement réussi environ 1 tâche sur 5, avec un taux d’achèvement de 20,6 %, et a obtenu des points partiels sur les autres, pour atteindre un score partiel de 54,8 %
    Mais cette différence de métriques fait douter de la possibilité de comparer les benchmarks entre articles dans une marge d’erreur raisonnable : https://arxiv.org/pdf/2606.29537

    • Le taux d’achèvement est la part des tâches réussies à 100 %, tandis que le taux de score est la part des points partiels possibles effectivement obtenus
      Les créateurs de benchmarks préfèrent des chiffres bas qui montrent une marge de progression, alors que les créateurs de modèles préfèrent des chiffres élevés qui mettent en avant les capacités, mais les 55,7 % d’Anthropic et les 54,8 % de l’article sont en réalité quasiment le même résultat
    • Les modèles de langage étant généralement non déterministes, on peut s’attendre à une certaine dispersion, mais un écart de cette ampleur demande des explications supplémentaires
  • Dire qu’« Opus 5 n’est pas globalement meilleur que Fable 5 », puis lister dans le blog qu’il est meilleur sur la plupart des benchmarks, rend la communication confuse
    La system card indique aussi qu’il est similaire à Claude Mythos 5, considéré comme Fable sans restriction sur les capacités de R&D en IA

    • Cette fois, cela ressemble à un compromis consistant à souligner sa puissance tout en essayant d’éviter une surveillance accrue des autorités
      Opus 5 n’ayant pas été entraîné à exploiter des vulnérabilités logicielles, ses capacités de découverte sont proches de celles de Mythos 5, mais ses capacités d’exploitation pour les convertir en menace cyber réelle sont nettement en retrait
    • On peut l’expliquer ainsi : Fable est intelligent mais non optimisé pour les benchmarks, tandis qu’Opus est moins intelligent mais optimisé pour les benchmarks
    • Cela semble vouloir dire que leurs capacités de R&D en IA sont proches, mais que les capacités de piratage qui ont provoqué la controverse autour de Fable ne sont pas équivalentes, même si la formulation est confuse
    • Il se peut aussi qu’ils n’indiquent pas explicitement qu’il est meilleur que Fable pour éviter la surveillance des autorités
  • Même des modèles qui semblent bien supérieurs à Fable sont sortis sans problème particulier, faute de promotion apocalyptique de la part d’Anthropic
    En théorie, selon les critères d’Anthropic, ce devrait être de l’AGI, mais en réalité ce n’est qu’un vendredi ordinaire

    • En lisant la section sur les garde-fous du rapport, on comprend pourquoi
      Il est dit que ces modèles sont fortement protégés, et que Mythos sans garde-fous n’a donc pas pu être publié
      OpenAI avait eu une réaction similaire quand il a annoncé qu’un modèle sans garde-fous avait infiltré les serveurs de HuggingFace
    • Il semble y avoir moins d’exagération du type « le prochain modèle sera l’AGI »
      Même si GPT-6 sort cet été, presque plus personne n’en attend désormais une AGI, et je me demande comment ils vont maintenir le cycle de hype
    • Je me demande si l’idée est que, tant qu’aucune véritable fin du monde ne se produit, les avertissements suscitent du mécontentement, ou bien si les prédictions ratées sur l’apocalypse sont perçues comme de la promotion
    • Fable a déjà ouvert la voie sur la frontière, et Opus 5 n’a fait que le rattraper
  • Le cas promotionnel selon lequel Opus 5 a créé en une seule session un flux de données de marché et des outils de validation pour une nouvelle plateforme d’échange est, de façon amusante, un projet qu’on confie souvent à un stagiaire dans une société de trading

  • Dans le graphique Frontier Code, je me demande pourquoi l’efficacité par tâche du mode de réflexion intermédiaire est de loin la plus élevée, et pourquoi les résultats d’évaluation se dégradent fortement à mesure que la quantité de raisonnement augmente
    Il arrive qu’il y ait une légère baisse au niveau maximal, mais à ce point c’est inhabituel : https://imgur.com/a/Nv8V7Ry

    • Comme l’indicateur est le coût par tâche, cela peut être un cas de surconception où le modèle brûle trop vite des tokens en essayant de mieux faire
      Subjectivement, Opus 4.8 Medium aujourd’hui et Opus 5 Medium après l’annonce me semblent plus efficaces dans la tranche des 5 heures d’utilisation que l’Opus 4.8 de la semaine dernière
    • À un niveau de raisonnement élevé, la sortie peut devenir plus longue et se focaliser excessivement sur des détails non pertinents, ce qui augmente la surface d’erreur
      Cette limite peut apparaître dans un usage centré sur les prompts plutôt qu’en agentique, et il est possible que le niveau intermédiaire soit mieux équilibré
    • Si le benchmark pénalise le nombre d’exécutions de commandes ou le temps réel écoulé, un effort de raisonnement élevé peut conduire à un score plus faible
    • Cela pourrait aussi ressembler au Ballmer Peak, où la performance augmente à un certain niveau précis de relâchement
    • Le fait que ça baisse au milieu puis remonte au niveau maximal est aussi intéressant
      On peut se demander si trop réfléchir est mauvais, mais que réfléchir encore beaucoup plus finit par redevenir bénéfique