SFEIR

Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut

SFEIR
Synthèse visuelle Les modèles Claude en 15 slides : What · So What · Now What
Claude Opus 5 : l'intelligence quasi-frontier au prix du modèle par défaut

Le 24 juillet 2026, Anthropic a mis Claude Opus 5 en disponibilité générale sur toutes ses plateformes1. La formule d'accroche tient en une phrase : un modèle « réfléchi et proactif qui s'approche de l'intelligence frontier de Claude Fable 5 à moitié prix ». Le tarif ne bouge pas d'un centime par rapport à Opus 4.8, à 5 $ le million de tokens en entrée et 25 $ en sortie. L'identifiant API est claude-opus-5, et le modèle devient le défaut de Claude Max et le plus puissant de Claude Pro.

Il faut lire l'annonce pour ce qu'elle est. Anthropic ne prétend pas qu'Opus 5 soit son modèle le plus intelligent : Fable 5 garde ce rang. L'argument est économique. Dans une large bande médiane de difficulté, une intelligence quasi-frontier livrée efficacement et à bas coût bat une intelligence frontier livrée cher1. Pour comprendre où Opus 5 se range dans l'ensemble de la gamme, notre carte des modèles Claude pose le décor ; cet article se concentre sur ce que le nouveau modèle par défaut change concrètement.

Le pivot : le modèle par défaut devient quasi-frontier

La bascule n'est pas une histoire de podium. Opus 5 est rapporté en tête de l'Artificial Analysis Intelligence Index avec un score de 61, devant Fable 5 (60) et GPT-5.6 Sol (59), mais cette mesure provient d'une source secondaire et n'a pas été confirmée sur la page primaire d'Artificial Analysis6. Anthropic ne cite d'ailleurs pas cet index sur sa propre page. L'entreprise met en avant des benchmarks « coût par tâche », là où se joue son argument réel.

Sur Frontier-Bench v0.1, Anthropic affirme qu'Opus 5 dépasse tous les autres modèles et plus que double la performance d'Opus 4.8, à un coût par tâche inférieur1. Sur CursorBench 3.2 à effort maximal, il se place à moins de 0,5 % du meilleur score de Fable 5, pour la moitié du coût par tâche. Sur OSWorld 2.0 (usage d'ordinateur), il dépasse le pic de Fable 5 pour environ un tiers du budget. En sciences de la vie, il progresse sur toutes les évaluations face à Opus 4.8, dont un gain de 10,2 points en chimie organique. Ces chiffres sont des mesures constructeur, sur des harnais internes, et méritent la prudence d'usage que nous appliquons à toute release : la valeur réelle se lit en coût par résultat, pas au sommet d'un classement. À signaler pour l'honnêteté du dossier : Anthropic n'a pas publié de SWE-bench Verified pour Opus 5 à la date du lancement.

BenchmarkOpus 5Fable 5Opus 4.8GPT-5.6 Sol
Codage agentique en terminal (Frontier-Bench v0.1)43,3 %33,7 %21,1 %34,4 %
Travail de la connaissance (GDPval-AA v2)1861174715931736
Résolution de problèmes inédits (ARC-AGI-3)30,2 %1,5 %7,8 %
Recherche agentique (BrowseComp)90,8 %87,4 %84,3 %90,4 %
Raisonnement multidisciplinaire (Humanity's Last Exam, sans outils)56,3 %56,5 %49,8 %
Raisonnement multidisciplinaire (Humanity's Last Exam, avec outils)64,7 %63,9 %57,9 %
Usage d'ordinateur (OSWorld 2.0)70,6 %66,1 %55,7 %62,6 %
Codage agentique (DeepSWE v1.1)68,8 %69,7 %59,0 %72,7 %
Codage agentique (FrontierCode v1.1, Main)53,4 %53,5 %46,5 %47,5 %
Workflows métier (AutomationBench)26,0 %17,4 %17,0 %18,1 %
Juridique (Legal Agent Benchmark, held-out)11,7 %13,3 %10,4 %2,5 %
Santé (HealthBench Professional)59,8 %66,0 % (Mythos 5)57,4 %60,5 %
Biologie (BioMysteryBench, hard)49,4 %46,5 %42,4 %
Biologie (BioMysteryBench, résolus par l'humain)90,1 %89,0 % (Mythos 5)88,5 %

Scores publiés par Anthropic le jour du lancement1 ; mesures constructeur, harnais internes. Sur les lignes santé et biologie, la colonne de la classe Mythos rapporte Mythos 5 et non Fable 5.

Opus 5 ne gagne pas partout. GPT-5.6 Sol reste devant sur DeepSWE v1.1 (72,7 % contre 68,8 %), Fable 5 le devance de 0,1 point sur FrontierCode et de 0,2 sur Humanity's Last Exam sans outils, et Mythos 5 le dépasse de 6,2 points en santé. L'écart se creuse là où le raisonnement se combine à l'usage d'outils : ARC-AGI-3 (30,2 % contre 7,8 % pour GPT-5.6 Sol), Frontier-Bench (43,3 % contre 34,4 %) et AutomationBench (26,0 % contre 18,1 %). Anthropic revendique exactement ce terrain : le meilleur rapport capacité/coût sur les charges agentiques.

Ce qui change côté ingénierie

Opus 5 introduit plusieurs changements qui touchent directement le code d'intégration, et l'un d'eux est cassant.

L'adaptive thinking est activé par défaut : le modèle décide quand et combien réfléchir. Le paramètre d'effort (échelle low, medium, high, xhigh, max) devient le levier de profondeur de raisonnement. Conséquence directe : désactiver le thinking n'est accepté qu'à effort high ou moins ; le faire à xhigh ou max renvoie désormais une erreur 400. Tout code hérité d'Opus 4.8 qui coupait le thinking à effort élevé casse2.

Trois nouveautés d'API accompagnent le modèle. L'échange d'outils en cours de conversation (bêta) permet d'ajouter ou retirer des tools entre deux tours sans invalider le cache de prompt, ce qui compte pour les agents longue durée. Les fallbacks automatiques (mode default, bêta) appliquent les modèles de repli recommandés par catégorie de refus, pour que les requêtes routent toujours vers le meilleur modèle disponible plutôt que d'être bloquées. Le minimum de cache descend à 512 tokens (contre 1 024 sur Opus 4.8), rendant cachables des prompts jusque-là trop courts2. S'ajoute un Fast mode (research preview) à environ 2,5× la vitesse par défaut, facturé au double du tarif de base, soit 10 $/50 $ : il est proposé sur la Claude Platform et, via des crédits d'usage, dans Claude Code.

Un comportement mérite l'attention. Opus 5 vérifie son propre travail sans qu'on le lui demande et produit des réponses plus longues. La documentation officielle le reconnaît et recommande de retirer les instructions de vérification héritées pour éviter la sur-vérification2. La critique publique a été plus directe : dans sa revue du 24 juillet, Claire Vo décrit un modèle « brillant mais agaçant », à la personnalité « névrotique », et pointe un problème de verbosité surnommé « Claude Slop »8. Pour une équipe qui met Opus 5 en production, calibrer la longueur des sorties et l'effort n'est pas cosmétique : c'est une variable de coût.

Ethan Mollick, professeur à Wharton, a testé le modèle avant sa sortie. Il le décrit comme « un bon modèle, quoique bizarre » : sur les tâches courtes, Opus 5 égale ou dépasse Fable 5 ; sur les tâches longues, il le trouve « moins ambitieux », rendant un travail moins complet. Après la sortie, Mollick indique avoir remplacé Opus 4.8 par Opus 5 comme modèle de travail, « globalement plus fort sur tout », avec la même réserve que Claire Vo : Opus 5 a hérité des tics de langage de Fable, dont le goût de la densité et le « FableSpeak »9. Vérifiez cette frontière tâches courtes / tâches longues sur vos propres charges : elle décide si Opus 5 remplace Fable 5 ou seulement Opus 4.8.

Le retour le plus opérationnel vient d'Every, qui a testé Opus 5 pendant une semaine avant la sortie, sur du code, de la rédaction, du travail de connaissance et son agent interne. Verdict de jour zéro : le modèle casse la compatibilité ascendante des harnais existants. Il discute les instructions, s'arrête avant d'avoir fini, et rend la main à l'utilisateur au milieu d'un flux pourtant autonome. Le plugin Compound Engineering a cassé, au point que Kieran Klaassen l'a réécrit et a publié dans la foulée une skill de re-calibrage de harnais10. Deux remèdes ont marché, tous deux à rebours du réflexe habituel : supprimer les skills accumulées pour les modèles précédents et repartir de zéro, puis descendre l'effort. À medium ou low, Opus 5 se tient mieux qu'à effort élevé, car plus il dispose de temps de réflexion, plus les comportements gênants ressortent. Dan Shipper tranche : « a poor man's Fable », la personnalité du modèle de génie sans son plafond de capacité, qu'il compte réserver aux moments où il aura épuisé ses tokens Fable11.

Sécurité et alignement : une asymétrie voulue

Anthropic présente Opus 5 comme son modèle le plus aligné à ce jour. Son audit comportemental automatisé lui attribue un score de 2,3 sur l'échelle des comportements désalignés, le plus bas de ses modèles récents : Anthropic le décrit comme adhérant à la Constitution mieux qu'Opus 4.8, Sonnet 5 et Fable 51. Le system card conclut qu'Opus 5 ne franchit pas le seuil d'autonomie en R&D d'IA fixé par la Responsible Scaling Policy ; il est traité comme ayant des capacités CB-1 (armes non nouvelles) mais pas CB-2, et hérite des mêmes protections ASL-3 qu'Opus 4.85.

Sur le cyber, Anthropic a fait un choix de conception assumé. Opus 5 est proche de Mythos 5 pour identifier des vulnérabilités, mais reste nettement en retrait pour développer des exploits : l'entreprise a délibérément évité de l'entraîner sur des tâches cyber offensives1. Ses classificateurs de sécurité sont proportionnellement moins restrictifs que ceux de Fable 5 ; Anthropic s'attend à ce qu'ils interviennent environ 85 % moins souvent. Une requête signalée bascule par défaut vers Opus 4.8 dans Claude.ai, Claude Code et Claude Cowork, avec notification à l'utilisateur. Nouveauté : les requêtes de biologie bloquées sur Fable 5 routent désormais vers Opus 5, et non plus vers Opus 4.8. Le mécanisme complet est décrit dans notre article sur les classificateurs et safeguards de la classe Mythos.

Le point qui décide pour une DSI européenne : la rétention

Voici l'information qui, pour un CTO en France, au Benelux ou en Suisse, pèse plus lourd qu'un point de benchmark. Anthropic l'écrit noir sur blanc : « conformément aux modèles Opus précédents, Opus 5 n'a pas d'exigence de rétention de données pour l'accès général »1. À l'inverse, Fable 5 et Mythos 5, classés « Covered Models », imposent une rétention de 30 jours sur tout le trafic, sans possibilité de Zero Data Retention, sur toutes les plateformes (API, Bedrock, Google Cloud, Foundry)7. Cette obligation écrase les accords ZDR existants.

La ligne de partage est nette. Tous les modèles Claude courants hors classe Mythos (Opus 5, Opus 4.8, Sonnet 5, Haiku 4.5) restent éligibles au Zero Data Retention. Pour un cabinet juridique routant des communications privilégiées, un acteur de la santé ou un établissement financier soumis à des obligations de résidence des données, Fable 5 est de fait hors de portée sur les workloads sensibles, tandis qu'Opus 5 préserve les contrôles. C'est ce qui fait d'Opus 5, pour l'Europe, le meilleur compromis capacité/conformité de la gamme Anthropic. Côté résidence géographique, deux options existent : les endpoints régionaux sur Bedrock et Google Cloud (prime d'environ 10 %) et le paramètre inference_geo sur l'API (multiplicateur ×1,1)4.

Cette lecture s'inscrit dans une gestion plus large du risque fournisseur, que l'épisode des contrôles à l'export de juin 2026 a rendue tangible : un modèle de haut de gamme peut être coupé du jour au lendemain, y compris hors des États-Unis. Nous en tirons une méthode dans notre architecture multi-LLM souveraine et notre analyse du risque de continuité de l'IA.

Migrer d'Opus 4.8 à Opus 5 : la checklist

La bascule est un drop-in à prix identique, mais quatre vérifications s'imposent avant la mise en production, trois documentées par Anthropic2 et une quatrième remontée du terrain :

1. Retirer les instructions de vérification héritées. Opus 5 vérifie déjà son travail ; garder d'anciennes consignes de contrôle produit de la sur-vérification et gonfle les sorties.

2. Réviser max_tokens. Le thinking activé par défaut consomme du budget de sortie ; un plafond calibré pour Opus 4.8 peut devenir trop juste.

3. Corriger le code qui désactive le thinking à effort élevé. À xhigh ou max, cet appel renvoie une erreur 400.

4. Re-calibrer les skills et les harnais agentiques. Les workflows agentiques taillés pour Opus 4.8 ou Fable 5 provoquent des arrêts prématurés et des retours de main en plein flux autonome. Repartir d'un harnais minimal, puis réintroduire les skills une à une en testant à effort medium, donne de meilleurs résultats que porter l'existant tel quel1011.

Un point de coût total à ne pas oublier : depuis Claude 4.7, le tokenizer produit environ 30 % de tokens de plus pour le même texte4. Toute projection budgétaire fondée sur d'anciennes mesures doit l'intégrer. La bonne discipline reste d'instrumenter le coût par tâche et de piloter par l'effort, comme nous le détaillons pour le routage multi-modèles.

Questions fréquentes

Opus 5 est-il plus intelligent que Fable 5 ?
Non, Fable 5 reste le modèle le plus capable d'Anthropic. L'argument d'Opus 5 est économique : sur une large bande de difficulté, il livre une intelligence quasi-frontier à moitié prix (5 $/25 $ contre 10 $/50 $), avec moins de tours et de tokens à qualité comparable.

Quel est le prix de Claude Opus 5 ?
5 $ le million de tokens en entrée et 25 $ en sortie, identique à Opus 4.8. Le cache hit revient à 0,50 $, le Batch API applique −50 %. La fenêtre de contexte est de 1 million de tokens sans prime long-contexte.

Pourquoi choisir Opus 5 plutôt que Fable 5 en Europe ?
Parce qu'Opus 5 n'impose aucune rétention de données pour l'accès général et reste éligible au Zero Data Retention, alors que Fable 5 et Mythos 5 imposent 30 jours de rétention sans ZDR sur toutes les plateformes. Pour les secteurs régulés, c'est déterminant.

Migrer d'Opus 4.8 vers Opus 5 demande-t-il du travail ?
C'est un remplacement direct à prix égal, mais avec trois précautions : retirer les instructions de vérification héritées, réviser max_tokens (thinking par défaut), et corriger tout code qui désactive le thinking à effort xhigh ou max (erreur 400).

Le point de vue SFEIR : une innovation d'orchestration, pas de podium

L'intérêt d'Opus 5 n'est pas un saut de capacité brute, c'est un déplacement du rapport coût/intelligence. Quand le modèle par défaut d'un fournisseur atteint le quasi-frontier au prix d'un daily driver, la question utile pour une plateforme agentique cesse d'être « quel modèle est le plus fort » et devient « comment orchestrer une flotte dont le défaut est déjà excellent ». La réponse est une architecture hétérogène routée par difficulté et par sensibilité : Haiku 4.5 pour la classification et l'extraction, Sonnet 5 pour le gros de la production, Opus 5 comme défaut agentique et de code, Fable 5 réservé aux tâches long-horizon les plus ambitieuses et aux seuls workloads compatibles avec la rétention 30 jours.

Router par difficulté et par sensibilitéMatrice à deux axes : en abscisse la durée et la complexité de la tâche, en ordonnée la sensibilité des données. Quatre cellules : Haiku 4.5 pour les tâches courtes ordinaires, Fable 5 pour les tâches longues ordinaires, Sonnet 5 pour les tâches courtes en données régulées, Opus 5 pour les tâches longues en données régulées. Une bande basse rappelle le repli automatique de Fable 5 vers Opus quand un classifieur se déclenche. DURÉE ET COMPLEXITÉ DE LA TÂCHE SENSIBILITÉ DES DONNÉES Sonnet 5 production courante sur données régulées, Zero Data Retention possible Opus 5 sessions agentiques longues, quasi-frontier et ZDR préservé Haiku 4.5 classification, extraction, triage, sous-agents à haut volume Fable 5 projets long-horizon uniquement, rétention 30 jours assumée Repli : requête cyber, bio ou distillation → Opus répond à la place, et l'utilisateur le voit
Deux questions suffisent à placer une charge de travail : combien de temps dure la tâche, et quelle est la sensibilité des données. Opus 5 occupe la case la plus exigeante, longue et régulée, que la classe Mythos ne peut pas servir à cause de sa rétention de 30 jours.

Ce raisonnement rejoint notre conviction « AI Only » : le modèle est une commodité, l'avantage durable vit dans le système qui l'entoure, sa discipline de Context Engineering et la qualité de son harnais. Deux critères non techniques finissent souvent par trancher pour une DSI : le coût total, tokenizer +30 % compris, et la conformité. Sur ce dernier terrain, Opus 5 marque un vrai point pour l'Europe, et il faut savoir le lire dans les petites lignes plutôt que dans les graphes de benchmark.


Sources

  1. « Introducing Claude Opus 5 », Anthropic, 24 juillet 2026 — annonce et positionnement (« s'approche de l'intelligence frontier de Fable 5 à moitié prix »), Frontier-Bench (plus que double Opus 4.8), CursorBench, OSWorld, sciences de la vie, alignement (2,3 sur l'échelle de désalignement), asymétrie cyber défense/offense, safeguards routing et absence de rétention pour l'accès général. Chiffres constructeur, harnais internes, témoignages partenaires sélectionnés par Anthropic. anthropic.com — Claude Opus 5
  2. « What's new in Claude Opus 5 », Claude Platform Docs, juillet 2026 — adaptive thinking par défaut et erreur 400 à effort élevé (changement cassant), échelle d'effort, échange d'outils préservant le cache, fallbacks automatiques, minimum de cache à 512 tokens, Fast mode, recommandation de retirer les instructions de vérification, checklist de migration. platform.claude.com — What's new in Opus 5
  3. « Models overview », Claude Platform Docs, juillet 2026 — spécifications (contexte 1M, sortie 128K, cutoff mai 2026), modalités texte et image en entrée, hiérarchie de gamme et logique de segmentation. platform.claude.com — Models overview
  4. « Pricing », Claude Platform Docs, juillet 2026 — grille tarifaire, prompt caching (cache hit 0,1×), Batch (−50 %), résidence des données (endpoints régionaux, inference_geo ×1,1) et effet tokenizer (~+30 % de tokens depuis Claude 4.7). platform.claude.com — Pricing
  5. « System Card: Claude Opus 5 », Anthropic (PDF), 24 juillet 2026 — franchissement du seuil d'autonomie R&D non atteint, capacités CB-1 sans CB-2, mêmes protections ASL-3 qu'Opus 4.8. anthropic.com — System Card Opus 5 (PDF)
  6. « Claude Opus 5 Becomes Top Model on Artificial Analysis Intelligence Index », OfficeChai, 24 juillet 2026 — score AA de 61 (devant Fable 5 à 60 et GPT-5.6 Sol à 59). Source secondaire ; la page primaire d'Artificial Analysis pour Opus 5 n'a pas pu être vérifiée à cette date. officechai.com — AA Index
  7. Politique de rétention des « Covered Models » (Fable 5 / Mythos 5) : rétention obligatoire de 30 jours sans Zero Data Retention sur toutes les plateformes, écrasant les accords ZDR existants ; Opus 5 et les autres modèles hors classe Mythos restent éligibles au ZDR. cybernews.com · Forrester
  8. Claire Vo, « Claude Opus 5 review: this model is brilliant (but annoying) », Lenny's Newsletter, 24 juillet 2026 — personnalité « névrotique », verbosité (« Claude Slop »). Source secondaire, retour d'usage individuel. lennysnewsletter.com
  9. Ethan Mollick (Wharton), deux publications sur X, 24 juillet 2026 — retour d'accès anticipé (« a good model if a quirky one », parité avec Fable 5 sur les tâches courtes, moins d'ambition sur les tâches longues) puis adoption d'Opus 5 en remplacement d'Opus 4.8, avec la réserve du « FableSpeak » et du goût de la densité. Démonstrations jointes : un shader néo-gothique et un jeu de construction ferroviaire (code sous licence MIT). Retour d'usage individuel, accès fourni par Anthropic avant la sortie ; aucun article long n'avait été publié sur son Substack au 25 juillet 2026. post 1 · post 2
  10. Kieran Klaassen (Every), publication sur X, 24 juillet 2026 — Opus 5 rend la main à l'utilisateur au milieu d'un flux pourtant autonome et casse le plugin Compound Engineering ; meilleurs résultats à effort medium et sans les skills héritées ni les méga-prompts. Réécriture du plugin (PR 1250) et skill de re-calibrage de harnais (PR 1252). Retour d'usage d'une équipe, accès anticipé. x.com — @kieranklaassen
  11. Dan Shipper (Every), « Day 0 vibe check », X, 24 juillet 2026 — une semaine de test sur code, rédaction, travail de connaissance et agent interne : rupture de compatibilité ascendante avec les skills et workflows existants, arrêts prématurés et instructions discutées, gains nets en repartant de zéro, supériorité de l'effort medium ou low, verdict « a poor man's Fable ». Retour d'usage d'équipe, accès anticipé. x.com — @danshipper
SFEIR Auteur

Articles similaires