← Le blog d'Origin Labs

Actus IA

Claude Opus 5 : les benchmarks l'adorent, une partie des développeurs beaucoup moins

Pierre Beunardeau · 2026-08-11

Sorti le 24 juillet 2026, Claude Opus 5 aligne les records sur les évaluations agentiques. Dix-sept jours plus tard, une partie de sa base la plus fidèle, les développeurs, est en partie repassée à Opus 4.8. Sur les benchmarks, ce modèle est une progression nette ; dans le travail itératif de tous les jours, il concentre les critiques. Voici les chiffres attribués à leurs sources, les verbatims vérifiés, les causes documentées par Anthropic elle-même, et ce que les rumeurs Sonnet 5.5 et Fable 5.1 disent de la suite.

Planche d'atelier au crayon et aquarelle : un double cadran mécanique en coupe, une aiguille s'affole vers le haut (les benchmarks) pendant que l'autre retombe (l'usage quotidien), sapins dans la brume, logotype Origin Labs

En cinq points

  • Frontier-Bench doublé par rapport à Opus 4.8, CursorBench à 0,5 point de Fable 5 pour moitié moins cher : la progression sur le papier est réelle.
  • Verbosité, sur-engagement, erreurs « confiantement fausses », workflows cassés : les quatre griefs qui reviennent partout chez les développeurs.
  • La documentation d'Anthropic décrit ces comportements comme voulus : vérification spontanée, élargissement de périmètre, thinking activé par défaut.
  • Le guide officiel le dit noir sur blanc : le paramètre effort pilote la réflexion du modèle, pas la longueur de ses réponses.
  • Sonnet 5.5 (nom de code « Fennec ») et Fable 5.1 circulent en fuites ; rien n'est confirmé, et le nom de code est un recyclage.

Ce que les benchmarks disent : une progression réelle

Commençons par les chiffres. Le positionnement officiel d'Anthropic au lancement : « a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price ». Les résultats ci-dessous mélangent mesures communiquées par Anthropic et évaluations indépendantes ; l'attribution est précisée à chaque ligne, parce que cela compte.

  • Frontier-Bench v0.1 : Opus 5 « more than doubles Opus 4.8's performance at a lower cost per task », nouveau meilleur score (43,3 à 43,5 % selon les mesures tierces). Mesure interne Anthropic (annonce et méthodologie) ; la méthodologie est un run maison : cinq essais par tâche, avec repli vers Opus 4.8 lors de certains refus.
  • CursorBench 3.2 : à effort maximal, à 0,5 point du meilleur score de Fable 5, pour moitié moins cher par tâche (annonce Anthropic).
  • SWE-bench Pro : 79,2 % contre 80,0 % pour Fable 5, le seul test de cette sélection où le modèle phare reste devant (mesures tierces, datanorth.ai).
  • Terminal-Bench v2.1 : 89 % à effort maximal, au niveau de l'ancien leader GPT-5.6 Sol (The Decoder).
  • OSWorld 2.0 (contrôle d'ordinateur) : 70,6 % contre 55,7 % pour Opus 4.8 (datanorth.ai).
  • Intelligence Index : 61, devant Fable 5 (60) et GPT-5.6 Sol (59) (Artificial Analysis).
  • ARC-AGI 3 : 30,2 %, soit trois fois le deuxième meilleur score (annonce Anthropic).

Trois évaluations, trois modèles : Opus 5 tient ses promesses de papierOSWorld 2.0Opus 5 · 70,6Fable 5 · 66,1Opus 4,8 · 55,7SWE-bench ProOpus 5 · 79,2Fable 5 · 80,0AA IntelligenceIndexOpus 5 · 61Fable 5 · 60Sources : annonce Anthropic (24/07/2026), datanorth.ai, Artificial Analysis.Pas de score public Opus 4,8 sur SWE-bench Pro ni AA Index dans ces sources.

Côté tarifs, rien ne bouge : 5 dollars le million de tokens en entrée, 25 en sortie, le prix d'Opus 4.8 et la moitié de Fable 5. Un « fast mode » facturé 10/50 dollars promet 2,5 fois la vitesse, et l'API Batch tombe à 2,50/12,50. Contexte d'un million de tokens, sorties jusqu'à 128 000 tokens, et Opus 5 devient le modèle par défaut de Claude Max. Anthropic reconnaît elle-même que Mythos 5 reste devant sur les tâches de cybersécurité. Sur le papier, c'est une très belle release.

Ce que vivent les utilisateurs : quatre griefs convergents

Dix-sept jours après la sortie, le fil Hacker News de lancement a dépassé les 1 300 commentaires, Reddit a inventé les mots « essay of slop », « Claude slop » et « benchslop », et les retours convergent sur quatre griefs (réception documentée notamment par MindStudio et botmonster).

Téléimprimeuse d'atelier dessinée au crayon et à l'aquarelle, déroulant un ruban de papier interminable qui submerge l'établi et recouvre une loupe, un unique passage souligné de turquoise : métaphore de la verbosité qui noie la réponse utile sous le texte

La verbosité d'abord. C'est la plainte numéro un. Matt Pocock : « Opus 5 does feel significantly more 'jargon-y' than 4.8, "dead parameter", "monotonic funnel", "a real cliff is a real cliff" » (tweet repris par The Neuron). Sur r/ClaudeCode, le commentaire le plus voté du fil de recette résume tout : « It's too talkative » (273 votes). Un autre : le modèle serait « optimised for benchmarks and vibe coding instead of... real work » (247 votes). Un « token guzzling garbage generator », lâche un troisième.

Le sur-engagement ensuite. Demandez deux choses à Opus 5, il en fera cinq, puis vous suggérera deux chantiers supplémentaires. Theo (t3.gg) l'a décrit comme « the most annoying model he's used », qui « treats every minor issue like a high severity problem requiring thousands of lines of code to resolve » (relaté par MindStudio). La mesure la plus parlante vient de CodeRabbit, sur leur propre pipeline de revue de code, contre leur propre baseline : précision en hausse (35,2 % vers 39,3 %), rappel en baisse (61,1 % vers 55,2 %), et 92 nitpicks contre 23, soit quatre fois plus de remarques mineures. La comparaison porte sur leur baseline interne, pas directement sur Opus 4.8. Artificial Analysis relève de son côté 103 tours d'agent en moyenne à effort maximal, contre 55 pour Opus 4.8 : la mécanique du modèle qui « creuse » est mesurable.

Le sur-engagement, mesuré : nitpicks multipliés par quatreNitpicks en code reviewbaseline CodeRabbit23Opus 592Tours d'agent (effort max)Opus 4,855Opus 5103Sources : CodeRabbit (comparaison contre sa baseline interne, pas directementOpus 4,8) ; Artificial Analysis. Mesures publiées début août 2026.

La régression perçue face à Opus 4.8. Point contre-intuitif : plus intelligent sur le papier, moins fiable en itération réelle. Les erreurs sont « confiantement fausses » : le code passe les tests mais rate l'intention. La system card d'Anthropic le reconnaît elle-même : « We found a surprising number of cases in which Opus 5 confidently stated an answer about which it was in fact unsure. The model hallucinates factual claims slightly more than Opus 4.8, despite being more accurate overall. » Soit 6 points d'hallucination de plus face à Opus 4.8 dans la configuration de leur évaluation interne. L'évaluation indépendante d'Artificial Analysis, menée dans sa propre configuration, mesure de son côté un taux d'hallucination de 50 % sur AA-Omniscience, en hausse de 14 points. Les deux chiffres relèvent de méthodologies distinctes. Sur les workflows, Kieran Klaassen (Every) rapporte qu'Opus 5 a « broke Compound Engineering », et un fil Reddit à 592 votes liste les raisons d'abandon : migrations documentées vers Opus 4.8, 4.6, Fable 5 et Codex.

La personnalité, enfin. Dan Shipper (Every) a signé l'autopsie la plus citée, dans le « Vibe Check » d'Every (« Claude Opus 5 Is Brilliant in Flashes, Frustrating in Practice ») et son fil de lancement : « it's a hard model to love... It argued with instructions, stopped before the work was finished... » Et cette formule : « Our first reaction was: What have they done to my boy? » La plus dure : « It's a poor man's Fable. It has many of Fable's personality quirks without Fable's genius. » Varun Mathur le trouve « not earnest », mélange de « bare-minimum work with confident excuses ». Simon Willison, dès le jour de sortie, parlait d'un modèle « relentlessly proactive ».

Le paradoxe : meilleur modèle, pire expérience

La nuance qui rend l'épisode fascinant : les mêmes critiques reconnaissent sa supériorité technique. Claire Vo (How I AI, Lenny's Newsletter) résume le paradoxe mieux que personne :

« BIG NEWS: Opus 5 is here... and I hate working with it. And yet in a blind taste test, I ranked it above every other model (even Fable and my beloved GPT-5.6). » , Claire Vo

Meilleur modèle, pire expérience : les deux sont vrais en même temps.

Ceux qui obtiennent de bons résultats ont tous fait la même chose : baisser l'effort à medium (les niveaux bas et moyens sont bien plus forts qu'avant, ce qui rend les anciens réglages trop agressifs), supprimer les instructions de vérification devenues redondantes, simplifier leurs skills. Le correctif le plus viral de Reddit, 107 votes, consiste à écrire « I have ADHD » dans son CLAUDE.md pour forcer la concision. Ses détracteurs l'ont rebaptisé « Give it ADDERALL.md ».

Ce que la documentation permet d'expliquer

Rien de tout cela n'est un accident. La documentation officielle d'Anthropic décrit noir sur blanc les comportements incriminés ; un post Reddit à 455 votes le note : « a lot of complaints people have about Opus 5 behavior are clearly described by Anthropic as baked in ». Attention toutefois à l'ordre des preuves : ce qui suit est documenté, tandis que le lien causal avec l'entraînement du modèle reste de l'interprétation.

1. Un modèle positionné pour l'agentique long-horizon. Le guide de prompting officiel (« Prompting Claude Opus 5 ») est d'une honnêteté remarquable : « Claude Opus 5 verifies its own work without being told to » et « Claude Opus 5 can also expand the scope of a task, adding steps that weren't requested or applying its own judgment about what the task should be ». Vérification spontanée, gestion proactive des cas limites, délégation aux sous-agents plus fréquente : ce que les utilisateurs appellent « il fait trop » correspond aux comportements décrits comme voulus. Le problème, c'est que les prompts hérités de la génération 4.x (« double-check », « include a final verification step ») s'empilent sur ces comportements natifs et produisent de la sur-vérification.

2. Un system prompt de Claude Code réduit de plus de 80 %. Dans un billet officiel du 24 juillet (« The new rules of context engineering for Claude 5 generation models »), Thariq Shihipar (Anthropic) explique avoir supprimé plus de 80 % du system prompt de Claude Code pour la génération 5. Il s'agit du harnais, pas de l'entraînement du modèle. Exemple de bascule : l'ancienne règle « In code: default to writing no comments » devient « Write code that reads like the surrounding code ». Fini les garde-fous externes, place au jugement du modèle, et les CLAUDE.md, skills et prompts écrits pour 4.x entrent en conflit avec ce jugement. Anthropic a d'ailleurs reconverti la commande claude doctor en outil d'audit de son propre contexte.

3. Une calibration déréglée, et documentée. La doc confirme que les réponses par défaut sont plus longues que sur les Opus précédents, et lâche la phrase qui explique des milliers de frustrations : « The effort parameter controls how much the model thinks rather than how much it says: lowering effort can reduce thinking volume without reliably shortening the visible response. To control response length, prompt for it explicitly. » Le thinking est activé par défaut sur toute la gamme d'effort (de low à max, high par défaut) ; le désactiver à xhigh ou max renvoie une erreur 400, un changement cassant par rapport à Opus 4.8.

4. L'hypothèse du post-entraînement. Une explication possible, non démontrée par la documentation : l'optimisation par préférences récompenserait des réponses perçues comme « thorough » et « complete » par les annotateurs, ce qui produirait mécaniquement plus d'explications, plus d'abstractions, et chaque détail traité comme potentiellement critique. Dans le même registre interprétatif, plusieurs observateurs relèvent que le style dense d'Opus 5 ressemble à celui d'un sous-agent destiné à être orchestré (par Fable ou Mythos) plutôt qu'à un interlocuteur humain direct ; Tenobrus le qualifie de « natural born subagent ». À classer en hypothèse, pas en cause établie.

5. L'ambition affichée est ailleurs. L'illustration la plus marquante du paradigme agentique chez Anthropic ne vient d'ailleurs pas d'Opus 5 : c'est une préversion de Fable 5 qui a réécrit le moteur d'exécution Bun, 535 496 lignes de Zig, vers Rust, via une cinquantaine de workflows et jusqu'à 64 instances Claude en parallèle, raconte Jarred Sumner sur le blog de Bun. C'est ce type de charge de travail, autonome, massive, parallélisée, qui sert visiblement de cible de conception à la génération 5. La conversation itérative quotidienne n'est que l'usage collatéral.

La synthèse : Anthropic est passé d'un paradigme « règles strictes + modèle moins capable » à « jugement du modèle + échafaudage minimal ». C'est cohérent pour l'ère agentique, mais la migration se paie comptant pour tous ceux qui avaient construit leurs workflows sur la génération précédente.

Pendant ce temps, la rumeur machine : Sonnet 5.5 et Fable 5.1

Le timing est piquant : alors qu'Opus 5 essuie le feu des critiques, les fuites s'accumulent sur la suite. Rien de ce qui suit n'est confirmé par Anthropic ; les précautions habituelles s'appliquent.

Sonnet 5.5 (nom de code « Fennec »). La fuite du week-end a d'abord été publiée par le média chinois spécialisé dans l'IA Jiqizhixin (机器之心), puis reprise le 10 août au matin par 36Kr (36氪) dans une version anglaise : un modèle en phase finale de développement, sortie « très probablement le mois prochain », soit septembre 2026, contexte porté à 2 millions de tokens (contre 1 million pour Sonnet 5), capacités « proches de Fable 5 » au prix Sonnet, latence réduite, appels d'outils (navigateur, terminal) renforcés. Le cadrage « réponse à DeepSeek V4 Flash » est une inférence du journaliste, pas une spécification de la fuite. Deux raisons de prudence : le nom de code « Fennec » est un recyclage, c'était déjà celui qui avait fuité pour Sonnet 5 en février 2026, et la rumeur des 2 millions de tokens s'était alors révélée fausse (Sonnet 5 est resté à 1 million). WinCentral, principale source anglophone (9 août), le souligne explicitement. Pour rappel, Sonnet 5 est sorti le 30 juin 2026 (2/10 dollars le million de tokens), avec une falaise tarifaire programmée au 1er septembre : une fenêtre qui rend une annonce en septembre plausible, sans la confirmer.

Fable 5.1. L'affaire tient en deux posts X du 26 juillet (Pankaj Kumar, amplifié par LuminaXspace ; puis Andrew Curran trois heures plus tard) et dans leurs relais (36Kr, WinCentral, kie.ai, Times Of AI). Le verbatim de Curran est la pièce maîtresse : « I think Fable 5.1 is ready, but Anthropic are saving it for OpenAI's next release. They will keep crossing swords like this from here on out. » Prix supposé identique à Fable 5 (10/50 dollars), sortie visée en août, focus sur le raisonnement long-horizon, modèle déjà « utilisé en interne » selon Times Of AI. Le fact-check d'aitoolsreview résume honnêtement la situation : deux posts X plus le silence d'Anthropic. Rappel de contexte : Fable 5 (classe Mythos, 9 juin) avait été suspendu trois jours après son lancement sur directive des contrôles à l'exportation américains, avant d'être restauré le 1er juillet. Il reste le modèle le plus puissant largement disponible chez Anthropic.

Fennec aux oreilles démesurées dessiné au crayon et à l'aquarelle, une oreille collée contre le pavillon en laiton d'un télégraphe d'atelier, des ondes fines se perdant dans la brume avec des sapins en fond : métaphore de la machine à rumeurs autour de Sonnet 5.5 et Fable 5.1

Ce que cet épisode dit vraiment

Opus 5 est un cas d'école : un modèle peut progresser sur toutes les métriques et régresser sur la seule qui compte au quotidien, l'expérience itérative. Ce n'est pas un bug, c'est un décalage de conception entre un modèle optimisé pour l'autonomie long-horizon et des workflows hérités d'une génération conçue pour l'assistance directe. Anthropic en assume l'essentiel dans sa propre documentation.

Dans nos workflows au studio, le même pattern se vérifie : les sessions Opus 5 deviennent exploitables quand on baisse l'effort à medium, qu'on retire des prompts les consignes de vérification écrites pour la génération précédente, et qu'on borne le périmètre explicitement. Le modèle n'est pas cassé ; il exige qu'on reconstruise la maison autour de lui.

La question ouverte, à l'aube de Sonnet 5.5 et Fable 5.1 : combien d'utilisateurs accepteront de payer ce prix, quand Opus 4.8, plus direct et plus prévisible, tourne toujours très bien ? La réponse déterminera si l'épisode restera une friction de migration, ou le moment où Anthropic a commencé à optimiser pour ses benchmarks plutôt que pour ses utilisateurs.

Questions fréquentes

Claude Opus 5 est-il vraiment meilleur qu'Opus 4.8 ?

Sur les benchmarks, oui, et nettement : Frontier-Bench doublé, Intelligence Index en tête, prix inchangé (5/25 dollars le million de tokens). En usage itératif quotidien, une partie des développeurs le trouve moins pratique : erreurs plus subtiles, réponses plus longues, workflows cassés. Les deux constats sont vrais en même temps, comme le résume le test à l'aveugle de Claire Vo.

Pourquoi Claude Opus 5 fait-il plus que ce qu'on lui demande ?

Parce qu'il a été conçu pour l'autonomie long-horizon : la documentation officielle indique qu'il vérifie son travail spontanément et peut « expand the scope of a task, adding steps that weren't requested ». Les anciennes consignes de vérification écrites pour la génération 4.x s'ajoutent à ce comportement natif et produisent de la sur-vérification.

Comment rendre Opus 5 agréable au quotidien ?

Les praticiens qui obtiennent de bons résultats convergent sur trois réglages : baisser l'effort à medium, supprimer des prompts les instructions « double-check » devenues redondantes, et expliciter le périmètre de chaque tâche. Pour la longueur des réponses, la doc est claire : l'effort pilote la réflexion, pas le volume visible ; il faut demander la concision explicitement.

Faut-il attendre Sonnet 5.5 ou Fable 5.1 ?

Rien n'est confirmé par Anthropic. Sonnet 5.5 repose sur une fuite publiée par Jiqizhixin, puis reprise par 36Kr le 10 août 2026, avec un nom de code recyclé et une promesse de 2 millions de tokens déjà démentie une fois ; Fable 5.1 tient sur deux posts X. Si vous êtes sur Opus 4.8, attendre septembre ne coûte rien ; si vous êtes sur Opus 5, appliquez d'abord les réglages ci-dessus.

Sources

À lire aussi