Claude Opus 5 arrive au prix d'Opus 4.8. La vitesse devient l'option premium.
Opus 5 est lancé à 5$/25$ par million de tokens, comme Opus 4.8, pendant que l'Agent SDK livre les contrôles code pour piloter son nouveau Fast mode.

Opus 5 arrive au prix d'Opus 4.8
Claude Opus 5 a été lancé le 24 juillet, au tarif de 5$ par million de tokens en entrée et 25$ en sortie — identique à Opus 4.8. Anthropic présente le modèle comme se rapprochant de l'intelligence frontière de Claude Fable 5 « à moitié prix », chiffres à l'appui : état de l'art sur Frontier-Bench et GDPval-AA, plus du double des performances d'Opus 4.8 à coût par tâche inférieur sur Frontier-Bench, et un score sur ARC-AGI 3 qui triple celui du meilleur modèle concurrent. Opus 5 devient le modèle par défaut sur Claude Max et le plus performant disponible sur Claude Pro.
Le lancement n'est pas passé inaperçu : le fil Hacker News de l'annonce affiche 1 768 points et 1 317 commentaires, et le fil r/ClaudeAI totalise 2 857 upvotes et 643 commentaires — pas le genre d'engagement qu'on associe à une sortie de routine.
Ce qui nous intéresse davantage que le tableau de benchmarks, c'est ce qui a été livré à côté, la même semaine, par une autre équipe.
Le vrai coup produit, c'est le Fast mode
Opus 5 embarque un mode Fast : environ 2,5x la vitesse par défaut, pour 2x le prix de base. C'est un levier différent du curseur d'effort introduit par Sonnet 5 il y a trois semaines — l'effort échange latence et tokens contre de la profondeur de raisonnement à prix fixe ; le Fast mode échange du prix contre de la vitesse d'exécution à profondeur de raisonnement fixe. Confondre les deux fausse ta logique de routage : un appel Sonnet en effort xhigh et un appel Opus en Fast mode résolvent des problèmes différents. L'un achète une meilleure réponse. L'autre achète la même réponse, plus vite.
Voici l'heuristique qu'on utilise pour ne pas les mélanger. On sort le curseur d'effort quand le mode d'échec est faux — un plan qui rate un cas limite, un refactor qui casse silencieusement un contrat. On sort le Fast mode quand le mode d'échec est en retard — une boucle d'agent interactive où une bonne réponse en 8 secondes plutôt que 20 est tout le produit. Quand une tâche est à la fois difficile et sensible à la latence, tu paies sur les deux axes en même temps, et c'est exactement la décision de routage qui mérite d'être mesurée plutôt que devinée.
Cette distinction ne compte en pratique que si on peut réellement piloter ce mode depuis le code, savoir quand il est actif, et l'annuler proprement s'il ne se comporte pas comme prévu — ce qui nous amène au SDK.
Le SDK n'a pas attendu pour suivre
@anthropic-ai/claude-agent-sdk a publié la version 0.3.219 le 24 juillet — le jour même du lancement d'Opus 5 — puis la 0.3.220 le lendemain. L'ajout principal, fast_mode_disabled_reason, est désormais exposé sur les messages de résultat et d'initialisation : une application hôte peut dire à l'utilisateur pourquoi le Fast mode n'est pas actif au lieu d'échouer silencieusement.
Ce seul champ comble un vrai trou. Sans lui, « le Fast mode est actif » relevait de l'espoir, pas du fait : un appel pouvait retomber en douce sur la vitesse par défaut — après un changement de modèle, sous un plan qui ne l'accorde pas, ou parce que la forme de la requête le disqualifiait — et le seul signal était un graphe de latence qui ne bougeait pas. Désormais la raison revient sur le message lui-même :
// sur le message init/result que le SDK te renvoie maintenant
if (message.fast_mode_disabled_reason) {
telemetry.warn("fast_mode_off", { reason: message.fast_mode_disabled_reason });
}
Logge-la, ne l'avale pas. Toute la différence entre une primitive debuggable et une case cochée tient à savoir si cette string atteint un jour un dashboard.
À côté : un flag opt-in cancel_queued sur la requête de contrôle d'interruption, qui annule les messages en file d'attente et en attente de dispatch lors d'un abort — avant cela, interrompre un appel en Fast mode en cours pouvait laisser des messages en file dans un état ambigu, toujours dispatchés vers un modèle censé s'être arrêté. La même version corrige aussi la réponse d'initialisation qui rapportait le fast_mode_state du modèle de départ après un changement de modèle — exactement le bug sur lequel tu tomberais en construisant la logique de routage ci-dessus.
Deux ajouts plus discrets dans ces mêmes versions méritent d'être signalés si tu maintiens un hôte d'agents : un hook de cycle de vie DirectoryAdded, déclenché quand un nouveau répertoire de travail s'enregistre en cours de session, et un paramètre sandbox.network.strictAllowlist pour refuser de façon déterministe les hôtes non autorisés dans les commandes sandboxées. Rien de spécifique à Opus 5 ici, mais les deux sont arrivés dans la même fenêtre de 48 heures que le lancement du modèle — ça ressemble moins à une coïncidence qu'à un calendrier de release synchronisé.
Deux bêtas discrètes à connaître
Sous les graphiques de benchmarks, le post de lancement d'Anthropic confirme deux fonctionnalités bêta qui comptent plus pour du code d'agent en production que les chiffres phares : le changement d'outils en cours de conversation sur la Claude Platform, où les développeurs peuvent désormais modifier les outils accessibles à Claude sans invalider le cache de prompt, et les fallbacks automatiques, où une requête bloquée par les classifieurs de sécurité sur Opus 5 (ou Fable 5) peut être routée vers un autre modèle au lieu de faire échouer l'appel. Deux détails de plomberie peu glamour, mais qui déterminent si « changer de modèle selon la tâche » reste un schéma sur un tableau blanc ou finit vraiment en prod. Le changement d'outils sans invalidation du cache est en réalité le plus gros des deux : il supprime la taxe qui rendait les jeux d'outils dynamiques trop chers pour valoir le coup dans des agents longue durée.
Pendant ce temps, les labos open-weight tarifent le même axe
Trois jours avant Opus 5, le Thinking Machines Lab de Mira Murati a publié Inkling — un modèle mixture-of-experts de 975 milliards de paramètres (41 milliards actifs), poids complets sur Hugging Face sous licence Apache 2.0, fenêtre de contexte d'1M de tokens, pré-entraîné sur 45 000 milliards de tokens de texte, images, audio et vidéo. C'est le premier modèle public du labo depuis le départ de Murati d'OpenAI, disponible sur OpenRouter à 1$ par million de tokens en entrée et 4,05$ en sortie — environ un cinquième du prix d'entrée d'Opus 5.
Ce qui frappe, ce n'est pas la performance générale d'Inkling, en retrait face à des modèles plus petits et moins chers sur plusieurs benchmarks de factualité dans le propre tableau comparatif de Thinking Machines. C'est le chiffre agentique : 74,1 sur MCP Atlas, un benchmark qui mesure la fiabilité d'un modèle à accomplir des tâches réelles via le Model Context Protocol. De quoi dépasser Nemotron 3 Ultra de Nvidia (42,7) de plus de 30 points — même si Inkling reste derrière GLM 5.2 de Zhipu (77,8) sur ce même indicateur. Thinking Machines a choisi de mettre ce chiffre en avant plutôt qu'un classement généraliste, ce qui en dit long sur où le labo situe le prochain terrain de bataille.
En mettant les deux lancements côte à côte, un motif se dessine : plus personne ne vend « plus intelligent » comme un chiffre unique. Anthropic tarife la vitesse comme un axe séparé de la profondeur de raisonnement. Thinking Machines optimise et vend un modèle spécifiquement pour l'usage agentique d'outils, quitte à sacrifier la performance générale. La fiche modèle commence à ressembler à une fiche technique avec des curseurs indépendants plutôt qu'à un score de QI unique — et une logique de routage qui traite encore « quel modèle » comme une décision unique va se tromper de plus en plus souvent.
Sur quoi on parie la semaine prochaine
On surveille si fast_mode_disabled_reason remonte vraiment des raisons de refus exploitables en pratique, ou si ça finit avalé dans un catch block comme une string de plus — c'est toute la différence entre une primitive debuggable et une case cochée. Sur notre infra de dev perso, on teste si le Fast mode justifie sa prime de prix x2 spécifiquement sur les boucles agentiques à latence serrée, plutôt que de rester sur Opus 5 en vitesse par défaut pour tout le reste. Et si le cadrage MCP Atlas fait école, on s'attend à voir d'autres labos open-weight suivre la voie d'Inkling et mettre en avant un chiffre agentique plutôt qu'un classement généraliste.
Ce qu'il faut retenir quand on ship des agents : « quel modèle » n'est plus une seule décision. C'est un modèle, un niveau d'effort, un palier de vitesse et une politique de fallback — quatre curseurs, tarifés indépendamment. Les équipes qui raisonnent comme ça dépenseront moins et livreront plus vite que celles qui choisissent encore un nom unique dans un classement.
Travailler avec Ikki
Pas sûr que le Fast mode convienne à vos tâches d'agent ?
On benchmarke vos prompts de prod sur les modes par défaut et Fast d'Opus 5, et on vous livre une règle de routage basée sur la forme de la tâche, pas sur l'instinct.
Autres articles
MCP a son premier vrai breaking change : fin des sessions, place au stateless
La révision MCP du 28 juillet 2026 supprime les sessions et le handshake pour de bon. Ce qui casse, ce qui est déprécié, et ce que le SDK de référence a déjà livré.
PlateformesLe compte à rebours de Nuxt 3 s'arrête le 31 juillet, pile quand Nuxt 4.5 sort
Nuxt 3 atteint sa fin de vie le 31 juillet — onze jours après que Nuxt 4.5 a livré Vite 8, Rspack 2 et un mode de streaming SSR expérimental à tester dès maintenant.