Fable 5.1 vs GPT-6 Astra : un labo a baissé votre facture, l'autre a couru après le titre
Anthropic a coupé de 75% le prix des lectures de cache de Fable 5.1. OpenAI a sorti GPT-6 Astra avec une run de benchmark à 26 098$ et des excuses. Le chiffre le plus utile de la semaine ne vient d'aucun des deux posts de lancement.

Deux labos, quarante-huit heures, deux paris opposés
Le 1er septembre, Anthropic sort Claude Fable 5.1 et Claude Mythos 5.1 et ouvre son annonce sur un tableau de prix. Le 3 septembre, OpenAI sort GPT-6 Astra et ouvre sur une démo.
Deux sorties la même semaine, pour le même public de gens qui font tourner de l'IA en prod, et qui pointent dans des directions opposées. L'une rend les charges agentiques moins chères. L'autre rend une tranche étroite de capacité agentique plus visible, plus coûteuse à prouver, et plus compliquée à obtenir.
On n'a pas fait tourner Astra sur nos propres évals, donc ce n'est pas "quel modèle gagne", mais une lecture de ce que chaque labo pense devoir dire à ses clients ce trimestre, et du seul chiffre de la semaine qui devrait vraiment changer votre façon de construire, et qui ne vient d'aucun des deux posts de lancement.
Le pari d'Anthropic : votre facture compte plus que votre score
L'annonce de Fable 5.1 tient sur une ligne. Les lectures de cache passent de 1,00$ à 0,25$ par million de tokens, soit -75%. L'input reste à 10$/M et l'output à 50$/M, inchangés depuis Fable 5. Une seule ligne a bougé.
Les chiffres d'Anthropic (quatre semaines d'usage mesuré de Fable en août 2026 sur Claude Enterprise, Claude Code et l'API) situent l'effet à environ -25% sur une facture type, et jusqu'à -45% sur les sessions fortement agentiques et gourmandes en cache. Le chiffre est calculé sur du trafic réel, pas projeté par le marketing.
Mais lisez la condition attachée. La remise ne tombe que sur une ligne. Si les lectures de cache représentent 30% de votre dépense en tokens, -75% dessus font environ -22% sur la facture. Si c'est 5% (sessions courtes, prompts qui changent à chaque appel, pas de schéma d'outils stable) vous récupérez environ 4%. Le chiffre de 45% décrit un agent longue durée avec un gros system prompt stable et des définitions d'outils épinglées en cache. Déterminez lequel des deux vous êtes avant de mettre le chiffre dans une prévision.
La system card rapporte aussi Terminal-Bench-Science passant de 24,7% à 52,6% et Terminal-Bench coding de 42,0% à 55,8%. De vrais gains, et presque secondaires : Anthropic a choisi d'ouvrir sur la baisse de prix, pas sur le bond de benchmark. Un labo persuadé que son histoire était la capacité aurait ouvert sur le score.
Le pari d'OpenAI : le titre, c'est la sortie
GPT-6 Astra sort dans ce que Reuters décrit comme un examen renforcé de la sécurité des agents, et le rollout a suivi le même ton. Les abonnés Pro et Plus ont eu des problèmes d'accès dès le premier jour. Sam Altman s'est excusé publiquement pour un lancement que plusieurs médias ont qualifié de "chaotique", et les utilisateurs payants n'avaient toujours pas de date ferme plusieurs jours après.
Le CEO de Nvidia Jensen Huang a déclaré que l'AGI était arrivée et a félicité OpenAI, une affirmation immédiatement contestée par des chercheurs rappelant, à raison, que "l'AGI" n'a pas de définition consensuelle et que Huang n'offrait aucune preuve au-delà de l'existence du modèle. Traitez cette citation comme du marketing, pas comme un résultat de benchmark, parce que c'est exactement ce que c'est.
Le chiffre qui devrait vraiment changer votre façon de construire
Voilà la partie qui mérite votre temps. Le chiffre porteur de ce lancement n'est pas dans les supports d'OpenAI. Il est sur arcprize.org, publié le jour même du lancement par l'organisation tierce qui gère la série de benchmarks ARC-AGI.
Astra à effort de raisonnement maximal score 62,7% sur ARC-AGI-3 Semi-Private pour 26 098$, avec le harnais Standard d'ARC, celui qui permet au modèle de conserver au fil de l'environnement les notes qu'il choisit de garder.
Changez de harnais et le tableau bascule. Avec un harnais Provider Adapter (qui préserve l'état de raisonnement opaque du modèle entre les requêtes et utilise la compaction pour gérer les conversations longues) le même modèle atteint 99,9% pour 18 817$.
L'écart est difficile à ignorer : près de 37 points gagnés, avec une facture inférieure d'environ 28%. Sur les jeux public et semi-private, tous niveaux de raisonnement confondus, ARC mesure les runs Provider Adapter à environ 3,66x plus rapides en temps écoulé agrégé, avec 49% de tokens en moins.
Pour quelqu'un qui exploite des agents en production, c'est probablement le résultat le plus intéressant de la semaine. Il parle moins des capacités d'Astra que de la façon dont son état est conservé entre deux requêtes. L'écart entre un agent qui transporte des notes en texte et un agent dont l'état de raisonnement survit à la frontière de requête valait, sur ce benchmark, plus que n'importe quelle montée de version sortie cette semaine. Comme le formule TNW, le chiffre AGI vient d'un harnais, pas du modèle.
Si vous faites tourner des agents, la question qui suit est concrète : qu'est-ce que votre boucle jette entre deux étapes ? La plupart des boucles maison re-sérialisent l'état en texte à chaque saut, c'est en gros le harnais Standard. Les chiffres d'ARC suggèrent que c'est le chemin cher.
Une réserve sur les montants. Les runs ARC-AGI-3 sont de longues sessions agentiques riches en outils, pas des complétions uniques. Un total d'évaluation à cinq chiffres ne dit rien de votre coût par requête. N'extrapolez pas.
L'engagement n'est pas un signal de prod
Astra a généré plus de bruit. Encore faut-il comparer ce qui est comparable, parce que la version bâclée de ce comparatif est exactement ce que cet article dénonce.
Fil principal contre fil principal : le thread de lancement d'Astra sur Hacker News a récolté environ 2 251 points et 2 062 commentaires ; celui de Fable 5.1, environ 1 415 points et 1 392 commentaires. Soit environ 1,6x, réel, mais pas un écrasement. L'avance d'Astra ne dépasse 2x que si on agrège ses fils satellites (la fiche OpenRouter, l'article ARC-AGI-3, la couverture du rollout) face au fil unique de Fable. Reddit se partage de façon comparable : le fil principal de r/OpenAI autour de 1 376 upvotes, celui de r/ClaudeAI autour de 1 453. Ces compteurs bougent en continu ; ce sont les chiffres au moment d'écrire.
Astra n'a donc pas "dominé". Il a surtout généré plus de fils, et sur des sujets qui en disent long : des pannes d'accès, des excuses, une déclaration d'AGI, une run de benchmark à 26K$. De l'attention gagnée par le spectacle et la controverse, pas par "voici ce qui change dans votre intégration".
Pendant ce temps, le fil Fable qui a produit la discussion la plus utile était un fil sceptique, se demandant si 5.1 est vraiment tellement meilleur ou si c'est le train du hype. Il a quand même récolté 160 upvotes et 128 commentaires. Cette communauté débat de la réalité du bond de benchmark. Elle s'accorde globalement sur la réalité de la baisse de prix.
CNBC a rapporté le 6 septembre que le rythme des sorties chez Meta, Google, OpenAI et Anthropic produisait une "fatigue des modèles" chez les praticiens qui essaient de suivre. Plausible comme conséquence d'une semaine comme celle-ci, même si on hésiterait à l'attribuer à une seule sortie.
Même examen, réponses différentes
Les deux labos opèrent sous un examen sécurité renforcé ce cycle, pas seulement OpenAI. Anthropic a repris ses tests offensifs externes sur ses propres modèles fin août, après des incidents de sécurité impliquant Claude, en relançant le programme la veille du lancement de Fable 5.1.
Mais la symétrie s'arrête au contexte de fond. La couverture du lancement d'Astra a aussi fait remonter des constats d'un modèle cherchant à contourner la supervision, une propriété pertinente en prod, pas un artefact de cycle médiatique, et qui a sa place dans une revue de risque si vous mettez Astra à proximité de quoi que ce soit d'important.
Ce que chaque labo a choisi de mettre devant le client diverge aussi. La réponse d'Anthropic à l'examen, c'est une system card et une liste publique de breaking changes ; celle d'OpenAI, un score de benchmark et un fil d'excuses. Les deux sont des manières légitimes de gérer la pression. Ce n'est pas le même pari sur ce qui construit la confiance chez les gens qui shippent réellement ce genre de produit.
Ce qu'il faut vraiment faire cette semaine
Aucune de ces observations n'est un verdict sur quel modèle est meilleur pour votre tâche. On n'a pas fait tourner Astra contre Fable 5.1 sur nos propres charges, et quiconque prétend avoir une réponse nette cette semaine vend quelque chose.
Trois gestes concrets, selon où vous vous situez :
Vous optimisez la marge d'un pipeline agentique existant. Mesurez votre part de lectures de cache avant de miser sur l'histoire de prix de Fable 5.1. La baisse de 75% est réelle ; qu'elle vaille 22% ou 4% pour vous est un calcul dont vous avez déjà les données.
Vous évaluez de la capacité de pointe. Les chiffres ARC-AGI-3 d'Astra sont réellement à l'état de l'art sur un benchmark conçu pour résister à la mémorisation, et méritent un test à harnais équivalent sur votre propre tâche. Mais ne transformez pas une run de benchmark à cinq chiffres en estimation de prix par requête.
Ni l'un ni l'autre. Le résultat sur les harnais reste du signal gratuit. Auditez ce que votre boucle d'agent jette entre deux étapes. C'est peu coûteux à vérifier et, au vu des chiffres d'ARC, plausiblement plus rentable que l'une ou l'autre des deux sorties.
La semaine prochaine, on surveille deux fils. Si OpenAI suit avec le genre de changelog détaillé (chaînes d'erreur et chemin de migration) qu'Anthropic a livré avec Fable 5.1 : pour l'instant, la surface d'intégration d'Astra se reconstruit à partir du blog d'une organisation de benchmark tierce et de rapports de panne, pas d'OpenAI. Et si la "fatigue des modèles" survit au cycle qui l'a nommée. Si oui, ça change le poids qu'un seul titre hebdomadaire devrait avoir dans une conversation de roadmap. Y compris celle-ci.
Envie d'un second avis sur quelle sortie compte vraiment pour ce que vous shippez ? discutons.
Travailler avec Ikki
Vous hésitez entre les annonces modèles de la semaine ?
Envoyez-nous vos 3 principaux cas d'usage en prod. On mappe chacun sur le modèle qui gagne réellement sur vos chiffres de coût et de latence, pas celui qui a gagné le cycle d'actu de la semaine.
Autres articles
Confinement des agents : cinq règles à reprendre du post-mortem d'Anthropic
Des modèles Claude ont atteint l'internet réel deux fois cet été, chaque fois dans un environnement d'évaluation qu'Anthropic n'exploitait pas. Le post-mortem vaut checklist de confinement pour qui fait tourner des agents avec un accès outils réel.
AgentsAnthropic verrouille son modèle le plus dangereux derrière des artefacts, pas des prompts
Claude Mythos 5 n'a pas de fenêtre de chat. Il a des interfaces limitées à une tâche qui ne rendent qu'un artefact : le pattern d'accès dont tout builder d'agents a besoin.