Retour au blog
IA & Prix

Opus 5.5 et GPT-6 Sol à 90 minutes d'écart : la guerre des prix de l'IA

23 septembre 2026 5 min de lecture

Je construis un produit sur Claude. Alors, le mardi 22 septembre, j'ai fait ce qu'un paquet de CTO ont fait cet après-midi-là : j'ai ouvert deux pages de lancement côte à côte et j'ai essayé de comprendre à quoi ressemblerait ma facture le mois suivant.

Anthropic a sorti Claude Opus 5.5 en premier. Selon TechCrunch, OpenAI a suivi environ 90 minutes plus tard avec GPT-6 Sol et GPT-6 Luna. Les deux annonces ouvraient sur la même promesse, plus de capacité pour moins cher, et les deux venaient avec un type de graphique que je ne voyais pas sur les pages de lancement il y a un an : la précision tracée en fonction du coût par tâche, sur une échelle logarithmique.

Ce second détail, c'est la vraie histoire. Mais d'abord, les chiffres que tout le monde a cités.

Les prix affichés

Opus 5.5 coûte 4 $ par million de tokens en entrée et 20 $ par million en sortie. C'est 20 % de moins qu'Opus 5, qui était à 5 $ et 25 $. L'écriture en cache passe de 6,25 $ à 5 $. La lecture en cache passe de 0,50 $ à 0,20 $, une baisse de 60 %. Il existe aussi un mode rapide, jusqu'à 2,5 fois plus véloce, à 8 $ et 40 $.

GPT-6 Sol coûte 2 $ en entrée et 10 $ en sortie, exactement la moitié des 4 $ et 20 $ de GPT-5.6 Sol. GPT-6 Luna, le petit modèle, coûte 0,10 $ et 0,50 $, contre 0,20 $ et 1,20 $ auparavant. OpenAI décrit cette baisse comme 50 % par rapport au tarif promotionnel de la génération 5.6.

Lu comme ça, Sol coûte moitié moins cher qu'Opus 5.5 sur chaque token. C'est le titre que la plupart des gens ont retenu, et pour ma charge de travail, ça ne veut presque rien dire.

La ligne qui compte, c'est le cache

Anthropic le dit sans détour dans son propre billet : les lectures en cache « constituent la majorité des coûts du travail agentique et du code ». Ça correspond à ce que j'observe. Un agent qui tourne pendant une heure relit le même system prompt, les mêmes fichiers et la même conversation des centaines de fois. Les tokens frais ne sont qu'une fine couche au-dessus d'une base épaisse et réutilisée.

Alors, regardons le cache. Opus 5.5 lit les tokens en cache à 0,20 $ par million. OpenAI affirme que son prompt caching amélioré pour GPT-6 offre une remise de 90 % sur les lectures en cache, ce qui, sur le prix d'entrée de 2 $ de Sol, donne aussi 0,20 $ par million.

Sur la partie de la facture qui domine le travail agentique, les deux modèles coûtent la même chose.

Ce qui reste, c'est le nombre de tokens que chaque modèle brûle pour terminer une tâche. Ce qui nous ramène à ces graphiques.

Le coût par tâche est désormais l'unité de mesure

L'argument d'Anthropic pour Opus 5.5 ne porte pas vraiment sur le prix par token. Il dit que le modèle est moins cher par token et utilise moins de tokens par tâche, ce qui « se traduit par une baisse de coûts de 40 % » par rapport à Opus 5 sur des charges de travail typiques. Les témoignages clients sur la page répètent le même schéma. GitHub affirme que, dans VS Code, il a résolu plus de tâches terminal qu'Opus 5 en moins de la moitié des étapes. Optiver rapporte avoir égalé la qualité d'Opus 5 en environ moitié moins de tours, de temps et de tokens en sortie, réduisant le coût de cette charge de travail de 40 à 50 %. Spotify évoque l'accomplissement des mêmes tâches, moins cher et plus vite.

OpenAI fait le même mouvement depuis l'autre côté. Sa comparaison phare porte sur AutomationBench, un test de workflows métier à travers plusieurs applications : GPT-6 Sol en effort « xhigh » surpasse Claude Opus 5 en effort maximal « pour seulement 9 % du coût par tâche d'Opus 5 ». Sur l'évaluation de factualité d'OpenAI, Luna en effort supérieur égale GPT-5.6 Sol pour environ un centième de son coût.

Les deux entreprises te vendent désormais un coût par tâche accomplie. C'est la bonne unité de mesure. C'est aussi une unité qu'on ne peut pas lire sur une liste de prix, parce qu'elle dépend de la tâche.

Chaque lancement se compare au modèle que l'autre remplaçait

Voici le détail qui m'a fait sourire. Le tableau de benchmarks d'Anthropic compare Opus 5.5 à GPT-6 Astra, le modèle phare d'OpenAI, et à GPT-5.6 Sol. Les tableaux d'OpenAI comparent GPT-6 Sol à Claude Opus 5 et à Fable 5.1.

Personne ne s'est comparé à la nouveauté de l'autre, parce que 90 minutes plus tôt, cette nouveauté n'existait pas encore. Anthropic s'est mesuré au Sol qu'OpenAI s'apprêtait à remplacer. OpenAI s'est mesuré à l'Opus qu'Anthropic venait de remplacer.

Ce n'est pas un scandale. C'est comme ça que fonctionnent les lancements. Mais ça signifie que, le soir du 22 septembre, il n'existait aucune comparaison officielle des deux modèles entre lesquels la plupart des équipes devaient réellement choisir.

Le seul rapprochement possible

Il existe un benchmark présent sur les deux pages avec le même score de référence. Sur AutomationBench, les deux entreprises indiquent Claude Opus 5 à 26,9 %. Ça donne un point d'ancrage commun.

Sur la page d'Anthropic, Opus 5.5 obtient 40,0 % et GPT-6 Astra 41,4 %. Sur la page d'OpenAI, GPT-6 Sol en effort xhigh obtient 33,2 %, pour 0,27 $ par tâche.

Je ne parierais pas un contrat sur cette comparaison. Anthropic précise que son résultat pour Opus 5.5 vient de l'évaluation propre à Zapier pendant l'accès anticipé, avec les interventions des garde-fous comptées comme des échecs, et OpenAI cite une version spécifique du benchmark. Des runs différents, des réglages différents. Mais c'est la seule ligne réellement comparable disponible, et elle dit quelque chose que les gros titres n'ont pas dit : le modèle le moins cher ne fait pas le même travail.

Ce que je vais réellement faire

Trois choses, aucune glamour.

D'abord, je vais arrêter de comparer les prix au token. Je vais rejouer notre propre jeu d'évaluation sur chaque modèle et enregistrer le coût par tâche accomplie, y compris les tentatives ratées et les tokens dépensés en appels d'outils. Le seul benchmark qui fixe ma facture, c'est mon propre trafic.

Ensuite, je vais traiter les tableaux des fournisseurs comme les deux moitiés d'un rapprochement que je dois faire moi-même. Si le graphique d'un fournisseur omet le concurrent que j'envisage réellement, c'est une information, pas un oubli à pardonner.

Enfin, je vais anticiper que ça continue. Anthropic annonce que Sonnet 5.5 et Haiku 5.5 vont suivre dans les prochaines semaines. OpenAI a sorti GPT-6 Astra plus tôt ce mois-ci, puis deux petits frères moins chers moins de trois semaines plus tard. Le prix d'un niveau de capacité donné baisse désormais par paliers de semaines, pas d'années.

Pour une équipe produit, ça change une règle d'architecture. Le modèle n'est plus une décision qu'on prend une fois pour toutes. C'est un paramètre que tu révises chaque mois, et le coût de cette révision, c'est la qualité de ton dispositif d'évaluation. Les équipes qui en ont un bon vont surfer sur la guerre des prix. Celles qui n'en ont pas liront des pages de lancement, comme je l'ai fait ce mardi après-midi.

Sources

Un projet du même genre ?

Je conçois et déploie des produits comme celui-ci. Parlons-en.

Discutons