Retour au blog
IA

Claude Opus 5.5 a aidé à écrire cet article. La ligne qui compte, c'est 16 sur 18.

23 septembre 2026 4 min de lecture

Cet article a été préparé avec Claude Opus 5.5. Tout comme le lot de posts auquel il appartient : la recherche, les premiers jets, les réécritures après que j'ai changé d'avis en cours de route. Anthropic a sorti le modèle le 22 septembre, et je l'utilise depuis dans Claude Code, sur le genre de sessions longues et désordonnées où un modèle soit garde le fil, soit le lâche discrètement.

Je veux parler d'une ligne du post de lancement, parce que c'est elle qui décide de la façon dont je l'utilise.

Seize sur dix-huit

Sous les tableaux de benchmarks, Anthropic décrit un test interne. Opus 5.5, Fable 5.1 et Opus 5 ont chacun reçu la consigne de rédiger un rapport sur les résultats trimestriels d'une entreprise, en n'utilisant que ce qu'ils pouvaient trouver sur une copie du web où le communiqué de résultats était difficile à localiser. Un correcteur automatisé vérifiait chaque chiffre et chaque citation par rapport aux sources. Un chiffre inventé ou une citation inventée, et le rapport était recalé.

Sur différents niveaux d'effort, 16 des 18 rapports d'Opus 5.5 ont passé la barre. Ni Fable 5.1 ni Opus 5 ne l'ont franchie, à aucune tentative.

C'est une vraie avancée. Passer de zéro rapport propre à seize, ce n'est pas une marge de benchmark, c'est un changement de comportement : quand la source est difficile à trouver, le nouveau modèle est beaucoup plus enclin à continuer de chercher, ou à dire qu'il ne l'a pas trouvée, plutôt qu'à combler le vide avec quelque chose de plausible.

Maintenant, lis-le dans l'autre sens. Deux rapports sur dix-huit contenaient encore au moins un chiffre ou une citation inventés. Un sur neuf.

Un sur neuf, c'est un taux, pas un verdict

Pour un chatbot qui répond à des questions anodines, un sur neuf serait peut-être tolérable. Pour un article qui porte mon nom, ou pour le travail juridique et de propriété intellectuelle que fait chaque jour le produit dont je suis CTO, ça ne l'est pas. La différence n'est pas le modèle. C'est le coût de l'erreur, qui retombe sur celui qui signe.

Donc rien ne change dans mon processus, et je soupçonne qu'Anthropic serait d'accord, puisque ce test n'existe que parce qu'ils n'ont rien présumé. Le modèle écrit. Autre chose vérifie. Dans mon cas, cette autre chose est un petit modèle juge qui relit chaque phrase par rapport aux sources, et du code tout simple qui recalcule chaque chiffre. J'écrirai sur ce dispositif séparément. Le point ici, c'est qu'un meilleur rédacteur ne supprime pas le besoin d'un relecteur. Il rend juste le travail du relecteur plus discret.

Ce qui a changé dans l'usage quotidien

Deux autres affirmations du post de lancement correspondent à ce que j'ai constaté.

La première, c'est l'écriture. Anthropic dit qu'Opus 5.5 communique de façon plus naturelle, met l'information la plus importante en premier, est moins susceptible d'utiliser du jargon, et « suit les règles d'écriture qu'on lui donne ». Mes règles sont précises et un peu obsessionnelles : aucun tiret cadratin nulle part, sources primaires uniquement, dates écrites en toutes lettres, chaque chiffre traçable. À mi-parcours de ce lot, j'en ai ajouté une nouvelle : arrêter de citer un journal en particulier, même comme simple contexte. Il a appliqué la règle à tout ce qui a suivi sans qu'on ait besoin de le lui rappeler. Ça a l'air anodin. Sur un lot de douze articles, c'est la différence entre relire et réécrire.

La seconde, c'est le coût, et plus précisément le cache. Les lectures de cache passent de 0,50 $ à 0,20 $ par million de tokens, soit 60 % de moins que sur Opus 5, et Anthropic précise que les lectures de cache représentent la majorité du coût du travail agentique et du code. Une session longue, c'est surtout le modèle qui relit le même contexte : les règles, les fichiers, les notes. C'est exactement cette ligne-là qui est devenue la moins chère. Les tokens en entrée et en sortie sont 20 % moins chers, à 4 $ et 20 $, et Anthropic affirme que le modèle utilise aussi moins de tokens par tâche, pour une baisse de 40 % sur les charges de travail typiques.

La première sortie après « ralentir la frontière »

Il y a une phrase de plus dans l'annonce sur laquelle il vaut la peine de s'arrêter. Anthropic présente Opus 5.5 comme sa première sortie depuis qu'elle a appelé à « ralentir la frontière », une référence à l'essai de Dario Amodei du 12 septembre, qui soutenait que les laboratoires devraient ralentir le rythme auquel ils améliorent les capacités de leurs modèles, et qui engageait Anthropic à héberger des évaluateurs externes intégrés.

Dix jours plus tard, l'entreprise sortait un modèle. On pourrait y voir une contradiction. Je lis le post de lancement autrement. Opus 5.5 est présenté comme performant au niveau de Fable 5.1, le modèle phare existant d'Anthropic, sur la plupart des tâches, tout en coûtant 40 % de moins à faire tourner qu'Opus 5. Il a été testé avant sa sortie par des évaluateurs externes, dont METR. Anthropic affirme qu'il affiche les meilleurs scores jamais enregistrés à son audit comportemental automatisé, et qu'il est beaucoup moins susceptible que les modèles récents de prendre des actions difficiles à annuler. Et parce qu'il est comparable à Mythos 5.1 en biologie et en cybersécurité, il embarque des garde-fous similaires à ceux de Fable 5.1, certaines tâches étant confiées à des modèles plus anciens quand ces garde-fous se déclenchent.

Autrement dit, le gain principal de cette sortie, c'est l'efficacité, pas un nouveau plafond. Savoir si c'est à ça que ressemble le ralentissement de la frontière en pratique, c'est une question pour les évaluateurs qu'Amodei veut voir installés dans la maison. Pour un builder, l'effet pratique est plus simple : la capacité que je payais au prix fort il y a un mois coûte désormais moins cher et, selon la mesure d'Anthropic, produit ses réponses plus de 30 % plus vite qu'Opus 5.

Ce que je dirais à un autre CTO

Passe au nouveau modèle, mesure, et garde le vérificateur. Le modèle est meilleur pour ne pas inventer, il n'est pas parfait pour autant, et le fournisseur a publié le chiffre qui te dit les deux à la fois. C'est le genre de post de lancement le plus utile : celui qui te donne le taux, pour que tu puisses décider ce que ça te coûte quand le taux se réalise.

Sources

Un projet du même genre ?

Je conçois et déploie des produits comme celui-ci. Parlons-en.

Discutons