Volver al blog
IA

Claude Opus 5.5 ayudó a escribir este artículo. La línea que me importa es 16 de 18.

23 de septiembre de 2026 4 min de lectura

Este artículo se preparó con Claude Opus 5.5. También el lote de posts al que pertenece: la investigación, los primeros borradores, las reescrituras después de que cambiara de opinión a mitad de camino. Anthropic lanzó el modelo el 22 de septiembre, y lo he usado desde entonces en Claude Code, en el tipo de sesiones largas y desordenadas donde un modelo o bien mantiene el hilo, o bien lo pierde en silencio.

Quiero hablar de una línea del post de lanzamiento, porque es la que decide cómo lo uso.

Dieciséis sobre dieciocho

Debajo de las tablas de benchmarks, Anthropic describe un test interno. A Opus 5.5, Fable 5.1 y Opus 5 se les pidió a cada uno que escribiera un informe sobre los resultados trimestrales de una empresa, usando solo lo que pudieran encontrar en una copia de la web donde el comunicado de resultados era difícil de localizar. Un corrector automatizado verificaba cada cifra y cada cita contra las fuentes. Un número inventado o una cita inventada, y el informe quedaba descartado.

En los distintos niveles de esfuerzo, 16 de los 18 informes de Opus 5.5 superaron el listón. Ni Fable 5.1 ni Opus 5 lo superaron en ningún intento.

Eso es un avance real. Pasar de cero informes limpios a dieciséis no es un margen de benchmark, es un cambio de comportamiento: cuando la fuente es difícil de encontrar, el nuevo modelo tiene muchas más probabilidades de seguir buscando, o de decir que no la encontró, que de rellenar el hueco con algo plausible.

Ahora léelo al revés. Dos informes de dieciocho seguían conteniendo al menos una cifra o una cita inventadas. Uno de cada nueve.

Uno de cada nueve es una tasa, no un veredicto

Para un chatbot que responde preguntas informales, uno de cada nueve podría ser tolerable. Para un artículo con mi nombre, o para el trabajo legal y de propiedad intelectual que hace cada día el producto del que soy CTO, no lo es. La diferencia no es el modelo. Es el coste del error, que recae sobre quien firma.

Así que nada cambia en mi proceso, y sospecho que Anthropic estaría de acuerdo, ya que ese test solo existe porque ellos no dieron nada por hecho. El modelo escribe. Otra cosa verifica. En mi caso, esa otra cosa es un pequeño modelo juez que relee cada frase contra las fuentes, y código sencillo que recalcula cada cifra. Escribiré sobre ese dispositivo por separado. La idea aquí es que un mejor redactor no elimina la necesidad de un revisor. Solo hace que el trabajo del revisor sea más discreto.

Lo que cambió en el uso diario

Otras dos afirmaciones del post de lanzamiento coinciden con lo que he visto.

La primera es la escritura. Anthropic dice que Opus 5.5 comunica de forma más natural, pone la información más importante por delante, tiene menos tendencia a usar jerga, y «sigue las reglas de escritura que se le dan». Mis reglas son específicas y un poco obsesivas: ninguna raya nunca, solo fuentes primarias, fechas escritas en su forma completa, cada cifra rastreable. A mitad de este lote añadí una nueva: dejar de citar a un periódico en concreto, incluso como simple contexto. Aplicó la regla a todo lo que siguió sin que hiciera falta recordárselo. Suena a poco. En un lote de doce artículos, es la diferencia entre revisar y reescribir.

La segunda es el coste, y en concreto la caché. Las lecturas en caché bajan de 0,50 $ a 0,20 $ por millón de tokens, un 60 % menos que en Opus 5, y Anthropic señala que las lecturas en caché representan la mayoría del coste del trabajo agéntico y de programación. Una sesión larga es, sobre todo, el modelo releyendo el mismo contexto: las reglas, los archivos, las notas. Esa es exactamente la línea que se volvió más barata. Los tokens de entrada y salida son un 20 % más baratos, a 4 $ y 20 $, y Anthropic dice que el modelo también usa menos tokens por tarea, lo que da una caída del 40 % en las cargas de trabajo típicas.

El primer lanzamiento después de «ralentizar la frontera»

Hay una frase más en el anuncio que merece la pena detenerse a pensar. Anthropic presenta Opus 5.5 como su primer lanzamiento desde que pidió «ralentizar la frontera», una referencia al ensayo de Dario Amodei del 12 de septiembre, que sostenía que los laboratorios deberían frenar el ritmo al que mejoran las capacidades de sus modelos, y que comprometía a Anthropic a alojar evaluadores externos integrados.

Diez días después, la empresa lanzó un modelo. Se podría leer como una contradicción. Yo leo el post de lanzamiento de otra manera. Opus 5.5 se presenta como un modelo que rinde al nivel de Fable 5.1, el modelo estrella existente de Anthropic, en la mayoría de las tareas, mientras cuesta un 40 % menos de ejecutar que Opus 5. Fue probado antes de su lanzamiento por evaluadores externos, incluido METR. Anthropic dice que registra las mejores puntuaciones que ha obtenido en su auditoría de comportamiento automatizada, y que tiene muchas menos probabilidades que los modelos recientes de tomar acciones difíciles de revertir. Y como es comparable a Mythos 5.1 en biología y ciberseguridad, incorpora salvaguardas similares a las de Fable 5.1, con algunas tareas delegadas a modelos más antiguos cuando esas salvaguardas se activan.

Dicho de otro modo, la ganancia principal de este lanzamiento es la eficiencia, no un nuevo techo. Si eso es lo que significa ralentizar la frontera en la práctica es una pregunta para los evaluadores que Amodei quiere tener dentro de la casa. Para alguien que construye producto, el efecto práctico es más simple: la capacidad por la que pagaba precios de primer nivel hace un mes ahora cuesta menos y, según la medida de Anthropic, genera respuestas más de un 30 % más rápido que Opus 5.

Lo que le diría a otro CTO

Cambia de modelo, mide, y conserva el verificador. El modelo es mejor no inventando cosas, no es perfecto en eso, y el proveedor publicó el número que te dice las dos cosas a la vez. Ese es el tipo de post de lanzamiento más útil: el que te da la tasa, para que puedas decidir cuánto te cuesta cuando esa tasa se cumple.

Fuentes

¿Un proyecto del mismo estilo?

Diseño y despliego productos como este. Hablemos.

Hablemos