Volver al blog
IA y Precios

Opus 5.5 y GPT-6 Sol con 90 minutos de diferencia: la guerra de precios de la IA

23 de septiembre de 2026 5 min de lectura

Construyo un producto sobre Claude. Así que el martes 22 de septiembre hice lo que hicieron muchos CTO esa tarde: abrí dos páginas de lanzamiento una al lado de la otra y traté de averiguar cómo sería mi factura el mes siguiente.

Anthropic lanzó primero Claude Opus 5.5. Según TechCrunch, OpenAI siguió unos 90 minutos después con GPT-6 Sol y GPT-6 Luna. Los dos anuncios abrían con la misma promesa, más capacidad por menos dinero, y los dos venían con un tipo de gráfico que no veía en las páginas de lanzamiento hace un año: la precisión representada frente al coste por tarea, en escala logarítmica.

Ese segundo detalle es la verdadera historia. Pero antes, las cifras que todo el mundo citó.

Los precios de lista

Opus 5.5 cuesta 4 $ por millón de tokens de entrada y 20 $ por millón de salida. Eso es un 20 % menos que Opus 5, que estaba en 5 $ y 25 $. Las escrituras en caché bajan de 6,25 $ a 5 $. Las lecturas en caché bajan de 0,50 $ a 0,20 $, un recorte del 60 %. También hay un modo rápido, hasta 2,5 veces más veloz, a 8 $ y 40 $.

GPT-6 Sol cuesta 2 $ de entrada y 10 $ de salida, exactamente la mitad de los 4 $ y 20 $ de GPT-5.6 Sol. GPT-6 Luna, el modelo pequeño, cuesta 0,10 $ y 0,50 $, frente a los 0,20 $ y 1,20 $ anteriores. OpenAI describe el recorte como un 50 % respecto al precio promocional de la generación 5.6.

Leído así, Sol cuesta la mitad que Opus 5.5 en cada token. Ese es el titular que la mayoría repitió, y para mi carga de trabajo no significa casi nada.

La línea que importa es la caché

Anthropic lo dice sin rodeos en su propia publicación: las lecturas en caché «constituyen la mayoría de los costes del trabajo agéntico y de programación». Eso coincide con lo que yo veo. Un agente que trabaja durante una hora relee el mismo system prompt, los mismos archivos y la misma conversación cientos de veces. Los tokens frescos son una capa fina sobre una base gruesa y reutilizada.

Así que fíjate en la caché. Opus 5.5 lee los tokens en caché a 0,20 $ por millón. OpenAI dice que su prompt caching mejorado para GPT-6 da un descuento del 90 % en las lecturas de entrada en caché, lo que sobre el precio de entrada de 2 $ de Sol también da 0,20 $ por millón.

En la parte de la factura que domina el trabajo con agentes, los dos modelos cuestan lo mismo.

Lo que queda es cuántos tokens quema cada modelo para terminar una tarea. Lo que nos devuelve a esos gráficos.

El coste por tarea es ahora la unidad

El argumento de Anthropic para Opus 5.5 no trata en realidad del precio por token. Dice que el modelo es más barato por token y usa menos tokens por tarea, lo que «se traduce en una caída de costes del 40 %» frente a Opus 5 en cargas de trabajo típicas. Los testimonios de clientes en la página repiten el mismo patrón. GitHub dice que en VS Code resolvió más tareas de terminal que Opus 5 en menos de la mitad de los pasos. Optiver informa de haber igualado la calidad de Opus 5 con aproximadamente la mitad de turnos, tiempo y tokens de salida, recortando el coste de esa carga de trabajo entre un 40 % y un 50 %. Spotify habla de completar las mismas tareas más barato y más rápido.

OpenAI hace la misma jugada desde el otro lado. Su comparación estrella es en AutomationBench, una prueba de flujos de trabajo empresariales entre aplicaciones: GPT-6 Sol con esfuerzo «xhigh» supera a Claude Opus 5 con esfuerzo máximo «por solo el 9 % del coste por tarea de Opus 5». En la evaluación de factualidad de OpenAI, Luna con esfuerzo más alto iguala a GPT-5.6 Sol por cerca de una centésima parte de su coste.

Las dos empresas te venden ahora un coste por tarea completada. Esa es la unidad correcta. También es una unidad que no puedes leer en una lista de precios, porque depende de la tarea.

Cada lanzamiento se compara con el modelo que el otro estaba reemplazando

Aquí está el detalle que me hizo sonreír. La tabla de benchmarks de Anthropic compara Opus 5.5 con GPT-6 Astra, el buque insignia de OpenAI, y con GPT-5.6 Sol. Las tablas de OpenAI comparan GPT-6 Sol con Claude Opus 5 y con Fable 5.1.

Nadie se comparó con la novedad del otro, porque 90 minutos antes esa novedad no existía. Anthropic se midió contra el Sol que OpenAI estaba a punto de reemplazar. OpenAI se midió contra el Opus que Anthropic acababa de reemplazar.

Eso no es un escándalo. Así funcionan los lanzamientos. Pero significa que, la noche del 22 de septiembre, no existía ninguna comparación oficial de los dos modelos entre los que la mayoría de los equipos elegían de verdad.

El único cruce que pude hacer

Hay un benchmark presente en las dos páginas con la misma puntuación de referencia. En AutomationBench, las dos empresas sitúan a Claude Opus 5 en el 26,9 %. Eso da un punto de anclaje común.

En la página de Anthropic, Opus 5.5 obtiene un 40,0 % y GPT-6 Astra un 41,4 %. En la página de OpenAI, GPT-6 Sol con esfuerzo xhigh obtiene un 33,2 %, a 0,27 $ por tarea.

No apostaría un contrato a esa comparación. Anthropic señala que su resultado para Opus 5.5 viene de la propia evaluación de Zapier durante el acceso anticipado, contando las intervenciones de los mecanismos de seguridad como fallos, y OpenAI cita una versión concreta del benchmark. Ejecuciones distintas, configuraciones distintas. Pero es la única línea realmente comparable disponible, y dice algo que los titulares no dijeron: el modelo más barato no está haciendo el mismo trabajo.

Lo que voy a hacer de verdad

Tres cosas, ninguna glamurosa.

Primero, voy a dejar de comparar precios por token. Voy a volver a correr nuestro propio conjunto de evaluación en cada modelo y a registrar el coste por tarea completada, incluidos los reintentos y los tokens gastados en llamadas a herramientas. El único benchmark que fija mi factura es mi propio tráfico.

Segundo, voy a tratar las tablas de los proveedores como las dos mitades de un cruce que tengo que hacer yo mismo. Si el gráfico de un proveedor omite al competidor que de verdad estoy considerando, eso es información, no un descuido que haya que perdonar.

Tercero, voy a dar por hecho que esto va a seguir pasando. Anthropic dice que Sonnet 5.5 y Haiku 5.5 llegarán en las próximas semanas. OpenAI lanzó GPT-6 Astra a principios de este mes y dos hermanos más baratos menos de tres semanas después. El precio de un nivel de capacidad dado ahora cae en pasos de semanas, no de años.

Para un equipo de producto, eso cambia una regla de arquitectura. El modelo ya no es una decisión que tomas una sola vez. Es un parámetro que revisas cada mes, y el coste de revisarlo es la calidad de tu sistema de evaluación. Los equipos que tengan uno bueno cabalgarán la guerra de precios. Los que no lo tengan leerán páginas de lanzamiento, como hice yo esa tarde de martes.

Fuentes

¿Un proyecto del mismo estilo?

Diseño y despliego productos como este. Hablemos.

Hablemos