Mistral Large 4 es un modelo de pesos abiertos que aún no puedes descargar: qué debe comprobar un CTO europeo antes de enviarle un archivo de cliente

El martes 6 de octubre, Mistral publicó una vista previa pública de Mistral Large 4. Muy oficialmente, Mistral lo llama "le Chonk". Es un modelo mixture-of-experts nativamente multimodal, de alrededor de 1 billón de parámetros, entrenado desde cero con 3.800 GPU NVIDIA Grace Blackwell en los centros de datos europeos de Mistral, y la vista previa se sirve en esa misma infraestructura. Precio de lista: 1,36 $ por millón de tokens de entrada, 4,18 $ por millón de tokens de salida.
El veredicto de Simon Willison esa noche fue justo. "Ciertamente no es un modelo de clase Fable", pero Mistral vuelve a estar "quizá unos 6 meses por detrás de la frontera". En el Artificial Analysis Intelligence Index obtiene 38. Mistral Large 3, el diciembre pasado, obtuvo 9.
Construyo una LegalTech sobre Claude. Nuestros usuarios suben documentos que no enseñarían a un competidor. Un modelo europeo, operado por una empresa europea, con pesos que yo podría alojar por mi cuenta, es casi lo ideal sobre el papel. Así que leí este lanzamiento como una lista de comprobación de compras, no como una clasificación. Cinco preguntas, cinco respuestas a día de hoy.
¿Son abiertos los pesos?
Todavía no. El anuncio dice: "Weights drop end of this month." Hasta entonces, Mistral hace red-teaming del modelo con "responsables de ciberseguridad, socios verificados y autoridades estatales, que accederán al mismo modelo con moderación reducida y capacidades cibernéticas ampliadas". TechCrunch describe el acceso público como un "public guardrail endpoint", con los pesos previstos en unas tres semanas, tras las pruebas de seguridad. Artificial Analysis clasifica por ahora el modelo como propietario.
Incluso la ficha técnica sigue moviéndose. La entrada del blog dice 49.000 millones de parámetros activos. La ficha del modelo en la documentación de Mistral indica 52.000 millones activos y 1,05 billones en total, más un codificador de visión de 1.600 millones de parámetros.
¿Bajo qué licencia?
Es la pregunta que más me importa, y nadie puede responderla todavía. En la ficha del modelo, los campos Weights y License dicen ambos "Coming soon". La insignia del catálogo dice "Open", sin ninguna licencia asociada.
El propio catálogo de Mistral muestra por qué importa. Mistral Large 2.1, de noviembre de 2024, figura bajo la Mistral Research License. Mistral Large 3, de diciembre de 2025, bajo Apache 2.0. Mistral Medium 3.5 lleva una etiqueta "Modified MIT". Tres modelos, tres respuestas distintas a la pregunta que cuenta: ¿puede funcionar de forma comercial, en nuestros propios servidores, con datos de clientes?
El contraste llegó el día anterior. El 5 de octubre, Reflection AI anunció Beam, un modelo de pesos abiertos de 501.000 millones de parámetros con 23.000 millones activos, solo texto. Reflection dice que "hace avanzar la frontera occidental de los pesos abiertos" y lo mide frente a GLM 5.2 y Qwen 3.8-Max; TechCrunch lo presentó como un rival de los modelos abiertos chinos. Le Monde enmarcó el lanzamiento de Mistral de la misma manera, como un modelo destinado a cerrar la brecha con los mejores competidores chinos. Los pesos de Beam tampoco han salido; Reflection dice que más adelante este mes. Pero Reflection nombró la licencia en su anuncio: Apache 2.0. Mistral no.
"Autoalojar" también necesita una comprobación de realidad. La columna de memoria GPU de la ficha del modelo dice N/A. Mi propia aritmética: 1,05 billones de parámetros en 16 bits son unos 2,1 TB de pesos, unos 525 GB en 4 bits, antes de un solo token de contexto. Eso es una decisión de clúster, no un servidor bajo un escritorio.
¿Dónde se ejecuta de verdad?
El argumento de Mistral es la soberanía. El modelo "estará disponible en varias regiones del mundo, incluido un despliegue europeo que Mistral opera de extremo a extremo, con independencia de otros proveedores de servicios digitales y bajo la ley europea".
La documentación añade la letra pequeña. El endpoint por defecto, api.mistral.ai, es global, y "Mistral no se compromete a una ubicación de inferencia concreta para las solicitudes enviadas a este endpoint". El endpoint de la UE, api.eu.mistral.ai, se factura a 1,1 veces el precio de lista. No sirve Agents, Batch ni la API Files, la llamada a funciones es la única herramienta admitida, y los datos de la cuenta, como las claves de API, la facturación y las analíticas de uso, aún pueden tratarse fuera de la región. La retención cero de datos existe en los planes de pago, bajo petición, y Mistral revisa cada solicitud.
El 10 % ya es lo habitual. La API de Anthropic acepta dos valores de inference_geo, "global" y "us", este último a 1,1 veces; no hay valor para la UE, y los endpoints regionales de Amazon Bedrock y Google Cloud llevan un recargo del 10 %. OpenAI cobra un 10 % de recargo en sus endpoints de residencia de datos. La diferencia de Mistral no es el precio de una región. Es quién opera el hardware y bajo qué ley, lo cual es un argumento jurídico antes que técnico.
¿Es más barato?
Por token, claramente. Claude Sonnet 5.5 y GPT-6.1 Sol figuran ambos a 2 $ de entrada y 10 $ de salida. Claude Opus 5.5 cuesta 4 $ y 20 $. La página de precios de la documentación de Mistral lista ahora mismo Large 4 con un "Sale price" de la mitad de su precio de lista, 0,68 $ y 2,09 $.
Por tarea, no. Artificial Analysis informa de que Large 4 generó unos 200 millones de tokens de salida para ejecutar su Intelligence Index, frente a una mediana de 81 millones, por 1,13 $ por tarea. En el mismo índice, Sonnet 5.5 con esfuerzo medio obtiene 40,8 por 0,59 $ por tarea, con unos 31 millones de tokens de salida. GPT-6.1 Sol con esfuerzo bajo obtiene 42,1 por 0,13 $. Esas cifras usan precios de lista. La oferta reduciría más o menos a la mitad la cifra de Mistral, lo que la sitúa a la par de Sonnet 5.5 con esfuerzo medio, una configuración que puntúa más alto.
El precio por token es una etiqueta. El coste por tarea completada es la factura. Un modelo verboso puede tener un precio de salida casi un 60 % más bajo y aun así costar más.
¿Qué dejaron fuera los gráficos?
La página de lanzamiento de Mistral incluye unos veinte gráficos de benchmarks. Los repasé uno por uno.
Los gráficos de código comparan Large 4 solo con modelos abiertos, y no lidera ninguno. Kimi K3 saca 68 frente a sus 62 en DeepSWE 1.1. GLM-5.3 saca 40 frente a sus 28 en Terminal-Bench 4.0. DeepSeek V4 Pro saca 66 frente a sus 59 en SWE-Atlas-QnA. El texto nombra los dos modelos a los que supera su puntuación de código combinada.
Los modelos cerrados se eligen con cuidado. GPT-6 Astra, el buque insignia de OpenAI a 10 $ y 50 $, aparece en siete gráficos. Claude Opus 5.5 aparece una vez, en el Artificial Analysis Cyber Index, dibujado con sus bloqueos de seguridad, ya que el argumento de Mistral ahí es que los modelos cerrados rechazan el trabajo de seguridad. El anterior Claude Opus 5 aparece dos veces, y supera a Large 4 en una evaluación humana a ciegas sobre código, 4,22 a 3,74.
El gráfico más cercano a mi trabajo es el benchmark Legal Agent de Harvey, ejecutado por vals.ai: Large 4 con 15,8, GPT-6 Astra con 5,4, ningún modelo Claude. El Legal Index de Artificial Analysis, un compuesto más amplio, invierte el orden: GPT-6 Astra entre 52,9 y 58,2 según el esfuerzo, Large 4 con 37,0, y Sonnet 5.5 con esfuerzo medio con 43,7.
Lo que no aparece en ninguna parte: Claude Sonnet 5.5 y GPT-6.1 Sol, los dos modelos con el precio más cercano, y la puntuación de 38 en el Intelligence Index. Es un comportamiento normal en un lanzamiento. También es información.
Lo que hago el lunes
Nada cambia en producción. Tres cosas van a la lista.
Primero, si pruebas Large 4 con algo sensible, envíalo a api.eu.mistral.ai, llama antes a models.list allí para confirmar que el modelo se sirve en esa región, y pide la retención cero de datos antes del primer documento real, no después.
Segundo, ejecútalo sobre tu propio conjunto de evaluación en los dos niveles de razonamiento que expone la API, "none" y "high", y anota el coste por tarea completada, tokens incluidos. Artificial Analysis ya sugiere que te sorprenderá.
Tercero, trata la licencia como una puerta. El autoalojamiento es la verdadera razón por la que un CTO europeo elegiría este modelo en lugar de una API estadounidense, y ese plan no puede empezar hasta que exista el texto de la licencia. Puse un recordatorio el 31 de octubre.
Si los pesos llegan bajo una licencia permisiva y el modelo responde bien con nuestros documentos, será la opción europea más interesante para equipos como el mío. Hasta entonces, es una API prometedora con dirección europea.
Fuentes
- Mistral AI, "Introducing Mistral Large 4" (6 de octubre de 2026)
- Mistral Docs, "Mistral Large 4" (leído el 7 de octubre de 2026)
- Mistral Docs, "Models Overview" (leído el 7 de octubre de 2026)
- Mistral Docs, "Mistral Large 2.1" (leído el 7 de octubre de 2026)
- Mistral Docs, "Mistral Large 3" (leído el 7 de octubre de 2026)
- Mistral Docs, "Pricing" (leído el 7 de octubre de 2026)
- Mistral Docs, "Regional inference" (leído el 7 de octubre de 2026)
- Mistral Docs, "Zero data retention" (leído el 7 de octubre de 2026)
- Simon Willison, "Introducing Mistral Large 4: Le chonk" (6 de octubre de 2026)
- TechCrunch, "Mistral's new 1T model aims to leapfrog closed and open rivals" (6 de octubre de 2026)
- Le Monde, "Mistral AI lance un nouveau modèle d'IA censé « réduire l'écart » avec les meilleurs concurrents chinois" (6 de octubre de 2026)
- Reflection AI, "Introducing Beam: Reflection's 501B open-weight model" (5 de octubre de 2026)
- TechCrunch, "Reflection debuts Beam, an open-weight AI model to rival Chinese models at lower compute cost" (5 de octubre de 2026)
- Artificial Analysis, "Mistral Large 4 Preview: Intelligence, Performance & Price Analysis" (leído el 7 de octubre de 2026)
- Anthropic, "Pricing" (leído el 7 de octubre de 2026)
- Anthropic, "Data residency" (leído el 7 de octubre de 2026)
- OpenAI, "Pricing" (leído el 7 de octubre de 2026)
