Jev, un juez para fact-checkear al redactor

Los posts de mi último lote los escribió un modelo grande y los revisó uno pequeño que no sabe escribir una frase.
Eso no es un eslogan, es la arquitectura. El modelo grande es Claude Opus 5.5, que cuesta 4 $ por millón de tokens de entrada. El pequeño es Jev, de una empresa llamada TypeSafe, que cuesta 0,042 $ por millón de tokens de entrada, con los tokens de salida gratis. Unas 95 veces más barato en la entrada. Y la parte que hace la aritmética no es ninguno de los dos. Es código.
Así es como funciona, qué encontró, y dónde todavía falla.
Un modelo que solo responde preguntas
Jev es lo que TypeSafe llama un modelo System One. No genera texto ni explicaciones. Le das un estado, un fragmento de texto o un objeto JSON, y una o varias preguntas tipadas. Devuelve respuestas tipadas: la probabilidad de que una pregunta de sí o no sea sí, una elección entre opciones que tú defines con una probabilidad para cada una, o una puntuación en niveles que describes.
Suena limitado hasta que te das cuenta de cuánto del fact-checking tiene exactamente esa forma. ¿Esta frase es una afirmación factual? ¿Este pasaje respalda esta afirmación, la contradice, o no dice nada al respecto? Son juicios, no redacción.
El pipeline
Construí el verificador el 22 de septiembre, después de hacer el mismo trabajo para mi lote de septiembre con un flujo de 36 agentes corriendo en modelos caros. Funciona en cinco pasos.
Primero, la selección. Jev lee el borrador frase por frase y dice cuáles afirman algo verificable. Las opiniones, las preguntas y las hipótesis quedan fuera.
Segundo, la evidencia. Para cada afirmación, el código extrae los tres pasajes de cada fuente que comparten más palabras y números con ella, y los fusiona en el orden de las páginas. Lo aprendí de la manera difícil: una frase que lleva cinco datos repartidos en dos párrafos nunca puede confirmarse con una sola ventana de tres frases.
Tercero, el juicio. Jev lee la afirmación frente a la evidencia de cada fuente y responde: respalda, contradice, o información insuficiente.
Cuarto, las reglas de conflicto, escritas en código. Una contradicción de una fuente vence a una confirmación de otra; esa regla salió de un caso real en el que dos páginas oficiales daban dos fechas distintas para la misma decisión. Y una contradicción solo cuenta si la evidencia contiene al menos la mitad de las palabras de la afirmación, para que el juez esté mirando el mismo hecho. En mis primeros casos, las contradicciones verdaderas se situaban en 0,71 y 0,73, las falsas en 0,36 o menos. Probé a preguntarle a Jev «¿es este el mismo hecho?» en su lugar. Calificó una contradicción real con 0,43, así que volví a contar palabras.
Quinto, y el más importante: los números nunca llegan al modelo. Cada cifra de una afirmación debe aparecer en la evidencia, o derivarse de dos cifras de la evidencia mediante una sola operación, o mediante una conversión de unidades. La tolerancia es del 1,5 %, del 10 % cuando la frase dice «aproximadamente». Una afirmación cuyas cifras cuadran todas por cálculo queda resuelta por el cálculo.
Lo que encontró
En un artículo real de mi lote de septiembre, ya programado, encontró dos errores de dos, sin ninguna falsa alarma. Tardó seis segundos y costó cerca de un tercio de centavo.
En un artículo correcto, disparó una falsa alarma: un ejemplo que yo había inventado para ilustrar un punto, y que estaba lógicamente ausente de las fuentes.
En ese mismo artículo con tres errores inyectados, entre ellos un importe equivocado y un número de horas equivocado, atrapó dos de los tres.
Tres artículos no son una calibración. Lo digo en la documentación y lo digo aquí también. Es un comienzo.
También hizo un trabajo más pequeño esta semana. Antes de escribir nada, le di a Jev los 29 titulares tech de la semana recopilados por mi radar de noticias, y le pedí que calificara cada uno como tema para un post dirigido a desarrolladores y fundadores. Veintinueve llamadas, poco más de doce mil tokens, y una factura por debajo de una décima de centavo. Puso la guerra de precios entre modelos y una demanda contra OpenAI en primer lugar, justo donde yo los habría puesto.
Dónde falla
No busca. Comprueba un borrador frente a las fuentes que yo le doy. Una afirmación sin fuente vuelve como «no confirmada», no como «falsa».
No sabe qué existe. Si un borrador menciona una versión de software que nunca se publicó, Jev solo lo señalará si una fuente dice algo distinto. La regla que ya tenía, comprobar cada número de versión antes de publicar, sigue en pie.
Y tiene un punto ciego conocido. Una frase corta que solo lleva una fecha comparte muy pocas palabras con cualquier pasaje, así que su contradicción queda filtrada por la regla del mismo hecho y vuelve como «no confirmada». Alguien tiene que leerlas. Ejecutarlo sobre este mismo lote sacó a la luz una prima del mismo problema: un porcentaje que estaba correctamente en la fuente quedó marcado como «verificado por cálculo» por una coincidencia de proporción entre dos números sin relación. La cifra era correcta; la prueba no lo era. Esa va a mi lista.
El principio
El diseño tiene una sola idea debajo: el modelo caro solo debería ver lo que el barato no pudo resolver. El código hace el conteo. El juez hace la lectura. El redactor hace la redacción. Y el resto incierto, que suele ser corto, va a un modelo más fuerte o a mí.
Hace un año habría usado un solo modelo grande para todo y habría llamado al resultado «revisado». Ahora la revisión cuesta menos que el café que bebo mientras leo su informe, y me dice exactamente qué frases no pudo garantizar.
Fuentes
- Documentación de TypeSafe, «Models» (precio de Jev, facturación solo de entrada)
- Documentación de TypeSafe, «Introduction»
- Anthropic, «Introducing Claude Opus 5.5», 22 de septiembre de 2026 (precio de Opus 5.5)
- mis propias mediciones, el 22 y 23 de septiembre de 2026
