Volver al blog
IA y Moderación

La moderación ya tiene un modelo de decisión que lee tu política en 35 milisegundos. El umbral es ahora la política

7 de octubre de 2026 6 min de lectura

El martes 6 de octubre, una empresa llamada Musubi publicó PolicyLM-1.7B, un modelo de pesos abiertos con licencia Apache 2.0, creado para una sola tarea: la moderación de contenido. Le das un mensaje y tu propia política de contenido, escrita en reglas cortas en lenguaje natural, y devuelve una puntuación entre 0 y 1 para cada categoría de esa política. No genera texto. En una sola NVIDIA L4 de 24 GB, Musubi mide una mediana de 35 milisegundos por mensaje de chat corto, con hasta seis categorías.

TechCrunch presentó el lanzamiento como la llegada de los modelos de decisión a la moderación. La categoría tiene tres semanas. TypeSafe lanzó Jev el 15 de septiembre. OpenAI anunció una Decisions API en la DevDay el 29 de septiembre, que devuelve respuestas que los desarrolladores pueden usar para "classify content, route requests, or choose an agent's next action" (clasificar contenido, enrutar solicitudes o elegir la siguiente acción de un agente). El 1 de octubre, Strands Labs de Amazon publicó Strands Decider 2B en código abierto. Musubi no esconde el parentesco: "If Jev caught your eye, PolicyLM-1.7B is the same kind of model, trained specifically for content moderation, that you can run yourself." (Si Jev te llamó la atención, PolicyLM-1.7B es el mismo tipo de modelo, entrenado específicamente para moderación de contenido, que puedes ejecutar tú mismo.)

Uso Jev a diario para pequeñas decisiones de sí o no, como comprobar las afirmaciones de mis propios posts. No modero una plataforma. Pero la moderación es el lugar donde responder con un número en vez de un veredicto importa más.

El mayor problema de decisión de internet

El 7 de octubre, la base de datos de transparencia del DSA de la UE, donde las plataformas en línea presentan la "exposición de motivos" que deben a un usuario cada vez que eliminan o restringen su contenido, mostraba 4.301.448.066 exposiciones presentadas en los últimos 180 días por 374 plataformas. El cuarenta por ciento eran decisiones totalmente automatizadas.

Cada exposición lleva un campo obligatorio que indica si la decisión fue totalmente automatizada, parcialmente automatizada o no automatizada. Ninguno de los campos documentados registra cuán segura estaba la máquina. La Comisión Europea describe la exposición como una herramienta para ayudar a los usuarios a "entender y, en su caso, impugnar las decisiones de moderación de contenido".

Hasta ahora, la parte automatizada se ha apoyado sobre todo en dos herramientas. Los clasificadores fijos son rápidos y baratos, pero puntúan sus propias categorías integradas, así que cambiar una regla implica reetiquetar datos y reentrenar. Los grandes modelos de lenguaje leen tu política real, pero en la comparación de Musubi suelen tardar cientos de milisegundos o más por comprobación, demasiado lento y caro para un chat en vivo.

Un modelo de decisión se sitúa entre ambos. Lee la política como un LLM y responde a la velocidad de un clasificador. Lo interesante no es la velocidad. Es que la respuesta es un número.

Qué cambia cuando quien decide es un número

Los umbrales pasan a ser por contexto. PolicyLM trae dos ajustes predefinidos: "precision", el predeterminado, en 0,335, para superficies donde las infracciones son raras, como el chat en vivo, y "balanced" en 0,275, para colas donde un fallo cuesta más que una falsa alarma. Cada categoría puede tener su propio umbral. La documentación de TypeSafe coincide: "A confidence threshold is not one number." (Un umbral de confianza no es un solo número.) Un nombre de usuario, un mensaje directo y un anuncio de marketplace no merecen el mismo umbral, y un equipo de políticas ahora puede moverlo sin un ciclo de reentrenamiento. El umbral es la política, escrita en el único idioma que el modelo obedece.

Con el ajuste predeterminado, una puntuación de 0,34 marca un mensaje. Es una puntuación, no la promesa de que un tercio de esos mensajes incumple las reglas. TypeSafe define la calibración como que los resultados con 0,8 ocurran alrededor del 80 % de las veces "across many predictions" (a lo largo de muchas predicciones). Medir si los números de un modelo significan eso con tu tráfico te corresponde a ti; el propio Musubi dice que hay que calibrar con tu propio contenido antes de salir a producción.

Las apelaciones pueden reproducir una decisión, si la conservaste. Una apelación plantea una sola pregunta: ¿fue correcta esta eliminación según las reglas vigentes ese día? Si guardaste la puntuación, la categoría, la versión de la política, el umbral y la revisión del modelo, puedes responder con exactitud, y decir si pasaría hoy. Defendí ese patrón en Store the Probability, Never the Verdict. La moderación es donde más rinde.

No reproduzcas volviendo a ejecutar el modelo. La ficha del modelo de PolicyLM señala que las lecturas en bfloat16 en CUDA y en Apple silicon diferían hasta 0,083, y que el float32 en CPU cambiaba algunas decisiones; para puntuaciones exactas y repetibles recomienda float32. TypeSafe pasó una rúbrica de moderación sobre una publicación límite 15 veces: Jev mantuvo su etiqueta principal el 90,8 % de las veces y cambió en 2 de 8 preguntas. Su documentación añade que un umbral "does not make the model deterministic" (no vuelve determinista al modelo). El registro es el documento de referencia. El modelo, no.

La auditabilidad se vuelve más honesta. Un modelo de decisión no escribe ninguna razón, y Musubi incluye "No reasons provided" (no se dan razones) entre sus limitaciones. Para las exposiciones de motivos, creo que eso se acerca más a una virtud. Un registro como "comercio fuera de la plataforma, política versión 14, puntuación 0,71, umbral 0,335" es una razón que cualquiera puede comprobar. Una justificación generada a posteriori puede no describir cómo se llegó al veredicto.

El coste por decisión se desploma. Jev cuesta 42 $ por mil millones de tokens de entrada, y las salidas son gratis. Una llamada de 2000 tokens, política más mensaje, cuesta 0,000084 $, así que un millón de decisiones cuestan 84 $. La ficha de PolicyLM dice que una L4 sostuvo 34,4 mensajes por segundo con un p95 de 150 milisegundos o menos; son casi tres millones de mensajes al día en una sola tarjeta. La propuesta de Musubi: "score all of your traffic instead of sampling it" (puntúa todo tu tráfico en vez de muestrearlo). La moderación pasa del muestreo al censo.

Dónde sigue fallando

Los usuarios adversarios. La ficha del modelo declara "a security boundary against adversarial users" (una frontera de seguridad contra usuarios adversarios) fuera de alcance. El limpiador de texto incluido deshace caracteres parecidos, letras espaciadas y base64, y detectó entre 10 y 12 puntos más de infracciones disfrazadas en el conjunto de prueba de Musubi, pero "leetspeak mostly gets through" (el leetspeak pasa en su mayor parte). Quien intenta saltarse un filtro itera más rápido que cualquier equipo de políticas.

La deriva. La ficha advierte que las puntuaciones cambian con "policy wording, language, device and numeric format" (la redacción de la política, el idioma, el dispositivo y el formato numérico). Editar la política tampoco sale gratis: en el benchmark de Musubi, alrededor de 1 de cada 2 ediciones de una sola cláusula cambiaba realmente la decisión. Los modelos alojados también se mueven: el alias jev-latest de Jev apunta actualmente a jev-1.13.0, y cada respuesta nombra la versión que respondió. Y lee la ficha junto a la entrada del blog. La entrada dice que un PolicyLM afinado a medida funciona en una plataforma que maneja más de un millón de mensajes al día. La ficha de los pesos publicados dice "Not yet tested on live traffic" (aún no probado con tráfico real).

La precisión todavía se compra con tiempo. En el benchmark de políticas personalizadas de Musubi, el gpt-oss-safeguard-20B de OpenAI, de pesos abiertos, logra 0,909 de precisión frente a 0,842 de PolicyLM y sigue 0,716 de las ediciones de política frente a 0,528, con una mediana de 349 milisegundos por mensaje frente a 22, ambos en un solo H100. La propia comparación de Musubi envía las apelaciones, los baneos y las retiradas a modelos más grandes.

La cola humana. En la prueba de caso límite de TypeSafe, un mínimo de 0,60 elevó el acuerdo al 99,2 %, pero solo el 74,2 % de las respuestas fueron automáticas; el resto pasó a revisión humana. Es una sola publicación difícil, no una tasa. La lección se mantiene igualmente: un decisor barato no elimina la cola. Tus umbrales deciden qué tamaño tiene, así que fíjalos con el número de tus revisores sobre la mesa.

Qué haría el lunes

Registrar cada decisión automatizada como una fila: puntuación, categoría, versión de la política, umbral vigente, revisión del modelo, formato numérico. Fijar umbrales por superficie, no por plataforma. Definir una banda de incertidumbre explícita y seguir su volumen diario frente a lo que tus revisores pueden despachar. Construir una muestra etiquetada con tu propio tráfico y comprobar cada mes que los mensajes puntuados en torno a 0,7 son infracciones más o menos tan a menudo como suponías. Fijar las versiones del modelo. Responder a las apelaciones desde el registro.

Luego, preguntar quién ejecuta el modelo. En la LegalTech que construyo, los documentos de los clientes son sensibles, así que dónde se ejecuta un modelo es una pregunta que hago antes que la precisión. Para moderar mensajes privados, los pesos abiertos en tu propia infraestructura no son un detalle.

El modelo te da un número. Qué significa ese número sigue siendo una decisión de política, y ahora merece la misma revisión que el texto de la política.

Fuentes

¿Un proyecto del mismo estilo?

Diseño y despliego productos como este. Hablemos.

Hablemos