ISMS Copilot
Engineering

El intercambio de no inferioridad: cómo implementamos cambios de modelos con un empate en calidad

Tres reglas de decisión pre-registradas movieron tres interfaces de chat a GLM 5.3 el 2026-09-01: el cambio (Grok 4.6 a GLM 5.3) obtuvo 1.7 puntos menos en nuestro conjunto de calidad de cuatro tareas y redujo la latencia mediana del primer token de 88.9 segundos a 4.2 en nuestra sonda de latencia.

por ISMS Copilot··14 min read
El intercambio de no inferioridad: cómo implementamos cambios de modelos con un empate en calidad

El 2026-09-01 movimos nuestra superficie de chat de pago (modo pensamiento) de Grok 4.6 (razonamiento activado) a GLM 5.3 (esfuerzo alto) tras una evaluación en la que el modelo retador obtuvo 1.7 puntos menos en calidad de respuesta. En nuestro prompt de producción, el primer token de contenido del modelo titular tardó una mediana de 88,906 ms; el del modelo retador, 4,169 ms. La misma evaluación también movió la superficie de pago rápida (una victoria directa de +10.0 puntos) y ambos modos de la superficie gratuita (+13.3 y +11.7 puntos). Las tres superficies ejecutan hoy el modelo retador en producción, con los modelos anteriores a solo una variable de entorno de distancia. Llamamos a esta práctica intercambio de no inferioridad, y creemos que es la forma correcta de realizar cambios de modelos en producción: el trabajo de la evaluación no es encontrar un ganador, sino establecer, bajo reglas congeladas antes del proceso, que el modelo retador no pierde, y luego dejar que las dimensiones que los usuarios realmente sienten (latencia del primer token, colas, fiabilidad) rompan el empate.

Por qué falla la puerta intuitiva

La mayoría de los equipos gestionan un cambio de modelo de la forma obvia: ejecutan una evaluación y solo implementan si el nuevo modelo obtiene una puntuación más alta. Dos cosas rompen esa puerta.

En primer lugar, en tareas reales de producto, las diferencias de calidad entre los modelos de vanguardia actuales suelen ser más pequeñas que la capacidad del juez para medirlas. Nuestra evaluación de cumplimiento de 20 tareas midió la fluctuación de test-retest del juez en 18.2 puntos en una escala de 100, y registró su veredicto como empate exactamente por esa razón (el proceso se llevó a cabo al día siguiente de este cambio; lo documentamos aquí). Una puerta que exige mejora en ese instrumento casi nunca se activa de manera honesta. Una puerta sin uno envía a producción basándose en ruido.

En segundo lugar, una puerta de mejora estricta crea incentivos equivocados: o nada se implementa nunca, o alguien re-ejecuta la evaluación hasta que el ruido favorezca al modelo retador.

La alternativa se toma de los ensayos clínicos. Un ensayo de no inferioridad no pregunta si el nuevo tratamiento es mejor, solo si es aceptablemente no peor, dentro de un margen definido antes de que existan datos. Tomemos el diseño al por mayor: pre-registremos una banda de empate y las protecciones operativas, ejecutemos una vez y hagamos que el veredicto sea mecánico.

El montaje: tres superficies, tres reglas congeladas

Evaluamos tres superficies de chat en producción del mismo producto, un mismo arnés de evaluación, un solo proceso. Cada superficie tuvo su propia regla de decisión, congelada el 2026-09-01 antes de que se realizara ninguna llamada:

SuperficieModelo titularModelo retadorRegla pre-registrada
Pago rápidaGLM 5.2GLM 5.3-Flash, esfuerzo bajoCalidad dentro de 5.0 puntos Y latencia mediana del primer token no materialmente peor Y p90 por debajo de la carrera de reserva de 8 s Y tasa de cola >10 s no peor en más de 5 pp
Pago pensamientoGrok 4.6, razonamiento activadoGLM 5.3, esfuerzo altoCalidad dentro de la banda de empate de 5.0 puntos gana el cambio
Gratuita (sesión cerrada y reserva por exceso de cuota)GLM 4.7GLM 5.3-Flash, esfuerzo bajoCalidad dentro de 5.0 puntos Y latencia mediana del primer token por debajo de 2x el titular

La banda de empate fue de 5.0 puntos en la métrica de calidad, congelada en el plan, sin ajustes tras ver las puntuaciones. Una protección se congeló en prosa en lugar de como un número: la regla de la superficie de pago rápida dice que la mediana del primer token del modelo retador debe ser "no materialmente peor", sin umbral adjunto. El plan es el plan, y esa protección requirió una llamada de juicio en la sección de resultados; la solución es un umbral numérico la próxima vez, y está en la lista de verificación. Nuestra capa de streaming cae a un estado de espera tras 8 segundos sin primer contenido en superficies rápidas y 120 segundos en superficies de pensamiento, por lo que las protecciones de latencia se escribieron frente a esos presupuestos reales.

Método, tal como se congeló:

  • El prompt era el ensamblaje de producción. 22,445 caracteres: el prompt de estilo conciso, la inyección de conocimiento del framework construida a partir de la pregunta, el bloque del espacio de trabajo, la fecha. Byte-idéntico en todos los brazos. Un prompt demo compacto habría medido un producto diferente.
  • Cuatro tareas, tres tareas de respuesta GRC de larga duración más una tarea de política basada en espacio de trabajo nativa de chat, cada una puntuada en una rúbrica de 5 criterios de 0-2. Tres muestras por brazo por tarea a temperatura 0.
  • Un modelo juez puntuó cada salida a ciegas: Grok 4.3, ejecutado a través de OpenRouter, sin etiquetas de brazo, sin conocimiento de qué modelo produjo qué. Comparte una familia de proveedores con exactamente un brazo, el titular de pensamiento. La auto-preferencia en evaluadores LLM está documentada cuando el juez puntúa sus propias generaciones (Panickssery, Bowman y Feng, arXiv:2404.13076, 2024-04-15), y los sesgos de posición y verbosidad están catalogados en configuraciones de LLM-como-juez (Zheng et al., arXiv:2306.05685, 2023-06-09). Ninguno de los dos trabajos mide el sesgo a nivel de familia, y ninguno lo hicimos nosotros, por lo que registramos la dirección del riesgo en lugar de asumir neutralidad: si existe favoritismo familiar aquí, infla al titular, lo que sesga el cambio de pensamiento de manera conservadora, no permisiva.
  • Las líneas base del titular se regeneraron frescas en el mismo proceso. Nuestra evaluación de junio del mismo titular usó un juez diferente y un ensamblaje de prompt anterior, por lo que reutilizar sus números almacenados habría comparado dos instrumentos diferentes. Mismo juez, mismo día, mismo ensamblaje, o la comparación no es concluyente.
  • Un techo de gasto pre-registrado con aborto automático, y timeouts por llamada estrictos.

Los resultados

La calidad es la puntuación media del juez como porcentaje del máximo de la rúbrica; 12 generaciones puntuadas por brazo (4 tareas, 3 muestras), 2026-09-01:

SuperficieBrazoCalidad
Pago rápidaGLM 5.2 (titular)81.7
Pago rápidaGLM 5.3-Flash, esfuerzo bajo91.7
Pago pensamientoGrok 4.6, razonamiento activado (titular)91.7
Pago pensamientoGLM 5.3, esfuerzo alto90.0
Gratuita rápidaGLM 4.7 (titular)80.0
Gratuita rápidaGLM 5.3-Flash, esfuerzo bajo93.3
Gratuita pensamientoGLM 4.7, razonamiento activado (titular)80.8
Gratuita pensamientoGLM 5.3-Flash, esfuerzo bajo92.5

La latencia es el tiempo hasta el primer token de contenido en una conexión de streaming; seis repeticiones por brazo en una tarea de producción basada en espacio de trabajo (el mismo ensamblaje de prompt de 22,445 caracteres que el banco de calidad), 2026-09-01:

BrazoTTFC p50TTFC p90Repeticiones >10 s
Pago rápida: GLM 5.2773 ms2,626 ms0 de 6
Pago rápida: GLM 5.3-Flash2,641 ms4,011 ms0 de 6
Pago pensamiento: Grok 4.688,906 ms101,591 ms6 de 6
Pago pensamiento: GLM 5.34,169 ms57,707 ms2 de 6
Gratuita rápida: GLM 4.72,857 ms3,163 ms0 de 6
Gratuita rápida: GLM 5.3-Flash3,350 ms3,640 ms0 de 6
Gratuita pensamiento: GLM 4.718,014 ms24,156 ms6 de 6
Gratuita pensamiento: GLM 5.3-Flash3,052 ms7,612 ms0 de 6

Aplicadas mecánicamente, las reglas congeladas dieron tres veredictos:

  • Pago rápida: IR, y la superficie se volvió más lenta. Calidad +10.0 puntos. El primer token 3.4x más lento (773 ms a 2,641 ms mediana), pero p90 en 4.0 s frente a la carrera de 8 s y cero repeticiones por encima de 10 s en ambos lados. Aquí es donde el veredicto dejó de ser completamente mecánico: la protección en prosa ("no materialmente peor") no tiene umbral, y juzgamos que 2.6 s mediana con un p90 de 4.0 s y sin colas lo supera. Esa llamada se registra aquí en lugar de lavarla en un umbral que nunca existió. Si los usuarios perciben 2.6 s como peor que 0.8 s no es algo que esta evaluación midiera; lo que estableció es que la protección tal como se congeló pasó, y que un requisito de ser más rápido que el titular habría vetado un cambio que las reglas congeladas puntuaron como una victoria de calidad directa.
  • Pago pensamiento: IR en un empate. 90.0 frente a 91.7 es -1.7 puntos, dentro de la banda de 5.0 puntos. Frente a eso, la mediana de 88.9 segundos del titular en nuestro sondeo (6 de 6 repeticiones por encima de 10 s) se convirtió en una mediana de 4.2 segundos (2 de 6 por encima de 10 s, y el p90 del titular ya estaba por encima de 100 s). Una mejora de 21x en el número que los usuarios sienten, por 1.7 puntos que se sitúan dentro de la banda de empate pre-registrada.
  • Gratuita: IR. +13.3 puntos en modo rápido, +11.7 en modo pensamiento, y el antiguo brazo de pensamiento de 18.0 segundos mediana con 6 de 6 colas se convirtió en 3.1 s sin ninguna.

El veredicto de pensamiento es el que merece discutirse, así que aquí está el argumento completo. La banda pre-registrada dice que una brecha de 1.7 puntos no es una diferencia de calidad. La fluctuación de re-test de 18.2 puntos que nuestra evaluación de cumplimiento midió al día siguiente, en un conjunto de tareas y rúbrica diferente, es la única medición directa que tenemos de la resolución del juez en nuestros instrumentos, y se sitúa un orden de magnitud por encima de esta brecha. Ninguno de los dos números es un intervalo de confianza sobre esta brecha en particular, y la banda es una regla de decisión, no un suelo de ruido medido. Pero ambos apuntan en la misma dirección. Mantener la superficie de pensamiento en 1.7 puntos que nuestros instrumentos no resuelven, mientras la mediana del primer token del titular en nuestro sondeo se situaba en 89 segundos, invierte las prioridades: el número que los usuarios sienten primero es la latencia, y se movió 21x en nuestra medición.

Un veredicto tiene una vida útil

En junio de 2026 evaluamos GLM 5.2 (lanzado el 2026-06-16) como reemplazo de GLM 4.7 en el mismo producto, y el veredicto del 2026-06-18 fue no reemplazar: dos jueces ciegos independientes puntuaron que era un par de calidad de GLM 4.7, con empates exactos tras excluir un error de infraestructura, pero falló las puertas operativas de manera decisiva, sobre todo en la latencia de pensamiento: una mediana de 93 s hasta el primer token de contenido frente a los 2.1 s de GLM 4.7 en nuestras tareas y configuración, una brecha de 44x.

Tres meses después, su sucesor superó al mismo titular de manera directa en ambos modos gratuitos de la evaluación de septiembre. Dos conclusiones que ahora tratamos como reglas permanentes.

Los veredictos de los modelos tienen una vida útil medida en meses. Una llamada de "par de calidad, no implementable operativamente" es un veredicto sobre un modelo en un momento dado, no sobre el puesto; el puesto recibió un modelo diferente y el veredicto cambió. Esta es otra razón por la que regeneramos las líneas base del titular en cada evaluación de cambio en lugar de citar las almacenadas: las líneas base almacenadas comparan en silencio entre instrumentos, y los veredictos obsoletos comparan en silencio entre generaciones de modelos. El número de junio era cierto. No lo heredamos, y no nos vinculaba.

Dos cosas que el arnés capturó

Generaciones vacías con un límite ajustado. El primer pase de latencia el 2026-09-01 ejecutó cada brazo con un límite de finalización de 256 tokens. Las doce filas de los dos brazos de pensamiento GLM (GLM 4.7 y GLM 5.2, seis cada uno) volvieron vacías: el canal de razonamiento consumió el presupuesto antes de que existiera el primer token de contenido, por lo que la fila midió el límite, no el modelo. El brazo de Grok 4.6 pensamiento hizo streaming sin problemas con el mismo límite. Invalidamos el pase y re-ejecutamos los brazos de pensamiento GLM con un límite de 4,096 tokens antes de leer ningún percentil; el banco de calidad había usado un presupuesto de 16k en todo momento y no se vio afectado. Esta es la misma clase de fallo que el cero silencioso sobre el que escribimos en agosto (datos sin nada en ellos, puntuados como una medición). La protección barata no es glamurosa: contar las generaciones vacías por brazo y negarse a agregar cualquier brazo cuyo conteo vacío sea distinto de cero.

La forma de la solicitud del titular no se transfiere. Sondeamos si la configuración anterior podía copiarse en el retador. En nuestras pruebas de API del 2026-09-01, 24 de 24 llamadas en GLM 5.3 y GLM 5.3-Flash que llevaban reasoning: {enabled: false} en la ruta que probamos devolvieron HTTP 400, por lo que en nuestras sondas, el razonamiento no puede desactivarse en esta familia; el esfuerzo bajo es el suelo, no un control. Una migración de modelo re-deriva la configuración de la solicitud del comportamiento real del retador. Cada parámetro que copies del titular sin volver a probarlo es un factor de confusión que introduces en tu propia evaluación.

Lo que esto reclama y no reclama

Los números de calidad provienen de 12 generaciones puntuadas por brazo (4 tareas, 3 muestras, temperatura 0), un modelo juez, sin calibración humana de las rúbricas de chat, un solo proceso en un día (2026-09-01), solo en nuestro ensamblaje de prompt y configuración de servicio. La banda de empate de 5.0 puntos fue una regla de decisión pre-registrada, no un suelo de ruido medido para este instrumento; nuestra evaluación de cumplimiento de 20 tareas, ejecutada al día siguiente (2026-09-02) en un conjunto de tareas y escala de rúbrica diferentes, midió 18.2 puntos de fluctuación de test-retest del juez, por lo que tratamos las diferencias de calidad dentro de la banda como no medidas, no como cero. Los percentiles de latencia provienen de 6 repeticiones de streaming por brazo en una tarea de espacio de trabajo, nuestro ensamblaje de prompt, nuestra configuración, ese día: propiedades de nuestro montaje, no de benchmarks de proveedores. Todos los resultados son puntuales a fecha del 2026-09-01. Una publicación pública de nuestra metodología de benchmark, incluyendo cómo medimos la fluctuación del juez, está en la página de calidad del modelo.

La lista de verificación

Antes de tu próximo cambio de modelo en producción:

  1. Congela la regla de decisión por superficie antes del proceso: banda de empate, protecciones de latencia, protecciones de colas, techo de gasto y qué significa un empate.
  2. Dimensiona la banda de empate a partir de la fluctuación de test-retest de tu juez en tus rúbricas. Si nunca has vuelto a juzgar respuestas idénticas, no sabes cuán pequeñas son tus diferencias de calidad medibles.
  3. Evalúa con el ensamblaje de prompt de producción, byte-idéntico en todos los brazos. Un prompt demo mide un producto que no ejecutas.
  4. Regenera las líneas base del titular en el mismo proceso, mismo juez, mismo día. Las líneas base almacenadas son comparaciones entre instrumentos.
  5. Protege las colas, no las medias: latencia p90 del primer token y la tasa de >10 s, frente a tus reservas reales de streaming.
  6. Cuenta las generaciones vacías por brazo y rechaza puntuar cualquier brazo que las tenga. Corrige el presupuesto de finalización, luego mide.
  7. Re-deriva la configuración de la solicitud para el retador, incluyendo los parámetros de razonamiento. Nunca copies la forma del titular en la evaluación.
  8. Conoce en qué dirección el sesgo familiar de tu juez empuja la decisión y diseña para que sea conservador.
  9. Pon una fecha de caducidad en cada veredicto. Re-ejecuta cualquier cosa mayor de un trimestre.

Un empate no es indecisión. Es el veredicto que tu evaluación de calidad puede defender realmente, y pre-registrarlo es lo que entrega la decisión a los números que sienten tus usuarios.

Artículos relacionados

La estrategia de precios 'frontier' no es una estrategia de cumplimiento
Engineering

La estrategia de precios 'frontier' no es una estrategia de cumplimiento

Los agentes de cumplimiento son hornos de tokens: entrada de evidencia, referencias de marcos, análisis de salida. Ejecutamos la API de ISMS Copilot en GLM 5.2 con conocimiento de marcos curado inyectado en la inferencia, a $2.80/$8.80 por millón de tokens y una vía masiva a $0.50/$2.00. Aquí está la matemática de precios frente a la lista de precios de Claude, y la evidencia de por qué un modelo no 'frontier' cumple en el trabajo de cumplimiento.

·9 min read
El cero silencioso: cuando una puntuación faltante de juez se convierte en una medición
Engineering

El cero silencioso: cuando una puntuación faltante de juez se convierte en una medición

En nuestra ablación del 17 de julio de 2026 sobre estrategias de generación de documentos GRC (GLM-5.2 y Claude Opus 4.8 como escritores y jueces con rúbrica de 1-10), el pase 2 tuvo 79 de 446 filas de juicio registradas sin una puntuación general. El agregador contó cada una como 0. El mismo relleno con ceros había fabricado un efecto de 3.25 puntos en el pase 1, y cuando desapareció, escribimos una teoría sobre el sesgo del juez para explicar por qué. El desplazamiento emparejado entre los dos jueces en los mismos documentos fue de 0.12.

·16 min read