Benchmarkamos ISMS Copilot frente al modelo desnudo y al mejor prompt DIY. El veredicto pre-registrado es empate.
Una evaluación congelada de 20 tareas en seis configuraciones de GLM 5.3-Flash: qué cambió el módulo de conocimiento, dónde el producto y el mejor prompt independiente empataron bajo la regla congelada, y dónde el brazo de conocimiento más documentos superó al producto.

En este conjunto congelado de 20 tareas de cumplimiento, el mismo modelo base obtuvo puntuaciones diferentes según el andamiaje que lo rodeaba; el mayor aumento se produjo cuando se inyectó conocimiento curado de marcos normativos en tiempo de inferencia, especialmente en marcos menos conocidos. Congelamos las tareas y la regla de decisión antes de la ejecución, mantuvimos el veredicto de empate pre-registrado y publicamos las pérdidas.
La configuración
Seis brazos. Mismo modelo para cada brazo (GLM 5.3-Flash, configuración de razonamiento idéntica, presupuesto de salida y pin de servidor), mismas veinte preguntas. La única variable es lo que rodea la solicitud:
| Brazo | Lo que recibe el modelo |
|---|---|
| Desnudo | La pregunta. Nada más. |
| DIY prompt A / B | Dos prompts de "consultor senior en GRC" escritos de forma independiente, creados sin ver las tareas |
| DIY + conocimiento | Prompt A más el módulo de referencia de marcos normativos curado que nuestro sistema inyecta |
| DIY + conocimiento + documentos | Lo anterior, más los documentos de contexto de la tarea y la fecha actual |
| ISMS Copilot completo | El ensamblaje de producción: persona, detección de marco normativo, módulo inyectado, fecha, documentos del espacio de trabajo |
Las veinte tareas congeladas: dieciséis preguntas estándar en nueve marcos normativos, cuatro trampas (un control inexistente de ISO 27001, numeración de 2013 superada, un artículo inexistente de GDPR, una premisa incorrecta de fecha y alcance de DORA). Nueve tareas en marcos bien conocidos (ISO 27001, GDPR, SOC 2), once en marcos menos comunes (ISO 42001, el ISM australiano, DORA, NIS 2, TISAX, MTCS de Singapur). Dos tareas incluyen un documento contractual o de diseño ficticio que la respuesta debe citar realmente. Un modelo juez de una familia de proveedores diferente, sin conocer qué brazo produjo cada respuesta, puntuó todas las respuestas según rúbricas congeladas; un verificador determinista confirmó por separado cada identificador de control o artículo citado frente a los registros reales.
El método fue revisado de forma adversarial por un segundo sistema de IA antes del congelamiento, y cumplió su función: detectó errores en las claves de respuesta, un verificador que habría penalizado a los modelos por refutar correctamente controles falsos, y varias formas en que los brazos podrían haber divergido. Todo se corrigió antes de cualquier gasto.
El titular pre-registrado
El criterio principal se congeló con antelación: producto completo frente al mejor de los dos prompts DIY.
| Brazo | General | Marcos conocidos | Marcos menos conocidos |
|---|---|---|---|
| Desnudo | 68.0% | 66.7% | 69.0% |
| Mejor prompt DIY | 76.0% | 88.0% | 66.3% |
| DIY + módulo de conocimiento | 96.9% | 100.0% | 94.3% |
| ISMS Copilot completo | 92.1% | 88.9% | 94.7% |
El producto obtuvo un 92.1% frente al 76.0% del mejor prompt DIY: una diferencia de 16.1 puntos, con un intervalo de confianza del 95% [3.4, 30.2]. Nuestra banda de empate pre-registrada era de 18.2 puntos, calculada a partir de la variabilidad del juez al re-evaluar respuestas idénticas. La diferencia no superó la banda. El veredicto pre-registrado es un empate, y ese es el veredicto que reportamos. No ajustamos la banda después de ver los números.
Lo que realmente muestran las capas
El módulo de conocimiento es el motor. Un prompt de consultor más el módulo inyectado de referencia obtuvo un 96.9%, la puntuación más alta de los seis brazos en este conjunto de tareas. El módulo es el mismo que ISMS Copilot inyecta cuando la pregunta menciona un marco normativo, y el mismo que expone la API.
La ventaja del producto reside en marcos menos comunes. En ISO 27001, GDPR y SOC 2, un buen prompt DIY está a la par con el producto (88.0 vs 88.9). El modelo base conoce los clásicos. En ISO 42001, el ISM australiano, DORA, NIS 2, TISAX y MTCS, el producto obtiene un 94.7% frente al 66.3% del mejor prompt DIY, y el modelo desnudo un 69.0%. Fuera de las preguntas trampa, el modelo desnudo fabricó 8 identificadores de controles y artículos, incluyendo una estructura completa inventada del Anexo A de ISO 42001. El producto no fabricó ninguno.
Un prompt DIY subperformó al brazo desnudo en una tarea. En la tarea de estructura de ISO 42001, obtuvo un 32% frente al 82% del modelo desnudo tras importar con confianza la estructura del Anexo de ISO 27001. Dado que el prompt cambió en su conjunto, esta ejecución no aísla qué instrucción causó la regresión; añadir el módulo de conocimiento elevó la misma tarea al 100%.
Las pérdidas, en texto plano
El brazo de conocimiento más documentos superó al producto. Obtuvo un 98.7% frente al 92.1%, con cinco celdas de tareas diferentes. Este resultado muestra que el prompt A, suministrado con el mismo módulo de conocimiento, fecha actual y documentos relevantes, superó al ensamblaje de producción en este conjunto de tareas de pregunta única. El benchmark no evaluó el valor del estado multi-turno, la detección automática, el manejo de espacios de trabajo u otras características de flujo de trabajo.
El producto falló una de las cuatro trampas. Al pedirle que explicara el control A.8.35 de ISO 27001, que no existe, el producto describió con confianza que se trataba de codificación segura, que en realidad es el A.8.28. Su tabla de controles inyectada en el mismo prompt terminó en el A.8.34, y ambas configuraciones DIY con módulo de conocimiento rechazaron la premisa falsa. Un posible mecanismo es que las directivas de sesgo de acción del prompt de producción afectaron el comportamiento de rechazo, pero el brazo del producto difiere de esos brazos DIY en varios componentes, por lo que este benchmark no puede atribuir el fallo a ese mecanismo. Es un defecto reproducible del producto en la tarea t17.
La detección es a nivel de nombre. Una tarea describió una violación de datos personales sin mencionar nunca el GDPR. El producto no inyectó nada y aún respondió bien con conocimiento base. Ese es el comportamiento documentado, no una sorpresa: nombra el marco normativo o fíjalo.
Qué afirma y no afirma este benchmark
Esta comparación con el mismo modelo base se ejecutó el 2 de septiembre de 2026 con veinte tareas, una muestra por brazo y tarea, un juez automatizado y sin calibración humana. En este conjunto, las puntuaciones cambiaron en las direcciones reportadas cuando se modificó el andamiaje; los resultados no establecen un rendimiento más allá de este conjunto de tareas y ejecución. No es una comparación entre modelos ni una opinión de auditoría, y no respalda ninguna afirmación sobre la eliminación de alucinaciones. Un resumen público del método, resultados, pérdidas y advertencias está disponible en la página de documentación: Calidad de respuestas: el benchmark de andamiaje.
Artículos relacionados

La estrategia de precios 'frontier' no es una estrategia de cumplimiento
Los agentes de cumplimiento son hornos de tokens: entrada de evidencia, referencias de marcos, análisis de salida. Ejecutamos la API de ISMS Copilot en GLM 5.2 con conocimiento de marcos curado inyectado en la inferencia, a $2.80/$8.80 por millón de tokens y una vía masiva a $0.50/$2.00. Aquí está la matemática de precios frente a la lista de precios de Claude, y la evidencia de por qué un modelo no 'frontier' cumple en el trabajo de cumplimiento.

El cero silencioso: cuando una puntuación faltante de juez se convierte en una medición
En nuestra ablación del 17 de julio de 2026 sobre estrategias de generación de documentos GRC (GLM-5.2 y Claude Opus 4.8 como escritores y jueces con rúbrica de 1-10), el pase 2 tuvo 79 de 446 filas de juicio registradas sin una puntuación general. El agregador contó cada una como 0. El mismo relleno con ceros había fabricado un efecto de 3.25 puntos en el pase 1, y cuando desapareció, escribimos una teoría sobre el sesgo del juez para explicar por qué. El desplazamiento emparejado entre los dos jueces en los mismos documentos fue de 0.12.

Por qué no deduplicamos hechos de cumplimiento mediante la similitud de incrustaciones
En nuestra evaluación de deduplicación de memoria, las contradicciones promediaron 0.938 de coseno medio con su hecho almacenado más cercano, y los duplicados reales promediaron 0.940, sin que ningún umbral único separara claramente los pares que no deben fusionarse de los que deberían hacerlo. Por lo tanto, el coseno nunca toma la decisión de fusión en nuestro flujo de trabajo.
