La estrategia de precios 'frontier' no es una estrategia de cumplimiento
Los agentes de cumplimiento son hornos de tokens: entrada de evidencia, referencias de marcos, análisis de salida. Ejecutamos la API de ISMS Copilot en GLM 5.2 con conocimiento de marcos curado inyectado en la inferencia, a $2.80/$8.80 por millón de tokens y una vía masiva a $0.50/$2.00. Aquí está la matemática de precios frente a la lista de precios de Claude, y la evidencia de por qué un modelo no 'frontier' cumple en el trabajo de cumplimiento.

Un agente de cumplimiento es un horno de tokens. Para hacer su trabajo consume evidencia (políticas, descripciones de controles, artefactos de auditoría, exportaciones de tickets), consume material de referencia (el marco en sí: controles, cláusulas, mapeos) y produce análisis estructurado. La proporción es desequilibrada: decenas de miles de tokens de entrada por cada mil de salida, y el lado de entrada crece con cada documento que adjuntas. A escala de agente, donde una revisión humana se convierte en cientos de pasadas automatizadas, el precio por token no es un renglón en la lista. Es una restricción arquitectónica. Decide si procesas todo el conjunto de evidencia o una muestra, si el agente vuelve a leer el marco por cada hallazgo o trabaja desde la memoria, y si la idea completa se concreta.
Por eso, al fijar los precios de la API de ISMS Copilot, partimos de la carga de trabajo, no de los modelos 'frontier'. Esta publicación contiene la matemática y el razonamiento, con fuentes, para que puedas repetirla cuando los precios cambien. Cambiarán. La hoja de precios actual de Anthropic está publicada aquí; la nuestra está en la consola. Todo lo que sigue se observó el 2026-08-26.
La hoja de precios, lado a lado
Tarifas publicadas por millón de tokens de Anthropic, comparadas con las nuestras:
| Modelo | Entrada | Salida | Misma carga de trabajo, combinada |
|---|---|---|---|
ISMS Copilot mini (isms-mini) | $0.50 | $2.00 | $0.88 |
| Claude Haiku 4.5 | $1.00 | $5.00 | $1.88 |
| Claude Sonnet 5 | $2.00 | $10.00 | $4.00 |
Nivel GLM de ISMS Copilot (isms-fast, isms-thinking, cualquier región) | $2.80 | $8.80 | $4.30 |
| Claude Sonnet 4.6 | $3.00 | $15.00 | $6.00 |
| Claude Opus (4.5 a 5) | $5.00 | $25.00 | $10.00 |
La columna combinada usa una mezcla ilustrativa de cumplimiento, 75% de entrada y 25% de salida, porque el trabajo de cumplimiento lee mucho más de lo que escribe. Tu mezcla diferirá; las tarifas de lista son la parte estable de la comparación.
Leída con honestidad, la tabla dice tres cosas. Nuestra vía masiva cuesta menos de la mitad que Haiku para el mismo trabajo, que es la vía que importa cuando formateas o clasificas diez mil artefactos de evidencia. Nuestro nivel estándar se sitúa muy por debajo de Sonnet 4.6 y Opus, y aproximadamente al nivel del nuevo precio de lista de Sonnet 5. Y si tu instinto es "Sonnet 5 se abarató", guarda ese pensamiento, porque el precio de lista no es toda la historia con los modelos más recientes de Claude.
El detalle que cambia la matemática
Tres detalles estructurales, todos de la propia documentación de precios de Anthropic, ninguno oculto pero todos fáciles de pasar por alto al multiplicar precios de lista por conteos de tokens.
El tokenizador más reciente. Según la documentación de Anthropic: "Los modelos Claude 4.7 y posteriores, así como la vista previa de Claude Mythos, usan un tokenizador más reciente que contribuye a su rendimiento mejorado en una amplia gama de tareas. Este tokenizador produce aproximadamente un 30% más de tokens para el mismo texto". Más tokens para el mismo texto es un multiplicador de costos con nombre técnico. En los modelos donde se aplica (que incluye Sonnet 5 y el Opus actual), el mismo documento de políticas cuesta aproximadamente un 30% más en tokens de lo que sugiere la multiplicación del precio de lista. Nuestra tabla anterior ni siquiera incluye ese efecto; en los modelos más recientes, añádelo.
La geografía fija tiene un costo extra allí, y aquí no. Anthropic cobra un multiplicador de 1.1x en todas las categorías de tokens cuando fijas la inferencia en Estados Unidos con inference_geo: "us". Algunos programas de cumplimiento requieren geografía fija, y es un requisito legítimo. En nuestra API, la ruta de procesamiento en la UE se ejecuta en un host de inferencia vinculado a la UE de Mistral, sin retención del contenido de la solicitud, al mismo precio que la ruta global. Fijar es una opción de enrutamiento aquí, no una categoría premium.
Sus mitigaciones son reales, y también lo es el corpus. Dos puntos justos a favor de Anthropic, porque una comparación que los omite no es una comparación. La API por lotes reduce a la mitad los costos de entrada y salida para trabajos no sensibles al tiempo, y el almacenamiento en caché de indicaciones hace que el contexto repetido sea económico en llamadas posteriores. Si la forma de tu agente de cumplimiento encaja en ventanas por lotes y repetición compatible con caché, incluye esos en tu matemática. Pero ten en cuenta lo que ningún descuento arregla: en una API de modelo sin procesar, la salida de cumplimiento fundamentada requiere el material de referencia en la indicación, y ese corpus es tuyo para licenciar, ensamblar, mantener y mantener actualizado. Los marcos se modifican, las transposiciones se promulgan, las ediciones se reemplazan. En nuestra API, el conocimiento es la parte incluida: 101 módulos de marcos curados hoy, inyectados al detectar o fijar, facturados como tokens de entrada ordinarios, revelados en cada respuesta.
Lo barato no es el argumento
Un modelo barato que inventa números de controles es caro en la única moneda que importa a escala: el tiempo de revisión. La razón por la que nuestra estrategia de precios puede situarse donde está es que la competencia en cumplimiento no proviene del modelo base por sí solo. Proviene de lo que hay en la indicación.
El mecanismo, expresado con precisión porque la versión imprecisa es como mienten las áreas de marketing: la API no es un modelo afinado, y el conocimiento no está en los pesos. Cuando tu solicitud nombra un marco (o fijas uno), el servidor inyecta el módulo de referencia curado para ese marco en la indicación, junto con una indicación del sistema publicada, antes de que el modelo hable. La respuesta te indica exactamente qué módulos se ejecutaron, mediante el encabezado x-isms-frameworks y un objeto de divulgación con una estimación de tokens. La fundamentación que puedes verificar supera el recuerdo que no puedes ver.
El modelo detrás de los alias es GLM 5.2, un modelo de pesos abiertos fuerte con un contexto de 1M de tokens. Lo seleccionamos mediante una evaluación registrada, no por una "corazonada": una evaluación de cumplimiento a ciegas con 36 generaciones donde GLM 5.2 con conocimiento inyectado obtuvo 87.8 (rápido) y 90.0 (pensamiento) frente a los 73.3 y 74.4 de Mistral Small en las mismas tareas con la misma inyección; una suite de trampas de citación donde GLM pasó 5 de 5 trampas diseñadas para detectar invenciones confiantes de hechos de cumplimiento; y una puerta pre-registrada para la indicación del sistema publicada (20/20 de precisión, 24/24 de rechazo de elicitación de propiedad intelectual, con el primer intento fallido registrado en lugar de oculto). El registro completo, con tamaños de muestra y advertencias, está en la nueva página de calidad del modelo y fundamentación. Lo citamos con sus límites: estas son nuestras evaluaciones internas, N es pequeño, y no reclamamos superioridad de calidad sobre Claude, porque aún no existe una evaluación comparativa directa contra modelos 'frontier' sin procesar. Una está en diseño ahora, y su premisa es publicar las pérdidas junto con las victorias.
Lo que sí podemos decir es más estrecho y más fuerte: cuando se selecciona un módulo, el modelo responde a partir de una referencia mantenida y sellada de verificación en lugar del recuerdo del entrenamiento, y puedes ver qué referencia sirvió para cada respuesta. En el trabajo de cumplimiento, esa es la diferencia entre una respuesta que verificas aleatoriamente y una respuesta que puedes incluir en un documento de trabajo.
No es un producto de la UE
Una palabra sobre el alcance, porque la conversación sobre la API de cumplimiento tiende a colapsar en un marco de GDPR y listo. El catálogo es global, con Estados Unidos como el clúster único más grande: SOC 2, HIPAA, CCPA, CMMC, FedRAMP, PCI DSS, Controles CIS y nueve publicaciones de NIST, incluyendo 800-53 y 800-171. Luego el Reino Unido (seis módulos), Japón (cuatro), Canadá (cinco), India (cinco), Suiza (FADP, el estándar mínimo de TIC, NCS, FINMA 23/01), Australia (Ocho Esenciales y la Ley de Privacidad, con AU ISM y CPS 234 llegando), Nueva Zelanda, Singapur, Alemania (BSI Grundschutz, C5, TISAX), Francia y las 25 transposiciones nacionales de NIS 2. El conteo en vivo proviene de GET /v1/frameworks, que es autoritativo y público con tu clave; hoy dijo 101, y cambia a medida que se añaden y modifican marcos.
La ruta de procesamiento en la UE es una opción de enrutamiento entre dos, con el mismo precio, para programas que lo necesitan. No es la identidad del producto.
Cuándo una API 'frontier' sigue siendo la opción correcta
La honestidad corta en ambos sentidos. Si tu carga de trabajo es realmente razonamiento de frontera (interpretación legal novedosa sin marco al que anclarse, síntesis de múltiples pasos masiva), un modelo 'frontier' puede valer los precios 'frontier' para ese paso. Si necesitas entrada multimodal o llamadas a herramientas nativas, somos texto-entrada/texto-salida, y el patrón honesto hoy es un paso de sub-agente, no un reemplazo. Nada aquí prohíbe un híbrido: modelo 'frontier' para el paso de síntesis difícil, esta API para todo fundamentado y todo a volumen. La pregunta arquitectónica es qué API maneja el 95% de los tokens que son búsquedas de referencia, lecturas de evidencia y formato estructurado. Esa es la parte donde el precio 'frontier' se vuelve insostenible en silencio.
Rehaz esta matemática tú mismo
Los precios cambian; las conclusiones deben sobrevivir al movimiento. Fuentes actuales: página de precios de Anthropic, nuestra consola de precios. Los hechos estructurales (comportamiento del tokenizador, multiplicadores de geografía, conocimiento incluido o autoensamblado) cambian más lentamente que los precios, y esos son los que vale la pena discutir.
Si estás construyendo un agente de cumplimiento o una aplicación de cumplimiento: obtén una clave de API, apunta tu cliente compatible con OpenAI a api.ismscopilot.com/v1, y lee la documentación de conocimiento de marcos y calidad del modelo para ver exactamente qué llega a tu indicación. La primera solicitud toma minutos. El argumento de precios toma tanto tiempo como quieras dedicarle.
Artículos relacionados

El cero silencioso: cuando una puntuación faltante de juez se convierte en una medición
En nuestra ablación del 17 de julio de 2026 sobre estrategias de generación de documentos GRC (GLM-5.2 y Claude Opus 4.8 como escritores y jueces con rúbrica de 1-10), el pase 2 tuvo 79 de 446 filas de juicio registradas sin una puntuación general. El agregador contó cada una como 0. El mismo relleno con ceros había fabricado un efecto de 3.25 puntos en el pase 1, y cuando desapareció, escribimos una teoría sobre el sesgo del juez para explicar por qué. El desplazamiento emparejado entre los dos jueces en los mismos documentos fue de 0.12.

Por qué no deduplicamos hechos de cumplimiento mediante la similitud de incrustaciones
En nuestra evaluación de deduplicación de memoria, las contradicciones promediaron 0.938 de coseno medio con su hecho almacenado más cercano, y los duplicados reales promediaron 0.940, sin que ningún umbral único separara claramente los pares que no deben fusionarse de los que deberían hacerlo. Por lo tanto, el coseno nunca toma la decisión de fusión en nuestro flujo de trabajo.

La prueba de simetría: implementar una corrección en el prompt que no puedes reproducir
Cuando un error de producción no se reproduce en entorno local, no puedes validar una corrección en el prompt comprobando si tiene éxito. La validas verificando si tu cambio mueve la salida en una dirección consistente o simplemente añade ruido aleatorio al modelo. Aquí está la prueba que realizamos en 126 pares ciegos de A/B.
