ISMS Copilot
Engineering

La tarification de pointe n'est pas une stratégie de conformité

Les agents de conformité sont des fourneaux à jetons : des preuves en entrée, des références de cadre en entrée, des analyses en sortie. Nous exécutons l'API ISMS Copilot sur GLM 5.2 avec des connaissances de cadre injectées à l'inférence, à 2,80 $/8,80 $ par million de jetons et une voie en vrac à 0,50 $/2,00 $. Voici le calcul des prix par rapport à la grille tarifaire de Claude, ainsi que les preuves démontrant qu'un modèle non de pointe tient la route pour les travaux de conformité.

par ISMS Copilot··10 min read
La tarification de pointe n'est pas une stratégie de conformité

Un agent de conformité est un fourneau à jetons. Pour accomplir sa mission, il consomme des preuves (politiques, descriptions de contrôles, artefacts d'audit, exports de tickets), consomme du matériel de référence (le cadre lui-même : contrôles, clauses, mappings), et produit des analyses structurées. Le ratio est déséquilibré : des dizaines de milliers de jetons en entrée pour chaque millier en sortie, et le côté entrée croît à chaque document que vous attachez. À l'échelle de l'agent, où une revue humaine devient des centaines de passes automatisées, le prix par jeton n'est pas un poste de dépense. C'est une contrainte architecturale. Il détermine si vous traitez l'ensemble des preuves ou un échantillon, si l'agent relit le cadre pour chaque constat ou travaille à partir de sa mémoire, et si l'idée même aboutit.

Ainsi, lorsque nous avons fixé le prix de l'API ISMS Copilot, nous sommes partis de la charge de travail, et non des modèles de pointe. Cet article présente les calculs et le raisonnement, avec les sources, afin que vous puissiez refaire les calculs vous-même lorsque les prix évoluent. Ils évolueront. La grille tarifaire actuelle d'Anthropic est publiée ici ; la nôtre se trouve dans la console. Tout ce qui suit a été observé le 2026-08-26.

La grille tarifaire, côte à côte

Les tarifs publiés par Anthropic par million de jetons, comparés aux nôtres :

ModèleEntréeSortieCharge de travail identique, moyenne
ISMS Copilot mini (isms-mini)0,50 $2,00 $0,88 $
Claude Haiku 4.51,00 $5,00 $1,88 $
Claude Sonnet 52,00 $10,00 $4,00 $
Niveau ISMS Copilot GLM (isms-fast, isms-thinking, quelle que soit la région)2,80 $8,80 $4,30 $
Claude Sonnet 4.63,00 $15,00 $6,00 $
Claude Opus (4.5 à 5)5,00 $25,00 $10,00 $

La colonne « moyenne » utilise un mélange illustratif de conformité, 75 % d'entrée et 25 % de sortie, car les travaux de conformité lisent bien plus qu'ils n'écrivent. Votre mélange sera différent ; les prix listés constituent la partie stable de la comparaison.

Lue honnêtement, ce tableau révèle trois choses. Notre voie en vrac coûte moins de la moitié de Haiku pour le même travail, ce qui est crucial lorsque vous formatez ou classez des dizaines de milliers d'artefacts de preuve. Notre niveau standard se situe bien en dessous de Sonnet 4.6 et Opus, et environ au niveau du nouveau prix listé de Sonnet 5. Et si votre instinct vous dit « Sonnet 5 est devenu bon marché », gardez cette pensée en tête, car le prix listé ne raconte pas toute l'histoire des nouveaux modèles Claude.

Les petits détails qui changent la donne

Trois détails structurels, tous issus de la documentation tarifaire d'Anthropic, aucun n'étant caché mais tous faciles à négliger lorsque vous multipliez les prix listés par les comptes de jetons.

Le nouveau tokenizer. D'après la documentation d'Anthropic : « Les modèles Claude 4.7 et ultérieurs, ainsi que le prévisualisation Claude Mythos, utilisent un tokenizer plus récent qui contribue à leurs performances améliorées sur une large gamme de tâches. Ce tokenizer produit environ 30 % de jetons en plus pour le même texte. » Plus de jetons pour le même texte est un multiplicateur de coût déguisé en nom technique. Sur les modèles où il s'applique (ce qui inclut Sonnet 5 et l'Opus actuel), le même document de politique coûte environ 30 % de jetons en plus que ne le suggère la multiplication par le prix listé. Notre tableau ci-dessus n'inclut même pas cet effet ; sur les nouveaux modèles, ajoutez-le.

La géographie verrouillée coûte plus cher là-bas, et rien ici. Anthropic applique un multiplicateur de 1,1x sur toutes les catégories de jetons lorsque vous verrouillez l'inférence aux États-Unis avec inference_geo: "us". Certains programmes de conformité exigent une géographie verrouillée, et c'est une exigence légitime. Sur notre API, le chemin de traitement dans l'UE s'exécute sur l'hôte d'inférence lié à l'UE de Mistral, sans conservation du contenu de la requête, au même prix que le chemin global. Le verrouillage est ici un choix de routage, et non un niveau premium.

Leurs atténuations sont réelles, et leur corpus aussi. Deux points justes en faveur d'Anthropic, car une comparaison qui les omet n'en est pas une. L'API Batch divise par deux les coûts d'entrée et de sortie pour les travaux non sensibles au temps, et la mise en cache des invites rend le contexte répété peu coûteux lors des appels suivants. Si la forme de votre agent de conformité s'adapte aux fenêtres par lots et aux répétitions favorables au cache, incluez-les dans vos calculs. Mais notez ce qu'aucun rabais ne corrige : sur une API de modèle brut, une sortie de conformité ancrée exige que le matériel de référence soit présent dans l'invite, et ce corpus est à votre charge pour la licence, l'assemblage, la maintenance et le maintien à jour. Les cadres sont modifiés, les transpositions sont promulguées, les éditions sont remplacées. Sur notre API, la connaissance fait partie intégrante du service : 101 modules de cadre curatés aujourd'hui, injectés à la détection ou par épinglage, facturés comme des jetons d'entrée ordinaires, divulgués dans chaque réponse.

Le prix bas n'est pas l'argument

Un modèle bon marché qui invente des numéros de contrôle est coûteux dans la seule devise qui compte à l'échelle : le temps de revue. La raison pour laquelle nos tarifs peuvent se situer là où ils sont réside dans le fait que la compétence en conformité ne provient pas du modèle de base seul. Elle provient de ce qui est présent dans l'invite.

Le mécanisme, énoncé avec précision car la version imprécise est la manière dont le marketing ment : l'API n'est pas un modèle affiné, et la connaissance n'est pas dans les poids. Lorsque votre requête nomme un cadre (ou que vous en épinglez un), le serveur injecte le module de référence curaté pour ce cadre dans l'invite, aux côtés d'une invite système publiée, avant que le modèle ne réponde. La réponse vous indique exactement quels modules ont été exécutés, via l'en-tête x-isms-frameworks et un objet de divulgation avec une estimation des jetons. Une ancrage que vous pouvez vérifier vaut mieux qu'une mémoire que vous ne pouvez pas voir.

Le modèle derrière les alias est GLM 5.2, un modèle open-weights solide avec un contexte de 1M de jetons. Nous l'avons choisi à l'issue d'une évaluation enregistrée, et non d'une impression : une évaluation de conformité en aveugle, avec 36 générations où GLM 5.2 avec des connaissances injectées a obtenu 87,8 (rapide) et 90,0 (réfléchi) contre 73,3 et 74,4 pour Mistral Small sur les mêmes tâches avec la même injection ; une suite de pièges de citation où GLM a réussi 5 sur 5 des pièges conçus pour détecter l'invention confiante de faits de conformité ; et une porte d'entrée préenregistrée pour l'invite système publiée (20/20 de précision, 24/24 de refus d'extraction de propriété intellectuelle, avec la première tentative échouée enregistrée plutôt que cachée). L'ensemble des enregistrements, avec les tailles d'échantillon et les mises en garde, se trouve sur la nouvelle page qualité du modèle et ancrage. Nous la citons avec ses limites : il s'agit de nos évaluations internes, N est petit, et nous ne revendiquons aucune supériorité de qualité par rapport à Claude, car aucun benchmark comparatif direct avec des modèles de pointe bruts n'existe encore. L'un est en cours de conception, et son principe est de publier les pertes ainsi que les victoires.

Ce que nous pouvons affirmer est plus étroit et plus fort : lorsqu'un module est sélectionné, le modèle répond à partir d'une référence maintenue et estampillée de vérification au lieu de se fier à sa mémoire d'entraînement, et vous pouvez voir quelle référence a servi pour chaque réponse. Dans le travail de conformité, c'est la différence entre une réponse que vous vérifiez par échantillonnage et une réponse que vous pouvez intégrer dans un document de travail.

Pas un produit de l'UE

Un mot sur le périmètre, car la conversation sur l'API de conformité a tendance à se réduire à un cadre GDPR-et-c'est-tout. Le catalogue est mondial, avec les États-Unis comme plus grand cluster unique : SOC 2, HIPAA, CCPA, CMMC, FedRAMP, PCI DSS, CIS Controls, et neuf publications NIST dont 800-53 et 800-171. Puis le Royaume-Uni (six modules), le Japon (quatre), le Canada (cinq), l'Inde (cinq), la Suisse (LPD, la norme minimale ICT, NCS, FINMA 23/01), l'Australie (Essential Eight et la loi sur la confidentialité, avec AU ISM et CPS 234 en cours d'intégration), la Nouvelle-Zélande, Singapour, l'Allemagne (BSI Grundschutz, C5, TISAX), la France, et les 25 transpositions nationales de NIS 2. Le décompte en temps réel provient de GET /v1/frameworks, qui est autoritaire et public avec votre clé ; il indiquait 101 aujourd'hui, et il évolue au fur et à mesure que les cadres sont ajoutés et modifiés.

Le chemin de traitement dans l'UE est un choix de routage parmi deux, tarifé de manière identique, pour les programmes qui en ont besoin. Ce n'est pas l'identité du produit.

Quand une API de pointe reste le bon choix

L'honnêteté va dans les deux sens. Si votre charge de travail relève véritablement du raisonnement de pointe (interprétation juridique inédite sans cadre pour l'ancrer, synthèse multi-étapes massive), un modèle de pointe peut valoir ses prix de pointe pour cette étape. Si vous avez besoin d'une entrée multimodale ou d'appels d'outils natifs, nous sommes en texte-entrée/texte-sortie, et le schéma honnête aujourd'hui est une étape de sous-agent, et non un remplacement. Rien ici n'interdit une approche hybride : modèle de pointe pour la synthèse difficile, cette API pour tout ce qui est ancré et tout ce qui est en volume. La question architecturale est de savoir quelle API gère les 95 % de jetons que sont les recherches de références, les lectures de preuves et le formatage structuré. C'est là que la tarification de pointe devient silencieusement insoutenable.

Refaites ces calculs vous-même

Les prix évoluent ; les conclusions doivent survivre à ces mouvements. Sources actuelles : la page tarifaire d'Anthropic, notre console tarifaire. Les faits structurels (comportement du tokenizer, multiplicateurs géographiques, connaissances incluses ou auto-assemblées) évoluent moins vite que les prix, et ce sont ceux-là qui valent la peine d'être discutés.

Si vous construisez un agent de conformité ou une application de conformité : obtenez une clé API, pointez votre client compatible OpenAI sur api.ismscopilot.com/v1, et consultez la documentation sur les connaissances de cadre et la qualité du modèle pour voir exactement ce qui atterrit dans votre invite. La première requête prend quelques minutes. L'argument tarifaire prend autant de temps que vous souhaitez y consacrer.

Articles connexes

Le zéro silencieux : quand une note de juge manquante devient une mesure
Engineering

Le zéro silencieux : quand une note de juge manquante devient une mesure

Lors de notre ablation du 17 juillet 2026 sur les stratégies de génération de documents GRC (GLM-5.2 et Claude Opus 4.8 en tant que rédacteurs et juges selon une grille de 1 à 10), le passage 2 comptait 79 lignes de jugement sur 446 sans note globale. L'agrégateur les a comptées comme des 0. Ce remplissage par des zéros avait artificiellement créé un écart de 3,25 points dans le passage 1, et lorsque cet écart a disparu, nous avons élaboré une théorie sur un biais des juges pour l'expliquer. L'écart apparié entre les deux juges sur les mêmes documents était de 0,12.

·17 min read
Pourquoi nous ne dédupliquons pas les faits de conformité par similarité d'embeddings
Engineering

Pourquoi nous ne dédupliquons pas les faits de conformité par similarité d'embeddings

Dans notre évaluation de déduplication en mémoire, les contradictions affichaient une similarité cosinus moyenne de 0,938 avec leur fait stocké le plus proche, tandis que les doublons réels atteignaient 0,940. Aucun seuil unique ne permettait de séparer clairement les paires qui ne devaient pas fusionner de celles qui le devaient. Ainsi, le cosinus ne prend jamais la décision de fusion dans notre pipeline.

·11 min read