Il pricing 'frontier' non è una strategia di compliance
Gli agenti di compliance sono forni di token: evidenze in entrata, riferimenti al framework in entrata, analisi in uscita. Eseguiamo l'API ISMS Copilot su GLM 5.2 con conoscenza curata dei framework iniettata durante l'inferenza, a $2,80/$8,80 per milione di token e una corsia bulk a $0,50/$2,00. Ecco la matematica dei prezzi rispetto alla lista prezzi di Claude, e le prove per cui un modello non 'frontier' regge il lavoro di compliance.

Un agente di compliance è un forno di token. Per svolgere il proprio compito, consuma evidenze (politiche, descrizioni dei controlli, artefatti di audit, esportazioni di ticket), consuma materiale di riferimento (il framework stesso: controlli, clausole, mapping) e produce analisi strutturate. Il rapporto è sbilanciato: decine di migliaia di token in entrata per ogni migliaio in uscita, e il lato in entrata cresce con ogni documento che si allega. A scala di agente, dove una revisione umana diventa centinaia di passaggi automatizzati, il prezzo per token non è un elemento di linea. È un vincolo architetturale. Decide se elaborare l'intero set di evidenze o un campione, se l'agente rilegge il framework per ogni riscontro o lavora dalla memoria, e se l'intera idea viene effettivamente realizzata.
Quindi, quando abbiamo stabilito i prezzi dell'API ISMS Copilot, abbiamo partito dal carico di lavoro, non dal 'frontier'. Questo post contiene la matematica e il ragionamento, con le fonti, così potete rifarlo voi stessi quando i prezzi cambiano. Cambieranno. La lista prezzi attuale di Anthropic è pubblicata qui; la nostra è nel pannello di controllo. Tutto ciò che segue è stato osservato il 2026-08-26.
La lista prezzi, affiancata
Le tariffe pubblicate per milione di token di Anthropic, affiancate alle nostre:
| Modello | Input | Output | Stesso carico di lavoro, media |
|---|---|---|---|
ISMS Copilot mini (isms-mini) | $0,50 | $2,00 | $0,88 |
| Claude Haiku 4.5 | $1,00 | $5,00 | $1,88 |
| Claude Sonnet 5 | $2,00 | $10,00 | $4,00 |
Livello ISMS Copilot GLM (isms-fast, isms-thinking, qualsiasi regione) | $2,80 | $8,80 | $4,30 |
| Claude Sonnet 4.6 | $3,00 | $15,00 | $6,00 |
| Claude Opus (4.5 fino a 5) | $5,00 | $25,00 | $10,00 |
La colonna media utilizza una miscela di compliance illustrativa, 75% input e 25% output, perché il lavoro di compliance legge molto più di quanto scriva. La vostra miscela sarà diversa; le tariffe listate sono la parte stabile del confronto.
Leggendo onestamente, la tabella dice tre cose. La nostra corsia bulk costa meno della metà di Haiku per lo stesso lavoro, che è la corsia che conta quando si formattano o si classificano diecimila artefatti di evidenza. Il nostro livello standard si posiziona ben al di sotto di Sonnet 4.6 e Opus, e grossomodo al nuovo prezzo listato di Sonnet 5. E se il vostro istinto è "Sonnet 5 è diventato economico", tenete presente questo pensiero, perché il prezzo listato non è l'intera storia per i modelli Claude più recenti.
Il dettaglio che cambia la matematica
Tre dettagli strutturali, tutti tratti dalla documentazione di pricing di Anthropic, nessuno nascosto ma tutti facili da trascurare quando si moltiplicano i prezzi listati per i conteggi di token.
Il tokenizer più recente. Dalla documentazione di Anthropic: "I modelli Claude 4.7 e successivi, incluso Claude Mythos Preview, utilizzano un tokenizer più recente che contribuisce al miglioramento delle prestazioni su una vasta gamma di attività. Questo tokenizer produce circa il 30% in più di token per lo stesso testo". Più token per lo stesso testo è un moltiplicatore di costo mascherato da nome tecnico. Sui modelli in cui si applica (che includono Sonnet 5 e l'attuale Opus), lo stesso documento di policy costa circa il 30% in più di token rispetto a quanto suggerito dalla moltiplicazione del prezzo listato. La tabella sopra non include nemmeno questo effetto; sui modelli più recenti, aggiungetelo.
La geografia bloccata costa extra lì, e nulla qui. Anthropic applica un moltiplicatore di 1,1x su tutte le categorie di token quando bloccate l'inferenza negli Stati Uniti con inference_geo: "us". Alcuni programmi di compliance richiedono la geografia bloccata, ed è una richiesta legittima. Sulla nostra API, il percorso di elaborazione UE viene eseguito sull'host di inferenza di Mistral nell'UE, con zero conservazione del contenuto della richiesta, allo stesso prezzo del percorso globale. Il blocco qui è una scelta di routing, non un livello premium.
Le loro mitigazioni sono reali, e lo è anche il corpus. Due punti a favore di Anthropic, perché un confronto che li ometta non è un confronto. L'API Batch dimezza i costi di input e output per lavori non sensibili al tempo, e la cache dei prompt rende il contesto ripetuto economico nei chiamate successive. Se la forma del vostro agente di compliance si adatta alle finestre batch e alla ripetizione cache-friendly, includete questi elementi nella vostra matematica. Ma notate ciò che nessun sconto risolve: su un'API di modello grezzo, l'output di compliance basato su evidenze richiede che il materiale di riferimento sia incluso nel prompt, e quel corpus è vostro da licenziare, assemblare, mantenere e tenere aggiornato. I framework vengono modificati, le trasposizioni vengono emanate, le edizioni vengono superate. Sulla nostra API, la conoscenza è la parte inclusa: 101 moduli di framework curati oggi, iniettati al rilevamento o tramite pin, addebitati come token di input ordinari, dichiarati in ogni risposta.
Economico non è l'argomento
Un modello economico che inventa numeri di controllo è costoso nella sola valuta che conta a scala: il tempo di revisione. Il motivo per cui i nostri prezzi possono posizionarsi dove si trovano è che la competenza di compliance non proviene dal modello base da solo. Proviene da ciò che è incluso nel prompt.
Il meccanismo, espresso con precisione perché la versione imprecisa è il modo in cui il marketing mente: l'API non è un modello affinato, e la conoscenza non è nei pesi. Quando la vostra richiesta nomina un framework (o lo bloccate), il server inietta il modulo di riferimento curato per quel framework nel prompt, insieme a un prompt di sistema pubblicato, prima che il modello risponda. La risposta vi dice esattamente quali moduli sono stati eseguiti, tramite l'intestazione x-isms-frameworks e un oggetto di disclosure con una stima dei token. Una grounding verificabile batte una recall invisibile.
Il modello dietro gli alias è GLM 5.2, un modello open-weights forte con un contesto di 1M token. L'abbiamo scelto attraverso una valutazione registrata, non un "vibe check": una valutazione di compliance in cieco con 36 generazioni in cui GLM 5.2 con conoscenza iniettata ha ottenuto 87,8 (fast) e 90,0 (thinking) contro i 73,3 e 74,4 di Mistral Small nello stesso compito con la stessa iniezione; una suite di trappole di citazione in cui GLM ne ha superate 5 su 5 progettate per cogliere invenzioni sicure di fatti di compliance; e un gate pre-registrato per il prompt di sistema pubblicato (20/20 accuratezza, 24/24 rifiuto di elicitazione di proprietà intellettuale, con il primo tentativo fallito registrato invece che nascosto). L'intero record, con dimensioni dei campioni e avvertenze, è nella nuova pagina qualità del modello e grounding. Lo citiamo con i suoi limiti: si tratta delle nostre valutazioni interne, N è piccolo, e non affermiamo una superiorità qualitativa su Claude, perché non esiste ancora un benchmark head-to-head contro modelli 'frontier' grezzi. Uno è in fase di progettazione ora, e la sua premessa è pubblicare le perdite insieme ai successi.
Quello che possiamo dire è più ristretto e più forte: quando un modulo viene selezionato, il modello risponde da un riferimento mantenuto e con timbro di verifica invece che dalla recall dell'addestramento, e potete vedere quale riferimento ha servito ogni risposta. Nel lavoro di compliance, questa è la differenza tra una risposta che verificate a campione e una che potete inserire in un documento di lavoro.
Non un prodotto UE
Una parola sull'ambito, perché la conversazione sull'API di compliance tende a collassare nel frame "GDPR e basta". Il catalogo è globale, con gli Stati Uniti come cluster singolo più grande: SOC 2, HIPAA, CCPA, CMMC, FedRAMP, PCI DSS, CIS Controls e nove pubblicazioni NIST tra cui 800-53 e 800-171. Poi il Regno Unito (sei moduli), Giappone (quattro), Canada (cinque), India (cinque), Svizzera (FADP, lo standard minimo ICT, NCS, FINMA 23/01), Australia (Essential Eight e la legge sulla privacy, con AU ISM e CPS 234 in arrivo), Nuova Zelanda, Singapore, Germania (BSI Grundschutz, C5, TISAX), Francia e le 25 trasposizioni nazionali di NIS 2. Il conteggio attuale proviene da GET /v1/frameworks, che è autorevole e pubblico con la vostra chiave; oggi diceva 101, e cambia man mano che i framework vengono aggiunti e modificati.
Il percorso di elaborazione UE è una scelta di routing tra due, con lo stesso prezzo, per programmi che ne hanno bisogno. Non è l'identità del prodotto.
Quando un'API 'frontier' è ancora la scelta giusta
L'onestà taglia in entrambi i sensi. Se il vostro carico di lavoro è effettivamente un ragionamento di tipo 'frontier' (interpretazione legale innovativa senza un framework a cui ancorarsi, sintesi multi-step massiccia), un modello 'frontier' potrebbe valere i prezzi 'frontier' per quel passaggio. Se avete bisogno di input multimodali o di chiamate a strumenti native, noi siamo text-in/text-out, e il pattern onesto oggi è un passaggio di sub-agente, non un sostituto. Nulla qui vieta un approccio ibrido: modello 'frontier' per la sintesi difficile, questa API per tutto ciò che è basato su evidenze e tutto ciò che è a volume. La domanda architetturale è quale API gestisce il 95% dei token che sono ricerche di riferimenti, letture di evidenze e formattazione strutturata. È questa la parte in cui il pricing 'frontier' diventa insostenibile senza che nessuno se ne accorga.
Rifate questa matematica da soli
I prezzi cambiano; le conclusioni dovrebbero sopravvivere al cambiamento. Fonti attuali: pagina prezzi di Anthropic, il nostro pannello prezzi. I fatti strutturali (comportamento del tokenizer, moltiplicatori geografici, conoscenza inclusa o auto-assemblata) cambiano più lentamente dei prezzi, e sono questi che vale la pena discutere.
Se state costruendo un agente di compliance o un'app di compliance: ottenete una chiave API, puntate il vostro client compatibile con OpenAI a api.ismscopilot.com/v1 e leggete la documentazione sulla conoscenza dei framework e qualità del modello per vedere esattamente cosa finisce nel vostro prompt. La prima richiesta richiede minuti. L'argomento sui prezzi richiede tutto il tempo che volete dedicargli.
Articoli correlati

Lo zero silenzioso: quando un punteggio mancante di giudizio diventa una misurazione
Nell'ablazione del 2026-07-17 sulle strategie di generazione di documenti GRC (GLM-5.2 e Claude Opus 4.8 come scrittori e giudici su una scala 1-10), nel passaggio 2, 79 delle 446 righe di giudizio registrate non avevano un punteggio complessivo. L'aggregatore le ha contate come 0. Lo stesso riempimento con zeri aveva prodotto un effetto di 3,25 punti nel passaggio 1, e quando è scomparso abbiamo elaborato una teoria sul bias del giudice per spiegarlo. Lo scarto appaiato tra i due giudici sullo stesso documento era di 0,12.

Perché non deduplichiamo i fatti di conformità tramite similarità di embedding
Nella nostra valutazione di deduplicazione della memoria, le contraddizioni avevano una media di 0.938 cosine rispetto al fatto memorizzato più vicino, mentre i duplicati veri avevano una media di 0.940. Nessun singolo threshold separava chiaramente le coppie che non dovevano essere fuse da quelle che dovevano esserlo. Quindi, il cosine non viene mai utilizzato per decidere la fusione nel nostro pipeline.

Il test di simmetria: distribuire una correzione del prompt che non puoi riprodurre
Quando un bug di produzione non si riproduce offline, non puoi validare una correzione del prompt facendola avere successo. Puoi validarla verificando se la tua modifica sposta l'output in una direzione coerente o aggiunge semplicemente rumore variabile del modello. Ecco il test che abbiamo eseguito su 126 coppie A/B alla cieca.
