ISMS Copilot
Engineering

Frontier-Preise sind keine Compliance-Strategie

Compliance-Agenten sind Token-Öfen: Eingabe von Belegen, Referenzrahmen, Analyse als Ausgabe. Wir betreiben die ISMS Copilot API auf GLM 5.2 mit kuratiertem Rahmenwissen, das während der Inferenz injiziert wird, zu $2,80/$8,80 pro Million Tokens und einer Bulk-Lane für $0,50/$2,00. Hier ist die Preismathematik im Vergleich zum Claude-Preisblatt und der Nachweis, warum ein Nicht-Frontier-Modell für Compliance-Arbeit ausreicht.

von ISMS Copilot··8 min read
Frontier-Preise sind keine Compliance-Strategie

Ein Compliance-Agent ist ein Token-Ofen. Um seine Aufgabe zu erfüllen, verbraucht er Belege (Richtlinien, Kontrollbeschreibungen, Audit-Artefakte, Ticket-Exporte), Referenzmaterial (den Rahmen selbst: Kontrollen, Klauseln, Mappings) und produziert strukturierte Analysen. Das Verhältnis ist unausgeglichen: Zehntausende Tokens gehen hinein, für je tausend Tokens Ausgabe, und die Eingabeseite wächst mit jedem Dokument, das angehängt wird. Im Agenten-Maßstab, wo eine manuelle Prüfung zu Hunderten automatisierten Durchläufen wird, ist der Preis pro Token kein Posten in der Budgetplanung. Er ist die architektonische Einschränkung. Er entscheidet, ob das gesamte Belegset verarbeitet wird oder nur eine Stichprobe, ob der Agent den Rahmen für jeden Befund neu liest oder aus dem Gedächtnis arbeitet – und ob die gesamte Idee überhaupt umsetzbar ist.

Als wir die ISMS Copilot API bepreisten, begannen wir daher mit der Arbeitslast, nicht mit Frontier-Modellen. Dieser Beitrag enthält die Berechnungen und die Begründung mit Quellen, damit Sie die Rechnung bei Preisänderungen selbst nachvollziehen können. Die Preise werden sich ändern. Anthropics aktuelle Preisliste ist hier veröffentlicht; unsere finden Sie in der Konsole. Alle Angaben unten wurden am 2026-08-26 erhoben.

Die Preisliste im direkten Vergleich

Anthropics veröffentlichte Preise pro Million Tokens im Vergleich zu unseren:

ModellEingabeAusgabeGleicher Arbeitsaufwand, gemischt
ISMS Copilot mini (isms-mini)$0,50$2,00$0,88
Claude Haiku 4.5$1,00$5,00$1,88
Claude Sonnet 5$2,00$10,00$4,00
ISMS Copilot GLM-Tier (isms-fast, isms-thinking, jede Region)$2,80$8,80$4,30
Claude Sonnet 4.6$3,00$15,00$6,00
Claude Opus (4.5 bis 5)$5,00$25,00$10,00

Die gemischte Spalte verwendet eine illustrative Compliance-Mischung mit 75 % Eingabe und 25 % Ausgabe, da Compliance-Arbeit weit mehr liest als schreibt. Ihre Mischung wird abweichen; die Listenpreise sind der stabile Teil des Vergleichs.

Ehrlich betrachtet, sagt die Tabelle drei Dinge aus. Unsere Bulk-Lane kostet weniger als die Hälfte von Haiku für dieselbe Arbeit – und das ist die Lane, die zählt, wenn Sie zehntausend Beleg-Artefakte formatieren oder klassifizieren. Unsere Standard-Tier liegt deutlich unter Sonnet 4.6 und Opus und etwa auf dem Niveau des neuen Listenpreises von Sonnet 5. Und wenn Ihnen der Gedanke kommt „Sonnet 5 ist jetzt günstiger“, halten Sie diesen Gedanken fest: Der Listenpreis ist nicht die ganze Geschichte bei den neueren Claude-Modellen.

Die Feinheiten, die die Rechnung verändern

Drei strukturelle Details, alle aus Anthropics eigener Preisdokumentation, die weder versteckt noch schwer zu finden sind, aber leicht übersehen werden, wenn man Listenpreise mit Token-Zählungen multipliziert.

Der neuere Tokenizer. Laut Anthropics Dokumentation: „Claude 4.7 und spätere Modelle sowie die Claude Mythos Preview nutzen einen neueren Tokenizer, der zu einer verbesserten Leistung in einem breiten Aufgabenspektrum beiträgt. Dieser Tokenizer erzeugt etwa 30 % mehr Tokens für denselben Text.“ Mehr Tokens für denselben Text ist ein Kostentreiber in technischer Verkleidung. Bei den Modellen, auf die dies zutrifft (einschließlich Sonnet 5 und dem aktuellen Opus), kostet dasselbe Richtliniendokument etwa 30 % mehr Tokens, als die reine Multiplikation der Listenpreise suggeriert. Unsere obige Tabelle berücksichtigt diesen Effekt nicht einmal; bei den neueren Modellen müssen Sie ihn hinzufügen.

Geografische Festlegung kostet dort extra – hier nicht. Anthropic verlangt einen 1,1-fachen Aufschlag auf alle Token-Kategorien, wenn Sie die Inferenz in den Vereinigten Staaten mit inference_geo: "us" festlegen. Manche Compliance-Programme verlangen geografische Festlegung, und das ist eine legitime Anforderung. In unserer API läuft der EU-Verarbeitungsweg auf Mistrals EU-basiertem Inferenz-Host, mit null Speicherung der Anfrageinhalte, zum gleichen Preis wie der globale Weg. Die Festlegung ist hier eine Routing-Entscheidung, kein Premium-Tarif.

Ihre Minderungen sind real – und so ist auch der Korpus. Zwei faire Punkte zugunsten von Anthropic, denn ein Vergleich, der sie auslässt, ist kein vollständiger Vergleich. Die Batch-API halbiert die Eingabe- und Ausgabekosten für nicht zeitkritische Arbeit, und Prompt-Caching macht wiederholten Kontext bei subsequenten Aufrufen günstig. Wenn die Form Ihres Compliance-Agenten zu Batch-Fenstern und cachefreundlicher Wiederholung passt, sollten Sie diese in Ihre Berechnung einbeziehen. Aber beachten Sie, was kein Rabatt behebt: Bei einer reinen Modell-API erfordert eine fundierte Compliance-Ausgabe, dass das Referenzmaterial im Prompt enthalten ist – und dieser Korpus muss von Ihnen lizenziert, zusammengestellt, gewartet und aktuell gehalten werden. Rahmenwerke werden geändert, Umsetzungen erlassen, Ausgaben ersetzt. In unserer API ist das Wissen der inkludierte Teil: 101 kuratierte Rahmenwerk-Module heute, injiziert bei Erkennung oder per Pin, abgerechnet als gewöhnliche Tokens, offengelegt in jeder Antwort.

Günstig ist nicht das Argument

Ein günstiges Modell, das Kontrollnummern erfindet, ist in der einzigen Währung teuer, die im Maßstab zählt: Prüfzeit. Der Grund, warum unsere Preise dort liegen können, wo sie liegen, ist, dass die Compliance-Kompetenz nicht allein vom Basismodell kommt. Sie stammt aus dem, was im Prompt enthalten ist.

Der Mechanismus – präzise formuliert, denn die unpräzise Version ist, wie Marketing lügt: Die API ist kein feinabgestimmtes Modell, und das Wissen steckt nicht in den Gewichten. Wenn Ihre Anfrage ein Rahmenwerk benennt (oder Sie eines festlegen), injiziert der Server das kuratierte Referenzmodul für dieses Rahmenwerk in den Prompt, zusammen mit einem veröffentlichten System-Prompt, bevor das Modell antwortet. Die Antwort teilt Ihnen genau mit, welche Module verwendet wurden, über den Header x-isms-frameworks und ein Offenlegungsobjekt mit einer Token-Schätzung. Nachvollziehbare Grundlagen schlagen nicht sichtbare Erinnerungen.

Das Modell hinter den Aliasen ist GLM 5.2, ein starkes Open-Weights-Modell mit einem 1-Million-Token-Kontext. Wir haben es durch eine dokumentierte Evaluation ausgewählt, nicht nach Bauchgefühl: eine verblindete, 36-Generierungs-Compliance-Evaluation, in der GLM 5.2 mit injiziertem Wissen 87,8 (fast) und 90,0 (thinking) erreichte – gegenüber Mistral Small mit 73,3 und 74,4 bei denselben Aufgaben mit derselben Injektion; ein Zitierfallen-Test, bei dem GLM 5 von 5 Fallen 5 passierte, die darauf ausgelegt waren, selbstsichere Erfindungen von Compliance-Fakten zu entlarven; und ein vorregistriertes Gate für den veröffentlichten System-Prompt (20/20 Genauigkeit, 24/24 Ablehnung von Anfragen nach geistigem Eigentum, wobei der erste gescheiterte Versuch dokumentiert und nicht begraben wurde). Der vollständige Datensatz mit Stichprobengrößen und Einschränkungen ist auf der neuen Seite Modellqualität und Grundlagen dokumentiert. Wir zitieren ihn mit seinen Grenzen: Dies sind unsere internen Evaluierungen, N ist klein, und wir behaupten keine qualitative Überlegenheit gegenüber Claude, denn ein direkter Benchmark gegen reine Frontier-Modelle existiert noch nicht. Ein solcher ist in Planung, und seine Prämisse ist, sowohl Verluste als auch Erfolge zu veröffentlichen.

Was wir enger und stärker sagen können: Wenn ein Modul ausgewählt wird, antwortet das Modell auf Basis einer gewarteten, verifizierbaren Referenz – statt aus dem Trainingsgedächtnis – und Sie können sehen, welche Referenz für jede Antwort diente. Bei Compliance-Arbeit ist das der Unterschied zwischen einer Antwort, die Sie stichprobenartig prüfen, und einer Antwort, die Sie direkt in ein Arbeitsdokument übernehmen können.

Kein EU-Produkt

Ein Wort zum Geltungsbereich, denn das Gespräch über Compliance-APIs neigt dazu, in eine GDPR-und-dann-ist-alles-erledigt-Falle zu tappen. Der Katalog ist global, mit den Vereinigten Staaten als größtem Einzelcluster: SOC 2, HIPAA, CCPA, CMMC, FedRAMP, PCI DSS, CIS Controls und neun NIST-Publikationen einschließlich 800-53 und 800-171. Dann das Vereinigte Königreich (sechs Module), Japan (vier), Kanada (fünf), Indien (fünf), die Schweiz (FADP, der ICT-Mindeststandard, NCS, FINMA 23/01), Australien (Essential Eight und der Privacy Act, mit AU ISM und CPS 234), Neuseeland, Singapur, Deutschland (BSI Grundschutz, C5, TISAX), Frankreich und die 25 nationalen Umsetzungen von NIS 2. Die aktuelle Anzahl stammt von GET /v1/frameworks, die autoritativ und öffentlich mit Ihrem Schlüssel ist; heute waren es 101, und sie ändert sich, wenn Rahmenwerke hinzugefügt oder geändert werden.

Der EU-Verarbeitungsweg ist eine von zwei Routing-Entscheidungen, die zum gleichen Preis angeboten werden, für Programme, die ihn benötigen. Er ist nicht die Identität des Produkts.

Wann eine Frontier-API trotzdem die richtige Wahl ist

Ehrlichkeit gilt in beide Richtungen. Wenn Ihre Arbeitslast tatsächlich an der Frontier liegt – neuartige rechtliche Interpretationen ohne Rahmenwerk zur Verankerung, massive mehrstufige Synthesen –, dann kann ein Frontier-Modell die Frontier-Preise für diesen Schritt wert sein. Wenn Sie multimodale Eingaben oder natives Tool-Calling benötigen, sind wir text-in/text-out, und das ehrliche Muster heute ist ein Sub-Agenten-Schritt, kein Ersatz. Nichts hier verbietet eine Hybridlösung: Frontier-Modell für den schwierigen Syntheseschritt, diese API für alles Grundlegende und alles im Volumen. Die architektonische Frage ist, welche API die 95 % der Tokens handhabt, die Referenzabfragen, Beleglesungen und strukturierte Formatierungen sind. Das ist der Teil, bei dem Frontier-Preise leise unsustainable werden.

Rechnen Sie diese Mathematik selbst nach

Preise ändern sich; Schlussfolgerungen sollten den Veränderungen standhalten. Aktuelle Quellen: Anthropics Preisseite, unsere Konsole-Preise. Die strukturellen Fakten (Tokenizer-Verhalten, Geografie-Aufschläge, inkludiertes Wissen oder selbst zusammengestellter Korpus) ändern sich langsamer als die Preise, und genau diese sind es wert, diskutiert zu werden.

Wenn Sie einen Compliance-Agenten oder eine Compliance-App entwickeln: holen Sie sich einen API-Key, richten Sie Ihren OpenAI-kompatiblen Client auf api.ismscopilot.com/v1 ein und lesen Sie die Dokumentation zu Rahmenwissen und Modellqualität, um genau zu sehen, was in Ihren Prompt gelangt. Die erste Anfrage dauert Minuten. Die Preisdiskussion so lange, wie Sie sich nehmen möchten.

Verwandte Beiträge

Die stille Null: Wenn eine fehlende Richterbewertung zur Messung wird
Engineering

Die stille Null: Wenn eine fehlende Richterbewertung zur Messung wird

In unserer Ablation vom 17. Juli 2026 zu GRC-Dokumentgenerierungsstrategien (GLM-5.2 und Claude Opus 4.8 als Autoren und 1-10-Bewerter) hatten im Durchgang 2 79 von 446 erfassten Bewertungszeilen keine Gesamtbewertung. Der Aggregator zählte jede davon als 0. Dieselbe Null-Ersetzung hatte im Durchgang 1 einen Effekt von 3,25 Punkten erzeugt, und als dieser verschwand, formulierten wir eine Theorie zur Richterverzerrung, um dies zu erklären. Die paarweise Abweichung zwischen den beiden Richtern bei denselben Dokumenten betrug 0,12.

·14 min read
Warum wir Compliance-Fakten nicht durch Ähnlichkeitsdeduplizierung zusammenführen
Engineering

Warum wir Compliance-Fakten nicht durch Ähnlichkeitsdeduplizierung zusammenführen

In unserer Memory-Deduplizierungsbewertung lagen Widersprüche im Durchschnitt bei einem Kosinuswert von 0,938 zu ihrem nächstgelegenen gespeicherten Fakt, während echte Duplikate bei 0,940 lagen. Kein einzelner Schwellenwert trennte die Paare, die nicht zusammengeführt werden dürfen, von denen, die es sollten. Daher trifft die Kosinus-Ähnlichkeit in unserer Pipeline niemals die Merge-Entscheidung.

·9 min read