ISMS Copilot
Engineering

Cena modeli frontowych nie jest strategią zgodności

Agenci zgodności to piece tokenowe: dane wejściowe, odniesienia do ram, analiza na wyjściu. Uruchamiamy API ISMS Copilot na modelu GLM 5.2 z wstrzykiwaną wiedzą ramową podczas inferencji, w cenie $2,80/$8,80 za milion tokenów oraz $0,50/$2,00 za pasmo hurtowe. Poniżej przedstawiamy obliczenia cenowe na podstawie arkusza cenowego Claude oraz dowody, dlaczego model niebędący modelem frontowym sprawdza się w pracy związanej ze zgodnością.

przez ISMS Copilot··8 min read
Cena modeli frontowych nie jest strategią zgodności

Agent zgodności to piece tokenowe. Aby wykonać swoją pracę, zużywa dowody (polityki, opisy kontroli, artefakty audytowe, eksporty zgłoszeń), zużywa materiały referencyjne (same ramy: kontrole, klauzule, mapowania) i produkuje ustrukturyzowaną analizę. Proporcje są nierównomierne: dziesiątki tysięcy tokenów wejściowych na każdy tysiąc wyjściowych, a strona wejściowa rośnie wraz z każdym dołączonym dokumentem. W skali agenta, gdzie jedna recenzja ludzka staje się setkami zautomatyzowanych przebiegów, cena za token nie jest pozycją na liście. To ograniczenie architektoniczne. Decyduje ono o tym, czy przetworzysz cały zestaw dowodów, czy tylko próbkę, czy agent będzie ponownie czytał ramy dla każdego znaleziska, czy też cała koncepcja w ogóle wejdzie w życie.

Dlatego przy ustalaniu ceny API ISMS Copilot zaczęliśmy od obciążenia roboczego, a nie od modeli frontowych. Poniższy wpis zawiera obliczenia i uzasadnienie wraz ze źródłami, abyś mógł samodzielnie je powtórzyć, gdy ceny się zmienią. Zmienią się. Obecny arkusz cenowy Anthropic jest opublikowany tutaj, a nasz znajduje się w konsoli. Wszystko poniżej zostało zaobserwowane w dniu 2026-08-26.

Arkusz cenowy, obok siebie

Opublikowane przez Anthropic stawki za milion tokenów, obok naszych:

ModelWejścieWyjścieTo samo obciążenie, średnio
ISMS Copilot mini (isms-mini)$0,50$2,00$0,88
Claude Haiku 4.5$1,00$5,00$1,88
Claude Sonnet 5$2,00$10,00$4,00
ISMS Copilot GLM (isms-fast, isms-thinking, dowolny region)$2,80$8,80$4,30
Claude Sonnet 4.6$3,00$15,00$6,00
Claude Opus (4.5 do 5)$5,00$25,00$10,00

Kolumna „średnio” używa ilustracyjnej mieszanki zgodnościowej: 75% wejścia i 25% wyjścia, ponieważ prace związane ze zgodnością znacznie więcej czytają, niż piszą. Twoja mieszanka może się różnić; stabilną częścią porównania są ceny z listy.

Przeczytane uczciwie, tabela mówi trzy rzeczy. Nasze pasmo hurtowe jest o ponad połowę tańsze od Haiku przy tym samym zadaniu — to pasmo, które ma znaczenie przy formatowaniu lub klasyfikowaniu dziesięciu tysięcy artefaktów dowodowych. Nasza standardowa taryfa plasuje się znacznie poniżej Sonnet 4.6 i Opus, a mniej więcej na poziomie nowej ceny listowej Sonnet 5. I jeśli masz wrażenie, że „Sonnet 5 stał się tani”, wstrzymaj się z tym myśleniem, ponieważ cena z listy to nie cała historia w przypadku nowszych modeli Claude.

Drobne druki, które zmieniają obliczenia

Trzy strukturalne szczegóły, wszystkie pochodzące z dokumentacji cenowej Anthropic — żaden z nich nie jest ukryty, ale wszystkie łatwo przeoczyć przy mnożeniu cen z listy przez liczbę tokenów.

Nowszy tokenizer. Według dokumentacji Anthropic: „Modele Claude 4.7 i nowsze oraz podgląd Claude Mythos używają nowszego tokena, który przyczynia się do ich lepszej wydajności w szerokim zakresie zadań. Ten tokenizer generuje około 30% więcej tokenów dla tego samego tekstu”. Więcej tokenów dla tego samego tekstu to mnożnik kosztów w technicznej nazwie. W modelach, do których się to odnosi (w tym Sonnet 5 i obecny Opus), ten sam dokument polityki kosztuje około 30% więcej tokenów, niż sugeruje mnożenie cen z listy. Nasza powyższa tabela nawet nie uwzględnia tego efektu; w przypadku nowszych modeli należy go dodać.

Geografia „przypięta” kosztuje dodatkowo tam, a u nas nic. Anthropic nalicza 1,1-krotny mnożnik na wszystkie kategorie tokenów, gdy przypinasz inferencję do Stanów Zjednoczonych za pomocą inference_geo: "us". Niektóre programy zgodności wymagają przypiętej geografii, co jest uzasadnionym wymogiem. W naszym API ścieżka przetwarzania w UE działa na węźle inferencji Mistrala zlokalizowanym w UE, z zerowym przechowywaniem treści żądań, w tej samej cenie co ścieżka globalna. Przypięcie jest tutaj wyborem trasy, a nie płatnym poziomem.

Ich środki zaradcze są realne, podobnie jak korpus. Dwa uczciwe punkty na korzyść Anthropic, ponieważ porównanie, które je pomija, nie jest porównaniem. API Batch obniża o połowę koszty wejścia i wyjścia dla prac niekrytycznych czasowo, a cache’owanie promptów sprawia, że powtarzający się kontekst jest tani w kolejnych wywołaniach. Jeśli kształt Twojego agenta zgodności pasuje do okien wsadowych i powtarzalności przyjaznej cache’owaniu, uwzględnij je w swoich obliczeniach. Ale pamiętaj, czego żadna zniżka nie naprawi: w przypadku surowego API modelu ugruntowana odpowiedź zgodności wymaga umieszczenia materiału referencyjnego w prompcie, a ten korpus jest Twój do licencjonowania, zestawiania, utrzymywania i aktualizowania. Ramy są zmieniane, transpozycje wprowadzane, edycje zastępowane. W naszym API wiedza jest częścią pakietu: 101 kuratorowanych modułów ramowych dostępnych obecnie, wstrzykiwanych przy wykryciu lub poprzez przypięcie, rozliczanych jako zwykłe tokeny wejściowe, ujawnianych w każdej odpowiedzi.

Tanie nie jest argumentem

Tani model, który wymyśla numery kontroli, jest kosztowny w jedynym walucie, która się liczy w skali: czasie recenzji. Powód, dla którego nasze ceny mogą się kształtować tam, gdzie się kształtują, tkwi w tym, że kompetencja zgodności nie pochodzi wyłącznie z modelu bazowego. Pochodzi z treści w prompcie.

Mechanizm, przedstawiony precyzyjnie, ponieważ wersja nieprecyzyjna to sposób, w jaki marketing kłamie: API nie jest model fine-tunowany, a wiedza nie jest w wagach. Gdy Twoje żądanie nazywa ramę (lub ją przypinasz), serwer wstrzykuje kuratorowany moduł referencyjny dla tej ramy do prompty, obok opublikowanego systemowego prompty, przed tym, jak model zacznie mówić. Odpowiedź dokładnie informuje, które moduły zostały uruchomione, za pomocą nagłówka x-isms-frameworks oraz obiektu ujawnienia z oszacowaniem tokenów. Ugruntowanie, które możesz zweryfikować, bije recall, którego nie widać.

Model stojący za aliasami to GLM 5.2, mocny model o otwartych wagach z kontekstem 1M tokenów. Wybraliśmy go na podstawie udokumentowanej oceny, a nie „wibesów”: ślepo oceniana, 36-generacyjna ocena zgodności, w której GLM 5.2 z wstrzykiwaną wiedzą uzyskał wynik 87,8 (fast) i 90,0 (thinking), podczas gdy Mistral Small na tych samych zadaniach z tą samą iniekcją uzyskał 73,3 i 74,4; zestaw pułapek cytatowych, w którym GLM przeszedł 5 z 5 pułapek zaprojektowanych, aby wyłapać pewne wymyślanie faktów zgodnościowych; oraz zarejestrowana brama dla opublikowanego systemowego prompty (20/20 dokładności, 24/24 odmówienia wyłudzania własności intelektualnej, z nieudaną pierwszą próbą zarejestrowaną, a nie ukrytą). Pełny zapis, wraz z wielkościami prób i zastrzeżeniami, znajduje się na nowej stronie dokumentacji model quality and grounding. Cytujemy go z uwzględnieniem ograniczeń: są to nasze wewnętrzne oceny, N jest małe, i nie twierdzimy o wyższości jakościowej nad Claude, ponieważ nie istnieje jeszcze żaden benchmark head-to-head przeciwko surowym modelom frontowym. Jeden jest obecnie w fazie projektowej, a jego założeniem jest publikowanie zarówno strat, jak i zwycięstw.

To, co możemy powiedzieć, jest węższe i mocniejsze: gdy moduł jest wybrany, model odpowiada na podstawie utrzymywanego, opatrzonego pieczątką referencyjnego źródła, zamiast bazować na recallu z treningu, a Ty możesz zobaczyć, które źródło posłużyło za każdą odpowiedź. W pracy związanej ze zgodnością to różnica między odpowiedzią, którą sprawdzisz, a odpowiedzią, którą możesz umieścić w dokumentacji roboczej.

Nie jest to produkt UE

Słowo o zakresie, ponieważ rozmowy o API zgodności mają tendencję do zawężania się do ramy GDPR. Katalog jest globalny, z Stanami Zjednoczonymi jako największym pojedynczym skupiskiem: SOC 2, HIPAA, CCPA, CMMC, FedRAMP, PCI DSS, CIS Controls oraz dziewięć publikacji NIST, w tym 800-53 i 800-171. Następnie Wielka Brytania (sześć modułów), Japonia (cztery), Kanada (pięć), Indie (pięć), Szwajcaria (FADP, minimalny standard ICT, NCS, FINMA 23/01), Australia (Essential Eight i Ustawa o Prywatności, z AU ISM i CPS 234 wdrażanymi), Nowa Zelandia, Singapur, Niemcy (BSI Grundschutz, C5, TISAX), Francja, oraz 25 narodowych transpozycji dyrektywy NIS 2. Aktualna liczba pochodzi z GET /v1/frameworks, która jest autorytatywna i publiczna z Twoim kluczem; dzisiaj wskazała 101, i zmienia się wraz z dodawaniem i nowelizacją ram.

Ścieżka przetwarzania w UE to jeden z dwóch wyborów trasy, identycznie wyceniany, dla programów, które go potrzebują. To nie jest tożsamość produktu.

Kiedy API modelu frontowego nadal jest właściwym wyborem

Szczerość działa w obie strony. Jeśli Twoje obciążenie robocze to rzeczywiście wymagająca praca frontowa (nowatorska interpretacja prawna bez ramy do zakotwiczenia, masowa wieloetapowa synteza), model frontowy może być wart cen frontowych dla tego kroku. Jeśli potrzebujesz wejścia multimodalnego lub natywnego wywoływania narzędzi, jesteśmy tekst-in/tekst-out, a uczciwy wzorzec dzisiejszy to krok pod-agentem, a nie zamiennik. Nic tutaj nie zabrania hybrydy: model frontowy do trudnej syntezy, to API do wszystkiego ugruntowanego i wszystkiego na dużą skalę. Pytanie architektoniczne brzmi: które API obsługuje 95% tokenów, które są odczytami referencyjnymi, odczytami dowodów i ustrukturyzowanym formatowaniem. To właśnie ta część, w której cena modeli frontowych cicho staje się nie do utrzymania.

Przelicz te obliczenia samodzielnie

Ceny się zmieniają; wnioski powinny przetrwać te zmiany. Obecne źródła: strona cenowa Anthropic, nasza konsola cenowa. Fakty strukturalne (zachowanie tokena, mnożniki geografii, wiedza włączona lub samodzielnie zestawiana) zmieniają się wolniej niż ceny, i to one są warte dyskusji.

Jeśli budujesz agenta zgodności lub aplikację zgodności: pobierz klucz API, skieruj swojego klienta kompatybilnego z OpenAI na api.ismscopilot.com/v1 i przeczytaj dokumentację wiedzy ramowej oraz jakości modelu, aby zobaczyć dokładnie, co ląduje w Twoim prompcie. Pierwsze żądanie zajmuje minuty. Argument dotyczący cen tyle, ile zechcesz na niego poświęcić.

Powiązane artykuły

Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem
Engineering

Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem

W naszym badaniu ablacyjnym z 17 lipca 2026 dotyczącym strategii generowania dokumentów GRC (GLM-5.2 i Claude Opus 4.8 jako pisarze oraz sędziowie oceniający w skali 1-10), w drugim przebiegu 79 z 446 zarejestrowanych wierszy oceny nie zawierało wyniku ogólnego. Agregator potraktował każdy z nich jako 0. To samo wypełnianie zerami wygenerowało efekt punktowy 3,25 w pierwszym przebiegu, a gdy zniknęło, opracowaliśmy teorię dotyczącą tendencyjności sędziów, aby wyjaśnić dlaczego. Różnica między dwoma sędziami przy tych samych dokumentach wyniosła 0,12.

·14 min read