ISMS Copilot
Engineering

Przetestowaliśmy ISMS Copilot w porównaniu z modelem bazowym i lepszym DIY promptem. Wstępnie zarejestrowany werdykt to remis.

Zamrożona ocena 20 zadań w sześciu konfiguracjach GLM 5.3-Flash: co zmienił moduł wiedzy, gdzie produkt i najlepszy samodzielny prompt zremisowały według reguły zamrożenia, oraz gdzie wersja z wiedzą i dokumentami uzyskała wyższe wyniki.

przez ISMS Copilot··5 min read
Przetestowaliśmy ISMS Copilot w porównaniu z modelem bazowym i lepszym DIY promptem. Wstępnie zarejestrowany werdykt to remis.

Na tym zamrożonym zbiorze 20 zadań dotyczących zgodności, ten sam model bazowy osiągał różne wyniki w zależności od struktury wokół niego; największy wzrost zanotowano, gdy wstrzykiwano wiedzę o ramie w czasie inferencji, szczególnie w przypadku mniej znanych ram. Zadania i regułę decyzyjną zamrożono przed uruchomieniem testu, zachowano zarejestrowany przed testem zakres remisu i opublikowano błędy.

Konfiguracja testu

Sześć wariantów. Ten sam model dla każdego wariantu (GLM 5.3-Flash, identyczna konfiguracja rozumowania, limit odpowiedzi i pin serwera), te same dwadzieścia pytań. Jedyną zmienną jest to, co otacza zapytanie:

WariantCo otrzymuje model
Model bazowySame pytanie. Nic więcej.
DIY prompt A / BDwa niezależnie napisane „prompty starszego konsultanta ds. GRC”, stworzone bez wglądu w zadania
DIY + wiedzaPrompt A plus wstrzykiwany moduł referencyjny ramy, który nasz system wstrzykuje
DIY + wiedza + dokumentyPowyższe, plus dokumenty kontekstowe zadania i aktualna data
Pełny ISMS CopilotProdukcyjne zestawienie: persony, wykrywanie ramy, wstrzykiwany moduł, data, dokumenty robocze

Dwadzieścia zamrożonych zadań: szesnaście standardowych pytań dotyczących dziewięciu ram, cztery pułapki (nieistniejąca kontrola ISO 27001, przestarzałe numerowanie z 2013 r., nieistniejący artykuł GDPR, błędna przesłanka dotycząca daty i zakresu DORA). Dziewięć zadań dotyczy dobrze znanych ram (ISO 27001, GDPR, SOC 2), jedenaście – mniej popularnych (ISO 42001, australijski ISM, DORA, NIS 2, TISAX, singapurski MTCS). Dwa zadania zawierają fikcyjny kontrakt lub dokument projektowy, którego odpowiedź musi rzeczywiście zacytować. Model sędziowski od innego dostawcy, nieznający, który wariant wygenerował daną odpowiedź, oceniał każdą odpowiedź według zamrożonych kryteriów; oddzielny, deterministyczny sprawdzacz weryfikował każde cytowane identyfikator kontroli lub artykułu względem rzeczywistych rejestrów.

Metoda została poddana recenzji przez drugi system AI przed zamrożeniem, i spełniła swoją rolę: wykryła błędy w kluczu odpowiedzi, sprawdzacz, który mógłby karać modele za poprawne odrzucenie fałszywych kontroli, oraz kilka sposobów, w jakie warianty mogłyby odbiegać. Wszystko naprawiono przed rozpoczęciem testów.

Zarejestrowany przed testem główny wynik

Główny punkt końcowy został zamrożony z wyprzedzeniem: pełny produkt kontra lepszy z dwóch DIY promptów.

WariantOgółemZnane ramyMniej znane ramy
Model bazowy68,0%66,7%69,0%
Najlepszy DIY prompt76,0%88,0%66,3%
DIY + moduł wiedzy96,9%100,0%94,3%
Pełny ISMS Copilot92,1%88,9%94,7%

Produkt uzyskał 92,1% wobec 76,0%: różnica 16,1 punktu, przedział ufności 95% [3,4, 30,2]. Zarejestrowany przed testem zakres remisu wynosił 18,2 punktu, określony na podstawie tego, jak bardzo sędzia waha się przy ponownej ocenie identycznych odpowiedzi. Różnica nie przekroczyła zakresu. Zarejestrowany werdykt to remis, i taki werdykt raportujemy. Nie poluzowaliśmy zakresu po zobaczeniu wyników.

Co faktycznie pokazują warstwy

Moduł wiedzy jest silnikiem. Sam prompt konsultanta plus wstrzyknięty moduł uzyskał 96,9%, najwyższy wynik wśród sześciu wariantów w tym zbiorze zadań. Moduł jest tym samym kuratorowanym modułem referencyjnym, który ISMS Copilot wstrzykuje, gdy pytanie wymienia ramę, i tym samym, który API udostępnia.

Zaletą produktu są mniej popularne ramy. W przypadku ISO 27001, GDPR i SOC 2 dobry DIY prompt jest na równi z produktem (88,0 wobec 88,9). Model bazowy zna klasyki. W przypadku ISO 42001, australijskiego ISM, DORA, NIS 2, TISAX i MTCS produkt uzyskał 94,7% wobec 66,3% dla najlepszego DIY promptu, a model bazowy – 69,0%. Poza zadaniami pułapkami, model bazowy sfabrykował 8 identyfikatorów kontroli i artykułów, w tym całą wymyśloną strukturę załącznika A ISO 42001. Produkt nie sfabrykował żadnego.

Jeden DIY prompt uzyskał gorszy wynik niż model bazowy w jednym zadaniu. W zadaniu dotyczącym struktury ISO 42001 uzyskał 32% wobec 82% modelu bazowego, po pewnym zaimportowaniu struktury załącznika A ISO 27001. Ponieważ prompt zmienił się jako całość, to uruchomienie nie izoluje, która instrukcja spowodowała regresję; dodanie modułu wiedzy podniosło wynik w tym samym zadaniu do 100%.

Błędy, wprost

Wariant z wiedzą i dokumentami uzyskał wyższy wynik niż produkt. Uzyskał 98,7% wobec 92,1%, z pięcioma różniącymi się komórkami zadań. Ten wynik pokazuje, że prompt A dostarczony z tym samym modułem wiedzy, aktualną datą i odpowiednimi dokumentami uzyskał wyższy wynik niż zestawienie produkcyjne w tym zbiorze zadań jednopytaniowych. Benchmark nie testował wartości stanu wieloetapowego, automatycznego wykrywania, obsługi przestrzeni roboczej ani innych funkcji związanych z przepływem pracy.

Produkt nie poradził sobie z jedną z czterech pułapek. Poproszony o wyjaśnienie nieistniejącej kontroli ISO 27001 A.8.35, produkt pewnie opisał ją jako bezpieczne kodowanie, co jest w rzeczywistości A.8.28. Jego wstrzyknięta tabela kontroli w tej samej odpowiedzi zakończyła się na A.8.34, a oba DIY z modułem wiedzy odrzuciły fałszywe założenie. Jednym z możliwych mechanizmów jest to, że dyrektywy dotyczące działania w produkcyjnym promptcie wpłynęły na zachowanie odrzucania, jednak wariant produktu różni się od tych DIY pod kilkoma względami, więc ten benchmark nie może przypisać błędu temu mechanizmowi. Jest to powtarzalna wada produktu w zadaniu t17.

Wykrywanie jest na poziomie nazwy. Jedno zadanie opisało naruszenie danych osobowych bez wymieniania GDPR. Produkt nic nie wstrzyknął i nadal dobrze odpowiedział bazując na wiedzy. Jest to udokumentowane zachowanie, a nie niespodzianka: nazwij ramę lub ją określ.

Co to pokazuje, a czego nie

To porównanie tego samego modelu bazowego przeprowadzono 2026-09-02 na dwudziestu zadaniach, jednej próbce na wariant na zadanie, zautomatyzowanym modelem sędziowskim i bez kalibracji przez człowieka. W tym zbiorze wyniki zmieniały się w opisanych kierunkach wraz ze zmianą struktury; wyniki nie określają wydajności poza tym zbiorem zadań i tym uruchomieniem. To nie jest porównanie między modelami ani opinia audytu i nie potwierdza eliminacji halucynacji. Publiczne podsumowanie metody, wyników, błędów i zastrzeżeń jest dostępne na stronie dokumentacji: Jakość odpowiedzi: benchmark struktury.

Powiązane artykuły

Cena modeli frontowych nie jest strategią zgodności
Engineering

Cena modeli frontowych nie jest strategią zgodności

Agenci zgodności to piece tokenowe: dane wejściowe, odniesienia do ram, analiza na wyjściu. Uruchamiamy API ISMS Copilot na modelu GLM 5.2 z wstrzykiwaną wiedzą ramową podczas inferencji, w cenie $2,80/$8,80 za milion tokenów oraz $0,50/$2,00 za pasmo hurtowe. Poniżej przedstawiamy obliczenia cenowe na podstawie arkusza cenowego Claude oraz dowody, dlaczego model niebędący modelem frontowym sprawdza się w pracy związanej ze zgodnością.

·8 min read
Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem
Engineering

Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem

W naszym badaniu ablacyjnym z 17 lipca 2026 dotyczącym strategii generowania dokumentów GRC (GLM-5.2 i Claude Opus 4.8 jako pisarze oraz sędziowie oceniający w skali 1-10), w drugim przebiegu 79 z 446 zarejestrowanych wierszy oceny nie zawierało wyniku ogólnego. Agregator potraktował każdy z nich jako 0. To samo wypełnianie zerami wygenerowało efekt punktowy 3,25 w pierwszym przebiegu, a gdy zniknęło, opracowaliśmy teorię dotyczącą tendencyjności sędziów, aby wyjaśnić dlaczego. Różnica między dwoma sędziami przy tych samych dokumentach wyniosła 0,12.

·14 min read