ISMS Copilot
Engineering

Wymiana na niegorszy: jak wprowadzamy zmiany modeli przy remisie jakościowym

Trzy wstępnie zarejestrowane reguły decyzyjne przeniosły trzy powierzchnie czatu do GLM 5.3 w dniu 2026-09-01: zmiana myślenia (Grok 4.6 na GLM 5.3) uzyskała o 1,7 punktu niższy wynik w naszym czterozadaniowym zbiorze jakości i skróciła medianę czasu do pierwszego tokenu z 88,9 sekundy do 4,2 sekundy w naszym teście opóźnienia.

przez ISMS Copilot··12 min read
Wymiana na niegorszy: jak wprowadzamy zmiany modeli przy remisie jakościowym

1 września 2026 roku przeniesiono płatną powierzchnię czatu think z modelu Grok 4.6 (rozumowanie włączone) na GLM 5.3 (wysiłek wysoki) po ocenie, w której model wyzwalający uzyskał o 1,7 punktu niższy wynik pod względem jakości odpowiedzi. Na naszym produkcyjnym promcie mediana czasu do pierwszego tokenu treści w modelu aktualnym wynosiła 88 906 ms, natomiast w modelu wyzwalającym — 4 169 ms. Ta sama ocena przeniosła również płatną powierzchnię fast (wygrana +10,0 punktu) oraz oba tryby powierzchni darmowej (+13,3 i +11,7 punktu). Wszystkie trzy powierzchnie działają obecnie z modelem wyzwalającym w produkcji, a poprzednie modele są oddalone o jedną zmienną środowiskową. Nazywamy praktykę stojącą za tymi decyzjami wymianą na niegorszy i uważamy, że jest ona właściwym podejściem do zmian modeli w produkcji: zadaniem oceny nie jest znalezienie lepszego modelu, lecz ustalenie — zgodnie z regułami zamrożonymi przed uruchomieniem — że model wyzwalający nie jest gorszy, a następnie pozostawienie decyzji wymiarom, które użytkownicy faktycznie odczuwają (czas do pierwszego tokenu, ogony, niezawodność).

Dlaczego intuicyjna bramka zawodzi

Większość zespołów stosuje oczywistą bramkę przy wymianie modelu: przeprowadza się ocenę i wdraża tylko wtedy, gdy nowy model uzyska wyższy wynik. Dwa czynniki unieważniają tę bramkę.

Po pierwsze, w przypadku rzeczywistych zadań produktowych różnice jakościowe między obecnymi modelami wiodącymi są zwykle mniejsze niż zdolność sędziego do ich zmierzenia. Nasz 20-zadaniowy benchmark zgodności zmierzył wahnięcie test-retest sędziego na poziomie 18,2 punktu w skali 100-punktowej i wstępnie zarejestrował werdykt remisu właśnie na tej podstawie (ocena została przeprowadzona dzień po tej wymianie; opisaliśmy ją tutaj). Bramka wymagająca poprawy na tym instrumencie prawie nigdy nie działa uczciwie. Bramka bez niego wdraża rozwiązania oparte na szumie.

Po drugie, rygorystyczna bramka poprawy tworzy niewłaściwe bodźce: albo nic nigdy nie zostaje wdrożone, albo ktoś powtarza ocenę, aż szum przypadnie na korzyść modelu wyzwalającego.

Alternatywą jest podejście zaczerpnięte z badań klinicznych. Badanie na niegorszość nie pyta, czy nowe leczenie jest lepsze, lecz jedynie, czy jest akceptowalnie niegorsze w ramach marginesu zdefiniowanego przed zebraniem jakichkolwiek danych. Przenieśmy to podejście w całości: wstępnie zarejestruj pasmo remisu i operacyjne zabezpieczenia, przeprowadź ocenę jednokrotnie i uczyń werdykt mechanicznym.

Konfiguracja: trzy powierzchnie, trzy zamrożone reguły

Oceniliśmy trzy produkcyjne powierzchnie czatu tego samego produktu, jedno stanowisko oceny, jedno uruchomienie. Każda powierzchnia otrzymała własną regułę decyzyjną, zamrożoną 1 września 2026 roku przed rozpoczęciem oceny:

PowierzchniaModel aktualnyModel wyzwalającyWstępnie zarejestrowana reguła
Płatna fastGLM 5.2GLM 5.3-Flash, wysiłek niskiJakość w granicach 5,0 punktów I mediana czasu do pierwszego tokenu nie znacząco gorsza I p90 poniżej 8 s zapasowego wyścigu I wskaźnik >10 s nie gorszy o więcej niż 5 pp
Płatna thinkGrok 4.6, rozumowanie włączoneGLM 5.3, wysiłek wysokiJakość w granicach 5,0-punktowego pasma remisu uprawnia do zmiany
Darmowa (zalogowani poza limitem i zapasowy tryb przekroczenia limitu)GLM 4.7GLM 5.3-Flash, wysiłek niskiJakość w granicach 5,0 punktów I mediana czasu do pierwszego tokenu poniżej 2× aktualnego modelu

Pasmo remisu wynosiło 5,0 punktów w metryce jakości, zamrożone w planie i nie dostosowywane po uzyskaniu wyników. Jedno zabezpieczenie zostało zamrożone w formie tekstowej zamiast liczbowej: reguła powierzchni fast płatnej stwierdza, że mediana czasu do pierwszego tokenu modelu wyzwalającego musi być „nie znacząco gorsza”, bez określonego progu. Plan jest planem, a to zabezpieczenie wymagało oceny w sekcji wyników; poprawką jest wprowadzenie liczbowego progu następnym razem, co znajduje się w checklistce. Nasza warstwa strumieniowania przełącza się w stan oczekiwania po 8 sekundach bez pierwszego tokenu treści na powierzchniach fast i 120 sekundach na powierzchniach think, dlatego zabezpieczenia opóźnienia zostały sformułowane z uwzględnieniem tych rzeczywistych budżetów.

Metodyka, zamrożona:

  • Prompt był produktowym zestawem. 22 445 znaków: zwięzły stylistyka promptu, wstrzyknięcie wiedzy frameworku zbudowane z pytania, blok roboczy, data. Identyczny bajtowo we wszystkich wariantach. Kompaktowy przykładowy prompt zmierzyłby inny produkt.
  • Cztery zadania, trzy długie zadania GRC dotyczące odpowiedzi oraz jedno zadanie dotyczące polityki osadzonej w przestrzeni roboczej, każde oceniane według 5-kryterialnej skali 0–2. Trzy próbki na wariant na zadanie w temperaturze 0.
  • Jeden model-sędzia oceniał każde wyjście w trybie ślepym: Grok 4.3, uruchomiony przez OpenRouter, bez etykiet wariantów, bez znajomości tego, który model wygenerował dany wynik. Dzieli on rodzinę dostawcy z dokładnie jednym wariantem — aktualnym modelem think. Samopreferencja w ocenach LLM jest udokumentowana, gdy sędzia ocenia własne generacje (Panickssery, Bowman i Feng, arXiv:2404.13076, 15.04.2024), a tendencyjność związana z pozycją i gadatliwością jest skatalogowana w konfiguracjach LLM-jako-sędzia (Zheng i in., arXiv:2306.05685, 09.06.2023). Żaden z artykułów nie mierzy tendencyjności na poziomie rodziny, a my również tego nie robiliśmy, dlatego zanotowaliśmy kierunek ryzyka zamiast zakładać neutralność: jeśli istnieje tu tendencyjność rodzinna, faworyzuje ona model aktualny, co powoduje, że zmiana think jest konserwatywna, a nie liberalna.
  • Bazowe modele aktualne zostały odświeżone w tym samym uruchomieniu. Nasza ocena z czerwca 2026 roku tego samego modelu aktualnego używała innego sędziego i wcześniejszego zestawu promptów, dlatego ponowne użycie zapisanych liczb porównałoby dwa różne instrumenty. Ten sam sędzia, ten sam dzień, ten sam zestaw — w przeciwnym razie porównanie nie jest rozstrzygające.
  • Wstępnie zarejestrowany limit wydatków z automatycznym przerwaniem oraz twarde limity czasu na pojedyncze wywołania.

Wyniki

Jakość to średni wynik sędziego wyrażony jako procent maksymalnej punktacji w skali; 12 ocenionych generacji na wariant (4 zadania, 3 próbki), 1 września 2026 roku:

PowierzchniaWariantJakość
Płatna fastGLM 5.2 (aktualny)81,7
Płatna fastGLM 5.3-Flash, wysiłek niski91,7
Płatna thinkGrok 4.6, rozumowanie włączone (aktualny)91,7
Płatna thinkGLM 5.3, wysiłek wysoki90,0
Darmowa fastGLM 4.7 (aktualny)80,0
Darmowa fastGLM 5.3-Flash, wysiłek niski93,3
Darmowa thinkGLM 4.7, rozumowanie włączone (aktualny)80,8
Darmowa thinkGLM 5.3-Flash, wysiłek niski92,5

Opóźnienie to czas do pierwszego tokenu treści w połączeniu strumieniowym; sześć powtórzeń na wariant w jednym zadaniu osadzonym w przestrzeni roboczej (ten sam 22 445-znakowy zestaw promptów co benchmark jakości), 1 września 2026 roku:

WariantTTFC medianaTTFC p90Powtórzenia powyżej 10 s
Płatna fast: GLM 5.2773 ms2 626 ms0 z 6
Płatna fast: GLM 5.3-Flash2 641 ms4 011 ms0 z 6
Płatna think: Grok 4.688 906 ms101 591 ms6 z 6
Płatna think: GLM 5.34 169 ms57 707 ms2 z 6
Darmowa fast: GLM 4.72 857 ms3 163 ms0 z 6
Darmowa fast: GLM 5.3-Flash3 350 ms3 640 ms0 z 6
Darmowa think: GLM 4.718 014 ms24 156 ms6 z 6
Darmowa think: GLM 5.3-Flash3 052 ms7 612 ms0 z 6

Zastosowane mechanicznie, zamrożone reguły wydały trzy werdykty:

  • Płatna fast: DO WDRĄŻENIA, a powierzchnia stała się wolniejsza. Jakość +10,0 punktu. Pierwszy token 3,4× wolniejszy (773 ms do 2 641 ms mediany), ale p90 przy 4,0 s wobec 8-sekundowego wyścigu zapasowego i zero powtórzeń powyżej 10 s po obu stronach. Właśnie tutaj werdykt przestał być w pełni mechaniczny: zabezpieczenie tekstowe („nie znacząco gorsza”) nie miało progu, dlatego uznaliśmy, że 2,6 s mediany z p90 4,0 s i brakiem ogonów je spełnia. Ta decyzja została tutaj odnotowana zamiast być „przepuszczona” przez próg, który nigdy nie istniał. To, czy użytkownicy postrzegają 2,6 s jako gorsze od 0,8 s, nie zostało zmierzone przez tę ocenę; to, co ona ustaliła, to fakt, że zabezpieczenie w zamrożonej formie przeszło, a wymóg szybszego modelu aktualnego zablokowałby wymianę, którą zamrożone reguły uznały za jednoznaczną wygraną jakościową.
  • Płatna think: DO WDRĄŻENIA przy remisie. 90,0 wobec 91,7 to -1,7 punktu, w granicach 5,0-punktowego pasma. Wobec tego mediana czasu do pierwszego tokenu modelu aktualnego w naszym teście wynosząca 88,9 sekundy (6 z 6 powtórzeń powyżej 10 s) stała się 4,2 sekundy mediany (2 z 6 powyżej 10 s, a p90 modelu aktualnego wynosił już ponad 100 s). 21-krotna poprawa w wymiarze odczuwanym przez użytkowników przy zaledwie 1,7 punkcie wstępnie zarejestrowanego pasma remisu.
  • Darmowa: DO WDRĄŻENIA. +13,3 punktu w trybie fast, +11,7 w trybie think, a stary tryb think z medianą 18,0 sekundy i 6 z 6 ogonami stał się 3,1 s z żadnymi.

To właśnie werdykt think warto poddać dyskusji, dlatego oto pełna argumentacja. Wstępnie zarejestrowane pasmo stwierdza, że różnica 1,7 punktu nie jest różnicą jakościową. 18,2-punktowe wahnięcie ponownej oceny, które zmierzyliśmy następnego dnia w benchmarku zgodności na innym zestawie zadań i skali punktacji, jest jedynym bezpośrednim pomiarem, jakim dysponujemy dotyczącym rozdzielczości naszych instrumentów, i znajduje się o rząd wielkości powyżej tej różnicy. Żadna z liczb nie jest przedziałem ufności dla tej konkretnej różnicy, a pasmo jest regułą decyzyjną, a nie zmierzoną podłogą szumu. Jednak obie wskazują w tym samym kierunku. Utrzymywanie powierzchni think przy 1,7 punkcie, których nasze instrumenty nie rozróżniają, podczas gdy mediana czasu do pierwszego tokenu modelu aktualnego w naszym teście wynosiła 89 sekund, odwraca priorytety: wymiarem odczuwanym przez użytkowników jako pierwszy jest opóźnienie, a ono poprawiło się 21-krotnie w naszym pomiarze.

Weredykt ma datę ważności

W czerwcu 2026 roku oceniliśmy GLM 5.2 (wydany 16 czerwca 2026 roku) jako zamiennik GLM 4.7 w tym samym produkcie, a werdykt z 18 czerwca 2026 roku brzmiał: nie zastępuj. Dwa niezależne ślepe sędziowie uznali go za równego jakościowo GLM 4.7, z dokładnymi remisami po wykluczeniu błędu infrastruktury, ale zdecydowanie nie spełnił on bramki operacyjnej, przede wszystkim pod względem opóźnienia think: mediana 93 s do pierwszego tokenu treści wobec 2,1 s GLM 4.7 w naszych zadaniach i konfiguracji — 44-krotna różnica.

Trzy miesiące później jego następca wypadł w ocenie wrześniowej zdecydowanie lepiej od tego samego modelu aktualnego w obu trybach darmowych. Dwa wnioski, które obecnie traktujemy jako stałe reguły.

Werdykt dotyczący modelu ma okres ważności liczony w miesiącach. Werdykt „równa jakościowo, nie nadaje się do wdrożenia operacyjnego” dotyczy jednego modelu w jednym punkcie czasowym, a nie samego slotu; slot otrzymał inny model, a werdykt uległ zmianie. To kolejny powód, dla którego odświeżamy bazy modeli aktualnych w każdej ocenie wymiany zamiast cytować zapisane — zapisane bazy porównują milcząco przez różne instrumenty, a nieaktualne werdykty porównują milcząco przez różne generacje modeli. Czerwcowa liczba była prawdziwa. Nie odziedziczyliśmy jej i nie była wiążąca.

Dwie rzeczy, które stanowisko oceny wychwyciło

Puste generacje przy ciasnym limicie. Pierwsze uruchomienie pomiaru opóźnienia 1 września 2026 roku uruchamiało każdy wariant przy limicie dokończenia 256 tokenów. Wszystkie dwanaście wierszy dwóch wariantów think GLM (GLM 4.7 i GLM 5.2, po sześć każdy) powróciło puste: kanał rozumowania zużył budżet przed pojawieniem się pierwszego tokenu treści, dlatego wiersz mierzył limit, a nie model. Wariant think Grok 4.6 strumieniował bez problemu przy tym samym limicie. Unieważniliśmy uruchomienie i powtórzyliśmy warianty think GLM z limitem 4 096 tokenów przed odczytaniem jakichkolwiek percentyli; benchmark jakości używał budżetu 16k przez cały czas i nie został dotknięty. Jest to ta sama klasa błędu co „ciche zero”, o którym pisaliśmy w sierpniu (dane bez niczego w środku, ocenione jako pomiar). Tania straż to niechwalebna: policz puste generacje na wariant i odrzuć agregację dla jakiegokolwiek wariantu, który ma choć jedną.

Kształt żądania modelu aktualnego nie przenosi się. Sprawdziliśmy, czy poprzednią konfigurację można skopiować na model wyzwalający. W naszym teście API z 1 września 2026 roku 24 z 24 wywołań do GLM 5.3 i GLM 5.3-Flash, które zawierały reasoning: {enabled: false} w przebadanym endpointcie, zwróciło HTTP 400, dlatego w naszych testach nie można wyłączyć rozumowania w tej rodzinie; wysiłek niski jest dolną granicą, a nie pokrętłem. Migracja modelu wymaga ponownego wyprowadzenia konfiguracji żądania z faktycznego zachowania modelu wyzwalającego. Każdy parametr skopiowany z modelu aktualnego bez ponownego przetestowania jest czynnikiem zakłócającym, który wprowadzasz do własnej oceny.

Co to twierdzenie stwierdza, a czego nie

Liczby dotyczące jakości pochodzą z 12 ocenionych generacji na wariant (4 zadania, 3 próbki, temperatura 0), jednego modelu-sędziego, bez kalibracji przez człowieka skal rubryk czatu, jednego uruchomienia w jednym dniu (1 września 2026 roku), jedynie dla naszego zestawu promptów i konfiguracji serwowania. 5,0-punktowe pasmo remisu było wstępnie zarejestrowaną regułą decyzyjną, a nie zmierzoną podłogą szumu dla tego instrumentu; nasz 20-zadaniowy benchmark zgodności, uruchomiony następnego dnia (2 września 2026 roku) na innym zestawie zadań i skali punktacji, zmierzył 18,2-punktowe wahnięcie test-retest sędziego, dlatego traktujemy różnice jakościowe w granicach pasma jako niezmierzone, a nie jako zerowe. Percentyle opóźnienia pochodzą z sześciu powtórzeń strumieniowych na wariant w jednym zadaniu osadzonym w przestrzeni roboczej, naszym zestawie promptów, naszej konfiguracji, tego dnia: właściwości naszej konfiguracji, a nie benchmarków dostawcy. Wszystkie wyniki są punktowe w czasie na dzień 1 września 2026 roku. Publiczny opis naszej metodyki benchmarku, w tym sposób mierzenia wahnięcia sędziego, znajduje się na stronie model quality.

Checklistka

Przed następną wymianą modelu w produkcji:

  1. Zamroź regułę decyzyjną dla każdej powierzchni przed uruchomieniem: pasmo remisu, zabezpieczenia opóźnienia, zabezpieczenia ogonów, limit wydatków i to, co oznacza remis.
  2. Określ wielkość pasma remisu na podstawie wahnięcia test-retest sędziego w Twoich skalach. Jeśli nigdy nie powtórzyłeś oceny identycznych odpowiedzi, nie wiesz, jak małe są Twoje mierzalne różnice jakościowe.
  3. Oceń na produkcyjnym zestawie promptów, identycznym bajtowo we wszystkich wariantach. Przykładowy prompt mierzy produkt, którego nie prowadzisz.
  4. Odśwież bazy modeli aktualnych w tym samym uruchomieniu, z tym samym sędzią, tego samego dnia. Zapisane bazy to porównania przez różne instrumenty.
  5. Strzeż ogonów, a nie średnich: p90 czasu do pierwszego tokenu i wskaźnik powyżej 10 s, z uwzględnieniem rzeczywistych rezerw strumieniowania.
  6. Policz puste generacje na wariant i odrzuć agregację dla jakiegokolwiek wariantu, który ma choć jedną. Napraw budżet dokończenia, a następnie mierz.
  7. Ponownie wyprowadź konfigurację żądania dla modelu wyzwalającego, w tym parametry rozumowania. Nigdy nie kopiuj kształtu modelu aktualnego do oceny.
  8. Znajdź kierunek tendencyjności rodzinnej sędziego i zaprojektuj tak, aby działała konserwatywnie.
  9. Nadaj każdemu werdyktowi datę ważności. Powtórz wszystko, co jest starsze niż kwartał.

Remis nie jest niezdecydowaniem. Jest to werdykt, który Twoja ocena jakości może rzeczywiście obronić, a uczynienie go wstępnie zarejestrowanym to sposób na przekazanie decyzji wymiarom, które odczuwają Twoi użytkownicy.

Powiązane artykuły

Cena modeli frontowych nie jest strategią zgodności
Engineering

Cena modeli frontowych nie jest strategią zgodności

Agenci zgodności to piece tokenowe: dane wejściowe, odniesienia do ram, analiza na wyjściu. Uruchamiamy API ISMS Copilot na modelu GLM 5.2 z wstrzykiwaną wiedzą ramową podczas inferencji, w cenie $2,80/$8,80 za milion tokenów oraz $0,50/$2,00 za pasmo hurtowe. Poniżej przedstawiamy obliczenia cenowe na podstawie arkusza cenowego Claude oraz dowody, dlaczego model niebędący modelem frontowym sprawdza się w pracy związanej ze zgodnością.

·8 min read
Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem
Engineering

Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem

W naszym badaniu ablacyjnym z 17 lipca 2026 dotyczącym strategii generowania dokumentów GRC (GLM-5.2 i Claude Opus 4.8 jako pisarze oraz sędziowie oceniający w skali 1-10), w drugim przebiegu 79 z 446 zarejestrowanych wierszy oceny nie zawierało wyniku ogólnego. Agregator potraktował każdy z nich jako 0. To samo wypełnianie zerami wygenerowało efekt punktowy 3,25 w pierwszym przebiegu, a gdy zniknęło, opracowaliśmy teorię dotyczącą tendencyjności sędziów, aby wyjaśnić dlaczego. Różnica między dwoma sędziami przy tych samych dokumentach wyniosła 0,12.

·14 min read