Wymiana na niegorszy: jak wprowadzamy zmiany modeli przy remisie jakościowym
Trzy wstępnie zarejestrowane reguły decyzyjne przeniosły trzy powierzchnie czatu do GLM 5.3 w dniu 2026-09-01: zmiana myślenia (Grok 4.6 na GLM 5.3) uzyskała o 1,7 punktu niższy wynik w naszym czterozadaniowym zbiorze jakości i skróciła medianę czasu do pierwszego tokenu z 88,9 sekundy do 4,2 sekundy w naszym teście opóźnienia.

1 września 2026 roku przeniesiono płatną powierzchnię czatu think z modelu Grok 4.6 (rozumowanie włączone) na GLM 5.3 (wysiłek wysoki) po ocenie, w której model wyzwalający uzyskał o 1,7 punktu niższy wynik pod względem jakości odpowiedzi. Na naszym produkcyjnym promcie mediana czasu do pierwszego tokenu treści w modelu aktualnym wynosiła 88 906 ms, natomiast w modelu wyzwalającym — 4 169 ms. Ta sama ocena przeniosła również płatną powierzchnię fast (wygrana +10,0 punktu) oraz oba tryby powierzchni darmowej (+13,3 i +11,7 punktu). Wszystkie trzy powierzchnie działają obecnie z modelem wyzwalającym w produkcji, a poprzednie modele są oddalone o jedną zmienną środowiskową. Nazywamy praktykę stojącą za tymi decyzjami wymianą na niegorszy i uważamy, że jest ona właściwym podejściem do zmian modeli w produkcji: zadaniem oceny nie jest znalezienie lepszego modelu, lecz ustalenie — zgodnie z regułami zamrożonymi przed uruchomieniem — że model wyzwalający nie jest gorszy, a następnie pozostawienie decyzji wymiarom, które użytkownicy faktycznie odczuwają (czas do pierwszego tokenu, ogony, niezawodność).
Dlaczego intuicyjna bramka zawodzi
Większość zespołów stosuje oczywistą bramkę przy wymianie modelu: przeprowadza się ocenę i wdraża tylko wtedy, gdy nowy model uzyska wyższy wynik. Dwa czynniki unieważniają tę bramkę.
Po pierwsze, w przypadku rzeczywistych zadań produktowych różnice jakościowe między obecnymi modelami wiodącymi są zwykle mniejsze niż zdolność sędziego do ich zmierzenia. Nasz 20-zadaniowy benchmark zgodności zmierzył wahnięcie test-retest sędziego na poziomie 18,2 punktu w skali 100-punktowej i wstępnie zarejestrował werdykt remisu właśnie na tej podstawie (ocena została przeprowadzona dzień po tej wymianie; opisaliśmy ją tutaj). Bramka wymagająca poprawy na tym instrumencie prawie nigdy nie działa uczciwie. Bramka bez niego wdraża rozwiązania oparte na szumie.
Po drugie, rygorystyczna bramka poprawy tworzy niewłaściwe bodźce: albo nic nigdy nie zostaje wdrożone, albo ktoś powtarza ocenę, aż szum przypadnie na korzyść modelu wyzwalającego.
Alternatywą jest podejście zaczerpnięte z badań klinicznych. Badanie na niegorszość nie pyta, czy nowe leczenie jest lepsze, lecz jedynie, czy jest akceptowalnie niegorsze w ramach marginesu zdefiniowanego przed zebraniem jakichkolwiek danych. Przenieśmy to podejście w całości: wstępnie zarejestruj pasmo remisu i operacyjne zabezpieczenia, przeprowadź ocenę jednokrotnie i uczyń werdykt mechanicznym.
Konfiguracja: trzy powierzchnie, trzy zamrożone reguły
Oceniliśmy trzy produkcyjne powierzchnie czatu tego samego produktu, jedno stanowisko oceny, jedno uruchomienie. Każda powierzchnia otrzymała własną regułę decyzyjną, zamrożoną 1 września 2026 roku przed rozpoczęciem oceny:
| Powierzchnia | Model aktualny | Model wyzwalający | Wstępnie zarejestrowana reguła |
|---|---|---|---|
| Płatna fast | GLM 5.2 | GLM 5.3-Flash, wysiłek niski | Jakość w granicach 5,0 punktów I mediana czasu do pierwszego tokenu nie znacząco gorsza I p90 poniżej 8 s zapasowego wyścigu I wskaźnik >10 s nie gorszy o więcej niż 5 pp |
| Płatna think | Grok 4.6, rozumowanie włączone | GLM 5.3, wysiłek wysoki | Jakość w granicach 5,0-punktowego pasma remisu uprawnia do zmiany |
| Darmowa (zalogowani poza limitem i zapasowy tryb przekroczenia limitu) | GLM 4.7 | GLM 5.3-Flash, wysiłek niski | Jakość w granicach 5,0 punktów I mediana czasu do pierwszego tokenu poniżej 2× aktualnego modelu |
Pasmo remisu wynosiło 5,0 punktów w metryce jakości, zamrożone w planie i nie dostosowywane po uzyskaniu wyników. Jedno zabezpieczenie zostało zamrożone w formie tekstowej zamiast liczbowej: reguła powierzchni fast płatnej stwierdza, że mediana czasu do pierwszego tokenu modelu wyzwalającego musi być „nie znacząco gorsza”, bez określonego progu. Plan jest planem, a to zabezpieczenie wymagało oceny w sekcji wyników; poprawką jest wprowadzenie liczbowego progu następnym razem, co znajduje się w checklistce. Nasza warstwa strumieniowania przełącza się w stan oczekiwania po 8 sekundach bez pierwszego tokenu treści na powierzchniach fast i 120 sekundach na powierzchniach think, dlatego zabezpieczenia opóźnienia zostały sformułowane z uwzględnieniem tych rzeczywistych budżetów.
Metodyka, zamrożona:
- Prompt był produktowym zestawem. 22 445 znaków: zwięzły stylistyka promptu, wstrzyknięcie wiedzy frameworku zbudowane z pytania, blok roboczy, data. Identyczny bajtowo we wszystkich wariantach. Kompaktowy przykładowy prompt zmierzyłby inny produkt.
- Cztery zadania, trzy długie zadania GRC dotyczące odpowiedzi oraz jedno zadanie dotyczące polityki osadzonej w przestrzeni roboczej, każde oceniane według 5-kryterialnej skali 0–2. Trzy próbki na wariant na zadanie w temperaturze 0.
- Jeden model-sędzia oceniał każde wyjście w trybie ślepym: Grok 4.3, uruchomiony przez OpenRouter, bez etykiet wariantów, bez znajomości tego, który model wygenerował dany wynik. Dzieli on rodzinę dostawcy z dokładnie jednym wariantem — aktualnym modelem think. Samopreferencja w ocenach LLM jest udokumentowana, gdy sędzia ocenia własne generacje (Panickssery, Bowman i Feng, arXiv:2404.13076, 15.04.2024), a tendencyjność związana z pozycją i gadatliwością jest skatalogowana w konfiguracjach LLM-jako-sędzia (Zheng i in., arXiv:2306.05685, 09.06.2023). Żaden z artykułów nie mierzy tendencyjności na poziomie rodziny, a my również tego nie robiliśmy, dlatego zanotowaliśmy kierunek ryzyka zamiast zakładać neutralność: jeśli istnieje tu tendencyjność rodzinna, faworyzuje ona model aktualny, co powoduje, że zmiana think jest konserwatywna, a nie liberalna.
- Bazowe modele aktualne zostały odświeżone w tym samym uruchomieniu. Nasza ocena z czerwca 2026 roku tego samego modelu aktualnego używała innego sędziego i wcześniejszego zestawu promptów, dlatego ponowne użycie zapisanych liczb porównałoby dwa różne instrumenty. Ten sam sędzia, ten sam dzień, ten sam zestaw — w przeciwnym razie porównanie nie jest rozstrzygające.
- Wstępnie zarejestrowany limit wydatków z automatycznym przerwaniem oraz twarde limity czasu na pojedyncze wywołania.
Wyniki
Jakość to średni wynik sędziego wyrażony jako procent maksymalnej punktacji w skali; 12 ocenionych generacji na wariant (4 zadania, 3 próbki), 1 września 2026 roku:
| Powierzchnia | Wariant | Jakość |
|---|---|---|
| Płatna fast | GLM 5.2 (aktualny) | 81,7 |
| Płatna fast | GLM 5.3-Flash, wysiłek niski | 91,7 |
| Płatna think | Grok 4.6, rozumowanie włączone (aktualny) | 91,7 |
| Płatna think | GLM 5.3, wysiłek wysoki | 90,0 |
| Darmowa fast | GLM 4.7 (aktualny) | 80,0 |
| Darmowa fast | GLM 5.3-Flash, wysiłek niski | 93,3 |
| Darmowa think | GLM 4.7, rozumowanie włączone (aktualny) | 80,8 |
| Darmowa think | GLM 5.3-Flash, wysiłek niski | 92,5 |
Opóźnienie to czas do pierwszego tokenu treści w połączeniu strumieniowym; sześć powtórzeń na wariant w jednym zadaniu osadzonym w przestrzeni roboczej (ten sam 22 445-znakowy zestaw promptów co benchmark jakości), 1 września 2026 roku:
| Wariant | TTFC mediana | TTFC p90 | Powtórzenia powyżej 10 s |
|---|---|---|---|
| Płatna fast: GLM 5.2 | 773 ms | 2 626 ms | 0 z 6 |
| Płatna fast: GLM 5.3-Flash | 2 641 ms | 4 011 ms | 0 z 6 |
| Płatna think: Grok 4.6 | 88 906 ms | 101 591 ms | 6 z 6 |
| Płatna think: GLM 5.3 | 4 169 ms | 57 707 ms | 2 z 6 |
| Darmowa fast: GLM 4.7 | 2 857 ms | 3 163 ms | 0 z 6 |
| Darmowa fast: GLM 5.3-Flash | 3 350 ms | 3 640 ms | 0 z 6 |
| Darmowa think: GLM 4.7 | 18 014 ms | 24 156 ms | 6 z 6 |
| Darmowa think: GLM 5.3-Flash | 3 052 ms | 7 612 ms | 0 z 6 |
Zastosowane mechanicznie, zamrożone reguły wydały trzy werdykty:
- Płatna fast: DO WDRĄŻENIA, a powierzchnia stała się wolniejsza. Jakość +10,0 punktu. Pierwszy token 3,4× wolniejszy (773 ms do 2 641 ms mediany), ale p90 przy 4,0 s wobec 8-sekundowego wyścigu zapasowego i zero powtórzeń powyżej 10 s po obu stronach. Właśnie tutaj werdykt przestał być w pełni mechaniczny: zabezpieczenie tekstowe („nie znacząco gorsza”) nie miało progu, dlatego uznaliśmy, że 2,6 s mediany z p90 4,0 s i brakiem ogonów je spełnia. Ta decyzja została tutaj odnotowana zamiast być „przepuszczona” przez próg, który nigdy nie istniał. To, czy użytkownicy postrzegają 2,6 s jako gorsze od 0,8 s, nie zostało zmierzone przez tę ocenę; to, co ona ustaliła, to fakt, że zabezpieczenie w zamrożonej formie przeszło, a wymóg szybszego modelu aktualnego zablokowałby wymianę, którą zamrożone reguły uznały za jednoznaczną wygraną jakościową.
- Płatna think: DO WDRĄŻENIA przy remisie. 90,0 wobec 91,7 to -1,7 punktu, w granicach 5,0-punktowego pasma. Wobec tego mediana czasu do pierwszego tokenu modelu aktualnego w naszym teście wynosząca 88,9 sekundy (6 z 6 powtórzeń powyżej 10 s) stała się 4,2 sekundy mediany (2 z 6 powyżej 10 s, a p90 modelu aktualnego wynosił już ponad 100 s). 21-krotna poprawa w wymiarze odczuwanym przez użytkowników przy zaledwie 1,7 punkcie wstępnie zarejestrowanego pasma remisu.
- Darmowa: DO WDRĄŻENIA. +13,3 punktu w trybie fast, +11,7 w trybie think, a stary tryb think z medianą 18,0 sekundy i 6 z 6 ogonami stał się 3,1 s z żadnymi.
To właśnie werdykt think warto poddać dyskusji, dlatego oto pełna argumentacja. Wstępnie zarejestrowane pasmo stwierdza, że różnica 1,7 punktu nie jest różnicą jakościową. 18,2-punktowe wahnięcie ponownej oceny, które zmierzyliśmy następnego dnia w benchmarku zgodności na innym zestawie zadań i skali punktacji, jest jedynym bezpośrednim pomiarem, jakim dysponujemy dotyczącym rozdzielczości naszych instrumentów, i znajduje się o rząd wielkości powyżej tej różnicy. Żadna z liczb nie jest przedziałem ufności dla tej konkretnej różnicy, a pasmo jest regułą decyzyjną, a nie zmierzoną podłogą szumu. Jednak obie wskazują w tym samym kierunku. Utrzymywanie powierzchni think przy 1,7 punkcie, których nasze instrumenty nie rozróżniają, podczas gdy mediana czasu do pierwszego tokenu modelu aktualnego w naszym teście wynosiła 89 sekund, odwraca priorytety: wymiarem odczuwanym przez użytkowników jako pierwszy jest opóźnienie, a ono poprawiło się 21-krotnie w naszym pomiarze.
Weredykt ma datę ważności
W czerwcu 2026 roku oceniliśmy GLM 5.2 (wydany 16 czerwca 2026 roku) jako zamiennik GLM 4.7 w tym samym produkcie, a werdykt z 18 czerwca 2026 roku brzmiał: nie zastępuj. Dwa niezależne ślepe sędziowie uznali go za równego jakościowo GLM 4.7, z dokładnymi remisami po wykluczeniu błędu infrastruktury, ale zdecydowanie nie spełnił on bramki operacyjnej, przede wszystkim pod względem opóźnienia think: mediana 93 s do pierwszego tokenu treści wobec 2,1 s GLM 4.7 w naszych zadaniach i konfiguracji — 44-krotna różnica.
Trzy miesiące później jego następca wypadł w ocenie wrześniowej zdecydowanie lepiej od tego samego modelu aktualnego w obu trybach darmowych. Dwa wnioski, które obecnie traktujemy jako stałe reguły.
Werdykt dotyczący modelu ma okres ważności liczony w miesiącach. Werdykt „równa jakościowo, nie nadaje się do wdrożenia operacyjnego” dotyczy jednego modelu w jednym punkcie czasowym, a nie samego slotu; slot otrzymał inny model, a werdykt uległ zmianie. To kolejny powód, dla którego odświeżamy bazy modeli aktualnych w każdej ocenie wymiany zamiast cytować zapisane — zapisane bazy porównują milcząco przez różne instrumenty, a nieaktualne werdykty porównują milcząco przez różne generacje modeli. Czerwcowa liczba była prawdziwa. Nie odziedziczyliśmy jej i nie była wiążąca.
Dwie rzeczy, które stanowisko oceny wychwyciło
Puste generacje przy ciasnym limicie. Pierwsze uruchomienie pomiaru opóźnienia 1 września 2026 roku uruchamiało każdy wariant przy limicie dokończenia 256 tokenów. Wszystkie dwanaście wierszy dwóch wariantów think GLM (GLM 4.7 i GLM 5.2, po sześć każdy) powróciło puste: kanał rozumowania zużył budżet przed pojawieniem się pierwszego tokenu treści, dlatego wiersz mierzył limit, a nie model. Wariant think Grok 4.6 strumieniował bez problemu przy tym samym limicie. Unieważniliśmy uruchomienie i powtórzyliśmy warianty think GLM z limitem 4 096 tokenów przed odczytaniem jakichkolwiek percentyli; benchmark jakości używał budżetu 16k przez cały czas i nie został dotknięty. Jest to ta sama klasa błędu co „ciche zero”, o którym pisaliśmy w sierpniu (dane bez niczego w środku, ocenione jako pomiar). Tania straż to niechwalebna: policz puste generacje na wariant i odrzuć agregację dla jakiegokolwiek wariantu, który ma choć jedną.
Kształt żądania modelu aktualnego nie przenosi się. Sprawdziliśmy, czy poprzednią konfigurację można skopiować na model wyzwalający. W naszym teście API z 1 września 2026 roku 24 z 24 wywołań do GLM 5.3 i GLM 5.3-Flash, które zawierały reasoning: {enabled: false} w przebadanym endpointcie, zwróciło HTTP 400, dlatego w naszych testach nie można wyłączyć rozumowania w tej rodzinie; wysiłek niski jest dolną granicą, a nie pokrętłem. Migracja modelu wymaga ponownego wyprowadzenia konfiguracji żądania z faktycznego zachowania modelu wyzwalającego. Każdy parametr skopiowany z modelu aktualnego bez ponownego przetestowania jest czynnikiem zakłócającym, który wprowadzasz do własnej oceny.
Co to twierdzenie stwierdza, a czego nie
Liczby dotyczące jakości pochodzą z 12 ocenionych generacji na wariant (4 zadania, 3 próbki, temperatura 0), jednego modelu-sędziego, bez kalibracji przez człowieka skal rubryk czatu, jednego uruchomienia w jednym dniu (1 września 2026 roku), jedynie dla naszego zestawu promptów i konfiguracji serwowania. 5,0-punktowe pasmo remisu było wstępnie zarejestrowaną regułą decyzyjną, a nie zmierzoną podłogą szumu dla tego instrumentu; nasz 20-zadaniowy benchmark zgodności, uruchomiony następnego dnia (2 września 2026 roku) na innym zestawie zadań i skali punktacji, zmierzył 18,2-punktowe wahnięcie test-retest sędziego, dlatego traktujemy różnice jakościowe w granicach pasma jako niezmierzone, a nie jako zerowe. Percentyle opóźnienia pochodzą z sześciu powtórzeń strumieniowych na wariant w jednym zadaniu osadzonym w przestrzeni roboczej, naszym zestawie promptów, naszej konfiguracji, tego dnia: właściwości naszej konfiguracji, a nie benchmarków dostawcy. Wszystkie wyniki są punktowe w czasie na dzień 1 września 2026 roku. Publiczny opis naszej metodyki benchmarku, w tym sposób mierzenia wahnięcia sędziego, znajduje się na stronie model quality.
Checklistka
Przed następną wymianą modelu w produkcji:
- Zamroź regułę decyzyjną dla każdej powierzchni przed uruchomieniem: pasmo remisu, zabezpieczenia opóźnienia, zabezpieczenia ogonów, limit wydatków i to, co oznacza remis.
- Określ wielkość pasma remisu na podstawie wahnięcia test-retest sędziego w Twoich skalach. Jeśli nigdy nie powtórzyłeś oceny identycznych odpowiedzi, nie wiesz, jak małe są Twoje mierzalne różnice jakościowe.
- Oceń na produkcyjnym zestawie promptów, identycznym bajtowo we wszystkich wariantach. Przykładowy prompt mierzy produkt, którego nie prowadzisz.
- Odśwież bazy modeli aktualnych w tym samym uruchomieniu, z tym samym sędzią, tego samego dnia. Zapisane bazy to porównania przez różne instrumenty.
- Strzeż ogonów, a nie średnich: p90 czasu do pierwszego tokenu i wskaźnik powyżej 10 s, z uwzględnieniem rzeczywistych rezerw strumieniowania.
- Policz puste generacje na wariant i odrzuć agregację dla jakiegokolwiek wariantu, który ma choć jedną. Napraw budżet dokończenia, a następnie mierz.
- Ponownie wyprowadź konfigurację żądania dla modelu wyzwalającego, w tym parametry rozumowania. Nigdy nie kopiuj kształtu modelu aktualnego do oceny.
- Znajdź kierunek tendencyjności rodzinnej sędziego i zaprojektuj tak, aby działała konserwatywnie.
- Nadaj każdemu werdyktowi datę ważności. Powtórz wszystko, co jest starsze niż kwartał.
Remis nie jest niezdecydowaniem. Jest to werdykt, który Twoja ocena jakości może rzeczywiście obronić, a uczynienie go wstępnie zarejestrowanym to sposób na przekazanie decyzji wymiarom, które odczuwają Twoi użytkownicy.
Powiązane artykuły

Przetestowaliśmy ISMS Copilot w porównaniu z modelem bazowym i lepszym DIY promptem. Wstępnie zarejestrowany werdykt to remis.
Zamrożona ocena 20 zadań w sześciu konfiguracjach GLM 5.3-Flash: co zmienił moduł wiedzy, gdzie produkt i najlepszy samodzielny prompt zremisowały według reguły zamrożenia, oraz gdzie wersja z wiedzą i dokumentami uzyskała wyższe wyniki.

Cena modeli frontowych nie jest strategią zgodności
Agenci zgodności to piece tokenowe: dane wejściowe, odniesienia do ram, analiza na wyjściu. Uruchamiamy API ISMS Copilot na modelu GLM 5.2 z wstrzykiwaną wiedzą ramową podczas inferencji, w cenie $2,80/$8,80 za milion tokenów oraz $0,50/$2,00 za pasmo hurtowe. Poniżej przedstawiamy obliczenia cenowe na podstawie arkusza cenowego Claude oraz dowody, dlaczego model niebędący modelem frontowym sprawdza się w pracy związanej ze zgodnością.

Cichy zero: kiedy brakujący wynik sędziego staje się pomiarem
W naszym badaniu ablacyjnym z 17 lipca 2026 dotyczącym strategii generowania dokumentów GRC (GLM-5.2 i Claude Opus 4.8 jako pisarze oraz sędziowie oceniający w skali 1-10), w drugim przebiegu 79 z 446 zarejestrowanych wierszy oceny nie zawierało wyniku ogólnego. Agregator potraktował każdy z nich jako 0. To samo wypełnianie zerami wygenerowało efekt punktowy 3,25 w pierwszym przebiegu, a gdy zniknęło, opracowaliśmy teorię dotyczącą tendencyjności sędziów, aby wyjaśnić dlaczego. Różnica między dwoma sędziami przy tych samych dokumentach wyniosła 0,12.
