Koch Laboratory

Dwa badania wypowiedzi generowanych maszynowo: kryteria przed wynikami

Dwa badania z programu prognoz, każde rozstrzygane własnym pomiarem: czy system pracujący bez nadzoru się uczy, a nie racjonalizuje — sprawdzane na pytaniach rozstrzygniętych po dacie odcięcia danych treningowych jego modelu, z zabezpieczeniami, które zatrzymują wyjście zamiast dołączać ostrzeżenie — oraz jak obniżenie precyzji liczbowej modelu wpływa na wierność faktograficzną wypowiedzi wyprowadzanych z dokumentów źródłowych. Wyników jeszcze nie ma; kryteria są opublikowane przed jakimkolwiek wynikiem, a wpis prostuje wcześniejsze twierdzenie, że implementacja nie ruszyła.

Koch Laboratory — dwa badania wypowiedzi generowanych maszynowo: kryteria przed wynikami

Ten wpis kontynuuje wpis z 2026-08-10 o prognozach z mierzoną własną omylnością. Obejmuje wyłącznie dwa badania, z których każde rozstrzyga własny pomiar — badanie A rozwija kierunek 4 tamtego wpisu, badanie B nie było wcześniej opisane — i prostuje jedno twierdzenie z tamtego wpisu.

Metodyka. Problem → stan techniki → falsyfikowalne kryterium → metoda → status i najbliższy krok. Wstrzymane pozostają konstrukcja rozwiązań, forma produktu, domena zastosowania oraz modele i parametry.

Kryteria przed wynikami. Kryteria obu badań są opisane poniżej, zanim powstał jakikolwiek wynik, a data tego wpisu jest ostemplowana. Progi, modele i dane zostaną ustalone przed pierwszym pomiarem i opublikowane razem z wynikami.

1. Badanie A — uczenie czy racjonalizacja: zestaw kontrolny po dacie odcięcia i zabezpieczenia fail-closed

Pytanie badawcze. Czy system pracujący bez nadzoru potrafi wykazać, że się uczy, a nie tylko coraz sprawniej uzasadnia — na pytaniach, których rozstrzygnięcie stało się znane dopiero po dacie odcięcia danych treningowych jego modelu — i czy, gdy ta kontrola zawodzi, sam wstrzymuje publikację, zamiast publikować dalej z ostrzeżeniem? Dlaczego to trudne. Pętla pomiarowa takiego systemu mierzy zgodność z własnym korpusem, nie z rzeczywistością; system, który nauczył się uzasadniać zamiast przewidywać, pokazuje rosnące wskaźniki i spokojną pracę — cichy pozorny sukces. Pytanie, którego rozstrzygnięcie mogło trafić do danych treningowych, nie odróżnia przewidywania od przypominania, a pytań spoza daty odcięcia ubywa z każdą zmianą modelu. Przy niewielu rozstrzygnięciach dziennie test statystyczny wykrywa pogorszenie późno; zbyt czuły próg zatrzymania wstrzymuje system bez powodu, zbyt tępy reaguje po fakcie. A ostrzeżenie, które ktoś musi przeczytać, nie jest zabezpieczeniem. Stan techniki (publikowany). Kontaminacja — przenikanie danych ewaluacyjnych do treningowych — jest opisana (m.in. Sainz i in. 2023; Golchin i Surdeanu, ICLR 2024); ewaluacje zaprojektowane tak, by jej unikać, używają pytań młodszych od modelu albo dotyczących zdarzeń przyszłych (m.in. LiveBench, ForecastBench). Model potrafi podać przekonujące uzasadnienie, które nie oddaje rzeczywistej podstawy jego odpowiedzi (Turpin i in., NeurIPS 2023). Odmowa przy niepewności jest znana dla pojedynczej odpowiedzi (opcja odrzucenia Chowa, 1970), a przejście w stan bezpieczny po wykrytej usterce — z bezpieczeństwa funkcjonalnego (IEC 61508). Benchmarki oceniają jednak model z zewnątrz; tu kontrola ma działać wewnątrz pracującego systemu i rozstrzygać, czy wolno mu dalej publikować. Kryterium sukcesu. Wynik na zestawie kontrolnym odróżnialny od przypadku według testu ustalonego przed pierwszym pomiarem; wstrzymanie publikacji wykazane w działaniu — samoczynne, bez udziału człowieka; progi zatrzymania wyznaczone pomiarem, nie przyjęte z góry. Jawnie dopuszczony wynik negatywny: jeśli wynik na zestawie kontrolnym trwale nie odróżnia się od przypadku, badanie kończy się rzetelnym negatywem — a system, zgodnie z własną zasadą, nie publikuje. Metoda. Pytania kontrolne o rozstrzygnięciu już znanym, które nastąpiło po dacie odcięcia danych treningowych badanego modelu; zestaw jest odnawiany przy każdej zmianie modelu i liczony osobno od pozostałych pomiarów. Zabezpieczenia działają samoczynnie; test kryterium i warunki zatrzymania zostaną ustalone przed pierwszym pomiarem. Status: brak wyniku na kryterium — zestaw kontrolny jeszcze nie istnieje. Prace nad zabezpieczeniami ruszyły wraz z implementacją w sierpniu 2026 i nie są tu przedstawiane jako wynik. Najbliższy krok: budowa zestawu kontrolnego, w tym ocena istniejących publicznych zbiorów pytań (licencja, dopasowanie, liczebność).

2. Badanie B — wierność faktograficzna przy obniżonej precyzji modelu

Pytanie badawcze. Jak obniżenie precyzji liczbowej modelu (kwantyzacja, kompresja wag) wpływa na wierność faktograficzną wypowiedzi wyprowadzanych z dokumentów źródłowych — i czy z pomiaru da się wyznaczyć regułę odrzucenia wypowiedzi? Dlaczego to trudne. Niższą precyzję wymusza budżet obliczeniowy, a jej skutki ocenia się zwykle miarami zbiorczymi. Utrata wierności nie musi być widoczna w płynności: model może pisać gładko i dopisać fakt spoza źródła — i jest wtedy gorszy od sztywnego, który niczego nie dopisuje. Granica między uogólnieniem a dopisaniem jest nieostra, bo poprawne uogólnienie formalnie przypomina twierdzenie spoza źródła. Zbiór referencyjny jest z konieczności mały, co ogranicza moc wyznaczonej reguły, a reguła zbyt ostra może odrzucić tak wiele, że generowanie wypowiedzi straci sens. Stan techniki (publikowany). Metody kwantyzacji (m.in. GPTQ, Frantar i in., ICLR 2023; AWQ, Lin i in., MLSys 2024) raportują głównie miary zbiorcze: perplexity i dokładność na zestawach zadań. Wierność wobec źródła mierzy osobna linia metod, rozwijana niezależnie od precyzji modelu — sprawdzanie zgodności faktów i atomowych twierdzeń ze źródłem (m.in. TRUE, Honovich i in. 2022; AlignScore, Zha i in. 2023; FActScore, Min i in. 2023); przegląd Ji i in. (2023) dzieli takie błędy na sprzeczne ze źródłem i nieweryfikowalne w nim. Pomiar, który wiąże poziom precyzji z częstością konkretnych typów błędów i kończy się regułą odrzucenia, nie jest nam znany. Kryterium sukcesu. Wierność przed płynnością: wariant (model i poziom precyzji) poniżej progu wierności ustalonego przed pierwszym pomiarem odpada bez względu na jakość języka. Błędy liczone osobno w czterech kategoriach: twierdzenie dodane (nieobecne w źródle), zmieniona liczba lub jednostka, przesunięta atrybucja (wypowiedź przypisana komu innemu) i zmieniony stopień pewności (możliwość podana jako fakt albo odwrotnie). Wynik jest jednym z dwóch, oba dopuszczone z góry: zmierzona reguła odrzucenia albo udokumentowane stwierdzenie, że żaden model w ustalonym budżecie obliczeniowym nie jest wystarczająco wierny. Metoda. Zbiór referencyjny z dokumentów źródłowych i wyprowadzonych z nich wypowiedzi, w którym werdykt o każdej wypowiedzi wydaje lub zatwierdza człowiek. Kilka modeli o otwartych licencjach na kilku poziomach precyzji, w tym samym, z góry ustalonym budżecie obliczeniowym; najpierw wierność, potem płynność. Pomiar powtarzany przy każdej zmianie modelu. Status: kategorie błędów i procedura pomiaru są zdefiniowane; zbioru referencyjnego jeszcze nie ma i nic nie zostało zmierzone. Najbliższy krok: budowa zbioru referencyjnego.

Korekty wpisu z 2026-08-10

Wpis z 2026-08-10 przedstawiał program jako będący w fazie koncepcyjnej i podawał, że implementacja nie została rozpoczęta. Nie było to prawdą już w dniu publikacji: prace implementacyjne ruszyły na początku sierpnia 2026. Tamten wpis pozostaje bez zmian, bo jego treść jest ostemplowana; korekta jest datowana tym wpisem.

Status wpisu. Żadne z badań nie ma jeszcze wyniku na swoim kryterium. Wyniki — pozytywne albo negatywne — trafią do kolejnego datowanego wpisu razem z progami, modelami i danymi ustalonymi przed pierwszym pomiarem.


Dowód czasu

Ten tekst został zahaszowany i ostemplowany przy publikacji. Do sprawdzenia potrzebne są oba pliki: stempel dowodzi, że w tamtej chwili istniał dokładnie jeden ciąg bajtów, a tym ciągiem jest wyłącznie źródło poniżej. Każda późniejsza zmiana przesuwa skrót i zrywa zgodność — i o to właśnie chodzi.

· @529.58 · 2026-W40

SHA-256 ostemplowanego tekstu: 897118bad9e4ede411841ff12ea0bd585ee4101763fa341bb464e47ee9a8950d

Sprawdzenie: ots verify <dowód> --file <źródło>