# Koch Laboratory — Dwa badania wypowiedzi generowanych maszynowo: kryteria przed wynikami · Forschungsportfolio / Portfolio badawcze / Research Portfolio

> **Zasada publikacji.** Publikujemy problem, stan techniki, falsyfikowalne kryterium i zarys metody. Progi, modele i dane obu badań zostaną ustalone przed pierwszym pomiarem i opublikowane razem z wynikami; konstrukcja rozwiązań, forma produktu i domena zastosowania pozostają wstrzymane.
> **Zasada uczciwości.** Żadne z dwóch badań nie ma jeszcze wyniku pomiarowego na swoim kryterium i tekst tego nie maskuje. Wynik negatywny jest w obu dopuszczony z góry i zostanie opublikowany na tych samych prawach co pozytywny.

---
---

# 🇵🇱 WERSJA POLSKA

## Koch Laboratory — dwa badania wypowiedzi generowanych maszynowo: kryteria przed wynikami

Ten wpis kontynuuje wpis z 2026-08-10 o prognozach z mierzoną własną omylnością. Obejmuje wyłącznie dwa badania, z których każde rozstrzyga własny pomiar — badanie A rozwija kierunek 4 tamtego wpisu, badanie B nie było wcześniej opisane — i prostuje jedno twierdzenie z tamtego wpisu.

**Metodyka.** Problem → stan techniki → falsyfikowalne kryterium → metoda → status i najbliższy krok. Wstrzymane pozostają konstrukcja rozwiązań, forma produktu, domena zastosowania oraz modele i parametry.

**Kryteria przed wynikami.** Kryteria obu badań są opisane poniżej, zanim powstał jakikolwiek wynik, a data tego wpisu jest ostemplowana. Progi, modele i dane zostaną ustalone przed pierwszym pomiarem i opublikowane razem z wynikami.

### 1. Badanie A — uczenie czy racjonalizacja: zestaw kontrolny po dacie odcięcia i zabezpieczenia fail-closed
**Pytanie badawcze.** Czy system pracujący bez nadzoru potrafi wykazać, że się uczy, a nie tylko coraz sprawniej uzasadnia — na pytaniach, których rozstrzygnięcie stało się znane dopiero po dacie odcięcia danych treningowych jego modelu — i czy, gdy ta kontrola zawodzi, sam wstrzymuje publikację, zamiast publikować dalej z ostrzeżeniem?
**Dlaczego to trudne.** Pętla pomiarowa takiego systemu mierzy zgodność z własnym korpusem, nie z rzeczywistością; system, który nauczył się uzasadniać zamiast przewidywać, pokazuje rosnące wskaźniki i spokojną pracę — cichy pozorny sukces. Pytanie, którego rozstrzygnięcie mogło trafić do danych treningowych, nie odróżnia przewidywania od przypominania, a pytań spoza daty odcięcia ubywa z każdą zmianą modelu. Przy niewielu rozstrzygnięciach dziennie test statystyczny wykrywa pogorszenie późno; zbyt czuły próg zatrzymania wstrzymuje system bez powodu, zbyt tępy reaguje po fakcie. A ostrzeżenie, które ktoś musi przeczytać, nie jest zabezpieczeniem.
**Stan techniki (publikowany).** Kontaminacja — przenikanie danych ewaluacyjnych do treningowych — jest opisana (m.in. Sainz i in. 2023; Golchin i Surdeanu, ICLR 2024); ewaluacje zaprojektowane tak, by jej unikać, używają pytań młodszych od modelu albo dotyczących zdarzeń przyszłych (m.in. LiveBench, ForecastBench). Model potrafi podać przekonujące uzasadnienie, które nie oddaje rzeczywistej podstawy jego odpowiedzi (Turpin i in., NeurIPS 2023). Odmowa przy niepewności jest znana dla pojedynczej odpowiedzi (opcja odrzucenia Chowa, 1970), a przejście w stan bezpieczny po wykrytej usterce — z bezpieczeństwa funkcjonalnego (IEC 61508). Benchmarki oceniają jednak model z zewnątrz; tu kontrola ma działać wewnątrz pracującego systemu i rozstrzygać, czy wolno mu dalej publikować.
**Kryterium sukcesu.** Wynik na zestawie kontrolnym odróżnialny od przypadku według testu ustalonego przed pierwszym pomiarem; wstrzymanie publikacji wykazane w działaniu — samoczynne, bez udziału człowieka; progi zatrzymania wyznaczone pomiarem, nie przyjęte z góry. Jawnie dopuszczony wynik negatywny: jeśli wynik na zestawie kontrolnym trwale nie odróżnia się od przypadku, badanie kończy się rzetelnym negatywem — a system, zgodnie z własną zasadą, nie publikuje.
**Metoda.** Pytania kontrolne o rozstrzygnięciu już znanym, które nastąpiło po dacie odcięcia danych treningowych badanego modelu; zestaw jest odnawiany przy każdej zmianie modelu i liczony osobno od pozostałych pomiarów. Zabezpieczenia działają samoczynnie; test kryterium i warunki zatrzymania zostaną ustalone przed pierwszym pomiarem.
**Status:** brak wyniku na kryterium — zestaw kontrolny jeszcze nie istnieje. Prace nad zabezpieczeniami ruszyły wraz z implementacją w sierpniu 2026 i nie są tu przedstawiane jako wynik. Najbliższy krok: budowa zestawu kontrolnego, w tym ocena istniejących publicznych zbiorów pytań (licencja, dopasowanie, liczebność).

### 2. Badanie B — wierność faktograficzna przy obniżonej precyzji modelu
**Pytanie badawcze.** Jak obniżenie precyzji liczbowej modelu (kwantyzacja, kompresja wag) wpływa na wierność faktograficzną wypowiedzi wyprowadzanych z dokumentów źródłowych — i czy z pomiaru da się wyznaczyć regułę odrzucenia wypowiedzi?
**Dlaczego to trudne.** Niższą precyzję wymusza budżet obliczeniowy, a jej skutki ocenia się zwykle miarami zbiorczymi. Utrata wierności nie musi być widoczna w płynności: model może pisać gładko i dopisać fakt spoza źródła — i jest wtedy gorszy od sztywnego, który niczego nie dopisuje. Granica między uogólnieniem a dopisaniem jest nieostra, bo poprawne uogólnienie formalnie przypomina twierdzenie spoza źródła. Zbiór referencyjny jest z konieczności mały, co ogranicza moc wyznaczonej reguły, a reguła zbyt ostra może odrzucić tak wiele, że generowanie wypowiedzi straci sens.
**Stan techniki (publikowany).** Metody kwantyzacji (m.in. GPTQ, Frantar i in., ICLR 2023; AWQ, Lin i in., MLSys 2024) raportują głównie miary zbiorcze: perplexity i dokładność na zestawach zadań. Wierność wobec źródła mierzy osobna linia metod, rozwijana niezależnie od precyzji modelu — sprawdzanie zgodności faktów i atomowych twierdzeń ze źródłem (m.in. TRUE, Honovich i in. 2022; AlignScore, Zha i in. 2023; FActScore, Min i in. 2023); przegląd Ji i in. (2023) dzieli takie błędy na sprzeczne ze źródłem i nieweryfikowalne w nim. Pomiar, który wiąże poziom precyzji z częstością konkretnych typów błędów i kończy się regułą odrzucenia, nie jest nam znany.
**Kryterium sukcesu.** Wierność przed płynnością: wariant (model i poziom precyzji) poniżej progu wierności ustalonego przed pierwszym pomiarem odpada bez względu na jakość języka. Błędy liczone osobno w czterech kategoriach: twierdzenie dodane (nieobecne w źródle), zmieniona liczba lub jednostka, przesunięta atrybucja (wypowiedź przypisana komu innemu) i zmieniony stopień pewności (możliwość podana jako fakt albo odwrotnie). Wynik jest jednym z dwóch, oba dopuszczone z góry: zmierzona reguła odrzucenia albo udokumentowane stwierdzenie, że żaden model w ustalonym budżecie obliczeniowym nie jest wystarczająco wierny.
**Metoda.** Zbiór referencyjny z dokumentów źródłowych i wyprowadzonych z nich wypowiedzi, w którym werdykt o każdej wypowiedzi wydaje lub zatwierdza człowiek. Kilka modeli o otwartych licencjach na kilku poziomach precyzji, w tym samym, z góry ustalonym budżecie obliczeniowym; najpierw wierność, potem płynność. Pomiar powtarzany przy każdej zmianie modelu.
**Status:** kategorie błędów i procedura pomiaru są zdefiniowane; zbioru referencyjnego jeszcze nie ma i nic nie zostało zmierzone. Najbliższy krok: budowa zbioru referencyjnego.

### Korekty wpisu z 2026-08-10
Wpis z 2026-08-10 przedstawiał program jako będący w fazie koncepcyjnej i podawał, że implementacja nie została rozpoczęta. Nie było to prawdą już w dniu publikacji: prace implementacyjne ruszyły na początku sierpnia 2026. Tamten wpis pozostaje bez zmian, bo jego treść jest ostemplowana; korekta jest datowana tym wpisem.

**Status wpisu.** Żadne z badań nie ma jeszcze wyniku na swoim kryterium. Wyniki — pozytywne albo negatywne — trafią do kolejnego datowanego wpisu razem z progami, modelami i danymi ustalonymi przed pierwszym pomiarem.

---
---

# 🇩🇪 DEUTSCHE FASSUNG

## Koch Laboratory — zwei Studien zu maschinell erzeugten Aussagen: Kriterien vor Ergebnissen

Dieser Eintrag setzt den Eintrag vom 2026-08-10 über Prognosen mit gemessener eigener Fehlbarkeit fort. Er umfasst ausschließlich zwei Studien, von denen jede durch eine eigene Messung entschieden wird — Studie A führt Richtung 4 jenes Eintrags weiter, Studie B wurde bisher nicht beschrieben —, und berichtigt eine Angabe aus jenem Eintrag.

**Methodik.** Problem → Stand der Technik → falsifizierbares Kriterium → Methode → Status und nächster Schritt. Zurückgehalten bleiben die Lösungskonstruktion, die Produktform, die Anwendungsdomäne sowie Modelle und Parameter.

**Kriterien vor Ergebnissen.** Die Kriterien beider Studien sind unten beschrieben, bevor es irgendein Ergebnis gibt, und das Datum dieses Eintrags ist gestempelt. Schwellen, Modelle und Daten werden vor der ersten Messung festgelegt und zusammen mit den Ergebnissen veröffentlicht.

### 1. Studie A — Lernen oder Rationalisierung: Kontrollsatz nach dem Trainingsschnitt und fail-closed-Sicherungen
**Forschungsfrage.** Kann ein unbeaufsichtigt arbeitendes System nachweisen, dass es lernt und nicht bloß immer geschickter begründet — an Fragen, deren Ausgang erst nach dem Trainingsschnitt seines Modells (dem Stichtag seiner Trainingsdaten) bekannt wurde —, und stellt es die Veröffentlichung selbst ein, wenn diese Kontrolle versagt, statt mit einem Warnhinweis weiterzumachen?
**Warum schwierig.** Die Messschleife eines solchen Systems misst die Übereinstimmung mit dem eigenen Korpus, nicht mit der Wirklichkeit; ein System, das gelernt hat zu begründen statt vorherzusagen, zeigt steigende Kennzahlen und einen unauffälligen Betrieb — einen stillen Scheinerfolg. Eine Frage, deren Ausgang in die Trainingsdaten gelangt sein kann, trennt Vorhersage nicht von Erinnerung, und Fragen jenseits des Trainingsschnitts werden mit jedem Modellwechsel weniger. Bei wenigen Auflösungen pro Tag erkennt ein statistischer Test eine Verschlechterung spät; eine zu empfindliche Stoppschwelle hält das System grundlos an, eine zu träge greift erst im Nachhinein. Und ein Warnhinweis, den jemand lesen muss, ist keine Sicherung.
**Stand der Technik (veröffentlicht).** Kontamination — das Durchsickern von Evaluationsdaten in Trainingsdaten — ist beschrieben (u. a. Sainz et al. 2023; Golchin und Surdeanu, ICLR 2024); Evaluationen, die sie vermeiden sollen, nutzen Fragen, die jünger sind als das Modell, oder Fragen zu künftigen Ereignissen (u. a. LiveBench, ForecastBench). Ein Modell kann eine überzeugende Begründung liefern, die die tatsächliche Grundlage seiner Antwort nicht wiedergibt (Turpin et al., NeurIPS 2023). Die Verweigerung bei Unsicherheit ist für einzelne Antworten bekannt (Rückweisungsoption nach Chow, 1970), der Übergang in einen sicheren Zustand nach einem erkannten Fehler aus der funktionalen Sicherheit (IEC 61508). Benchmarks bewerten das Modell jedoch von außen; hier soll die Kontrolle im laufenden System wirken und darüber entscheiden, ob es weiter veröffentlichen darf.
**Erfolgskriterium.** Das Ergebnis auf dem Kontrollsatz ist nach einem vor der ersten Messung festgelegten Test vom Zufall unterscheidbar; das Einstellen der Veröffentlichung ist im Betrieb nachgewiesen — selbsttätig, ohne menschliches Zutun; die Stoppschwellen sind gemessen, nicht vorab angenommen. Offen zugelassenes negatives Ergebnis: Bleibt das Ergebnis auf dem Kontrollsatz dauerhaft vom Zufall ununterscheidbar, endet die Studie mit einem belastbaren Negativbefund — und das System veröffentlicht nach seiner eigenen Regel nicht.
**Methode.** Kontrollfragen mit bereits feststehendem Ausgang, der erst nach dem Trainingsschnitt des untersuchten Modells eingetreten ist; der Kontrollsatz wird bei jedem Modellwechsel erneuert und getrennt von den übrigen Messungen ausgewertet. Die Sicherungen handeln selbsttätig; der Test für das Kriterium und die Stoppbedingungen werden vor der ersten Messung festgelegt.
**Status:** kein Ergebnis zum Kriterium — der Kontrollsatz existiert noch nicht. Die Arbeit an den Sicherungen hat mit der Implementierung im August 2026 begonnen und wird hier nicht als Ergebnis dargestellt. Nächster Schritt: Aufbau des Kontrollsatzes, einschließlich der Prüfung vorhandener öffentlicher Fragensammlungen (Lizenz, Eignung, Umfang).

### 2. Studie B — Faktentreue unter verringerter numerischer Präzision des Modells
**Forschungsfrage.** Wie wirkt sich eine geringere numerische Präzision eines Modells (Quantisierung, Kompression der Gewichte) auf die Faktentreue von Aussagen aus, die aus Quelldokumenten abgeleitet werden — und lässt sich aus der Messung eine Regel für die Zurückweisung einer Aussage bestimmen?
**Warum schwierig.** Das Rechenbudget erzwingt eine geringere Präzision, deren Folgen meist an Gesamtmaßen bewertet werden. Ein Verlust an Treue muss sich in der sprachlichen Flüssigkeit nicht zeigen: Ein Modell kann glatt formulieren und eine Tatsache hinzufügen, die nicht in der Quelle stand — und ist dann schlechter als ein steifes, das nichts hinzufügt. Die Grenze zwischen Verallgemeinerung und Hinzufügung ist unscharf, weil eine richtige Verallgemeinerung formal einer Behauptung von außerhalb der Quelle ähnelt. Der Referenzdatensatz ist zwangsläufig klein, was die Aussagekraft der ermittelten Regel begrenzt, und eine zu scharfe Regel kann so viel zurückweisen, dass das Erzeugen der Aussagen seinen Sinn verliert.
**Stand der Technik (veröffentlicht).** Quantisierungsverfahren (u. a. GPTQ, Frantar et al., ICLR 2023; AWQ, Lin et al., MLSys 2024) berichten vor allem Gesamtmaße: Perplexität und Genauigkeit auf Standard-Aufgabensammlungen. Die Treue zur Quelle misst eine eigene Methodenlinie, die unabhängig von der Modellpräzision entwickelt wird — die Prüfung der Konsistenz von Fakten und atomaren Behauptungen mit der Quelle (u. a. TRUE, Honovich et al. 2022; AlignScore, Zha et al. 2023; FActScore, Min et al. 2023); der Überblick von Ji et al. (2023) teilt solche Fehler in quellenwidrige und an der Quelle nicht überprüfbare ein. Eine Messung, die die Präzisionsstufe mit der Häufigkeit bestimmter Fehlertypen verbindet und in eine Zurückweisungsregel mündet, ist uns nicht bekannt.
**Erfolgskriterium.** Treue vor Flüssigkeit: Eine Variante (Modell und Präzisionsstufe) unterhalb der vor der ersten Messung festgelegten Treueschwelle scheidet unabhängig von ihrer sprachlichen Qualität aus. Fehler werden getrennt in vier Kategorien gezählt: hinzugefügte Behauptung (in der Quelle nicht enthalten), veränderte Zahl oder Einheit, verschobene Zuschreibung (Aussage einem anderen Urheber zugeschrieben) und veränderter Gewissheitsgrad (Möglichkeit als Tatsache dargestellt oder umgekehrt). Das Ergebnis ist eines von zwei, beide vorab zugelassen: eine gemessene Zurückweisungsregel oder der dokumentierte Befund, dass kein Modell innerhalb des festgelegten Rechenbudgets hinreichend treu ist.
**Methode.** Ein Referenzdatensatz aus Quelldokumenten und daraus abgeleiteten Aussagen, in dem das Urteil über jede Aussage ein Mensch fällt oder bestätigt. Mehrere Modelle mit offener Lizenz auf mehreren Präzisionsstufen im selben, vorab festgelegten Rechenbudget; zuerst Treue, dann Flüssigkeit. Wiederholung der Messung bei jedem Modellwechsel.
**Status:** Fehlerkategorien und Messverfahren sind festgelegt; einen Referenzdatensatz gibt es noch nicht, gemessen wurde nichts. Nächster Schritt: Aufbau des Referenzdatensatzes.

### Korrekturen zum Eintrag vom 2026-08-10
Der Eintrag vom 2026-08-10 stellte das Programm als in der Konzeptphase befindlich dar und gab an, die Implementierung habe nicht begonnen. Das traf bereits am Tag der Veröffentlichung nicht zu: Die Implementierungsarbeiten hatten Anfang August 2026 begonnen. Jener Eintrag bleibt unverändert, weil sein Inhalt gestempelt ist; die Korrektur ist mit diesem Eintrag datiert.

**Status des Eintrags.** Keine der Studien hat bisher ein Ergebnis zu ihrem Kriterium. Die Ergebnisse — positiv oder negativ — erscheinen in einem weiteren datierten Eintrag, zusammen mit den vor der ersten Messung festgelegten Schwellen, Modellen und Daten.

---
---

# 🇬🇧 ENGLISH VERSION

## Koch Laboratory — two studies on machine-generated statements: criteria before results

This entry continues the entry of 2026-08-10 on forecasts with measured own fallibility. It covers only two studies, each settled by a measurement of its own — Study A develops direction 4 of that entry, Study B has not been described before — and corrects one statement from that entry.

**Method.** Problem → state of the art → falsifiable criterion → method → status and next step. Withheld are the solution construction, the product form, the application domain, and the models and parameters.

**Criteria before results.** The criteria of both studies are described below before any result exists, and the date of this entry is stamped. Thresholds, models and data will be fixed before the first measurement and published together with the results.

### 1. Study A — learning or rationalisation: a control set after the training cut-off and fail-closed safeguards
**Research question.** Can a system running without supervision show that it is learning rather than merely getting better at justifying — on questions whose outcome became known only after its model's training-data cut-off — and, when that control fails, does it stop publishing by itself instead of carrying on with a warning?
**Why it is hard.** The measurement loop of such a system measures agreement with its own corpus, not with reality; a system that has learnt to justify rather than predict shows rising metrics and quiet operation — a silent sham success. A question whose outcome may have reached the training data does not separate prediction from recall, and questions beyond the cut-off become fewer with every change of model. With few resolutions per day, a statistical test detects deterioration late; a stop threshold that is too sensitive halts the system for no reason, one that is too sluggish acts after the fact. And a warning that someone has to read is not a safeguard.
**State of the art (published).** Contamination — evaluation data leaking into training data — is documented (e.g. Sainz et al. 2023; Golchin and Surdeanu, ICLR 2024); evaluations designed to avoid it use questions newer than the model or about future events (e.g. LiveBench, ForecastBench). A model can give a persuasive explanation that does not reflect the actual basis of its answer (Turpin et al., NeurIPS 2023). Abstaining under uncertainty is known for single answers (Chow's reject option, 1970), and moving to a safe state after a detected fault comes from functional safety (IEC 61508). Benchmarks, however, assess the model from outside; here the control is meant to work inside the running system and decide whether it may go on publishing.
**Success criterion.** Performance on the control set is distinguishable from chance by a test fixed before the first measurement; stopping publication is demonstrated in operation — automatically, without human involvement; the stop thresholds are measured, not assumed in advance. An openly admitted negative outcome: if performance on the control set remains permanently indistinguishable from chance, the study ends with a solid negative finding — and the system, by its own rule, does not publish.
**Method.** Control questions whose outcome is already settled but came after the training-data cut-off of the model under study; the set is renewed with every change of model and evaluated separately from all other measurements. The safeguards act by themselves; the test for the criterion and the stop conditions will be fixed before the first measurement.
**Status:** no result on the criterion — the control set does not exist yet. Work on the safeguards began with the implementation in August 2026 and is not presented here as a result. Next step: building the control set, including an assessment of existing public question sets (licence, fit, size).

### 2. Study B — factual fidelity under reduced numerical precision
**Research question.** How does lowering a model's numerical precision (quantisation, compression of the weights) affect the factual fidelity of statements derived from source documents — and can the measurement yield a rule for rejecting a statement?
**Why it is hard.** The compute budget forces lower precision, whose effects are mostly assessed with aggregate measures. A loss of fidelity need not show in fluency: a model can write smoothly and add a fact that was not in the source — and is then worse than a stiff one that adds nothing. The line between generalisation and addition is blurred, because a correct generalisation formally resembles a claim from outside the source. The reference set is necessarily small, which limits the power of the resulting rule, and a rule that is too strict can reject so much that generating the statements loses its point.
**State of the art (published).** Quantisation methods (e.g. GPTQ, Frantar et al., ICLR 2023; AWQ, Lin et al., MLSys 2024) mostly report aggregate measures: perplexity and accuracy on standard task suites. Fidelity to a source is measured by a separate line of methods, developed independently of model precision — checking the consistency of facts and atomic claims with the source (e.g. TRUE, Honovich et al. 2022; AlignScore, Zha et al. 2023; FActScore, Min et al. 2023); the survey by Ji et al. (2023) divides such errors into those contradicting the source and those unverifiable against it. A measurement that ties the precision level to the frequency of specific error types and ends in a rejection rule is not known to us.
**Success criterion.** Fidelity before fluency: a variant (model and precision level) below the fidelity threshold fixed before the first measurement is out, regardless of the quality of its language. Errors are counted separately in four categories: an added claim (absent from the source), an altered figure or unit, shifted attribution (a statement attributed to someone else) and a changed degree of certainty (a possibility presented as a fact, or the reverse). The outcome is one of two, both admitted in advance: a measured rejection rule, or a documented finding that no model within the fixed compute budget is faithful enough.
**Method.** A reference set of source documents and statements derived from them, in which the verdict on every statement is given or confirmed by a person. Several openly licensed models at several precision levels within the same compute budget, fixed in advance; fidelity first, fluency second. The measurement is repeated with every change of model.
**Status:** the error categories and the measurement procedure are defined; the reference set does not exist yet, and nothing has been measured. Next step: building the reference set.

### Corrections to the entry of 2026-08-10
The entry of 2026-08-10 presented the programme as being in the concept phase and stated that implementation had not started. That was already untrue on the day of publication: implementation work had begun in early August 2026. That entry remains unchanged because its content is stamped; the correction is dated by this entry.

**Status of the entry.** Neither study has a result on its criterion yet. The results — positive or negative — will appear in a further dated entry, together with the thresholds, models and data fixed before the first measurement.
