Koch Laboratory

Zwei Studien zu maschinell erzeugten Aussagen: Kriterien vor Ergebnissen

Zwei Studien aus dem Prognoseprogramm, jede durch eine eigene Messung entscheidbar: ob ein unbeaufsichtigt arbeitendes System lernt statt zu rationalisieren — geprüft an Fragen, die erst nach dem Trainingsschnitt seines Modells aufgelöst wurden, mit Sicherungen, die die Ausgabe stoppen, statt eine Warnung anzuhängen — und wie eine geringere numerische Präzision eines Modells die Faktentreue von Aussagen beeinflusst, die aus Quelldokumenten abgeleitet werden. Ergebnisse gibt es noch keine; die Kriterien sind vor jedem Ergebnis veröffentlicht, und der Eintrag berichtigt die frühere Angabe, die Implementierung habe nicht begonnen.

Koch Laboratory — zwei Studien zu maschinell erzeugten Aussagen: Kriterien vor Ergebnissen

Dieser Eintrag setzt den Eintrag vom 2026-08-10 über Prognosen mit gemessener eigener Fehlbarkeit fort. Er umfasst ausschließlich zwei Studien, von denen jede durch eine eigene Messung entschieden wird — Studie A führt Richtung 4 jenes Eintrags weiter, Studie B wurde bisher nicht beschrieben —, und berichtigt eine Angabe aus jenem Eintrag.

Methodik. Problem → Stand der Technik → falsifizierbares Kriterium → Methode → Status und nächster Schritt. Zurückgehalten bleiben die Lösungskonstruktion, die Produktform, die Anwendungsdomäne sowie Modelle und Parameter.

Kriterien vor Ergebnissen. Die Kriterien beider Studien sind unten beschrieben, bevor es irgendein Ergebnis gibt, und das Datum dieses Eintrags ist gestempelt. Schwellen, Modelle und Daten werden vor der ersten Messung festgelegt und zusammen mit den Ergebnissen veröffentlicht.

1. Studie A — Lernen oder Rationalisierung: Kontrollsatz nach dem Trainingsschnitt und fail-closed-Sicherungen

Forschungsfrage. Kann ein unbeaufsichtigt arbeitendes System nachweisen, dass es lernt und nicht bloß immer geschickter begründet — an Fragen, deren Ausgang erst nach dem Trainingsschnitt seines Modells (dem Stichtag seiner Trainingsdaten) bekannt wurde —, und stellt es die Veröffentlichung selbst ein, wenn diese Kontrolle versagt, statt mit einem Warnhinweis weiterzumachen? Warum schwierig. Die Messschleife eines solchen Systems misst die Übereinstimmung mit dem eigenen Korpus, nicht mit der Wirklichkeit; ein System, das gelernt hat zu begründen statt vorherzusagen, zeigt steigende Kennzahlen und einen unauffälligen Betrieb — einen stillen Scheinerfolg. Eine Frage, deren Ausgang in die Trainingsdaten gelangt sein kann, trennt Vorhersage nicht von Erinnerung, und Fragen jenseits des Trainingsschnitts werden mit jedem Modellwechsel weniger. Bei wenigen Auflösungen pro Tag erkennt ein statistischer Test eine Verschlechterung spät; eine zu empfindliche Stoppschwelle hält das System grundlos an, eine zu träge greift erst im Nachhinein. Und ein Warnhinweis, den jemand lesen muss, ist keine Sicherung. Stand der Technik (veröffentlicht). Kontamination — das Durchsickern von Evaluationsdaten in Trainingsdaten — ist beschrieben (u. a. Sainz et al. 2023; Golchin und Surdeanu, ICLR 2024); Evaluationen, die sie vermeiden sollen, nutzen Fragen, die jünger sind als das Modell, oder Fragen zu künftigen Ereignissen (u. a. LiveBench, ForecastBench). Ein Modell kann eine überzeugende Begründung liefern, die die tatsächliche Grundlage seiner Antwort nicht wiedergibt (Turpin et al., NeurIPS 2023). Die Verweigerung bei Unsicherheit ist für einzelne Antworten bekannt (Rückweisungsoption nach Chow, 1970), der Übergang in einen sicheren Zustand nach einem erkannten Fehler aus der funktionalen Sicherheit (IEC 61508). Benchmarks bewerten das Modell jedoch von außen; hier soll die Kontrolle im laufenden System wirken und darüber entscheiden, ob es weiter veröffentlichen darf. Erfolgskriterium. Das Ergebnis auf dem Kontrollsatz ist nach einem vor der ersten Messung festgelegten Test vom Zufall unterscheidbar; das Einstellen der Veröffentlichung ist im Betrieb nachgewiesen — selbsttätig, ohne menschliches Zutun; die Stoppschwellen sind gemessen, nicht vorab angenommen. Offen zugelassenes negatives Ergebnis: Bleibt das Ergebnis auf dem Kontrollsatz dauerhaft vom Zufall ununterscheidbar, endet die Studie mit einem belastbaren Negativbefund — und das System veröffentlicht nach seiner eigenen Regel nicht. Methode. Kontrollfragen mit bereits feststehendem Ausgang, der erst nach dem Trainingsschnitt des untersuchten Modells eingetreten ist; der Kontrollsatz wird bei jedem Modellwechsel erneuert und getrennt von den übrigen Messungen ausgewertet. Die Sicherungen handeln selbsttätig; der Test für das Kriterium und die Stoppbedingungen werden vor der ersten Messung festgelegt. Status: kein Ergebnis zum Kriterium — der Kontrollsatz existiert noch nicht. Die Arbeit an den Sicherungen hat mit der Implementierung im August 2026 begonnen und wird hier nicht als Ergebnis dargestellt. Nächster Schritt: Aufbau des Kontrollsatzes, einschließlich der Prüfung vorhandener öffentlicher Fragensammlungen (Lizenz, Eignung, Umfang).

2. Studie B — Faktentreue unter verringerter numerischer Präzision des Modells

Forschungsfrage. Wie wirkt sich eine geringere numerische Präzision eines Modells (Quantisierung, Kompression der Gewichte) auf die Faktentreue von Aussagen aus, die aus Quelldokumenten abgeleitet werden — und lässt sich aus der Messung eine Regel für die Zurückweisung einer Aussage bestimmen? Warum schwierig. Das Rechenbudget erzwingt eine geringere Präzision, deren Folgen meist an Gesamtmaßen bewertet werden. Ein Verlust an Treue muss sich in der sprachlichen Flüssigkeit nicht zeigen: Ein Modell kann glatt formulieren und eine Tatsache hinzufügen, die nicht in der Quelle stand — und ist dann schlechter als ein steifes, das nichts hinzufügt. Die Grenze zwischen Verallgemeinerung und Hinzufügung ist unscharf, weil eine richtige Verallgemeinerung formal einer Behauptung von außerhalb der Quelle ähnelt. Der Referenzdatensatz ist zwangsläufig klein, was die Aussagekraft der ermittelten Regel begrenzt, und eine zu scharfe Regel kann so viel zurückweisen, dass das Erzeugen der Aussagen seinen Sinn verliert. Stand der Technik (veröffentlicht). Quantisierungsverfahren (u. a. GPTQ, Frantar et al., ICLR 2023; AWQ, Lin et al., MLSys 2024) berichten vor allem Gesamtmaße: Perplexität und Genauigkeit auf Standard-Aufgabensammlungen. Die Treue zur Quelle misst eine eigene Methodenlinie, die unabhängig von der Modellpräzision entwickelt wird — die Prüfung der Konsistenz von Fakten und atomaren Behauptungen mit der Quelle (u. a. TRUE, Honovich et al. 2022; AlignScore, Zha et al. 2023; FActScore, Min et al. 2023); der Überblick von Ji et al. (2023) teilt solche Fehler in quellenwidrige und an der Quelle nicht überprüfbare ein. Eine Messung, die die Präzisionsstufe mit der Häufigkeit bestimmter Fehlertypen verbindet und in eine Zurückweisungsregel mündet, ist uns nicht bekannt. Erfolgskriterium. Treue vor Flüssigkeit: Eine Variante (Modell und Präzisionsstufe) unterhalb der vor der ersten Messung festgelegten Treueschwelle scheidet unabhängig von ihrer sprachlichen Qualität aus. Fehler werden getrennt in vier Kategorien gezählt: hinzugefügte Behauptung (in der Quelle nicht enthalten), veränderte Zahl oder Einheit, verschobene Zuschreibung (Aussage einem anderen Urheber zugeschrieben) und veränderter Gewissheitsgrad (Möglichkeit als Tatsache dargestellt oder umgekehrt). Das Ergebnis ist eines von zwei, beide vorab zugelassen: eine gemessene Zurückweisungsregel oder der dokumentierte Befund, dass kein Modell innerhalb des festgelegten Rechenbudgets hinreichend treu ist. Methode. Ein Referenzdatensatz aus Quelldokumenten und daraus abgeleiteten Aussagen, in dem das Urteil über jede Aussage ein Mensch fällt oder bestätigt. Mehrere Modelle mit offener Lizenz auf mehreren Präzisionsstufen im selben, vorab festgelegten Rechenbudget; zuerst Treue, dann Flüssigkeit. Wiederholung der Messung bei jedem Modellwechsel. Status: Fehlerkategorien und Messverfahren sind festgelegt; einen Referenzdatensatz gibt es noch nicht, gemessen wurde nichts. Nächster Schritt: Aufbau des Referenzdatensatzes.

Korrekturen zum Eintrag vom 2026-08-10

Der Eintrag vom 2026-08-10 stellte das Programm als in der Konzeptphase befindlich dar und gab an, die Implementierung habe nicht begonnen. Das traf bereits am Tag der Veröffentlichung nicht zu: Die Implementierungsarbeiten hatten Anfang August 2026 begonnen. Jener Eintrag bleibt unverändert, weil sein Inhalt gestempelt ist; die Korrektur ist mit diesem Eintrag datiert.

Status des Eintrags. Keine der Studien hat bisher ein Ergebnis zu ihrem Kriterium. Die Ergebnisse — positiv oder negativ — erscheinen in einem weiteren datierten Eintrag, zusammen mit den vor der ersten Messung festgelegten Schwellen, Modellen und Daten.


Zeitnachweis

Dieser Text wurde bei der Veröffentlichung gehasht und gestempelt. Zur Prüfung sind beide Dateien nötig: der Stempel belegt, dass genau eine Bytefolge zu diesem Zeitpunkt existierte, und nur die Quelle unten ist diese Bytefolge. Jede spätere Änderung verschiebt den Hash und bricht die Übereinstimmung — genau das ist der Zweck.

· @529.58 · 2026-W40

SHA-256 des gestempelten Textes: 897118bad9e4ede411841ff12ea0bd585ee4101763fa341bb464e47ee9a8950d

Prüfen mit: ots verify <Nachweis> --file <Quelle>