Strukturbasierte Kompression, gemessen: Abhängigkeitsachse geschlossen, Nische eingegrenzt
Zwei Benchmarks auf offengelegtem Korpus setzen den Eintrag vom 2026-07-14 fort, Negative zuerst: XOR-Abhängigkeitskodierung in 1D und 2D widerlegt, eine historische Codec-Version, die ihre eigene Ausgabe nicht dekodieren konnte, und ein Positivbefund, der sich auf echte Scans nicht übertrug — als einzige Nische bleiben digital erzeugte Raster mit bitgenauer Wiederholung. Mit Korrekturen zum früheren Eintrag.
Koch Laboratory — strukturbasierte Kompression, gemessen: Abhängigkeitsachse geschlossen, Nische eingegrenzt
Der Eintrag vom 2026-07-14 endete mit der Ankündigung eines definierten Benchmarks mit offengelegtem Korpus und Referenzverfahren, weil das Kompressionsverhältnis für keine der beiden Richtungen gemessen worden war. Dieser Eintrag berichtet über die Ergebnisse zweier Messsitzungen: Benchmark 1 (2026-07-15; 10 Dateien, 154 Messungen) und Benchmark 2 (2026-07-17; realistische Bilder, 51 Messungen). Die falsifizierbaren Kriterien wurden vor jeder Sitzung festgelegt, und jede Dekodierung wurde per SHA-256 gegen das Original geprüft. Aussagen des Eintrags vom 2026-07-14, die durch die Messungen überholt sind, stehen gesammelt im Abschnitt „Korrekturen zum Eintrag vom 2026-07-14”.
Die Bilanz in drei Sätzen. Die Achse der Abhängigkeitskodierung ist in 1D und in 2D widerlegt und wird geschlossen. Die historische Version des PGA-Codecs konnte die Daten, die sie selbst kodiert hatte, nicht wiederherstellen. Nach der Reparatur schlägt der Codec die klassischen Referenzverfahren nur auf einem digital erzeugten Raster, dessen Wiederholungen starr und bitgenau sind — auf echten Scans und gerenderten Seiten unterliegt er.
Methodik. Problem → Stand der Technik → vor der Messung festgelegtes Kriterium → Methode → Ergebnis mit Randbedingungen → nächster Schritt. Kompressionsverhältnis = Ausgabegröße / Eingabegröße: kleiner ist besser, über 1 bedeutet Expansion. Gezählt wird der gesamte Container — Header, Metadaten, Randbits, Prüfsumme — nicht nur die Nutzlast. Die Kriterienbezeichnungen (F1–F7) entsprechen den privaten Messprotokollen, deren Hashwerte Abschnitt 9 angibt.
Publikationshinweis. Für noch offene Richtungen veröffentlichen wir Problem, Stand der Technik, Kriterium und Ergebnis — nicht die Konstruktion. Wo „Konstruktion: zurückgehalten.” steht, wird das technische Detail als Anmeldematerial vorgehalten. Die Achse der Abhängigkeitskodierung ist als falsifiziert geschlossen; deshalb wird ihre Regel hier offengelegt.
1. Richtung 1 — Abhängigkeitskodierung in 1D: Regel offengelegt, Hypothese widerlegt
Forschungsfrage. Liefert eine umkehrbare Darstellung des Stroms als Schichten von Relationen zwischen Nachbarbits nach einem klassischen Endkodierer ein kleineres Ergebnis als derselbe Kodierer ohne Transformation sowie als zlib-9 und zstd-19?
Regel (offengelegt, da die Achse geschlossen ist). Die erste Schicht ist das XOR jedes Paares benachbarter Bits, b[i] ⊕ b[i+1]; jede weitere Schicht entsteht nach derselben Regel aus der vorigen. Die Umkehrung von L Schichten erfordert L Randbits.
Analytische Anmerkung. Für die gemessenen Tiefen L = 1, 2, 4, 8 ergibt die Iteration genau b[i] ⊕ b[i+L] (Binomialkoeffizienten modulo 2): Schicht L ist eine XOR-Differenz im Abstand L, acht Schichten sind die XOR-Differenz benachbarter Bytes. Bei den gemessenen Tiefen liegt die Transformation damit innerhalb der klassischen Differenzkodierung.
Stand der Technik (veröffentlicht). Differenz- und prädiktive Kodierung (einschließlich XOR-Differenz), RLE, DEFLATE (zlib, gzip), zstd.
Kriterien (vor der Messung festgelegt). F1: SHA-256 der Rekonstruktion gleich SHA-256 des Originals bei jeder Dekodierung. F2: Schicht L mit Endkodierer ergibt ein kleineres Ergebnis als derselbe Container ohne Transformation (L = 0), für L ∈ {1, 2, 4, 8}. F3: Ergebnis kleiner als zlib-9 und als zstd-19.
Methode. Korpus aus 10 Dateien (Abschnitt 8); L ∈ {0, 1, 2, 4, 8}; Endkodierer RLE oder zlib-9; insgesamt 100 Messungen. Gemessen wurde eine kanonische Neuimplementierung mit vollständigen Randbits — die frühere Referenzimplementierung speicherte nur das erste davon und konnte daher nicht mehr als eine Schicht dekodieren.
Ergebnis. Kompressionsverhältnis mit Endkodierer zlib-9 (gesamter Container) sowie die Referenzverfahren auf den Rohdaten:
| Datei | L = 0 (Kontrolle) | L = 1 | L = 2 | L = 4 | L = 8 | zlib-9 | zstd-19 |
|---|---|---|---|---|---|---|---|
| technischer Text | 0,2929 | 0,2972 | 0,3083 | 0,3261 | 0,3541 | 0,2903 | 0,2778 |
| synthetisches Formularraster | 0,1411 | 0,1439 | 0,1581 | 0,1714 | 0,1720 | 0,1411 | 0,1069 |
| Telemetrie (CSV) | 0,1623 | 0,1624 | 0,1648 | 0,1694 | 0,2050 | 0,1622 | 0,0740 |
| dünn besetzte Datei | 0,0028 | 0,0029 | 0,0030 | 0,0033 | 0,0034 | 0,0026 | 0,0014 |
| lange Bitläufe | 0,0067 | 0,0065 | 0,0065 | 0,0065 | 0,0065 | 0,0065 | 0,0094 |
| Zufallsdaten | 1,0005 | 1,0005 | 1,0005 | 1,0005 | 1,0005 | 1,0003 | 1,0001 |
| Ausschnitt der ausführbaren Datei | 0,8641 | 0,8701 | 0,8762 | 0,8838 | 0,8937 | 0,8640 | 0,8509 |
| nur Nullen | 0,0012 | 0,0012 | 0,0012 | 0,0012 | 0,0012 | 0,0011 | 0,0001 |
| alternierende Bits | 0,0012 | 0,0012 | 0,0012 | 0,0012 | 0,0012 | 0,0011 | 0,0001 |
| periodische Datei | 0,0034 | 0,0035 | 0,0036 | 0,0034 | 0,0028 | 0,0033 | 0,0004 |
Mit zlib-9 verschlechtert sich das Ergebnis auf fünf Dateien monoton mit der Schichtzahl: technischer Text, synthetisches Formularraster, Telemetrie, dünn besetzte Datei und Ausschnitt der ausführbaren Datei. Die Ausnahmen sind ausschließlich synthetisch. Auf der Datei mit langen Läufen spart eine Schicht 48 B gegenüber demselben Container ohne Transformation (1707 statt 1755 B) und erreicht damit genau das Ergebnis von zlib-9 allein (1707 B). Auf der periodischen Datei sparen acht Schichten 175 B (725 statt 900 B), während zstd-19 dieselbe Datei auf 97 B bringt. Auf den Zufallsdaten und in den beiden entarteten Fällen (nur Nullen, alternierende Bits) bleibt das Ergebnis bis auf 1 B konstant. Mit RLE verwandelte die Transformation eine Expansion nur auf einer Datei in Kompression — der Datei mit alternierenden Bits (16,00 → 0,0629 bei einer Schicht), die zlib-9 ganz ohne Transformation auf 0,0011 bringt. Wo die Schichten das RLE-Ergebnis auf anderen Dateien verkleinerten, blieb es größer als die Eingabe (z. B. Formularraster 1,51, Telemetrie 5,74, technischer Text 6,33). Auswertung der Kriterien. F1: erfüllt, 100/100. F2: mit zlib-9 nur auf zwei synthetischen Dateien erfüllt (lange Läufe, periodische Datei), mit RLE nur dort, wo das Ergebnis weiterhin größer als die Eingabe ist, sowie auf den alternierenden Bits. F3: auf 10 von 10 Dateien nicht erfüllt — kein Ergebnis mit Transformation war zugleich kleiner als zlib-9 und als zstd-19. Hypothese widerlegt. Mechanismus (gemessen). Auf Text und Telemetrie treiben die ersten Schichten die Dichte der Einsen gegen 0,5: technischer Text 0,3932 → 0,4607 (L = 1) → 0,4805 (L = 2), Telemetrie 0,4261 → 0,5119 (L = 1). Die Transformation verwischt also die Struktur, die der Endkodierer sieht, statt sie freizulegen. Wo die Dichte sinkt, verbessert sich das Ergebnis trotzdem nicht: Auf dem synthetischen Formularraster senkt eine Schicht die Dichte von 0,1918 auf 0,1365, das Kompressionsverhältnis mit zlib-9 steigt jedoch von 0,1411 auf 0,1439. Dasselbe Muster wiederholt sich in 2D (Abschnitt 6). Nächster Schritt. Keiner — Achse geschlossen (Abschnitt 7). Status: durch Messung falsifiziert (F3 auf 10/10 Dateien nicht erfüllt; F1 erfüllt, 100/100); Achse geschlossen.
2. Richtung 1 — die vollständige Schichtpyramide: umkehrbar, aber quadratisch
Forschungsfrage. Ist die historische Implementierung, die die vollständige Schichtpyramide bis hinunter zu einem einzigen Bit aufbaut, durchführbar? Kriterien. Wie in Abschnitt 1 (F1–F3). Methode. Historische Implementierung ohne Änderungen, angewandt auf Präfixe des technischen Textes von 128 bis 1024 B. Ergebnis.
| Eingabe | Ausgabe | Ausgabe / Eingabe | Kodierzeit |
|---|---|---|---|
| 128 B | 515.415 B | ×4027 | 0,086 s |
| 256 B | 2.055.749 B | ×8030 | 0,257 s |
| 512 B | 8.285.223 B | ×16.182 | 0,969 s |
| 1024 B | 33.310.203 B | ×32.529 | 3,844 s |
Die Pyramide für n Eingabebits enthält n(n−1)/2 Abhängigkeitsbits; die gemessene Ausgabe entspricht n(n−1)/2 Bytes auf 2 % genau (98,1–99,3 %), also etwa einem Byte pro Abhängigkeitsbit. Größe und Zeit wachsen quadratisch. Hochgerechnet auf die 14,2 MB große ausführbare Datei aus dem Eintrag vom 2026-07-14: etwa 6,5 PB Ausgabe und etwa 23 Jahre Rechenzeit auf der Messmaschine. F1 erfüllt (4/4); F2 und F3 widerlegt — das Ergebnis ist etwa 4000- bis 32.500-mal so groß wie die Eingabe. Beobachtung zur Konstruktion: Der Dekodierer dieser Implementierung liest ausschließlich die erste Schicht (mit einem Randbit genügt sie zur Wiederherstellung); das Speichern der Schichten ab der zweiten ist damit von vornherein redundant. Nächster Schritt. Keiner — Implementierung zurückgezogen. Status: umkehrbar (4/4), jenseits von Spielzeuggrößen undurchführbar; zurückgezogen.
3. Richtung 2 — der PGA-Codec in der historischen Version: Wiederherstellung auf 10 von 10 Dateien gescheitert
Forschungsfrage. Stellt die Codec-Version, an der die im Eintrag vom 2026-07-14 beschriebene Expansion um 56 % gemessen wurde, die Daten bitgenau wieder her? Kriterien (vor der Messung festgelegt). F1 für den PGA-Codec sowie F4: Größe des gesamten Containers (alle Abschnitte und Metadaten) kleiner als die Eingabe auf dem strukturierten Korpus, bei erfülltem F1. Methode. Historische Version ohne Änderungen; Kodierung und Dekodierung jeder der 10 Korpusdateien; SHA-256 des Ergebnisses gegen das Original. Ergebnis: Wiederherstellungskriterium widerlegt. Die Kodierung lief auf 10 von 10 Dateien durch, die Dekodierung auf 0 von 10: Auf 4 Dateien brach sie mit einem Fehler ab, auf 6 lieferte sie Daten, deren SHA-256 nicht mit dem Original übereinstimmte. Die Code-Analyse ergab zwei Formatfehler: Die Restschicht trug nicht die Daten, die sie wiederherstellen sollte, und der Kartenabschnitt war nicht eindeutig parsbar. Die Folge reicht über den Benchmark hinaus: Auch das historische 22,2-MB-Artefakt aus dem Eintrag vom 2026-07-14 ist nicht vollständig rekonstruierbar. Seine Größe wurde korrekt gemessen (14,2 → 22,2 MB), eine gültige verlustfreie Kodierung war es jedoch nicht. F4 lässt sich nicht bewerten, solange F1 nicht erfüllt ist. Nächster Schritt. Behebung beider Fehler in einer Messvariante (Abschnitt 4). Status: negatives Ergebnis — die historische Version erfüllt das Wiederherstellungskriterium nicht (0/10); Korrektur des Eintrags vom 2026-07-14 siehe unten.
4. Richtung 2 — nach der Reparatur: ein bedingter Positivbefund, der sich auf realistische Daten nicht übertrug
Forschungsfrage. Stellt der Codec nach der Formatreparatur die Daten bitgenau wieder her, und liefert er eine positive Größenbilanz — zuerst auf dem Korpus von Benchmark 1, dann auf realistischen Bildern? Stand der Technik (veröffentlicht). Für Binärbilder: CCITT G4 (ITU-T T.6, zweidimensionale Lauflängenkodierung relativ zur Referenzzeile) und JBIG2 (ITU-T T.88), das Text selbst über Symbolwörterbücher mit Mustervergleich kodiert. Diese, nicht gzip und zstd, sind die eigentliche Konkurrenz für diese Datenklasse. G4 wurde in Benchmark 2 gemessen; JBIG2 nicht — in der Messumgebung stand kein Kodierer dafür zur Verfügung. Kriterien (vor der Messung festgelegt). F4 (Benchmark 1): Container kleiner als die Eingabe auf dem strukturierten Korpus, bei erfülltem F1. F5 (Benchmark 2): Kompressionsverhältnis kleiner als zstd-19 und als CCITT G4 auf dem realistischen Korpus. Methode. Messvariante mit Behebung beider Fehler, in zwei Ausprägungen: formattreu zur historischen Version sowie mit einem von Redundanz befreiten Kartenabschnitt (Konstruktion zurückgehalten). Benchmark 2 verwendet die zweite Ausprägung auf sieben Binärbildern (Abschnitt 8), mit der tatsächlichen Rastergeometrie. Ergebnis — Benchmark 1. F1 wiederhergestellt: 10/10 in beiden Ausprägungen. F4 erwies sich in der Formulierung des Protokolls als schwach: Einen Container kleiner als die Eingabe hat die formattreue Ausprägung auf 4 von 5 strukturierten Dateien (auf dem technischen Text 1,098), die Ausprägung mit redundanzfreier Karte auf 5 von 5. Entscheidend ist der Vergleich mit den Referenzverfahren. Die formattreue Ausprägung war auf jeder der 10 Dateien größer als zstd-19; auf dem synthetischen Formularraster belegte die Karte 97 % ihres Containers. Die Ausprägung mit redundanzfreier Karte lieferte den ersten gemessenen Positivbefund des Programms — auf einer Datei: synthetisches Formularraster 0,0495 gegenüber 0,1069 (zstd-19) und 0,1411 (zlib-9), also 2,2-mal besser als das beste Referenzverfahren. Auf den übrigen 9 Dateien gewannen die Referenzverfahren (z. B. Telemetrie 0,2981 gegenüber 0,0740, technischer Text 0,7949 gegenüber 0,2778). Auf hochentropischen Daten expandiert der Codec: Zufallsdaten 1,176 (formattreue Ausprägung: 1,547), Ausschnitt der ausführbaren Datei 1,115 (1,519). Stand nach Benchmark 1: bedingter Positivbefund — synthetisches Raster, Glyphen am Kachelraster ausgerichtet, ohne Rauschen, ohne Vergleich mit G4 und JBIG2. Ergebnis — Benchmark 2: F5 widerlegt.
| Bild | PGA | zlib-9 | zstd-19 | CCITT G4 | bestes Verfahren |
|---|---|---|---|---|---|
fax2d — CCITT-Fax, 1728×1082 |
0,1888 | 0,1374 | 0,1241 | 0,1209 | G4 |
g3test — CCITT-Fax, 1728×1103 |
0,2629 | 0,1806 | 0,1624 | 0,1756 | zstd-19 |
jim___ah — dichtes Testbild, 664×813 |
0,2443 | 0,2083 | 0,1910 | 0,6301 | zstd-19 |
| Textseite, serifenlose Schrift | 0,0489 | 0,0440 | 0,0364 | 0,0376 | zstd-19 |
| Textseite, Serifenschrift | 0,0348 | 0,0376 | 0,0302 | 0,0346 | zstd-19 |
| Formularseite | 0,0351 | 0,0263 | 0,0133 | 0,0372 | zstd-19 |
| synthetisches Formularraster (Kontrolle aus Benchmark 1) | 0,0492 | 0,1411 | 0,1069 | 0,4030 | PGA |
Der Codec unterliegt zstd-19 auf 6 von 6 realistischen Bildern und CCITT G4 auf 4 von 6. Das einzige Bild, auf dem irgendeine eigene Methode des Programms am besten abschneidet, bleibt das synthetische, am Kachelraster ausgerichtete Raster. F1: 7/7. Methodischer Hinweis: In Benchmark 1 rasterte der Codec die Eingabe ohne Kenntnis ihrer tatsächlichen Geometrie; dass die Rasterbreite mit der tatsächlichen Breite des synthetischen Formularrasters übereinstimmte, war Zufall. Benchmark 2 verwendet in allen Messungen die tatsächliche Geometrie. Nächster Schritt. Klären, wovon der einzige Positivbefund abhängt (Abschnitt 5). Status: Umkehrbarkeit wiederhergestellt (10/10, 7/7); Generalisierung widerlegt (F5); Positivbefund auf das synthetische Raster beschränkt.
5. Richtung 2 — Mechanismus des Positivbefunds: starre, bitgenaue Wiederholung
Forschungsfrage. Wovon hängt der einzige Positivbefund ab — von der Ausrichtung der Muster am Kachelraster, von ihrer Bitgenauigkeit oder von beidem? Kriterien. Ein in Protokoll 1 angekündigter Empfindlichkeitstest ohne Erfolgsschwelle (gemessen wird die Degradationskurve gegenüber G4 und zstd-19 auf denselben Daten); F7 (vor der Messung festgelegt): Die Wahl des Rasterversatzes stellt das Kompressionsverhältnis des ausgerichteten Rasters wieder her. Methode. Das synthetische Formularraster wurde horizontal um weniger als eine Kachelbreite verschoben und durch zufälliges Kippen von Bits mit einer Wahrscheinlichkeit von 0,1 bis 2 % verrauscht; jedes Ergebnis mit SHA-256-Prüfung (13/13). Ergebnis — Verschiebung. Je nach Verschiebung ein Kompressionsverhältnis von 0,0492 bis 0,0880, das Wörterbuch mit bis zu 46 statt 16 Einträgen; G4 unverändert (0,403). Ergebnis — Rauschen.
| gekippte Bits | PGA | Wörterbucheinträge | zstd-19 | CCITT G4 |
|---|---|---|---|---|
| 0 | 0,0492 | 16 | 0,1069 | 0,4030 |
| 0,1 % | 0,0713 | 20 | 0,1327 | 0,4158 |
| 0,5 % | 0,1290 | 78 | 0,1969 | 0,4652 |
| 1 % | 0,1991 | 561 | 0,2555 | 0,5195 |
| 2 % | 0,3851 | 2656 | 0,3434 | 0,6180 |
Der Vorsprung vor zstd-19 schrumpft von 2,2-fach auf sauberen Daten auf 1,9-, 1,5- und 1,3-fach und kehrt sich bei 2 % gekippten Bits um (0,3851 gegenüber 0,3434). Das Kompressionsverhältnis des Codecs verschlechtert sich um den Faktor 7,8, das von G4 um den Faktor 1,5. Schluss: Der Positivbefund verlangt eine starre, bitgenaue Wiederholung der Muster — wie sie digital erzeugte Raster (born-digital) aufweisen, Scans dagegen nicht. Ergebnis — F7: technisch bestätigt. Absichtlich gegen das Kachelraster verschobenes Raster: 0,1416; nach Wahl des Rasterversatzes: 0,0492, also genau der Wert des ausgerichteten Rasters; Kosten: wenige Bits; F1 erfüllt. Das gilt für eine Verschiebung des ganzen Rasters; auf gerenderten Seiten und Scans, wo sich die Position der Zeichen einzeln ändert, wurde es nicht gemessen. Konstruktion: zurückgehalten. Nächster Schritt. Die Hypothese der dokumentübergreifenden Deduplikation (Abschnitt 7). Status: Randbedingungen gemessen; F7 technisch bestätigt.
6. Richtung 3 — räumliche Abhängigkeit in 2D: Hypothese widerlegt, mit Ablation der Prädiktoren
Forschungsfrage. Trägt die Abhängigkeitsregel, von 1D auf räumliche Nachbarn im Raster übertragen, ein Signal, das in 1D fehlte? Stand der Technik (veröffentlicht). Kontextmodellierung von Binärbildern in JBIG und JBIG2: Kontextschablone aus 10–16 Nachbarpixeln und adaptiver arithmetischer Kodierer. Hier wurde bewusst eine Minimalvariante gemessen, um zu entscheiden, ob die Achse überhaupt ein Signal trägt. Kriterien (vor der Messung festgelegt). F6(a): Der Mehrheitsprädiktor (Mehrheit aus drei Nachbarn: links, oben, oben links) ist besser als die trivialen Prädiktoren (nur linker oder nur oberer Nachbar). F6(b): Das Ergebnis ist kleiner als das beste Referenzverfahren für das jeweilige Bild. Methode. Residuum = Pixel ⊕ Vorhersage; kausaler Dekodierer; Endkodierer zlib-9 oder zstd-19; 7 Bilder × 4 Varianten = 28 Messungen; F1: 28/28. Ergebnis.
| Bild | links + zlib-9 | oben + zlib-9 | Mehrheit + zlib-9 | Mehrheit + zstd-19 | bestes Referenzverfahren |
|---|---|---|---|---|---|
fax2d |
0,1359 | 0,1646 | 0,1691 | 0,1567 | 0,1209 (G4) |
g3test |
0,1800 | 0,2178 | 0,2355 | 0,2154 | 0,1624 (zstd-19) |
jim___ah |
0,2085 | 0,3058 | 0,2849 | 0,2642 | 0,1910 (zstd-19) |
| Textseite, serifenlose Schrift | 0,0450 | 0,0456 | 0,0554 | 0,0469 | 0,0364 (zstd-19) |
| Textseite, Serifenschrift | 0,0387 | 0,0409 | 0,0465 | 0,0376 | 0,0302 (zstd-19) |
| Formularseite | 0,0272 | 0,0264 | 0,0316 | 0,0165 | 0,0133 (zstd-19) |
| synthetisches Formularraster | 0,1412 | 0,1610 | 0,2447 | 0,2189 | 0,1069 (zstd-19) |
F6(a) widerlegt: Mit demselben Kodierer (zlib-9) war der Mehrheitsprädiktor auf 7 von 7 Bildern schlechter als der linke Nachbar und auf 6 von 7 schlechter als beide trivialen Prädiktoren (Ausnahme: Auf jim___ah schlug er den oberen Nachbarn). F6(b) widerlegt: Keine Variante war auf irgendeinem Bild besser als das beste Referenzverfahren (0/7). Die jeweils beste Variante war auf 3 von 7 Bildern besser als G4 allein (jim___ah, Formularseite, synthetisches Raster), auf keinem besser als zstd-19 auf den Rohdaten.
Mechanismus. Das Residuum ist dünner besetzt als das Original und komprimiert dennoch nicht besser. Auf jim___ah hat es 0,165 Einsen pro Pixel gegenüber 0,557 im Original und ergibt mit zlib-9 praktisch dasselbe Ergebnis (0,2085 gegenüber 0,2083). Mit demselben Kodierer war das Residuum des linken Nachbarn höchstens geringfügig kleiner als das Original (fax2d: 0,1359 gegenüber 0,1374). Eine mit beiden Messungen vereinbare Deutung: Ein Kodierer der LZ-Familie gewinnt aus Wiederholungen — identischen Glyphen und Zeilen — und nicht aus der Bitdichte; die Abhängigkeitstransformation verändert die Dichte (in 1D in Richtung 0,5, in 2D nach unten), fügt aber keine Wiederholungen hinzu und zerstört einen Teil der vorhandenen. Der Gewinn aus der dünneren Besetzung gleicht den Verlust an Übereinstimmungen nicht aus.
Nächster Schritt. Keiner in dieser Form: Weiterarbeit hieße Kontextmodellierung mit arithmetischem Kodierer, also Konvergenz zum Stand der Technik (JBIG/JBIG2), keine neue Achse.
Status: falsifiziert (F6a, F6b); Achse geschlossen.
7. Schluss des Programms: Abhängigkeitsachse geschlossen, Nische eingegrenzt
- Die Achse der Abhängigkeitskodierung ist als falsifiziert geschlossen, in 1D (Abschnitte 1–2) und in 2D (Abschnitt 6), mit Endkodierern der Klassen RLE und LZ. Festgehaltener Mechanismus: Die Transformation verändert die Bitdichte, fügt aber keine der Wiederholungen hinzu, auf denen der Kodierer aufbaut.
- PGA-Codec — Nische eingegrenzt. Das Programm ging vom „besseren Allzweck-Kompressor” (in den Iterationen 2021–2025 widerlegt) über „strukturierte Korpora” (Dokumente, Scans, Telemetrie — für Scans, gerenderte Seiten, Text und Telemetrie durch Messung widerlegt) zu einer engen Datenklasse: digital erzeugte Raster mit starrer, bitgenauer Wiederholung (programmgenerierte Formulare, Druckdaten aus dem Spooler, aus Vorlagen befüllte Dokumente). Dort war der Codec etwa 2,2-mal besser als das beste klassische Referenzverfahren — gemessen mit vollständiger Wiederherstellung — und etwa 2,6-mal nach einer weiteren Verbesserung des Containers; das ist eine Schätzung aus Abschnittsgrößen, noch nicht durchgängig gemessen. Konstruktion: zurückgehalten.
- Randbedingungen der Nische, offen benannt. Der Vorsprung wurde auf einem einzigen synthetischen Raster gemessen; verglichen wurde mit G4, zlib-9 und zstd-19, nicht mit JBIG2, das Symbolwörterbücher verwendet und den nächstliegenden Stand der Technik bildet; die Robustheit gegenüber Rauschen ist schwach (Abschnitt 5). Das ist eine Abgrenzungshypothese, kein nachgewiesener Vorsprung auf realen Daten.
- Nächste Hypothese: dokumentübergreifende Deduplikation. Ein gemeinsames Wörterbuch für eine Serie von Seiten aus derselben Vorlage (z. B. Serien von Rechnungen oder Protokollen); Erwartung: Die Kosten des Wörterbuchs amortisieren sich über die Serie, und das Kompressionsverhältnis der Serie liegt deutlich unter dem einer einzelnen Seite. JBIG2 sieht Symbolwörterbücher vor, die mehreren Seiten gemeinsam sind; ohne Vergleich damit ist das Ergebnis dieser Hypothese nicht aussagekräftig. Das Kriterium wird, wie in beiden Sitzungen, vor der Messung festgelegt.
8. Korpus, Referenzverfahren, Reproduzierbarkeit
Benchmark 1 (2026-07-15), 10 Dateien. Fünf strukturierte: technischer Text (Projektdokumentation, 18.309 B), synthetisches Formularraster mit 1 Bit/Pixel (512 KiB; Tabellenlinien und ein kleiner fester Satz von Glyphen auf dem Kachelraster, ohne Rauschen), synthetische Telemetrie im CSV-Format (418.929 B), dünn besetzte Datei (256 KiB; Nullen und ein 16-Byte-Datensatzkopf alle 4096 B), Datei mit langen Läufen von 0x00- und 0xFF-Bytes (256 KiB). Zwei hochentropische Kontrolldateien: pseudozufällige Daten (256 KiB) und das erste MiB der kompilierten ausführbaren Windows-Datei aus dem Eintrag vom 2026-07-14. Drei Grenzfälle zu je 256 KiB: nur Nullen, alternierende Bits (Byte 0xAA), periodische Folge (Bytes 0–63). Die synthetischen Dateien sind deterministisch (fester Startwert des Zufallsgenerators).
Benchmark 2 (2026-07-17), 7 Binärbilder. Drei echte Bilder aus dem öffentlichen Testbildarchiv von libtiff pics-3.8.0 (download.osgeo.org/libtiff/pics-3.8.0.tar.gz): fax2d (1728×1082) und g3test (1728×1103) — klassische CCITT-Fax-Testbilder — sowie jim___ah (664×813; dicht: 56 % schwarze Pixel, keine einzige leere Zeile). Drei mit TrueType-Systemschriften bei etwa 200 dpi gerenderte Seiten (1656×2336): Text in serifenloser Schrift, Text in Serifenschrift sowie ein Formular mit Linien und Beschriftungen in nichtproportionaler Schrift; Zeilen- und Zeichenpositionen absichtlich nicht am Kachelraster ausgerichtet. Kontrolle: das synthetische Formularraster aus Benchmark 1. Die Raster sind als rohe Bits gespeichert, 1 Bit/Pixel, zeilenweise, Schwarz = 1.
Referenzverfahren. zlib-9 (DEFLATE, wie in gzip), zstd-19, CCITT G4 (in Benchmark 2; gemessen als vollständige TIFF-Datei). JBIG2 — nicht gemessen: kein Kodierer in der Messumgebung.
Umgebung. Windows 11 (AMD64), Python 3.12.10, numpy 2.5.0, Pillow 10.4.0, zstandard 0.25.0.
Prüfung. Benchmark 1: 154 Messungen; bei 144 Dekodierungen stimmte der SHA-256-Hashwert mit dem des Originals überein, die 10 Abweichungen betreffen die historische Version des PGA-Codecs (Abschnitt 3). Benchmark 2: 51 Messungen, darunter 48 Dekodierungen — alle 48 übereinstimmend; die übrigen 3 Messungen betrafen ein Konstruktionsdetail des Containers, ihr Ergebnis ist zurückgehalten.
Reproduzierbarkeit. Die Ergebnisse der Referenzverfahren auf den libtiff-Bildern kann jeder wiederholen: Das Archiv ist öffentlich, Geometrie und Rasterformat sind oben angegeben. Die Ergebnisse der eigenen Methoden erfordern die zurückgehaltene Konstruktion; mit den Protokollen verbinden sie die Hashwerte in Abschnitt 9.
9. Nachweise: SHA-256-Hashwerte und Zeitstempel
Die Messprotokolle bleiben privat: Sie enthalten die zurückgehaltene Konstruktion. Ihre hier veröffentlichten SHA-256-Hashwerte erlauben später die Prüfung, dass ein künftig vorgelegtes Dokument dasselbe ist, das im Juli 2026 gestempelt wurde. Die Nachweisverzeichnisse enthalten die SHA-256-Hashwerte der Rohergebnisdateien und der Korpusmanifeste sowie die Commit-Kennungen des Messcodes (das erste zusätzlich den Hashwert des Whitepapers von 2025).
| Dokument | SHA-256 | OpenTimestamps-Zeitstempel |
|---|---|---|
| Messprotokoll Nr. 1 (Benchmark 1) | 0830cc94c042c05103e45a47de2bdae0db2411f683fcd309e6630c5700552375 |
2026-07-15, Bitcoin-Attestierung |
| Nachweisverzeichnis zu Benchmark 1 | 8b85e99708febb32682a100f5b2336bd0ffc8cf0e0ef4c7671aa91576de6dc56 |
2026-07-15, Bitcoin-Attestierung |
| Messprotokoll Nr. 2 (Benchmark 2) | c478b509fda7419a60b0ad2149d28f4dec83aae5fb074ffbeab0cd3bb3aba1de |
2026-07-17 |
| Nachweisverzeichnis zu Benchmark 2 | 7b2a7a3fa8a49c3adda2e6604cdf462106f1ab4fc11a26c4246ba8e955324b09 |
2026-07-17 |
Die Hashwerte beider Protokolle stimmen mit den Einträgen in den Verzeichnissen überein. Wo ein Protokoll eine Zahl oder Beschreibung enthält, die nicht zu den Rohergebnisdateien passt, gibt dieser Eintrag den Wert aus den Ergebnisdateien an: (1) Protokoll Nr. 1 sagt, dass sich das Ergebnis mit zlib-9 auf jeder Datei monoton mit der Schichtzahl verschlechtert — laut Daten gilt das für 5 von 10 Dateien (Abschnitt 1); (2) Protokoll Nr. 1 bewertet F4 gegenüber zstd-19, obwohl F4 gegenüber der Eingabegröße formuliert ist — Abschnitt 4 gibt beide Lesarten an; (3) Protokoll Nr. 2 nennt 30/30 geprüfte Dekodierungen im 2D-Test — die Ergebnisdatei enthält 28, die Sitzungssumme 48/48 ist richtig; (4) Protokoll Nr. 2 gibt an, der Mehrheitsprädiktor sei auf 6 von 7 Bildern schlechter als der linke Nachbar gewesen — mit demselben Kodierer war er es auf 7 von 7, schlechter als beide trivialen Prädiktoren auf 6 von 7; (5) Protokoll Nr. 2 beschreibt jim___ah als handschriftlichen Scan — 56 % schwarze Pixel und keine leere Zeile sprechen eher für ein dichtes oder gerastertes Bild; wir beschreiben es daher neutral.
Korrekturen zum Eintrag vom 2026-07-14
- Richtung 1, Kriterium (b). Eintrag: „gemessene Ratio auf definierten Korpora gegenüber gzip/zstd — das Messprogramm wurde noch nicht durchgeführt”. Jetzt: am 2026-07-15 gemessen und widerlegt (Abschnitt 1); die Achse ist geschlossen, auch in der 2D-Variante (Abschnitt 6).
- Richtung 1, Konstruktion. Eintrag: „Konstruktion (Abhängigkeitsregel, Schichtaufbau, Containerformat): zurückgehalten”. Regel und Schichtaufbau sind jetzt offengelegt — XOR benachbarter Bits, Schicht für Schicht iteriert —, weil die Achse falsifiziert und geschlossen ist.
- Richtung 1, Umkehrbarkeit. Die Aussage bleibt bestehen (100/100 und 4/4), mit einer Präzisierung: Eine frühere Referenzimplementierung speicherte nur das erste Randbit und konnte nicht mehr als eine Schicht dekodieren; gemessen wurde an einer korrigierten Neuimplementierung.
- Richtung 2, Wiederherstellungskriterium. Eintrag: „Bitgenaue Rekonstruktion (erfüllt, hashverifiziert)”. Für den PGA-Codec traf das nicht zu: Die Prüfung betraf einen früheren Machbarkeitsnachweis. Die erste vollständige Validierung des PGA-Codecs (2026-07-15) ergab 0/10; umkehrbar ist erst die reparierte Variante (Abschnitte 3–4).
- Negatives Ergebnis +56 %. Die Größe wurde korrekt gemessen (14,2 → 22,2 MB), das Artefakt ist aber nicht vollständig rekonstruierbar und war damit keine gültige verlustfreie Kodierung. Der Schluss — Expansion auf hochentropischen Daten — ist durch die reparierte Variante mit SHA-256-Prüfung bestätigt: auf dem ersten MiB derselben Datei +52 % (formattreue Ausprägung) und +12 % (redundanzfreie Karte), auf Zufallsdaten +55 % und +18 %.
- Richtung 2, Stand der Technik. Der Eintrag verglich mit gzip/zstd. Der eigentliche Stand der Technik für Binärbilder sind CCITT G4 und JBIG2; G4 wurde in Benchmark 2 gemessen, JBIG2 noch nicht.
- Richtung 2, Status. Eintrag: „POC implementiert / in Validierung”. Jetzt: validiert — die historische Version erfüllt das Wiederherstellungskriterium nicht, die reparierte Variante erfüllt es, der Positivbefund überträgt sich nicht über das synthetische Raster hinaus (Abschnitte 3–5).
- Abgrenzungsschluss. Der Eintrag verengte das Programm auf strukturierte Korpora (Dokumente, Scans, Telemetrie). Die Messungen verengen weiter: Auf Scans, gerenderten Textseiten, Telemetrie und Text gewinnen die klassischen Kodierer; es bleibt die Nische digital erzeugter Raster mit starrer Wiederholung (Abschnitt 7).
Programmstatus: aktiv. Achse der Abhängigkeitskodierung — als falsifiziert geschlossen, in 1D und 2D. PGA-Codec — in der reparierten Variante umkehrbar, mit einem Vorsprung, der nur auf einem einzigen synthetischen, digital erzeugten Raster gemessen ist; nächster Schritt: dokumentübergreifende Deduplikation auf Seitenserien aus einer Vorlage.
Zeitnachweis
Dieser Text wurde bei der Veröffentlichung gehasht und gestempelt. Zur Prüfung sind beide Dateien nötig: der Stempel belegt, dass genau eine Bytefolge zu diesem Zeitpunkt existierte, und nur die Quelle unten ist diese Bytefolge. Jede spätere Änderung verschiebt den Hash und bricht die Übereinstimmung — genau das ist der Zweck.
SHA-256 des gestempelten Textes: 9655706edbeb5b0f3b47af0d9c98c8d37e0ff8d4084f884ee4b298b02a6d4476
- Sigelith-Anker portfolio-dependibit-benchmarks.public.md.beattime.json
- OpenTimestamps-Nachweis portfolio-dependibit-benchmarks.public.md.ots
- Gestempelter Quelltext portfolio-dependibit-benchmarks.public.md
Prüfen mit: ots verify <Nachweis> --file <Quelle>