# Koch Laboratory — Walidacja łańcucha analizy EEG przed pierwszym prawdziwym nagraniem (projekt „neuro", ciąg dalszy) · Forschungsportfolio / Portfolio badawcze / Research Portfolio

> **Zasada publikacji.** Publikujemy problem, stan techniki, kryterium, metodę i wynik — także negatywny. Wstrzymane pozostają konstrukcje rozwiązań, szczegóły bodźców, zawartość i budowa bazy normatywnej oraz szczegóły operacyjne i dotyczące bezpieczeństwa.
> **Zasada uczciwości.** Wyniki analizy EEG w tym wpisie pochodzą wyłącznie z danych syntetycznych o znanej prawdzie podstawowej; jedyne dane rzeczywiste, o których mowa, to dotychczasowe nagrania pilotażowe — opisane jako nieprzydatne do ERP. W bazie analiz nie ma dotąd żadnego nagrania prawdziwej osoby.
> **Słownik.** Wyłącznie rejestr mainstreamowy (ERP, ISC, hyperscanning, INS, diada) — jak w poprzednim wpisie projektu.

---
---

# 🇵🇱 WERSJA POLSKA

## Koch Laboratory — walidacja łańcucha analizy EEG przed pierwszym prawdziwym nagraniem

Ten wpis kontynuuje wpis „neuro" (w dzienniku z datą 2026-08-10, w obecnym brzmieniu ostemplowany 2026-08-12), który opisał kierunki badawcze przesiewu kondycji poznawczej na czterech kanałach konsumenckiego EEG. Tamten wpis mówił, czego szukamy; ten mówi, co sprawdzono, zanim pierwsza osoba usiądzie do pomiaru przeznaczonego do bazy: czy łańcuch analizy odzyskuje efekt, który do niego włożono, i czy nie wytwarza efektu tam, gdzie go nie ma. Do tego dochodzą wyniki negatywne dotyczące bodźca i sygnału, ustalenia audytu metodycznego wraz z poprawkami oraz zmiany konstrukcyjne na poziomie, który można opublikować. Korekty do wpisu z 2026-08-12 zebrano na końcu; sam tamten wpis pozostaje niezmieniony.

**Metodyka i przeznaczenie.** Jak w reszcie laboratorium: problem → stan techniki → falsyfikowalne kryterium → metoda → wynik z warunkami brzegowymi → następny krok. „Potwierdzone" znaczy spełnione w granicach kryterium, „obalone" — sprawdzone i odrzucone z podanym powodem, „częściowo" — z nazwaną brakującą częścią. Gdzie widnieje „Konstrukcja: wstrzymana", szczegół techniczny pozostaje niepubliczny. Przeznaczenie platformy: instrument pomiarowy do zastosowań badawczych i wellness; nie jest wyrobem medycznym i nie dostarcza informacji do podejmowania decyzji diagnostycznych ani terapeutycznych.

### 1. Kierunek 1 — łańcuch ERP na syntetycznej prawdzie podstawowej, z kontrolą negatywną
**Pytanie badawcze.** Skąd wiadomo, że łańcuch analizy — od pakietów Bluetooth przez rekonstrukcję sygnału i epokowanie po statystykę — znajdzie potencjał wywołany, który jest w danych, i nie zgłosi go tam, gdzie go nie ma? Na nagraniu prawdziwej osoby tego nie sprawdzimy, bo prawdy podstawowej tam nie znamy.
**Stan techniki (publikowany).** Symulacja aktywności związanej ze zdarzeniami ze znaną prawdą podstawową jako sposób walidacji metod analizy (np. SEREEGA, Krol i in. 2018); kontrole negatywne jako warunek wiarygodności efektu; walidacja konsumenckiej opaski do badań ERP (grupa Krigolsona).
**Kryterium sukcesu.** (a) Przy niskim szumie łańcuch odzyskuje wstrzykniętą amplitudę i latencję; (b) w zapisie bez wstrzykniętej odpowiedzi żaden kanał nie jest istotny; (c) ten sam zapis daje te same liczby w lokalnym narzędziu analitycznym i w przetwarzaniu na platformie.
**Metoda.** Zapisy syntetyczne odtwarzają transport danych opaski (pakiety z numerami sekwencji, zmienny czas przybycia, zgubione pakiety) oraz mrugnięcia, rytm alfa i zakłócenia sieciowe 50 Hz. Wstrzyknięta prawda: fala różnicowa +6,5 µV w latencji 350 ms między dwiema klasami zdarzeń. Warianty z niskim szumem, z szumem typowym dla opaski i z samym szumem przeszły przez lokalne narzędzie analityczne (11 sierpnia 2026 r.); zapis z odpowiedzią i kontrola negatywna przeszły ponadto całą ścieżkę platformy: wysyłka zapisu → kolejka przetwarzania → analiza → wynik (13 sierpnia 2026 r.).
**Wynik.** Potwierdzone w granicach kryterium. (a) Przy niskim szumie odzyskano +6,3 µV przy 336 ms i +6,5 µV przy 355 ms na dwóch kanałach czołowych, wobec prawdy +6,5 µV przy 350 ms. (b) Kontrola negatywna: żadnego istotnego kanału (p od 0,09 do 0,42); na całej ścieżce platformy wstrzyknięty efekt wykryto na jednym kanale z czterech (nieskorygowane p = 0,015), a kontrola negatywna nie dała istotnego kanału (p od 0,28 do 0,89). (c) Lokalne narzędzie i przetwarzanie na platformie dają na tym samym zapisie identyczne liczby — to jedna implementacja, nie dwie. Po poprawkach z kierunku 5 łańcuch przetworzył ponownie zapisy syntetyczne (23 sierpnia 2026 r.), ale pełnego powtórzenia obu kontroli, z porównaniem do prawdy podstawowej, nie udokumentowano.
**Warunki brzegowe.** Przy szumie typowym dla opaski efekt, który naprawdę jest w danych, wychodzi istotny tylko na jednym lub dwóch kanałach z czterech — tyle wynosi realistyczna czułość jednej sesji. Latencja szczytu przy małej liczbie prób łapie szum (przy dziesięciu epokach szczyt wypadł w 441 ms przy prawdzie 350 ms), dlatego podstawową miarą jest średnia amplituda w ustalonym oknie po bodźcu, a szczyt podajemy pomocniczo. Przy korekcie Holma wprowadzonej po audycie (kierunek 5) wynik z jednego kanału na całej ścieżce platformy nie byłby już istotny na poziomie 0,05 (wartość skorygowana 4 × 0,015 = 0,06).
**Następny krok.** Ilościowo określić czułość jednej sesji przy skorygowanej statystyce — jak często znany efekt osiąga istotność przy realistycznym szumie — i powtórzyć kontrolę negatywną; potem pierwsze nagranie prawdziwej osoby wobec kryterium z poprzedniego wpisu: widoczny uśredniony potencjał wywołany po co najmniej 30 powtórzeniach.
**Status:** potwierdzone na danych syntetycznych; kryterium na danych prawdziwych otwarte — takich danych w bazie analiz jeszcze nie ma.

### 2. Kierunek 2 — korelacja międzyosobnicza na parach syntetycznych i wspólne sesje
**Pytanie badawcze.** Czy miara ISC odróżnia parę zapisów ze wspólną, wywołaną bodźcem modulacją od pary bez niej — przy rozkładzie zerowym wyznaczonym z tych samych danych i z wynikiem identycznym przy każdym przeliczeniu? I czy da się w ogóle nagrać diadę: dwie lub więcej osób oglądających ten sam film w różnych miejscach?
**Stan techniki (publikowany).** ISC w EEG przy bodźcach naturalistycznych (Dmochowski i in. 2012; Ki, Kelly, Parra 2016); dane surogatowe — przesunięcia cykliczne, randomizacja fazy (Theiler i in. 1992) — jako rozkład zerowy; zdalny hyperscanning jako ustabilizowany nurt neuronauki społecznej (poprzedni wpis).
**Kryterium sukcesu.** Para skorelowana: wysokie r i p < 0,05; para nieskorelowana: r bliskie zeru i p > 0,05; powtórne przeliczenie: identyczne p.
**Metoda.** Zapisy syntetyczne ze wspólną modulacją amplitudy i bez niej; korelacja obwiedni amplitudy między osobami po wyrównaniu do bodźca; p z przesunięć cyklicznych.
**Wynik.** Potwierdzone na danych syntetycznych (14 sierpnia 2026 r.): para skorelowana r = 0,93, p = 0,005 (najmniejsza wartość osiągalna przy użytej liczbie permutacji); kontrola negatywna r = −0,001, p = 0,98. Ustalenie metodyczne: czysto okresowa modulacja daje przy rozkładzie zerowym z przesunięć cyklicznych zachowawcze p, bo taki rozkład zachowuje autokorelację — to cecha poprawnej statystyki, nie błąd; sygnały testowe muszą być bogate widmowo, jak prawdziwy film. Po audycie (kierunek 5) obliczenie przebudowano; obie kontrole są częścią testów automatycznych. Wspólne sesje zaimplementowano 14 sierpnia 2026 r.: wspólny start uczestników w różnych miejscach, zapisy przypisane do wspólnego terminu i ISC dla każdej pary, przeliczana po każdej sesji.
**Konstrukcja (synchronizacja startu i zegarów między lokalizacjami): wstrzymana.**
**Warunki brzegowe.** Laboratorium ma jedną opaskę — prawdziwej diady nie nagrano, więc kryterium hyperscanningu z poprzedniego wpisu pozostaje niesprawdzone. Z kontroli wymienionych w tamtym kryterium działają przesunięcia cykliczne; pary pozorowane (osoby, które nigdy nie były połączone) i korekta wielokrotnych porównań między parami nie są jeszcze zaimplementowane.
**Następny krok.** Druga opaska i pierwsza prawdziwa diada; pary pozorowane i korekta między parami przed jakąkolwiek interpretacją wyniku.
**Status:** częściowo — metoda potwierdzona na danych syntetycznych, wspólne sesje zaimplementowane, kryterium na prawdziwych diadach otwarte.

### 3. Kierunek 3 — bodziec: odrzucony model generatywny i przesunięcie o jedną klatkę
**Pytanie badawcze.** Uśrednianie ERP wymaga powtórzeń fizycznie identycznych, różniących się wyłącznie zamierzonym wymiarem, z początkiem bodźca w znanej klatce. Skąd wziąć taki bodziec — i skąd wiadomo, że zaznaczona klatka to ta, w której bodziec rzeczywiście się pojawia?
**Stan techniki (publikowany).** W psychologii eksperymentalnej bodźce generuje się programowo, z kontrolowanymi parametrami, a ich timing sprawdza się pomiarem sprzętowym (fotodioda), jak w porównawczych badaniach oprogramowania eksperymentalnego (Bridges i in. 2020).
**Kryterium sukcesu.** (a) Powtórzenia identyczne co do klatki; (b) warunki różnią się wyłącznie zamierzonym wymiarem; (c) każdy zaznaczony początek bodźca wypada w klatce, w której bodziec pojawia się po raz pierwszy — sprawdzone niezależnie od generatora; (d) udokumentowane pochodzenie i licencja, pozwalające zamrozić wersję bodźca na lata.
**Metoda.** Próba zbudowania filmu bodźcowego generatywnym modelem wideo; niezależny audyt każdej wersji bodźca — program, który czyta wyłącznie gotowy plik wideo i listę markerów, a deklaracjom generatora nie ufa.
**Wynik.** (1) Generatywny model wideo odrzucony jako źródło bodźca (11 sierpnia 2026 r.). Powód nie był estetyczny, lecz metodologiczny: model nie powtarza ujęcia co do klatki (a); między klipami zmieniają się luminancja, kontrast, ruch i tempo, a każdy z tych parametrów sam wywołuje odpowiedź mózgu (b); nie da się zamówić zdarzenia w określonej klatce (c); pochodzenie i licencja materiału są niejasne wobec wymogu zamrożenia na lata (d). (2) Systematyczne przesunięcie o jedną klatkę we własnym generatorze — wykryte przez niezależny audyt. Na części prób marker wypadał o jedną klatkę przed klatką, w której bodziec rzeczywiście się pojawiał; latencje tych prób wyszłyby dłuższe o jedną klatkę, czyli o kilkadziesiąt milisekund — w skali różnic latencji, których szukamy. Poprawione w generatorach bodźców; obecnie używane wersje bodźca laboratorium przeszły ten audyt przed publikacją.
**Warunki brzegowe.** Audyt sprawdza plik, nie ekran: tego, co dzieje się między plikiem a okiem (dekoder, kompozytor, wyświetlacz), dotyczy dopiero pomiar sprzętowy — jeszcze niewykonany.
**Następny krok.** Pomiar timingu toru prezentacji fotodiodą.
**Status:** wynik negatywny (model generatywny odrzucony) oraz własny błąd wykryty i poprawiony.

### 4. Kierunek 4 — sygnał: mrugnięcia zamiast liczby prób, ICA na czterech kanałach, nagrania pilotażowe
**Pytanie badawcze.** Co przy czterech suchych elektrodach ogranicza wykrywalność ERP w jednej sesji — liczba prób czy artefakty? Czy standardowe narzędzia usuwania artefaktów działają na czterech kanałach? I czy dotychczasowe nagrania pilotażowe nadają się do ERP?
**Stan techniki (publikowany).** Artefakty oczne dominują w kanałach czołowych; ICA jest standardem usuwania mrugnięć przy wielokanałowym EEG, ale jej zdolność rozdzielcza zależy od liczby kanałów; alternatywami są odrzucanie epok i korekcja regresyjna (Gratton, Coles, Donchin 1983).
**Kryterium sukcesu.** Zabieg uznajemy za pomocny tylko wtedy, gdy w symulacji poprawia wykrywanie znanego, wstrzykniętego efektu i nie wytwarza efektu w kontroli negatywnej. Nagranie uznajemy za przydatne do ERP tylko wtedy, gdy ma nominalną częstotliwość próbkowania i markery bodźca zsynchronizowane z prezentacją.
**Metoda.** Symulacja z kierunku 1 przy szumie typowym dla opaski, z mrugnięciami; zmieniane były liczba prób, próg odrzucania epok oraz ICA (włączona albo wyłączona). Dla nagrań pilotażowych — sprawdzenie efektywnej częstotliwości próbkowania i obecności markerów.
**Wynik.** (1) Hipoteza „więcej prób = lepsza wykrywalność" obalona w symulacji: ponad trzykrotne zwiększenie liczby zdarzeń nie poprawiło wykrywalności; poprawiło ją dopiero ostrzejsze odrzucanie epok zanieczyszczonych mrugnięciami. Wariancję robią mrugnięcia, nie liczba prób — pierwszeństwo mają kontakt elektrod i instrukcja dla uczestnika, a nie dłuższy bodziec. (2) ICA na czterech kanałach zawodna: w symulacji nie wyodrębniała niezawodnie składowej mrugnięć; pozostała opcją, a podstawową obroną jest odrzucanie epok. (3) Nagrania pilotażowe nieprzydatne do ERP: żadne nie ma markerów bodźca, a najnowszy eksport z zewnętrznej aplikacji nagrywającej miał efektywną częstotliwość próbkowania niższą od nominalnej o ponad dwa rzędy wielkości — składowa trwająca około 100 ms mieści się między dwiema próbkami. Takie pliki nadają się co najwyżej do trendów pasm i kontroli kontaktu elektrod, nigdy do ERP i nigdy do bazy normatywnej.
**Następny krok.** Korekcja regresyjna mrugnięć jako alternatywa dla ICA — sprawdzona na tych samych zapisach syntetycznych, z kontrolą negatywną.
**Status:** dwie hipotezy obalone, dane pilotażowe wykluczone z ERP — wyniki negatywne, publikowane celowo.

### 5. Kierunek 5 — audyt metodyczny: cztery ustalenia i ich poprawki
**Pytanie badawcze.** Czy kod analizy robi to, co deklaruje metodyka — także w przypadkach, których nikt nie przetestował ręcznie?
**Stan techniki (publikowany).** Kontrola błędu rodzinnego przy wielu testach (Holm 1979); pseudoreplikacja, czyli liczenie powtórzonych pomiarów tej samej osoby jako niezależnych obserwacji (Hurlbert 1984; Lazic 2010); powtarzalność obliczeń jako wymóg wobec testów permutacyjnych.
**Kryterium sukcesu.** Ustalenie uznajemy za zamknięte dopiero wtedy, gdy poprawka jest w kodzie i pokrywa ją test regresyjny.
**Metoda.** Audyt projektu (15 sierpnia 2026 r.), który objął m.in. kod analizy i metodykę; poprawki następnego dnia; testy regresyjne w ciągłej integracji; drugi audyt (wrzesień 2026 r.), który sprawdził m.in., czy wcześniejsze ustalenia są zamknięte.
**Wynik.** Cztery ustalenia metodyczne:

1. **Cztery kanały testowane bez korekty.** Każdy kanał oceniano osobno przy p < 0,05 — przy niezależnych kanałach to około 18,5 % szans na co najmniej jeden fałszywie dodatni wynik w sesji bez żadnego efektu. Poprawka: korekta Holma–Bonferroniego; surowe p zostaje w wyniku, o istotności rozstrzyga wartość skorygowana.
2. **Uszkodzone pakiety mogły wytworzyć fikcyjny sygnał.** Walidacja przepuszczała pakiety z nieprawidłowymi polami, a duże luki były po cichu interpolowane — łańcuch mógł „uzupełnić" sygnał tam, gdzie go nie było. Poprawka: ścisła walidacja struktury, uporządkowanie pakietów i odrzucanie duplikatów; zapis z ciągłą luką dłuższą niż 2 s albo z ponad 20 % brakujących próbek jest odrzucany, a nie interpolowany.
3. **ISC: czas ściśnięty i niepowtarzalny seed.** Oś czasu składano z kolejnych pakietów, więc luki znikały, a osie dwóch osób z różnymi stratami rozjeżdżały się względem siebie; seed permutacji zależał od funkcji skrótu losowanej w każdym procesie, więc p zmieniało się przy każdym przeliczeniu. Poprawka (zmieniona ISC): oś czasu z numerów sekwencji, z jawnie oznaczonymi lukami; korelacja wyłącznie na oknach obecnych u obu osób; stabilny seed wyprowadzany kryptograficzną funkcją skrótu z identyfikatorów pary; skróty danych wejściowych zapisywane przy wyniku.
4. **Norma: powtórzenia jako niezależne obserwacje, brak kontroli jakości jako zaliczenie.** Wielokrotne sesje (i ponowne przeliczenia) jednej osoby trafiały do normy jak kolejne osoby, a brak metryk jakości prezentacji traktowano jak wynik pozytywny. Poprawka: jeden wynik na sesję i jedna sesja na osobę w grupie odniesienia — liczebność normy liczy ludzi, nie pomiary; brak kontroli jakości oznacza wykluczenie.

Po audytach poprawiono też obsługę zgód i usuwania danych — zanim istniały jakiekolwiek dane prawdziwych uczestników. Poprawki weszły do kodu 16 sierpnia 2026 r. Ustalenia 2 i 3 są pokryte testami regresyjnymi w ciągłej integracji (pakiety uszkodzone, zduplikowane i poza kolejnością, zawinięcie licznika sekwencji, luki, powtarzalność ISC i oznaczanie luk), a drugi audyt potwierdził ich zamknięcie. Poprawki ustaleń 1 i 4 są w kodzie, ale bez dedykowanych testów regresyjnych; ustalenie 4 drugi audyt uznał za zamknięte tylko częściowo: dopuszczenie sesji do normy nie sprawdza jeszcze wersji urządzenia i oprogramowania układowego i nie ma własnego progu utraty pakietów.
**Następny krok.** Testy regresyjne dla ustaleń 1 i 4; reguły dopuszczenia do normy obejmujące wersję urządzenia i oprogramowania układowego (por. kierunek 6 poprzedniego wpisu) oraz próg utraty pakietów.
**Status:** dwa ustalenia zamknięte; dwa poprawione w kodzie, lecz bez testu regresyjnego — w tym jedno zamknięte tylko częściowo.

### 6. Kierunek 6 — norma: tylko amplitudy, latencje po kalibracji, percentyl od N ≥ 20
**Pytanie badawcze.** Kiedy liczba pokazana na tle grupy porównawczej znaczy to, co sugeruje? Percentyl wygląda jak fakt także wtedy, gdy grupa liczy kilka osób albo gdy mierzona wielkość niesie stałe, niezmierzone przesunięcie.
**Stan techniki (publikowany).** Normy testów podaje się względem zdefiniowanych grup odniesienia o wystarczającej liczebności; pomiar latencji wymaga sprzętowej weryfikacji timingu bodźca (Bridges i in. 2020).
**Kryterium sukcesu.** Percentyl pokazujemy tylko wtedy, gdy (a) wielkość jest wolna od niezmierzonych przesunięć systematycznych i (b) grupa odniesienia liczy co najmniej 20 osób.
**Metoda.** Latencja bezwzględna zawiera stałe, niezmierzone opóźnienie toru Bluetooth + kompozytor + ekran; różnice między warunkami w obrębie jednej sesji są od niego wolne. Stąd trzy reguły: normowane są wyłącznie amplitudy; latencje pozostają poza normą do czasu sprzętowego pomiaru timingu; poniżej 20 osób w grupie odniesienia zamiast percentyla pokazujemy liczebność — liczoną w osobach, nie w sesjach (kierunek 5).
**Wynik.** Zaimplementowane (15 i 16 sierpnia 2026 r.) i sprawdzane testami: latencje nie trafiają do normy, a poniżej progu widać liczebność zamiast percentyla. Warunek brzegowy: w bazie analiz nie ma jeszcze nagrań prawdziwych osób, więc żadna grupa odniesienia nie istnieje — reguły obowiązują, ale nie miały jeszcze na czym zadziałać.
**Następny krok.** Po pomiarze timingu: rozstrzygnięcie, czy latencje bezwzględne mogą wejść do normy — z jawnie podanym zmierzonym przesunięciem i jego rozrzutem.
**Status:** zaimplementowane; reguły w mocy, niesprawdzone na danych prawdziwych.

### Korekty wpisu z 2026-08-12

Wpis z 2026-08-12 pozostaje w brzmieniu, w jakim go ostemplowano. Poniższe korekty go nie zastępują — prostują go w świetle tego, co wiadomo dziś.

- **Kierunek 1 (znakowanie zdarzeń w przeglądarce) — status był zaniżony.** Wymieniał wyłącznie akwizycję, choć w dniu wpisu istniała już ścieżka od zapisu do wyniku ERP (w lokalnym narzędziu analitycznym; na platformie — od następnego dnia), zwalidowana dzień wcześniej na zapisie syntetycznym ze znaną prawdą podstawową i z kontrolą negatywną (kierunek 1 tego wpisu). Kryterium ERP na nagraniu prawdziwej osoby nie było wtedy spełnione i nie jest spełnione dziś. Odniesieniem dla timingu jest bezpośredni pomiar sprzętowy toru prezentacji (fotodioda), dotąd niewykonany; równoległego pipeline'u laboratoryjnego (desktopowego toru akwizycji), o którym mówiło tamto kryterium, nie zbudowano.
- **Kierunek 2 — zmieniła się „główna luka".** Wpis wskazywał jako główną lukę brak markerów zdarzeń w nagraniach pilotażowych. Markery nie były już wtedy wąskim gardłem — zawiera je każdy zapis z własnego odtwarzacza — a najnowsze nagranie pilotażowe okazało się nieprzydatne do ERP także z drugiego, niezależnego powodu (kierunek 4 tego wpisu). Główną luką są dziś dane: w bazie analiz nie ma żadnego nagrania prawdziwej osoby, kohorty normatywnej nie ma, a timing sprzętowy pozostaje niezmierzony.
- **Kierunek 3 — wspólne sesje.** Wpis podawał: „architektura wspólnych sesji zaprojektowana, implementacja nierozpoczęta". Było to prawdą w dniu wpisu i przestało nią być dwa dni później: 14 sierpnia 2026 r. zaimplementowano wspólne sesje (kierunek 2 tego wpisu). Kryterium tamtego kierunku pozostaje niesprawdzone — nie nagrano dotąd żadnej prawdziwej diady.
- **Kierunek 5 — dziennik operacji i zgody.** Status opisywał dziennik jako „tylko dopisywalny", a zgody jako zdarzenia z wersją treści. W rzeczywistości obie własności były wtedy słabsze, niż sugerował opis: były konwencją aplikacji, a nie gwarancją egzekwowaną przez system. Egzekwowane są dopiero od poprawek po audytach z sierpnia i września 2026 r. Kotwiczenie i rozstrzygnięcie konfliktu z prawem do usunięcia pozostają otwarte, jak w tamtym wpisie.
- **Przeznaczenie — zdanie wycofane.** Wycofujemy zdanie z akapitu „Metodyka": „narzędzie dostarcza informacji wspierającej decyzję lekarza, nigdy nie orzeka; ścieżka wyrobu medycznego (MDR) jest świadomie osobnym, późniejszym etapem". Obowiązuje brzmienie: platforma jest instrumentem pomiarowym do zastosowań badawczych i wellness; nie jest wyrobem medycznym i nie dostarcza informacji do podejmowania decyzji diagnostycznych ani terapeutycznych. Słowo „przesiew" w tamtym wpisie oznacza pytanie badawcze, nie zastosowanie.

**Status programu:** aktywny. Łańcuch analizy zwalidowany na danych syntetycznych z kontrolami negatywnymi, ustalenia audytu metodycznego poprawione (dwa w pełni zamknięte), wspólne sesje zaimplementowane, reguły normy zawężone. Warunki brzegowe, wprost: w bazie analiz nie ma dotąd żadnego nagrania prawdziwej osoby; laboratorium ma jedną opaskę, więc prawdziwej diady nie nagrano; timing sprzętowy (fotodioda) nie został zmierzony; akwizycja w przeglądarce działa wyłącznie w przeglądarkach opartych na Chromium (Web Bluetooth) — nie w Firefoksie, nie w Safari i nie na iPhonie ani iPadzie. Najbliższy krok: pomiar timingu fotodiodą i pierwsze nagrania prawdziwych osób na zamrożonej wersji bodźca.

---
---

# 🇩🇪 DEUTSCHE FASSUNG

## Koch Laboratory — Validierung einer EEG-Analysekette vor der ersten echten Aufzeichnung

Dieser Eintrag setzt den Eintrag „neuro" fort (im Tagebuch mit dem Datum 2026-08-10, in der vorliegenden Fassung gestempelt am 2026-08-12), der Forschungsrichtungen für ein kognitives Screening auf vier Kanälen eines Verbraucher-EEG beschrieb. Jener Eintrag sagte, wonach wir suchen; dieser sagt, was geprüft wurde, bevor die erste Person zu einer Messung Platz nimmt, die in die Datenbasis eingehen soll: ob die Analysekette einen Effekt wiederfindet, der in sie hineingelegt wurde, und ob sie keinen Effekt erzeugt, wo keiner ist. Hinzu kommen negative Ergebnisse zu Reiz und Signal, die Befunde eines methodischen Audits samt Korrekturen sowie Änderungen der Konstruktion auf veröffentlichungsfähigem Niveau. Korrekturen zum Eintrag vom 2026-08-12 stehen am Ende; jener Eintrag selbst bleibt unverändert.

**Methodik und Zweckbestimmung.** Wie im übrigen Labor: Problem → Stand der Technik → falsifizierbares Kriterium → Methode → Ergebnis mit Randbedingungen → nächster Schritt. „Bestätigt" heißt im Rahmen des Kriteriums erfüllt, „widerlegt" heißt geprüft und mit angegebenem Grund verworfen, „teilweise" heißt mit benanntem fehlendem Teil. Wo „Konstruktion: zurückgehalten" steht, bleibt das technische Detail unveröffentlicht. Zweckbestimmung der Plattform: ein Messinstrument für Forschungs- und Wellnesszwecke; sie ist kein Medizinprodukt und liefert keine Informationen für diagnostische oder therapeutische Entscheidungen.

### 1. Richtung 1 — ERP-Kette auf synthetischer Grundwahrheit, mit Negativkontrolle
**Forschungsfrage.** Woher wissen wir, dass die Analysekette — von den Bluetooth-Paketen über die Signalrekonstruktion und die Epochierung bis zur Statistik — ein ereigniskorreliertes Potential findet, das in den Daten steckt, und keines meldet, wo keines ist? An der Aufzeichnung einer echten Person lässt sich das nicht prüfen, denn dort ist die Grundwahrheit unbekannt.
**Stand der Technik (veröffentlicht).** Simulation ereigniskorrelierter Aktivität mit bekannter Grundwahrheit zur Validierung von Analysemethoden (z. B. SEREEGA, Krol et al. 2018); Negativkontrollen als Voraussetzung für die Glaubwürdigkeit eines Effekts; Validierung des Verbraucher-Stirnbands für die ERP-Forschung (Gruppe Krigolson).
**Erfolgskriterium.** (a) Bei geringem Rauschen findet die Kette die eingespeiste Amplitude und Latenz wieder; (b) in einer Aufzeichnung ohne eingespeiste Antwort ist kein Kanal signifikant; (c) dieselbe Aufzeichnung ergibt im lokalen Analysewerkzeug und in der Verarbeitung auf der Plattform dieselben Zahlen.
**Methode.** Die synthetischen Aufzeichnungen bilden den Datentransport des Stirnbands nach (Pakete mit Sequenznummern, schwankende Ankunftszeiten, verlorene Pakete), dazu Lidschläge, Alpha-Rhythmus und 50-Hz-Netzstörungen. Eingespeiste Wahrheit: eine Differenzwelle von +6,5 µV bei einer Latenz von 350 ms zwischen zwei Ereignisklassen. Die Varianten mit geringem Rauschen, mit stirnbandtypischem Rauschen und mit reinem Rauschen liefen durch das lokale Analysewerkzeug (11. August 2026); die Aufzeichnung mit Antwort und die Negativkontrolle durchliefen zusätzlich den gesamten Weg der Plattform: Hochladen der Aufzeichnung → Verarbeitungswarteschlange → Analyse → Ergebnis (13. August 2026).
**Ergebnis.** Im Rahmen des Kriteriums bestätigt. (a) Bei geringem Rauschen wiedergefunden: +6,3 µV bei 336 ms und +6,5 µV bei 355 ms auf zwei frontalen Kanälen, gegenüber der Wahrheit von +6,5 µV bei 350 ms. (b) Negativkontrolle: kein signifikanter Kanal (p zwischen 0,09 und 0,42); auf dem gesamten Weg der Plattform wurde der eingespeiste Effekt auf einem von vier Kanälen erkannt (unkorrigiertes p = 0,015), und die Negativkontrolle ergab keinen signifikanten Kanal (p zwischen 0,28 und 0,89). (c) Lokales Werkzeug und Plattformverarbeitung liefern auf derselben Aufzeichnung identische Zahlen — es ist eine Implementierung, nicht zwei. Nach den Korrekturen aus Richtung 5 verarbeitete die Kette erneut synthetische Aufzeichnungen (23. August 2026); eine vollständige Wiederholung beider Kontrollen mit Vergleich zur Grundwahrheit ist jedoch nicht dokumentiert.
**Randbedingungen.** Bei stirnbandtypischem Rauschen wird ein tatsächlich vorhandener Effekt nur auf einem oder zwei von vier Kanälen signifikant — das ist die realistische Empfindlichkeit einer einzelnen Sitzung. Die Peaklatenz fängt bei wenigen Durchgängen Rauschen ein (bei zehn Epochen lag der Peak bei 441 ms, die Wahrheit bei 350 ms); Hauptmaß ist deshalb die mittlere Amplitude in einem festen Fenster nach dem Reiz, der Peak wird nur ergänzend berichtet. Mit der nach dem Audit eingeführten Holm-Korrektur (Richtung 5) wäre das Ergebnis auf einem Kanal aus dem gesamten Weg der Plattform auf dem Niveau 0,05 nicht mehr signifikant (korrigierter Wert 4 × 0,015 = 0,06).
**Nächster Schritt.** Die Empfindlichkeit einer einzelnen Sitzung unter der korrigierten Statistik quantifizieren — wie oft der bekannte Effekt bei realistischem Rauschen Signifikanz erreicht — und die Negativkontrolle wiederholen; danach die erste Aufzeichnung einer echten Person, gemessen am Kriterium aus dem vorigen Eintrag: ein sichtbares gemitteltes ereigniskorreliertes Potential nach mindestens 30 Wiederholungen.
**Status:** auf synthetischen Daten bestätigt; das Kriterium an echten Daten ist offen — solche Daten gibt es in der Analysedatenbank noch nicht.

### 2. Richtung 2 — Inter-Subjekt-Korrelation an synthetischen Paaren und gemeinsame Sitzungen
**Forschungsfrage.** Unterscheidet das ISC-Maß ein Aufzeichnungspaar mit gemeinsamer, reizgetriebener Modulation von einem Paar ohne sie — bei einer Nullverteilung aus denselben Daten und mit einem Ergebnis, das bei jeder Neuberechnung identisch ist? Und lässt sich eine Dyade überhaupt aufzeichnen: zwei oder mehr Personen, die denselben Film an verschiedenen Orten sehen?
**Stand der Technik (veröffentlicht).** ISC im EEG bei naturalistischen Reizen (Dmochowski et al. 2012; Ki, Kelly, Parra 2016); Surrogatdaten — zyklische Verschiebungen, Phasenrandomisierung (Theiler et al. 1992) — als Nullverteilung; Remote-Hyperscanning als etablierte Strömung der sozialen Neurowissenschaft (voriger Eintrag).
**Erfolgskriterium.** Korreliertes Paar: hohes r und p < 0,05; unkorreliertes Paar: r nahe null und p > 0,05; erneute Berechnung: identisches p.
**Methode.** Synthetische Aufzeichnungen mit und ohne gemeinsame Amplitudenmodulation; Korrelation der Amplitudenhüllkurven zwischen Personen nach Ausrichtung auf den Reiz; p aus zyklischen Verschiebungen.
**Ergebnis.** Auf synthetischen Daten bestätigt (14. August 2026): korreliertes Paar r = 0,93, p = 0,005 (der kleinste mit der verwendeten Zahl von Permutationen erreichbare Wert); Negativkontrolle r = −0,001, p = 0,98. Methodischer Befund: Eine rein periodische Modulation ergibt unter der Nullverteilung aus zyklischen Verschiebungen ein konservatives p, weil diese Nullverteilung die Autokorrelation erhält — eine Eigenschaft korrekter Statistik, kein Fehler; Testsignale müssen spektral reich sein wie ein echter Film. Nach dem Audit (Richtung 5) wurde die Berechnung umgebaut; beide Kontrollen sind Teil der automatischen Tests. Gemeinsame Sitzungen wurden am 14. August 2026 implementiert: gemeinsamer Start von Teilnehmenden an verschiedenen Orten, Zuordnung der Aufzeichnungen zu einem gemeinsamen Termin und ISC für jedes Paar, neu berechnet nach jeder Sitzung.
**Konstruktion (Synchronisation von Start und Uhren zwischen den Orten): zurückgehalten.**
**Randbedingungen.** Das Labor hat ein einziges Stirnband — eine echte Dyade wurde nicht aufgezeichnet, das Hyperscanning-Kriterium aus dem vorigen Eintrag bleibt also ungeprüft. Von den dort genannten Kontrollen sind die zyklischen Verschiebungen umgesetzt; Scheinpaare (Personen, die nie verbunden waren) und die Korrektur für multiples Testen über die Paare hinweg sind noch nicht implementiert.
**Nächster Schritt.** Ein zweites Stirnband und die erste echte Dyade; Scheinpaare und Korrektur über die Paare vor jeder Interpretation eines Ergebnisses.
**Status:** teilweise — Methode auf synthetischen Daten bestätigt, gemeinsame Sitzungen implementiert, Kriterium an echten Dyaden offen.

### 3. Richtung 3 — Reiz: verworfenes generatives Modell und Versatz um ein Einzelbild
**Forschungsfrage.** Die ERP-Mittelung verlangt physisch identische Wiederholungen, die sich nur in der beabsichtigten Dimension unterscheiden, mit Reizbeginn in einem bekannten Einzelbild. Woher kommt ein solcher Reiz — und woher wissen wir, dass das markierte Einzelbild dasjenige ist, in dem der Reiz tatsächlich erscheint?
**Stand der Technik (veröffentlicht).** In der experimentellen Psychologie werden Reize programmgesteuert mit kontrollierten Parametern erzeugt und ihr Timing mit Hardware gemessen (Photodiode), wie in vergleichenden Studien zu Experimentalsoftware (Bridges et al. 2020).
**Erfolgskriterium.** (a) Wiederholungen bildgenau identisch; (b) die Bedingungen unterscheiden sich nur in der beabsichtigten Dimension; (c) jeder markierte Reizbeginn fällt in das Einzelbild, in dem der Reiz zum ersten Mal erscheint — unabhängig vom Generator geprüft; (d) dokumentierte Herkunft und Lizenz, die es erlauben, eine Reizversion über Jahre einzufrieren.
**Methode.** Versuch, einen Reizfilm mit einem generativen Videomodell zu erstellen; unabhängiges Audit jeder Reizversion — ein Programm, das ausschließlich die fertige Videodatei und die Markerliste liest und den Angaben des Generators nicht vertraut.
**Ergebnis.** (1) Generatives Videomodell als Reizquelle verworfen (11. August 2026). Der Grund war nicht ästhetisch, sondern methodisch: Das Modell wiederholt keine Einstellung bildgenau (a); zwischen den Clips ändern sich Leuchtdichte, Kontrast, Bewegung und Tempo, und jeder dieser Parameter ruft für sich eine Hirnantwort hervor (b); ein Ereignis lässt sich nicht für ein bestimmtes Einzelbild bestellen (c); Herkunft und Lizenz des Materials sind, gemessen an der Anforderung, über Jahre einzufrieren, unklar (d). (2) Systematischer Versatz um ein Einzelbild im eigenen Generator — vom unabhängigen Audit entdeckt. Bei einem Teil der Durchgänge lag der Marker ein Einzelbild vor dem Bild, in dem der Reiz tatsächlich erschien; die Latenzen dieser Durchgänge wären um ein Einzelbild, also um einige Dutzend Millisekunden, zu lang ausgefallen — in der Größenordnung der Latenzunterschiede, nach denen wir suchen. In den Reizgeneratoren korrigiert; die derzeit verwendeten Reizversionen des Labors haben dieses Audit vor der Veröffentlichung bestanden.
**Randbedingungen.** Das Audit prüft die Datei, nicht den Bildschirm: Was zwischen Datei und Auge geschieht (Decoder, Compositor, Display), erfasst erst die Hardwaremessung — sie steht noch aus.
**Nächster Schritt.** Messung des Timings der Darbietungskette mit einer Photodiode.
**Status:** negatives Ergebnis (generatives Modell verworfen) sowie eigener Fehler entdeckt und korrigiert.

### 4. Richtung 4 — Signal: Lidschläge statt Durchgangszahl, ICA auf vier Kanälen, Pilotaufzeichnungen
**Forschungsfrage.** Was begrenzt bei vier Trockenelektroden die Erkennbarkeit eines ERP in einer einzelnen Sitzung — die Zahl der Durchgänge oder Artefakte? Funktionieren Standardwerkzeuge der Artefaktentfernung auf vier Kanälen? Und taugen die vorhandenen Pilotaufzeichnungen für ERP?
**Stand der Technik (veröffentlicht).** Augenartefakte dominieren die frontalen Kanäle; ICA ist der Standard zur Entfernung von Lidschlägen bei mehrkanaligem EEG, ihre Trennschärfe hängt jedoch von der Kanalzahl ab; Alternativen sind das Verwerfen von Epochen und die regressionsbasierte Korrektur (Gratton, Coles, Donchin 1983).
**Erfolgskriterium.** Ein Eingriff gilt nur dann als hilfreich, wenn er in der Simulation die Erkennung des bekannten, eingespeisten Effekts verbessert und in der Negativkontrolle keinen Effekt erzeugt. Eine Aufzeichnung gilt nur dann als ERP-tauglich, wenn sie die nominelle Abtastrate hat und Reizmarker trägt, die mit der Darbietung synchronisiert sind.
**Methode.** Die Simulation aus Richtung 1 mit stirnbandtypischem Rauschen und Lidschlägen; variiert wurden die Zahl der Durchgänge, die Verwerfungsschwelle für Epochen und die ICA (ein oder aus). Bei den Pilotaufzeichnungen: Prüfung der effektiven Abtastrate und der Marker.
**Ergebnis.** (1) Hypothese „mehr Durchgänge = bessere Erkennbarkeit" in der Simulation widerlegt: Mehr als die dreifache Zahl von Ereignissen verbesserte die Erkennbarkeit nicht; das gelang erst durch ein strengeres Verwerfen von Epochen, die durch Lidschläge verunreinigt waren. Die Varianz stammt von den Lidschlägen, nicht von der Zahl der Durchgänge — Vorrang haben der Elektrodenkontakt und die Instruktion der Teilnehmenden, nicht ein längerer Reiz. (2) ICA auf vier Kanälen unzuverlässig: In der Simulation trennte sie die Lidschlagkomponente nicht zuverlässig ab; sie bleibt eine Option, die Hauptabwehr ist das Verwerfen von Epochen. (3) Pilotaufzeichnungen für ERP unbrauchbar: Keine trägt Reizmarker, und der jüngste Export aus der Aufnahme-App eines Drittanbieters hatte eine effektive Abtastrate, die um mehr als zwei Größenordnungen unter der nominellen lag — eine Komponente von rund 100 ms passt zwischen zwei Abtastwerte. Solche Dateien taugen höchstens für Bandtrends und die Kontrolle des Elektrodenkontakts, nie für ERP und nie für die Normdatenbank.
**Nächster Schritt.** Regressionsbasierte Lidschlagkorrektur als Alternative zur ICA — geprüft an denselben synthetischen Aufzeichnungen, mit Negativkontrolle.
**Status:** zwei Hypothesen widerlegt, Pilotdaten von ERP ausgeschlossen — negative Ergebnisse, bewusst veröffentlicht.

### 5. Richtung 5 — methodisches Audit: vier Befunde und ihre Korrekturen
**Forschungsfrage.** Tut der Analysecode, was die Methodik behauptet — auch in Fällen, die niemand von Hand getestet hat?
**Stand der Technik (veröffentlicht).** Kontrolle der familienweisen Fehlerrate bei vielen Tests (Holm 1979); Pseudoreplikation, also das Zählen wiederholter Messungen derselben Person als unabhängige Beobachtungen (Hurlbert 1984; Lazic 2010); Reproduzierbarkeit der Berechnung als Anforderung an Permutationstests.
**Erfolgskriterium.** Ein Befund gilt erst dann als geschlossen, wenn die Korrektur im Code steht und ein Regressionstest sie abdeckt.
**Methode.** Ein Audit des Projekts (15. August 2026), das unter anderem den Analysecode und die Methodik umfasste; Korrekturen am folgenden Tag; Regressionstests in der kontinuierlichen Integration; ein zweites Audit (September 2026), das unter anderem prüfte, ob die früheren Befunde geschlossen sind.
**Ergebnis.** Vier methodische Befunde:

1. **Vier Kanäle ohne Korrektur getestet.** Jeder Kanal wurde einzeln bei p < 0,05 bewertet — bei unabhängigen Kanälen sind das rund 18,5 % Wahrscheinlichkeit für mindestens ein falsch positives Ergebnis in einer Sitzung ohne jeden Effekt. Korrektur: Holm-Bonferroni-Verfahren; das rohe p bleibt im Ergebnis, über die Signifikanz entscheidet der korrigierte Wert.
2. **Beschädigte Pakete konnten ein fiktives Signal erzeugen.** Die Validierung ließ Pakete mit fehlerhaften Feldern durch, und große Lücken wurden stillschweigend interpoliert — die Kette konnte Signal „ergänzen", wo keines war. Korrektur: strenge Strukturvalidierung, Ordnen der Pakete und Verwerfen von Duplikaten; eine Aufzeichnung mit einer zusammenhängenden Lücke von mehr als 2 s oder mit mehr als 20 % fehlenden Abtastwerten wird verworfen statt interpoliert.
3. **ISC: gestauchte Zeit und nicht reproduzierbarer Seed.** Die Zeitachse wurde aus aufeinanderfolgenden Paketen zusammengesetzt, sodass Lücken verschwanden und die Achsen zweier Personen mit unterschiedlichen Verlusten gegeneinander verrutschten; der Seed der Permutationen hing von einer in jedem Prozess zufällig initialisierten Hashfunktion ab, sodass sich p bei jeder Neuberechnung änderte. Korrektur (überarbeitete ISC): Zeitachse aus den Sequenznummern mit ausdrücklich gekennzeichneten Lücken; Korrelation ausschließlich auf Fenstern, die bei beiden Personen vorhanden sind; stabiler Seed, mit einer kryptographischen Hashfunktion aus den Kennungen des Paares abgeleitet; Prüfsummen der Eingangsdaten werden mit dem Ergebnis gespeichert.
4. **Norm: Wiederholungen als unabhängige Beobachtungen, fehlende Qualitätskontrolle als bestanden.** Mehrere Sitzungen (und Neuberechnungen) einer Person gingen in die Norm ein, als wären es weitere Personen, und fehlende Kennzahlen der Darbietungsqualität wurden wie ein positives Ergebnis behandelt. Korrektur: ein Ergebnis pro Sitzung und eine Sitzung pro Person in der Referenzgruppe — die Größe der Norm zählt Menschen, nicht Messungen; fehlende Qualitätskontrolle bedeutet Ausschluss.

Nach den Audits wurde auch der Umgang mit Einwilligungen und Löschung korrigiert — bevor es überhaupt Daten echter Teilnehmender gab. Die Korrekturen stehen seit dem 16. August 2026 im Code. Die Befunde 2 und 3 sind durch Regressionstests in der kontinuierlichen Integration abgedeckt (beschädigte, doppelte und vertauschte Pakete, Überlauf des Sequenzzählers, Lücken, Reproduzierbarkeit der ISC und Kennzeichnung von Lücken), und das zweite Audit hat sie als geschlossen bestätigt. Die Korrekturen zu den Befunden 1 und 4 stehen im Code, jedoch ohne eigene Regressionstests; Befund 4 hat das zweite Audit nur als teilweise geschlossen eingestuft: Die Zulassung einer Sitzung zur Norm prüft noch nicht die Geräte- und Firmwareversion und hat keine eigene Schwelle für Paketverluste.
**Nächster Schritt.** Regressionstests für die Befunde 1 und 4; Zulassungsregeln für die Norm, die die Geräte- und Firmwareversion (vgl. Richtung 6 des vorigen Eintrags) und eine Schwelle für Paketverluste umfassen.
**Status:** zwei Befunde geschlossen; zwei im Code korrigiert, aber ohne Regressionstest — davon einer nur teilweise geschlossen.

### 6. Richtung 6 — Norm: nur Amplituden, Latenzen erst nach der Kalibrierung, Perzentil ab N ≥ 20
**Forschungsfrage.** Wann bedeutet eine Zahl vor dem Hintergrund einer Vergleichsgruppe das, was sie nahelegt? Ein Perzentil sieht auch dann wie eine Tatsache aus, wenn die Gruppe aus wenigen Personen besteht oder die gemessene Größe einen konstanten, ungemessenen Versatz trägt.
**Stand der Technik (veröffentlicht).** Testnormen werden gegenüber definierten Referenzgruppen ausreichender Größe berichtet; Latenzmessungen erfordern eine hardwareseitige Prüfung des Reiztimings (Bridges et al. 2020).
**Erfolgskriterium.** Ein Perzentil wird nur gezeigt, wenn (a) die Größe frei von ungemessenen systematischen Versätzen ist und (b) die Referenzgruppe mindestens 20 Personen umfasst.
**Methode.** Die absolute Latenz enthält eine konstante, ungemessene Verzögerung der Kette Bluetooth + Compositor + Bildschirm; Unterschiede zwischen Bedingungen innerhalb einer Sitzung sind davon frei. Daraus folgen drei Regeln: Normiert werden ausschließlich Amplituden; Latenzen bleiben bis zur Hardwaremessung des Timings außerhalb der Norm; bei weniger als 20 Personen in der Referenzgruppe wird statt eines Perzentils die Gruppengröße gezeigt — gezählt in Personen, nicht in Sitzungen (Richtung 5).
**Ergebnis.** Umgesetzt (15. und 16. August 2026) und durch Tests geprüft: Latenzen gelangen nicht in die Norm, und unterhalb der Schwelle erscheint die Gruppengröße statt eines Perzentils. Randbedingung: Die Analysedatenbank enthält noch keine Aufzeichnungen echter Personen, also existiert keine Referenzgruppe — die Regeln gelten, hatten aber noch nichts, worauf sie wirken konnten.
**Nächster Schritt.** Nach der Timingmessung: Entscheidung, ob absolute Latenzen in die Norm aufgenommen werden können — mit offen angegebenem gemessenem Versatz und seiner Streuung.
**Status:** umgesetzt; Regeln in Kraft, an echten Daten noch nicht erprobt.

### Korrekturen zum Eintrag vom 2026-08-12

Der Eintrag vom 2026-08-12 bleibt in der gestempelten Fassung bestehen. Die folgenden Korrekturen ersetzen ihn nicht, sondern berichtigen ihn im Licht dessen, was heute bekannt ist.

- **Richtung 1 (Ereignismarkierung im Browser) — der Status war zu niedrig angesetzt.** Er nannte nur die Akquisition, obwohl am Tag des Eintrags bereits der Weg von der Aufzeichnung bis zum ERP-Ergebnis bestand (im lokalen Analysewerkzeug; auf der Plattform ab dem Folgetag) und am Vortag an einer synthetischen Aufzeichnung mit bekannter Grundwahrheit und Negativkontrolle validiert worden war (Richtung 1 dieses Eintrags). Das ERP-Kriterium an der Aufzeichnung einer echten Person war damals nicht erfüllt und ist es heute nicht. Als Timing-Referenz gilt eine direkte Hardwaremessung der Darbietungskette (Photodiode), die noch aussteht; die im damaligen Kriterium genannte parallele Labor-Pipeline (ein Akquisitionsweg über den Desktop) wurde nicht gebaut.
- **Richtung 2 — die „Hauptlücke" hat sich verschoben.** Der Eintrag nannte als Hauptlücke fehlende Ereignismarker in den Pilotaufzeichnungen. Die Marker waren schon damals nicht der Engpass — jede Aufzeichnung aus dem eigenen Player enthält sie —, und die jüngste Pilotaufzeichnung erwies sich zudem aus einem zweiten, unabhängigen Grund als für ERP unbrauchbar (Richtung 4 dieses Eintrags). Die Hauptlücke sind heute Daten: In der Analysedatenbank gibt es keine Aufzeichnung einer echten Person, es gibt keine Normkohorte, und das Hardwaretiming ist ungemessen.
- **Richtung 3 — gemeinsame Sitzungen.** Der Eintrag gab an: „die Architektur gemeinsamer Sitzungen ist entworfen, die Implementierung nicht begonnen". Das traf am Tag des Eintrags zu und war zwei Tage später überholt: Am 14. August 2026 wurden gemeinsame Sitzungen implementiert (Richtung 2 dieses Eintrags). Das Kriterium jener Richtung bleibt ungeprüft — eine echte Dyade wurde bisher nicht aufgezeichnet.
- **Richtung 5 — Betriebsprotokoll und Einwilligungen.** Der Status beschrieb das Protokoll als „nur anfügend" und Einwilligungen als Ereignisse mit Fassung des Textes. Tatsächlich waren beide Eigenschaften damals schwächer, als die Beschreibung nahelegte: Sie waren Konventionen der Anwendung, keine vom System erzwungenen Garantien. Erzwungen werden sie erst seit den Korrekturen nach den Audits vom August und September 2026. Verankerung und Auflösung des Konflikts mit dem Löschanspruch bleiben offen, wie in jenem Eintrag.
- **Zweckbestimmung — Satz zurückgezogen.** Zurückgezogen wird der Satz aus dem Absatz „Methodik": „Das Werkzeug liefert Information zur Unterstützung der ärztlichen Entscheidung und urteilt nie selbst; der Weg zum Medizinprodukt (MDR) ist bewusst eine eigene, spätere Etappe." Es gilt die Fassung: Die Plattform ist ein Messinstrument für Forschungs- und Wellnesszwecke; sie ist kein Medizinprodukt und liefert keine Informationen für diagnostische oder therapeutische Entscheidungen. Das Wort „Screening" bezeichnet in jenem Eintrag eine Forschungsfrage, keine Anwendung.

**Programmstatus:** aktiv. Die Analysekette ist an synthetischen Daten mit Negativkontrollen validiert, die Befunde des methodischen Audits sind korrigiert (zwei vollständig geschlossen), gemeinsame Sitzungen sind implementiert, die Normregeln sind enger gefasst. Randbedingungen, offen benannt: In der Analysedatenbank gibt es bisher keine Aufzeichnung einer echten Person; das Labor hat ein einziges Stirnband, eine echte Dyade wurde also nicht aufgezeichnet; das Hardwaretiming (Photodiode) ist nicht gemessen; die Akquisition im Browser funktioniert ausschließlich in Chromium-basierten Browsern (Web Bluetooth) — nicht in Firefox, nicht in Safari und nicht auf iPhone oder iPad. Nächste Etappe: die Timingmessung mit einer Photodiode und die ersten Aufzeichnungen echter Personen auf einer eingefrorenen Reizversion.

---
---

# 🇬🇧 ENGLISH VERSION

## Koch Laboratory — validating an EEG analysis chain before the first real recording

This entry continues the "neuro" entry (dated 2026-08-10 in the notebook, stamped in its present wording on 2026-08-12), which set out research directions for cognitive screening on four channels of consumer EEG. That entry said what we are looking for; this one says what was checked before the first person sits down for a measurement intended for the database: whether the analysis chain recovers an effect that was put into it, and whether it produces no effect where there is none. Added to this are negative results on stimulus and signal, the findings of a methodological audit together with their corrections, and design changes at a publishable level. Corrections to the entry of 2026-08-12 are collected at the end; that entry itself remains unchanged.

**Method and intended purpose.** As in the rest of the lab: problem → state of the art → falsifiable criterion → method → result with boundary conditions → next step. "Confirmed" means met within the criterion, "refuted" means tested and rejected with the reason given, "partial" means with the missing part named. Where "Construction: withheld" appears, the technical detail remains unpublished. The platform's intended purpose: a measuring instrument for research and wellness use; it is not a medical device and does not provide information for diagnostic or therapeutic decisions.

### 1. Direction 1 — the ERP chain on synthetic ground truth, with a negative control
**Research question.** How do we know that the analysis chain — from Bluetooth packets through signal reconstruction and epoching to the statistics — finds an event-related potential that is in the data, and reports none where there is none? On a recording of a real person this cannot be checked, because the ground truth there is unknown.
**State of the art (published).** Simulation of event-related activity with known ground truth as a way to validate analysis methods (e.g. SEREEGA, Krol et al. 2018); negative controls as a condition for the credibility of an effect; validation of the consumer headband for ERP research (the Krigolson group).
**Success criterion.** (a) At low noise the chain recovers the injected amplitude and latency; (b) in a recording without an injected response no channel is significant; (c) the same recording yields the same numbers in the local analysis tool and in processing on the platform.
**Method.** The synthetic recordings reproduce the headband's data transport (packets with sequence numbers, variable arrival times, lost packets), plus blinks, alpha rhythm and 50 Hz mains interference. Injected truth: a difference wave of +6.5 µV at a latency of 350 ms between two event classes. The variants with low noise, with noise typical of the headband and with noise alone ran through the local analysis tool (11 August 2026); the recording with a response and the negative control also went through the platform's full path: upload of the recording → processing queue → analysis → result (13 August 2026).
**Result.** Confirmed within the criterion. (a) At low noise, recovered +6.3 µV at 336 ms and +6.5 µV at 355 ms on two frontal channels, against a truth of +6.5 µV at 350 ms. (b) Negative control: no significant channel (p from 0.09 to 0.42); on the platform's full path the injected effect was detected on one channel out of four (uncorrected p = 0.015), and the negative control produced no significant channel (p from 0.28 to 0.89). (c) The local tool and the platform processing give identical numbers on the same recording — it is one implementation, not two. After the corrections from direction 5 the chain processed synthetic recordings again (23 August 2026), but a complete repetition of both controls, with comparison against the ground truth, is not documented.
**Boundary conditions.** At noise typical of the headband, an effect that really is in the data comes out significant on only one or two channels out of four — that is the realistic sensitivity of a single session. Peak latency picks up noise when trials are few (with ten epochs the peak fell at 441 ms against a truth of 350 ms), so the primary measure is the mean amplitude in a fixed post-stimulus window, with the peak reported as auxiliary. Under the Holm correction introduced after the audit (direction 5), the single-channel result from the platform's full path would no longer be significant at the 0.05 level (adjusted value 4 × 0.015 = 0.06).
**Next step.** Quantify the sensitivity of a single session under the corrected statistics — how often the known effect reaches significance at realistic noise — and repeat the negative control; then the first recording of a real person, against the criterion from the previous entry: a visible averaged event-related potential after at least 30 repetitions.
**Status:** confirmed on synthetic data; the criterion on real data is open — there are no such data in the analysis database yet.

### 2. Direction 2 — inter-subject correlation on synthetic pairs, and shared sessions
**Research question.** Does the ISC measure distinguish a pair of recordings with a shared, stimulus-driven modulation from a pair without it — with a null distribution derived from the same data and a result that is identical at every recomputation? And can a dyad be recorded at all: two or more people watching the same film in different places?
**State of the art (published).** ISC in EEG with naturalistic stimuli (Dmochowski et al. 2012; Ki, Kelly, Parra 2016); surrogate data — circular shifts, phase randomisation (Theiler et al. 1992) — as a null distribution; remote hyperscanning as an established current of social neuroscience (previous entry).
**Success criterion.** Correlated pair: high r and p < 0.05; uncorrelated pair: r close to zero and p > 0.05; recomputation: identical p.
**Method.** Synthetic recordings with and without a shared amplitude modulation; correlation of amplitude envelopes between people after alignment to the stimulus; p from circular shifts.
**Result.** Confirmed on synthetic data (14 August 2026): correlated pair r = 0.93, p = 0.005 (the smallest value attainable with the number of permutations used); negative control r = −0.001, p = 0.98. Methodological finding: a purely periodic modulation yields a conservative p under a circular-shift null, because such a null preserves autocorrelation — a property of correct statistics, not a fault; test signals must be spectrally rich, like a real film. After the audit (direction 5) the computation was rebuilt; both controls are part of the automated tests. Shared sessions were implemented on 14 August 2026: a joint start for participants in different places, recordings assigned to a common session slot, and ISC for every pair, recomputed after each session.
**Construction (synchronisation of start and clocks across locations): withheld.**
**Boundary conditions.** The lab has a single headband — no real dyad has been recorded, so the hyperscanning criterion from the previous entry remains untested. Of the controls named in that criterion, circular shifts are in place; sham pairs (people who were never connected) and correction for multiple comparisons across pairs are not yet implemented.
**Next step.** A second headband and the first real dyad; sham pairs and correction across pairs before any interpretation of a result.
**Status:** partial — method confirmed on synthetic data, shared sessions implemented, criterion on real dyads open.

### 3. Direction 3 — the stimulus: a rejected generative model and a one-frame offset
**Research question.** ERP averaging requires physically identical repetitions that differ only in the intended dimension, with stimulus onset in a known frame. Where does such a stimulus come from — and how do we know that the marked frame is the one in which the stimulus actually appears?
**State of the art (published).** In experimental psychology, stimuli are generated programmatically with controlled parameters, and their timing is checked by hardware measurement (photodiode), as in comparative studies of experiment software (Bridges et al. 2020).
**Success criterion.** (a) Repetitions identical to the frame; (b) conditions differ only in the intended dimension; (c) every marked onset falls in the frame in which the stimulus first appears — checked independently of the generator; (d) documented provenance and licence that allow a stimulus version to be frozen for years.
**Method.** An attempt to build a stimulus film with a generative video model; an independent audit of every stimulus version — a program that reads only the finished video file and the marker list and does not trust what the generator declares.
**Result.** (1) Generative video model rejected as a stimulus source (11 August 2026). The reason was not aesthetic but methodological: the model does not repeat a shot to the frame (a); between clips, luminance, contrast, motion and pace change, and each of these parameters evokes a brain response of its own (b); an event cannot be ordered for a specific frame (c); provenance and licence of the material are unclear against the requirement of a freeze lasting years (d). (2) A systematic one-frame offset in our own generator — caught by the independent audit. On part of the trials the marker fell one frame before the frame in which the stimulus actually appeared; the latencies of those trials would have come out one frame — several tens of milliseconds — too long, on the scale of the latency differences we are looking for. Corrected in the stimulus generators; the lab's stimulus versions currently in use passed this audit before publication.
**Boundary conditions.** The audit checks the file, not the screen: what happens between the file and the eye (decoder, compositor, display) is covered only by the hardware measurement — not yet performed.
**Next step.** Measurement of the timing of the presentation chain with a photodiode.
**Status:** negative result (generative model rejected) and an error of our own caught and corrected.

### 4. Direction 4 — the signal: blinks rather than trial count, ICA on four channels, pilot recordings
**Research question.** With four dry electrodes, what limits the detectability of an ERP in a single session — the number of trials or artefacts? Do standard artefact-removal tools work on four channels? And are the existing pilot recordings usable for ERP?
**State of the art (published).** Ocular artefacts dominate the frontal channels; ICA is the standard for removing blinks in multichannel EEG, but its separating power depends on the number of channels; the alternatives are epoch rejection and regression-based correction (Gratton, Coles, Donchin 1983).
**Success criterion.** An intervention counts as helpful only if, in simulation, it improves detection of the known injected effect and produces no effect in the negative control. A recording counts as usable for ERP only if it has the nominal sampling rate and carries stimulus markers synchronised with the presentation.
**Method.** The simulation from direction 1 at noise typical of the headband, with blinks; the number of trials, the epoch rejection threshold and ICA (on or off) were varied. For the pilot recordings — a check of the effective sampling rate and of the markers.
**Result.** (1) The hypothesis "more trials = better detectability" refuted in simulation: more than tripling the number of events did not improve detectability; only stricter rejection of epochs contaminated by blinks did. The variance comes from blinks, not from the trial count — electrode contact and participant instructions take priority, not a longer stimulus. (2) ICA on four channels unreliable: in simulation it did not reliably isolate the blink component; it remains an option, and the main defence is epoch rejection. (3) Pilot recordings unusable for ERP: none carries stimulus markers, and the most recent export from a third-party recording app had an effective sampling rate more than two orders of magnitude below the nominal one — a component lasting about 100 ms fits between two samples. Such files are good at most for band trends and electrode-contact checks, never for ERP and never for the normative database.
**Next step.** Regression-based blink correction as an alternative to ICA — tested on the same synthetic recordings, with a negative control.
**Status:** two hypotheses refuted, pilot data excluded from ERP — negative results, published deliberately.

### 5. Direction 5 — methodological audit: four findings and their corrections
**Research question.** Does the analysis code do what the methodology claims — including in cases nobody tested by hand?
**State of the art (published).** Control of the family-wise error rate across many tests (Holm 1979); pseudoreplication, that is, counting repeated measurements of the same person as independent observations (Hurlbert 1984; Lazic 2010); reproducible computation as a requirement for permutation tests.
**Success criterion.** A finding counts as closed only when the correction is in the code and a regression test covers it.
**Method.** An audit of the project (15 August 2026) that covered, among other things, the analysis code and the methodology; corrections the following day; regression tests in continuous integration; a second audit (September 2026) that checked, among other things, whether the earlier findings are closed.
**Result.** Four methodological findings:

1. **Four channels tested without correction.** Each channel was assessed separately at p < 0.05 — with independent channels, that is about an 18.5% chance of at least one false positive in a session with no effect at all. Correction: the Holm–Bonferroni procedure; the raw p stays in the result, and significance is decided by the adjusted value.
2. **Corrupted packets could produce a fictitious signal.** Validation let through packets with malformed fields, and large gaps were silently interpolated — the chain could "fill in" signal where there was none. Correction: strict structural validation, ordering of packets and discarding of duplicates; a recording with a continuous gap longer than 2 s or with more than 20% of samples missing is rejected rather than interpolated.
3. **ISC: compressed time and a non-repeatable seed.** The time axis was assembled from consecutive packets, so gaps vanished and the axes of two people with different losses slid against each other; the permutation seed depended on a hash function randomised in every process, so p changed at every recomputation. Correction (revised ISC): time axis from the sequence numbers, with gaps explicitly marked; correlation only on windows present for both people; a stable seed derived from the pair's identifiers with a cryptographic hash function; hashes of the input data stored with the result.
4. **The norm: repetitions as independent observations, missing quality control as a pass.** Several sessions (and recomputations) of one person entered the norm as if they were further people, and missing presentation-quality metrics were treated as a positive result. Correction: one result per session and one session per person in the reference group — the size of the norm counts people, not measurements; missing quality control means exclusion.

After the audits, the handling of consent and deletion was also corrected — before any data of real participants existed. The corrections went into the code on 16 August 2026. Findings 2 and 3 are covered by regression tests in continuous integration (corrupted, duplicated and out-of-order packets, wrap-around of the sequence counter, gaps, ISC reproducibility and gap marking), and the second audit confirmed them as closed. The corrections for findings 1 and 4 are in the code but without dedicated regression tests; the second audit rated finding 4 as only partially closed: admission of a session to the norm does not yet check the device and firmware version and has no packet-loss threshold of its own.
**Next step.** Regression tests for findings 1 and 4; admission rules for the norm that cover the device and firmware version (cf. direction 6 of the previous entry) and a packet-loss threshold.
**Status:** two findings closed; two corrected in the code but without a regression test — one of them only partially closed.

### 6. Direction 6 — the norm: amplitudes only, latencies after calibration, percentiles from N ≥ 20
**Research question.** When does a number shown against a comparison group mean what it suggests? A percentile looks like a fact even when the group consists of a few people, or when the measured quantity carries a constant, unmeasured offset.
**State of the art (published).** Test norms are reported against defined reference groups of sufficient size; latency measurements require hardware verification of stimulus timing (Bridges et al. 2020).
**Success criterion.** A percentile is shown only if (a) the quantity is free of unmeasured systematic offsets and (b) the reference group contains at least 20 people.
**Method.** Absolute latency contains a constant, unmeasured delay of the chain Bluetooth + compositor + screen; differences between conditions within one session are free of it. Hence three rules: only amplitudes are normed; latencies stay out of the norm until the hardware timing measurement; with fewer than 20 people in the reference group the group size is shown instead of a percentile — counted in people, not in sessions (direction 5).
**Result.** Implemented (15 and 16 August 2026) and checked by tests: latencies do not enter the norm, and below the threshold the group size appears instead of a percentile. Boundary condition: the analysis database contains no recordings of real people yet, so no reference group exists — the rules are in force but have not yet had anything to act on.
**Next step.** After the timing measurement: a decision on whether absolute latencies can enter the norm — with the measured offset and its spread stated openly.
**Status:** implemented; rules in force, not yet exercised on real data.

### Corrections to the entry of 2026-08-12

The entry of 2026-08-12 stands in the wording in which it was stamped. The corrections below do not replace it; they correct it in the light of what is known today.

- **Direction 1 (event marking in the browser) — the status was understated.** It listed only acquisition, although on the day of the entry the path from recording to ERP result already existed (in the local analysis tool; on the platform from the following day) and had been validated the day before on a synthetic recording with known ground truth and a negative control (direction 1 of this entry). The ERP criterion on a recording of a real person was not met then and is not met today. The timing reference is a direct hardware measurement of the presentation chain (photodiode), not yet performed; the parallel laboratory pipeline named in that criterion (a desktop acquisition path) was not built.
- **Direction 2 — the "main gap" has moved.** The entry named the lack of event markers in the pilot recordings as the main gap. The markers were no longer the bottleneck even then — every recording from our own player contains them — and the most recent pilot recording also proved unusable for ERP for a second, independent reason (direction 4 of this entry). The main gap today is data: there is no recording of a real person in the analysis database, there is no normative cohort, and hardware timing remains unmeasured.
- **Direction 3 — shared sessions.** The entry stated: "the shared-session architecture is designed, implementation not started". That was true on the day of the entry and was out of date two days later: shared sessions were implemented on 14 August 2026 (direction 2 of this entry). The criterion of that direction remains untested — no real dyad has been recorded so far.
- **Direction 5 — operations log and consents.** The status described the log as "append-only" and consents as events carrying the version of the text. In reality both properties were weaker at the time than the description suggested: they were conventions of the application, not guarantees enforced by the system. They have been enforced only since the corrections that followed the audits of August and September 2026. Anchoring and the resolution of the conflict with the right to erasure remain open, as in that entry.
- **Intended purpose — sentence withdrawn.** We withdraw the sentence from the "Method" paragraph: "the tool provides information supporting a physician's decision and never adjudicates; the medical-device path (MDR) is deliberately a separate, later stage". The wording that applies: the platform is a measuring instrument for research and wellness use; it is not a medical device and does not provide information for diagnostic or therapeutic decisions. The word "screening" in that entry denotes a research question, not a use.

**Program status:** active. The analysis chain is validated on synthetic data with negative controls, the findings of the methodological audit are corrected (two fully closed), shared sessions are implemented, and the rules of the norm are narrowed. Boundary conditions, stated plainly: there is so far no recording of a real person in the analysis database; the lab has a single headband, so no real dyad has been recorded; hardware timing (photodiode) has not been measured; browser acquisition works only in Chromium-based browsers (Web Bluetooth) — not in Firefox, not in Safari and not on iPhone or iPad. Next stage: the timing measurement with a photodiode and the first recordings of real people on a frozen stimulus version.
