Foundation Models · Self-supervised · Kopf-CT

Weniger Bias, besserer Transfer?

Eine KI für alles Mögliche, trainiert nur auf Alltagsfotos, hat nie ein medizinisches Bild gesehen — und liest trotzdem ein Hirn-CT erstaunlich gut. Die eigentliche Frage ist also: Was macht das möglich? Die Antwort war nicht das, worauf ich gewettet hatte.

Illustration: eine KI, die auf Alltagsfotos trainiert wurde, trifft auf einen Hirnscan
Eine KI, die nur aus Alltagsfotos gelernt hat — Katzen, Autos, Landschaften — trifft auf einen Hirnscan, für den sie nie trainiert wurde. (Illustration.)
≈0,94AUC „Blutung ja/nein" — eingefroren und ab Werk, ohne medizinisches Training (0,5 = Zufall, 1,0 = perfekt)
~50annotierte Scans schlagen bereits den Zufall — das Regime seltener Befunde
+0,013Satellit schlägt Web-Vortraining, gleiches Modell — was es gelernt hat schlägt wie
0,955bestes Ergebnis — aus der Auswahl der richtigen wenigen Modelle, nicht aus dem Zusammenwerfen aller

Eine illustrative Demonstration auf öffentlichen, unvollkommenen Daten (RSNA-ICH 2019). Sie zeigt, was die Methode kann — sie ist kein klinisches Produkt und erhebt keinen klinischen oder regulatorischen (MDR) Anspruch.

Überblick (4 Min): warum es wichtig ist, warum es funktioniert und was standhielt — in einfacher Sprache. Zu jedem Kapitel unten gibt es außerdem ein kurzes Video.
Grundlagen

Zuerst die Grundlagen: wie diese KIs sehen lernen

Alles Weitere ruht auf drei Ideen: wie ein Modell ohne Etiketten lernt, wie viel menschliche Annahme jeder Lernstil einbaut (sein Inductive Bias) und der Testaufbau mit eingefrorenem Encoder. Die Drei-Minuten-Fassung — als Video oder hier zum Lesen.

Grundlagen (~4 Min): selbstüberwachtes Lernen, Inductive Bias, der Farb-Bias und der Testaufbau — in einfacher Sprache.
Zum Ausklappen: der Testaufbau, die CT-Fenster und die drei Lernstile

Der Test in einfachen Worten: der Künstler und die Medizinstudentin

Man stelle sich die KI als Künstler mit einem außergewöhnlichen Auge vor, der Millionen Bilder studiert hat — Katzen, Autos, Landschaften. Wir bitten ihn nicht um eine Diagnose. Wir geben ihm einen Hirnscan und eine einzige Anweisung: „Schreib in deiner eigenen Kurzschrift auf, was dir auffällt — jede Kante, Textur, jeden hellen Fleck, jede Asymmetrie." Er weiß nicht, was eine Blutung ist; er beschreibt nur, was da ist, jedes Mal auf dieselbe sorgfältige Weise. Diese Notizen sind seine Lesart des Scans.

Dann kommt eine Medizinstudentin im ersten Jahr dazu, die den Scan nie sieht — sie liest nur die Notizen des Künstlers. Aus einem Stapel alter Fälle (die Notizen plus die bekannte Antwort) lernt sie, welche Kritzeleien typischerweise mit „Blutung" einhergehen. Das ist das Einzige, was wir trainieren, und es dauert Minuten. Der eigentliche Test lautet also: Wie gut sind die Notizen des Künstlers? Und weil wir den Künstler nie umlernen (er bleibt eingefroren), ist der Vergleich zwischen den Künstlern fair, und die Studentin braucht nur eine Handvoll Beispiele.

CT slice 3 windows greyscale FROZEN encoder Its “notes” (fixed) Tiny classifier per window → avg Score
Jedes klinische Fenster wird einzeln gelesen, in Graustufen; nur die kleinen Klassifikatoren pro Fenster werden trainiert (Sekunden bis Minuten), ihre Stimmen werden gemittelt. Die große KI bleibt eingefroren — wir messen, wie gut ihre Notizen „ab Werk" für Hirn-CT sind.
Der Aufbau in einer Tabelle
ZutatWahl
DatenRSNA Hirn-CT (2019, öffentlich) — ~752.000 Schnitte, 21.744 Patienten
Verwendete Schnitte~187.000 — etwa ein Viertel des Datensatzes (eine Stichprobe, nicht der ganze Satz)
FrageLiegt eine Hirnblutung vor? — plus der Wettbewerbs-Score über sechs Kategorien
Vorverarbeitung3 klinische „Helligkeitsfenster" (Hirn / subdural / Knochen), jedes als eigenes Graustufenbild
Die KI-ModelleEingefroren — DINOv2, DINOv3, I-JEPA, ResNet, ConvNeXt — plus zwei „Außenseiter": ein Vision-Language-Modell (Qwen) und ein Dokument-Encoder (Donut)
Was wir trainierenEine logistische Regression pro Fenster auf den eingefrorenen „Notizen" — dann die drei gemittelt
FairnessGetrennt nach Patienten (kein Leakage), fester Zufalls-Seed

Was ein „Fenster" wirklich ist — selbst ausprobieren

Ein CT speichert keine Helligkeit, sondern Dichte in Hounsfield-Einheiten (HU), von Luft (−1000) bis dichtem Knochen (+2000 und mehr). Ein Bildschirm kann nicht 4.000 Abstufungen auf einmal zeigen, also wählt man ein Fenster — einen Ausschnitt der HU-Skala, gedehnt auf vollen Schwarz-Weiß-Kontrast. Der Haken: graue Substanz, weiße Substanz und frisches Blut — die ganze Frage in einem Kopf-CT — liegen in einem nur ~70 HU schmalen Streifen dieser 4.000-HU-Skala. Verschieb das Fenster unten und beobachte, was auftaucht und verschwindet:

Interactive — CT windowing: move the window across the density scale
blood
-100 -50 0 50 100 150 HU → fat CSF white m. gray m. blood calcif.

Schematic phantom, not a patient scan (the dataset licence forbids patient images). The brightness of every region is the real windowing transform — screen value = (HU − window-low) / width — applied to real tissue densities. The window (orange band on the scale) is the sliver of the 4,000-HU range stretched to full black-to-white; everything below it turns black, everything above turns white. Picking where to place it is a human choice — which is exactly why the article asks whether a few standard windows read all the signal.

Drei Arten, einer KI das Sehen beizubringen (plus ein Außenseiter)

Jeder Lernstil hinterlässt einen anderen Fingerabdruck menschlicher Annahmen im Modell — wie viel jemand vorab festgelegt hat, was zählt. Dieser Fingerabdruck, der Inductive Bias, ist die Achse, um die sich das ganze Experiment dreht.

1 · Supervised (denk „ResNet"): Zeig dem Netz Millionen Bilder, jedes von einem Menschen mit einer von 1000 Kategorien beschriftet, und trainiere es, die Kategorie zu erraten. Menschlicher Fingerabdruck: schwer — die Liste der Kategorien entscheidet, was das Modell für „wichtig" hält. Ein Katze-gegen-Hund-Detektor lernt, was Katzen von Hunden trennt — nicht, wie eine Hirnblutung aussieht.

Image CNN(ResNet) 1000 classscores Compare tothe answer Human label e.g. “cat”
Supervised. Menschliche Etiketten treiben das Training — die Kategorienliste entscheidet, was zählt.

2 · Self-Distillation (die „DINO"-Familie — DINOv2, DINOv3): keine Etiketten. Zeig dem Modell zwei verzerrte Varianten desselben Bildes — anders zugeschnitten, in der Farbe verschoben — und trainiere es, für beide dieselbe innere Beschreibung zu erzeugen. Menschlicher Fingerabdruck: mittel — die Annahmen stecken in den Verzerrungen. „Farbe ist egal" ist eine gute Regel für Fotos, aber im CT ist die Helligkeit das medizinische Signal. Dieses eingebaute „Farbe ist egal" nennen wir später den Farb-Bias.

Image View A crop + colour View B other distortion Student Teacher avg. student Make bothmatch
DINO (Self-Distillation). Keine Etiketten — zwei verzerrte Ansichten eines Bildes müssen dieselbe Beschreibung ergeben.

3 · I-JEPA — der vorhersagebasierte Stil. Keine Etiketten, keine Farb-Tricks. Es verdeckt einen Teil des Bildes und lässt das Modell die innere Beschreibung des verdeckten Teils aus dem Sichtbaren vorhersagen — im „Kopf", nicht als Pixel. Menschlicher Fingerabdruck: leicht. Weil es am wenigsten einbaut, ist es der natürliche Kandidat für die Wette, auf die wir am Ende kommen.

Image in patches Visible context Hidden target Encoder Predictor Compare in the “mind”
I-JEPA (vorhersagebasiert). Die Bedeutung des verdeckten Teils aus dem sichtbaren Kontext vorhersagen — im Repräsentationsraum, nicht in Pixeln.

4 · Language-Supervised (ein multimodales Modell wie Qwen): ein großes Sprachmodell mit angebautem Vision-Encoder, trainiert auf Bild-Text-Paaren, bis es zwischen Bild und beschreibenden Worten wechseln kann. Menschlicher Fingerabdruck: schwer — aber aus Sprache. Fachfremd für rohe CT-Textur, trägt aber etwas, das keiner der anderen hat: es verbindet Bilder mit Text. Für die Bias-Frage kein direkter Gegner — es taucht in Kapitel 2 als bewusster Außenseiter auf.

StilBraucht Menschen-Annotationen?Lernt durch…Eingebaute Annahmen
Supervised (ResNet)JaVorhersage des AnnotationenSchwer
DINO (Self-Distillation)NeinAbgleich verzerrter AnsichtenMittel
I-JEPA (vorhersagebasiert)NeinVorhersage verdeckter BedeutungLeicht
Language-Supervised (VLM)Nein (nutzt Captions)Abgleich Bild zu WortSchwer — sprachlich

Eine Anmerkung für technisch Neugierige: I-JEPA ist eine Joint-Embedding Predictive Architecture — nicht autoregressiv und ohne Pixel-Rekonstruktion; es sagt Repräsentationen verdeckter Regionen voraus. DINO ist eine Invarianz- bzw. Self-Distillation-Methode, keine generative.

Also — mit eingefrorenem Künstler und in Minuten trainierter Studentin: funktioniert es überhaupt?

Finding 01

Eine KI, die nur Alltagsfotos kennt, erkennt Hirnblutungen — eingefroren, ohne jedes medizinische Training.

Die großen Modelle einfrieren, jedes den CT-Schnitt 'lesen' lassen und nur einen winzigen Klassifikator auf den Notizen trainieren. Selbst so erreichen die besten selbstüberwachten Modelle rund 0,94 AUC bei 'Blutung ja/nein' — ein glaubwürdiger Startpunkt für medizinische Bildgebung in Stunden, nicht Monaten.

≈0,94 AUC eingefroren · winziger Klassifikator in Minuten trainiert · getrennt nach Patienten, fester Seed
In der Tiefe: das Ergebnis, und wie wenig dafür nötig ist
Detailvideo (Kapitel 1) — die Kernaussage plus die Methode dahinter, ~90 s.

Es funktioniert, und das ist der überraschende Teil. Mit dem Aufbau aus den Grundlagen — ein eingefrorener Encoder plus ein winziger Klassifikator pro Fenster — erreichen die besten Modelle ab Werk rund 0,94 AUC bei der schlichten Frage „liegt eine Blutung vor?". Kein Fine-Tuning, kein medizinisches Vortraining; das große Modell lernt nicht einmal, was eine Blutung ist. Es beschreibt nur den Schnitt, und eine logistische Regression auf diesen Beschreibungen erledigt den Rest.

Bemerkenswert ist, wie wenig dafür nötig ist. Die großen Modelle bleiben eingefroren, es gibt also kein teures Umtrainieren; nur der kleine Klassifikator lernt, in Minuten. Eine brauchbare Ausgangsbasis steht in Stunden, nicht Monaten. Die naheliegende nächste Frage — und der Rest dieses Artikels — ist, was diesen Wert eigentlich antreibt.

Es funktioniert — aber was macht es aus? Drei Hebel, der größte zuerst.

Finding 02

Was ein Modell gelernt hat, schlägt das Wie: ein satellitentrainierter Zwilling liest Hirn-CT besser als sein web-trainiertes Double.

Der größte Hebel ist nicht das Trainingsrezept — es ist die Welt, aus der das Modell gelernt hat. Ein dokument-trainierter Encoder scheitert am Hirn-CT; ein breit trainiertes Vision-Language-Modell kommt fast an die Foto-Modelle heran; und — der sauberste Schnitt — dieselbe DINOv3-Architektur, auf Satellitenbildern vortrainiert, schlägt ihren Web-Foto-Zwilling um +0,013 AUC, über jeden Datensatz-Ausschnitt, den wir probiert haben.

DINOv3 ViT-L, eingefroren, native Auflösung: Web 0,930 vs. Satellit 0,943
In der Tiefe: die Außenseiter, der saubere Zwillingstest und die Größen-'Skyline'
Detailvideo (Kapitel 2) — die Kernaussage plus die Methode dahinter, ~90 s.

Wenn es auf die Notizen ankommt, dann sollte zählen, was der Künstler vorher studiert hat — mehr als der genaue Stil, in dem er studiert hat. Um das zu prüfen, zwei bewusste Außenseiter, Encoder für etwas ganz anderes, auf einem Ausschnitt von 40.000 Schnitten: Qwen, ein Vision-Language-Modell, und Donut, ein Encoder zum Lesen gescannter Dokumente.

ModellVortrainiert aufAUC (40k-Ausschnitt, eingefroren)
DINOv2-giantAlltagsfotos (selbstüberwacht)0,926
Qwen (Vision-Language)Webbilder und ihre Captions0,916
Donutgescannte Dokumente0,806

Der Dokumentleser ist klar der schwächste — seine Welt (Text auf Papier) liegt einfach zu weit vom CT weg. Bemerkenswerter: das Vision-Language-Modell kommt bis auf ~0,010 an das beste foto-trainierte Modell heran, obwohl es nie als reines Bildmodell gebaut wurde.

Qwen und Donut unterscheiden sich auch in Größe und Architektur, es ist also kein sauberer Schnitt. DINOv3 erlaubt den sauberen: dieselbe Architektur, dieselbe Größe, auf zwei verschiedenen Welten vortrainiert. Die Satelliten-Version gewinnt um +0,013 — und das über jeden Ausschnitt. Warum sollte ein Modell, das die Erde aus dem Orbit studiert hat, einen Hirnscan besser lesen als eines, das Katzen und Autos studiert hat? Eine plausible Lesart, eine Hypothese: Satellitenbilder liegen näher an einem CT-Schnitt als ein Foto — weitgehend Graustufen, textur- und kantendominiert, flache Querschnitte, keine Farb-und-Objekt-Semantik von Alltagsfotos.

Größer lohnt sich nicht immer (bei diesem Budget)

Pareto-Skyline: AUC gegen Modellgröße in Millionen Parametern, log-Skala, für alle eingefrorenen Encoder
Jeder Punkt ist ein eingefrorenes Modell. Die gestrichelte Linie ist die „Skyline" — die beste Genauigkeit, die man bei jeder Größe bekommt. Ein kleines selbstüberwachtes ResNet-50 (26M Parameter, 0,925, grün) liegt darauf und erreicht I-JEPA-H/16 — ein Modell mit dem 25-Fachen seiner Größe.

Ein Vorbehalt: Diese Skyline ist eine Momentaufnahme bei festem Rechenbudget, keine Aussage über Skalierung. Wir trainieren nur eine kleine Probe auf eingefrorenen Features, also überanpassen die höherdimensionalen Notizen eines größeren Modells diese Probe stärker — umso mehr, je weniger Daten man nutzt. Der allergrößte Encoder (7B Parameter) lief aus Budgetgründen nur auf einem kleinen Teil der Schnitte. Lies die Position der großen Modelle als unser Budget, nicht als ihre Obergrenze.

Finding 03

Verschiedene Lernstile sehen Verschiedenes — deshalb schlägt eine gezielt gewählte Handvoll das Zusammenwerfen aller.

Kein einzelnes Modell gewinnt allein, und keines ist überflüssig: verschiedene Modelle machen wirklich verschiedene Fehler, also fängt ein kleines, kuratiertes Ensemble Signal ein, das keines allein sieht: 0,935 (bestes Einzelmodell) → 0,941 (sechs Modelle) → 0,952 (plus 3D-Kontext) → 0,955 (gezielte Auswahl über Modelle, Fenster und Kontext).

0,935 → 0,955 AUC — jeder Gewinn auf Validierung gewählt, einmal auf Held-out-Test gemessen
In der Tiefe: das Ensemble, wählen statt zusammenkippen, und wo das vorhersagebasierte Modell punktet
Detailvideo (Kapitel 3) — die Kernaussage plus die Methode dahinter, ~90 s.

Alles zusammenzuwerfen ist der falsche Reflex. Das beste Ensemble ist eine kuratierte, vielfältige Handvoll von sechs — alle ~20 Modelle hineinzuwerfen ist leicht schlechter (0,934): die schwächeren Supervised-CNNs verwässern nur den gleichgewichteten Mittelwert. Dasselbe gilt eine Ebene höher: alle ~240 Kandidaten zusammenzuwerfen (jedes Modell, beide Auflösungen, jedes Fenster, mit und ohne Nachbar-Kontext) landet bei 0,946 — nicht besser als die Handvoll. Was funktioniert, ist zu wählen: eine greedy Auswahl, auf einem Validierungs-Split zusammengestellt und einmal auf einem unberührten Test-Split gemessen, erreicht 0,955 AUC (+0,009 gegenüber dem Zusammenwerfen, 95%-KI klar über null). Sie behält 63 von ~240 Kandidaten und entdeckt jeden Hebel dieses Artikels auf einmal wieder.

Zerlegung des gewählten Ensembles: Stimmanteile je Modell, gefärbt nach Fenster, und die Aufteilung über Auflösungen und Nachbar-Kontext
Das gewählte Ensemble, zerlegt. Links — der Stimmanteil jedes Modells, gefärbt nach Fenster: das Satelliten-DINOv3-L ist das Rückgrat (~45%), die DINOv2-Familie füllt auf, die schwachen CNNs fallen fast raus. Die schmalen Blut- und Schlaganfall-Fenster nehmen etwa ein Drittel des Gewichts. Rechts — die Auswahl streut über beide Auflösungen und behält bei rund drei Vierteln ihrer Mitglieder den Nachbar-Kontext. Sie wählte nicht „mehr", sondern eine vielfältige, komplementäre Handvoll.

Zwei weitere Hebel brauchten gar kein Nachtrainieren. Zwei schmale Fenster hinzuzufügen — eines auf dem feinen Grau-Weiß-Band, eines auf dem Frischblut-Band — bringt einen kleinen, aber statistisch bedeutsamen Zuwachs (+0,004 Held-out). 3D-Kontext — jeder Schnitt borgt sich die gemittelten Notizen seiner Nachbarn, da eine Blutung meist über mehrere benachbarte Schnitte reicht — bringt deutlich mehr (+0,012, ebenfalls signifikant).

Und etwas fast Poetisches fällt aus der Zerlegung. Sortiert man das Gewicht jedes Modells nach Fenster, spaltet sich das Ensemble entlang der Inductive-Bias-Achse aus den Grundlagen. Die Supervised-CNNs tragen nur über die breiten klinischen Fenster bei (0% aus den schmalen). Das bias-arme I-JEPA ist das Spiegelbild: ~95% seines Beitrags fließen durch die schmalen Blut- und Schlaganfall-Fenster (79% allein aus Blut). DINO liegt dazwischen. In einem Satz: je leichter die eingebauten Annahmen eines Modells, desto mehr liegt sein einzigartiger Wert in der scharfen, lokalen „ist hier ein heller Fleck?"-Sicht. Merk dir das — es ist der erste Hinweis, dass „bias-arm" etwas Spezifisches bringt, auch wenn es nicht allein gewinnt.

Eine Hypothese, was hier passiert

I-JEPA lernt, den verdeckten Teil eines Bildes aus seiner Umgebung vorherzusagen — „was gehört hierher, gegeben der Kontext?" — und trainiert ohne Farb- oder Kontrast-Tricks. Es sollte also ungewöhnlich wach für eine Region sein, die von dem abweicht, was ihre Nachbarschaft vorhersagt, und es behält den rohen Kontrast, statt ihn wegzulernen. Das schmale Blutfenster ist genau diese Situation: alles flach abgeschnitten, außer einem hellen Fleck frischen Bluts, der aus einem gleichmäßigen Feld heraussticht. DINOs Stärke — Invarianz gegen Aussehen, Zuschnitt und Farbe — passt dagegen zu den breiten, texturreichen Fenstern. Wenn das hält, hieß „weniger Inductive Bias" nie „besser" — es hieß komplementär. Das Naheliegende, das man als Nächstes testen sollte.

Methodik-Notiz. Jeder Gewinn hier wird auf Validierung gewählt und einmal auf einem Held-out-Test berichtet, mit patientenweisen Bootstrap-Konfidenzintervallen. Das sind Out-of-Sample-Gewinne, keine auf dem Testset getunten Zahlen — und diese Disziplin zu benennen ist der Punkt: sie macht kleine, echte Unterschiede vertrauenswürdig.

Finding 04

Rund 50 annotierte Scans schlagen bereits den Zufall — das Regime seltener Befunde ist machbar.

Der dritte Hebel ist, wie wenig man braucht. In der Medizin ist die drängende Frage oft das Gegenteil von Big Data: für einen seltenen Befund hat man vielleicht nur eine Handvoll annotierter Fälle. Mit eingefrorenen Features landen ~50 Beispiele bei ~0,74 AUC, ein paar hundert erreichen ~0,84, und die Kurve flacht nach einigen Zehntausend ab.

50 Annotationen → 0,74 · 500 → 0,84 · 1.000 → 0,86 · 133.000 → 0,935
In der Tiefe: die Few-Shot-Kurve und ihr Vorbehalt
Detailvideo (Kapitel 4) — die Kernaussage plus die Methode dahinter, ~90 s.
AUC gegen Anzahl annotierter Beispiele von 50 bis 133.000 für DINOv2-giant und I-JEPA g/16
Publizierte AUC für die zwei Kern-Backbones, von 50 bis 133.000 annotierten Beispielen (eingefrorenes Backbone + winzige Probe, gemittelt über viele Zufallsziehungen). Gepunktete Linien markieren 50 / 100 / 500 — die Kurve liegt schon im Bereich weniger hundert deutlich über dem Zufall und flacht nach einigen Zehntausend ab.

Deshalb unterscheidet sich unser Viertel des Datensatzes kaum von der Nutzung aller Daten — und deshalb ist ein brandneuer Befund mit nur ein paar hundert Annotationen mit eingefrorenen Features nicht hoffnungslos.

Vorbehalt

Wie weit das trägt, hängt davon ab, wie auffällig der Befund ist. Eine Hirnblutung ist relativ sichtbar; ein subtiler Befund bräuchte mehr Beispiele. Der Weg ist immer, es an den eigenen wenigen Beispielen zu testen — genau wie hier.

Finding 05

Nicht eine Blutung, sondern fünf — unterschieden bei 0,92–0,98 AUC, und der Typ entscheidet, was als Nächstes passiert.

Dieselben eingefrorenen Notizen tragen mehr als 'Blutung ja/nein'. Jeder Schnitt ist für fünf Blutungstypen annotiert, mehrere können gemeinsam auftreten, also ist es ein Multi-Annotation-Problem: ein winziger Klassifikator pro Typ. Die Reihenfolge ist klinisch sinnvoll — dichte, gut lokalisierte Blutungen sind am leichtesten; die dünne, diffuse Subarachnoidalblutung ist der schwerste häufige Typ.

Intraventrikulär 0,976 · intraparenchymal 0,963 · subdural 0,944 · subarachnoidal 0,932 · epidural 0,916 (selten, verrauscht)
In der Tiefe: Ergebnisse pro Typ, Behandlungspfade und der Abstand zum 2019er-Gewinner
Detailvideo (Kapitel 5) — die Kernaussage plus die Methode dahinter, ~90 s.
Erkennungs-AUC pro Typ für die fünf Blutungstypen, eingefrorenes gewähltes Ensemble
Erkennung pro Typ, eingefrorenes gewähltes Ensemble, one-vs-rest, patientenweise getrennter Test. Epidural ist selten (0,4% der Schnitte), daher ist die Zahl verrauscht. Ein separates Ensemble pro Typ zu tunen brachte nichts — ein vielfältiges Ensemble ist bereits nahezu optimal, also übertreiben wir es nicht.

Warum der Typ zählt — nicht nur, dass Blut da ist

Die fünf Typen verzweigen sich in verschiedene Behandlungspfade: ein anderer Arzt anzurufen, eine andere Untersuchung als Nächstes, ein anderer Raum vorzubereiten.

TypWas er typischerweise auslöst
Epiduralarteriell, kann schnell entgleisen → neurochirurgische Ausräumung (OP)
Akut subduralRaumforderung → neurochirurgische Ausräumung (OP)
Subarachnoidalmeist aneurysmatisch → CT-Angiografie, dann Coiling / Clipping; oft eine Verlegung
IntraventrikulärHydrozephalus-Risiko → Ventrikeldrainage
IntraparenchymalBlutdruckkontrolle, Aufhebung der Antikoagulation, Intensivmedizin

Der Typ, nicht nur das Vorhandensein von Blut, entscheidet also, was als Nächstes passiert — ihn innerhalb von Sekunden nach dem Scan zu kennen, lässt den richtigen Pfad früh statt erst nach der Befundung beginnen.

Der Realitätscheck: wie weit von den Experten?

Der Wettbewerb 2019 wurde mit einem schwer engineerten System gewonnen: drei feinabgestimmte CNN-Architekturen, über Kreuzvalidierungs-Folds gemischt, zwei Sequenzmodelle, die Kontext über Schnitte lesen, plus Test-Time-Augmentation. Unser schneller, eingefrorener Ansatz landet bei rund dem 2,6-Fachen des Fehlers des Gewinners — weit von der Spitze, erreicht mit einem Bruchteil des Aufwands. Dieser Abstand ist im Log-Loss; beim reinen Ranking (sortiert es Blutungen über Nicht-Blutungen?) ist unser Ensemble bereits stark (~0,95 AUC). Der Rückstand ist vor allem Fähigkeit (Fine-Tuning), nicht Kalibrierung: die Konfidenz im Nachhinein anzupassen verschiebt den Wert nur um ~0,001.

Log-Loss vom einzelnen eingefrorenen Modell bis zum Ensemble mit 3D-Kontext, mit dem 2019er-Wettbewerbsgewinner als Maßstab
Von einem einzelnen eingefrorenen Modell bis zu einem kleinen Ensemble mit 3D-Kontext — und der vollständig engineerte 2019er-Gewinner als Maßstab. Niedriger ist besser. Auf unserem eigenen patientenweise getrennten Split gemessen, nicht auf dem privaten Testset des Wettbewerbs — ein Größenvergleich, kein Ranking.

Eine Erwartung aber hielt den Daten nicht stand — die Wette, die wir in den Grundlagen aufgestellt haben.

Finding 06

Die Wette — „weniger Bias heißt besserer Transfer“ — ging nicht auf: DINO bleibt vor I-JEPA.

Erinnern wir uns an die naheliegende Erwartung: weil I-JEPA am wenigsten menschliche Annahme einbaut, sollte es sich am besten an eine nie gesehene Domäne anpassen. Vernünftig, durch die Literatur gestützt — und nicht das, was geschah. Die besten drei eingefrorenen Modelle sind alle DINO; I-JEPA liegt knapp dahinter.

DINOv2-giant 0,935 · I-JEPA g/16 0,928 — die starke Form der Hypothese fällt
In der Tiefe: die Tabelle, warum der Farb-Bias nicht griff, und der eine saubere Sieg
Detailvideo (Kapitel 6) — die Kernaussage plus die Methode dahinter, ~90 s.

Wir haben gerade gesehen, wie I-JEPA im Ensemble seinen Beitrag leistet, besonders im schmalen Blutfenster. Aber die Wette aus den Grundlagen war stärker als das: das annahmen-ärmste Modell sollte klar gewinnen. Tat es nicht.

Die Wette (vor dem Test formuliert)

Weil I-JEPA am wenigsten menschliche Annahme einbaut, sollte es sich besser an Domänen anpassen, für die es nie trainiert wurde — etwa medizinische Bildgebung — als die stärker „vorgeformten" Methoden (DINO oder voll überwachte Modelle).

Es ist eine vernünftige Wette, kein Handwedeln. Vorarbeiten deuten in dieselbe Richtung: Farb-Jitter kann gelernte Features aktiv beschädigen (Planckian Jitter, 2022); JEPA-artige Methoden funktionieren ohne schwere Augmentierung (You Don't Need Data Augmentation in SSL, 2024); Invarianz- vs. vorhersagebasierte Methoden passen zu verschiedenen Signalen (Pretext Matters, 2026).

ModellFamilieAUC (jede Blutung, eingefroren)
DINOv2-giantDINO (Self-Distill.)0,935
DINOv3-L/16 (sat)DINO0,934
DINOv2-largeDINO0,928
I-JEPA g/16I-JEPA (vorhersagebasiert)0,928
I-JEPA H/16I-JEPA (vorhersagebasiert)0,925
Unsere Deutung — eine Hypothese

Das Farb-Argument greift hier kaum. Ein CT ist Graustufen — es gibt keine Farbe, die DINOs Farb-Jitter-Augmentierung fehllernen könnte — also greift die Sorge, seine „Foto"-Annahmen würden bei medizinischen Bildern schaden, weitgehend nicht. Das ist ein Grund, warum die „weniger-Bias-gewinnt"-Wette nicht aufging: es gab kaum Farb-Bias, den man hätte bestrafen können.

Und doch ist I-JEPA nicht geschlagen, sondern gleichauf — es erreicht DINOv2 trotz Training auf einer weit kleineren Bildsammlung, und im Ensemble besitzt es das schmale Blutfenster. „Weniger Bias" hieß also nicht „besser"; es hieß anders und komplementär — am ehesten zahlt es sich in Daten-Effizienz aus, nicht im rohen Transfer.

Ein sauberer, kontrollierter Sieg für Self-Supervision

Die Wette auf den Bias fiel, aber ein einfacherer Vergleich hielt. Hält man alles konstant außer dem Lernstil — dasselbe ResNet-50, dieselben Daten, nur supervised vs. selbstüberwacht — gewinnt Self-Supervision klar: 0,900 vs. 0,925 AUC (+0,025). Für die neueren Transformer-Modelle war der Unterschied klein und mit anderen Faktoren verwoben — ein Indiz, kein Beweis.

Wo zahlt sich das alles also aus?

Finding 07

Was es bedeutet: eine Klinik könnte ihre eigene Triage für die Befunde bauen, die kein Anbieter abdeckt — aus einer Handvoll Annotationen.

Für die offensichtlichen, häufigen Befunde ist das ein gelöster, ausgerollter Markt — kommerzielle Werkzeuge triagieren Blutung und großen Gefäßverschluss gut, und wir behaupten nicht, sie zu schlagen. Der interessante Raum ist, was sie nicht abdecken: seltenere Befunde, lokale Patientenmixe, der eigene Workflow jeder Abteilung — wo eingefrorene Features plus ein paar hundert Annotationen genügen, um zu starten, Schritt für Schritt verbesserbar.

Eingefroren starten (Stunden Arbeit) → Annotationen ergänzen → Fine-Tuning → auf eigenen Scans vortrainieren
In der Tiefe: wo es sich lohnt, die Ökonomie, Grenzen und was als Nächstes kommt
Detailvideo (Kapitel 7) — die Kernaussage plus die Methode dahinter, ~90 s.
Wenn Sie … sindDie Kernaussage
Neugierig (nicht-technisch)Eine KI, die nur auf Alltagsfotos trainiert wurde, kann Hirnblutungen schon recht gut erkennen — ohne je „Medizin studiert" zu haben. Das ist die Kraft, den Kern zu lernen.
In medizinischer KIEingefrorene Foundation-Features sind eine starke, fast kostenlose Baseline — genug, um Workflow-Triage auf eigenen Daten mit einer Handvoll Annotationen zu prototypen und dann in Schritten zu verbessern. Am wertvollsten für die seltenen Befunde, die kein fertiges Werkzeug abdeckt.
In der Technik (egal welche Domäne)Worauf man vortrainiert zählt mehr als das genaue Rezept, und ein vielfältiges Ensemble schlägt ein einzelnes großes Modell. „Weniger Inductive Bias = besserer Transfer" war intuitiv, hielt aber nicht sauber.

Wo ein günstiger Detektor sich wirklich lohnt

Nicht in einem voll besetzten Stroke-Center um die Mittagszeit. Er lohnt sich, wo Expertise oder Geografie der Engpass ist — und die harten Zahlen hier stammen aus ausgerollten Systemen, nicht von uns:

  • Die Verlegungsentscheidung — ein kleines Krankenhaus mit Scanner, aber ohne Neurochirurgie. Die Uhr, die zählt, ist die Door-in-Door-out-Zeit, routinemäßig über zwei Stunden. In einem Hub-and-Spoke-Netz senkte automatische Erkennung sie von 202 → 113 Minuten und die Team-Benachrichtigung von 45 → 7 Minuten (Viz.ai, 2024).
  • Das Wochenende, wenn kein Experte im Haus ist. Klinisch relevante Diskrepanzen zwischen vorläufigem und finalem Befund liegen im Bereitschaftsdienst bei ≈2–6%, und die am häufigsten übersehenen Blutungen sind die subtilen — subdural (39%) und subarachnoidal (33%) (AJNR). Das sind genau die zwei Typen, die unser Modell am schwersten findet — aber ein Modell ermüdet nicht um 3 Uhr nachts. Der Wert ist nicht „besser als ein Neuroradiologe"; es ist eine konstante Zweitmeinung, wo keine vor Ort ist.

Warum eine einzelne Klinik das selbst bauen könnte

  • Es braucht sehr wenige Annotationen. Die Few-Shot-Kurve erreichte brauchbare Genauigkeit von Zehnern bis wenigen hundert annotierten Fällen — nicht den Zehntausenden, die ein Modell von Grund auf verlangt. Ein klinikeigenes Archiv, vom eigenen Personal leicht annotiert, genügt zum Start.
  • Es verbessert sich in Schritten. Beginne mit einem eingefrorenen Modell und einer winzigen Probe — Stunden Arbeit. Wenn ein Befund wichtiger wird, füge Annotationen hinzu; wenn er sehr wichtig ist, mache Fine-Tuning; an der Grenze fahre label-freies Vortraining auf den eigenen unannotierten Scans des Hauses. Jeder Schritt ist optional und baut aufeinander auf.
Die Richtung, die es zu untersuchen lohnt

Der Faden aus den Außenseitern und dem Satellitentest weist in eine Richtung: auf der Zieldomäne selbst vortrainieren. Die bestimmende Eigenschaft dieser selbstüberwachten Methoden ist, dass sie gar keine Annotationen brauchen — dasselbe Rezept könnte also auf dem großen Archiv unannotierter CT / MRT eines Hauses laufen und die Features nativ „medizinisch" sprechen lassen, mit nur einer Handvoll Annotationen obendrauf. Wir haben das Vortraining selbst nicht getestet; es bräuchte eine eigene Studie — und für klinischen Einsatz ordentliche Validierung und regulatorische Arbeit. Aber so wird aus einem Daten-Moat ein Modell-Moat.

Grenzen — das war ein schneller Blick, nicht das letzte Wort

  • Eingefroren, nicht feinabgestimmt. Die Modelle an CT anzupassen würde deutlich mehr herausholen — umso mehr, je weiter der Input von Alltagsfotos entfernt liegt.
  • Nur leichter 3D-Kontext. Schnitt-plus-gemittelte-Nachbarn schlug sowohl volle Konkatenation (überanpasst seltene Subtypen) als auch naives Mitteln (verwischt den Schnitt, schadete). Ein voll gelerntes Sequenzmodell über Schnitte hinweg — wie beim Gewinner — ist der verbleibende Weg zu mehr.
  • Keine Eins-zu-eins-Leaderboard-Zahl. Alle Werte sind auf unserem eigenen patientenweise getrennten Split, nicht auf dem privaten Testset von 2019. Das „2,6-Fache" ist ein Plausibilitätscheck zur Größenordnung, kein direkter Vergleich.

Die Workflow-Zahlen oben stammen aus ausgerollten, validierten Systemen — nicht aus dieser Arbeit. Wir haben die Fähigkeit auf öffentlichen, unvollkommenen Daten demonstriert, ohne klinischen Einsatz und ohne klinische Studie. Daraus einen sicheren Zweitleser oder Verlegungs-Auslöser zu machen ist eine separate, ordentlich regulierte Anstrengung; es wird kein MDR/CE-Anspruch erhoben.

Falls Sie daran arbeiten: Die Bausteine sind heute da — sie einzusetzen braucht Engineering, keinen Durchbruch. Falls Sie klinische Bildgebungs-Workflows mit KI verbessern, mit den Domänendaten und der klinischen Reichweite, um es richtig zu tun, freue ich mich auf das Gespräch.