LeJEPA · Self-supervised Learning · Effizientes Pretraining

Kann man Sprachmodelle wie Video-KI trainieren?

Yann LeCuns Labor trainiert Video-KI, indem es jeden Clip schreddert, einen zufälligen Bruchteil behält und einem Netz beibringt, dass zwei Schnipsel desselben Clips dasselbe bedeuten. Auf Text portiert stellt das Rezept eine schärfere Frage, als ob es funktioniert: Ein Modell, das nie mehr als 30 % eines Texts liest, lernt bessere Text-Repräsentationen als Modelle, die alles lesen — welche Zutat macht das möglich? Die Antwort braucht eine Ablation, eine Maskierungsraten-Kontrolle und einen Blick in die Token-Geometrie — und sie ist nicht der neue Invarianz-Loss.

87,8Themen-Genauigkeit des besten Objectives — geschredderte Token-Vorhersage, bei 60 % des Compute der Klassiker (±0,1, 3 Seeds)
70 %jedes Texts sind gelöscht, bevor das Siegermodell sie je sieht — und es schlägt trotzdem die Modelle, die alles lesen
0,99Kosinus-Ähnlichkeit zwischen allen Token-Paaren — wie das pure Rezept Textstruktur kollabieren lässt, und warum kein View-Design das reparierte
25committete Befunde mit reproduzierbaren Läufen — inklusive der negativen Ergebnisse, auf denen die Schlüsse ruhen

Ein Forschungslog mit kleinen Modellen (9M–124M Parameter) und Frozen-Probe-Auswertung auf öffentlichen Daten (wikitext-103, FineWeb-Edu). Jede Zahl stammt aus einem committeten, reproduzierbaren Lauf; Vergleiche sind auf Daten, Architektur und Seeds abgeglichen. Dies ist eine kontrollierte Studie über Trainings-Objectives — kein State-of-the-Art-Embedding-Modell.

Überblick (~4 Min): das Rezept, die Hauptvergleiche, die entscheidende Ablation und der Mechanismus — in einfacher Sprache. Zu jedem Kapitel unten gibt es ein eigenes kurzes Video.
Grundlagen

Zuerst die Grundlagen: drei Wege, auf rohem Text zu trainieren

Alles Weitere ruht auf drei Trainings-Objectives — zwei Klassikern und dem Neuling — plus einer Messidee: das trainierte Netz einfrieren und testen, wie viel ein winziger Klassifikator aus seinen internen Zusammenfassungen lesen kann. Die Drei-Minuten-Fassung als Video, oder hier zum Lesen.

Grundlagen (~3 Min): Masked- und Next-Token-Prediction, das LeJEPA-Rezept, SIGReg und der Frozen-Probe-Test — in einfacher Sprache.
Vertiefung: die zwei Klassiker, der Neuling, und der Schredder zum Ausprobieren

Die zwei Klassiker: das nächste Wort vorhersagen, oder das versteckte

Next-Token-Prediction (das GPT-Rezept, „CLM"): von links nach rechts lesen, immer das nächste Wort raten. Masked Prediction (das BERT-Rezept, „MLM"): 15 % der Wörter schwärzen und aus beiden Richtungen erraten. Beides sind Token-Level-Objectives — jedes Lernsignal betrifft ein Wort an einer Position. Sie haben die gesamte LLM-Ära gebaut.

Der Neuling: sich auf den Kern einigen

LeJEPA (LeCun & Balestriero, Ende 2025) ist ein Sequenz-Level-Objective mit zwei Zutaten. Einem Invarianz-Loss: Zwei zufällig geschredderte Ansichten desselben Inputs müssen auf dieselbe Ein-Vektor-Zusammenfassung abbilden. Und SIGReg, einem statistischen Regularisierer, der beweisbar verhindert, dass diese Zusammenfassungen auf einen Punkt kollabieren — der klassische Fehlermodus dieser Familie. Ein Netz, kein Teacher-Modell, ein zusätzlicher Hyperparameter. Die Video-Version LeVJEPA — wenige Wochen vor diesem Experiment erschienen — erreichte oder schlug Metas V-JEPA 2 mit bis zu einem Zwanzigstel des Compute — vor allem, weil die weggeschredderten Teile nie gelesen werden. Binnen Monaten gab es LeJEPA-Arbeiten für Video, Bilder, Audio, EEG, Moleküle und Zeitreihen. Text — die Modalität, in der selbstüberwachtes Lernen geboren wurde — fehlte. Den Text-Port nenne ich LeTJEPA, um ihn klar von LeJEPA (dem Framework) und LeVJEPA (dem Video-Rezept) zu trennen.

Interaktiv — was das Netz im Training tatsächlich sieht

Zwei unabhängig geschredderte Ansichten desselben Absatzes. LeTJEPA trainiert beide auf die gleiche Ein-Vektor-Zusammenfassung; die geschwärzten Wörter werden nie gelesen — daher die Compute-Ersparnis. Überlebende Wörter behalten ihre exakten Positionen — das ist kein Bag of Words. Und die Schwärzung existiert nur im Training: Im Einsatz liest das Modell immer den vollen Text.

Wie alles gemessen wird

Alle Modelle werden from scratch trainiert — gleiche Daten in gleicher Reihenfolge, derselbe 63M-Parameter-Transformer, derselbe Optimizer, dieselben Seeds — der einzige Unterschied ist das Objective. Danach wird jedes Netz eingefroren, und winzige lineare Proben lernen auf seinen Ausgaben: Themen-Klassifikation (AG-News), Satz-Ähnlichkeit (STS-B) und Grammatik über Minimalpaare (BLiMP: bevorzugt das Modell „the cats sleep" gegenüber „the cats sleeps"?). Nichts aus dem Training überlappt mit den Tests (auf 13-Gramm-Ebene geprüft: null Kollisionen). Eine bewusst ernüchternde Referenz läuft mit: TF-IDF, das Wortzähl-Verfahren aus den 1970ern.

Einordnung

Warum das Ganze — und wo es in der Landschaft steht

Hinter diesem Experiment steht eine offene Kontroverse: LeCun hält Next-Token-Vorhersage für eine Sackgasse — Modelle sollten Bedeutungen vorhersagen, nicht Wörter — mit auffälligen Effizienz-Ergebnissen auf Video. Text ist das Feld, auf dem diese Wette nie getestet wurde, ausgerechnet weil die Konkurrenz dort am stärksten ist. Die Drei-Minuten-Fassung, oder die Karte darunter.

Einordnung (~3 Min): die Wette hinter JEPA, die vier Familien der Pretraining-Objectives, und warum sich das Experiment in jede Richtung lohnt.
Vertiefung: die vier Familien, und was jedes Ergebnis bedeuten würde

Woher die Idee kommt — 13 Jahre in fünf Schritten

SchrittWas geschahModalität
2013 · word2vecselbstüberwachtes Lernen entsteht im Text: Nachbarwörter aus dem Kontext vorhersagenText
2018 · BERT & GPTToken-Vorhersage skaliert zur Grundlage der LLM-ÄraText
2020–21 · SimCLR, BYOL, DINOdie Bildverarbeitung übernimmt die Idee; gegen den Embedding-Kollaps entsteht ein Zoo an Tricks — Negative, Stop-Gradienten, Teacher-NetzeVision
2022–24 · JEPA → I-JEPA → V-JEPALeCuns Positionspapier: Bedeutungen vorhersagen statt Pixel; erste Bild- und Video-UmsetzungenVision
2025–26 · LeJEPA, LeVJEPAder Trickzoo wird durch eine beweisbare Statistik ersetzt (SIGReg); das Video-Rezept ergänzt Token-DroppingVision

Dieses Experiment schließt den Kreis: Das destillierte Rezept kehrt in die Modalität zurück, in der selbstüberwachtes Lernen geboren wurde. Und es gibt eine historische Resonanz, die sich erst am Ende des Logs zeigt — das Objective, das am Ende vorn liegt (einen Nachbarn aus spärlichem Kontext vorhersagen), ist im Geist dem word2vec-Ausgangspunkt von 2013 näher als alles dazwischen.

FamilieIdeeStand auf Text
Token-Vorhersage (GPT, BERT)jedes Wort einzeln vorhersagendie Basis aller LLMs
Kontrastiv (SimCSE u. a.)ähnliche Sätze zusammenziehen, andere wegdrückenStandard für Satz-Embeddings; braucht Negative
JEPA-Linie (LeJEPA)Ansichten einigen sich im Bedeutungsraum; eine Verteilungs-Statistik ersetzt die Negativenvor diesem Log ungetestet auf Rohtext
Weglassen & Vorhersagen (MAE-Linie)Eingabe ausdünnen, Fehlendes vorhersagenin der Bildverarbeitung etabliert, auf Text kaum erprobt

Der Einsatz gilt in beide Richtungen. Überträgt sich das Rezept, wird Satz-Semantik 40 % billiger — relevant für jedes Embedding-Training. Scheitert es, ist der Fehlermodus selbst eine Antwort: darauf, was Video als Substrat für Bedeutungsraum-Lernen von Text unterscheidet. In jedem Fall entsteht als Nebenprodukt etwas Seltenes — ein kontrollierter Vergleich von Trainingszielen bei identischen Daten, identischer Architektur und festem Compute. (Vorschau aus dem Überblick: Das Objective, das am Ende vorn liegt, gehört zur vierten Familie — in einer Variante, die es so noch nicht gab.)

Erste Frage: Welche Teile des Video-Rezepts überstehen den Transfer auf Sprache?

Finding 01

Das Rezept überträgt sich: 30–95 % des Texts zu schreddern ist gratis, und pures LeTJEPA schlägt die Klassiker beim Thema — mit 60 % von deren Compute.

Die Effizienz-Mechanik überträgt sich fast unverändert aus dem Video. Die Genauigkeit bleibt über eine 14×-Compute-Spanne an Drop-Raten flach; ein kausaler (GPT-artiger) Encoder kostet nichts gegenüber einem bidirektionalen; und mit korrekt gewichtetem Regularisierer erreicht das pure Rezept 86,2 % Themen-Genauigkeit — über den nachtrainierten BERT- und GPT-Baselines, die den vollen Text lesen.

86,2 % (kausal) / 86,1 % (bidirektional) vs. 85,9 % CLM / 85,6 % MLM — bei 60 % von deren Token-Budget
Vertiefung: was sich übertrug, und das λ-Normierungs-Detail
Detailvideo (Kapitel 1) — was sich vom Video auf Text überträgt, ~90 s.

Aufbau. Ein 63M-Parameter-Transformer (12 Schichten, d=512), from scratch auf wikitext-103 trainiert (118 Mio. Tokens), 20.000 Schritte bei Batch 512 × 256 Tokens. LeTJEPA: zwei unabhängig zu 70 % gedroppte Ansichten pro Sequenz, MSE-Invarianz zwischen ihren Zusammenfassungs-Vektoren plus SIGReg (λ=5,6 nach dem Audit unten); überlebende Tokens behalten ihre Originalpositionen. Baselines: CLM und MLM unter identischen Bedingungen auf vollen Sequenzen nachtrainiert. Der Drop-Raten-Sweep (30–95 %) läuft als separate 5.000-Schritt-Diagnosen. Auswertung: eingefrorene lineare Proben auf AG-News und STS-B, gemittelt über 3 Probe-Seeds.

Was hält

  • Aggressives Schreddern ist gratis. Die Themen-Genauigkeit bleibt flach, während die Drop-Rate von 30 % auf 95 % steigt — eine 14×-Spanne im Compute. Der zentrale Video-Befund repliziert auf Sprache.
  • Kausalität ist gratis. Ein kausaler Encoder hält mit einem bidirektionalen mit — Streaming-taugliche Embeddings ohne Genauigkeitspreis, spiegelbildlich zum Block-Causal-Ergebnis des Video-Papers.
  • Sequenz-Level schlägt Token-Level auf dessen eigenem Terrain. Bei der Themen-Klassifikation — einer Aufgabe über den Kern eines Texts — führt pures LeTJEPA jetzt vor den klassischen Objectives, obwohl es nie mehr als 30 % einer Sequenz liest.

Das λ-Normierungs-Detail

Ein Konfigurations-Detail wiegt schwerer als alle anderen: Der Video-Code mittelt seinen Invarianz-Loss über die 256 Zusammenfassungs-Dimensionen, mein Port summierte. Bei gleichem λ heißt das ~280× schwächere Regularisierung — und das Training kollabiert. Mit dem entsprechend höheren λ≈5,6 (dem Paper-äquivalenten Wert, aus dem Abgleich mit der Referenz-Implementierung) trainiert alles stabil, und pures LeTJEPA gewinnt fast zwei Punkte. Das Mitteln des Originals ist vermutlich auch die bessere Konvention, weil das Gewicht dann nicht an der Dimensionszahl hängt.

Zwischenfazit

Die Mechanik überträgt sich. Aber Thema ist der freundlichstmögliche Test für ein Gist-Objective — die echten Fragen sind, was es auf diesem Weg nicht lernen kann, und ob es Token-Vorhersage dort schlagen kann, wo die stark ist.

Bevor man Objectives direkt vergleicht, lohnt der Blick darauf, wann ein Sprachmodell welche Fähigkeit lernt.

Finding 02

Grammatik ist schnell, Bedeutung ist langsam: Ein Sprachmodell hat Grammatik nach den ersten 15 % des Trainings fertig gelernt.

Ein Modell, ein einziger Durchlauf über 10 Milliarden Tokens, drei Fähigkeiten an jedem Checkpoint gemessen. Grammatik plateaut nach ≈1,5 Mrd. Tokens; Satz-Bedeutung verbessert sich bis ≈3–4 Mrd.; Themenwissen bis ≈6 Mrd. Das meiste Trainings-Compute fließt in eine Fähigkeit, die das Modell im Kern fertig gelernt hat.

Interactive — three abilities, one training run (hover the curves)
Grammar (BLiMP)  
0.5B 1B 2B 5B 10B 70% 64% plateau ≈1.5B
Sentence meaning (STS-B)  
0.5B 1B 2B 5B 10B 0.52 0.3 plateau ≈3–4B
Topic (AG-News)  
0.5B 1B 2B 5B 10B 86% 83% plateau ≈6B

One model, a single pass over 10B tokens — every sequence seen exactly once, so the curves aren't distorted by repeated data; log-scale token axis, probe-free measurements at every checkpoint. Grammar plateaus after ≈1.5B tokens; sentence meaning keeps improving to ≈3–4B; topic knowledge creeps up to ≈6B. Dots are individual checkpoint measurements — some noise is expected.

Grammatik-Plateau ≈1,5 Mrd. Tokens · Satz-Bedeutung ≈3–4 Mrd. · Thema ≈6 Mrd.
Vertiefung: die Messung, und warum das Instrument zählt
Detailvideo (Kapitel 2) — die Lerndynamik-Messung, ~90 s.

Aufbau. Ein 63M-Modell, ein einziger Durchlauf über 9,91 Mrd. Tokens FineWeb-Edu — jede Sequenz genau einmal gesehen, keine Kurve durch wiederholte Daten verzerrt. Ein Checkpoint alle ~0,5 Mrd. Tokens; an jedem Checkpoint drei Messungen: BLiMP-Minimalpaar-Likelihoods für Grammatik (ohne Probe), STS-B-Kosinus-Korrelation für Satz-Bedeutung und eine eingefrorene AG-News-Probe fürs Thema.

Eine Nebenlektion für Praktiker: Der übliche Embedding-Probe-Test für Grammatik (CoLA) hat hier nichts gemessen — für jedes Modell auf dem Niveau der Majority-Baseline —, während Minimalpaar-Likelihoods (BLiMP) die Modelle sauber trennten. Das Instrument zählt.

Zwischenfazit

Wenn Grammatik billig ist und Bedeutung teuer, sollte ein Sequenz-Level-Objective, das direkt auf Bedeutung zielt, eine nützliche Ergänzung zur Token-Vorhersage sein. Das war die Hypothese für das nächste Experiment — und sein Ergebnis sah wie eine saubere Bestätigung aus.

Finding 03

Die Kombination gewinnt — +1,8 Punkte Themen-Genauigkeit über dem besten Klassiker, bei 60 % des Compute.

Das kombinierte Objective ist einfach: Die zwei geschredderten Ansichten fließen ohnehin fürs Invarianz-Loss durchs Netz — also soll jedes überlebende Token zusätzlich seinen (meist geschwärzten) rechten Nachbarn vorhersagen. Null zusätzliches Encoder-Compute; GradNorm balanciert die beiden Losses automatisch. Epoch-matched, drei Probe-Seeds: 87,7 ±0,4 vs. 85,9 ±0,2 — mehr als vier Standardabweichungen.

87,7 ±0,4 vs. 85,9 ±0,2 Themen-Genauigkeit · >4σ · 1,58 vs. 2,62 Mrd. verarbeitete Tokens
Vertiefung: das kombinierte Objective, und das Ergebnis, wie es dastand
Detailvideo (Kapitel 3) — die Kombination und ihr scheinbarer Sieg, ~90 s.

Aufbau. Das kombinierte Objective ergänzt LeTJEPAs zwei gedroppte Ansichten um einen Token-Loss: Jedes überlebende Token sagt das nächste Token der Originalsequenz voraus (meist ein gelöschtes; Positionen mit überlebendem Nachbarn sind ausgeschlossen, um Kopieren zu verhindern). GradNorm balanciert die beiden Losses über gleiche Gradienten-Normen an der letzten Schicht. Alles andere wie in Befund 01: 63M, wikitext-103, 20.000 Schritte, epoch-matched gegen CLM/MLM auf vollen Sequenzen, 3 Probe-Seeds, kausale und bidirektionale Variante.

Beide Hälften schienen genau das zu tun, was das Lerndynamik-Kapitel vorhersagte: Der Invarianz-Term liefert das billige Semantik-Signal, der Token-Term hält das Modell nah an den einzelnen Wörtern. Die Kombination schlug Masked Language Modelling, Next-Token-Prediction, eine kontrastive Kontrolle und pures LeTJEPA — jedes pure Objective — und verarbeitete dabei 40 % weniger Text. Es replizierte mit kausalem und bidirektionalem Encoder.

Die eigentliche Frage: Welche Zutat trägt den Effekt?

Ein Zwei-Arm-Vergleich kann sie nicht beantworten, egal wie signifikant er ist: Die Kombination unterscheidet sich vom reinen Masked Language Modelling in zwei Dingen gleichzeitig — sie fügt den Invarianz-Loss hinzu, und ihre Token-Vorhersage arbeitet auf geschredderten Ansichten. Das Werkzeug, das verschränkte Zutaten trennt, ist die Ablation: genau eine löschen, alles andere festhalten. Hier heißt das ein dritter Arm — die geschredderte Token-Vorhersage allein, die komplette LeJEPA-Maschinerie (Invarianz, SIGReg, Projector) entfernt. Trägt der Invarianz-Term den Effekt, fällt dieser Arm auf die Baseline zurück; trägt das Schreddern selbst, hält er mit.

Der Ablations-Arm hielt mit.

Finding 04

Die Ablation: Geschredderte Token-Vorhersage allein hält beim Thema mit der Kombination mit — und schlägt sie bei der Bedeutung.

Invarianz-Loss, SIGReg und Projector löschen; nur die geschredderten Ansichten und die Nachbar-Vorhersage behalten. Dieses abgespeckte Objective erreicht 87,8 ±0,1 Themen-Genauigkeit und 0,47 Satz-Ähnlichkeit — gleichauf mit der Kombination beim Thema, klar besser bei der Bedeutung, bei denselben 60 % Compute. Der Vorsprung der Kombination ist also ein Sparse-Training-Effekt, kein Invarianz-Effekt.

87,8 ±0,1 Thema · 0,47 STS-B · 60 % Compute — ganz ohne JEPA-Term
Vertiefung: die volle Tabelle, die Maskierungsraten-Kontrolle, und die Einordnung in die Literatur
Detailvideo (Kapitel 4) — die Ablation, die die Ursache isoliert, ~90 s.

Aufbau. Die Ablation behält den Token-Arm der Kombination exakt bei — zwei zu 70 % gedroppte Ansichten, bidirektionale Attention, Nachbar-Ziele mit Kopier-Ausschluss — und löscht Invarianz-Loss, SIGReg und Projector. Die Maskierungsraten-Kontrollen trainieren Standard-MLM mit 40 % bzw. 80 % Masken auf vollen Sequenzen. Alle Arme: dieselbe 63M-Architektur, dieselben wikitext-103-Daten in derselben Reihenfolge, 20.000 Schritte, 3 Probe-Seeds; BLiMP wird bei kausalen Modellen autoregressiv gescored, bei bidirektionalen per Pseudo-Likelihood (Sternchen-Werte — nur innerhalb einer Familie vergleichen).

ObjectiveThema ↑Bedeutung ↑Grammatik ↑Compute
Geschredderte Token-Vorhersage allein (die Ablation)87,8 ±0,10,4758,0*1,58 Mrd.
LeTJEPA × MLM (die Kombination)87,7 ±0,40,41—*1,58 Mrd.
LeTJEPA × CLM86,7 ±0,40,3960,61,58 Mrd.
Pures LeTJEPA (λ=5,6, kausal / bidir)86,2 / 86,10,28 / 0,351,58 Mrd.
CLM (GPT-Rezept)85,9 ±0,20,3466,12,62 Mrd.
MLM (BERT-Rezept, 15 % Masken)85,6 ±0,20,43—*2,62 Mrd.
MLM, 40 % Masken86,3 ±0,30,4861,9*2,62 Mrd.
MLM, 80 % Masken86,1 ±0,30,4557,0*2,62 Mrd.
TF-IDF (Wortzählen, 1970er)89,50,70

Frozen-Probe-Ergebnisse, 63M-Modelle, identische Daten & Architektur, epoch-matched; Thema ist AG-News (Mittel ± Std über 3 Probe-Seeds), Bedeutung STS-B-Spearman, Grammatik BLiMP (*kausale und bidirektionale Modelle nutzen unterschiedliches Scoring — nur innerhalb einer Scoring-Familie vergleichen).

Das Objective im Ganzen: Text schreddern, zufällige 30 % der Tokens an ihren Originalpositionen behalten, keine Mask-Tokens, kein Decoder — und jedes überlebende Token sagt seinen rechten Nachbarn im Originaltext voraus, der meist geschwärzt ist. Zwei unabhängige Shreds pro Sequenz, bidirektionale Attention, Positionen mit überlebendem Nachbarn ausgeschlossen (kein Kopieren). Das ist das ganze Rezept.

Ist das nur „mehr maskieren"? Die Forschung zu Maskierungsraten (Wettig et al., 2023) zeigte, dass 40 % Maskierung BERTs 15 % schlägt und 80 % noch überraschend gut funktioniert — die schärfste Null-Hypothese ist also, dass jede aggressive Korruption hierher führt. Die zwei Maskierungsraten-Baselines in der Tabelle testen genau das, bei sonst identischem Setup. Die Antwort: teilweise. Eine höhere Maskierungsrate hilft tatsächlich — bei 40 % Maskierung erreicht reines MLM Parität bei der Bedeutung (0,48 vs. 0,47) und gewinnt +0,7 beim Thema. Aber der Themen-Abstand zum echten Wegwerfen bleibt deutlich (86,3 vs. 87,8, weit jenseits des Seed-Rauschens) — und das maskierte Modell bezahlt dafür das 1,67-Fache an Compute, weil jeder [MASK]-Platzhalter weiter durchs Netz läuft. Bei 80 % Maskierung degradiert wieder alles. Tokens wirklich zu löschen bleibt die bessere und zugleich billigere Variante.

Einordnung in die Literatur: Jede Zutat existiert irgendwo — MAE-LM (ICLR 2024) entfernt Mask-Tokens aus dem Encoder, braucht aber einen Decoder; Googles Token-Dropping wirft Tokens mitten im Netz ab (Effizienz); Forgetful Causal Masking dünnt den Kontext im GPT-Training aus. Die spezifische Kombination hier — encoder-only, kein Decoder, keine Mask-Tokens, echtes Input-Level-Dropping, Nachbar-Ziele, evaluiert als eingefrorener Satz-Encoder — konnte ich nicht publiziert finden. Ich würde sie als decoder-freie Vereinfachung dieser Linie positionieren, nicht als neue Idee. In diesen Vergleichen liegt sie über allen Objectives, die ich ursprünglich testen wollte.

Und LeJEPAs Invarianz-Term?

Er ist nicht nutzlos — er ist redundant, sobald ein starker Token-Anker da ist. Auf dem kausalen Arm, wo das Token-Signal schwächer ist, kauft der Invarianz-Loss weiterhin echten Semantik-Gewinn (0,39 vs. 0,32 STS-B). Und pures LeTJEPA bleibt das beste Objective der Tabelle, das ganz ohne Token-Vorhersage auskommt. Die nüchterne Zusammenfassung: Der Invarianz-Term liefert Gist-Semantik nur dort, wo sonst nichts sie liefert.

Warum bleibt das Invarianz-Objective auf Text hinter Video zurück? Die Token-Analyse gibt eine präzise Antwort.

Finding 05

Pure Invarianz kollabiert jedes Token auf den Kern des Texts — und kein View-Design entkommt: nicht Drop-Rate, nicht Blöcke, nicht lange Kontexte, nicht Video-artige Crops.

LeVJEPAs auffälligste Abbildung zeigt Video-Patches, die sich selbst organisieren, obwohl nur die Clip-Zusammenfassung supervidiert wird. Auf Text passiert das Gegenteil: Nach dem Training ist jede Token-Repräsentation einer Sequenz nahezu identisch mit jeder anderen (Kosinus 0,98–1,00) — jedes Token trägt eine Kopie des Text-Kerns. Das ist kein Bug. Es ist die mathematisch optimale Lösung des Objectives — und wir konnten zeigen, warum.

Token-Paar-Kosinus 0,99 · jeder Fluchtversuch scheiterte: Drop 0,3–0,95, Block-Shreds, 4096-Token-Kontexte, Video-artige lokale Crops, stärkeres SIGReg
Vertiefung: der visuelle Beleg, der versteckte Strafterm, und das systematische Scheitern jedes Fixes
Detailvideo (Kapitel 5) — der Token-Kollaps-Mechanismus, ~2 Min.

Aufbau. Zwei Sorten Experiment. Analyse trainierter Modelle: paarweiser Kosinus zwischen allen Token-Repräsentationen einer Sequenz (32 zurückgehaltene Sequenzen), effektiver Rang und eine Wortarten-Probe auf eingefrorenen Tokens. Auswege: separate 5.000-Schritt-Trainingsläufe pro Design — Drop-Raten 0,3–0,95, zusammenhängende 16-Token-Blöcke als Drop-Einheit, 4.096-Token-Kontexte und LeVJEPA-artige Ansichten (eine globale + vier lokale Span-Ansichten), jeweils gleich vermessen; ein 9M-Parameter-Screening-Tier reproduzierte zuerst die bekannten Signaturen, sodass jede Variante Minuten statt Stunden kostet.

Unten ist jedes Wort danach eingefärbt, wie ähnlich seine interne Repräsentation dem Wort „inflation" ist (dunkler = ähnlicher). Ein Modell mit brauchbarer Token-Struktur sollte das zweite Vorkommen von „inflation" aufleuchten lassen und wenig sonst:

Pure LeTJEPA (invariance only)

The European Central Bank kept interest rates unchanged on Thursday, after raising them repeatedly over the past two years to curb stubbornly high inflation in the euro zone. Bank president Christine Lagarde said the central bank would continue to watch incoming economic data closely before deciding on its next step, and that inflation in the euro zone was expected to fall gradually next year.

Combined objective (invariance + token prediction)

The European Central Bank kept interest rates unchanged on Thursday, after raising them repeatedly over the past two years to curb stubbornly high inflation in the euro zone. Bank president Christine Lagarde said the central bank would continue to watch incoming economic data closely before deciding on its next step, and that inflation in the euro zone was expected to fall gradually next year.

Pures LeTJEPA ist fast gleichmäßig dunkel — seine Token-Repräsentationen sind auf einen globalen Kern kollabiert. Eine Wortarten-Probe auf den eingefrorenen Tokens bestätigt es: 41 % für pures LeTJEPA vs. 63–70 %, sobald irgendein Token-Level-Loss dabei ist.

Warum SIGReg das nicht verhindern kann — und der Invarianz-Loss es belohnt

SIGReg bewacht eine Sache: dass verschiedene Texte gut verteilte Zusammenfassungen bekommen. Auf die Tokens innerhalb eines Texts schaut es nie. Und der Invarianz-Loss belohnt den Kollaps aktiv: Die Zusammenfassung ist nahe an einem gewichteten Mittel der Token-Repräsentationen, und der quadrierte Abstand zweier Shred-Zusammenfassungen ist proportional zur Token-Varianz innerhalb der Sequenz. Alle Tokens identisch zu machen ist kein Fehlermodus dieses Objectives — es ist sein Optimum. Beide Bedingungen, „Texte gut verteilt" und „Tokens alle gleich", sind gleichzeitig perfekt erfüllbar; das Training findet schlicht diesen Punkt.

Jeder Ausweg, getestet — keiner funktionierte

  • Drop-Rate: Die Homogenisierung wächst monoton von Drop 0,3 bis 0,95 (Kosinus 0,93 → 0,997) — exakt wie die Varianz-Formel es vorhersagt, denn der Strafkoeffizient skaliert mit eins durch die Zahl der behaltenen Tokens.
  • Zusammenhängende Blöcke (16 Tokens wie ein Bild-Patch behandeln): lexikalisch nicht von zufälligem Droppen bei gleicher Rate zu unterscheiden — kein Effekt.
  • Längere Kontexte (4096 Tokens): Verstreute Shreds werden nur repräsentativer für den Text — die Invarianz-Aufgabe wird leichter, nicht schwerer.
  • Video-artige lokale Crops (eine globale Ansicht, vier lokale Span-Ansichten — das Design, das im Video die Emergenz erzeugt): Bei kurzen Kontexten sind die Spans so redundant wie Shreds; bei langen entsteht endlich echter Vorhersagedruck (der Loss bleibt hoch) — und fließt in Teil-Kollaps oder bloße Kern-Glättung statt in Token-Struktur. Auch mit dem korrigierten, stärkeren SIGReg entsteht keine Token-Identität.
Die Hypothese, die all das überlebt

Im Video unterbestimmt der Inhalt eines lokalen Crops den Clip wirklich — das Ganze aus dem Teil vorherzusagen erfordert Patches, die wissen, was wo ist. Im Text ist das, was ein Ausschnitt über sein Dokument verrät, selbst schon eine Zusammenfassung: ein Thema, ein Stil, eine Tonlage. Token-Identität reduziert die Restunsicherheit nicht — also bezahlt das Objective nie dafür. Wenn das stimmt, ist die für Video berichtete emergente Struktur keine Eigenschaft des JEPA-Rezepts, sondern eine Eigenschaft dessen, wie viel ein Teil eines Bildes über das Ganze sagt — was Text in dieser Größenordnung schlicht nicht teilt.

Einen Preis zahlen alle geschredderten Objectives gemeinsam: Grammatik. Das legte ein weiteres Experiment nahe.

Finding 06

Schreddern kostet Grammatik — und ein dichter 64-Token-Span als zweiter Loss holt die Hälfte zurück.

Jedes Objective, das nur geschredderten Text liest, verliert 4–6 BLiMP-Punkte gegen ein reines GPT-Modell: Nachbar-Vorhersage über geschreddertem Kontext ist ein schlechter Grammatiklehrer. Aber Grammatik ist lokal — das Lerndynamik-Kapitel zeigte, dass sie zuerst sättigt, und sie lebt im Satz, nicht im Dokument. Also: die Shred-Ansichten für Semantik behalten, und dichte Next-Token-Prediction auf einem kurzen zusammenhängenden Span pro Sequenz ergänzen, an Originalpositionen, ohne Kontext davor.

BLiMP 60,6 → 63,8 (+3,2) bei gehaltenen Semantik-Werten · das dichte Voll-Sequenz-Modell bleibt mit 66,1 die Decke
Vertiefung: das Span-Design und sein exakter Trade-off
Detailvideo (Kapitel 6) — die Grammatik-Kosten und der Span-Fix, ~90 s.

Aufbau. Identisch zur Kombination, mit einer Änderung: Der Token-Loss wandert von den geschredderten Ansichten auf einen dichten, zusammenhängenden 64-Token-Span pro Sequenz, an zufälliger Position gezogen, an Originalpositionen belassen, ohne Kontext davor. GradNorm balanciert Span-Loss und Invarianz-Loss. 20.000 Schritte, epoch-matched, kausaler Encoder, 3 Probe-Seeds; Grammatik autoregressiv gescored (innerhalb dieser Tabelle vergleichbar).

Objective (kausaler Arm)Thema ↑Bedeutung ↑Grammatik ↑Compute
CLM (dicht, volle Sequenz)85,9 ±0,20,3466,1100 %
Geschreddertes CLM86,2 ±0,10,3261,960 %
LeTJEPA × geschreddertes CLM86,7 ±0,40,3960,660 %
LeTJEPA × dichter 64-Token-Span86,3 ±0,20,4063,885 %

Die Span-Variante bestätigt den Mechanismus aus Kapitel 2 auf einem zweiten Weg: Grammatik reagiert auf ein dichtes, lokales Signal — 64 zusammenhängende Tokens pro Sequenz holen +3,2 BLiMP-Punkte gegenüber der geschredderten Kombination zurück, während die Semantik-Werte halten. An die Decke des dichten Voll-Sequenz-Modells kommt sie nicht heran, und sie gibt einen Teil der Compute-Ersparnis zurück. Die offene Synthese — geschredderte Token-Vorhersage (das beste Objective aus Kapitel 4) plus dichter Span für Grammatik — ist der offensichtliche nächste Lauf.

Finding 07

Was bei dieser Größenordnung belegt ist — und was nicht.

Die kontrollierten Vergleiche laufen bei 63M Parametern, mit Absicht, für Ein-GPU-Sorgfalt; ein Screening-Tier mit 9M-Modellen machte die Iterationsschleife zu Minuten statt Stunden. Die Kern-Abstände liegen bei >4σ auf dem Probe-Rauschen — aber mehrere der größten Aussagen ruhen auf einem Korpus und einem Pretraining-Seed.

Ein Pretraining-Seed pro Objective · das beste Objective bisher nur auf wikitext bestätigt · TF-IDF bleibt bei Rohwerten vorn
Vertiefung: die Grenzen-Liste, und was als Nächstes läuft
Detailvideo (Kapitel 7) — Grenzen, und was die Schlüsse ändern würde, ~90 s.
  • Die 1970er-Referenz gewinnt bei Rohwerten weiter. TF-IDF schlägt hier jedes neuronale Modell bei Thema und Ähnlichkeit — auf lexikalischen Benchmarks, bei dieser Größenordnung, mit diesen Daten. Mehr Daten halfen den Modellen deutlich (Thema 84→88,3 bei 10 Mrd. Tokens); Parameter allein nicht, und spät im Single-Epoch-Training driften die Ähnlichkeits-Werte aller Objectives nach unten — ein offener, Objective-unabhängiger Effekt. Belastbar sind Aussagen darüber, welches Objective mehr pro Compute lernt, nicht absolute Überlegenheit.
  • Das beste Objective ist bisher nur auf wikitext bestätigt. Die 10-Mrd.-Token-Bestätigung auf FineWeb für die geschredderte Token-Vorhersage ist der wichtigste fehlende Lauf.
  • Scoring-Vorbehalt. BLiMP-Zahlen sind nur innerhalb einer Scoring-Familie vergleichbar (kausale Modelle scoren autoregressiv, bidirektionale per Pseudo-Likelihood).
  • Seeds. Probe-Seeds sind gemittelt (3); die Replikation über Pretraining-Seeds ist eingereiht.
  • Verwandte Arbeiten, geprüft. JEPA-Objectives für Sprache existieren: LLM-JEPA ergänzt den Standard-LM-Loss um einen JEPA-Term, braucht aber natürlich gepaarte Ansichten (Text↔Code), und BERT-JEPA aligniert Übersetzungspaare auf einem nachtrainierten mehrsprachigen Encoder — und nennt SIGReg ausdrücklich als Future Work. Was ich zum Zeitpunkt des Schreibens nicht finden konnte: eine LeJEPA/SIGReg-Anwendung auf Rohtext, oder eine publizierte Version der siegenden Shred-Vorhersage-Variante. Beim Tempo des Felds hat diese Aussage eine kurze Haltbarkeit.

Alles — Code, 25 Einzelbefunde mit Commit-Hashes und die negativen Ergebnisse — liegt als reproduzierbares Forschungslog vor. Wer an effizientem Pretraining oder selbstüberwachten Objectives arbeitet und sich austauschen will: mein Postfach ist offen.