Kann man Sprachmodelle wie Video-KI trainieren?
Yann LeCuns Labor trainiert Video-KI, indem es jeden Clip schreddert, einen zufälligen Bruchteil behält und einem Netz beibringt, dass zwei Schnipsel desselben Clips dasselbe bedeuten. Auf Text portiert stellt das Rezept eine schärfere Frage, als ob es funktioniert: Ein Modell, das nie mehr als 30 % eines Texts liest, lernt bessere Text-Repräsentationen als Modelle, die alles lesen — welche Zutat macht das möglich? Die Antwort braucht eine Ablation, eine Maskierungsraten-Kontrolle und einen Blick in die Token-Geometrie — und sie ist nicht der neue Invarianz-Loss.
Ein Forschungslog mit kleinen Modellen (9M–124M Parameter) und Frozen-Probe-Auswertung auf öffentlichen Daten (wikitext-103, FineWeb-Edu). Jede Zahl stammt aus einem committeten, reproduzierbaren Lauf; Vergleiche sind auf Daten, Architektur und Seeds abgeglichen. Dies ist eine kontrollierte Studie über Trainings-Objectives — kein State-of-the-Art-Embedding-Modell.
Zuerst die Grundlagen: drei Wege, auf rohem Text zu trainieren
Alles Weitere ruht auf drei Trainings-Objectives — zwei Klassikern und dem Neuling — plus einer Messidee: das trainierte Netz einfrieren und testen, wie viel ein winziger Klassifikator aus seinen internen Zusammenfassungen lesen kann. Die Drei-Minuten-Fassung als Video, oder hier zum Lesen.
Vertiefung: die zwei Klassiker, der Neuling, und der Schredder zum Ausprobieren
Die zwei Klassiker: das nächste Wort vorhersagen, oder das versteckte
Next-Token-Prediction (das GPT-Rezept, „CLM"): von links nach rechts lesen, immer das nächste Wort raten. Masked Prediction (das BERT-Rezept, „MLM"): 15 % der Wörter schwärzen und aus beiden Richtungen erraten. Beides sind Token-Level-Objectives — jedes Lernsignal betrifft ein Wort an einer Position. Sie haben die gesamte LLM-Ära gebaut.
Der Neuling: sich auf den Kern einigen
LeJEPA (LeCun & Balestriero, Ende 2025) ist ein Sequenz-Level-Objective mit zwei Zutaten. Einem Invarianz-Loss: Zwei zufällig geschredderte Ansichten desselben Inputs müssen auf dieselbe Ein-Vektor-Zusammenfassung abbilden. Und SIGReg, einem statistischen Regularisierer, der beweisbar verhindert, dass diese Zusammenfassungen auf einen Punkt kollabieren — der klassische Fehlermodus dieser Familie. Ein Netz, kein Teacher-Modell, ein zusätzlicher Hyperparameter. Die Video-Version LeVJEPA — wenige Wochen vor diesem Experiment erschienen — erreichte oder schlug Metas V-JEPA 2 mit bis zu einem Zwanzigstel des Compute — vor allem, weil die weggeschredderten Teile nie gelesen werden. Binnen Monaten gab es LeJEPA-Arbeiten für Video, Bilder, Audio, EEG, Moleküle und Zeitreihen. Text — die Modalität, in der selbstüberwachtes Lernen geboren wurde — fehlte. Den Text-Port nenne ich LeTJEPA, um ihn klar von LeJEPA (dem Framework) und LeVJEPA (dem Video-Rezept) zu trennen.
Wie alles gemessen wird
Alle Modelle werden from scratch trainiert — gleiche Daten in gleicher Reihenfolge, derselbe 63M-Parameter-Transformer, derselbe Optimizer, dieselben Seeds — der einzige Unterschied ist das Objective. Danach wird jedes Netz eingefroren, und winzige lineare Proben lernen auf seinen Ausgaben: Themen-Klassifikation (AG-News), Satz-Ähnlichkeit (STS-B) und Grammatik über Minimalpaare (BLiMP: bevorzugt das Modell „the cats sleep" gegenüber „the cats sleeps"?). Nichts aus dem Training überlappt mit den Tests (auf 13-Gramm-Ebene geprüft: null Kollisionen). Eine bewusst ernüchternde Referenz läuft mit: TF-IDF, das Wortzähl-Verfahren aus den 1970ern.
Warum das Ganze — und wo es in der Landschaft steht
Hinter diesem Experiment steht eine offene Kontroverse: LeCun hält Next-Token-Vorhersage für eine Sackgasse — Modelle sollten Bedeutungen vorhersagen, nicht Wörter — mit auffälligen Effizienz-Ergebnissen auf Video. Text ist das Feld, auf dem diese Wette nie getestet wurde, ausgerechnet weil die Konkurrenz dort am stärksten ist. Die Drei-Minuten-Fassung, oder die Karte darunter.
Vertiefung: die vier Familien, und was jedes Ergebnis bedeuten würde
Woher die Idee kommt — 13 Jahre in fünf Schritten
| Schritt | Was geschah | Modalität |
|---|---|---|
| 2013 · word2vec | selbstüberwachtes Lernen entsteht im Text: Nachbarwörter aus dem Kontext vorhersagen | Text |
| 2018 · BERT & GPT | Token-Vorhersage skaliert zur Grundlage der LLM-Ära | Text |
| 2020–21 · SimCLR, BYOL, DINO | die Bildverarbeitung übernimmt die Idee; gegen den Embedding-Kollaps entsteht ein Zoo an Tricks — Negative, Stop-Gradienten, Teacher-Netze | Vision |
| 2022–24 · JEPA → I-JEPA → V-JEPA | LeCuns Positionspapier: Bedeutungen vorhersagen statt Pixel; erste Bild- und Video-Umsetzungen | Vision |
| 2025–26 · LeJEPA, LeVJEPA | der Trickzoo wird durch eine beweisbare Statistik ersetzt (SIGReg); das Video-Rezept ergänzt Token-Dropping | Vision |
Dieses Experiment schließt den Kreis: Das destillierte Rezept kehrt in die Modalität zurück, in der selbstüberwachtes Lernen geboren wurde. Und es gibt eine historische Resonanz, die sich erst am Ende des Logs zeigt — das Objective, das am Ende vorn liegt (einen Nachbarn aus spärlichem Kontext vorhersagen), ist im Geist dem word2vec-Ausgangspunkt von 2013 näher als alles dazwischen.
| Familie | Idee | Stand auf Text |
|---|---|---|
| Token-Vorhersage (GPT, BERT) | jedes Wort einzeln vorhersagen | die Basis aller LLMs |
| Kontrastiv (SimCSE u. a.) | ähnliche Sätze zusammenziehen, andere wegdrücken | Standard für Satz-Embeddings; braucht Negative |
| JEPA-Linie (LeJEPA) | Ansichten einigen sich im Bedeutungsraum; eine Verteilungs-Statistik ersetzt die Negativen | vor diesem Log ungetestet auf Rohtext |
| Weglassen & Vorhersagen (MAE-Linie) | Eingabe ausdünnen, Fehlendes vorhersagen | in der Bildverarbeitung etabliert, auf Text kaum erprobt |
Der Einsatz gilt in beide Richtungen. Überträgt sich das Rezept, wird Satz-Semantik 40 % billiger — relevant für jedes Embedding-Training. Scheitert es, ist der Fehlermodus selbst eine Antwort: darauf, was Video als Substrat für Bedeutungsraum-Lernen von Text unterscheidet. In jedem Fall entsteht als Nebenprodukt etwas Seltenes — ein kontrollierter Vergleich von Trainingszielen bei identischen Daten, identischer Architektur und festem Compute. (Vorschau aus dem Überblick: Das Objective, das am Ende vorn liegt, gehört zur vierten Familie — in einer Variante, die es so noch nicht gab.)
Erste Frage: Welche Teile des Video-Rezepts überstehen den Transfer auf Sprache?
Das Rezept überträgt sich: 30–95 % des Texts zu schreddern ist gratis, und pures LeTJEPA schlägt die Klassiker beim Thema — mit 60 % von deren Compute.
Die Effizienz-Mechanik überträgt sich fast unverändert aus dem Video. Die Genauigkeit bleibt über eine 14×-Compute-Spanne an Drop-Raten flach; ein kausaler (GPT-artiger) Encoder kostet nichts gegenüber einem bidirektionalen; und mit korrekt gewichtetem Regularisierer erreicht das pure Rezept 86,2 % Themen-Genauigkeit — über den nachtrainierten BERT- und GPT-Baselines, die den vollen Text lesen.
86,2 % (kausal) / 86,1 % (bidirektional) vs. 85,9 % CLM / 85,6 % MLM — bei 60 % von deren Token-BudgetVertiefung: was sich übertrug, und das λ-Normierungs-Detail
Aufbau. Ein 63M-Parameter-Transformer (12 Schichten, d=512), from scratch auf wikitext-103 trainiert (118 Mio. Tokens), 20.000 Schritte bei Batch 512 × 256 Tokens. LeTJEPA: zwei unabhängig zu 70 % gedroppte Ansichten pro Sequenz, MSE-Invarianz zwischen ihren Zusammenfassungs-Vektoren plus SIGReg (λ=5,6 nach dem Audit unten); überlebende Tokens behalten ihre Originalpositionen. Baselines: CLM und MLM unter identischen Bedingungen auf vollen Sequenzen nachtrainiert. Der Drop-Raten-Sweep (30–95 %) läuft als separate 5.000-Schritt-Diagnosen. Auswertung: eingefrorene lineare Proben auf AG-News und STS-B, gemittelt über 3 Probe-Seeds.
Was hält
- Aggressives Schreddern ist gratis. Die Themen-Genauigkeit bleibt flach, während die Drop-Rate von 30 % auf 95 % steigt — eine 14×-Spanne im Compute. Der zentrale Video-Befund repliziert auf Sprache.
- Kausalität ist gratis. Ein kausaler Encoder hält mit einem bidirektionalen mit — Streaming-taugliche Embeddings ohne Genauigkeitspreis, spiegelbildlich zum Block-Causal-Ergebnis des Video-Papers.
- Sequenz-Level schlägt Token-Level auf dessen eigenem Terrain. Bei der Themen-Klassifikation — einer Aufgabe über den Kern eines Texts — führt pures LeTJEPA jetzt vor den klassischen Objectives, obwohl es nie mehr als 30 % einer Sequenz liest.
Das λ-Normierungs-Detail
Ein Konfigurations-Detail wiegt schwerer als alle anderen: Der Video-Code mittelt seinen Invarianz-Loss über die 256 Zusammenfassungs-Dimensionen, mein Port summierte. Bei gleichem λ heißt das ~280× schwächere Regularisierung — und das Training kollabiert. Mit dem entsprechend höheren λ≈5,6 (dem Paper-äquivalenten Wert, aus dem Abgleich mit der Referenz-Implementierung) trainiert alles stabil, und pures LeTJEPA gewinnt fast zwei Punkte. Das Mitteln des Originals ist vermutlich auch die bessere Konvention, weil das Gewicht dann nicht an der Dimensionszahl hängt.
Die Mechanik überträgt sich. Aber Thema ist der freundlichstmögliche Test für ein Gist-Objective — die echten Fragen sind, was es auf diesem Weg nicht lernen kann, und ob es Token-Vorhersage dort schlagen kann, wo die stark ist.
Bevor man Objectives direkt vergleicht, lohnt der Blick darauf, wann ein Sprachmodell welche Fähigkeit lernt.
Grammatik ist schnell, Bedeutung ist langsam: Ein Sprachmodell hat Grammatik nach den ersten 15 % des Trainings fertig gelernt.
Ein Modell, ein einziger Durchlauf über 10 Milliarden Tokens, drei Fähigkeiten an jedem Checkpoint gemessen. Grammatik plateaut nach ≈1,5 Mrd. Tokens; Satz-Bedeutung verbessert sich bis ≈3–4 Mrd.; Themenwissen bis ≈6 Mrd. Das meiste Trainings-Compute fließt in eine Fähigkeit, die das Modell im Kern fertig gelernt hat.
Grammatik-Plateau ≈1,5 Mrd. Tokens · Satz-Bedeutung ≈3–4 Mrd. · Thema ≈6 Mrd.Vertiefung: die Messung, und warum das Instrument zählt
Aufbau. Ein 63M-Modell, ein einziger Durchlauf über 9,91 Mrd. Tokens FineWeb-Edu — jede Sequenz genau einmal gesehen, keine Kurve durch wiederholte Daten verzerrt. Ein Checkpoint alle ~0,5 Mrd. Tokens; an jedem Checkpoint drei Messungen: BLiMP-Minimalpaar-Likelihoods für Grammatik (ohne Probe), STS-B-Kosinus-Korrelation für Satz-Bedeutung und eine eingefrorene AG-News-Probe fürs Thema.
Eine Nebenlektion für Praktiker: Der übliche Embedding-Probe-Test für Grammatik (CoLA) hat hier nichts gemessen — für jedes Modell auf dem Niveau der Majority-Baseline —, während Minimalpaar-Likelihoods (BLiMP) die Modelle sauber trennten. Das Instrument zählt.
Wenn Grammatik billig ist und Bedeutung teuer, sollte ein Sequenz-Level-Objective, das direkt auf Bedeutung zielt, eine nützliche Ergänzung zur Token-Vorhersage sein. Das war die Hypothese für das nächste Experiment — und sein Ergebnis sah wie eine saubere Bestätigung aus.
Die Kombination gewinnt — +1,8 Punkte Themen-Genauigkeit über dem besten Klassiker, bei 60 % des Compute.
Das kombinierte Objective ist einfach: Die zwei geschredderten Ansichten fließen ohnehin fürs Invarianz-Loss durchs Netz — also soll jedes überlebende Token zusätzlich seinen (meist geschwärzten) rechten Nachbarn vorhersagen. Null zusätzliches Encoder-Compute; GradNorm balanciert die beiden Losses automatisch. Epoch-matched, drei Probe-Seeds: 87,7 ±0,4 vs. 85,9 ±0,2 — mehr als vier Standardabweichungen.
87,7 ±0,4 vs. 85,9 ±0,2 Themen-Genauigkeit · >4σ · 1,58 vs. 2,62 Mrd. verarbeitete TokensVertiefung: das kombinierte Objective, und das Ergebnis, wie es dastand
Aufbau. Das kombinierte Objective ergänzt LeTJEPAs zwei gedroppte Ansichten um einen Token-Loss: Jedes überlebende Token sagt das nächste Token der Originalsequenz voraus (meist ein gelöschtes; Positionen mit überlebendem Nachbarn sind ausgeschlossen, um Kopieren zu verhindern). GradNorm balanciert die beiden Losses über gleiche Gradienten-Normen an der letzten Schicht. Alles andere wie in Befund 01: 63M, wikitext-103, 20.000 Schritte, epoch-matched gegen CLM/MLM auf vollen Sequenzen, 3 Probe-Seeds, kausale und bidirektionale Variante.
Beide Hälften schienen genau das zu tun, was das Lerndynamik-Kapitel vorhersagte: Der Invarianz-Term liefert das billige Semantik-Signal, der Token-Term hält das Modell nah an den einzelnen Wörtern. Die Kombination schlug Masked Language Modelling, Next-Token-Prediction, eine kontrastive Kontrolle und pures LeTJEPA — jedes pure Objective — und verarbeitete dabei 40 % weniger Text. Es replizierte mit kausalem und bidirektionalem Encoder.
Ein Zwei-Arm-Vergleich kann sie nicht beantworten, egal wie signifikant er ist: Die Kombination unterscheidet sich vom reinen Masked Language Modelling in zwei Dingen gleichzeitig — sie fügt den Invarianz-Loss hinzu, und ihre Token-Vorhersage arbeitet auf geschredderten Ansichten. Das Werkzeug, das verschränkte Zutaten trennt, ist die Ablation: genau eine löschen, alles andere festhalten. Hier heißt das ein dritter Arm — die geschredderte Token-Vorhersage allein, die komplette LeJEPA-Maschinerie (Invarianz, SIGReg, Projector) entfernt. Trägt der Invarianz-Term den Effekt, fällt dieser Arm auf die Baseline zurück; trägt das Schreddern selbst, hält er mit.
Der Ablations-Arm hielt mit.
Die Ablation: Geschredderte Token-Vorhersage allein hält beim Thema mit der Kombination mit — und schlägt sie bei der Bedeutung.
Invarianz-Loss, SIGReg und Projector löschen; nur die geschredderten Ansichten und die Nachbar-Vorhersage behalten. Dieses abgespeckte Objective erreicht 87,8 ±0,1 Themen-Genauigkeit und 0,47 Satz-Ähnlichkeit — gleichauf mit der Kombination beim Thema, klar besser bei der Bedeutung, bei denselben 60 % Compute. Der Vorsprung der Kombination ist also ein Sparse-Training-Effekt, kein Invarianz-Effekt.
87,8 ±0,1 Thema · 0,47 STS-B · 60 % Compute — ganz ohne JEPA-TermVertiefung: die volle Tabelle, die Maskierungsraten-Kontrolle, und die Einordnung in die Literatur
Aufbau. Die Ablation behält den Token-Arm der Kombination exakt bei — zwei zu 70 % gedroppte Ansichten, bidirektionale Attention, Nachbar-Ziele mit Kopier-Ausschluss — und löscht Invarianz-Loss, SIGReg und Projector. Die Maskierungsraten-Kontrollen trainieren Standard-MLM mit 40 % bzw. 80 % Masken auf vollen Sequenzen. Alle Arme: dieselbe 63M-Architektur, dieselben wikitext-103-Daten in derselben Reihenfolge, 20.000 Schritte, 3 Probe-Seeds; BLiMP wird bei kausalen Modellen autoregressiv gescored, bei bidirektionalen per Pseudo-Likelihood (Sternchen-Werte — nur innerhalb einer Familie vergleichen).
| Objective | Thema ↑ | Bedeutung ↑ | Grammatik ↑ | Compute |
|---|---|---|---|---|
| Geschredderte Token-Vorhersage allein (die Ablation) | 87,8 ±0,1 | 0,47 | 58,0* | 1,58 Mrd. |
| LeTJEPA × MLM (die Kombination) | 87,7 ±0,4 | 0,41 | —* | 1,58 Mrd. |
| LeTJEPA × CLM | 86,7 ±0,4 | 0,39 | 60,6 | 1,58 Mrd. |
| Pures LeTJEPA (λ=5,6, kausal / bidir) | 86,2 / 86,1 | 0,28 / 0,35 | — | 1,58 Mrd. |
| CLM (GPT-Rezept) | 85,9 ±0,2 | 0,34 | 66,1 | 2,62 Mrd. |
| MLM (BERT-Rezept, 15 % Masken) | 85,6 ±0,2 | 0,43 | —* | 2,62 Mrd. |
| MLM, 40 % Masken | 86,3 ±0,3 | 0,48 | 61,9* | 2,62 Mrd. |
| MLM, 80 % Masken | 86,1 ±0,3 | 0,45 | 57,0* | 2,62 Mrd. |
| TF-IDF (Wortzählen, 1970er) | 89,5 | 0,70 | — | — |
Frozen-Probe-Ergebnisse, 63M-Modelle, identische Daten & Architektur, epoch-matched; Thema ist AG-News (Mittel ± Std über 3 Probe-Seeds), Bedeutung STS-B-Spearman, Grammatik BLiMP (*kausale und bidirektionale Modelle nutzen unterschiedliches Scoring — nur innerhalb einer Scoring-Familie vergleichen).
Das Objective im Ganzen: Text schreddern, zufällige 30 % der Tokens an ihren Originalpositionen behalten, keine Mask-Tokens, kein Decoder — und jedes überlebende Token sagt seinen rechten Nachbarn im Originaltext voraus, der meist geschwärzt ist. Zwei unabhängige Shreds pro Sequenz, bidirektionale Attention, Positionen mit überlebendem Nachbarn ausgeschlossen (kein Kopieren). Das ist das ganze Rezept.
Ist das nur „mehr maskieren"? Die Forschung zu Maskierungsraten (Wettig et al., 2023) zeigte, dass 40 % Maskierung BERTs 15 % schlägt und 80 % noch überraschend gut funktioniert — die schärfste Null-Hypothese ist also, dass jede aggressive Korruption hierher führt. Die zwei Maskierungsraten-Baselines in der Tabelle testen genau das, bei sonst identischem Setup. Die Antwort: teilweise. Eine höhere Maskierungsrate hilft tatsächlich — bei 40 % Maskierung erreicht reines MLM Parität bei der Bedeutung (0,48 vs. 0,47) und gewinnt +0,7 beim Thema. Aber der Themen-Abstand zum echten Wegwerfen bleibt deutlich (86,3 vs. 87,8, weit jenseits des Seed-Rauschens) — und das maskierte Modell bezahlt dafür das 1,67-Fache an Compute, weil jeder [MASK]-Platzhalter weiter durchs Netz läuft. Bei 80 % Maskierung degradiert wieder alles. Tokens wirklich zu löschen bleibt die bessere und zugleich billigere Variante.
Einordnung in die Literatur: Jede Zutat existiert irgendwo — MAE-LM (ICLR 2024) entfernt Mask-Tokens aus dem Encoder, braucht aber einen Decoder; Googles Token-Dropping wirft Tokens mitten im Netz ab (Effizienz); Forgetful Causal Masking dünnt den Kontext im GPT-Training aus. Die spezifische Kombination hier — encoder-only, kein Decoder, keine Mask-Tokens, echtes Input-Level-Dropping, Nachbar-Ziele, evaluiert als eingefrorener Satz-Encoder — konnte ich nicht publiziert finden. Ich würde sie als decoder-freie Vereinfachung dieser Linie positionieren, nicht als neue Idee. In diesen Vergleichen liegt sie über allen Objectives, die ich ursprünglich testen wollte.
Er ist nicht nutzlos — er ist redundant, sobald ein starker Token-Anker da ist. Auf dem kausalen Arm, wo das Token-Signal schwächer ist, kauft der Invarianz-Loss weiterhin echten Semantik-Gewinn (0,39 vs. 0,32 STS-B). Und pures LeTJEPA bleibt das beste Objective der Tabelle, das ganz ohne Token-Vorhersage auskommt. Die nüchterne Zusammenfassung: Der Invarianz-Term liefert Gist-Semantik nur dort, wo sonst nichts sie liefert.
Warum bleibt das Invarianz-Objective auf Text hinter Video zurück? Die Token-Analyse gibt eine präzise Antwort.
Pure Invarianz kollabiert jedes Token auf den Kern des Texts — und kein View-Design entkommt: nicht Drop-Rate, nicht Blöcke, nicht lange Kontexte, nicht Video-artige Crops.
LeVJEPAs auffälligste Abbildung zeigt Video-Patches, die sich selbst organisieren, obwohl nur die Clip-Zusammenfassung supervidiert wird. Auf Text passiert das Gegenteil: Nach dem Training ist jede Token-Repräsentation einer Sequenz nahezu identisch mit jeder anderen (Kosinus 0,98–1,00) — jedes Token trägt eine Kopie des Text-Kerns. Das ist kein Bug. Es ist die mathematisch optimale Lösung des Objectives — und wir konnten zeigen, warum.
Token-Paar-Kosinus 0,99 · jeder Fluchtversuch scheiterte: Drop 0,3–0,95, Block-Shreds, 4096-Token-Kontexte, Video-artige lokale Crops, stärkeres SIGRegVertiefung: der visuelle Beleg, der versteckte Strafterm, und das systematische Scheitern jedes Fixes
Aufbau. Zwei Sorten Experiment. Analyse trainierter Modelle: paarweiser Kosinus zwischen allen Token-Repräsentationen einer Sequenz (32 zurückgehaltene Sequenzen), effektiver Rang und eine Wortarten-Probe auf eingefrorenen Tokens. Auswege: separate 5.000-Schritt-Trainingsläufe pro Design — Drop-Raten 0,3–0,95, zusammenhängende 16-Token-Blöcke als Drop-Einheit, 4.096-Token-Kontexte und LeVJEPA-artige Ansichten (eine globale + vier lokale Span-Ansichten), jeweils gleich vermessen; ein 9M-Parameter-Screening-Tier reproduzierte zuerst die bekannten Signaturen, sodass jede Variante Minuten statt Stunden kostet.
Unten ist jedes Wort danach eingefärbt, wie ähnlich seine interne Repräsentation dem Wort „inflation" ist (dunkler = ähnlicher). Ein Modell mit brauchbarer Token-Struktur sollte das zweite Vorkommen von „inflation" aufleuchten lassen und wenig sonst:
Pure LeTJEPA (invariance only)
The European Central Bank kept interest rates unchanged on Thursday, after raising them repeatedly over the past two years to curb stubbornly high inflation in the euro zone. Bank president Christine Lagarde said the central bank would continue to watch incoming economic data closely before deciding on its next step, and that inflation in the euro zone was expected to fall gradually next year.
Combined objective (invariance + token prediction)
The European Central Bank kept interest rates unchanged on Thursday, after raising them repeatedly over the past two years to curb stubbornly high inflation in the euro zone. Bank president Christine Lagarde said the central bank would continue to watch incoming economic data closely before deciding on its next step, and that inflation in the euro zone was expected to fall gradually next year.
Pures LeTJEPA ist fast gleichmäßig dunkel — seine Token-Repräsentationen sind auf einen globalen Kern kollabiert. Eine Wortarten-Probe auf den eingefrorenen Tokens bestätigt es: 41 % für pures LeTJEPA vs. 63–70 %, sobald irgendein Token-Level-Loss dabei ist.
Warum SIGReg das nicht verhindern kann — und der Invarianz-Loss es belohnt
SIGReg bewacht eine Sache: dass verschiedene Texte gut verteilte Zusammenfassungen bekommen. Auf die Tokens innerhalb eines Texts schaut es nie. Und der Invarianz-Loss belohnt den Kollaps aktiv: Die Zusammenfassung ist nahe an einem gewichteten Mittel der Token-Repräsentationen, und der quadrierte Abstand zweier Shred-Zusammenfassungen ist proportional zur Token-Varianz innerhalb der Sequenz. Alle Tokens identisch zu machen ist kein Fehlermodus dieses Objectives — es ist sein Optimum. Beide Bedingungen, „Texte gut verteilt" und „Tokens alle gleich", sind gleichzeitig perfekt erfüllbar; das Training findet schlicht diesen Punkt.
Jeder Ausweg, getestet — keiner funktionierte
- Drop-Rate: Die Homogenisierung wächst monoton von Drop 0,3 bis 0,95 (Kosinus 0,93 → 0,997) — exakt wie die Varianz-Formel es vorhersagt, denn der Strafkoeffizient skaliert mit eins durch die Zahl der behaltenen Tokens.
- Zusammenhängende Blöcke (16 Tokens wie ein Bild-Patch behandeln): lexikalisch nicht von zufälligem Droppen bei gleicher Rate zu unterscheiden — kein Effekt.
- Längere Kontexte (4096 Tokens): Verstreute Shreds werden nur repräsentativer für den Text — die Invarianz-Aufgabe wird leichter, nicht schwerer.
- Video-artige lokale Crops (eine globale Ansicht, vier lokale Span-Ansichten — das Design, das im Video die Emergenz erzeugt): Bei kurzen Kontexten sind die Spans so redundant wie Shreds; bei langen entsteht endlich echter Vorhersagedruck (der Loss bleibt hoch) — und fließt in Teil-Kollaps oder bloße Kern-Glättung statt in Token-Struktur. Auch mit dem korrigierten, stärkeren SIGReg entsteht keine Token-Identität.
Im Video unterbestimmt der Inhalt eines lokalen Crops den Clip wirklich — das Ganze aus dem Teil vorherzusagen erfordert Patches, die wissen, was wo ist. Im Text ist das, was ein Ausschnitt über sein Dokument verrät, selbst schon eine Zusammenfassung: ein Thema, ein Stil, eine Tonlage. Token-Identität reduziert die Restunsicherheit nicht — also bezahlt das Objective nie dafür. Wenn das stimmt, ist die für Video berichtete emergente Struktur keine Eigenschaft des JEPA-Rezepts, sondern eine Eigenschaft dessen, wie viel ein Teil eines Bildes über das Ganze sagt — was Text in dieser Größenordnung schlicht nicht teilt.
Einen Preis zahlen alle geschredderten Objectives gemeinsam: Grammatik. Das legte ein weiteres Experiment nahe.
Schreddern kostet Grammatik — und ein dichter 64-Token-Span als zweiter Loss holt die Hälfte zurück.
Jedes Objective, das nur geschredderten Text liest, verliert 4–6 BLiMP-Punkte gegen ein reines GPT-Modell: Nachbar-Vorhersage über geschreddertem Kontext ist ein schlechter Grammatiklehrer. Aber Grammatik ist lokal — das Lerndynamik-Kapitel zeigte, dass sie zuerst sättigt, und sie lebt im Satz, nicht im Dokument. Also: die Shred-Ansichten für Semantik behalten, und dichte Next-Token-Prediction auf einem kurzen zusammenhängenden Span pro Sequenz ergänzen, an Originalpositionen, ohne Kontext davor.
BLiMP 60,6 → 63,8 (+3,2) bei gehaltenen Semantik-Werten · das dichte Voll-Sequenz-Modell bleibt mit 66,1 die DeckeVertiefung: das Span-Design und sein exakter Trade-off
Aufbau. Identisch zur Kombination, mit einer Änderung: Der Token-Loss wandert von den geschredderten Ansichten auf einen dichten, zusammenhängenden 64-Token-Span pro Sequenz, an zufälliger Position gezogen, an Originalpositionen belassen, ohne Kontext davor. GradNorm balanciert Span-Loss und Invarianz-Loss. 20.000 Schritte, epoch-matched, kausaler Encoder, 3 Probe-Seeds; Grammatik autoregressiv gescored (innerhalb dieser Tabelle vergleichbar).
| Objective (kausaler Arm) | Thema ↑ | Bedeutung ↑ | Grammatik ↑ | Compute |
|---|---|---|---|---|
| CLM (dicht, volle Sequenz) | 85,9 ±0,2 | 0,34 | 66,1 | 100 % |
| Geschreddertes CLM | 86,2 ±0,1 | 0,32 | 61,9 | 60 % |
| LeTJEPA × geschreddertes CLM | 86,7 ±0,4 | 0,39 | 60,6 | 60 % |
| LeTJEPA × dichter 64-Token-Span | 86,3 ±0,2 | 0,40 | 63,8 | 85 % |
Die Span-Variante bestätigt den Mechanismus aus Kapitel 2 auf einem zweiten Weg: Grammatik reagiert auf ein dichtes, lokales Signal — 64 zusammenhängende Tokens pro Sequenz holen +3,2 BLiMP-Punkte gegenüber der geschredderten Kombination zurück, während die Semantik-Werte halten. An die Decke des dichten Voll-Sequenz-Modells kommt sie nicht heran, und sie gibt einen Teil der Compute-Ersparnis zurück. Die offene Synthese — geschredderte Token-Vorhersage (das beste Objective aus Kapitel 4) plus dichter Span für Grammatik — ist der offensichtliche nächste Lauf.
Was bei dieser Größenordnung belegt ist — und was nicht.
Die kontrollierten Vergleiche laufen bei 63M Parametern, mit Absicht, für Ein-GPU-Sorgfalt; ein Screening-Tier mit 9M-Modellen machte die Iterationsschleife zu Minuten statt Stunden. Die Kern-Abstände liegen bei >4σ auf dem Probe-Rauschen — aber mehrere der größten Aussagen ruhen auf einem Korpus und einem Pretraining-Seed.
Ein Pretraining-Seed pro Objective · das beste Objective bisher nur auf wikitext bestätigt · TF-IDF bleibt bei Rohwerten vornVertiefung: die Grenzen-Liste, und was als Nächstes läuft
- Die 1970er-Referenz gewinnt bei Rohwerten weiter. TF-IDF schlägt hier jedes neuronale Modell bei Thema und Ähnlichkeit — auf lexikalischen Benchmarks, bei dieser Größenordnung, mit diesen Daten. Mehr Daten halfen den Modellen deutlich (Thema 84→88,3 bei 10 Mrd. Tokens); Parameter allein nicht, und spät im Single-Epoch-Training driften die Ähnlichkeits-Werte aller Objectives nach unten — ein offener, Objective-unabhängiger Effekt. Belastbar sind Aussagen darüber, welches Objective mehr pro Compute lernt, nicht absolute Überlegenheit.
- Das beste Objective ist bisher nur auf wikitext bestätigt. Die 10-Mrd.-Token-Bestätigung auf FineWeb für die geschredderte Token-Vorhersage ist der wichtigste fehlende Lauf.
- Scoring-Vorbehalt. BLiMP-Zahlen sind nur innerhalb einer Scoring-Familie vergleichbar (kausale Modelle scoren autoregressiv, bidirektionale per Pseudo-Likelihood).
- Seeds. Probe-Seeds sind gemittelt (3); die Replikation über Pretraining-Seeds ist eingereiht.
- Verwandte Arbeiten, geprüft. JEPA-Objectives für Sprache existieren: LLM-JEPA ergänzt den Standard-LM-Loss um einen JEPA-Term, braucht aber natürlich gepaarte Ansichten (Text↔Code), und BERT-JEPA aligniert Übersetzungspaare auf einem nachtrainierten mehrsprachigen Encoder — und nennt SIGReg ausdrücklich als Future Work. Was ich zum Zeitpunkt des Schreibens nicht finden konnte: eine LeJEPA/SIGReg-Anwendung auf Rohtext, oder eine publizierte Version der siegenden Shred-Vorhersage-Variante. Beim Tempo des Felds hat diese Aussage eine kurze Haltbarkeit.
Alles — Code, 25 Einzelbefunde mit Commit-Hashes und die negativen Ergebnisse — liegt als reproduzierbares Forschungslog vor. Wer an effizientem Pretraining oder selbstüberwachten Objectives arbeitet und sich austauschen will: mein Postfach ist offen.