KI-Versorgungskrise: Die Getreidespeicher sind voll, aber der Reis ist nicht gewaschen.
Anfang 2025 sagte Musk in einer Live-Übertragung einen Satz, der die gesamte Branche erschaudern ließ: Wir haben die kumulative Summe des menschlichen Wissens im Grunde bereits erschöpft.
Im selben Jahr wandte sich Ilya Sutskever – derjenige, der das Scaling Law persönlich auf den Thron gehoben hat – um und sagte: Die 2010er Jahre waren die Ära der Skalierung, jetzt sind wir zurück in der Ära der Überraschungen und Entdeckungen. Jeder sucht nach dem nächsten Durchbruch.
Bis 2026 erhielt diese Debatte einen einheitlichen Namen: Datenwand.
He Baohong, Chefingenieur der China Academy of Information and Communications Technology, drückte es auf einer Konferenz im Mai noch deutlicher aus: Das Vortraining von Modellen im Internet ist bereits auf die Datenwand gestoßen. Die öffentlichen Daten sind vollständig aufgebraucht, und es lassen sich kaum neue Datenquellen finden, um die Fähigkeiten der Modelle effektiv zu steigern.
Das klingt beängstigend. Alle KI-Labore der Welt kämpfen um dieselbe immer kleiner werdende Rohstoffmenge, wie eine Gruppe von Bergarbeitern, die das Ende einer Ader erreicht haben.
Aber nachdem ich so viele Jahre an vorderster Front mit Daten gearbeitet habe, war meine erste Reaktion auf diese Berichte keine Panik, sondern eine sehr unzeitgemäße Frage:
Im Jahr 2025 betrug die gesamte in China erzeugte Datenmenge 52,26 ZB, was einem Anstieg von 27,28 % gegenüber dem Vorjahr entspricht und 27,44 % der globalen Gesamtdatenmenge ausmacht.
Was bedeutet 52 Zettabyte? 1 ZB entspricht 10 hoch 21 Byte. Diese Zahl wächst weiterhin jährlich um mehr als ein Viertel.
Auf der einen Seite explodieren die Daten mit einer Geschwindigkeit von mehreren zehn ZB pro Jahr, auf der anderen Seite klagen die Modellanbieter, dass sie nichts mehr zu füttern haben.
Das nennt man keine Hungersnot. Das nennt man: Das Getreidespeicher ist voll, aber der Reis wurde nicht gewaschen.
Bei der KI mangelt es nicht an Daten, sondern an Daten, die direkt verarbeitet werden können.
Der Unterschied zwischen beiden ist der gesamte Grund für die Existenz des Handwerks der Datenverwaltung.
1. Das Getreide ist alle: Drei Zahlen
Eile nicht, zu widersprechen, zeige alle Beweise, die die These vom „Nahrungsmangel“ stützen. Sie sind keine Panikmache, sondern basieren auf Berechnungen.
Erste Zahl: 300 Billionen
Eine Studie von Epoch AI liefert eine weithin zitierte Schätzung: Der Gesamtbestand an hochwertigen, öffentlich zugänglichen menschlichen Texten im Internet beträgt etwa 300 Billionen Token.
Dieser Pool enthält Wikipedia, Open-Source-Code-Repositories, wissenschaftliche Zeitschriften, digitale Bibliotheken und Forendiskussionen, die über mehr als zwanzig Jahre angesammelt wurden. Das klingt nach einer unermesslichen Menge – aber es ist begrenzt.
In den letzten drei Trainingszyklen haben die Spitzenmodelle es fast vollständig aufgebraucht. Jedes digitalisierte Buch, jedes öffentliche GitHub-Repository, jeder Reddit-Beitrag von 2008 bis 2022 und jede offen zugängliche medizinische Arbeit wurde in neuronale Netzwerkgewichte umgewandelt.
Und die Geschwindigkeit, mit der Menschen neue Bücher und neue Arbeiten schreiben, kann mit dem exponentiell wachsenden Appetit der nächsten Generation von Trainingsclustern bei weitem nicht mithalten.
Zweite Zahl: 25 %
Wenn der begrenzte Bestand eine Naturkatastrophe ist, dann ist dies eine von Menschen verursachte Katastrophe.
Die von MIT geleitete „Data Provenance Initiative“ führte eine Studie durch, um die Veränderungen der drei gängigen Trainingsdatensätze C4, RefinedWeb und Dolma zu untersuchen. Das Fazit lautet: Innerhalb nur eines Jahres wurden 5 % aller Daten und 25 % der hochwertigsten Quellen mit Zugriffsbeschränkungen belegt.
Die New York Times, Reddit, Stack Overflow und eine große Anzahl von Nachrichtenagenturen haben entweder ihre Nutzungsbedingungen geändert oder direkt technische Sperren implementiert.
Beachte die 25 %: Das, was gesperrt wurde, ist kein Überrest, sondern genau der Teil mit der höchsten Qualität. Es ist, als wäre der Getreidespeicher nicht leer, aber die besten Säcke wurden verschlossen.
Dritte Zahl: 2026–2032
Nach Berechnungen von Epoch AI werden hochwertige, von Menschen erzeugte Texte zwischen 2026 und 2032 vollständig aufgebraucht sein, wobei der genaue Zeitpunkt vom Grad der Aggressivität des „Übertrainings“ der Labore abhängt.
Interessanterweise verschiebt sich dieser Zeitraum nach hinten. Ihre frühere Schätzung war pessimistischer und wurde später verschoben. Diese Korrektur selbst zeigt eines: Die Position dieser Wand ist berechnet, nicht angefahren.
Und die ältere Arbeit aus dem Jahr 2022 prognostizierte, dass hochwertige englische Texte bis 2026 aufgebraucht sein würden. Aus der Perspektive des Jahres 2026 betrachtet, ist die Genauigkeit dieser Prognose wirklich unangenehm.
2. Es gibt kein Mangel an Getreide, sondern es kann nicht genutzt werden
Jetzt erlauben Sie mir, diese unzeitgemäße Frage auszuführen.
Der Unterschied zwischen 52,26 ZB und 300 Billionen Token ist nicht nur eine Größenordnung, sondern eine Eigenschaft.
Machen wir eine grobe Umrechnung, um ein Gefühl zu bekommen. Ein chinesisches Zeichen entspricht etwa 1,5 bis 2 Token, bei einem Mittelwert entsprechen 300 Billionen Token etwa 180 Billionen chinesischen Zeichen. Das klingt viel, aber 1 ZB ist 10 hoch 21 Byte – selbst wenn man nur Texte zählt, übersteigt die Datenmenge von mehreren zehn ZB diese Zahl bei weitem.
Dann stellt sich die Frage: Wo sind die restlichen Daten?
Die Antwort lautet – sie sind fast alle an drei Orten gesperrt.
Erster Ort: Der private Bereich von Unternehmen. Wie viele Jahre an Auftragsaufzeichnungen in Ihrem ERP laufen, wie viele echte Anrufe in Ihrem Kundensystem gespeichert sind, wie viele Fehleranalyseberichte Ihre F&E-Abteilung angesammelt hat. Diese Daten waren nie im Internet und können nicht von Crawlern erfasst werden. Sie sind die größte Gruppe von „unerschlossenen Getreidefeldern“ auf diesem Planeten.
Zweiter Ort: Innerhalb von Regierungen und Institutionen. Gesundheitswesen, Justiz, Bildung, Meteorologie, natürliche Ressourcen. Diese Daten sind riesig und von hoher Qualität, aber aus Gründen der Compliance und Souveränität werden die meisten nicht für das Training kommerzieller Modelle freigegeben.
Dritter Ort: Die physische Welt. In dem Artikel der Lernzeitung gibt es einen aufschlussreichen Vergleich: Die Größe der Trainingskorpora, die die Fähigkeitssteigerung allgemeiner Großmodelle unterstützen, erreicht die Größenordnung von Billionen Token, während die hochwertigen Datensätze für die Interaktion mit echten Geräten, die weltweit für das Training von verkörperter Intelligenz verwendet werden, im Allgemeinen noch die Größenordnung von Millionen von Trajektorien haben. Es fehlen mehrere Größenordnungen.
Daher lautet die Wahrheit: Es gab noch nie so viele Daten auf der Erde wie heute, und der kleine Teil, den die Modelle legal, kostengünstig und hochwertig erhalten können, geht zur Neige.
Das ist keine Ressourcenerschöpfung. Das ist ein strukturelles Versagen auf der Angebotsseite – das Getreide ist im Speicher, aber es gibt keinen Kanal, um es zu zu verarbeitendem Reis zu machen.
3. Das Internet wird von seinem eigenen Abwasser verschmutzt
Es gibt noch etwas, das problematischer ist als der „begrenzte Bestand“, und viele Menschen sind sich dessen nicht bewusst.
In den zwei Jahren von 2023 bis 2025 haben Millionen von automatischen Veröffentlichungsrobotern, SEO-Inhaltsfarmen und Affiliate-Marketing-Tools Milliarden von Seiten kostengünstiger, maschinell erzeugter Texte in das öffentliche Internet eingespeist.
Bis 2026 wird, wenn ein Labor das offene Netz durchsucht, das, was es erfasst, höchstwahrscheinlich synthetischer Text sein, der von den Modellen des letzten Jahres erzeugt wurde.
Es gibt eine scharfe, aber treffende Aussage: Die KI-Branche hat ihre eigene Wasserquelle verschmutzt.
Was sind die Folgen? Heute verbringen Forscher mehr Ingenieurzeit damit, Filter zu bauen, um maschinell erzeugte Texte zu erkennen und zu verwerfen, als damit, die eigentliche Architektur zu trainieren.
Das führt zu einer besonders absurden Situation –
Um die Datenwand zu umgehen, nutzt die Branche in großem Umfang KI-generierte Inhalte; und die Überfülle an KI-generierten Inhalten lässt die verbleibenden echten Daten noch tiefer untergehen. Je eiliger Sie das Problem lösen wollen, desto teurer wird das Problem.
So entstand die seltsamste Enteignungsbewegung in der Wirtschaftsgeschichte: Saubere, überprüfte Texte, die vor 2022 von echten Menschen geschrieben wurden, sind zu digitalem Gold geworden.
Technologieunternehmen geben Hunderte Millionen Dollar aus, um geschlossene private menschliche Archive zu erwerben – jahrzehntelange Krankenakten von Krankenhausnetzen, Kundenservice-Anrufaufzeichnungen von Telekommunikationsgiganten, gescannte physische Archive von historischen Gesellschaften. Verlage, Zeitungsgruppen und Forenplattformen, die einst als „Überreste der traditionellen Medien“ galten, erhielten plötzlich eine große Verhandlungsmacht in Lizenzverhandlungen.
Wenn Sie über zwanzig Jahre von Forendiskussionen verfügen, die von echten Menschen geschrieben wurden und sich um echte Fehler in der physischen Welt drehen – dann sitzen Sie auf einem unersetzlichen Trainingsvermögen, das nicht künstlich hergestellt werden kann.
4. Sind synthetische Daten ein Retter? Zum Teil ja, zum Teil nein
Wenn das Getreide nicht reicht, stellt man es selbst her – das ist eine instinktive Reaktion. Wie groß ist das Ausmaß der Reaktion der Branche? Sehen Sie sich zwei Zahlen an:
Nach Schätzungen sind bereits 30 % bis 60 % der Trainings-Token im Training aktueller Spitzenmodelle synthetisch und nicht durch Crawlen erfasst.
Gartner prognostiziert, dass bis Ende 2026 synthetische Daten etwa 75 % aller für die KI-Entwicklung verwendeten Daten ausmachen werden – während dieser Anteil im Jahr 2021 etwa 1 % betrug.
75-fache Zunahme in fünf Jahren. Diese Kurve ist steiler als die Iteration jedes einzelnen Modells.
Aber der Preis ist: Der Modellkollaps
Die bahnbrechende Studie in der Nature hat klar demonstriert, was beim rekursiven Training passiert:
In der ersten Generation werden winzige statistische Fehler und Randfälle geglättet; in der dritten Generation beginnt das Modell, seltene Fakten, ungewöhnliche sprachliche Nuancen und die Ansichten von Minderheiten zu vergessen; in der fünften Generation entartet die Ausgabe zu sich wiederholendem, niedrigvarianten Unsinn.
Der Mechanismus ist eigentlich leicht zu verstehen. Ein Sprachmodell ist eine Wahrscheinlichkeitsvorhersage-Engine, die aus dem Zentrum der menschlichen Verteilung probt und gängige Wörter und typische Strukturen bevorzugt. Wenn Sie das Modell mit synthetischen Daten trainieren, trainieren Sie mit einer „Annäherung der Annäherung“ – die Enden der Wahrscheinlichkeitsverteilung verschwinden.
Dieser Prozess ähnelt der biologischen Inzucht: Jede Generation verstärkt kleine Mängel ein wenig.
Daher ist das Verhältnis, das die meisten Mainstream-Teams verwenden, sehr einheitlich: 30 % bis 50 % synthetische Daten, der Rest muss echt und manuell kuratiert sein. Trainieren Sie niemals mit rein synthetischen Daten, behalten Sie immer eine kleine Menge von von Menschen erzeugten Seed-Daten als Ankerpunkt.
Die Gegenmeinung hat auch Recht: AlphaGo hat genau so gewonnen
Aber synthetische Daten pauschal zu verurteilen, ist auch nicht richtig. Es gibt ein zu starkes Gegenbeispiel, das man nicht umgehen kann.
AlphaGo lernte zuerst menschliche Spielpartien, dann spielte es Millionen von Partien gegen sich selbst und zog schließlich Züge, die Menschen nie gespielt haben. Es übertraf die Menschen, gerade weil es nicht mehr auf menschliche Daten beschränkt war.
Übertragen Sie diese Logik auf Mathematik und Programmierung – KI kann neue mathematische Aufgaben und Lösungen erzeugen, überprüfen, ob die Lösungen korrekt sind, und dann mit diesen überprüften synthetischen Daten trainieren. Da Mathematik und Code objektive Standardantworten haben, wird das Volumen der effektiven Trainingsdaten nahezu unbegrenzt.
SynthLLM von Microsoft Research Asia funktioniert genau so: Es verwendet Graphalgorithmen, um hochrangige Konzepte aus vorhandenen Korpora zu neuen synthetischen Proben neu zu kombinieren, speziell um die Abhängigkeit vom Crawlen aus dem Web zu verringern.
Wer hat also Recht?
Der Engpass bei synthetischen Daten ist nie der Generator, sondern der Prüfer.
In allen Bereichen, in denen ein objektiver Bewertungsstandard existiert – ob Code kompiliert werden kann, ob Mathematik gültig ist, wer ein Spiel gewinnt – kann Selbstspiel funktionieren und sich unbegrenzt ausdehnen. In allen Bereichen, die auf menschliches Urteil angewiesen sind – kreatives Schreiben, feine Nuancen, Ästhetik und Entscheidungen – beschleunigen synthetische Daten nur die Degeneration, weil niemand dem Modell zuverlässig sagen kann „das ist besser“.
Mit anderen Worten: Sie können nur so viele synthetische Daten erzeugen, wie Sie überprüfen können. Und die privaten Daten von Unternehmen sind im Wesentlichen ein fertiger Prüfer.
5. Chinas Lösung: Kein neues Getreide suchen, das alte Getreide waschen
Dieser Abschnitt ist der Teil, den ich am liebsten schreiben möchte. Denn angesichts derselben Wand sind die Reaktionslogiken auf beiden Seiten völlig unterschiedlich.
Die Mainstream-Erzählung im Silicon Valley lautet „neues Getreide suchen“ – Urheberrechte kaufen, synthetische Daten erzeugen, auf Multimodalität setzen, auf verkörperte Intelligenz setzen.
Die Antwort Chinas ist eine andere: Das vorhandene Getreide gründlich waschen.
Am 3. Juni 2026 veröffentlichte das Nationale Datenbüro den „Umsetzungsplan zur Förderung der Aktion zum Aufbau hochwert