- KI wurde klug, indem sie quasi das ganze Internet las, und es wird knapp. Schätzungen setzen die Erschöpfung hochwertigen menschlichen Texts zwischen 2026 und 2032 an.
- Der Ausweg, das Training mit KI-erzeugten synthetischen Daten, hat eine Falle namens Modellkollaps, bei der jede Generation fader wird, wenn nicht echte Daten dabeibleiben.
- Daten werden zu einer knappen, bezahlten Ressource, weshalb Lizenzdeals explodieren und der Besitz einzigartiger Daten der neue Burggraben ist.
Der Aufhänger
Zwei Kräfte bestimmen, wie gut KI wird: Rechenleistung und Daten. Alle reden über Chips und Gigawatt. Viel weniger reden über die andere Grenze, die vielleicht zuerst zubeißt. Die Modelle lernten, indem sie das Internet lasen, und es gibt nur ein Internet. Forscher meinen nun, der Vorrat an hochwertigem menschlichem Text, der gut genug zum Trainieren ist, geht irgendwann zwischen 2026 und 2032 aus.Was die Datenmauer wirklich ist
Moderne Modelle werden auf riesigen Textmengen trainiert, gemessen in Billionen Tokens, ein Token ist ungefähr ein Wortteil. Epoch AI schätzte, dass das hochwertige öffentliche Internet rund 300 Billionen Tokens enthält, und Frontier-Modelle trainieren schon auf einem beträchtlichen Teil davon. Das Problem: Gute Daten wachsen nicht so schnell wie der Appetit der Modelle. Treibt man die Skalierung ein paar Jahre weiter, laufen die Labore in eine Mauer: Sie haben alles Lesenswerte gelesen. Das ist die Datenmauer.Warum man nicht einfach mehr machen kann
Der naheliegende Ausweg sind synthetische Daten, also KI ihr eigenes Trainingsmaterial erzeugen lassen. Das funktioniert bis zu einem Punkt, und es birgt ein berühmtes Risiko namens Modellkollaps. Trainiere ein Modell auf den Ausgaben früherer Modelle, Generation für Generation, und es verliert langsam die seltenen, schrägen, echten Ränder menschlichen Schreibens und driftet zu fadem, durchschnittlichem Text, eine Kopie einer Kopie einer Kopie. Die Forschung hat eine Lösung: synthetische Daten mit echten mischen, statt sie zu ersetzen. Das hält das Modell an der Realität verankert, und es heißt, echte menschliche Daten bleiben unverzichtbar.Warum Daten teuer wurden
Deshalb entstand fast über Nacht ein Markt für Datenlizenzen. Öffentliche KI-Content-Deals gingen von quasi null 2022 auf rund 90 bis Ende 2025, und die Preise steigen weiter. Reddit, jetzt die meistzitierte Einzelquelle in KI-Modellen, schloss Deals mit Google und OpenAI, die sich auf zusammen rund 550 Millionen Dollar im Jahr neu bepreisen könnten. Auch Nachrichtenverlage unterschreiben. Wenn der Rohstoff knapp wird, wird bezahlt, wer einen einzigartigen, hochwertigen Vorrat davon besitzt.Was es für Anleger bedeutet
Folge wieder dem knappen Rohstoff. War Rechenleistung die Engpass-Geschichte der letzten zwei Jahre, sind Daten die leisere darunter. Firmen mit großen, einzigartigen, menschlichen Datensätzen, Foren, Verlage, Nischenarchive, halten plötzlich ein echtes Asset. Eigene Daten werden zu einem Burggraben, den Geld allein nicht schnell nachbauen kann, weshalb OpenAI mehr Lizenzdeals geschlossen hat als fast jeder andere. Für Nutzer deutet es auch an, dass künftige Fortschritte eher aus besseren, saubereren, exklusiven Daten kommen als aus roher Größe.Steht KI also kurz vor dem Stillstand
Wohl kein Stillstand, und die leichten Gewinne daraus, einfach mehr Text zu füttern, schwinden. Der nächste Vorteil kommt daraus, mehr aus denselben Daten zu holen: klügeres Training, Denken zur Inferenzzeit, multimodale Daten wie Video und Audio und exklusive Quellen, an die andere nicht herankommen. Die Ära kostenloser, unendlicher Trainingsdaten geht zu Ende. Was sie ersetzt, sind Daten als gemanagte, bezahlte, strategische Ressource.FAQ
Haben sie nicht schon alles trainiert? Wie kann es eine Mauer geben?Sie haben den Großteil des leichten, hochwertigen öffentlichen Texts trainiert, ja. Die Mauer ist, dass dieser Vorrat ungefähr fest ist, während der Bedarf der Modelle weiter wächst, und die wirklich guten Daten, kein Spam, keine Dubletten, sind ein kleinerer Teil, als es aussieht.
Wenn synthetische Daten Kollaps verursachen, warum sie überhaupt nutzen?
Weil sie vorsichtig genutzt helfen, besonders bei engen Fähigkeiten wie Mathe und Code, wo man die Antwort prüfen kann. Die Gefahr ist, echte Daten über Generationen durch synthetische zu ersetzen. Beigemischt zu menschlichen Daten sind sie ein Werkzeug, keine Falle.
Worauf sollte ich als Anleger achten?
Achte darauf, wer einzigartige Daten besitzt und wer dafür zahlt. Lizenzdeals, Content-Partnerschaften und exklusive Archive werden zu Bilanz-Assets. Die Firmen, die knappe, hochwertige Daten kontrollieren, haben vielleicht mehr Hebel als die, die nur Chips kaufen.
