Die wichtigsten Punkte:
  • Der neueste KI-Sprung kam nicht von größerem Training. Er kam davon, Modelle beim Fragen länger denken zu lassen, mit extra Rechenleistung, bevor sie antworten.
  • Dieses Denken läuft in versteckten Tokens, die du nie siehst, aber bezahlst, eine einzige schwere Frage kann also ein Vielfaches einer normalen kosten.
  • Das drehte die Kostenstruktur der KI um: 2026 verbrennt der Betrieb der Modelle (Inferenz) mehr Rechenleistung und Geld als ihr Training, was Chips und Margen neu formt.

Der Aufhänger

Jahrelang machte man KI klüger, indem man sie größer machte: mehr Daten, mehr Parameter, größere Trainingsläufe. Diese Kurve flachte ab. Die neuen Fortschritte kamen aus einer anderen Idee, das Modell länger denken zu lassen, wenn man es etwas fragt, statt aus dem Reflex zu antworten. Die Branche nennt es Test-Time Compute, und es hat sowohl die Technik als auch die Ökonomie leise umgebaut.

Was Test-Time Compute wirklich ist

Ein normales Modell antwortet in einem Durchgang, als würde es das Erstbeste herausplatzen. Ein Reasoning-Modell hält inne und arbeitet das Problem durch, probiert Ansätze, prüft sich, geht zurück, bevor es antwortet. Es tut das, indem es eine lange innere Gedankenkette erzeugt, versteckte Reasoning-Tokens, die nie in der Chat-Blase auftauchen. Mehr Denken heißt mehr Tokens und bessere Antworten bei schweren Problemen. Es ist der Unterschied zwischen System 1, schnell und instinktiv, und System 2, langsam und überlegt.

Wie sie das Denken lernen

Der Trick ist Reinforcement Learning. Man nimmt ein Basismodell, setzt es in eine Umgebung, die korrekte Antworten auf schwere Probleme belohnt, und lässt es lernen, dass Schritt-für-Schritt-Denken sich auszahlt. Modelle wie OpenAIs o-Reihe und DeepSeeks R1 wurden so gebaut. Das Bemerkenswerte: DeepSeek-R1 erreichte ein viel teureres Modell teils dadurch, dass es 10- bis 100-mal mehr Tokens pro Frage erzeugte. Es tauschte rohe Größe gegen rohe Denkzeit.

Warum es so viel kostet

Hier ist der Haken, den die meisten nie sehen. Diese versteckten Denk-Tokens sind echte Rechenleistung, und du wirst dafür bezahlt, also zahlst du. Ein Reasoning-Modell kann in der Größenordnung von 150-mal mehr Rechenleistung verbrauchen als eine schlichte Antwort, und bei manchen schweren Aufgaben liegen die Energiekosten über 100-mal höher. Die kluge Antwort ist also langsamer und dramatisch teurer, und der Preis skaliert damit, wie schwer die Frage ist. Deine Rechnung hängt jetzt davon ab, wie viel das Modell zu denken beschloss.

Warum das das ganze Geschäft verändert

Das ist der große Punkt. Ein Modell zu trainieren ist eine große einmalige Kosten. Es zu betreiben ist eine Kosten, die du für immer zahlst, bei jeder einzelnen Anfrage. Sobald ein Modell milliardenfach am Tag aufgerufen wird, übersteigen die Betriebskosten die Trainingskosten bei Weitem. Anfang 2026 gab die Welt zum ersten Mal mehr für KI-Inferenz aus als für Training, Inferenz macht jetzt rund zwei Drittel der gesamten KI-Rechenleistung aus. Deshalb schwenken Nvidia und andere hart Richtung Inferenz-Ökonomie, Kosten pro Token statt nur Trainings-Pferdestärken.

Was es für Anleger bedeutet

Folge der Rechenleistung. Der KI-Trade verschiebt sich von wer das größte Modell trainiert zu wer Antworten am günstigsten in großem Maßstab liefert. Das begünstigt inferenz-optimierte Chips, effizientes Ausliefern und jeden, der die Kosten pro Token senken kann. Es macht auch KI-Bruttomargen zu einer echten Frage, denn jede clevere Reasoning-Antwort frisst variable Kosten. Und achte auf das Overthinking-Problem: Mehr Denken ist nicht immer besser, es trifft auf abnehmenden Ertrag und kann sogar schaden, Effizienz wird also zum Vorteil, nicht rohes Denken.

FAQ

Ist ein Reasoning-Modell immer besser als ein normales?
Nein. Es hilft stark bei schweren, mehrstufigen Problemen wie Mathe und Code, aber bei einfachen Fragen verbrennt es nur Zeit und Geld ohne Gewinn. Bei manchen Wissensaufgaben hilft es noch nicht. Passe das Werkzeug zur Aufgabe.

Warum kann ich das Modell nicht denken sehen?
Die meisten Labore verbergen die Gedankenkette, teils zum Schutz ihrer Methode, teils weil sie unordentlich ist. Du zahlst trotzdem für diese versteckten Tokens, weshalb eine kurze Antwort eine überraschend hohe Rechnung tragen kann.

Was ist die Anleger-Lehre in einem Satz?
Inferenz ist das neue Schlachtfeld. Das Geld wandert vom Trainieren des Modells zum Betreiben, die Gewinner werden also die sein, die eine gute Antwort zu den niedrigsten Kosten pro Token liefern.