- KI-Agenten scheitern vor allem, weil sich kleine Fehler über viele Schritte multiplizieren. Eine 95-Prozent-Erfolgsrate pro Schritt fällt über 20 Schritte auf rund 36 Prozent.
- Je länger die Aufgabe, desto schlimmer. Der Erfolg fällt jenseits einer halben Stunde steil ab, und das Verdoppeln der Aufgabenlänge vervierfacht ungefähr die Fehlerquote.
- Deshalb glänzen Agenten in Demos und brechen in der Produktion, und deshalb ist Zuverlässigkeit das harte Problem von 2026.
Der Aufhänger
2026 ist das Jahr der KI-Agenten. Jedes Labor bringt Systeme heraus, die eigenständig handeln: die Reise buchen, den Code schreiben und ausführen, eine Aufgabe von Anfang bis Ende erledigen. Die Demos sind beeindruckend. Dann setzt man eines auf eine echte, lange Aufgabe, und es fällt auseinander. Dafür gibt es einen klaren mathematischen Grund.Was ein Agent wirklich ist
Ein KI-Agent ist ein Modell in einer Schleife. Statt einer Frage und einer Antwort nimmt er ein Ziel, zerlegt es in Schritte, handelt, schaut auf das Ergebnis und entscheidet, was als Nächstes kommt, wieder und wieder, bis die Aufgabe erledigt ist. Jeder Schritt ist eine kleine Entscheidung des Modells. Eine einfache Aufgabe sind vielleicht drei Schritte. Eine echte, etwa einen Bug über eine Codebasis hinweg zu beheben oder eine mehrteilige Reise zu planen, kann Dutzende sein. Diese Länge ist das ganze Problem.Warum kleine Fehler zu großen werden
Hier ist die Mathematik, die niemand auf die Folie schreibt. Zuverlässigkeit multipliziert sich über Schritte. Ist ein Agent bei jedem Schritt zu 95 Prozent richtig, gelingt eine 20-Schritte-Aufgabe nur zu rund 36 Prozent, denn 0,95 hoch 20 ist etwa 0,36. Fällst du auf 85 Prozent pro Schritt über 10 Schritte, landest du nahe 20 Prozent. Ein früher Ausrutscher, ohne Möglichkeit, ihn zu bemerken oder zu beheben, und die ganze Kette geht leise schief. Das Modell wurde nicht dümmer. Die Aufgabe hatte nur zu viele Stellen zum Scheitern.Die Zeitmauer
Das Muster zeigt sich als Zeitgrenze. Forschung findet, dass die Erfolgsraten von Agenten steil fallen, sobald eine Aufgabe über etwa eine halbe Stunde läuft, und dass das Verdoppeln der Aufgabenlänge die Fehlerquote tendenziell vervierfacht. Es gibt sogar einen gemessenen 50-Prozent-Zuverlässigkeitshorizont, die Aufgabenlänge, bei der ein Agent zur Hälfte gelingt. Bei Frontier-Agenten lag er Anfang 2025 bei rund einer Stunde und soll bis 2027 Richtung mehrere Stunden reichen. Nützlich, und immer noch kürzer als ein voller Arbeitstag.Was es für Anleger bedeutet
Das rahmt den Agenten-Hype neu. Der Engpass ist, ob das System zwanzig Schritte ohne Entgleisen durchläuft, ein anderes Problem als auf einem Schritt klug zu sein. Der echte Wert sitzt also in der unglamourösen Schicht: Checkpoints, Fehlerbehebung, Verifizierung und Werkzeuge, mit denen ein Agent eigene Fehler erkennt und korrigiert. Firmen, die Zuverlässigkeit und Orchestrierung verkaufen, zählen vielleicht mehr als die nächste Modellveröffentlichung. Und sei skeptisch bei Agenten-Demos, denn ein Benchmark, der eine Aufgabe einmal laufen lässt und einen hohen Wert zeigt, verbirgt, wie oft sie im zweiten Versuch scheitert.Wie man es zu beheben versucht
Die Lösungen drehen sich meist um Struktur statt um größere Hirne. Zerlege eine lange Aufgabe in kleinere, mit Checkpoints versehene Teile. Füge Prüfschritte ein, damit der Agent seine eigene Arbeit kontrolliert. Lass ihn Fortschritt speichern und nach einem Fehler weitermachen, statt neu zu beginnen. Nutze mehrere Agenten, die einander gegenprüfen. Nichts davon macht das Modell klüger. Es macht das System überlebensfähig, und genau das zählt bei langen Aufgaben.FAQ
Wenn Modelle immer klüger werden, löst sich das nicht von selbst?Teils. Höhere Genauigkeit pro Schritt hilft stark, denn der Fehler schaukelt sich aus dieser Zahl auf. Aber selbst 99 Prozent pro Schritt scheitern über Hunderte Schritte spürbar, Struktur und Wiederherstellung bleiben also wichtig. Klüger hilft, es löscht die Mathematik nicht.
Warum sehen Agenten-Demos dann so gut aus?
Demos sind kurz, kuratiert und laufen meist einmal. Echte Arbeit ist lang, chaotisch und unversöhnlich, und ein einzelner Lauf verbirgt, wie oft dieselbe Aufgabe bei einem Neuversuch scheitert. In einem Benchmark schaffen Top-Agenten eine Aufgabe allein zu unter der Hälfte und achtmal in Folge zu unter einem Viertel.
Was nehme ich wirklich mit?
Beurteile einen Agenten nach der Zuverlässigkeit bei langen Aufgaben statt nach einem Ein-Schuss-Benchmark. Frag, wie er mit einem schiefgehenden Schritt umgeht, ob er Checkpoints setzen und fortsetzen kann und wie konsistent er über wiederholte Läufe ist. Konsistenz ist die echte Kennzahl.
