Die wichtigsten Punkte:
  • Ein LLM schlägt keine Fakten nach. Es sagt die wahrscheinlichsten nächsten Wörter voraus, eine selbstsichere, flüssige, falsche Antwort ist also ein normales Ergebnis.
  • Das Problem steckt doppelt drin: in der Art, wie Modelle Text erzeugen, und in der Art, wie wir sie benoten, denn die meisten Tests belohnen ein selbstsicheres Raten über ein ehrliches Ich weiß es nicht.
  • Selbstsicherheit ist nicht Richtigkeit, und die Lösung ist, kalibrierte Unsicherheit zu lehren und zu belohnen, statt nur größere Modelle.

Der Aufhänger

Du stellst einer KI eine Frage, und sie antwortet flüssig, in ganzen Sätzen, mit einer echt aussehenden Quelle, und liegt komplett falsch. Das ist eine Halluzination, und 2026 passiert sie weiter oft. Benchmarks setzen die Halluzinationsraten je nach Aufgabe zwischen 15 und über 50 Prozent an, in Recht und Medizin weit höher. Das Überraschende: Das ist kein Fehler im System. Es ist, wie die Technik funktioniert.

Was ein LLM wirklich tut

Ein großes Sprachmodell speichert und sucht Fakten nicht wie eine Datenbank. Es sagt das nächste Wort voraus, wieder und wieder, anhand von Mustern in seinen Trainingsdaten. Fragst du etwas, erzeugt es die statistisch wahrscheinlichste Fortsetzung, den Text, der richtig klingt. Meistens fallen richtig klingen und richtig sein zusammen. Wenn nicht, bekommst du eine flüssige, selbstsichere Antwort, die zufällig falsch ist. Das Modell lügt nicht. Es hat kein getrenntes Gespür für wahr und falsch, gegen das es prüfen könnte.

Warum man es nicht einfach patchen kann

Hier ist der tiefere Grund, aus einem OpenAI-Paper von 2025. Halluzination liegt teils daran, wie wir Modelle benoten. Die meisten Benchmarks werten eine richtige Antwort als Sieg und ein Ich weiß es nicht als Niederlage, wie ein Multiple-Choice-Test, bei dem Raten besser ist als Leerlassen. Modelle lernen also, immer eine Antwort zu liefern, selbstsicher und vollständig, weil Zögern bestraft wird. Wir haben ihnen das Bluffen antrainiert. Das zu beheben heißt, das Notensystem zu ändern und ein kalibriertes Ich bin nicht sicher über ein selbstsicheres falsches Raten zu belohnen.

Warum Selbstsicherheit nichts sagt

Das ist die praktische Falle. Der Ton eines LLM hat keinen Bezug dazu, ob es richtig liegt. Es nennt einen echten und einen erfundenen Fakt in derselben ruhigen, sicheren Stimme, denn beides ist nur wahrscheinlich klingender Text. Es gibt kein eingebautes Signal, das sagt, das hier weiß ich und das hier rate ich. Eine polierte, sichere Antwort ist also kein Beleg für Genauigkeit. Sie ist nur ein Beleg, dass das Modell gut schreibt.

Was es für Anleger und Nutzer bedeutet

Deshalb ist der KI-Einsatz in heiklen Bereichen schwer. Bei juristischen Fragen halluzinieren Modelle bei der Mehrheit der Fragen zu einem Urteil, und medizinische Zusammenfassungen erreichten ohne Schutzmechanismen Fehlerraten über 60 Prozent. Der Wert sitzt also in der Schicht um das Modell herum: Retrieval, das Antworten in echten Quellen verankert, Verifizierung und menschliche Prüfung, wo es zählt. Werkzeuge, die Halluzinationen senken oder markieren, sind ein echter Markt. Und für jeden Nutzer ist die Regel simpel: Prüfe alles, was zählt, besonders wenn die Antwort am selbstsichersten klingt.

Wird es besser

Ja, langsam. Neuere Trainingsmethoden belohnen das Modell dafür, seine Selbstsicherheit an die tatsächliche Genauigkeit anzupassen, und bestrafen Überheblichkeit wie falsche Bescheidenheit. Retrieval und Werkzeugnutzung lassen ein Modell Quellen prüfen, statt aus dem Gedächtnis zu raten. Die Grundrate sinkt weiter. Aber weil das Verhalten darin wurzelt, wie diese Modelle Text erzeugen, wird es gemanagt, nicht ausgelöscht.

FAQ

Kann man die KI nicht einfach so trainieren, dass sie nichts erfindet?
Nicht ganz, denn das Modell erzeugt plausiblen Text per Design und hat keinen internen Faktenprüfer. Du kannst die Rate mit besserem Training und durch Verankern in echten Quellen senken, aber ein probabilistisches Modell hat immer eine Chance auf einen selbstsicheren Fehlgriff.

Warum klingt es so sicher, wenn es falsch liegt?
Weil Flüssigkeit und Sicherheit nur der Stil wahrscheinlichen Texts sind, ohne Bezug zur Wahrheit. Das Modell schreibt eine Vermutung in derselben Stimme wie einen Fakt. Behandle einen sicheren Ton als null Beleg für Genauigkeit.

Wie schütze ich mich in der Praxis?
Frag nach Quellen und prüfe sie, denn erfundene Zitate sind ein klassisches Zeichen. Setze auf Werkzeuge, die Antworten in echten Dokumenten verankern. Und prüfe alles Wichtige, Namen, Zahlen, Zitate, Daten, bevor du dich darauf verlässt.