Die wichtigsten Punkte:
  • Wenn ein Labor sagt, sein Modell schlage die anderen, ist der Benchmark dahinter oft kontaminiert, gesättigt oder ausgetrickst, die Zahl bedeutet also weniger, als sie klingt.
  • Sobald ein Benchmark zum Marketing-Ziel wird, optimieren Labore auf den Wert statt auf die eigentliche Fähigkeit. Das ist Goodharts Gesetz in Aktion.
  • Ernsthafte Prüfer ignorieren die gesättigten Klassiker und schauen auf kontaminationsresistente Tests wie Humanity's Last Exam und FrontierMath, wo selbst Spitzenmodelle meist scheitern.

Der Aufhänger

Alle paar Wochen verkündet ein Labor ein Modell, das GPT-4 schlägt oder ein Leaderboard anführt, und die Schlagzeile wird als Fakt behandelt. Die meisten dieser Zahlen sind nahezu bedeutungslos. Die Benchmarks dahinter sind gesättigt, in die Trainingsdaten gesickert oder still optimiert. Zu wissen warum, ist der Unterschied zwischen KI-News lesen und sie verstehen.

Problem eins: Sättigung

Der klassische Benchmark, MMLU, ein breiter Multiple-Choice-Test, ist als Frontier-Werkzeug am Ende. 2026 schafft jedes führende Modell über 88 Prozent darauf, und die Abstände liegen im Messrauschen. Wenn fünf Modelle alle 89 bis 92 erreichen, ist eine Rangliste nach dieser Zahl, als würde man Sprinter mit einer Stoppuhr werten, die nur ganze Sekunden anzeigt. Der Test trennt nicht mehr, das Marketing nutzt ihn trotzdem weiter.

Problem zwei: Kontamination

Hier ist das, was die meisten übersehen. Benchmarks sind öffentlich, und Modelle trainieren auf dem öffentlichen Internet, die Testfragen landen also oft in den Trainingsdaten. Das Modell punktet dann durch Erinnern, nicht durch Denken. Studien fanden Kontamination von bis zu 45 Prozent auf gängigen Benchmarks, und als Forscher geleakte Beispiele aus einem Mathe-Test entfernten, fiel die Genauigkeit um rund 13 Prozent, ein Boden, keine Decke. Ein kontaminierter Wert misst Erinnerung, und Erinnerung ist keine Intelligenz.

Problem drei: Goodharts Gesetz

Es gibt eine Regel, die das alles steuert: Wenn ein Maß zum Ziel wird, hört es auf, ein gutes Maß zu sein. Sobald Benchmark-Werte zur Schlagzeilen-Kennzahl wurden, mit der Labore werben, verschob sich der Anreiz vom Bau allgemeiner Fähigkeit zum Optimieren für den konkreten Test. Teams wählen Checkpoints, die im Benchmark gut abschneiden, statt solche, die wirklich besser sind. Die Zahl steigt, das Marketing wird besser, und die reale Fähigkeit bewegt sich kaum.

Worauf Profis wirklich schauen

Ernsthafte Prüfer sind zu kontaminationsresistenten Tests übergegangen. Humanity's Last Exam, ein 3.000-Fragen-Parcours, gebaut, um Google-fest zu sein, ist jetzt der Frontier-Maßstab, und das beste Modell schafft nur rund 37 Prozent, die meisten unter 30. FrontierMath nutzt brandneue, unveröffentlichte Aufgaben, geschrieben von über 70 Mathematikern unter strenger Geheimhaltung. LiveCodeBench filtert auf Coding-Aufgaben, die nach dem Trainings-Stichtag eines Modells entstanden. Der rote Faden ist simpel: ein Test, den das Modell nicht vorher gesehen haben kann.

Was es für Anleger bedeutet

Hier zahlt es sich aus. Eine Neuer-Bestwert-Pressemitteilung ist kein Grund, eine Aktie neu zu bepreisen oder den eigenen Stack auszutauschen. Benchmark-Siege sind jetzt eine Marketing-Fläche, und die Lücke zwischen Leaderboard und realem Nutzen ist gewachsen. Das Signal, das zählt, ist die Leistung auf zurückgehaltenen, kontaminationsresistenten Tests, und mehr noch, ob das Modell bei deiner Aufgabe wirklich funktioniert. Behandle runde Benchmark-Behauptungen als Werbung, bis das Gegenteil bewiesen ist.

FAQ

Sind also alle Benchmarks nutzlos?
Nein, sie sind nützlich, wenn sie frisch und unkontaminiert sind. Das Problem sind die berühmten, gesättigten, die das Marketing dominieren. Zurückgehaltene Tests wie FrontierMath oder LiveCodeBench tragen noch echtes Signal, zumindest bis auch sie leaken.

Wie kann ein Modell schummeln, wenn niemand ihm absichtlich die Antworten gab?
Meist ist es nicht absichtlich. Die Testfragen sind öffentlich, also werden sie mit allem anderen online in die Trainingsdaten gespült. Das Modell merkt sie sich aus Versehen, und der Benchmark kann Erinnerung nicht mehr von Denken unterscheiden.

Was tue ich mit einer KI-Benchmark-Behauptung?
Abwerten. Frag, welcher Benchmark, ob er kontaminationsresistent ist und wie das Modell bei Aufgaben abschneidet, die es nicht auswendig kennen kann. Und teste es an deinem eigenen Anwendungsfall, das ist der einzige Benchmark, der deine Rechnungen bezahlt.