Die wichtigsten Punkte:
  • Distillation lässt ein kleines, günstiges Modell ein großes, teures imitieren lernen und fängt viel von dessen Können zu einem winzigen Bruchteil der Kosten ein.
  • Deshalb lässt sich ein Frontier-Modell, das Hunderte Millionen kostete, für Tausende teilweise kopieren, was den Burggraben der Spitzenreiter leise untergräbt.
  • Es ist auch ein juristischer und sicherheitstechnischer Brennpunkt, OpenAI, Google und Anthropic werfen Rivalen vor, ihre Modelle regelwidrig zu destillieren.

Der Aufhänger

Wie bringt ein kleines Labor ein Modell heraus, das es mit einem Riesen aufnimmt, für ein Rundungsfehler-Budget? Oft ist die Antwort Distillation. Es ist eine der wichtigsten und am wenigsten verstandenen Ideen in der KI gerade, und sie erklärt sowohl, warum offene Modelle weiter aufholen, als auch, warum die größten Labore sich plötzlich vor Gericht bekämpfen.

Was Distillation wirklich ist

Distillation heißt, einem kleinen Modell beizubringen, ein großes zu imitieren. Du nimmst ein großes, fähiges Lehrer-Modell, lässt es eine riesige Zahl Fragen beantworten und trainierst mit diesen Antworten ein kleineres Schüler-Modell, dieselben Ausgaben zu erzeugen. Der Schüler lernt nicht bei null, er lernt aus dem Verhalten des Lehrers und kopiert dessen Muster. Gut gemacht, hat das kleine Modell am Ende viel vom Können des großen, und es ist weit günstiger und schneller im Betrieb.

Warum es so günstig ist

Die Kostenlücke ist der ganze Punkt. Ein Frontier-Modell von null zu trainieren kann Hunderte Millionen an Rechenleistung kosten. Sein Verhalten in ein kleines offenes Modell zu destillieren kann einen winzigen Bruchteil davon kosten. DeepSeek zeigte das im großen Stil, indem es ein starkes destilliertes Modell angeblich für rund zehntausend Dollar feinabstimmte, und destillierte Modelle laufen mit 5- bis 20-mal niedrigeren Kosten pro Token. Du überspringst den teuren Teil, das ursprüngliche Training, und erbst das Ergebnis.

Warum das die großen Labore ängstigt

Hier bricht der Burggraben. Ein Frontier-Labor gibt ein Vermögen aus, um einen Vorsprung zu bauen, dann kopiert ein Konkurrent viel davon, einfach indem er die Ausgaben studiert, ohne eigenen Riesen-Trainingslauf. Es umgeht sogar Chip-Sanktionen, denn man braucht keinen riesigen Cluster zum Destillieren, nur Zugang zu den Antworten eines guten Modells. Der Lohn fürs Erstsein wird kürzer, und genau das raubt Chefs geschlossener Modelle den Schlaf.

Der Rechts- und Sicherheitsstreit

So wurde ein Kampf daraus. OpenAI warf DeepSeek vor, seine Modelle gegen die Nutzungsbedingungen zu destillieren, Ausgaben über getarnte Konten abzugreifen, und US-Behörden prüften mögliche Verstöße gegen Geschäftsgeheimnisse. Anthropic sagte, es habe industrielle Distillation gegen Claude erwischt, über 16 Millionen Austausche über rund 24.000 betrügerische Konten von drei Laboren. Die meisten großen Anbieter verbieten jetzt, ihre Ausgaben zum Training von Konkurrenten zu nutzen. Das über Grenzen hinweg durchzusetzen ist der schwere Teil.

Was es für Anleger bedeutet

Distillation formt die Burggraben-Frage neu. Wenn Fähigkeit durch Ausgaben durchsickert, ist ein reiner Modellvorsprung schwer zu verteidigen, und Wert verschiebt sich zu dem, was sich nicht leicht destillieren lässt: eigene Daten, Verbreitung, Marke und die Infrastruktur, um im großen Maßstab auszuliefern. Es drückt auch auf die Preise, denn ein günstiger destillierter Klon deckelt, was jemand fürs Knapp-vorne-Sein verlangen kann. Für die Open-Source-Seite ist es Raketentreibstoff. Für die Spitzenreiter ist es ein Leck, das sie nicht ganz stopfen können.

FAQ

Ist Distillation dasselbe wie das Modell einfach zu kopieren?
Nein. Du bekommst nicht die Originalgewichte, du trainierst ein neues Modell, sich wie es zu verhalten, indem es aus seinen Antworten lernt. Der Schüler ist ein eigenes Modell, er hat nur Stil und Können des Lehrers geerbt. Diese Unterscheidung ist auch, warum die Rechtsfragen heikel sind.

Wenn es so leicht ist, warum sind Frontier-Modelle noch vorne?
Weil Distillation kopiert, was ein Modell schon kann. Sie kann nicht die Fähigkeit kopieren, die Grenze nach vorne zu schieben, und der Lehrer muss erst existieren. Distillation verkleinert den Abstand hinter dem Spitzenreiter, sie bewegt den Spitzenreiter nicht.

Worauf sollte ich als Anleger achten?
Achte darauf, was sich nicht destillieren lässt. Einzigartige Daten, Verbreitung und Auslieferungs-Infrastruktur behalten Wert, wenn rohe Modellfähigkeit durchsickert. Und achte auf die Rechtsstreite, denn wie Gerichte das Training auf den Ausgaben eines Rivalen behandeln, prägt, wer wen kopieren darf.