StartseiteArtikel

Amodei geht heimlich bei Yao Shunyu in die Lehre, Altman geht heimlich bei Liang Wenfeng in die Lehre.

字母AI2026-09-25 17:18
Wie das Sprichwort besagt, ist so gut wie jedes Schriftstück in der Welt abgeschrieben – es kommt einzig darauf an, ob du das Kopieren gekonnt beherrschst.

Man sagt, alle Texte der Welt sind im Grunde genommen abgeschrieben – es kommt nur darauf an, ob man es gekonnt anstellt.

Bei den gerade veröffentlichten Modellen Opus 5.5 und GPT-6 Luna erkennt man auf den ersten Blick deutlich die Einflüsse von Yao Shunyu und Liang Wenfeng.

Vielleicht haben beide Unternehmen das Pre-Training bereits bis an die Grenzen getrieben. Um die Intelligenz der Modelle zu steigern und die Rechenkosten zu senken, wählen beide neuen Modelle den Weg, ein neues Schlachtfeld zu erschließen.

Opus 5.5 greift den Kontext an, während GPT-6 Luna den Cache optimiert.

Das ist mir bestens bekannt! Das eine ist Hunyuan, das andere DeepSeek!

Aber man muss zugeben, dass Anthropic und Altman die Konzepte wirklich sehr überzeugend umgesetzt haben.

Anthropic lernt die Konzepte von Yao Shunyu ab

Schauen wir uns zuerst eine Reihe von Zahlen an: Im Intelligenzindex von Artificial Analysis gibt es eine Statistik zum Wert „durchschnittlich wie viele Token ausgegeben werden, um eine Aufgabe zu lösen“.

In dieser Rangliste gibt Claude Opus 5.5 im Max-Modus durchschnittlich 119.000 Ausgabe-Token pro Aufgabe aus, davon 84.000 für das „Denken“ und 35.000 für die endgültige Antwort. Dagegen verbraucht GPT-6 Astra von OpenAI im gleichen Modus nur 27.000 Token.

Um die Intelligenz von großen Modellen zu steigern, folgt der traditionelle Weg, während des Pre-Trainings massiv Daten und Rechenleistung einzusetzen, um die Intelligenz in die Gewichtungen des Modells einzubauen: Einmal trainiert, kann es wiederverwendet werden.

Modelle, die diesem Weg folgen, führen bei der Inferenz fast keine zusätzlichen Denkprozesse durch. Je höher der Wert der Trainingsdaten ist, desto höher ist die Intelligenz des Modells.

Aber der traditionelle Weg hat Schwächen bei unbekannten Aufgabentypen: Die Generalisierung traditioneller Modelle basiert auf Interpolation. In der Nähe der Verteilung, die von den Trainingsdaten abgedeckt wird, zeigt es gute Leistungen. Sobald es auf unbekannte Aufgabentypen oder Aufgaben mit mehrstufiger Inferenz stößt, beginnt es, Halluzinationen zu erzeugen. Weil seine gesamte „Intelligenz“ in den Gewichtungen steckt, kann es Muster, die die Gewichtungen nie gesehen haben, bei der Inferenz nicht ergänzen.

Das ist so, als würde man lange Zeit Boxübungen an einem Holzpfahl trainieren, nur um festzustellen, dass der Gegner auf dem Schlachtfeld nicht stillsteht und zudem Waffen einsetzt.

Der andere Weg ist der Test-Time-Ansatz. Das fertig trainierte Modell ist nur ein Halbfabrikat: Wenn es tatsächlich Aufgaben löst, lässt man es zuerst eine lange Inferenzkette schreiben – je länger es denkt, desto besser ist das Ergebnis. Die Intelligenz stammt nicht mehr nur aus den Gewichtungen, sondern auch aus der Echtzeit-Inferenz bei jedem Aufruf.

Mit anderen Worten: Die Intelligenz wird in den Kontext verlagert.

Opus 5.5 folgt genau diesem Test-Time-Ansatz.

Die offizielle Erklärung lautet: Sofern nicht ausdrücklich anders angegeben, werden alle Ergebnisse im Modus „adaptive thinking at max effort“ (adaptives Denken mit maximaler Anstrengung) erzielt.

Und ab dieser Generation bietet Opus 5.5 keine Option mehr, den „Thinking-Modus“ zu deaktivieren. Im Grunde wird damit ausgedrückt: Der Inferenzprozess ist Teil des Modells selbst.

Der Nachteil ist, dass der Denkprozess mehr Token verbraucht, und die Kosten steigen mit der Schwierigkeit der Aufgabe stark an. Die Kernlogik von Opus 5.5 lautet: Alle relevanten Daten sind bereits weitgehend trainiert, der Grenznutzen des Pre-Trainings erreicht seinen Höhepunkt, daher kann der Zuwachs an Intelligenz nur aus der Inferenz stammen.

Diese Logik, Intelligenz aus dem Kontext zu gewinnen, hat Yao Shunyu schon sehr früh vorgeschlagen.

2023 stellte Yao Shunyu das Konzept des Tree of Thoughts (Gedankenbaum) vor, das im Wesentlichen eine Form des Test-Time-Ansatzes darstellt.

Bei der Inferenz werden mehrere Denkpfade entfaltet, und während des Denkens wird nach der optimalen Lösung gesucht.

Im selben Jahr schlug er zudem die ReAct-Architektur vor, die das Modell dazu bringt, „Inferenz“ und „Handlung“ abwechselnd auszuführen.

Im April 2025 veröffentlichte Yao Shunyu den Blogbeitrag „The Second Half“.

Die Kernaussage des Artikels lautet: In der ersten Phase der KI standen „Trainingsmethoden und Modelle“ im Vordergrund, zum Beispiel mehr Parameter, mehr Daten und stärkere Rechenleistung. In der zweiten Phase geht es um die Frage, „wie man Modelle einsetzt und bewertet“ – der Zuwachs verlagert sich von dem „Training“ hin zu „Inferenz und Handlung“.

Er schrieb in dem Artikel: „Erst nachdem wir die Inferenz in den Handlungsraum verlagert haben, erlangen wir die Fähigkeit, die Test-Time-Rechenleistung flexibel je nach Entscheidung zuzuweisen.“

Yao Shunyu nennt das „Denken“ eine „seltsame Handlung“.

Handlungen im Reinforcement Learning dienen dazu, die Umgebung zu verändern: Wenn man zum Beispiel eine Kiste öffnet, ändert sich der Zustand der Kiste. Der Sinn einer Handlung liegt darin, „die Welt zu verändern, um Belohnungen zu erhalten“.

Aber das Denken tut das nicht: Selbst wenn man tausendmal darüber nachdenkt, öffnet sich die Kiste nicht von selbst.

Yao Shunyu gibt in dem Artikel ein Beispiel: Es gibt zwei Kisten, eine enthält eine Million Dollar, die andere ist leer. In diesem Fall beträgt der erwartete Gewinn 500.000 Dollar.

Wenn man nun unzählige leere Kisten hinzufügt, sinkt der erwartete Gewinn immer weiter, weil man die Kiste mit der Million Dollar aus unendlich vielen Kisten auswählen muss.

Wenn man aber die Handlung der „Inferenz“ hinzufügt, wird das Modell leistungsfähiger und wählt die Kiste mit der Million Dollar leichter aus.

Yao Shunyus Erklärung lautet: Diese „leeren Kisten“ sind dir im Leben und in verschiedenen Spielen schon oft begegnet. Der Prozess, sie auszuwählen, dient selbst dazu, sich darauf vorzubereiten, die Kiste mit dem Geld zu finden.

Opus 5.5 hat genau dieses Konzept von Yao Shunyu technisch umgesetzt.

Altman lernt die Konzepte von Liang Wenfeng ab

Wenn der Schwerpunkt von Opus 5.5 auf der Frage liegt „wie man denkt“, dann liegt der Schwerpunkt von GPT-6 Luna auf der Frage „wie man kostengünstig denkt“.

Der Preis für die Eingabe von GPT-6 Luna beträgt 0,1 USD pro Million Token, für die Ausgabe 0,5 USD pro Million Token – das ist halb so viel wie bei der Vorgängerversion GPT-5.6 Luna.

Wenn der Cache-Treffer eintritt, beträgt der Preis für das Lesen aus dem Cache 0,01 USD pro Million Token, also 90 % günstiger als der Standard-Eingabepreis.

Bei jedem Aufruf des Modells muss der gesamte Kontext, den du ihm gibst, vollständig „gelesen“ werden: System-Prompts, lange Dokumente, historische Gespräche – kein Wort darf fehlen.

Aber dieser Kontext hat einen sehr hohen Wiederholungsgrad. Bei jedem weiteren Schritt des Agenten muss der gesamte vorherige Inhalt erneut gelesen werden. Lange Kontexte werden so zu einer Kostenfalle.

Das von GPT-6 Luna genutzte Prompt-Caching (KV-Cache-Wiederverwendung) löst genau dieses Problem: Derselbe Kontext wird einmal berechnet und gespeichert, beim nächsten Mal liest man direkt aus dem Cache, ohne neu zu berechnen. Dadurch wird der „wiederholte Teil“ vom teuersten zum günstigsten Teil.

Aber diese Methode hat DeepSeek schon lange zuvor umgesetzt.

Am 2. August 2026 hat DeepSeek „Context Caching on Disk“ (Kontext-Caching auf Festplatte) eingeführt: Wiederholte Inhalte werden in Festplatten-Arrays zwischengespeichert, bei einem Treffer werden sie direkt abgerufen und die Neuberechnung wird übersprungen.

Damals hieß es in der Ankündigung, dass der Preis bei Cache-Treffern auf 0,1 Yuan pro Million Token sinkt – genau 90 % günstiger als bei Treffern, also genau so wie bei GPT-6 Luna.

Bei der Version V4 Flash beträgt der Preis bei Treffern 0,02 Yuan und bei Nicht-Treffern 1 Yuan, also ein Unterschied um das 50-fache.

Der VRAM von GPUs ist sehr teuer, daher ist die Kapazität des KV-Caches begrenzt. Aber Festplatten sind günstig und haben eine große Kapazität. Wenn man den KV-Cache dort speichert, sinken die Kosten stark.

Das Prompt-Caching von OpenAI folgt fast dem gleichen Prinzip wie das von DeepSeek: Derselbe Präfix wird einmal berechnet, gespeichert und beim nächsten Mal direkt gelesen.

Nicht nur die Preise stimmen überein, sondern auch die Architektur.

Das Kontextfenster von GPT-6 Luna beträgt 1,05 Millionen Token, das von DeepSeek V4 1 Million Token – beide Werte sind fast identisch.

Aber der KV-Cache für einen 1-Millionen-Token-Kontext wäre bei den meisten Modellen nach dem Standard-Aufmerksamkeitsmechanismus nicht zu bewältigen.

Dafür nutzt DeepSeek die MLA-Architektur, die Key und Value gemeinsam in einen niedrigdimensionalen latenten Raum komprimiert, den latenten Vektor zwischenspeichert und ihn bei Bedarf wieder auf die ursprüngliche Größe hochskaliert.

Im technischen Bericht von DeepSeek-V2 wird erwähnt, dass MLA den KV-Cache um 93,3 % reduziert und den Generierungsdurchsatz auf das 5,76-fache steigert. Bei der Version V4 kommt zusätzlich komprimierte spärliche Aufmerksamkeit und hochkomprimierte Aufmerksamkeit hinzu: Bei V4-Pro beträgt der KV-Cache bei einem Kontext von einer Million Token nur 10 % des Werts der Vorgängerversion V3.2.

Darüber hinaus hat OpenSeek noch eine weitere Technik übernommen: Spekulative Dekodierung.

Im offiziellen Blog von OpenAI heißt es, dass sie ein kleineres Draft-Modell (Entwurfsmodell) ausführen, das parallel zum Hauptmodul die nächsten Token „errät“, bevor das Hauptmodul sie in einer Stapelverarbeitung prüft.

Wenn die Vermutung stimmt, können mehrere Token in einem einzigen Vorwärtsdurchlauf ausgegeben werden. Laut OpenAI steigert diese Verbesserung die Effizienz der Token-Generierung um mehr als 15 %.

Dieses Konzept gab es schon 2024 in DeepSeek V3: DeepSeek nutzt MTP (Multi-Token Prediction, Mehr-Token-Vorhersage).

Dabei wird direkt hinter dem Hauptmodell ein MTP-Head angehängt, der während des Trainings gemeinsam mit dem Hauptmodell trainiert wird und den Hidden State des Hauptmodells teilt. Bei der Inferenz kennt dieser Head den internen Zustand des Hauptmodells, macht genaue Vermutungen und hat eine hohe Akzeptanzrate bei der Prüfung.

Dieser Head kann direkt entfernt werden, ohne das Hauptmodell zu beeinträchtigen, oder er bleibt als Entwurfsmodul erhalten.

OpenAI nutzt dagegen ein externes unabhängiges kleines Modell zum Erstellen von Entwürfen. Die beiden Modelle laufen unabhängig voneinander: Das Entwurfsmodell weiß nicht, was das Hauptmodell denkt, es macht Vermutungen, die dann vom Hauptmodell geprüft werden.

Obwohl die Methoden leicht unterschiedlich sind, folgt beiden das gleiche Konzept: Das kleine Modell errät zuerst, das große prüft sie in einer Stapelverarbeitung, wodurch die serielle Dekodierung parallelisiert wird.

Alle Texte der Welt sind im Grunde abgeschrieben

Früher wurden Modelle im Silicon Valley definiert. Chinesische KI-Unternehmen wandelten diese Definitionen aufgrund begrenzter Rechenleistung in günstigere Lösungen um.

In dieser Runde ist es umgekehrt: Die akademischen Paradigmen und technischen Paradigmen werden von chinesischen Unternehmen entwickelt.

Die amerikanischen Konzerne übernehmen den letzten Schritt, machen daraus Produkte und verkaufen sie an die ganze Welt.

In den vergangenen Jahren haben die großen Konzerne ihre Ressourcen, Talente und Aufmerksamkeit vollständig auf das Hauptfeld des Pre-Trainings konzentriert.

Alle haben nach dem Scaling Law Daten und Rechenleistung massiv eingesetzt, um Ranglisten zu verbessern. Aber die führenden Unternehmen geraten in die oben erwähnte Situation, in der sich Anthropic jetzt befindet: Fast alle hochwertigen Daten sind vollständig trainiert, der Grenznutzen des Modell-Pre-Trainings sinkt.

In diesem Fall entsteht der Zuwachs der Branche natürlich auf dem zweiten Schlachtfeld, zum Beispiel wie man bei der Inferenz denkt (Test-Time Compute), wie man Kontexte nutzt (Context Learning) und wie man lange Kontexte kostengünstig verarbeitet (Caching / MLA / spärliche Aufmerksamkeit).

Das ist vergleichbar mit der Kampfkunst: Große Schulen jahrzehntelang eine Technik trainiert haben. Irgendwann merken sie, dass die Fähigkeiten nicht mehr steigen, während die früher unscheinbaren „Nebenmethoden“ die Kampfkraft stärker verbessern.

Es gibt hier einen kontraint