StartseiteArtikel

Alle behaupten, die Nummer eins zu sein. Wer ist eigentlich das leistungsstärkste Großmodell in China?

砺石商业评论2026-09-01 11:47
Die erste Echelon der chinesischen Großsprachmodelle weist ein Dualspitzen-Muster auf, das von Kimi K3 und Qwen3.8-Max gebildet wird.

Eine ehrlichere Aussage lautet, dass die erste Ebene der großen chinesischen Modelle ein Zweispitz-Muster ist, das aus Kimi K3 und Qwen3.8-Max besteht. Ersterer punktet bei internationalen Validierungen, Letzterer bei der chinesischsprachigen Gesamteignung und dem Ökosystem.

Gegenwärtig gibt es ein Kuriosum in der Branche der großen chinesischen Modelle: Fast jedes führende Unternehmen behauptet, sein Modell sei „das erste in China“ oder sogar „unter den ersten drei weltweit“.

Alibaba gibt an, Qwen3.8-Max stehe bei „blinden Dritttests nur hinter Claude“; Moonshot AI bezeichnet Kimi K3 als „das stärkste Open-Source-Modell der Welt“; Zhipu gibt an, GLM-5.2 sei „weltweit Erster im Code Arena“; auf der Modellkarte von DeepSeek steht „SWE-bench Verified 80,6 %“; Doubao 2.1 von ByteDance wirbt mit „IMO-Goldmedaille, weltweit führend bei HLE“; Wenxin 5.0 von Baidu betont „10M-Kontext, Erster bei chinesischsprachigem Schreiben“.

Alle diese Aussagen sind „richtig“, aber unvollständig. Sie haben ein gemeinsames Merkmal: Vor jedem „Ersten“ steht ein sorgfältig ausgewähltes Attribut. Das Modell mit den größten Parametern ist Erster, das Modell mit dem ersten Platz bei einem einzelnen Benchmark ist Erster, das Modell mit dem ersten Platz bei einer bestimmten blinden Testliste ist Erster, das Modell in einer bestimmten Preisklasse ist Erster. Mit unterschiedlichen Attributen stehen sich die Schlussfolgerungen natürlich nicht im Wege. Genau wie im Zeitalter der Smartphones, wo jeder Hersteller behauptet, „Erster bei Benchmark-Werten, Erster bei der Fotoqualität, Erster bei der Akkulaufzeit“ zu sein, und wie bei Elektroautos, wo jeder Hersteller sagt, „Erster bei der Reichweite, Erster bei dem intelligenten Fahren, Erster bei der Sicherheit“ zu sein.

Die Situation auf der anderen Seite des Ozeans ist anders. In der Branche der großen US-Modelle gibt es ein relativ anerkanntes Muster: In einer Phase führt OpenAI, in einer anderen Phase führt Anthropics Claude, Googles Gemini überholt zwischendurch. Mitte 2026 besteht der Konsens darin, dass Anthropic wieder an der Spitze steht: Claude Fable 5 belegt mit etwa 60 Punkten den ersten Platz auf dem Artificial Analysis-Intelligenzindex, GPT-5.6 Sol mit etwa 59 Punkten den zweiten Platz. Dieser Konsens wird gemeinsam von Drittprüfstellen, Entwicklergemeinschaften und tatsächlichen Nutzungsdaten gebildet, ohne dass man die Pressekonferenz eines Unternehmens ansehen muss.

In China hat sich ein solcher Konsens nicht herausgebildet. Nicht weil es keine Antwort gibt, sondern weil die Antwort von dem Lärm der Öffentlichkeitsarbeit überdeckt wird. Das veranlasst uns, alle eigenen Aussagen der Unternehmen beiseite zu legen und hauptsächlich drei Arten der autoritativsten Drittvalidierungsdaten zu verwenden – die globale blinde Arena-Test, der Artificial Analysis-Intelligenzindex und die chinesischsprachige SuperCLUE-Bewertung –, um gegenzuchecken, zu welchem Schluss die Fakten tatsächlich führen.

Erste Beweiskette: Der Artificial Analysis-Intelligenzindex

Artificial Analysis (AA) ist die unabhängige Prüfstelle, die am häufigsten in internationalen Entwicklergemeinschaften zitiert wird. Sein Intelligenzindex kombiniert standardisierte Tests aus mehreren Dimensionen wie Mathematik, Schlussfolgerung, Code und Wissen, wobei 189 Modelle aus der ganzen Welt gemeinsam rangieren. Er nimmt kein Geld von Herstellern an, hat ein einheitliches Testverfahren und ist derzeit das objektivste Drittmaßstab.

Anfang August 2026 lauten die Ergebnisse der wichtigsten chinesischen Modelle auf dem AA-Intelligenzindex wie folgt:

Kimi K3 (Max) von Moonshot AI: 57 Punkte, belegt den vierten Platz unter 189 Modellen. Dies ist die höchste Platzierung, die ein Open-Source-Gewichtsmodell je erreicht hat, übertrifft Claude Opus 4.8 (ca. 56 Punkte) und steht nur hinter Claude Fable 5 (ca. 60 Punkte), GPT-5.6 Sol (ca. 59 Punkte) und einem Flaggschiffmodell von Google.

GLM-5.2 (Max) von Zhipu: 51 Punkte, rangiert außerhalb der Top-Ten.

DeepSeek V4 Flash 0731 von DeepSeek: 50 Punkte, gleichauf mit Googles Gemini 3.6 Flash.

Qwen3.8-Max von Alibaba: Bisher keine Ergebnisse. Bis heute hat AA die Prüfung noch nicht abgeschlossen. Das Validierungsergebnis seines Vorgängermodells Qwen3.7-Max beträgt 56,6 Punkte – dies ist der einzige Drittreferenzwert dieser Modellfamilie.

Diese Tabelle offenbart zwei Dinge. Erstens hat das stärkste chinesische Modell bereits die Schwelle zur ersten globalen Ebene erreicht: Der Abstand zwischen den 57 Punkten von Kimi K3 und dem Spitzenreiter beträgt nur 3 Punkte, während dieser Abstand vor einem Jahr noch zweistellig war. Zweitens sind „das offiziell stärkste Modell“ und „das bei Validierungen stärkste Modell“ zwei verschiedene Dinge – Qwen3.8-Max, das behauptet, „nur hinter Claude Fable 5 zu stehen“, ist genau das einzige Modell unter den führenden Modellen, das noch keine Drittprüfungsergebnisse vorweisen kann.

Zweite Beweiskette: Der blinde Arena-Test

Der Mechanismus von Arena (arena.ai) basiert auf menschlichen blinden Tests: Zwei anonyme Modelle beantworten dieselbe Frage, und der Nutzer stimmt für das bessere Modell. Millionen von Stimmen werden in ELO-Punkte umgerechnet. Er misst nicht, „wie viele Punkte man bei einer Prüfung erzielt“, sondern „welches Modell echten Menschen besser nutzbar erscheint“. In der Rangliste der 33. Woche im August 2026 (10. bis 16. August) lauten die Ergebnisse der in China entwickelten Modelle wie folgt.

In der Gesamtrangliste belegen die Claude-Serie von Anthropic die ersten fünf Plätze. Unter den in China entwickelten Modellen steht Qwen3.8-Max auf Platz 8 (ELO 1491), Kimi K3 Max auf Platz 12 (1489) – sie sind die einzigen zwei chinesischen Modelle, die unter die ersten 15 Plätze kommen. Dieses Muster ist einen genaueren Blick wert: Der Punkteunterschied zwischen den beiden beträgt nur 2 Punkte, was im Fehlerbereich praktisch gleichwertig ist, aber Qwen3.8-Max steht weiter oben.

In der Code-Rangliste belegt Kimi K3 Max Platz 6 (1544 Punkte) und ist damit das am höchsten eingestufte in China entwickelte Codemodell; Qwen3.8-Max steht auf Platz 13, Mimo von Xiaomi auf Platz 25.

Die Rangliste für Frontendentwicklung ist diejenige, bei der die in China entwickelten Modelle am stärksten abschneiden. Kimi K3 Max belegt mit 1674 Punkten den zweiten Platz, nur 18 Punkte hinter dem Spitzenreiter Claude Opus 5 Max (1692 Punkte); Qwen3.8-Max steht auf Platz 3 (1667 Punkte); GLM-5.2-Max von Zhipu auf Platz 9; DeepSeek V4 Pro steigt neu in die Liste ein und belegt Platz 10. Als Kimi K3 vor einem Monat neu veröffentlicht wurde, belegte es kurzzeitig mit 1679 Punkten den ersten Platz in dieser Rangliste – das war das erste Mal, dass ein in China entwickeltes Modell den ersten Platz weltweit in einer praktischen Rangliste von Arena erreichte.

In der Agent-Rangliste belegt Kimi K3 Max mit einer Nettosteigerungsrate von 10,60 % den fünften Platz und gehört damit zusammen mit der Claude Opus-Serie zur ersten globalen Ebene; Qwen3.8 Max steigt neu in die Liste ein und belegt Platz 11; GLM 5.2 Max auf Platz 14; DeepSeek V4 Flash auf Platz 19.

Wenn man die vier Ranglisten zusammen betrachtet, ist die Schlussfolgerung klar. Im System von Arena ist Kimi K3 Max das chinesische Modell mit der breitesten Abdeckung und der höchsten Position – Platz 6 bei Code, Platz 2 bei Frontendentwicklung, Platz 5 bei Agenten, Platz 12 in der Gesamtrangliste, keines der Ergebnisse fällt außerhalb der ersten 15 Plätze. Qwen3.8-Max ist das in der Gesamtrangliste höchstplatzierte in China entwickelte Modell (Platz 8), liegt aber bei den zwei praktischen Ranglisten für Code und Agenten hinter Kimi.

Dritte Beweiskette: Die chinesischsprachige SuperCLUE-Bewertung

SuperCLUE ist einer der glaubwürdigsten Drittbenchmarks für chinesischsprachige Szenarien. Auf der Rangliste vom Juli 2026 lautet die Gesamtrangliste der 12 wichtigsten in China entwickelten Modelle: Qwen3.8-Max, Kimi-K3, Doubao-Seed-2.1-Pro von ByteDance und DeepSeek-V4-Flash.

Der Punkteunterschied zwischen dem ersten und dem zweiten Platz ist gering, aber die Reihenfolge ist eindeutig. Bei der chinesischsprachigen Gesamteignung steht Alibaba Qwen3.8-Max an erster Stelle. Dies bestätigt sich mit seiner Leistung in der Arena-Gesamtrangliste (Platz 8, höher als Kimi auf Platz 12).

Bemerkenswert sind der dritte und vierte Platz. Doubao 2.1-Pro von ByteDance belegt den dritten Platz in der chinesischsprachigen Gesamteignungsprüfung und ist das einzige Modell der „Top-Fünf“, das nicht am internationalen blinden Test von Arena teilgenommen hat. Seine Fähigkeiten sind auf inländischen Ranglisten sichtbar, fehlen aber im internationalen Koordinatensystem. DeepSeek belegt den vierten Platz, seine frühere Position als Spitzenreiter wurde bereits von Nachfolgern abgelöst.

Bei dem speziellen Programmierbereich liefert SuperCLUE ein anderes Ergebnis. GLM-5.2 liegt mit 64,13 Punkten weit vorne, Kimi K2.7-Code erreicht 55,43 Punkte. Zhipu ist ein typischer „Einseitig spezialisierter Schüler“, der bei dem einzelnen Programmierbereich weltweit Erster ist (es hat auch den ersten Platz auf dem internationalen Code Arena und Design Arena erreicht), aber seine Gesamteignung reicht nicht aus, um unter die ersten vier in China zu kommen.

Porträts der fünf Unternehmen: Die Dimensionen der Stärken

Bevor wir die Porträts einzeln vorstellen, legen wir zuerst die harten Spezifikationen der fünf Flaggschiffmodelle zusammen, denn der Sommer 2026 ist der erste Sommer, in dem die fünf Unternehmen innerhalb von sechs Wochen nacheinander fortschrittliche Modelle veröffentlicht haben: Mitte Juni Zhipu GLM-5.2, 16. Juli Kimi K3, 19. Juli Vorschau von Qwen3.8-Max, 27. Juli Open-Source von Kimi K3, 31. Juli DeepSeek V4 Flash 0731, 3. August offizielle Version von Qwen3.8-Max.

Drei Fakten sind bemerkenswert. Erstens ist der Kontext mit einer Million Token bereits ein Standard für Flaggschiffmodelle und kein Unterscheidungsmerkmal mehr – alle fünf unterstützen ihn. Zweitens sind alle Modelle auf 2-Billionen-Parameter-Ebene Open-Source (MIT-Lizenz), dies ist ein kollektiver Beitrag chinesischer Unternehmen zur globalen Open-Source-Gemeinschaft und gleichzeitig eine differenzierte Konkurrenz zur geschlossenen Route der USA. Drittens gibt es einen 50-fachen Unterschied bei den Ausgabepreisen zwischen den Flaggschiffmodellen – dieser Preisunterschied selbst ist eine Entscheidung für das Geschäftsmodell: Kimi K3 nutzt den höchsten Preis, um die stärkste Schlussfolgerungsdichte zu erreichen, DeepSeek nutzt den minimalen Preis, um den Markt für häufige Agent-Aufrufe zu gewinnen.

Wenn wir die drei Beweisketten gegeneinander abgleichen, lässt sich die tatsächliche Position der fünf stärksten großen chinesischen Modelle im August 2026 so beschreiben.

Kimi K3 von Moonshot AI, das stärkste chinesische Modell bei Validierungen. Veröffentlicht am 16. Juli, Open-Source am 27. Juli, mit 2,8 Billionen Parametern und 104 Milliarden aktivierten Parametern. Es ist das Open-Source-Modell mit der größten Parametergröße in der Geschichte der Menschheit und das erste Billionen-Parameter-Open-Source-Modell weltweit, das nativ vier Modi für Text, Bild, Audio und Video unterstützt. Sein Drittprüfungszeugnis ist das vollständigste unter allen in China entwickelten Modellen: 57 Punkte auf dem AA-Intelligenzindex (höchster Wert in der Geschichte von Open-Source, weltweit Platz 4, übertrifft Claude Opus 4.8), Platz 2 bei Frontendentwicklung, Platz 6 bei Code, Platz 5 bei Agenten in Arena, Platz 2 bei chinesischsprachigen Szenarien in SuperCLUE. Eine praktische Prüfung der Drittprüfstelle FireworksAI an 1030 echten Agent-Aufgaben zeigt, dass die Leistung von Kimi K3 nahe an Claude Fable 5 liegt, die Kosten betragen etwa 1/50 davon. Der Nachteil ist der hohe Preis: Der Ausgabepreis beträgt 100 Yuan pro Million Token, 50 Mal so hoch wie der von DeepSeek V4 Flash.

Qwen3.8-Max von Alibaba, das stärkste Modell bei chinesischsprachiger Gesamteignung und Ökosystem. Mit 2,4 Billionen Parametern und 95 Milliarden aktivierten Parametern, die offizielle Version wurde am 3. August veröffentlicht. Es ist der Erste bei der chinesischsprachigen Gesamteignung in SuperCLUE und das höchstplatzierte in China entwickelte Modell in der Arena-Gesamtrangliste (Platz 8). Es muss jedoch darauf hingewiesen werden, dass sein internationales Validierungszeugnis derzeit leer ist. Die AA-Intelligenzindexprüfung wurde noch nicht abgeschlossen, alle offiziellen Benchmarks (4,16-fache Rendite bei E-Commerce-Simulation, 265 selbstständige Codierungsübermittlungen in 16 Tagen usw.) stammen ausschließlich von Alibaba selbst. Sein echter Wettbewerbsvorteil liegt anderswo: Die über Jahre angesammelte globale Download-Spitzenposition der Qwen-Open-Source-Familie und das dickste Ökosystem abgeleiteter Modelle sind Vermögenswerte, die die anderen vier Unternehmen nicht haben.

DeepSeek V4 von DeepSeek, der König der Schlussfolgerung und des Preis-Leistungs-Verhältnisses, wurde aber bereits überholt. Anfang 2025 näherte sich DeepSeek R1 mit extrem niedrigen Trainingskosten den damaligen Top-Modellen von OpenAI an, was in der Silicon Valley für Aufsehen sorgte und den Aktienkurs von Nvidia an diesem Tag stark fallen ließ – zum ersten Mal wurde die Stärke der großen chinesischen Modelle weltweit anerkannt. Das war der Höhepunkt von DeepSeek und gleichzeitig der Höhepunkt der Branche der großen chinesischen Modelle. In den folgenden eineinhalb Jahren verlangsamte sich das Tempo von DeepSeek: V4 wurde am 24. April dieses Jahres veröffentlicht, es gab vier Monate lang keine wichtigen Updates, erst die Updates von V4 Flash 0731 am 31. Juli und V4 Pro Mitte August brachten das Unternehmen zurück ins Spiel. Seine Grundlagen sind noch vorhanden – bei einer unabhängigen Quervergleichsprüfung (API-Praxisprüfung) von 8 wichtigen Modellen Mitte August belegt DeepSeek V4 Pro mit 9,1 Punkten den ersten Platz unter allen in China entwickelten Modellen, nur hinter Claude Opus 4.8 (9,20 Punkte) weltweit. Sein Wert von 9,5 Punkten im speziellen Schlussfolgerungsbereich übertrifft GPT-5.6, die Fähigkeit „fehlende Bedingungen zu erkennen und zu wissen, wann man keine Schlussfolgerung ziehen soll“ wurde als die stärkste im gesamten Test bewertet. Der Wert von etwa 80,6 % bei SWE-bench Verified ist der höchste nachweisbare standardisierte Benchmarkwert unter in China entwickelten Modellen. V4 Flash (284 Milliarden