StartseiteArtikel

Das "total überlegene" Zhipu hat seinen ersten Schlag direkt gegen DeepSeek gerichtet.

蓝字计划2026-08-28 18:15
GLM-5.3-Flash ist zur neuen Kill-Linie für große KI-Modelle geworden.

Nachdem DeepSeek so lange als „Preisbrecher“ agiert hat, hat es schließlich den Schlag gegen sich selbst erwartet.

Derjenige, der den Schlag führt, ist Zhipu.

Das kürzlich von Zhipu AI veröffentlichte GLM-5.3-Flash ist sowohl das geheime Großmodell OX Alpha, das in ausländischen Communities beliebt ist, als auch das erste native multimodale Modell der GLM-5-Serie.

Obwohl sein Name „Flash“ trägt, ist seine Leistung keineswegs flüchtig. Insbesondere im Artificial Analysis Intelligence Index erreicht es 57 Punkte, was über den 53 Punkten der offiziellen Version von DeepSeek V4 Pro liegt; selbst das Unternehmen ist nicht bescheiden und sagt, dass seine Leistung in einigen Messverfahren sogar mit dem früheren Flaggschiff Opus 4.8 von Claude mithalten kann.

Aber das Beeindruckendste an GLM-5.3-Flash ist: Sobald das Modell online ging, stand das Wort „billig“ direkt auf seinem Gesicht.

0,8 Yuan pro Million Token für die Eingabe, 2,8 Yuan für die Ausgabe, es gibt sogar eine zeitlich begrenzte 50 %-Rabattaktion für zwei Wochen. Seine Leistung kann mit Opus 4.8 mithalten, aber der Preis beträgt nur 1/40 davon, er ist sogar niedriger als der Nebenzeiten-Preis des „Preisbrechers“ DeepSeek.

Bei diesem Preis ist jeder verwirrt, oder?

Und genau das ist die Taktik, mit der DeepSeek am besten vertraut ist.

Gerade hat DeepSeek, das für sein überlegenes Preis-Leistungs-Verhältnis wirbt, die Spitzen- und Nebenzeiten-Preisgestaltung eingeführt, mit einem Preisanstieg von bis zu 1100 %; kurz darauf drückt GLM-5.3-Flash den Preis in den Bereich von „alltäglichen Verbrauchsgütern“.

Wird der König des Preis-Leistungs-Verhältnisses bei KI-Großmodellen nun „abgelöst“?

Kleines Geld ausgeben, große Dinge erledigen

Um GLM-5.3-Flash zu verstehen, muss man von einem geheimnisvollen „Ochsen“ ausgehen.

Am 20. August ging auf der KI-Aggregationsplattform OpenRouter plötzlich ein anonymes Modell namens Ox Alpha online. Keine offizielle Ankündigung, keine Vorwärmung, keine Offenlegung des Entwicklers, keine Angabe der Parametergröße und noch kein technischer Bericht – es ist ein sogenanntes „wildes Modell“.

Gerade zur Zeit, als der Animationsfilm „Ochse kommt“ populär wurde, und „Ox“ selbst „Ochse“ bedeutet, haben chinesische Entwickler den Witz aufgegriffen, und Ox Alpha das „Ochse-kommt“-Modell genannt.

Obwohl das „wilde Modell“ wild ist, ist es sehr großzügig: Ox Alpha kann Text-, Bild- und Videoeingaben empfangen und Text ausgeben. Die anonyme Testversion bietet zudem einen Kontext von 1,04 Millionen Token, aber Entwickler müssen keinen Cent für den Aufruf ausgeben – alles wird von dem Modellunternehmen bezahlt.

Diese fast kostenlose Art hat Ox Alpha schnell populär gemacht.

Weniger als einen Tag nach der Veröffentlichung stand Ox Alpha gleichzeitig an der Spitze der Aufrufvolumenlisten von OpenRouter und OpenCode, stellte einen neuen Veröffentlichungsrekord für Modelle auf OpenRouter auf und beendete die 56-tägige ununterbrochene Führung von DeepSeek.

Sogar der Gründer von Hermes Agent schrieb schockiert: Dieses Modell schlägt alle unsere internen Benchmarks, was ist da überhaupt passiert?!

Zeitweise wurde es zu einem neuen Spaß in der Entwickler-Community, die „Eltern“ hinter Ox Alpha zu erraten. Immerhin: Wer ein Modell mit solcher Leistung anbieten und so großzügig handeln kann, ist höchstwahrscheinlich kein Unbekannter.

Tatsächlich stimmt das genau.

Dahinter steht ein führendes Großmodellunternehmen wie Zhipu, was natürlich erklärt, warum es den Mut hat, die Kosten für Entwickler auf der ganzen Welt zu übernehmen.

Aber selbst mit großen Ressourcen kann man nicht unbegrenzt massenhaft kostenlose Token verbrennen. Ox Alpha kann so großzügig handeln, weil dieser „Ochse“ zwar groß aussieht, aber viel weniger frisst als man denkt.

GLM-5.3-Flash hat insgesamt 320 Milliarden Parameter, aber bei der Verarbeitung jedes Tokens werden nur etwa 18 Milliarden Parameter aktiviert, was nur 5,6 % entspricht. Für den extrem langen Kontext von 1,04 Millionen Token kombiniert es zudem lineare Aufmerksamkeit und spärliche Aufmerksamkeit, um den Rechenaufwand für die Verarbeitung massiver historischer Informationen so weit wie möglich zu reduzieren.

Beide Designkonzepte zielen auf dasselbe Ziel ab: Das Modell sieht aus wie ein großes Gebilde mit 320 Milliarden Parametern, aber die tatsächliche Rechnung wird möglicherweise nicht auf Basis von 320 Milliarden Parametern berechnet.

Das ist die weitere Grundlage für Zhipus großzügiges Handeln: Das Unternehmen übernimmt die Kosten, aber das Modell selbst muss auch lernen, Geld zu sparen.

Wenn man jetzt zurückblickt, wirkt die kostenlose Massenverbreitung von Ox Alpha während der anonymen Phase selbst wie eine „Niedrigkosten-Erklärung“.

Alle massiven Token werden von Zhipu bezahlt. Neben dem Testen des Modells und der Erzeugung von Aufmerksamkeit soll es Entwicklern auch beweisen: Zhipu wagt es, das Aufrufvolumen vollständig freizugeben, weil dieses Modell selbst nicht so viel Geld kostet wie man denkt.

Zusammengefasst in einem Satz: Dieser „Ochse“ frisst wirklich nicht viel.

Im Agent-Szenario ist dies noch wichtiger. Eine Aufgabe kann das Modell Dutzende oder sogar Hunderte Male nacheinander aufrufen, und die geringe Kostenersparnis bei jedem einzelnen Aufruf wird schließlich durch die häufigen Aufrufe ständig vergrößert.

Deshalb zielt die Architektur von GLM-5.3-Flash wirklich darauf ab, dass Agenten das Großmodell als eine Infrastruktur betrachten, die häufig verbraucht werden kann.

In den Köpfen der Entwickler gehörten die Labels „starke Leistung, niedriger Preis, unbesorgter Aufruf“ früher fast ausschließlich zu DeepSeek.

Was Zhipu wirklich angreifen will, ist vermutlich genau das wertvollste Markenzeichen für das Preis-Leistungs-Verhältnis von DeepSeek.

„Liang Wenfeng“ besiegt, „Liang Wengu“ verloren

Der Veröffentlichungszeitpunkt von GLM-5.3-Flash ist sehr geschickt gewählt.

Am 31. Juli, nach der Veröffentlichung der offiziellen Version von DeepSeek V4 Flash, stieg das Nutzungsvolumen auf OpenCode um 30 % an einem einzigen Tag, und die Anzahl neuer Abonnenten von OpenCode Go stieg ebenfalls um 30 %. Allein am 1. August lag das tägliche Verarbeitungsvolumen von DeepSeek V4 Flash bei 8 Billionen Token.

Aber am 17. August trat die neue Preisgestaltung von DeepSeek offiziell in Kraft. Der Preisanstieg von DeepSeek V4 Pro in Spitzenzeiten beträgt bis zu 1100 %; der Ausgabepreis von DeepSeek V4 Flash in Spitzenzeiten wurde von 0,28 Dollar auf 1,32 Dollar erhöht, das ist ein Anstieg um das 4,71-fache.

Die direkteste Auswirkung der starken Preiserhöhung ist, dass Entwickler mit ihren Füßen abzustimmen beginnen.

In den früher durchgesickerten Aufzeichnungen von Liang Wenfeng erwähnte er, dass die Nachfrage nach intelligenten Diensten keine Elastizität hat. Aber die Realität scheint nicht so einfach zu sein, besonders bei leichtgewichtigen Modellen.

Nach der Preiserhöhung fiel das tägliche Token-Volumen von DeepSeek schnell auf weniger als die Hälfte des früheren Spitzenwerts. Der CEO von OpenCode schätzt sogar, dass die Plattform dadurch eine tägliche Nachfrage von fast 10 Billionen Token freigeworden ist.

Genau zu diesem Zeitpunkt kam GLM-5.3-Flash, das im Mantel des „Ochse-kommt“-Modells steckte.

GLM-5.3-Flash kann als „billig und großzügig“ bezeichnet werden: 0,8 Yuan pro Million Token für die Eingabe bei Cache-Verfehlung, 2,8 Yuan für die Ausgabe, das entspricht einem Zehntel des Preises von GLM-5.3.

Nach der Veröffentlichung gibt es eine zweiwöchige zeitlich begrenzte 50%-Rabattaktion: 0,4 Yuan für die Eingabe bei Cache-Verfehlung, 1,4 Yuan für die Ausgabe, 0,115 Yuan für die Eingabe bei Cache-Treffer. Die Aktion läuft bis zum 24.00 Uhr des 9. Septembers 2026.

Nach diesen auffälligen Preisen ist GLM-5.3-Flash wirklich voller Angriffslust.

Aber um zu beurteilen, ob GLM-5.3-Flash DeepSeek wirklich getroffen hat, reicht es nicht, nur die Eingabe und Ausgabe bei Cache-Verfehlung zu betrachten.

Denn im echten Agent-Szenario kann der Preis für Cache-Treffer sogar den größten Anteil der Rechnung ausmachen.

Der sogenannte Cache-Treffer kann einfach so verstanden werden: Wenn Agenten das Modell wiederholt aufrufen, verwenden sie oft dieselben System-Prompts, Werkzeugdefinitionen, historischen Dialoge und Codes. Diese Inhalte wurden von der Plattform bereits einmal berechnet und können beim nächsten Mal direkt wiederverwendet werden.

Da es sich um bereits genutzte Inhalte handelt, ist der Preis natürlich günstiger als bei „Cache-Verfehlung“.

Dies ist bei normalen Chats vielleicht nicht so wichtig, aber wenn Agenten eine Aufgabe erledigen, rufen sie das Modell oft Dutzende oder sogar Hunderte Male nacheinander auf, und derselbe Aufgabenkontext und historische Aufzeichnungen werden wiederholt in den Kontext eingefügt. Besonders bei Aufgaben wie dem Schreiben von Code, bei denen die Eingabe sehr lang und die Ausgabe relativ kurz ist, beeinflusst der Preis für Cache-Treffer die Rechnung stärker.

Das ist auch ein kleiner cleverer Trick in der Preisgestaltung von Zhipu.

In seiner Werbung hebt es vor allem 0,8 Yuan pro Million Token für die Eingabe, 2,8 Yuan für die Ausgabe sowie 0,4 Yuan und 1,4 Yuan nach dem zeitlich begrenzten Rabatt hervor. Vergleicht man die Eingabe und Ausgabe bei Cache-Verfehlung, ist GLM tatsächlich günstiger als DeepSeek.

Aber der Standardpreis von GLM-5.3-Flash für Cache-Treffer beträgt 0,23 Yuan, während der Rabattzeitraum noch 0,115 Yuan kostet. DeepSeek V4 Flash kostet in Spitzenzeiten nur 0,1 Yuan, in Nebenzeiten sogar nur 0,05 Yuan.

Allein bei Cache-Treffern ist GLM selbst während der Rabattzeit teurer als DeepSeek in Spitzenzeiten; nach der Rückkehr zum regulären Preis ist es sogar das 2,3-fache des Preises von DeepSeek in Spitzenzeiten und das 4,6-fache des Preises in Nebenzeiten.

Nehmen wir an, eine Agent-Aufgabe hat eine kumulative Eingabe von 500.000 Token, von denen 99 % Cache-Treffer sind, und schließlich werden nur 10.000 Token ausgegeben. Das bedeutet, 495.000 Token werden nach dem Cache-Treffer-Preis berechnet, die restlichen 5000 Token nach dem Cache-Verfehlung-Preis.

Nach Ablauf der Rabattaktion kostet diese Aufgabe mit GLM-5.3-Flash etwa 0,146 Yuan; mit DeepSeek V4 Flash kostet sie in Nebenzeiten nur etwa 0,077 Yuan, in Spitzenzeiten etwa 0,155 Yuan.

Nach dieser Annahme ist GLM bei derselben Aufgabe fast 90 % teurer als „Liang Wengu“ und nur weniger als 6 % günstiger als „Liang Wenfeng“.

Das erklärt auch, warum einige Entwickler nach der tatsächlichen Nutzung feststellen, dass GLM insgesamt teurer ist als DeepSeek in Nebenzeiten, nur günstiger als in Spitzenzeiten: Bei Agent-Aufgaben mit hohem Cache-Trefferanteil werden die Einsparungen von GLM bei Eingabe und Ausgabe leicht durch den teureren Cache aufgezehrt.

Noch wichtiger ist: Der Rabatt von Zhipu dauert nur zwei Wochen, am 10. September wird der reguläre Preis wiederhergestellt.

Deshalb kann GLM-5.3-Flash nur „Liang Wenfeng“ schlagen, aber es ist nicht sicher, ob es „Liang Wengu“ besiegen kann.

Aber abgesehen von den Cache-Treffer-Preisen liegen die Preise von GLM-5.3-Flash in allen anderen Bereichen tatsächlich unter denen von DeepSeek.

DeepSeek ist schon sehr günstig, wie hat Zhipu es geschafft, den Preisboden weiter zu durchbrechen, während es eine gute Leistung beibehält?

Und die Antwort liegt in der Rechenleistung, die diesen „Ochsen“ trägt.

Immer noch ein „heimischer Ochse“

Nicht nur das Modell stammt aus dem Inland, auch die Rechenleistung, die diese massive globale echte Verkehrsbelastung aushält, verwendet ein inländisches Lösungskonzept.

Während der anonymen Veröffentlichung erreichte das tägliche Verarbeitungsvolumen von Ox Alpha zeitweise etwa 62 Billionen Token, und der gesamte Online-Verkehr wurde von 100.000 inländischen Chips getragen. Einige Medien berichten, dass diese Chips möglicherweise von Huawei, Moore Threads und Hygon stammen.

Natürlich werden 100.000 Chips nicht automatisch zu einem effizienten Inferenzsystem, wenn sie zusammengelegt werden.

Laut Zhipu sind die Hauptengpässe dieser inländischen Chips die Speicherkapazität und die Bandbreite.

Um den längsten Kontext von 1,04 Millionen Token