StartseiteArtikel

Zhipu (Protokoll): Die Umsatzstruktur hat sich umgekehrt, der ARR erreicht 1,6 Milliarden US-Dollar

海豚投研2026-09-02 11:53
ARR wird erstmals offengelegt, wobei proaktiv zwei unterschiedliche Berechnungsansätze bereitgestellt werden.

Das Folgende ist das Protokoll der Ergebnis-Telefonkonferenz von Zhipu (02513.HK) für das Zwischengeschäftsjahr FY26, zusammengestellt von HaiTun:

I. Rückblick auf die Kerninformationen des Finanzberichts

1.ARR wird erstmals offengelegt, und es werden aktiv zwei Berechnungsgrundlagen angegeben

a. Bis Ende August 2026 erreicht ARR 1,6 Milliarden US-Dollar, die Berechnungsgrundlage ist die monatliche Annualisierung, d. h. der Umsatz des einzelnen Monats August multipliziert mit 12.

b. Die Leitung weist gleichzeitig auf eine andere aggressivere Berechnungsmethode in der Branche hin: Die Daten der letzten Woche multipliziert mit 52; nach dieser Berechnungsgrundlage hat der neueste ARR nach der Massenverbreitung von GLM-5.3 bereits 2 Milliarden US-Dollar überschritten.

2.Die Umsatzstruktur hat den Wechsel abgeschlossen, Menge und Preis steigen gleichzeitig

a. Gesamtvolumen: Der Gesamtumsatz im ersten Halbjahr beträgt 957 Millionen RMB, was 142 Millionen US-Dollar entspricht, ein Anstieg von fast 400 % im Vergleich zum Vorjahreszeitraum.

b. Segment: Der Umsatz des Open-Plattform- und API-Geschäfts beträgt 825 Millionen RMB, was 123 Millionen US-Dollar entspricht, ein Anstieg von mehr als 27-fach im Vergleich zum Vorjahreszeitraum; sein Anteil am Gesamtumsatz ist von 15,2 % im gleichen Zeitraum des Vorjahres und 26,3 % zum Ende des Vorjahres auf 86,5 % gestiegen.

c. Aufteilung von Menge und Preis: Der durchschnittliche Preis von API ist um etwa 101 % gestiegen, während die Aufrufmenge des Coding-Plans im gleichen Zeitraum um mehr als das 23-fache gegenüber Jahresbeginn zugenommen hat. Die Leitung betont daher, dass die Mengenausweitung durch die Modellfähigkeiten anstelle der Preiselastizität angetrieben wird.

3.Bruttomarge und Recheneffizienz verbessern sich gleichzeitig

a. Die Bruttomarge des Open-Plattform- und API-Geschäfts ist von -0,4 % im Vorjahreszeitraum auf 24,6 % gestiegen, was einem Anstieg von 25 Prozentpunkten im Vergleich zum Vorjahr entspricht; sie ist auch um etwa 6 Prozentpunkte gegenüber 18,9 % im gesamten Vorjahreszeitraum gestiegen.

b. Das Unternehmen hat erstmals den Begriff „Rechenmultiplikator“ eingeführt, d. h. der Umsatz der Open-Plattform und API, der pro investiertem Yuan an Rechenleistung (einschließlich der Trainingsseite und der Inferenzseite) erzielt wird. Dieser Indikator hat sich gegenüber dem ersten Halbjahr des Vorjahres um das 14-fache verbessert.

4.Verlust verkleinert sich, die Leitung gibt an, dass der Bruttogewinn bereits die Forschung und Entwicklung unterstützt

a. Die Ausgaben für Forschung und Entwicklung im ersten Halbjahr betragen 2,13 Milliarden RMB, was etwa 317 Millionen US-Dollar entspricht.

b. Der Verlust im Berichtszeitraum beträgt 2,072 Milliarden RMB, was einem Rückgang von 12,5 % im Vergleich zum Vorjahr entspricht; die Verlustquote (Verlust im Berichtszeitraum geteilt durch Umsatz) hat sich im Vergleich zum Vorjahr um das 4,7-fache verkleinert; der bereinigte Nettoverlust beträgt 1,964 Milliarden RMB, und die bereinigte Verlustquote hat sich im Vergleich zum Vorjahr um das 3,5-fache verkleinert.

c. Die Begründung der Leitung lautet: Der bereinigte Nettoverlust von 1,964 Milliarden RMB ist bereits geringer als die Investition in Forschung und Entwicklung von 2,13 Milliarden RMB, was zeigt, dass der Bruttogewinn nach der Deckung der Verwaltungs- und Vertriebskosten bereits die Forschung und Entwicklung unterstützt.

II. Detaillierter Inhalt der Ergebnis-Telefonkonferenz

2.1 Kerninformationen der Aussagen der Führungskräfte

1.Fähigkeitsleiter und Geschäftsformel

a. Die Leitung definiert die Evolution der großen Modelle als fünfstufige Leiter, die nur nacheinander durchlaufen werden kann: Chat, Coding, Agent, Co-worker, Autonomous AI. Zwischen jeder Stufe gibt es technische Schwellenwerte; wenn diese nicht überwunden werden, ist das Geschäftsmodell der nächsten Stufe nicht ausgereift.

b. Im Berichtszeitraum lag der Schwerpunkt des Unternehmens zwischen der zweiten Stufe (Coding) und der vierten Stufe (Co-worker). Es wurden Versuche in Bereichen wie Cybersicherheit, Recht, Finanzen und Bildung unternommen, wobei die Cybersicherheit die schnellsten Fortschritte erzielt hat, während die anderen Bereiche noch in der Anfangsphase sind und keine skalierbaren Einnahmen erzielt haben.

c. Die von der Leitung vorgestellte Formel lautet: Der kommerzielle Wert von AGI = Obergrenze der Intelligenz × Umfang des Token-Verbrauchs. Mit jeder Erhöhung der Aufgabengrenze vergrößert sich der Marktraum um eine Größenordnung.

2.GLM-5.3 und GLM-5.3 Flash

a. GLM-5.3 und 5.2 verwenden die gleiche Architektur, die gleiche Gesamtparameterzahl und Aktivierungsparameterzahl. Die einzige Variable ist der Umfang des Nachschulungstrainings, die Abschlussrate von End-to-End-Aufgaben ist um mehr als 50 % gestiegen; die Trainingsaufgaben haben sich von übungsbasierten Aufgaben zu vollständigen professionellen Aufgaben gewandelt, die der tatsächlichen Arbeit von Experten nahekommen.

b. GLM-5.3 Flash ist auf Szenarien mit hoher Frequenz, großem Umfang und Kostensensitivität ausgerichtet. Es hat 320 Milliarden Gesamtparameter und 18 Milliarden Aktivierungsparameter, verwendet lineare und gemischte Aufmerksamkeit, sein Preis beträgt ein Zehntel von dem von 5.2, und es ist sowohl in Benchmark-Tests als auch in praktischen Anwendungen besser als 5.2.

c. Am ersten Tag der Veröffentlichung als anonymes Modell landete Flash auf dem ersten Platz von OpenRouter und brach den damaligen Rekord für den Token-Verbrauch, was den gesamten Aufrufumfang der Plattform um mehr als 20 % steigerte.

3.Dreistufige Evolution der Geschäftsform

a. Vor 2025 war die Phase der lokalen Bereitstellung: Kunden kauften Tools, die integriert, angepasst und in ihre eigene Umgebung bereitgestellt werden mussten, überlagert mit Anforderungen an Datensicherheitskonformität und selbstkontrollierte Unabhängigkeit.

b. Anfang 2025 trat man in die Coding-Phase ein, das Modell wandelte sich von wissensgesteuert zu aufgabengesteuert; das Unternehmen schrumpfte strategisch das Software-Lizenzgeschäft der lokalen Bereitstellung und wandelte sich zu aufrufbaren, erweiterbaren und messbaren intelligenten Diensten.

c. In diesem Jahr trat man in die Phase der parallelen Entwicklung von Agent und Co-worker ein, das Geschäft wandelte sich vom Verkauf von Aufrufen zum Verkauf von Abonnements und Ergebnissen von End-to-End-Aufgaben. Die Leitung fasst zusammen: Mit jedem Fähigkeitssprung des Modells rückt das, was Kunden kaufen, näher am endgültigen wirtschaftlichen Wert, und die Umsatzstruktur wird entsprechend neu gestaltet.

4.Plattformnutzer und Kundenqualität

a. Bis August 2026 übersteigt die Zahl der registrierten Nutzer der MaaS-Plattform 7,4 Millionen, ein Anstieg von 144 % gegenüber Jahresbeginn; die Zahl der zahlenden täglich aktiven Nutzer ist um 603 % gegenüber Jahresbeginn gestiegen; die durchschnittliche tägliche Aufrufmenge der zehn umsatzstärksten Nutzer in diesem Monat ist um das 98-fache gegenüber Jahresbeginn gestiegen.

b. Allein in den letzten zwei Monaten ist die Zahl der Nutzer dank GLM-5.2, 5.3 und 5.3 Flash von 5,8 Millionen Ende Juni um 1,6 Millionen auf 7,4 Millionen gestiegen.

c. Nach der ARR-Berechnungsgrundlage gibt es 115, 25, 37, 8, 2 und 2 Nutzergruppen mit einem jährlichen Umsatzbeitrag von über 100.000, 500.000, 1 Million, 10 Millionen, 25 Millionen und 250 Millionen US-Dollar.

5.Sicherheit und Governance

a. Die Vorgehensweise besteht darin, Open-Source, Offenheit und Sicherheitsfähigkeit gleichzeitig zu entwickeln: Indem das Modell über Open-Source-Gewichte, die MaaS-Plattform, den Coding-Plan und das globale Entwicklernetzwerk in möglichst viele reale Umgebungen gebracht wird, wird gleichzeitig die Zuverlässigkeit durch Zugriffskontrolle, Prozessüberwachung, Risikobewertung, Schwachstellenoffenlegung und externe Überprüfung sichergestellt.

b. Die empfindlichsten Fähigkeiten werden kontrolliert, vor der Open-Source-Veröffentlichung werden Schwachstellen von einem Drittteam unabhängig bewertet und die verantwortungsvolle Offenlegung über die nationale Schwachstellendatenbank abgeschlossen; das Prinzip der Arbeitsteilung lautet, dass das Unternehmen die Benchmark-Punkte selbst meldet und die Risikobeurteilung externen Teams überlassen wird, was sich nicht mit der Erhöhung der Fähigkeiten ändert.

2.2 Q&A Fragen und Antworten

F: Wie lange kann das Unternehmen seine Vorsprungsposition im Bereich Coding in Zukunft halten, und welchen Schlüsselvariablen wird es gegenüberstehen?

A: Jede Vorsprungsposition auf einzelnen Ranglisten wird eingeholt werden, was aufgebaut werden muss, ist die Fähigkeit zur kontinuierlichen Führung. Die Leitung gibt an, dass Coding-Benchmarks wöchentlich oder monatlich aktualisiert werden und bald eingeholt werden, außerdem weisen die Ranglisten selbst Störfaktoren auf. Daher lautet die Aussage zu SOTA im Halbjahresbericht eher, dass es wichtiger ist, wie stark die Fähigkeit zur kontinuierlichen Führung ist, als zu fragen, wie lange der Vorsprung anhält.

Der unterstützende Beweis ist, dass die Modellfamilie in den letzten etwa 11 Monaten mehrere Generationen Iterationen von 4.6, 4.7 bis 5.1, 5.2, 5.3 nacheinander abgeschlossen hat, die Fähigkeitskurve steigt kontinuierlich an, während die Kosten pro Aufgabe auf einem relativ gesunden Niveau gehalten werden.

Die Leitung erklärt gleichzeitig, dass das Unternehmen Coding nicht als eine Produktlinie mit schnellem Umsatzwachstum betrachtet, sondern als einen Knotenpunkt, der technologisch durchbrochen werden muss – nur wenn man entlang von Coding voranschreitet, kann man sich zu Agent, Langzeitaufgaben und Co-worker weiterentwickeln.

F: Wie soll die gesammelte Modellfähigkeit auf Szenarien außerhalb von Coding übertragen werden, und was ist der Umsetzungsweg?

A: Die Übertragung hat sich bereits in der Cybersicherheit bestätigt, der CyberGym-Wert ist von 77,2 auf 84,5 Punkte gestiegen. Die Leitung erklärt, dass man sich für den Einstieg bei Coding entschieden hat, weil es eine skalierbare, automatisierte und kostengünstige überprüfbare Umgebung bietet – ob der Code laufen kann, der Test bestanden wird und der Fehler behoben ist, kann objektiv beurteilt werden. Dies ist für das Verstärkungslernen von entscheidender Bedeutung, während die Schwierigkeit der meisten Wissensarbeit genau darin besteht, nicht beurteilen zu können, ob sie richtig ausgeführt wurde.

Ein weiterer Benchmark-Wert ist von 24,4 Punkten bei 5.2 um 30 Prozentpunkte auf 54,4 Punkte gestiegen, und je mehr Aufgaben eine vollständige langfristige Planung erfordern, desto deutlicher ist die Verbesserung von 5.3 gegenüber 5.2.

In der realen Umgebung arbeitet das Unternehmen mit mehreren inländischen Sicherheitsteams zusammen. In echten Codebasen wurden insgesamt 2436 Schwachstellen entdeckt und von Experten nach Duplikaten gefiltert, von denen mehr als 1000 hochriskant sind und 269 Projekte abdecken.

Es gibt drei Kriterien für die Szenarienauswahl: ob die intellektuelle Schwelle hoch genug ist, ob sie effektiv überprüft werden kann und ob sie nach Abschluss einen ausreichenden wirtschaftlichen Wert hat. Recht, Finanzen und Datenanalyse werden ebenfalls ausprobiert, aber die Zuverlässigkeitsschwelle und der Überprüfungsmechanismus sind unterschiedlich, sodass sich die kommerzielle Struktur entsprechend unterscheidet.

F: Wie ist der aktuelle Fortschritt der Erweiterung der Rechenleistung?

A: Es wird keine Angabe zur Anzahl der Grafikkarten gemacht, es wird befürwortet, stattdessen „effektive Rechenleistung“ und „Rechenmultiplikator“ zur Messung zu verwenden. Die Leitung gibt an, dass die Versorgung mit Rechenleistung ein gemeinsames Problem der Branche ist. Das Unternehmen expandiert in diesem Jahr kontinuierlich in einem gesunden Rhythmus und erhöht die Investitionen sowohl auf der Trainings- als auch auf der Inferenzseite.

Der Grund, warum die Anzahl der Grafikkarten nicht zur Messung verwendet wird, ist, dass Quellen und Verwendungszwecke vielfältig geworden sind: Die Quellen umfassen eigene Cluster, Mietung und Dienstleistungsbeschaffung, die Verwendungszwecke decken Vortraining, Mitteltraining, Nachschulung und Inferenz ab. Die Effizienz von Chips verschiedener Generationen und Architekturen unterscheidet sich stark, sodass die Summierung nicht die tatsächliche Fähigkeit widerspiegelt.

Intern wird darauf geachtet, wie viel Rechenleistung installiert ist, stabil gesteuert werden kann, langfristig läuft und schließlich in den Trainingsfortschritt und abrechenbare Token umgewandelt wird. Die Leitung ist der Meinung, dass die Frage nicht lauten sollte, wie viele Grafikkarten vorhanden sind, sondern wie schnell die Modelliteration und wie groß der Umfang der kommerziellen Token-Versorgung mit diesen Ressourcen unterstützt werden kann.

F: Welchen Umfang der Modelltrainings- und Inferenzanforderungen können die vorhandenen Rechenressourcen unterstützen?

A: Auf der Inferenzseite werden bereits 100.000 Grafikkarten der inländischen Chips erreicht, auf der Trainingsseite besteht weiterhin ein strukturelles Missverhältnis der heterogenen Rechenleistung. Ein Cluster mit 100.000 inländischen Chips hat die skalierbare kostengünstige Inferenz realisiert, was zu einem Rückgang der Kosten pro Inferenz um 80 % gegenüber Jahresbeginn führt.

Bei der anonymen Veröffentlichung von GLM-5.3 Flash wurden vollständig inländische Cluster zur Bereitstellung von Diensten verwendet. Das Aufrufvolumen von etwa 60 Billionen Token innerhalb von sechs Tagen war für OpenRouter und OpenCode ein historisches Niveau. Die Leitung ist der Meinung, dass bewiesen ist, dass inländische Grafikkarten „laufen können“, der tiefe Bereich besteht darin, die Wirtschaftlichkeit zu überprüfen.

Aus diesem Grund wurden vor einem halben Jahr die Inferenz-Engine und der Dienststapel neu erstellt, einschließlich Quantisierung, PD-Trennung, Layer-Split, Cache und Kommunikationsoptimierung. Die End-to-End-Leistung auf der gleichen inländischen Hardware hat sich gegenüber der Baseline um das 3-fache verbessert.

Auf der Trainingsseite handelt es sich um ein Strukturproblem und nicht um ein Mengenproblem, das sehr hohe Anforderungen an die Stabilität, das Netzwerk und den Softwarestapel von homogenen Clustern stellt, während in China hauptsächlich heterogene Rechenleistung vorherrscht.

Die Leitung erwartet, dass sich dies in drei bis sechs