StartseiteArtikel

Mehr als 7 Billionen: Das wöchentliche Aufrufvolumen von DeepSeek V4 Flash belegt den ersten Platz weltweit.

36氪的朋友们2026-08-05 15:41
Allein am 1. August erreichte die tägliche Verarbeitungsmenge von DeepSeek V4 Flash 8 Billionen Token.

Die wöchentliche Rangliste der globalen Aufrufvolumina großer KI-Modelle, veröffentlicht von der Mehrmodell-Aggregationsplattform OpenRouter (27. Juli bis 2. August), zeigt, dass DeepSeek V4 Flash mit einem Aufrufvolumen von 7,22 Billionen Token den ersten Platz belegt.

Laut einem weiteren Beitrag des Open-Source-Projektteams OpenCode ist das Aufrufvolumen von DeepSeek V4 Flash auf seiner Plattform stark angestiegen. Allein am 1. August verarbeitete das Modell an einem einzigen Tag 8 Billionen Token, davon 5 Billionen durch den Verbrauch des kostenlosen Testkontingents und 3 Billionen durch die kostenpflichtige Nutzung von Entwicklern über die OpenCode-Plattform.

Aus Daten von OpenRouter geht hervor, dass das gesamte wöchentliche Aufrufvolumen der globalen großen KI-Modelle letzte Woche 56,8 Billionen Token betrug, was einem Rückgang von 2,07 % gegenüber der Vorwoche entspricht. Unter den gelisteten großen KI-Modellen erreichte das wöchentliche Aufrufvolumen chinesischer großer KI-Modelle 28,13 Billionen Token, ein Rückgang von 14,76 % gegenüber der Vorwoche. Im gleichen Zeitraum betrug das wöchentliche Aufrufvolumen großer US-amerikanischer KI-Modelle 4,38 Billionen Token, was einem Anstieg von 87,18 % gegenüber der Vorwoche entspricht. Das wöchentliche Aufrufvolumen chinesischer großer Modelle hat das der USA bereits 14 Wochen in Folge übertroffen und belegt fest den ersten Platz weltweit.

Am 5. August ergab eine Abfrage von OpenRangliste der laufenden Woche durch Jiemian News, dass DeepSeek V4 Flash 0423 zum Zeitpunkt der Veröffentlichung immer noch an erster Stelle stand, mit einem Aufrufvolumen von 6,92 Billionen Token. Dieses Modell wurde erstmals im April dieses Jahres vorgestellt, zeichnet sich durch ein ausgewogenes Verhältnis von Inferenzgeschwindigkeit, Langkontext-Fähigkeit und Aufrufkosten aus und bietet hauptsächlich Entwicklern und kommerziellen Unternehmen Inferenzdienste mit hohem Durchsatz an.

OpenRouters wöchentliche Rangliste der Aufrufvolumina (zum Zeitpunkt der Veröffentlichung)

Auf dem zweiten Platz liegt MiMo-V2.5, das von Xiaomi entwickelt wurde, mit einem wöchentlichen Aufrufvolumen von 5,1 Billionen Token, was einem Rückgang von 52 % gegenüber der Vorwoche entspricht. Der Datenverkehr zeigt einen deutlichen Rückgang, und die Marktwärme hat etwas nachgelassen.

Dieses Xiaomi-Modell wurde am 23. April dieses Jahres offiziell in die öffentliche Testphase überführt und Ende April vollständig quelloffen gemacht. Es nutzt die MoE-Architektur (Mixture of Experts) mit einer Gesamtparameterzahl von über einer Billion, 42B aktivierten Parametern, einem standardmäßigen 1-Millionen-Token-Langkontext-Fenster und deckt gleichzeitig die multimodale Interaktion von Text, Sprache und Bild ab. Geringe Inferenzkosten und stabile Betriebsfähigkeit von Agenten sind die Kernvorteile, die ausländische Entwickler zur Massenintegration anziehen.

In der Woche vom 20. Juli bis 26. Juli belegte MiMo-V2.5 bereits den ersten Platz von OpenRouters wöchentlicher Aufrufvolumen-Rangliste, mit einem wöchentlichen Aufrufvolumen von 10,5 Billionen Token und einem Anstieg von 12 % gegenüber der Vorwoche.

Der dritte Platz gehört derzeit zu Hunyuan Hy3, einem selbst entwickelten großen Modell von Tencent, mit einem Aufrufumfang von 5,01 Billionen Token. Hy3 ist ein allgemeines großes Selbstentwicklungsmodell von Tencent. Der Datenverkehr dieses Modells blieb in dieser Periode gegenüber der Vorwoche unverändert, mit einer Wachstumsrate von 0 %. Hy3 war einst das Modell mit dem stärksten Wachstum auf der Rangliste der Woche, in der der 26. Juli lag. Zu diesem Zeitpunkt betrug das wöchentliche Aufrufvolumen 3,94 Billionen Token, mit einem Anstieg von über 999 % gegenüber der Vorwoche.

Hy3 wurde am 6. Juli offiziell quelloffen gemacht, mit einer Gesamtparameterzahl von 295B und nur 21B aktivierten Parametern pro Inferenz. Es nutzt eine Fusionsarchitektur aus schnellem und langsamem Denken, unterstützt maximal 256K Kontext und hat die Fähigkeiten zur Codegenerierung und intelligenten Interaktion erheblich verbessert. Tencent Hunyuan hat in einem Beitrag angegeben, dass das gesamte Aufrufvolumen von Hy3 bis zum 15. Juli bereits mehr als 68-fach höher ist als das des Vorgängermodells Hy2.

Der vierte Platz gehört ebenfalls zum Modell V4 Flash 0731 von DeepSeek. Dies ist ein neu veröffentlichtes neues Modell von DeepSeek mit einem wöchentlichen Datenverkehr von 3,45 Billionen Token. Der fünfte Platz ist GPT-5.6 Luna, das von OpenAI entwickelt wurde, mit einem wöchentlichen Token-Aufrufvolumen von 2,99 Billionen und einem explosiven Wachstum von 738 %.

Unter den ersten fünf Plätzen der Rangliste belegen die in China entwickelten großen Modelle die ersten vier Plätze, was eine extrem hohe Marktwärme bei den Aufrufen zeigt. Das neu iterierte Modell von OpenAI holt jedoch stark auf, was bedeutet, dass der Wettbewerb zwischen den globalen führenden Herstellern nicht nachlässt.

Betrachtet man die ersten zehn Plätze, belegt DeepSeek drei Plätze. Neben zwei Versionen von V4 Flash steht DeepSeek V4 Pro mit 2,97 Billionen Token auf dem sechsten Platz. Modelle von vielen Unternehmen wie Anthropic, Google, NVIDIA, MiniMax, Stepfun und Zhipu AI sind auf der Rangliste gelistet. Kostenlose Modelle nehmen immer mehr Anteile am Datenverkehr ein. Kostenlose Modelle wie NVIDIA Nemotron 3 Ultra, Poolside Laguna S 2.1 und Inclusion AI Ling-3.0-flash verzeichnen ein schnelles Wachstum, und viele kostenlose Modelle erreichen einen Anstieg von über 50 % gegenüber der Vorwoche.

Erwähnenswert ist, dass das Kimi K3-Modell, das zuvor von Elon Musk viel Aufmerksamkeit erhalten hat, diese Woche vorübergehend aus den ersten zehn Plätzen gefallen ist und derzeit auf Platz 12 steht. Dieses Modell hat eine Gesamtparameterzahl von 2,8 Billionen und ist mit einem 1-Millionen-Token-Langkontext-Fenster ausgestattet, was es zum quelloffenen großen Modell mit der größten Parameterzahl weltweit macht.

Im Gegensatz zu den früheren Wettbewerbsmodellen, bei denen Datenverkehr durch niedrige Preise erkauft wurde, ziehen die aktuellen chinesischen Modelle ausländische Entwickler durch kontinuierlich verbesserte Inferenzleistung und stabile Dienstleistungsfähigkeit an. Es gibt jedoch auch Herausforderungen: OpenAI und Anthropic bringen ständig neue Modellversionen heraus und verringern den Leistungsabstand kontinuierlich; mehrere Modelle der Google Gemini-Serie stehen stabil in den vorderen Plätzen der Rangliste, und ausländische Giganten verfügen immer noch über eine solide Grundbasis.

Die Differenzierung innerhalb des Sektors ist ebenfalls zu beachten. Einige chinesische Modelle verzeichnen in dieser Periode einen starken Rückgang des Aufrufvolumens. Xiaomi MiMo-V2.5, MiniMax M3 und Zhipu GLM5.2 weisen alle einen unterschiedlichen Grad an Rückgang des Datenverkehrs auf. Da die Geschwindigkeit des Wechsels der Popularität immer schneller wird, ist es sehr leicht, den Entwicklerdatenverkehr schnell zu verlieren, sobald sich das Tempo der Produktiteration verlangsamt.

Ein Analyst der KI-Branche weist darauf hin, dass der Markt für unabhängige ausländische Entwickler bereits in einen intensiven Wettbewerb eingetreten ist. Es ist schwierig, Vorteile nur durch eine einzelne Versionsaktualisierung zu behalten. Wie man kontinuierlich iteriert und die Inferenzkosten effizient kontrolliert, wird darüber entscheiden, ob die verschiedenen Modelle die Nutzer langfristig behalten können.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Jiemian News“, Autor: Song Jianan, veröffentlicht mit Genehmigung von 36kr.