Sowohl Qwen als auch Zhipu AI haben ihre großen KI-Modelle über Nacht quelloffen veröffentlicht, alle Preise sind günstiger als die von DeepSeek, und der Preiskampf unter den chinesischen selbst entwickelten großen KI-Modellen ist extrem heftig.
Berichtet von Zhidx am 27. August: Gestern Abend hat das Team von Alibaba Qwen Large Model das multimodale MoE-Modell Qwen3.8-Flash-Next quelloffen veröffentlicht, ein vorläufige Vorschauversion, die auf der nächsten Generation von Qwen4-Architektur aufbaut.
Das Hauptmodell von Qwen3.8-Flash-Next verfügt über 125B Parameter, zusätzlich ausgestattet mit 51B N-Gram-Embedding, aktiviert 6B Parameter pro Token, unterstützt nativ 262144 Token Kontext und kann über YaRN auf 1 Million Token erweitert werden.
Im Vergleich zu Qwen3.7-Plus senkt Qwen3.8-Flash-Next die Trainings- und Inferenzkosten: Der Trainingsaufwand beträgt nur etwa 1/9 des Vorgängers, weist aber eine bessere Leistung bei Programmier- und Büroaufgaben auf. Darüber hinaus übertrifft dieses Modell in den meisten von dem Qwen-Team veröffentlichten Benchmark-Tests die offizielle Version von DeepSeek-V4-Flash.
Was den Preis betrifft, wird Qwen3.8-Flash bald auf der Qwen AI-Plattform online gestellt und API-Dienste für Dritte anbieten: Der Preis für eine Million Tokens Eingabe beträgt 1 Yuan, für Ausgabe 3 Yuan. Im Vergleich zu den Eingabepreisen von DeepSeek-V4-Flash in Freizeitstunden liegt der Preis um 33,33 % niedriger, der Ausgabepreis um 33,33 % niedriger.
Gestern Abend hat Zhipu ebenfalls das erste native multimodale Modell GLM-5.3-Flash (320B-A18B) der GLM-5-Serie quelloffen veröffentlicht – dies ist auch das anonyme Modell Ox-Alpha (das „Niulai“-Modell), das zuvor im Internet viral war, und senkt ebenfalls den Preis deutlich. Das neue Modell verfügt über 320B Gesamtparameter, seine Programmierleistung entspricht der von Claude Opus 4.8 in der sensorischen Bewertung des selbst entwickelten Z.ai Code Bench von Zhipu, der Preis sinkt auf 1/10 des Preises von GLM-5.3, im zeitlich begrenzten Rabatt sogar auf 1/20 von GLM-5.3 und 1/40 von Opus 4.8.
▲ Preisvergleich zwischen Qwen3.8-Flash-Next und Modellen der DeepSeek-V4-Serie (Grafik von Zhidx)
Qwen3.8-Flash wird erstmals auf „Qwen Office“ online gestellt, die API wird bald verfügbar sein.
Auf der Qwen AI-Plattform wird dieses Modell unter dem Namen qwen3.8-flash bereitgestellt. Die Qwen AI-Plattform unterstützt branchenübliche Standardprotokolle, einschließlich der mit OpenAI kompatiblen Chat Completions und Responses API sowie der mit Anthropic kompatiblen Schnittstelle. Gleichzeitig unterstützt die Qwen API das Anthropic API und das OpenAI Responses-Protokoll und kann direkt mit Claude Code und Codex zusammenarbeiten.
In seinem Blog wird erwähnt, dass Qwen die strukturellen Änderungen vorab veröffentlicht, damit die Community sie prüfen kann, bevor die vollständige Qwen4-Modellfamilie veröffentlicht wird.
Unter den Twitter-Kommentaren von Qwen können es viele ausländische Entwickler kaum erwarten, das neue Modell von Qwen auszuprobieren. Einige Nutzer loben es nur unablässig mit Sätzen wie „Das ist extrem stark“, „Wir brauchen OpenAI nicht“ und „Qwen hat das Potenzial, Opus in Zukunft zu übertreffen“.
Derzeit sind die Modellgewichte von Qwen3.8-Flash-Next auf Hugging Face und ModelScope veröffentlicht, es handelt sich um die Standard-Produktionsversion mit 1 Million Kontext und integrierten offiziellen Tools.
Technischer Bericht:
https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
Hugging Face Open-Source-Adresse:
https://huggingface.co/Qwen/Qwen3.8-Flash-Next
ModelScope Open-Source-Adresse:
https://www.modelscope.cn/models/Qwen/Qwen3.8-Flash-Next
01.
Mehr als zehn Tests übertreffen
DeepSeek‑V4‑Flash und Claude‑Opus‑4.6
Qwen3.8-Flash-Next hat das Modell systematisch in vier Bereichen aktualisiert: Attention, Residual, Embedding und Optimization. Während es die Modellfähigkeiten verbessert, optimiert es weiter die Recheneffizienz, die Modellkapazität und die Trainingsstabilität.
▲ Architektur des Modells Qwen3.8-Flash-Next
Die von dem Qwen Large Model Team veröffentlichten Benchmark-Ergebnisse zeigen, dass Qwen3.8-Flash-Next in den meisten Bereichen wie Agenten, Programmierung, allgemeine Fähigkeiten und Multimodalität Qwen3.8‑27B, Qwen3.7‑Plus, DeepSeek‑V4‑Flash‑0731 und Claude‑Opus‑4.6 (Max) übertrifft und den ersten Platz belegt.
Genauer gesagt belegt Qwen3.8-Flash-Next bei reinen Textfähigkeiten in 10 Aufgaben den ersten Platz und übertrifft Qwen3.8‑27B, Qwen3.7‑Plus, DeepSeek‑V4‑Flash‑0731 und Claude‑Opus‑4.6 (Max).
Bei den Programmierfähigkeiten belegt Qwen3.8-Flash-Next den ersten Platz bei Agenten-Programmierung DeepSWE1.1 und SWE-bench Pro mehrsprachiger Software-Engineering, nur bei dem Test auf Repository-Ebene für Codegenerierung liegt es leicht hinter DeepSeek zurück.
Bei Agenten belegt das neue Qwen-Modell den ersten Platz bei den gewichteten Punktzahlen von langfristigen Büroaufgaben, professionellen Arbeitsaufgaben und fortschrittlichen Agentenaufgaben sowie bei dem Testlauf für echte Tool-Aufrufe. Bei der einmaligen vollständigen Erfolgsrate bei fortschrittlichen Agentenaufgaben liegt seine Punktzahl unter der von DeepSeek-V4-Flash.
Bei allgemeinen Fähigkeiten belegt Qwen3.8-Flash-Next den ersten Platz bei Befehlsbefolgung, wissenschaftlichem Schlussfolgern und Wettbewerbscodes, nur bei der umfassenden multidisziplinären Schlussfolgerungsfähigkeit liegt es leicht hinter Claude-Opus-4.6 zurück.
Bei multimodalen Fähigkeiten übertrifft dieses Modell in 13 Aufgaben die anderen drei Modelle und belegt den ersten Platz.
Bei multimodalen Agentenfähigkeiten wird hauptsächlich geprüft, ob das Modell Screenshots verstehen, Mobiltelefone und Computer bedienen, die Entwicklung von Apps und Webseiten sowie multimodale Tool-Aufrufe nachvollziehen kann. Qwen3.8-Flash-Next belegt in allen diesen Bereichen den ersten Platz.
Allgemeine multimodale Fähigkeiten prüfen hauptsächlich das Verständnis von Bildern, Langvideos, Diagrammen und mathematischen Fähigkeiten des Modells. Qwen3.8-Flash-Next übertrifft in den meisten Tests die anderen drei Modelle, nur bei dem Test zur Analyse von wissenschaftlichen Diagrammen ohne spezielle Hinweise zum Schlussfolgern liegt seine Punktzahl unter der von DeepSeek.
Qwen hat auch die Vergleichsergebnisse zwischen Qwen3.8-Flash-Next-Base (mit 6B aktivierten Parametern) und den Basisversionen von Qwen3.8-27B sowie Qwen3.7-Plus veröffentlicht: Es erzielt in 8 von 14 Benchmarks die besten Ergebnisse. Die 51B N-Gram-Embedding-Parameter sind deterministisch adressierbar und werden nicht in die Matrixmultiplikationsberechnung pro Token einbezogen.
Da die Anzahl der erforderlichen Parameter für Basismodelle und die Länge der Kontextfenster ständig zunehmen, ist das Kernproblem nicht mehr, wie groß die Skala erreicht werden kann, sondern wie hoch die Effizienz bei der Umsetzung der Skalierung ist. Aus diesem Grund hat das Alibaba Qwen Large Model Team Innovationen in der Architektur vorgenommen. Das von ihm quelloffen veröffentlichte Qwen3.8-Flash-Next ist genau das phasenweise Schlüsselergebnis von Alibaba auf dem Weg zu diesem Ziel.
Dieses Modell ist eine experimentelle Vorschauversion, die auf der Qwen4-Architektur aufbaut, deren Kern darin besteht, tiefgehend darüber nachzudenken, wie die Kernkomponenten moderner großer Sprachmodelle in groß angelegten Betriebsszenarien zusammenwirken.
02.
Vier große Architekturinnovationen
Machen das neue Modell leistungsstärker, stabiler und kostengünstiger
Qwen3.8-Flash-Next umfasst hauptsächlich vier Innovationspunkte:
1. Kombination von GDN und Qwen Sparse Attention (QSA) zur Realisierung effizienter Speicherung und präziser Abfrage
Die herkömmliche globale Aufmerksamkeit kann direkt auf alle historischen Token zugreifen, aber je länger der Kontext ist, desto höher sind die Kosten für Berechnung und KV-Cache-Speicherzugriff.
Es setzt das Architekturdesign von Qwen3.5 fort und verwendet die Hybridarchitektur aus GDN+Attention: Drei von vier Schichten verwenden Gated DeltaNet (GDN), um historische Informationen kontinuierlich in einen Zustand fester Größe zu komprimieren. Die verbleibende Schicht behält die globale Aufmerksamkeit bei, die für die genaue Abfrage globaler Informationen zuständig ist.
Die Forscher führen ferner Qwen Sparse Attention (QSA) in die globale Aufmerksamkeit ein, um die Berechnung bei langen Sequenzen zu reduzieren, indem nur wichtige Kontexte berücksichtigt werden. QSA filtert wichtige Kontexte auf der Granularität von Mikroblöcken über einen komprimierten leichtgewichtigen Indexer und senkt so den Aufwand für Aufmerksamkeit bei langen Sequenzen. Dadurch wird nicht nur der tatsächliche Berechnungsaufwand für die Aufmerksamkeit reduziert, sondern auch der Kontext-Indexaufwand für die „Suche nach wichtigen Kontexten“ selbst.
Man kann es so verstehen: GDN ist für das effiziente „Merken“ zuständig, QSA für das präzise „Suchen“.
Auf 1M Token erreicht der Attention-Kernel von QSA in der Prefill- bzw. Decode-Phase eine Beschleunigung von bis zu 7,6-fach bzw. 4,9-fach. Unter den experimentellen Bedingungen, die den Online-Szenarien mit hoher Cache-Wiederverwendung entsprechen (Trefferquote des Prefix-Caches beträgt 90 %), erreicht der Prefill-Durchsatz von Qwen3.8-Flash-Next bei 1M Kontext das 8,6-fache von Qwen3.7-Plus.
2. Einführung von Gated Residual (GR, gesteuerter Reststrom) für mehr Übertragungswege von Informationen
In der herkömmlichen Transformer-Architektur lesen und schreiben alle Schichten kontinuierlich Informationen auf demselben Reststromkanal. Mit zunehmender Tiefe des Netzwerks vermischen sich frühe Merkmale ständig mit nachfolgenden Informationen, sodass wichtige Informationen leichter allmählich verdünnt werden.
GR kann als Kombination zweier Ideen betrachtet werden: Einerseits wird das Design von Hyper-Connection fortgesetzt, das den Reststrom in mehrere Zweige erweitert. Andererseits wird das elementweise dynamische Gating von GatedNorm in das Lesen des Reststroms integriert. Schließlich wird der ursprüngliche einzelne Reststrom in 4 parallele Zweige erweitert. Das Modell kann dynamisch bestimmen, wie viele Informationen aus verschiedenen Zweigen gelesen und in verschiedene Zweige geschrieben werden, je nach aktuellem Inhalt.
Man kann es so verstehen