StartseiteArtikel

Die offizielle Version von DeepSeek V4 ist erschienen, neue Fähigkeiten kommen zum Vorschein, der König des Preis-Leistungs-Verhältnisses startet den Wettbewerb.

凤凰网科技2026-07-31 15:47
Der König des Preis-Leistungs-Verhältnisses wird den Agent-Wettkampf starten.

Am Nachmittag des 31. Juli hat die Technologieabteilung von Ifeng.com auf der offiziellen Website von DeepSeek nachgesehen und festgestellt, dass die API der offiziellen Version von DeepSeek-V4-Flash für die öffentliche Betaphase freigegeben wurde. Anders als die bisherige Hierarchielogik „Pro ist stark, Flash ist schwach“ sendet dieses Update ein bemerkenswertes Signal aus – die Leistung der offiziellen Flash-Version bei mehreren Agent-Benchmark-Tests hat bereits das Niveau der Vorschauversion von V4-Pro vor drei Monaten erreicht oder sogar übertroffen.

Laut dem offiziellen Update-Log erzielte die offizielle Version von V4-Flash 82,7 Punkte im Terminal Bench 2.1, 54,2 Punkte im NL2Repo, 76,7 Punkte im Cybergym und 70,3 Punkte im Toolathlon verified. Die Vorschauversion von V4-Pro erzielte hingegen 67,9 Punkte im Terminal Bench 2.0.

Es ist zu beachten, dass Terminal Bench 2.0 und 2.1 nicht dieselbe Version des Testdatensatzes sind, sodass ein direkter Vergleich nicht völlig fair ist. Dass eine Leichtgewichtversion mit nur 13 Milliarden aktivierten Parametern solche Werte bei den Agent-Fähigkeiten erreicht, zeigt bereits, dass das Optimierungspotenzial in der Nachtrainingsphase einen höheren Hebeleffekt haben könnte als die bloße Erhöhung der Parameterzahl.

Darüber hinaus hat DeepSeek ausdrücklich darauf hingewiesen, dass die öffentliche Betaphase derzeit nur auf die API beschränkt ist und die neuesten Funktionen in der App und auf der Webseite vorerst nicht ausprobiert werden können. Die offizielle Version von DeepSeek-V4-Pro wird so schnell wie möglich veröffentlicht.

„Nur das Nachtraining wurde erneut durchgeführt“

DeepSeek hat im offiziellen Update-Log erklärt: „Die Modellstruktur und -größe von DeepSeek-V4-Flash-0731 stimmen mit der DeepSeek-V4-Flash-preview überein, nur das Nachtraining wurde erneut durchgeführt.“

Laut dem offiziellen technischen Bericht von DeepSeek hat V4-Flash insgesamt 284 Milliarden Parameter und 13 Milliarden aktivierte Parameter; V4-Pro hat insgesamt 1,6 Billionen Parameter und 49 Milliarden aktivierte Parameter. Die Modellgröße der beiden unterscheidet sich um eine Größenordnung. Wenn Flash die Agent-Fähigkeiten durch Nachtraining auf ein Niveau nahe an Pro heben kann, bedeutet dies, dass die Modellgröße für bestimmte Aufgaben nicht der entscheidende Faktor ist – das Gewicht der Trainingsmethoden und der Datenqualität steigt.

Die Behörde hat ferner ausdrücklich angegeben, dass die Code-Agent-Aufgabe in diesem öffentlichen Benchmark-Test mit dem minimalen Modus von DeepSeek Harness als Framework getestet wurde, mit der maximalen Stufe, topp=0,95 und temperature=1,0. Dieses Detail deutet darauf hin, dass DeepSeek möglicherweise auch gezielte Optimierungen auf der Ebene des Agent-Frameworks vorgenommen hat, nicht nur Verbesserungen am Modell selbst.

Dies ist auch das erste Mal, dass das von DeepSeek selbst entwickelte Harness unter seinem offiziellen Namen erscheint. Zuvor hat Liang Wenfeng den Umsetzungsweg der AGI einmal mit dem Treppensteigen verglichen: Das Sprachmodell ist die erste Stufe, im letzten Jahr wurde das CoT (Chain of Thought) gelöst, die Stufe in diesem Jahr ist der Agent, und nach dem Agent muss das Problem des kontinuierlichen Lernens gelöst werden – das Modell soll wie ein Mensch langfristig Erfahrungen sammeln, anstatt jedes Mal den vollständigen Kontext zu erhalten, um arbeiten zu können. Danach kommt erst der „Singularität“ der Selbstiteration und die verkörperte Intelligenz. „KI fehlt es heute nicht an Geschmack und Intuition, es fehlt ihr an der Fähigkeit zum kontinuierlichen Lernen“, sagte er, „Investoren konzentrieren sich auf Agent, wir konzentrieren uns darauf, wie das Lernproblem gelöst werden kann.“

Kontinuierliches Lernen klingt nach einem Problem auf Modellebene, aber seine technische Umsetzung liegt genau im Harness. Das DeepSeek Agent Harness Team wurde im März dieses Jahres gegründet. Der Leiter Cui Tianyi ist ein Nachwuchskraft der 90er-Jahre, hat einen Abschluss in Informatik der Zhejiang-Universität, besitzt 6 Goldmedaillen bei den asiatischen Regionalwettbewerben der ACM, arbeitete neun Jahre lang bei der Top-Quantifizierungsinstitution Jane Street und trat im März dieses Jahres DeepSeek bei. Danach hat er im Mai kräftig neue Mitarbeiter eingestellt.

Wie verlautet, wird die Harness-Planung von DeepSeek gleichzeitig mit der Veröffentlichung der offiziellen Version von V4 eingeführt. DeepSeek hat ferner am Ende des Logs angegeben: „Die offizielle Version von DeepSeek-V4-Pro wird so schnell wie möglich veröffentlicht.“

Ein direkter Wettbewerb auf der Ebene des Ökosystems

Wenn der Wettbewerb um große Modelle im Jahr 2023 als „Wettbewerb um allgemeine Fähigkeiten“ und im Jahr 2024 als „Wettbewerb um langen Kontext“ galt, dann ist das Schlüsselwort des Jahres 2026 zweifellos Agent.

Die Agent-Fähigkeit – also die Fähigkeit des Modells, Aufgaben selbstständig zu planen, Werkzeuge aufzurufen und komplexe Aufgaben auszuführen – wird zu einem neuen Maßstab für die Stärke großer Modelle. Von Terminal Bench (Terminal-Bedienung) und NL2Repo (Code-Repository-Generierung) bis hin zu Cybergym (Cybersicherheitsaufgaben) und SWE-bench (Software-Engineering) definiert eine Reihe von Agent-Benchmark-Tests neu, was ein gutes Modell ausmacht.

Auf globaler Ebene wird die erste Ebene der Agent-Fähigkeiten derzeit noch von geschlossenen Großkonzernen beherrscht. Laut Daten von Drittplattformen für Bewertungen wie benchlm.ai stehen die Serien GPT-5.6 Sol und Claude Opus bei den meisten Agent-Benchmark-Tests an der Spitze. In der inländischen Gruppe holen GLM, Qwen und andere ebenfalls schnell auf.

Mit der deutlichen Verbesserung der Agent-Fähigkeiten von Flash verfolgt DeepSeek eine klare strategische Absicht: Mit kostengünstigen Leichtgewichtmodellen in den riesigen Markt der Agent-Anwendungen einzudringen.

Schließlich sind Agentszenarien viel empfindlicher für die Inferenzgeschwindigkeit und die Kosten als reine Dialogszenarien. Die Kosten für eine Agent-Aufgabe, die wiederholt Werkzeuge aufrufen und mehrfache Inferenzen durchführen muss, können mehrfach oder sogar zehnmal so hoch sein wie bei Flash, wenn sie mit einem Flaggschiffmodell ausgeführt wird. Wenn Flash bei den Agent-Fähigkeiten das Niveau „ausreichend nutzbar oder sogar gut nutzbar“ erreicht, wird sein Kostenvorteil äußerst wirksam sein.

Die beiden von der Behörde veröffentlichten internen Testdatensätze haben ebenfalls klare Ziele: DSBench-FullStack (interner Full-Stack-Entwicklungstestdatensatz) erzielte 68,7 Punkte, DSBench-Hard (interner Testdatensatz für schwierige Coding-Agent-Aufgaben) erzielte 59,6 Punkte. Dies bestätigt indirekt die Positionierung von DeepSeek – Flash zu einer bevorzugten Basis für Entwickler und Agent-Anwendungen zu machen.

Ein stiller Wettbewerb im Ökosystem hat ebenfalls begonnen: Die offizielle Version V4-Flash unterstützt nativ das Responses-API-Format und ist gezielt an Codex angepasst.

Responses API ist ein neues API-Format, das von OpenAI stark gefördert wird. Im Vergleich zum herkömmlichen Chat Completions eignet es sich besser für Agentszenarien – es unterstützt flexiblere Werkzeugaufrufe, komplexere Mehrrunden-Interaktionen und feinere Ausgabesteuerungen.

Dass DeepSeek dieses Format nativ unterstützt, bedeutet, dass Entwickler die Agent-Anwendungen, die auf Basis des OpenAI-Ökosystems entwickelt wurden, zu geringeren Kosten auf DeepSeek migrieren können. Dies wird ein direkter Wettbewerb zwischen den beiden auf der Ebene des Ökosystems sein.

Die Anpassung an Codex zielt auf das vertikale Szenario der Codegenerierung und Softwareentwicklung ab. Codex ist das Modell von OpenAI für den Code-Bereich. Die gezielte Anpassung von DeepSeek bedeutet, dass es direkt in das traditionelle Stärkenfeld von OpenAI eindringt und eine Herausforderung stellt.

Zusammengenommen zeigen diese Maßnahmen, dass DeepSeeks Ambition nicht nur darin besteht, ein „billiger Ersatz“ zu sein, sondern im Agent-Zeitalter seine eigene Ökosystemposition aufzubauen.

Nach der 50-Milliarden-Yuan-Finanzierungsrunde: Das Zeitfenster bei hoher Bewertung

Dieses Update findet weniger als zwei Monate statt, nachdem DeepSeek seine erste externe Finanzierungsrunde abgeschlossen hat.

Vor etwa mehr als einem Monat hat DeepSeek die erste externe Finanzierungsrunde seit seiner Gründung vor fast drei Jahren abgeschlossen, mit einem Gesamtbetrag von über 50 Milliarden Yuan, der den Rekord für eine einzelne Finanzierungsrunde in der chinesischen KI-Branche aufgestellt hat. Die Bewertung nach der Investition beträgt etwa 52 Milliarden US-Dollar (ca. 350 Milliarden Yuan). Zu den Investoren gehören Industriegiganten wie Tencent, CATL und JD.com sowie mehrere staatliche Industriefonds.

Mitte Juli beabsichtigte DeepSeek, eine neue private Finanzierungsrunde voranzutreiben, mit einer Vor-Investitionsbewertung von etwa 71 Milliarden US-Dollar (ca. 480 Milliarden Yuan), was einem Anstieg von etwa 37 % gegenüber der Bewertung von 52 Milliarden US-Dollar nach der ersten Finanzierungsrunde entspricht. Der Zeitraum von 52 Milliarden bis 71 Milliarden Dollar beträgt weniger als sechs Wochen.

Hinter der hohen Bewertung steht die Anerkennung des Marktes für die technische Stärke von DeepSeek und die Wette auf seine kommerzielle Perspektive. Eine hohe Bewertung bedeutet aber auch hohe Erwartungen und hohen Druck.

Berichten mehrerer Medien zufolge hat der Gründer von DeepSeek, Liang Wenfeng, selbst rund 20 Milliarden Yuan in der ersten Finanzierungsrunde investiert und die Kontrolle über das Unternehmen durch eine spezielle Struktur fest in der Hand. Dieser Gründer, der aus der Quantifizierungsfirma High-Flyer hervorgeht, hat in den letzten fast drei Jahren darauf bestanden, mit eigenen Mitteln zu investieren. Die Tatsache, dass er sich jetzt von der „Strategie ohne Finanzierung und ohne Börsengang“ zu einer aktiven Annäherung an das Kapital gewandelt hat, ist selbst ein starkes Signal – DeepSeek beschleunigt seinen Weg zur Kommerzialisierung und zum Börsengang.

Die Veröffentlichung der offiziellen Flash-Version kann als technische Umsetzung von DeepSeek unter der Unterstützung des Kapitals angesehen werden. Aber die eigentliche Prüfung steht noch bevor: Kann die offizielle Version von Pro wie geplant erscheinen? Kann die Verbesserung der Agent-Fähigkeiten in tatsächliche Einnahmen umgewandelt werden? Wie kann DeepSeek seinen Kostenvorteil unter dem Druck der Großkonzerne wie OpenAI und Anthropic ausspielen?

Der große Wettbewerb um den Agent-Bereich hat gerade erst begonnen. Mit der erheblichen Weiterentwicklung eines Leichtgewichtmodells stellt DeepSeek der Branche eine neue Aufgabe – wenn die Vorteile des Nachtrainings vollständig ausgeschöpft sind und die Effizienzsteigerung den Abstand der Parameter auszugleichen beginnt, wird die Wettbewerbslogik für große Modelle möglicherweise neu geschrieben.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „ifeng Technologie“, Autor: ifeng Technologie, veröffentlicht mit Genehmigung von 36Kr.