首页文章详情

Gerade ist die öffentliche Beta der offiziellen DeepSeek-V4-Flash API online gegangen.

CSDN2026-07-31 16:03
DeepSeek-V4-Flash ist da

Am 31. Juli hat DeepSeek die öffentliche Betaphase der offiziellen API-Version von V4-Flash für die breite Öffentlichkeit freigegeben. Das auffälligste Stichwort diesmal ist – ein deutlicher Sprung der Agent-Fähigkeiten.

Die Ergebnisse von 9 Benchmark-Tests wurden umfassend veröffentlicht, zahlreiche Indikatoren übertreffen die zuvor veröffentlichte Vorschauversion V4-Pro-Preview bei weitem, was die Obergrenze für "Code-Agenten" direkt um ein weiteres Stück angehoben hat.

Von Terminal Bench bis DSBench-Hard, von Cybersicherheitsabwehr bis Full-Stack-Entwicklung zeigt die offizielle Version von DeepSeek-V4-Flash ein beeindruckendes Potenzial als "Allround-Agent".

Was bedeutet das? Das bedeutet, dass KI nicht mehr nur "Code schreiben kann", sondern beginnt, wirklich wie ein Ingenieur zu arbeiten – Terminal öffnen, Repository analysieren, Tools aufrufen, End-to-End-Aufgaben erledigen.

Ergebnisliste der 9 Benchmark-Tests: Daten sprechen für sich

Diesmal hat DeepSeek nichts zurückgehalten und direkt die vollständigen Ergebnisse der 9 Benchmark-Tests vorgelegt. Von Terminaloperationen bis zur Analyse von Code-Repositories, von Cybersicherheit bis zu automatisierten Tests ist das Spektrum sehr breit.

Dabei führt Terminal Bench 2.1 mit einer hohen Punktzahl von 82,7, was bedeutet, dass die Aufgabenausführungsfähigkeit des Modells in der Terminalumgebung bereits sehr ausgereift ist – es kann komplexe Befehlszeilenoperationen verstehen, Skripte schreiben, Fehler debuggen, was fast der Leistung eines "KI-Betriebsingenieurs" entspricht.

Cybergym erreichte 76,7 Punkte und zeigte eine hervorragende Fähigkeit zur Cybersicherheitsabwehr. DSBench-FullStack (Full-Stack-Entwicklungstest) und DSBench-Hard (Coding-Agent-Herausforderungstest) erzielten 68,7 bzw. 59,6 Punkte, was zeigt, dass das Modell nicht nur einzelne Funktionen schreiben, sondern auch die gesamte Entwicklungslinie von Frontend bis Backend bewältigen kann.

Testhinweis: Transparent und streng

DeepSeek hat gleichzeitig detaillierte Testbedingungen veröffentlicht, die Transparenz verdient Lob:

Anmerkung 1: Für die Code-Agent-Aufgaben in den öffentlichen Benchmark-Datensätzen verwendet die offizielle Version von DeepSeek-V4-Flash den DeepSeek Harness Minimalmodus (demnächst veröffentlicht) als Framework für Tests, wobei die max-Stufe, top_p=0,95 und temperature=1,0 eingestellt sind.

Anmerkung 2: DSBench-FullStack ist ein intern verwendeter Full-Stack-Entwicklungstestdatensatz, DSBench-Hard ist ein intern verwendeter Testdatensatz für Coding-Agent-Herausforderungen.

Erwähnenswert ist, dass der DeepSeek Harness Minimalmodus als Testframework, das bald unabhängig veröffentlicht wird, zusammen mit den Ergebnissen vorgestellt wurde. Dies deutet auch auf das Layout von DeepSeek beim Aufbau eines standardisierten Agent-Bewertungsökosystems hin – es werden nicht nur stärkere Modelle trainiert, sondern auch zuverlässigere Bewertungstools bereitgestellt.

Native Unterstützung der Responses API, angepasst an Codex

Neben dem Sprung der Benchmark-Ergebnisse gibt es auch wichtige Aktualisierungen bei der technischen Anpassung der offiziellen Version V4-Flash – sie unterstützt nativ das Responses-API-Format und wurde gezielt an Codex angepasst.

Das bedeutet, dass Entwickler V4-Flash auf natürlichere Weise in die vorhandenen Codex-Arbeitsabläufe einbinden können, was die Migrationskosten senkt. Die spezifische Konfigurationsmethode finden Sie in der offiziellen Dokumentation von DeepSeek.

Modellstruktur unverändert, Nachschulung ist der Schlüssel

Ein bemerkenswertes Detail ist: Die Modellstruktur und -größe von DeepSeek-V4-Flash-0731 stimmen vollständig mit der Preview-Version überein, es wurde lediglich eine erneute Nachschulung durchgeführt.

Mit anderen Worten: Das Grundgerüst hat sich nicht geändert, was sich geändert hat, ist die "nachträgliche Ausbildung". Dies zeigt genau, dass im Bereich der Agent-Fähigkeiten der Optimierungsraum für Nachschulungsstrategien noch enorm ist. Bei gleicher Modellarchitektur kann eine feinere Optimierung durch Nachschulung zu einem qualitativen Sprung in den Benchmark-Tests führen – was eine weitreichende Erkenntnis für die gesamte Branche ist.

Umfang dieses Updates: Nur V4-Flash API

Hinweis zum Umfang des Updates

Bereits aktualisiert: DeepSeek-V4-Flash API-Schnittstelle

Nicht aktualisiert: DeepSeek-V4-Pro API

Nicht aktualisiert: Modell auf App-Seite / WEB-Seite

Demnächst veröffentlicht: Offizielle Version von DeepSeek-V4-Pro (wird so schnell wie möglich veröffentlicht)

Es ist zu beachten, dass dieses Update nur die API-Schnittstelle von DeepSeek-V4-Flash betrifft. Wenn Sie Nutzer von V4-Pro sind oder DeepSeek über die App/Web-Seite verwenden, wirkt sich dieses Update vorerst nicht auf Sie aus.

Bezüglich der von allen interessierten offiziellen Version von V4-Pro gab DeepSeek an, dass sie "so schnell wie möglich veröffentlicht wird". In Anbetracht dessen, dass die Flash-Version bereits so starke Agent-Fähigkeiten gezeigt hat, ist die Leistung der offiziellen V4-Pro-Version zweifellos noch erwartungsvoller.

Branchenbeobachtung: Das Agent-Zeitalter beginnt offiziell?

Von Terminal Bench bis Cybergym, von DeepSWE bis Toolathlon – die Namen dieser 9 Benchmark-Tests selbst zeigen einen Trend: Die Bewertung der KI-Fähigkeiten entwickelt sich von "einem Codeabschnitt schreiben" zu "eine technische Aufgabe erledigen".

Die offizielle Version von DeepSeek-V4-Flash übertrifft V4-Pro-Preview bei zahlreichen Agent-Benchmarks bei weitem und sendet ein klares Signal – der Wettbewerbsfokus im Zeitalter der Nachschulung hat sich von der Modellgröße zur tiefgreifenden Optimierung der Agent-Fähigkeiten verschoben.

Wenn KI in der Lage ist, Terminals geschickt zu bedienen, Code-Repositories zu analysieren, Cybersicherheitsabwehr durchzuführen und Full-Stack-Entwicklungsaufgaben zu erledigen, erleben wir vielleicht gerade den Beginn eines neuen Zeitalters: KI ist nicht mehr nur ein Code-Assistent, sondern wird zu einem echten KI-Ingenieur.

Und DeepSeek läuft auf diesem Weg ganz vorne.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto "CSDN", zusammengestellt von Meng Yidan, veröffentlicht mit Genehmigung von 36kr.