StartseiteArtikel

Nachdem ich die offizielle Version von DeepSeek V4 Pro im Praxistest vollständig evaluiert habe, habe ich erkannt, dass die nächste „Killer-Schwelle“ möglicherweise in seinem Agent verborgen liegt.

爱范儿2026-08-13 07:38
Neben dem Modell hat DeepSeek noch eine weitere Trumpfkarte.

Über Nacht sind drei bahnbrechende Modelle selten gleichzeitig erschienen.

Die theoretischen Benchmark-Werte von Grok 4.6 nähern sich denen von Fable 5, es zeichnet sich ab, dass es zu einem der drei großen ausländischen Anbieter werden könnte.

Qwen3.8 Max mit insgesamt 2,4 Billionen Parametern hat wie geplant seine Gewichte freigegeben; bei DeepSeek ist die offizielle Version von DeepSeek V4 Pro (deepseek-v4-pro) gleichzeitig online gegangen und bietet eine API-Schnittstelle an.

Nachdem ich die Benchmark-Grafik der offiziellen V4 Pro-Version gesehen habe, kann ich nur sagen: Die Verbesserungen sind mit bloßem Auge sichtbar.

Aber heutzutage haben wir schon zu viele Modelle gesehen, die bei Benchmarks nie verlieren, aber in der praktischen Nutzung nie gewinnen. Deshalb haben wir deepseek-v4-pro sofort in Codex und Claude Code integriert, um seine tatsächliche Leistung zu testen.

Ist die offizielle Version von V4 Pro wirklich gut nutzbar?

Beginnen wir mit den Textfähigkeiten.

Ich habe die offizielle V4 Pro-Version gebeten, Lu Xun nachzuahmen und einen etwa 400 Wörter langen kurzen Text zu schreiben, in dem sie sich darüber lustig macht, dass moderne Menschen hungrig bleiben, um zuerst das Essen zu fotografieren und in der Freundesliste zu posten – unter Berücksichtigung von Zeitgefühl, Sarkasmus und Humor.

Das Ergebnis lautet wie folgt:

Ehrlich gesagt, auf den ersten Blick gibt es definitiv noch eine Lücke zum echten Lu Xun.

Am Anfang hat es sogar direkt die charakteristische klassische Satzstruktur von Lu Xun übernommen, die Spuren der Nachahmung sind sehr offensichtlich. Aber die offizielle V4 Pro-Version hat zumindest den „Lu Xun-Stil“ nicht mechanisch als halbklassische, umgangssprachliche Mischung, seltene Wörter und archaische Partikel verstanden.

Es kann den Rhythmus der Satzstruktur erfassen und weiß, wie es das Verhalten „Essen fotografieren“ schrittweise zu dem Wunsch nach Darstellung, dem Gesicht und der Bewertung durch Beobachter lenken kann.

Wichtiger ist, dass der „Geschmack der von KI geschriebenen Pflichtaufsatz“ im gesamten Text bereits sehr schwach ist. Obwohl es noch nicht als großer Schriftsteller bezeichnet werden kann, fehlt zumindest das unangenehme Gefühl von zusammengefügten Vorlagen.

Wenn die Nachahmung von Lu Xun noch etwas von einer „Prüfung“ hat, kommt die folgende geschäftliche E-Mail dem täglichen Arbeitsalltag schon viel näher.

Ich habe angenommen, dass ein interner Fehler im Unternehmen zu einer einwöchigen Verzögerung des angepassten Systems für einen Großkunden geführt hat, und es gebeten, eine Entschuldigungs-E-Mail zu schreiben, in der die Verantwortung anerkannt, eine Entschädigung angeboten wird und gleichzeitig das Vertrauen des Kunden in die Zusammenarbeit nicht zerstört wird.

Die offizielle V4 Pro-Version hat keine üblichen unscharfen Ausdrücke aus dem Berufsleben wie „vielfältige Faktoren“ oder „Anpassung des Projektverlaufs“ verwendet, sondern direkt anerkannt: „Diese Verzögerung stammt vollständig aus unserem internen Fehler“, und anschließend drei Entschädigungen angeboten: Verlängerung der Garantie, Erhöhung der kostenlosen Schulungen und dedizierter Betriebsunterstützung.

Die gesamte E-Mail wurde in etwa 28 Sekunden fertiggestellt, der Text ist so weit fertig, dass man nur noch die Informationen anpassen muss, um sie zu verwenden.

Interessanterweise hat es nach dem Fertigstellen der E-Mail noch einmal zusätzlich erklärt, warum es so geschrieben hat – mit einer Art Beharrlichkeit, als würde es nach der Abgabe der Prüfung dem Lehrer die Lösungswege erklären.

Nachdem ich die Schreibfähigkeiten getestet habe, habe ich die offizielle Version von DeepSeek V4 Pro in Codex integriert.

DeepSeek unterstützt bereits nativ die OpenAI Responses API, und die offizielle Seite bietet direkt eine Integrationslösung für Codex an. Nach der Konfiguration können das Codex CLI, die ChatGPT-Desktopanwendung und das Codex-Plugin für VS Code dieselbe Konfiguration gemeinsam nutzen.

Ich habe auch einige Programmieraufgaben getestet.

Zuerst habe ich ihm eine sehr typische „umfassende“ Frontend-Anforderung gegeben.

Klassisches WebOS im macOS-Stil: Der gesamte Code soll in einer einzigen HTML-Datei untergebracht werden, gleichzeitig sollen Anwendungen wie Texteditor, Terminal, Code-Editor, Spiele, Dateiverwaltung, Malprogramm und Videobearbeitung integriert werden.

Allein an der Vollständigkeit der Ausführung gemessen ist dies die funktionsreichste Version unter den ähnlichen Modellen, die ich bisher getestet habe. Mehrere Anwendungen verfügen bereits über grundlegende Oberflächen und Interaktionen, das Systemgerüst ist auch relativ vollständig aufgebaut – nur das Design ist eher durchschnittlich.

Anschließend habe ich ein Beispiel für eine Sofortbildkamera getestet: Der gesamte Ablauf von Drücken des Auslösers, Blitzen, Ausgeben des Papiers und der chemischen Entwicklung von 8 bis 10 Sekunden soll vollständig simuliert werden, gleichzeitig sollen retro Farbverfälschungen, leichte Farbrauschen und die Oberflächentextur ähnlich wie bei Polaroid-Fotos hinzugefügt werden.

Betrachtet man das Endergebnis, ist der Übergang zwischen den Animationen auch relativ natürlich und flüssig.

Ein weiteres Beispiel: Ich habe direkt Three.js und WebGL verwendet, um es ein interaktives schwarzes Loch mit Akkretionsscheibe generieren zu lassen. Wenn die Maus den Beobachtungswinkel ändert, sollen sich Sternenhimmel, Akkretionsscheibe und Lichtablenkung entsprechend mitbewegen.

Bei leistungsempfindlichen Szenen wie WebGL ist die Steuerung von Partikelanzahl, Echtzeitberechnung, Renderaufwand und Animationskomplexität bei V4 Pro noch etwas zu aggressiv. Sobald ich die Webseite öffne, beginnt mein M2-Computer bereits merklich mit Frame-Einbrüchen.

Zum Schluss kommt ein HUD für das Cockpit eines Science-Fiction-Raumschiffs: Es muss gleichzeitig dynamische Fadenkreuze, Radar, Kurs, Geschwindigkeit, Energie, Zielerfassung und die Trägheitsverschiebung nach Mausbewegungen verarbeiten. Die offizielle V4 Pro-Version hat schließlich alle wichtigen Interaktionsbeziehungen umgesetzt.

Zusammenfassend lässt sich sagen: Solange es keine Fehler bei der offiziellen Bereitstellung gibt, hat die offizielle V4 Pro-Version die Vollständigkeit bei der Bewältigung komplexer Aufgaben verbessert. Dennoch hatte ich während der gesamten Nutzung immer das Gefühl, dass es an einigen besonders beeindruckenden Punkten fehlt – an einigen Stellen ist der Unterschied zu V4 Flash nicht so groß, wie ich es mir vorgestellt habe.

Aber im Agent-Szenario: Wenn Flash bereits 80% oder sogar 90% der Aufgaben erledigen kann und Pro nur für wenige schwierige Knotenpunkte zuständig ist, wird ein wirklich effizientes System dynamisch entscheiden, wann es Flash aufruft und wann Pro – anstatt ständig das teuerste Modell zu verwenden.

Mit anderen Worten: Die Fähigkeitsgradienten zwischen den Modellen können selbst zu einem Raum für Kostenoptimierung des Agenten werden.

Die nächste Karte von DeepSeek steckt in Harness

Was die Spezifikationen angeht, hat die DeepSeek V4-Serie den Kontext bereits auf 1 Million Tokens erweitert, die maximale Ausgabe erreicht 384.000 Tokens.

Für normale Chats wird ein so großes Fenster kaum benötigt, aber ein Coding Agent muss leicht Dutzende von Dateien, historische Änderungen, Rückgabewerte von Tools und Zustände lang andauernder Aufgaben gleichzeitig verarbeiten können. Je größer der Kontext ist, desto mehr Projektinformationen kann das Modell behalten.

Der Nachteil liegt auf der Hand: Die Anzahl der Tokens steigt schnell an.

Das erklärt auch, warum die Öffentlichkeit so viel Aufmerksamkeit geschenkt hat, nachdem DeepSeek angekündigt hat, die API-Preise in Kürze zu erhöhen.

Aktuell beträgt der Eingabepreis bei Treffern im Cache der offiziellen V4 Pro-Version 0,025 Yuan pro Million Tokens, bei nicht getroffenem Cache 3 Yuan und die Ausgabe 6 Yuan. Bei V4 Flash sind es entsprechend 0,02 Yuan, 1 Yuan und 2 Yuan.

Die Ein- und Ausgabepreise von Pro sind ungefähr dreimal so hoch wie die von Flash, aber auf dem globalen Markt sind sie immer noch sehr günstig.

DeepSeek selbst hat bereits im Voraus darauf hingewiesen, dass die Preise für API-Dienste in Kürze insgesamt angehoben werden und die Erhöhung voraussichtlich nicht gering ausfallen wird. Deshalb sind die aktuellen Preise von 3 Yuan für Eingabe und 6 Yuan für Ausgabe eher als ein vorübergehender Stufenpreis zu verstehen.

Ein weiterer erwähnenswerter Punkt: Nach den aktuellen Informationen zu dem Modell liegen seine Hauptfähigkeiten noch in Bereichen wie Text, Schlussfolgerung, Codierung und Tool Calls. Bisher gibt es keine native Eingabefähigkeit für Bilder, Videos und dergleichen. Kurz gesagt: Multimodalität ist derzeit nicht der Schwerpunkt der offiziellen V4 Pro-Version.

Im Vergleich dazu sind die Aktivitäten von DeepSeek im Bereich der Agenten deutlich häufiger geworden, kurz vor und nach der Veröffentlichung der offiziellen V4 Pro-Version.

In den letzten zwei bis drei Monaten haben wir auch gesehen, dass Cui Tianyi, der nun offiziell die Leitung der DeepSeek Harness-Abteilung übernommen hat, auf allen Plattformen aktiv nach neuen Mitarbeitern sucht – mit einer offensichtlichen Dringlichkeit, Talente zu gewinnen.

Unter anderem wurde kürzlich ein offizielles WeChat-Offiziellenkonto namens „DeepSeek Harness Team“ registriert, dessen Träger DeepSeek gehört. Bisher wurden noch keine Inhalte veröffentlicht.

Harness ist eine Ebene im heutigen Wettbewerb um Agenten, die oft vom Glanz der Modelle verdeckt wird.

Das Modell ist für die Schlussfolgerung zuständig, aber was tatsächlich bestimmt, wie der Agent Dateien liest, Tools aufruft, den Kontext verwaltet, fehlgeschlagene Versuche wiederholt und die Ausführung fortsetzt, ist das gesamte externe Laufzeitframework.

Die tatsächliche Nutzungserfahrung von Claude Code und Codex wird auch nie nur vom zugrundeliegenden Modell bestimmt.

Besonders nachdem DeepSeek sowohl Flash als auch Pro zur Verfügung hat, bekommt Harness eine weitere praktische Aufgabe: zu entscheiden, welche Aufgaben es wert sind, an Pro übergeben zu werden und welche Aufgaben mit Flash bereits erledigt werden können. Wenn das Modellrouting gut funktioniert, muss der Agent nicht für wenige schwierige Schritte den Preis von Pro für den gesamten Ablauf zahlen.