DeepSeek V4.1 Flash wurde veröffentlicht, es liefert die Leistung der Pro-Klasse zu dem Preis der Flash-Klasse.
Bild von KI generiert
Am 10. September hat DeepSeek offiziell V4.1 Flash veröffentlicht, gleichzeitig die API-Preise gesenkt und angekündigt, dass der V4 Pro-Dienst am 14. September um 12 Uhr Peking-Zeit eingestellt wird. Die entsprechenden Anfragen werden anschließend vom neuen Modell verarbeitet.
Nach offiziellen Angaben von DeepSeek hat V4.1 Pro in Bezug auf Leistung, Kosten, Geschwindigkeit und Gesamtaufgabendauer V4 Pro umfassend übertroffen. Dieses Modell mit neuer Architektur und nativer Unterstützung für visuelles Verständnis übernimmt nun die Position der vorherigen Pro-Generation.
Der Schwerpunkt dieses Updates liegt daher auf drei zusammenhängenden Änderungen: Die neue Architektur verbessert Fähigkeiten und Effizienz, visuelles Verständnis wird in das Hauptmodell integriert, und niedrigere Preise geben Entwicklern die Möglichkeit, mehr Aufgaben an Flash zu übergeben.
01. 552 Milliarden Parameter, unterschiedliche Rechenumfänge für Eingabe und Ausgabe
Das Upgrade von V4.1 Flash reicht bis in die Modellstruktur hinein.
Die offizielle Version von V4 Flash, die zuvor am 31. Juli veröffentlicht wurde, behielt die Modellstruktur und -größe der Vorschauversion bei und wurde hauptsächlich nachtrainiert. Diesmal verwendet V4.1 Flash eine völlig neue Causal-Encoder-Decoder-Struktur und ist ein Mixed-Experts-Modell (MoE) mit insgesamt 552 Milliarden Parametern.
Das Merkmal dieser Architektur ist die Asymmetrie zwischen Eingabe und Ausgabe: Bei der Verarbeitung von Eingaben werden 8 Milliarden Parameter aktiviert, bei der Generierung von Ausgaben 16 Milliarden Parameter. Das Modell verfügt über einen großen Gesamtparameterumfang, ruft bei jeder Berechnung nur einen Teil davon auf und weist unterschiedliche Rechenumfänge für das Lesen von Informationen und die Generierung von Inhalten zu. DeepSeek gibt an, dass seine Kosten deutlich unter denen bekannter Modelle gleicher Größe liegen.
Dieses Design steht in starkem Zusammenhang mit der Arbeitsweise von Agenten. Bei der Verarbeitung von Code-Repositories, langen Dokumenten und historischen Gesprächen muss das Modell eine große Menge an Informationen lesen und dann relativ begrenzte Urteile, Codes oder Betriebsanweisungen generieren. Die Senkung des Rechenaufwands im Eingabebereich dürfte die Gesamteffizienz solcher Aufgaben verbessern.
Neben der Architektur verwendet V4.1 Flash auch eine neue Vortrainingsmethode und wurde mit umfangreicherem Verstärkungslernen nachtrainiert. DeepSeek gibt an, dass das neue Modell in Benchmark-Tests mehrere Flaggschiffmodelle einschließlich V4 Pro übertroffen hat.
Nach den veröffentlichten offiziellen Ergebnissen erzielt V4.1 Flash im wissenschaftlichen Fragentest GPQA Diamond einen Wert von 90,9, im wettbewerbsorientierten Programmierranking von Codeforces einen Wert von 3471 und im MathArena Apex einen Wert von 65,6. Bei Terminal-Bench 2.1 zur Prüfung der Ausführung von Endaufgaben erreicht das neue Modell einen Wert von 90,6, bei dem Cybersicherheitstest CyberGym einen Wert von 88,1. Die entsprechenden zuvor von V4 Pro veröffentlichten Werte lagen bei 87,9 bzw. 83,3.
V4.1 Flash ist das kleinste Modell in der neuen Architekturserie. Nach Angaben von DeepSeek unterstützt diese Struktur auch die Erweiterung auf größere Parameterumfänge und bildet die Grundlage für nachfolgende größere Modelle.
02. Integration des visuellen Verständnisses in das Hauptmodell
Eine weitere Änderung von V4.1 Flash ist die native Unterstützung für multimodales visuelles Verständnis.
Zuvor stellte DeepSeek experimentelle visuelle Fähigkeiten über V4 Flash Vision Exp bereit. Nach dieser Veröffentlichung sind die alte Version von V4 Flash und die experimentelle Version für visuelle Funktionen eingestellt. Anfragen der beiden alten Modellnamen werden nun von V4.1 Flash übernommen, sodass Text- und Bildverarbeitung in demselben Haupt-API-Modell zusammengeführt sind.
Gemäß der neuesten Dokumentation zum Bildverständnis können Entwickler das Modell dazu bringen, Bilder zu beschreiben, Text in Screenshots zu erkennen und Diagramme zu analysieren. Bilder können über öffentliche Links übergeben, nach der Kodierung direkt eingereicht oder nach dem Hochladen über die Files API referenziert werden.
Dies ist für Agenten, die reale Materialien verarbeiten, von praktischer Bedeutung. Erläuterungstexte und Diagramme in Geschäftsdokumenten, Codes und Oberflächenscreenshots müssen oft zusammen verstanden werden. Ein einheitlicher Modellzugang reduziert den Aufwand der Entwickler, Aufgaben zwischen verschiedenen Modellen zu verteilen und zu wechseln.
In Bezug auf die grundlegenden Spezifikationen unterstützt V4.1 Flash einen Kontext von 1 Million Token, eine maximale Ausgabe von 384K sowie Funktionen wie JSON Output, Tool-Aufruf und Responses API. Das Modell bietet gleichzeitig Denk- und Nicht-Denkmodi, wobei der Denkmodus standardmäßig aktiviert ist. Die Denkintensität kann in drei Stufen (low, high, max) eingestellt werden, die Entwickler entsprechend der Aufgabenkomplexität konfigurieren können.
03. 60 % Preisnachlass für zwischengespeicherte Eingaben, günstigere kontinuierliche Arbeit
Die neuen Preise für V4.1 Flash treten am 10. September um 12 Uhr Peking-Zeit in Kraft, wobei weiterhin eine Spitzen- und Nebenzeiten-Preisgestaltung angewendet wird. Pro Million Token beträgt der Preis für Cache-getroffene Eingaben in der Nebensaison 0,02 Yuan, für Cache-nicht-getroffene Eingaben 1 Yuan und für Ausgaben 4 Yuan. In der Spitzenzeit liegen die Werte bei 0,04 Yuan, 2 Yuan bzw. 8 Yuan.
Die Spitzenzeit ist von Montag bis Freitag von 9:00 bis 12:00 Uhr und von 14:00 bis 18:00 Uhr Peking-Zeit, die übrigen Zeiten sind Nebenzeiten.
Im Vergleich zu den Preisen von V4 Flash im selben Zeitraum sinkt der Preis für Cache-getroffene Eingaben um 60 %, für nicht-getroffene Eingaben um etwa 33,3 % und für Ausgaben um etwa 11,1 %.
Aufgaben, bei denen große Mengen an Kontext wiederholt gelesen werden müssen, profitieren noch deutlicher. Wenn Agenten kontinuierlich arbeiten, geben sie oft historische Gespräche, Werkzeugbeschreibungen und Codes mehrmals ein. Die Senkung des Cache-Preises kann diesen wiederholten Aufwand reduzieren. Bei Aufgaben, die hauptsächlich auf die Generierung neuer Inhalte ausgerichtet sind, ist der Einsparungsgrad relativ begrenzt.
Bei einer Berechnung mit festem Verbrauch: Wenn eine Aufgabe 1 Million Cache-getroffene Eingabe-Token, 100.000 nicht-getroffene Eingabe-Token und 10.000 Ausgabe-Token verbraucht, sinken die Kosten in der Nebensaison von 0,245 Yuan auf 0,16 Yuan, was einem Rückgang von etwa 34,7 % entspricht. Die tatsächliche Rechnung hängt außerdem von der Denklänge des Modells, den Runden der Tool-Aufrufe und der Anzahl fehlgeschlagener Wiederholungsversuche ab.
deepseek-v4-pro wird nach dem 14. September um 12 Uhr auf das neue Flash umgestellt und zum Flash-Preis abgerechnet, bis zukünftig V4.1 Pro veröffentlicht wird.
04. Gemeinsames Training von Modell und Harness zur Verbesserung der kontinuierlichen Arbeitsfähigkeit
Gleichzeitig mit V4.1 Flash wird auch DeepSeek Harness v0.1.5 aktualisiert. Dieses Upgrade verbindet das Modelltraining weiter mit dem Agent-Ausführungsframework: V4.1 Flash wurde speziell für den Standardmodus, den programmierten Tool-Aufrufmodus (PTC) und den Minimalmodus von Harness trainiert und optimiert.
Das bedeutet, dass das Training nun verschiedene Umgebungen abdeckt, in denen das Modell tatsächlich arbeitet. Wenn ein Agent eine Aufgabe erledigt, muss er kontinuierlich zwischen Tool-Aufrufen, Ergebnisauslesen und nächsten Entscheidungen zirkulieren. Das Training für verschiedene Ausführungsmodi hilft dem Modell, sich an die Organisation und Aufrufweise der Tools anzupassen und Verbindungsprobleme während der Ausführung zu reduzieren.
Ein bemerkenswertes Detail ist, dass die neue Version von Harness bei der Verwendung von V4.1 Flash das Aktualisieren von System-Prompts unter Beibehaltung des vorhandenen KV-Cache unterstützt. Bei langen Aufgaben, bei denen Arbeitsregeln angepasst werden müssen, bietet dies die Voraussetzung, um vorherige Berechnungsergebnisse wiederzuverwenden und wiederholte Verarbeitungen zu reduzieren, was auch dem aktuellen Preisnachlass für zwischengespeicherte Eingaben entspricht.
Die Dateiverarbeitungsfähigkeiten wurden ebenfalls verbessert. Die Weboberfläche unterstützt das Hochladen von Dateien wie Bildern und PDFs, die vom Modell bei Bedarf über Dateiwerkzeuge gelesen werden. In der rechten Leiste kann der Dateibaum des Arbeitsbereichs durchsucht werden, wobei Markdown, HTML, PDFs, Codes und Bilder angezeigt werden können. In Kombination mit dem nativen visuellen Verständnis von V4.1 Flash können Benutzer dem Agenten Materialien übergeben und dann direkt die von ihm generierten Dateien einsehen.
Die Zusammenarbeit mehrerer Agenten wurde weiterentwickelt. Übergeordnete und untergeordnete Agenten unterstützen die bidirektionale Kommunikation, sodass während der Ausführung Informationen ergänzt und Richtungen angepasst werden können. Der Hauptagent kann auch Modelle und Inferenzintensitäten für untergeordnete Agenten auswählen. Die neue experimentelle Funktion Agent Teams ermöglicht es dem Hauptagenten, mehrere Mitglieder zu erstellen, die Arbeit über eine gemeinsame Aufgabenliste zu verteilen und zu verfolgen. Die Mitglieder können sich gegenseitig Nachrichten senden, und schließlich fasst der Hauptagent die Ergebnisse zusammen. Diese Funktion ist standardmäßig deaktiviert und führt nach der Aktivierung zu einem höheren Token-Verbrauch.
Darüber hinaus bietet die neue Version von Harness eine standardisierte Schnittstellen-Zugriffsmöglichkeit für Plug-ins in der linken und rechten Leiste und optimiert das Laden, Wiederherstellen und den Speicherverbrauch von langen Sitzungen. DeepSeek plant, weiterhin ein integriertes Plug-in-Verwaltungspanel hinzuzufügen, um das Design „alles ist ein Plug-in“ zu erweitern.
Aus diesem Update geht hervor, dass DeepSeek die Modellfähigkeiten und die Ausführungsumgebung gemeinsam optimiert. Die neue Architektur löst Probleme der Recheneffizienz, spezielle Trainings verbessern die Nutzung von Tools, und Harness übernimmt Datei-, Sitzungs- und Aufgaben-Zusammenarbeit. Diese Glieder beeinflussen gemeinsam, ob ein Agent eine Aufgabe stabil erledigen kann.
05. Nutzungsweise
Entwickler können auf der offenen Plattform von DeepSeek einen API-Schlüssel erstellen und den Modellnamen auf deepseek-flash setzen, um die neue Version aufzurufen. Die base_url für die OpenAI-kompatible Schnittstelle lautet https://api.deepseek.com, die für die Anthropic-kompatible Schnittstelle https://api.deepseek.com/anthropic.
Normale Benutzer können DeepSeek-Produkte über die Webversion von DeepSeek und die offizielle App nutzen. Die alten Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp können weiterhin aufgerufen werden, aber die zugrundeliegende Schicht wurde bereits auf V4.1 Flash umgestellt.
Darüber hinaus ist Tencent WorkBuddy bereits mit DeepSeek V4.1 Flash verbunden. Benutzer können dieses Modell im Client auswählen, um Büroaufgaben wie Dateiverarbeitung und Inhaltsgenerierung zu erleben.
Neben dem Modellupdate gibt es kürzlich auch Nachrichten über die Börsenvorbereitungen von DeepSeek. Nach früheren öffentlichen Berichten hat das Unternehmen die Arbeiten für den Börsengang am Sci-Tech Innovation Board vorangetrieben und mit mehreren führenden Wertpapierhäusern wie CITIC Securities über eine Zusammenarbeit bei der Börsenberatung Kontakt aufgenommen. Mehrere Personen, die mit den entsprechenden Kapitalmarktaktivitäten vertraut sind, gaben an, dass die neueste Bewertung des Unternehmens derzeit 500 Milliarden Yuan beträgt. CITIC Securities hat dazu noch keine Stellung genommen, und die spezifischen Börsenpläne müssen noch weiter bekannt gegeben werden.
V4.1 Flash erweitert die Fähigkeitsgrenzen von preiswerten Modellen und setzt einen höheren Ausgangspunkt für das zukünftige V4.1 Pro: Wenn Flash mehr komplexe Aufgaben übernehmen kann, müssen größere Modelle überzeugendere Fähigkeitssteigerungen vorweisen.
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto "Tencent Tech", Autor: Xiao Jing, veröffentlicht mit Genehmigung von 36Kr.