Gerade ist das neue DeepSeek-Modell online gegangen, und die Festplattenauslastung durch den Langtext-Cache ist um 88 % drastisch gesunken.
Bericht von Zhidx am 10. September: Gerade hat DeepSeek offiziell DeepSeek V4.1 Flash veröffentlicht. Dieses Modell verwendet eine neue Architektur, ist ein MoE-Modell mit 552B Parametern und das kleinste Mitglied in der neuen Modellarchitekturreihe von DeepSeek. In Bezug auf die Leistung übertrifft es eine Reihe von Flaggschiffmodellen einschließlich DeepSeek V4 Pro.
- Open-Source-Adresse des Modells: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- Link zum technischen Bericht: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
Gleichzeitig zeigt die DeepSeek App, dass ein umfassendes neues Upgrade abgeschlossen wurde, das die Modi Schnell, Experte und Bilderkennung integriert und das neue Modell eingeführt hat. Die Webversion sollte gleichzeitig aktualisiert worden sein.
01. Leistung übertrifft Flaggschiff umfassend, Preise werden gesenkt
In Bezug auf die Preise hat DeepSeek dank der Innovation der Modellarchitektur im Vergleich zu DeepSeek V4 Flash den Preis von V4.1 Flash gesenkt. Der Spitzen- und Nebenzeittarifmechanismus bleibt erhalten, der Preis in der Nebenzeitz beträgt die Hälfte des Preises in der Spitzenzeit. Die offizielle Seite ermutigt Nutzer, die Aufgabenzeit entsprechend der tatsächlichen Nutzung anzupassen.
Der neue Tarif lautet: In der Nebenzeitz Eingabe (Cache-Treffer) 0,02 Yuan, Cache-Fehltreffer 1,0 Yuan, Ausgabe 4,0 Yuan, in der Spitzenzeit Eingabe (Cache-Treffer) 0,04 Yuan, Cache-Fehltreffer 2,0 Yuan, Ausgabe 8,0 Yuan. Der neue Preis ist am 10. September 2026 um 12:00 Uhr offiziell in Kraft getreten.
▲Preistabelle von DeepSeek V4.1 Flash (Quelle: DeepSeek)
Dieses Modell verfügt über native multimodale visuelle Verständnisfähigkeiten und verwendet die neue Causal-Encoder-Decoder-Architektur. Eingabe und Ausgabe sind asymmetrisch: Die Anzahl der aktivierten Parameter bei der Eingabe beträgt nur 8B, bei der Ausgabe 16B. Die Kosten sind deutlich niedriger als bei bekannten Modellen gleicher Größe.
▲Leistungsvergleich zwischen DeepSeek-V4.1-Flash und gängigen fortschrittlichen Modellen im Agentic Benchmark (Quelle: DeepSeek)
Gleichzeitig übertrifft dieses kleinere Modell mit Unterstützung durch neue Vortrainingsverfahren und Post-Training in größerem Umfang mit Verstärkungslernen in Benchmarks wie dem Agentic Benchmark mehrere fortschrittliche Flaggschiffmodelle wie DeepSeek V4 Pro, GLM5.3 und Kimi-K3.
▲Leistungsvergleich zwischen DeepSeek-V4.1-Flash und gängigen fortschrittlichen Modellen im Agentic Benchmark (Quelle: DeepSeek)
Die offizielle Seite gibt in der Ankündigung die ursprüngliche Absicht für das Design der neuen Modellarchitektur an: Höhere Obergrenze der Fähigkeiten, schnellere Inferenzgeschwindigkeit, höherer Durchsatz und Erweiterbarkeit auf Modelle mit größerer Parameteranzahl.
02. Cache wird stark komprimiert, DeepSeek V4 Pro wird bald eingestellt
Die neue Generation von Modellen hat eine stark verbesserte Effizienz des KV-Cache. Im Vergleich zu DeepSeek V4 Flash reduziert V4.1 Flash den Bedarf an HBM auf 1/4 und den Bedarf an SSD auf 1/8. Laut offizieller Angabe von DeepSeek ist der KV-Cache des ersten Modells DeepSeek V1 437 Mal so groß wie der von DeepSeek V4.1 Flash.
▲Fortschritte von DeepSeek bei der Reduzierung des Kontextspeichers (Quelle: DeepSeek)
Diese Kompression wird durch die Zusammenarbeit von Architektur, Cache-Genauigkeit und Bereitstellungsstrategie erreicht. Auf der Architekturebene verwendet das neue Modell den CSA2-Mechanismus (Compressed Sparse Attention 2), um den globalen KV-Cache und den Top-K-Index schichtübergreifend wiederzuverwenden. Jede Schicht behält nur ihre eigenen Abfragevektoren und den lokalen Attention-Cache bei, sodass redundante Speicherung stark reduziert wird.
In Bezug auf die Cache-Genauigkeit speichert das Modell den globalen KV-Cache direkt im FP4-Format bereits in der Trainingsphase. Laut offizieller Angabe ist der Leistungsverlust fast vernachlässigbar. Auf der Bereitstellungsseite wird ein neuer begrenzter SWA-Wiedergabemechanismus hinzugefügt: Es reicht aus, die letzten n Tokens wiederzugeben, um den Zustand zu rekonstruieren, der für die Sliding-Window-Attention (SWA) benötigt wird. Dadurch muss der SWA-Cache nicht mehr auf die SSD geschrieben werden, und der Speicherbedarf des persistenten Caches wird weiter auf 1/8 des Werts von V4 Flash reduziert.
Durch die Kombination dieser Designs wird der Kontext von 4K auf 1M verlängert, während die Anzahl der FLOPs für die Dekodierung eines einzelnen Tokens nur um etwa ein Viertel steigt. Die Dekodierungskosten steigen fast nicht mit der Länge des Kontexts an.
▲Vergleich der Kontextlänge von DeepSeek-V4.1-Flash mit Vorgängermodellen (Quelle: DeepSeek)
Diese Zahl wirkt sich direkt auf die Rechnungen der Nutzer aus. In Agent-Anwendungsszenarien macht der Kostenanteil von Cache-Treffern oft einen hohen Anteil aus. Die Kompression des KV-Caches senkt die Nutzungskosten von Agent-Aufgaben stark. Für Agent-Workflows, die langen Kontext und mehrfache Aufrufe erfordern, kann das gleiche Budget mehr Aufgaben ausführen.
Mittlerweile ist DeepSeek V4.1 Flash auch in der DeepSeek API verfügbar. Nutzer können V4.1 Flash aufrufen, indem sie den Modellnamen in deepseek-flash ändern. Die älteren Modelle V4 Flash und V4 Flash Vision Exp sind jetzt eingestellt. Die Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp werden vorübergehend zu V4.1 Flash geleitet.
Gestern hat DeepSeek angekündigt, dass da alle Indikatoren von DeepSeek V4.1 Flash in mehreren Tests DeepSeek V4 Pro umfassend übertreffen, DeepSeek V4 Pro ab dem 14. September um 12:00 Uhr Beijing-Zeit schrittweise einstellen wird. Alle Anfragen an deepseek-v4-pro werden an das neue Modell geleitet und nach dem Einheitspreis von V4.1 Flash berechnet.
▲Ankündigung zur Anpassung von DeepSeek-Modellen (Quelle: DeepSeek)
03. Umfassende Unterstützung für Open Source, volle Integration von WorkBuddy und OpenCode
Neben den Modellfähigkeiten hat DeepSeek auch eine Reihe von Maßnahmen im Bereich Open Source und Ökosystem ergriffen.
DeepSeek hat heute angekündigt, die Open-Source-Community umfassend bei der Anpassung der Inferenz für das neue Modell zu unterstützen und zu versuchen, den Bereitstellungsbereich auf verschiedene Weise zu erweitern. Wenn Nutzer Bedarf an großskaliger Bereitstellung haben und über entsprechende Ressourcen (2000 GPUs, Speichercluster) verfügen, können sie sich mit DeepSeek in Verbindung setzen.
Gerade wurde die Version v0.1.5 von DeepSeek Harness veröffentlicht. Das Modell DeepSeek V4.1 Flash wurde speziell für DeepSeek Harness trainiert und optimiert. Bei der Verwendung von DeepSeek V4.1 Flash unterstützt die neue Version von DeepSeek Harness außerdem die Aktualisierung des System-Prompts, während der vorhandene KV-Cache beibehalten wird.
Auf der Ökosystemseite sind Tencent (einschließlich WorkBuddy, CodeBuddy usw.) und OpenCode als offizielle Partner nun vollständig in DeepSeek V4.1 Flash integriert. Das OpenCode Go-Paket bietet das vierfache Nutzungslimit.
▲Tabelle des Nutzungslimits von OpenCode-Modellen (Quelle: OpenCode)
In WorkBuddy wird ebenfalls ein exklusives Angebot für zwei Wochen angeboten. Tencent Cloud TokenHub, ima, Marvis und CodeBuddy sind gleichzeitig in DeepSeek V4.1 Flash integriert. In früheren Berichten von Reuters über die Finanzierung von DeepSeek war Tencent einer der Investoren von DeepSeek.
Gleichzeitig wurde DeepJIT als Open Source veröffentlicht, eine leichtgewichtige JIT-Kompilierungsbibliothek für xPU-Kerne, die sowohl die NVIDIA CUDA GPU als auch die Huawei Ascend NPU als Backends unterstützt und eine einheitliche Schnittstelle für die Kernel-Kompilierung auf der Inferenzseite sowie die Fähigkeit zum knotenübergreifenden gemeinsamen Caching bietet.
04. Schlussfolgerung: Das kleinste Modell übertrifft das Flaggschiff, die Inferenzkosten sinken weiter
Das Modell DeepSeek V4.1 Flash senkt die Kosten durch die neue Architektur und steigert gleichzeitig das Intelligenzniveau durch Verstärkungslernen in größerem Umfang. Es hat in einer kleineren Größe die umfassende Überlegenheit gegenüber dem Flaggschiff in der eigenen Produktlinie erreicht.
Für Nutzer, die Agenten häufig verwenden, wird die tatsächliche Änderung der Rechnungen durch die Kombination aus Cache-Kompression und Preissenkung deutlicher spürbar sein als die Verbesserung der Benchmark-Ergebnisse.
Aus einer langfristigen Perspektive behauptet die offizielle Seite, dass die neue Architektur auf Modelle mit größerer Parameteranzahl erweitert werden kann. Wir dürfen auf das kommende neue Flaggschiffmodell von DeepSeek gespannt sein.
Man kann sehen, dass die Produktlinie von DeepSeek um die neue Architektur neu geordnet wird. Die schrittweise Einstellung von V4 Pro ist nur der Beginn dieser Umstellung. Es ist abzuwarten, welchen Grad an Kosteneffizienz die fortschrittlichen Modelle mit größerer Parameteranzahl in Zukunft erreichen können.