V4.1 Flash interne Beta, Liang Wenfeng ist wieder zu Liang Sheng zurückgekehrt.
Ohne jegliche Vorankündigung hat die Zwischenversion von DeepSeek V4.1 Flash, deepseek-v4.1-flash-expires-on-0910, die interne Testphase gestartet.
Die offizielle Seite von DeepSeek erklärte: „DeepSeek V4.1 Flash verwendet eine neue Modellarchitektur, bietet native Multimodal-Unterstützung, stärkere Fähigkeiten, höhere Geschwindigkeit und geringere Kosten.“
Es gibt keinen technischen Bericht und keine Tabelle mit Leistungsparametern, aber die von der offiziellen Seite bereitgestellten Informationen sind bereits sehr beeindruckend.
V4.1 Flash ist das erste native multimodale Modell von DeepSeek. Obwohl V4 Flash Vision-Exp ebenfalls Multimodalität unterstützt, gehört es zum Typ „extern angehängt“: Es basiert auf dem rein textbasierten Grundgerüst von V4 Flash 0731 und ist mit einem visuellen Encoder sowie einem Aligner ausgestattet.
V4.1 Flash wird ab Werk mit integrierter Ein- und Ausgabe von Text und Bildern geliefert.
Und seit der offiziellen Veröffentlichung von V4 bis V4.1 sind nur 40 Tage vergangen. Es wird eine neue Architektur eingeführt, die gleichzeitig die Leistung steigert und die Kosten senkt … Sollte das nicht besser V5 Flash heißen?
Nach Tests mehrerer technischer Blogger in der Community zeigt dieses Modell, auch wenn es sich nur um eine Zwischenversion von V4.1 Flash und noch nicht um die offizielle Endversion handelt, eine sehr beeindruckende Leistung.
01
Was macht DeepSeek V4.1 Flash so außergewöhnlich?
Unmittelbar vor und nach der Veröffentlichung der Stellenausschreibung startete die interne Testversion von DeepSeek mit dem Codenamen DeepSeek-v4.1-flash-expires-on-0910 plötzlich die Testphase, die bis zum 10. September läuft.
DeepSeek hat keinen technischen Bericht zu diesem Modell veröffentlicht, aber in dem offiziell initiierten „Fragebogen für Feedback zur Einladung zum Test der Zwischenversion von V4.1 Flash“ gibt es eine sehr interessante Frage.
Die Frage lautet: „Glauben Sie, dass dieses Modell das online verfügbare DeepSeek V4 Pro vollständig ersetzen kann?“, die Optionen lauten jeweils „Ja“, „Nein“, „Unsicher“, „Sonstiges“.
Ob es V4 Pro ersetzen kann, müssen wir zuerst prüfen, wie es tatsächlich funktioniert.
Nach Tests wurde festgestellt, dass die Geschwindigkeit von V4.1 Flash extrem hoch ist.
Bisher sehen wir bei Gesprächen mit großen Modellen, selbst bei sehr schnellen Antworten, oft eine Denkanzeige von ein bis zwei Sekunden auf der Oberfläche. Bei V4.1 Flash tippte ein Entwickler versuchsweise „Hallo“ ein, das Modell benötigte nur 0,3 Sekunden Denkzeit, die Generierungsrate erreichte sofort 159,3 Token pro Sekunde, und die gesamte End-to-End-Zeit der Gesprächsrunde betrug nur 0,8 Sekunden.
In einem anderen Screenshot des realen Tests für die Inferenz von langen Texten mit hoher Auslastung erreichte die Generierungsgeschwindigkeit des Modells sogar direkt 420 Token pro Sekunde, mit einem End-to-End-Durchsatz von 409,5 Token/Sekunde.
In den Witzen von Brancheninsidern heißt es: „Dieser Durchsatz macht den sogenannten Hochgeschwindigkeitsmodus (Highspeed) anderer Anbieter zu unserem alltäglichen Standard.“
Aber das ist keineswegs nur „schnell“, sondern vor allem „schnell und präzise“.
Der Blogger Xiangyang Qiaomu schickte ein Foto eines Herrenanzugs an DeepSeek V4.1 Flash, und das Modell antwortete, dass er einen gestreiften Anzug trage.
Zuerst dachte er, es handele sich wieder um eine Halluzination wie bei V4 Flash Vision-Exp, aber als er das große Bild genau betrachtete, stellte er fest, dass die Person auf dem Foto tatsächlich einen gestreiften Anzug trug.
Mehrere erfahrene technische Blogger, die frühzeitig Zugriff auf das Modell erhielten, führten vergleichende End-to-End-Bewertungen von V4.1 Flash und dem früheren V4 Flash Vision-Exp bei denselben Aufgaben durch.
Die Ergebnisse zeigten, dass bei der Abfrage von extrem langen Kontexten von 49k die Verarbeitungsgeschwindigkeit des neuen Modells 5,2 Mal höher ist; bei der Generierung von SVG-Code 6,0 Mal höher; bei der Lösung der klassischen Palindrom-Algorithmusaufgabe nach Manacher 4,6 Mal höher; bei der Generierung und Optimierung großer SQL-Abfragen 5,0 Mal höher; bei der anspruchsvollen Umstrukturierungsaufgabe des asyncio-Asynchron-Architektur erreicht die Verarbeitungsgeschwindigkeit immer noch das 3,9-fache des Vorgängermodells.
Daher ist die Angabe der offiziellen Seite, dass V4.1 Flash eine neue Architektur verwendet und Multimodalität nativ unterstützt, absolut wahr.
Das ist noch nicht alles: Während die Leistung sprunghaft angestiegen ist, ist der Preis für den Aufruf des Modells derselbe wie bei V4 Flash.
In der Community gibt es viele Witze über Liang Wenfeng: Wenn DeepSeek eine gute Leistung zu niedrigen Preisen bietet, wird er als „Heiliger Liang“ oder „Vorfahr Liang“ bezeichnet, bei Preiserhöhungen hingegen als „Liang Zi“ oder „Kleiner Liang“. Bei V4.1 Flash ist Liang Wenfeng wieder zum Heiligen Liang geworden.
02
Die Erwachsenenfeier des kleinen Wals
Einen Tag vor der Veröffentlichung von V4.1 Flash kündigte DeepSeek plötzlich an, 150 neue Stellen auszuschreiben, die sich explizit an erfahrene Ingenieure mit 2 bis 10 Jahren Berufserfahrung richten, aber auch Absolventen und neue Talente berücksichtigen.
Diese Stellenausschreibung konzentriert sich auf zwei Bereiche: Erstens Entwicklungsingenieur für die Serverseite, der die Forschungsplattform für große Modelle, Komponenten des Agent-Frameworks, Infrastruktur für die Effizienz der Entwicklung, DeepSeek API, Online-Dienste und Datentechnik abdeckt; zweitens F&E-Ingenieur für elastisches Computing von Agenten, der die Entwicklung und Wartung der Plattform, die Optimierung unterer Ebenen und die Lösung schwieriger Probleme umfasst.
Als Leiter von DeepSeek Harness veröffentlichte Cui Tianyi einen Beitrag auf einer sozialen Plattform, in dem er erklärte, dass diese Erweiterung des Personals keineswegs dazu dient, Personal für reguläre Geschäfte aufzustocken, sondern dass „die sprunghafte Zunahme der Menge zu einer exponentiellen Explosion der Komplexität geführt hat“.
Cui Tianyi schrieb: „In der Informatik führt jede Zunahme der Menge zu einem enormen Anstieg der Komplexität. Die Menge an Daten, Maschinen/Containern, Trainingsaufgaben, Bewertungsaufgaben, Agent-Umgebungen, Nutzern, Anfragen und vieles mehr nimmt rapide zu. Das erzeugt eine immer größere Komplexität, sodass die früheren Backend-Systeme die zukünftigen Anforderungen der Menge nicht mehr vollständig erfüllen können. Deshalb brauchen wir eine große Anzahl neuer Mitarbeiter, um verschiedene Backend-Systeme zu aktualisieren, zu warten und neu zu schreiben.“
In der Vergangenheit war die öffentliche Wahrnehmung, dass DeepSeek eine „Spezialeinheit“ aus mehreren Dutzend genialen Algorithmenwissenschaftlern ist, die mit extremem Code-Anspruch und werkstattartiger innovativer Inspiration Erfolge erzielt hat, die auch das Silicon Valley aufhorchen lassen. Doch von der ersten Finanzierungsrunde bis zu den heutigen intensiven Maßnahmen hat sich DeepSeek zu einem Unternehmen mit Hunderten von Mitarbeitern entwickelt.
Vor dem Erhalt der ersten Finanzierungsrunde stürzten die Server von DeepSeek bei massiven Datenströmen oft ab. Nach Abschluss der Finanzierung wurde die Serverseite erweitert, sodass es keine längeren Ausfälle mehr gab.
Aber das hat nur die oberflächlichen Probleme von Webseiten und API gelöst. Das heutige DeepSeek steht nicht nur unter dem Druck der Server.
Aus der Perspektive der technischen Entwicklung durchlaufen große Modelle einen tiefgreifenden Wandel von der „statischen Vortrainierung“ zur „dynamischen Interaktion mit der Umgebung“.
In der Vergangenheit war die Ingenieuraufgabe beim Trainieren eines Sprachmodells relativ einfach: Ingenieure luden riesige Mengen an bereinigten statischen Texten aus dem Internet auf Festplatten und ließen die Grafikkarten die Daten verarbeiten.
In der heutigen Ära des verstärkenden Lernens und der Agenten muss das Modell, um reale Aufgaben lösen zu lernen, in Echtzeit auf Millisekundenebene mit Tausenden von dynamischen „Sandboxen“ interagieren.
Zum Beispiel: Um einem Modell das Schachspielen beizubringen, hat man ihm in der Vergangenheit Millionen von statischen Schachpartien gezeigt. Heute lässt man das Modell gleichzeitig an hunderttausenden dynamischen Schachbrettern gegen sich selbst spielen.
Das Starten jeder Schachbrettumgebung, die Wiederherstellung des Zustands, die Netzwerkisolation und das Erfassen der Ergebnisse müssen alle auf Millisekundenebene abgeschlossen werden.
Die ursprüngliche werkstattartige System von DeepSeek reichte für eigene Tests aus, konnte aber keine industriellen dynamischen Lasten dieser Größenordnung bewältigen.
Bei dem Durchsatz und der Inferenzgeschwindigkeit von V4.1 Flash dieser Größenordnung ist eine extrem starke Planungsfähigkeit erforderlich, um die Anforderungen der Entwickler zu erfüllen.
Zum Beispiel: Welche Anfragen werden auf derselben GPU in einem Batch-Prozess verarbeitet? Wie werden lange und kurze Anfragen so gemischt, dass sie sich nicht gegenseitig behindern? Woher bezieht man Ressourcen innerhalb von Sekunden, wenn der Datenstrom plötzlich auf das Dreifache ansteigt? Wie kann man automatisch die Kapazität verringern, um Kosten zu sparen, wenn der Datenstrom um 3 Uhr morgens abnimmt?
Als Labor musste sich DeepSeek nicht mit diesen Problemen auseinandersetzen, aber heute leitet Liang Wenfeng ein Unternehmen, und diese technischen Probleme sind zu entscheidenden Faktoren geworden.
Gleichzeitig bedeutet die neue Architektur, dass DeepSeek möglicherweise selbst Inferenz-Frameworks anpassen, eigene CUDA-Operatoren schreiben und die Modellkomprimierung sowie Quantisierung durchführen muss – was ebenfalls ein extrem zeit- und arbeitsaufwändiges technisches Problem darstellt.
Je stärker die Agent-Fähigkeiten von V4.1 sind, desto mehr Sandbox-Umgebungen werden benötigt und desto komplexer ist die Planung des elastischen Computing; je ausgereifter die multimodale Verständnisfähigkeit von V4.1 ist, desto größer ist der Druck auf die Datenpipelines und Speichersysteme.
Genau dafür sind diese 150 Ingenieure vorgesehen.
Obwohl 150 Mitarbeiter nur die quartalsweise ausgeschriebene Anzahl von Stellen einer Abteilung eines gewöhnlichen Großunternehmens sind, stellt dies bei DeepSeek eine große Maßnahme dar, die die Personalstärke verdoppelt.
DeepSeek hat den Prozess von 0 auf 1 abgeschlossen. Jetzt steht Liang Wenfeng vor der Aufgabe, den Weg von 1 zu 100 zu gehen. DeepSeek antwortet darauf mit 150 neuen Stellen, und V4.1 Flash wird zur Erwachsenenfeier von DeepSeek.
Ein genialer Junge muss schließlich erwachsen werden, und große Modelle dürfen nicht nur in wissenschaftlichen Arbeiten und Ranglisten verbleiben. Die Geschäftstätigkeit und das technische Grundgerüst für die reale Welt sind die Säulen, auf denen dieses Unternehmen langfristig überleben und den nächsten Wettbewerb gewinnen kann.
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Letter AI“, Autor: Miao Zheng, Redakteur: Wang Jing, veröffentlicht mit Genehmigung von 36kr.