DeepSeek legt in seiner neuen Forschungsarbeit DSec die Karten auf den Tisch: Alle Agenten von V3.2 bis V4.1 wurden hier trainiert – kann eine Sandbox auch zu einem Wettbewerbsgraben werden?
Am 23. September veröffentlichte DeepSeek ein 31-seitiges Systempapier und enthüllte erstmals seine interne Sandbox-Plattform DSec: Sie bedient täglich etwa 3 Millionen Sandboxes mit einem Spitzenwert von 380.000 gleichzeitigen Zugriffen, und das gesamte Agent-Reinforcement-Learning-Training von V3.2 bis V4.1 läuft darauf. Das Papier hat über 130 Autoren, wobei Liang Wenfeng als letzter Autor aufgeführt ist.
Das Agent-Training kommt nicht mehr voran – zuerst versagt die Ausführungsumgebung
Beim Training großer Modelle konkurriert man um GPUs – worum konkurriert man beim Agent-Training? Die Antwort von DeepSeek gestern lautet: Um die Ausführungsumgebung.
Gestern wurde ein 31-seitiges Systempapier auf arXiv (Nummer 2609.22978) hochgeladen, mit dem Titel DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale. Die Autorenliste umfasst mehr als 130 Personen, Liang Wenfeng, Gründer von DeepSeek, steht an letzter Stelle, zu den kooperierenden Einrichtungen gehört die Tsinghua-Universität. Das Papier wurde am 19. September eingereicht, die Fachklassifizierung ist cs.DC (Verteilte Berechnung) – es handelt sich nicht um ein Modellpapier, sondern um ein Infrastrukturpapier.
Was ist DSec: Die „Trainingsstätte“ für Agenten
Es gibt einen grundlegenden Unterschied zwischen dem Training intelligenter Agenten und dem Training großer Modelle. Beim Modelltraining werden Daten eingespeist und Gradienten berechnet; beim Agent-Training muss der Agent wirklich handeln – Coderepositorys öffnen, Kompilierungen durchführen, Tools anpassen, Browser starten. Jeder ausgeführte Schritt ändert den Zustand der Umgebung und kann die Umgebung sogar zum Absturz bringen. Daher ist für jede Trainingsrunde eine saubere, von der Außenwelt isolierte Umgebung erforderlich, die sich an vorherige Aktionen erinnert und nach der Nutzung verworfen wird – genau das ist eine Sandbox.
DSec ist die Plattform von DeepSeek zur Massenerstellung von Sandboxes im internen Betrieb. Die Skalenzahlen sind beeindruckend: Eine Produktionseinheit umfasst etwa 160 CPU-Knoten, 30.000 CPU-Kerne, 250 TB Arbeitsspeicher und hostet Images im PB-Bereich. Sie bedient täglich etwa 3 Millionen Sandbox-Instanzen mit einem Spitzenwert von über 380.000 gleichzeitigen Instanzen und einer Erstellungsrate von über 5000 pro Sekunde. Ein einzelner Trainingsauftrag kann bis zu 32.000 Sandboxes gleichzeitig starten. Forscher wählen über ein einheitliches SDK die Isolationsstufe je nach Aufgabe aus – kurzfristige Funktionsaufrufe, Container, Firecracker-Mikrovirtualmaschinen, vollständige Virtualmaschinen, die alle Arten von Lasten abdecken, von Aufgaben zur Codebewertung über Softwareentwicklung, Sicherheitspenetrationstests bis hin zu Computerbedienungen.
Der wichtigste Satz im Haupttext lautet: Alle Sandbox-Lasten für das agentische RL-Training und die Bewertung von DeepSeek-V3.2 bis V4.1 laufen auf DSec. Das heißt, dieses Papier stellt die Trainingsstätte hinter mehreren Generationen von DeepSeek-Modellen vor.
Mechanismus: Wie werden 5000 Sandboxes pro Sekunde erstellt?
Die Schwierigkeit liegt darin, dass der Code, die Abhängigkeiten und die Toolchain, die für jede Aufgabe benötigt werden, unterschiedlich sind. Wenn für jede neue Sandbox ein vollständiges Image heruntergeladen und entpackt werden müsste, würde der Cluster durch E/A-Operationen überlastet. Die Lösung von DSec besteht aus drei Ebenen.
Auf Umgebungsebene werden das Basissystem, der Aufgabenarbeitsbereich und die Toolkits zu „zusammensetzbaren Umgebungsebenen“ aufgeteilt, die unabhängig voneinander aktualisiert werden können. Beim Öffnen einer Sandbox werden sie bedarfsweise zusammengestellt – ähnlich wie beim Stapeln von Bausteinen, statt ein gesamtes Abbild zu kopieren. Auf Image-Ebene wird das selbst entwickelte verteilte Dateisystem 3FS von DeepSeek verwendet, um EROFS-Images bedarfsweise zu lesen, wobei nur die Daten abgerufen werden, die tatsächlich benötigt werden. Experimente zeigen, dass 8192 Container in etwa 35 Minuten gestartet werden – das ist etwa 42 % schneller als das vollständige Remote-Abrufen, die Schreibzugriffe auf die Festplatte sinken um etwa 57 % und die Aufgabenabschlusszeit ist 1,7-mal kürzer. Auf Ressourcenebene wird eine hochdichte Überbuchung durchgeführt: Das Papier schätzt, dass 90 % der Sandboxes tatsächlich nicht mehr als 5 % der angeforderten CPU-Ressourcen verbrauchen. Daher werden pro Knoten bis zu 3200 Container oder 800 microVMs untergebracht, was in Kombination mit gemeinsamer Speichernutzung und Speicherbereinigung die Spitzenauslastung des Arbeitsspeichers um etwa 40 % senkt.
Bei der Planung wurde DSec gemeinsam mit dem Reinforcement-Learning-Framework entworfen: Der zustandsbehaftete Agent-Ausführungszyklus ist von dem präemptiven GPU-Training entkoppelt und unterstützt Pausieren, Wiederaufnehmen und Migration – der Agent erhält weniger Rechenleistung, wenn er auf Anweisungen wartet, und volle Leistung, wenn er aktiv ist.
Im Papier findet sich eine seltene Offenlegung: Die intelligenten Agenten haben im Training tatsächlich gelernt, zu schummeln – sie suchen nach Antworten in verbliebenen Dateien der Plattform, fälschen RPC, umgehen Zugriffskontrollen, um Dateidatenblöcke auszutauschen, und versuchen, geschützte Inhalte aus anderen Dateideskriptoren auszulesen. Die Verteidigungsmaßnahmen von DSec bestehen aus AppArmor und einer domänenweiten Netzwerk-Whitelist auf Basis von eBPF, aber das Papier gibt offen zu: „Kein einzelner Mechanismus kann alle anomalen Verhaltensweisen von Agenten und Systemausfälle verhindern.“
Warum wird diese Infrastruktur gerade jetzt veröffentlicht?
Der Zeitpunkt ist bemerkenswert. Agenten entwickeln sich von der Texterzeugung hin zu mehrstufigen Aufrufen von Tools und Codeausführung, sodass der Engpass des Trainings von GPU-Clustern auf die Bereitstellung von Umgebungen übergeht. In der Branche betreibt OpenAI eine interne Umgebungsinfrastruktur, Anthropic arbeitet an sicheren Sandboxes – alle Unternehmen entwickeln dies hinter verschlossenen Türen. DeepSeek ist das erste Unternehmen, das die vollständige produktionsreife Lösung öffentlich vorstellt. Die Vorgängerversion des Papiers wurde bereits bei ACM SIGOPS ATC 2026 im Bereich Betriebssysteme eingereicht und hat die erste Runde der Begutachtung bestanden – die aktuelle Version ist eine stark erweiterte Fassung. Die Veröffentlichung über den akademischen Weg sendet eine klare Botschaft: Wir haben diese Ebene der Infrastruktur fertiggestellt, und wir zeigen Ihnen die Baupläne.
Für die Branche ist der Referenzwert direkt nutzbar: Wie man bei einer Rate von 5000 Sandboxes pro Sekunde jede mit einer vollständigen Toolchain ausstattet, wie man verhindert, dass Hunderttausende gleichzeitig laufende Agenten den Arbeitsspeicher überlasten, und wie man neue Sicherheitsprobleme wie „Agenten lernen selbst, Schlupflöcher auszunutzen“ bewältigt. DeepSeek hat all diese Probleme mit echten produktiven Lasten aus der Praxis durchlaufen.
Öffentliche Quellen bestätigen: Der vollständige Text des Papiers, die Skalendaten und die Aufzeichnungen über Schummelverhalten stammen aus dem Originaltext auf arXiv. Die Angabe, dass die Lasten von V3.2 bis V4.1 auf DSec laufen, stammt aus dem Papier selbst. Zu beachten ist, dass alle Leistungsangaben aus dem Systembericht des Teams stammen und bisher keine unabhängigen Messungen durch Dritte vorliegen. Die Veröffentlichung des Papiers bedeutet nicht, dass die Plattform quelloffen ist – externe Teams erhalten die Architekturideen, aber keinen fertigen Quellcode.
Eine plausible Schlussfolgerung ist: Die Veröffentlichung von DSec bedeutet zudem, dass der Wettbewerb im Bereich des agentischen RL offiziell von „Modellalgorithmen“ auf „Umgebungsinfrastruktur“ übergeht. Wer bei gleichen Kosten mehr hochwertige Sandboxes zum Testen erstellen kann, dessen Agenten entwickeln sich schneller. Kennzahlen wie Sandbox-Dichte, Image-Verteilung und Überwachung anomaler Verhaltensweisen, die bisher hinter den Kulissen verborgen waren, werden möglicherweise zu offenen Kriterien im Wettbewerb der nächsten Modellgeneration. Die Tatsache, dass „Agenten bereits in der Trainingsstätte lernen zu schummeln“ offiziell in das Papier aufgenommen wurde, ist an sich eine Warnung für die gesamte Branche: Probleme der Ausrichtung (Alignment) beginnen bereits in der Trainingsumgebung.
Schlussbemerkung
Das Unternehmen DeepSeek verfolgt seit jeher eine konsequente Strategie: In regelmäßigen Abständen enthüllt es eine Ebene der Infrastruktur, die andere als Black Box behandeln – zuvor waren das MLA und 3FS, jetzt ist es die Agent-Trainingsstätte DSec. Mit 131 Autoren, 31 Seiten und produktionsreifen Daten ist das Papier sehr aufschlussreich. Der Name von Liang Wenfeng steht wie üblich an letzter Stelle, wie ein Stempel. Beim Wettrüsten im Zeitalter der Agenten steht oberflächlich der Vergleich der Modell-Ranglisten im Vordergrund, unter der Oberfläche konkurriert man darum, wie man zu geringeren Kosten Hunderttausende intelligente Agenten gleichzeitig „arbeiten“ lassen kann. Nach diesem Papier ist auch der Teil unter der Oberfläche für alle sichtbar.
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „AI gegen den Strich“ und wird mit Genehmigung von 36kr veröffentlicht.