Nach Seed und Flow hat ByteDance eine weitere KI-Abteilung auf erster Unternehmensebene gegründet, die direkt auf „Daten“ abzielt | Exklusiv von 36Kr
Intelligentes Emergieren erfuhr aus mehreren unabhängigen Quellen, dass ByteDance kürzlich eine neue Abteilung auf erster Ebene gegründet hat – KI-Daten und -Sicherheit, die parallel zu Abteilungen wie Seed, Flow und Douyin steht, und die von Wang Yinglei (Adam Wang) geleitet wird.
Dies ist die zweite Abteilung auf erster Ebene für KI-Geschäfte, die ByteDance nach der Gründung der beiden KI-Abteilungen Seed und Flow Ende 2023 gegründet hat. Der Leiter Wang Yinglei war zuvor Leiter der Plattformverantwortung von TikTok und Leiter des Livestream-Geschäfts von TikTok. „Das Livestream-Geschäft, das von Wang Yinglei geleitet wurde, war einst eine der wichtigsten Einnahmequellen von TikTok und hat im Inneren von ByteDance herausragende Erfolge erzielt“, sagte eine mit ByteDance vertraute Person.
Intelligentes Emergieren hat ByteDance um eine Bestätigung der oben genannten Informationen gebeten. Bis zum Zeitpunkt der Veröffentlichung gab es keine Antwort.
Nach Modellen und Produkten zielt ByteDance diesmal direkt auf KI-Daten ab.
Laut Intelligentes Emergieren ist einer der Vorgänger dieser neuen Abteilung das Datenteam Global Data, das 2023 von Fu Yue (Spitzname Yuyi), einem Mitglied des Gründungsteams von TikTok, gegründet wurde und ursprünglich eine Größe von etwa 100 Mitarbeitern hatte. Dieses schlanke Team diente zunächst internationalen Geschäften wie Dola (der Überseeversion von Doubao) und TikTok und war anschließend für die Datenbeschaffung und Qualitätskontrolle für das Modelltraining von Seed verantwortlich. Im Team gibt es mehrere Funktionsbereiche wie Produktmanager, Datentechnik, Beschaffung, Qualitätskontrolle und Betrieb, Sicherheit und Compliance.
Neben Global Data hat die Abteilung für KI-Daten und -Sicherheit auch mehrere zuvor verstreute KI-Datenabteilungen integriert, darunter das Gruppen-Daten-Mittelplattform DMC sowie Teammitglieder der unter Flow angesiedelten KI-Datenplattform AIDP.
Mehrere informierte Personen teilten uns mit, dass die Integration und offizielle Gründung dieser Abteilung seit Anfang Juni 2026 läuft. Da die Integration mehrerer Abteilungen betroffen ist und die Geschäfte zwischen diesen Abteilungen viele Überlappungen aufweisen, arbeitet ByteDance derzeit ständig daran, die Struktur zu ordnen und das Personal zu optimieren.
Mehrere mit dieser Abteilung vertraute Personen berichteten uns: Die integrierte neue Abteilung wird ein riesiges Datenteam sein, das von Grundmodellen bis zu Geschäftsteams reicht, und ihre Kernfunktion besteht darin, alle großen Modelle von ByteDance mit multimodalen Datendiensten zu versorgen. Die Verantwortlichkeiten des Teams erstrecken sich auch über den gesamten Prozess der Datenproduktion: Standardfestlegung, Quellenfindung und Beschaffung, Synthese und Bereinigung, Qualitätsbewertung usw.
Auf der Vollversammlung von Seed Ende Juli erklärte Zhang Yiming, der lange nicht öffentlich aufgetreten war, dass ByteDance bei der Weiterentwicklung großer Modelle „entschieden keine Destillation anwenden wird“. Auf der Vollversammlung von ByteDance am 5. August sagte auch CEO Liang Rubo: „ByteDance wird seine großen Sprachmodelle entschlossen selbst entwickeln, die Grundlagen gut beherrschen, kurzfristige Rückstände akzeptieren, langfristige Optimierungen konsequent vorantreiben und vor allem darauf achten, dass die Maßnahmen nicht verfälscht werden.“ Diese Entscheidungen werden zwangsläufig dazu führen, dass die Bedeutung von Daten bei der Weiterentwicklung der großen Modelle von ByteDance stetig steigt.
Über ByteDance hinaus sehen wir auch, dass sich die globale KI-Branche strukturell verändert: Wenn die Daten des öffentlichen Internets erschöpft sind, verschiebt sich die Kernvariable des Wettbewerbs um Modelle von Algorithmen und Rechenleistung hin zu hochwertigen Daten aus der realen Welt.
Das riesige Datenimperium von ByteDance
ByteDance hat bei Investitionen in KI-Daten unter den großen inländischen Technologieunternehmen schon immer am entschlossensten gehandelt.
Ein wichtiger Grund ist, dass Seed seit seiner Gründung das Prinzip festgelegt hat, „keine Destillation durchzuführen“. Das Ziel von ByteDance bei fast allen Modellen ist es, die globale Spitzengruppe und sogar den SOTA-Standard zu erreichen, was durch Destillation kaum zu erreichen ist. Wenn alle Daten selbst synthetisiert, beschafft und bereinigt werden müssen, ist zwangsläufig ein riesiges Team zur Unterstützung erforderlich.
Wie riesig ist dieses Team? Intelligentes Emergieren hat exklusiv berichtet, dass im Inneren von ByteDance allein das Team, das die Modellsdatenbewertung für Seedance durchführt, mehr als 1000 Mitarbeiter zählt. Hinter jedem Algorithmen-Ingenieur von Seedance stehen in der Regel mehr als zehn Datenmitarbeiter zur Unterstützung.
Im Gegensatz dazu ist bei vielen führenden Startups im Videobereich ein internes Bewertungsteam mit mehreren Dutzend Mitarbeitern bereits ein relativ großer Investitionsaufwand. Der Erfolg von Seedance 2.0 wurde von mehreren Branchenexperten auch als „ein Sieg der Daten“ bezeichnet.
Dies hat ByteDance noch stärker dazu bewogen, in Daten zu investieren.
Zuerst auf der Budgetebene. Intelligentes Emergieren hat exklusiv berichtet, dass ByteDance Anfang 2026 das Datenbudget für das Training von Weltmodellen und Codierungsmodellen bereits auf über zehn Millionen US-Dollar angehoben hat, und „wenn das Budget als unzureichend empfunden wird, kann es jederzeit aufgestockt werden“.
Intelligentes Emergieren erfuhr außerdem, dass das derzeitige Datenteam von ByteDance auch ein Wettbewerbsmechanismus eingeführt hat, bei dem das Team nach Richtungen unterteilt wird – Weltmodell, Code, hochkomplexe Fachbereiche usw. Vor dem Hintergrund, dass die kommerzielle Logik von Modellen zunehmend klarer wird, muss auch jedes Datenprojekt von ByteDance den Return on Investment berechnen.
Neben ByteDance verstärken auch andere große Technologieunternehmen ihre Investitionen in Daten. Tencent, das seit letztem Jahr wirklich große Anstrengungen auf dem Gebiet großer Modelle unternimmt, hat in den letzten sechs Monaten häufig Mitarbeiter aus dem Datenteam von ByteDance mit einem bis zu dreifachen Gehalt abgeworben.
Die Budgets von Alibaba und Tencent für die Datenbeschaffung sind deutlich gestiegen und die Investitionen werden ständig erhöht. Eine Person aus der Datenbrille teilte Intelligentes Emergieren mit, dass die großen Technologieunternehmen derzeit bestimmte exklusive Datenstrategien verfolgen, beispielsweise die Festlegung exklusiver Fristen für Datensätze oder die phasenweise Übernahme der Kernmitarbeiter von Anbietern.
„Daten sind die entscheidendste Variable im aktuellen Wettbewerb um große Modelle.“ Dies ist bereits ein Konsens in fast allen beliebten Teilbereichen wie großen Sprachmodellen, verkörperter Intelligenz, Weltmodellen und KI für die Wissenschaft.
Auf dem Datenmarkt im Jahr 2026 besteht jedoch die Situation, dass die Nachfrage von KI-Unternehmen hoch ist und von der Vortrainingsphase bis zur Nachtrainingsphase alle auf den Engpass einer knappen Versorgung mit hochwertigen Daten stoßen.
Für ByteDance besteht die nächste Herausforderung darin, wie eine Datenorganisation mit mehr als 1000 Mitarbeitern schnell auf die neuesten Entwicklungen im Bereich der Modelle reagieren kann. Schließlich in einer Phase, in der sich die Fähigkeitsgrenzen von Modellen noch schnell verändern, können die heute am meisten gesuchten Daten in einem halben Jahr ihren Wert verlieren.
Der globale Wettbewerb um Modelle entwickelt sich zu einem Wettrüsten um Daten
In den letzten Jahren steht die globale Weiterentwicklung großer Modelle vor einem Trend: Unter der Voraussetzung, dass sich die Inferenzparadigmen langsam angleichen, verlangsamt sich die Verbesserung der Fähigkeiten durch die Algorithmenarchitektur. Daten sind bereits die wichtigste Variable, die die Obergrenze der Modellfähigkeiten bestimmt, und es gibt keine andere, die wichtiger ist.
Im Vergleich zu großen chinesischen Technologieunternehmen wie ByteDance sind die Investitionen ausländischer Unternehmen für große Modelle in Daten um ein Vielfaches höher. Die externen Datenbudgets führender Unternehmen für große Modelle im Silicon Valley wachsen schnell in einem Umfang von mehreren Milliarden US-Dollar pro Jahr. Beispielsweise hat Anthropic allein im Jahr 2025 ein Budget von über 1 Milliarde US-Dollar für RL-Daten bereitgestellt.
Das macht Daten zu einem der am schnellsten wachsenden Bereiche im Silicon Valley im Jahr 2026. Das typischste Beispiel ist das Starunternehmen Mercor aus dem Silicon Valley, dessen jährliches annualisiertes Einkommen von 500 Millionen US-Dollar im letzten Jahr auf 2 Milliarden US-Dollar zur Jahresmitte dieses Jahres gestiegen ist, wobei 91 % davon von führenden Modellunternehmen wie OpenAI und Anthropic stammen, und die Bewertung ist auf 20 Milliarden US-Dollar gestiegen, während das Unternehmen erst vor drei Jahren gegründet wurde.
Warum sind Daten plötzlich so wichtig geworden? Der grundlegende Grund liegt darin, dass die öffentlichen Daten im Internet fast erschöpft sind.
In den letzten drei Jahren haben sich die für das Modelltraining erforderlichen Daten von dem öffentlichen Bereich zu dem privaten Bereich gewandelt. Das öffentliche Internet enthält eine große Anzahl von Berichten und Dokumenten, fehlt aber an dem Prozess, wie Menschen diese Ergebnisse erzeugen, beispielsweise wie sie unklare Absichten verstehen, Kontext suchen, Fehler machen und diese korrigieren.
Beispielsweise gibt es neben der Codierung auch hochkomplexe Fachaufgaben in Bereichen wie Ärzten, Anwälten und der wissenschaftlichen Forschung, die von allgemeinen Modellen noch nicht gut gelöst werden können. Wenn Modelle ihre Fähigkeiten verbessern und wie echte Experten arbeiten wollen, benötigen sie eine große Menge natürlich erzeugter „Prozessdaten“. Diese Daten verbergen sich oft in echten Arbeitsabläufen, beispielsweise in Codebibliotheken, die im Inneren von Unternehmen angesammelt wurden, oder in Spuren, die durch tägliche Operationen von Mitarbeitern hinterlassen werden.
Die für KI benötigten Daten wandeln sich gerade von dem öffentlichen Bereich zu dem privaten Bereich. Die Erfassung einer großen Menge von privaten Daten ist zu einem neuen Wettbewerbspunkt für Unternehmen für große Modelle geworden.