Seed hat sein eigenes Sendungsbewusstsein.
Anfang dieses Jahres wurde Seedance 2.0 ohne übermäßige Vorankündigung veröffentlicht. Innerhalb weniger Stunden verbreiteten sich die damit erzeugten Videos auf sozialen Plattformen im In- und Ausland: filmreife Kameraführung, native Ton-Bild-Synchronisation, Erzählung mit mehreren Aufnahmen. Sogar Elon Musk hat ein Beispielvideo auf X geteilt und kommentiert: „It's happening fast.“
Davor war ein Mann namens WU Yonghui bereits zum Fokus der Aufmerksamkeit der Branche geworden. Er absolvierte 2001 den Bachelor-Studiengang Informatik an der Nanjing Universität, arbeitete 17 Jahre bei Google, war Google Fellow und einer der technischen Gesamtverantwortlichen für die Anwendung des großen Modells Gemini. Vor einem Jahr verließ er Mountain View, kehrte nach Peking zurück und übernahm das Forschungsteam für große Modelle von ByteDance namens Seed.
Die Situation, mit der WU Yonghui bei seiner Übernahme konfrontiert war, wurde von Medien so beschrieben: Ein Forschungsteam mit Tausenden von Mitarbeitern, das über 10 Milliarden Yuan investiert hatte, um zwei Jahre lang hinterherzueifern, hat endlich ein Grundmodell entwickelt, das zur ersten Reihe in China gehört, wurde aber schnell von einem Modell übertroffen, das von DeepSeek mit nur Hunderten von Mitarbeitern und weniger Ressourcen entwickelt wurde. Der Abteilungsleiter räumte Fehler ein, und der CEO des Unternehmens nannte es in einer Vollversammlung aller Mitarbeiter aus, dass es eigentlich besser hätte gemacht werden können.
Anderthalb Jahre später stieg die tägliche Anzahl der Token-Aufrufe des großen Doubao-Modells auf 180 Billionen, was einem Anstieg von mehr als dem 1500-fachen innerhalb von zwei Jahren entspricht. Volcano Engine belegt mit einem Anteil von 49,5 % den ersten Platz auf dem chinesischen Markt für öffentliche Cloud-MaaS. Seedance 2.0 wurde zum Maßstab für globale Videogenerationsmodelle. Nach Schätzungen mehrerer Seiten liegt die Bruttomarge bei über 70 % und trägt mehr als die Hälfte zum MaaS-Umsatz von Volcano Engine bei.
Doubao 2.1 Pro, das im Juni dieses Jahres veröffentlicht wurde, erreicht bei Programmierbewertungen wie Terminal Bench 2.1 das Niveau von Claude Opus 4.7, und die umfassenden Nutzungskosten betragen weniger als 20 % des Konkurrenten. Im August wurde SeedRealtime, das native voll-duplex große Modell für Ton und Video, veröffentlicht. Am selben Tag wurde es vollständig in der Doubao-App eingeführt, sodass 380 Millionen Nutzer über Nacht Videogespräche mit KI führen können, bei denen sie gleichzeitig zusehen, zuhören und sprechen.
Hinter den Zahlen verbirgt sich eine leise Transformation der organisatorischen Gene. Ein Internetunternehmen, das mit Empfehlungsalgorithmen, A/B-Tests und Wettbewerbsmechanismen aufgestiegen ist, hat drei Jahre lang gelernt, etwas zu tun, was es früher nicht beherrschte: Grundlagenforschung. In diesem Prozess gab es Fehlurteile, personelle Unruhen, Streit über Entwicklungswege und Momente, in denen es von der externen Umgebung angetrieben wurde.
Die Geschichte von Seed handelt von Technik, von Menschen, aber vor allem davon, wie ein Unternehmen in einer Phase des Paradigmenwechsels seine eigenen Grenzen neu definiert.
01
Alte Karten und neuer Krieg
Der Start von ByteDance bei der Entwicklung großer KI-Modelle war nicht früh.
Nach der Veröffentlichung von GPT-4 im Jahr 2023 gründete das Unternehmen ein Sonderprojekt für große Modelle, das von LI Hang, dem damaligen Leiter des AI Lab, geleitet wurde. Im August desselben Jahres wurde das große Modell „Skylark“ registriert, fünf Monate später als Wenxin Yiyan von Baidu und drei Monate später als Tongyi Qianwen von Alibaba. ZHU Wenjia wurde aus der Suchabteilung abgezogen, um das Team zu leiten, das den Vorgänger von Seed bildete.
Dieser technische Führungskraft, die von YANG Zhenyuan, dem Leiter der Empfehlungsalgorithmen von ByteDance, als „Top 3 der Algorithmen von Toutiao“ bewertet wird, hat einen Lebenslauf mit typischem ByteDance-Charakter:
Er war Chefarchitekt in der Suchabteilung von Baidu, trat 2015 zu ByteDance, um die Suchfunktion aufzubauen, übernahm 2019 die Leitung von Toutiao, berichtete drei Monate später direkt an ZHANG Yiming und erreichte im Frühjahr 2020 eine tägliche aktive Nutzerzahl (DAU) von 140 Millionen für Toutiao. 2021 wurde er nach Singapur versetzt, um die Technik von TikTok zu unterstützen.
Er versteht groß angelegte Systeme, Empfehlungsalgorithmen und weiß, wie man Technik zu Produkten mit hunderten Millionen Nutzern macht.
2024 war das Jahr der Anwendungsproduktionsstätte für die KI von ByteDance. Im Mai wurde die Familie der großen Doubao-Modelle offiziell veröffentlicht. Volcano Engine senkte den API-Preis auf 0,0008 Yuan pro tausend Token, was 99,3 % unter dem durchschnittlichen Branchenpreis liegt, und löste den ersten Preiskrieg für große Modelle aus.
Die Doubao-App wurde mit der ausgereiften Produktmethodik, dem Traffic-System und den Wachstumshacker-Maßnahmen von ByteDance innerhalb eines Jahres von Null zur KI-Anwendung mit der höchsten DAU in China. Im November 2024 lag die monatliche aktive Nutzerzahl bei fast 60 Millionen, was den zweiten Platz um fast 50 Millionen übertrifft.
Diese Vorgehensweise ist ByteDance sehr vertraut. In den letzten zehn Jahren wurde dieselbe Logik von Toutiao über Douyin, Xigua Video bis Jianying wiederholt bestätigt: Schnelle Iteration, datengesteuerte Vorgehensweise, A/B-Tests, Wettbewerbsmechanismus, gesättigter Einsatz von Ressourcen. Sobald ByteDance in ein Inhalts- oder Werkzeugsegment eintritt, kann es mit feinerem Betrieb und stärkerem Ressourceneinsatz immer später kommen und die Führung übernehmen.
Letztes Jahr veröffentlichte DeepSeek R1, und die Fähigkeitskurve des Inferenzmodells erlebte in diesem Winter einen steilen Sprung, aber ByteDance hatte nicht einmal ein entsprechendes Inferenzmodellprodukt. Die auf der Anwendungsebene angesammelten Nutzervorteile erscheinen angesichts des Generationenunterschieds der grundlegenden Fähigkeiten zerbrechlich.
Daher gab es die zweite Reflexion, die LIANG Rubo in der damaligen Vollversammlung aller Mitarbeiter vortrug. Letztes Mal sagte er, „das Unternehmen ist träge geworden“ und habe die Sprachmodelle mit Transformer als Kern vernachlässigt. Diesmal räumte er ein, dass die Nachverfolgung von OpenAI o1 zu langsam war, und das Team war damals der Meinung, dass es keine große Rolle spielt, ob man einen Monat früher oder später fertig wird.
Er sagte einen Satz, der später immer wieder zitiert wurde: Es reicht nicht, ein Technologieunternehmen zu sein, man muss ein innovatives Technologieunternehmen sein. Man muss nicht nur neue Technologien gut anwenden, sondern auch neue Technologien erforschen und erfinden.
Dies war eine entscheidende Wende in der Wahrnehmung. Der Erfolg im Internetzeitalter beruhte zu einem großen Teil auf dem ingenieurstechnischen Aufholen: Man erkennt die Richtung und verkleinert die Lücke schnell mit stärkerer Ingenieurskapazität und Ressourceneinsatz. Aber im Zeitalter großer Modelle beträgt der Feedback-Zyklus des Empfehlungssystems Stunden, während der Feedback-Zyklus der Modellfähigkeiten Monate oder sogar Quartale beträgt. Ersteres kann mit A/B-Tests kleine Schritte machen, bei Letzterem können bei falscher Wahl der Architektur und des Trainingswegs monatelange Investitionen umsonst sein.
In diesem Jahr setzte LIANG Rubo für Seed ein neues Ziel: Die Obergrenze der Intelligenz anstreben. Man soll die Intelligenz selbst zum wichtigsten Ziel machen, nicht die DAU eines bestimmten Produkts. Diese Anpassung der Reihenfolge der Ziele ist grundlegender als jede Änderung der Organisationsstruktur.
02
Der Nachfolger und die Einpflanzung der Forschungskultur
Letztes Jahr im Februar trat WU Yonghui offiziell bei ByteDance ein. Er war nach GAO Zhun, dem CFO, ein weiterer externer Führungskraft, der direkt auf der Ebene unter dem CEO eingestiegen ist.
Er absolvierte den Bachelor an der Nanjing Universität, promovierte an der UCR, trat 2008 zu Google und blieb mehr als zehn Jahre dort. Im Suchrangteam prägte er sich die Arbeitsgewohnheit ein, „groß angelegte maschinelle Lernsysteme für hunderten Millionen Nutzern bereitzustellen“. 2015 wechselte er zu Google Brain und war einer der Kernautoren des neuronalen maschinellen Übersetzungssystems GNMT. Später war er ein Kernmitwirkender bei der Conformer-Spracharchitektur, dem spärlichen Expertenmodell GLaM und dem Bild-Text-Modell CoCa.
Nach der Fusion von Google Brain und DeepSeek wurde WU Yonghui zum Vizepräsidenten für Forschung und Google Fellow befördert. Im Gemini-Team war er einer der technischen Gesamtverantwortlichen auf der Anwendungsseite und leitete die Umsetzung des Kontextfensters mit einer Million Token. Laut Google Scholar wurden seine Arbeiten insgesamt mehr als 73.000 Mal zitiert.
DeepSeek-R1 wurde einen Monat vor seinem Eintritt veröffentlicht. Diese Schockwelle war im Inneren von ByteDance noch nicht abgeklungen. Nachdem LIANG Rubo die Reflexion in der Vollversammlung aller Mitarbeiter gehalten hatte, trat WU Yonghui direkt in den Vordergrund.
Tatsächlich hatte die Anpassung der KI-Organisation von ByteDance schon vor WU Yonghuis Eintritt begonnen: Im Januar 2025 wurde Seed Edge offiziell ins Leben gerufen, das auf langfristige Forschung von mehr als fünf Jahren abzielt. Der Bewertungszyklus wurde auf drei Jahre verlängert, und bei wichtigen Ergebnissen kann die Leistung „rückwirkend vergütet“ werden. Das ist bei ByteDance, das normalerweise nach halbjährlichen OKRs arbeitet, fast eine Existenz, die gegen das OKR-Prinzip verstößt.
Die fünf Richtungen – nächste Generation der Inferenz, nächste Generation der Wahrnehmung (Weltmodell), modellgestaltung mit integrierter Software und Hardware, nächste Generation des Paradigmas (über Rückausbreitung und Transformer hinaus), nächste Generation des Scaling (Multi-Agent und Training zur Testzeit) – keines davon kann innerhalb eines Jahres klare Ergebnisse liefern.
Nach seinem Amtsaufbau baute WU Yonghui weiter eine virtuelle Organisation mit drei Ebenen auf: Edge für langfristige Erkundungen von mehr als fünf Jahren, Focus zur Bewältigung der Kernengpässe des nächsten Modells und Base für die technische Lieferung des aktuellen Modells. Zwischen den drei Ebenen können Mitarbeiter und Themen fließen: Ergebnisse von Edge können an die unteren Ebenen weitergegeben werden, und langfristige Themen, die von Focus entdeckt werden, können an Edge übergeben werden.
Er fördert die Kommunikation und den Austausch. Daten und Codebasen sind intern vollständig transparent, um die früheren Barrieren zu brechen, bei denen Dokumente zwischen verschiedenen Gruppen nicht sichtbar waren.
ZHANG Yiming widmete diesem Thema mehr Energie, als viele erwartet hatten. Der Gründer begann Ende 2023, die Autoren wichtiger KI-Arbeiten einzeln zu besuchen, darunter auch Doktoranden, die noch nicht abgeschlossen hatten. Nach WU Yonghuis Eintritt kehrte ZHANG Yiming häufiger an die Front zurück, um sich über die Technik zu informieren. Er nahm oft an wichtigen technischen Sitzungen von Seed teil und diskutierte gelegentlich sogar Details mit den Forschern.
Aber die Einpflanzung der Forschungskultur geschieht nicht über Nacht. Als WU Yonghui nach seiner Übernahme das erste große Modell Doubao 2.0 trainierte, erteilte er dem gesamten Team eine praktische Lektion. Dies war das größte Modell, das Seed seit seiner Gründung trainiert hat, mit einer Billion von Parametern und einer Gemini-ähnlichen multimodalen Architektur.
Als die Parametergröße anstieg, gab es Probleme mit der Trainingsstabilität. Mit den Worten eines Forschers: „Es ist wie beim Bau eines Hauses: Wenn das Fundament nicht stabil ist, treten beim Hinzufügen von Ziegeln leicht Probleme auf.“ Später arbeiteten mehrere Teams zusammen und brauchten drei Monate, um Patches an der Modellarchitektur und den Trainingsdaten vorzunehmen, bevor das Modell vor dem Frühlingsfest 2026 fertig trainiert wurde.
WENG Jiayi, der Leiter von OpenAI RL Infra, sagte: Jedes Modellteam hat Fehler in seiner Infrastruktur. Im Wesentlichen konkurrieren Modellunternehmen mit der Geschwindigkeit, mit der Fehler in der Infrastruktur behoben werden. Das bestimmt, wie viele Ideen pro Zeiteinheit überprüft werden können, und Ideen lassen sich lösen, sobald die Personaldichte ausreichend hoch ist.
Für ByteDance hat der Austausch und die Mischung der Mitarbeiter schon lange begonnen. Während der Gründungsphase von Seed warb ByteDance weltweit intensiv Talente an: JIANG Lu, der Leiter von Google VideoPoet, ZHOU Chang, der ehemalige technische Leiter von Alibaba Tongyi Qianwen, und HUANG Wenhao, Mitbegründer von 01.AI, traten nacheinander bei.
In dem Jahr, in dem WU Yonghui antrat, wechselte die Berichtsbeziehung von ZHU Wenjia von LIANG Rubo zu WU Yonghui. Die frühe Struktur mit zwei Leitern wurde zu einer einheitlichen Struktur, in der WU Yonghui die Grundlagenforschung leitet und ZHU Wenjia für die Modellanwendungen verantwortlich ist. Die visuelle Generierungslinie wurde ebenfalls angepasst: Seedream (Text zu Bild), Seedance (Text zu Video) und Seed3D (3D-Generierung) wurden alle der Leitung von ZHOU Chang unterstellt.
Im Jahr 2026 wird die Personalergänzung fortgesetzt. GUO Daya, einer der Kernautoren von DeepSeek R1, trat bei Seed ein, um den Bereich Codierung und Agent zu leiten, und die relevanten Entwicklungsressourcen wurden einheitlich unter seiner Leitung zusammengefasst. Im Juni wurde das Robotikteam von Seed Robotics ebenfalls der Leitung von ZHOU Chang unterstellt, was die Verantwortlichkeiten für den Bereich Multimodalität und verkörperte Intelligenz weiter konzentrierte.
Ein erwähnenswertes Detail ist die Trainingsentscheidung von Seedance 2.0. Beim Teamessen Ende 2025 schlug ZENG Yan, die Leiterin des Videomodells – eine junge Forscherin, die 2021 über die Campus-Einstellung eingetreten ist – vor, direkt ein Modell mit 200 Milliarden Parametern zu trainieren.
Im Team gab es Meinungsverschiedenheiten: Einige meinten, es sei sicherer, zuerst 100B zu trainieren, und die Trainingsressourcen waren knapp. Nach der Diskussion zwischen WU Yonghui und ZHOU Chang entschied man sich, ihre Einschätzung zu unterstützen. Diese damals radikal erscheinende Wahl erwies sich später als einer der Schlüsselfaktoren, mit denen Seedance 2.0 einen Generationenvorsprung erzielen konnte.
03
Seed ohne Destillation
Vor einiger Zeit sprach ZHANG Yiming in einer seltenen langen Rede in der Vollversammlung aller Mitarbeiter von Seed. Eine der Kernbotschaften lautet: Seed wird nicht durch Destillation hinterherjagen. Geschlossene Modelle dürfen nicht destilliert werden, offene Modelle dürfen nicht destilliert werden, und man akzeptiert, vorübergehend zurückzubleiben.
Nach der anschließenden Rekonstruktion mehrerer Medien erlebte diese Entscheidung drei Debatten über den Entwicklungsweg im Inneren von Seed.
Das erste Mal war nach der Veröffentlichung von DeepSeek-R1 im Januar 2025, als einige Forscher vorschlugen, die Generierungsdaten der führenden Modelle zu nutzen, um die Inferenzfähigkeiten zu ergänzen. Das zweite Mal war Ende 2025, als die NVIDIA Blackwell-GPUs in großem Maßstab bereitgestellt wurden und die KI-Leistungslücke zwischen China und den USA durch die neue Hardware weiter vergrößert wurde – da tauchte erneut die Stimme auf, „wenn es nicht anders geht, destillieren wir“.
Das dritte Mal war nach der Veröffentlichung von Kimi K3 im Juli