首页文章详情

Der von ByteDance entlassene Praktikant erhielt eine Finanzierung von 200 Millionen Yuan und fordert Li Feifei heraus.

铅笔道2026-10-10 21:52
Wie schafft es ein Praktikant, der von einem großen Konzern aus der Personalliste gestrichen wurde, zwei Jahre später mit einer Unternehmensbewertung von 200 Millionen US-Dollar zurückzukehren?

Das Unternehmen hat noch keinen Namen, das Produkt ist noch nicht in Sicht, das Team besteht nur aus 10 Personen, und es hat bereits eine Finanzierung von fast 30 Millionen US-Dollar (ca. 200 Millionen Yuan) erhalten, mit einer Post-Money-Bewertung von 200 Millionen US-Dollar.

Nach neuesten Berichten wurde dieses Geld in das Weltmodell-Unternehmen investiert, das von Tian Keyu gegründet wurde, mit Beteiligung von 5Y Capital, IDG Capital und anderen.

Das größte Label von Tian Keyu ist „der Praktikant, der von ByteDance entlassen und auf Schadenersatz verklagt wurde“.

Wie konnte ein Praktikant, der von dem großen Technologiekonzern ausgeschlossen wurde, zwei Jahre später mit einer Bewertung von 200 Millionen US-Dollar zurückkehren? Und warum drängen die Kapitalgeber so sehr auf sein „Weltmodell“, das er entwickeln will?

Ein einziges Papier senkt die Branchenkosten drastisch

Tian Keyu hat seinen Bachelor an der Fakultät für Softwaretechnik der Beihang-Universität absolviert und sein Masterstudium an der Peking-Universität aufgenommen, wo er unter der Anleitung von Wang Liwei forschte, sein Forschungsschwerpunkt lag auf der Optimierung tiefgreifender neuronaler Netze und generativen Modellen. Ab 2021 absolvierte er sein Praktikum in der Abteilung für kommerzielle Technologien von ByteDance, wo er an Hyperparameter-Optimierung, verstärktem Lernen und visueller Generierung arbeitete.

Von Juni bis Juli 2024 hat er aus Unzufriedenheit mit der internen Zuweisung von Rechenressourcen im Team das Programm eines anderen Praktikanten abgeschaltet, um die Grafikkarten für die von ihm anerkannten Forschungsarbeiten freizumachen. Nach Angaben von ByteDance hat er durch das Schreiben und Manipulieren von Code die Modelltrainingaufgaben von Forschungsprojekten des Teams böswillig angegriffen, was zu Ressourcenverlusten geführt hat.

Nach dem Vorfall leugnete Tian Keyu zunächst, dass er die Handlung vorgenommen habe, und behauptete, ein anderer Praktikant sei der Täter, er ging sogar zur Polizei und meldete, dass er verleumdet worden sei. ByteDance war der Ansicht, dass er keinerlei Reue zeigte, und verklagte ihn im November 2024 offiziell mit einer Schadenersatzforderung von 8 Millionen Yuan.

Später räumte er ein, dass sein Verhalten unangemessen war. Das Gericht stellte schließlich fest, dass er gegen den Praktikumsvertrag verstoßen hat, verurteilte ihn zu einer Zahlung von 500.000 Yuan Schadenersatz und konfiszierte sein gesamtes Praktikumsgehalt.

Die dramatische Wende ereignete sich am zehnten Tag nach der Klageeinreichung. Im Dezember 2024 verlieh NeurIPS den jährlichen Preis für das beste Papier an das Werk, dessen Erstautor Tian Keyu war – „Visuelle autoregressive Modellierung: Skalierbare Bildgenerierung durch Vorhersage der nächsten Skala“ (VAR), das Papier belegte den sechsten Platz in dieser Ausgabe. Dies ist ein äußerst seltener Fall, dass ein Wissenschaftler mit Hintergrund aus dem chinesischen Festland diesen Preis als Erstautor erhält.

Das Gewicht dieses Papiers bestimmt direkt, was er heute tut.

Vor VAR basierte die KI-Bildgenerierung hauptsächlich auf Diffusionsmodellen: Zuerst wird ein unscharfes Gesamtbild skizziert, dann wird es Schicht für Schicht verfeinert, die Bilder sind gut, aber langsam, teuer und verbrauchen viel Rechenleistung, und die Architektur unterscheidet sich auch von der großer Sprachmodelle. Tian Keyu und sein Team verfolgten einen anderen Ansatz: Sie wandeln das Bild nicht in eine eindimensionale Form um, um Pixel für Pixel vorherzusagen, sondern behalten die zweidimensionale Struktur bei, beginnen mit einem unscharfen Umriss von 1×1 und gehen dann zu 2×2, 4×4, 8×8 … über, um von grob zu fein schrittweise vorherzusagen – genau so, wie ein Mensch malt.

Das Ergebnis ist, dass diese GPT-ähnlichen autoregressiven Modelle erstmals bei der Bildgenerierung die Diffusionsmodelle übertreffen: Auf dem ImageNet-Benchmark sank der FID-Wert zur Messung der Verzerrung von 18,65 auf 1,73, die Inferenzgeschwindigkeit stieg um das 20-fache, und erstmals wurde das Skalierungsgesetz umgesetzt, dass „je größer das Modell, desto besser das Ergebnis“ für die visuelle Generierung gilt. Nach der Open-Source-Veröffentlichung des Projekts erhielt es auf GitHub mehr als 4400 Sterne.

Tian Keyus größte Stärke ist es, mit sparsameren Architekturen die Kosten der visuellen Generierung zu senken. Zwei Jahre später gründete er sein eigenes Unternehmen und macht immer noch dasselbe – nur dass er nun von Bildern zu Videos wechselt und von der Bildgenerierung zum Weltmodell übergeht.

Weltmodelle sind im Trend

Ein Weltmodell bedeutet einfach gesagt, dass die KI nicht nur ein einzelnes Bild versteht, sondern den Raum, die Bewegung und die Kausalität der realen Welt begreift und vorhersagen kann, „was als Nächstes passieren wird“. Es wird als gemeinsame grundlegende Fähigkeit für Roboter, autonomes Fahren und interaktive Videos angesehen und ist auch die Richtung, die Persönlichkeiten wie Li Fei-Fei und Yann LeCun in den letzten Jahren mit aller Kraft vorantreiben.

Tian Keyu ist der Ansicht, dass menschliche Sprachen überhaupt nicht geeignet sind, Videos zu beschreiben. Bei einem mehrminütigen Video, in dem eine Katze vom Tisch springt, gehen die meisten Informationen über die Position der Objekte, die Bewegungsbahnen, Licht und Schatten sowie Kollisionen verloren, wenn man es in Text niederschreibt, und es wird unnötig Rechenleistung verschwendet.

Sein Lösungsansatz besteht darin, eine eigene Sprache für die KI zu schaffen. Das Team hat bereits ein „visuelles Wörterbuch“ mit etwa 200.000 Symbolen erstellt, die für Menschen nicht erkennbar sind, aber die KI sie nutzen kann, um Videos darzustellen, zu komprimieren und vorherzusagen. „Wir schaffen zuerst eine Sprache für die KI und speisen sie dann mit 100 Millionen Stunden an Videos ein“, sagte Tian Keyu.

Mit dieser Methode sinken die Kosten für die Generierung eines 1-Sekunden-Videos auf mindestens ein Zehntel des ursprünglichen Werts, das vollständige Modell soll 2027 veröffentlicht werden.

Der Zeitpunkt, den er gewählt hat, ist genau der, an dem diese Branche am lebhaftesten und gleichzeitig am heikelsten ist.

Am 1. September veröffentlichte Li Fei-Fei Unternehmen World Labs Atlas, das 3D-Szenen aus Bildern rekonstruieren, Kamerabewegungen festlegen und Videos von bis zu einer Minute Länge in 1440p generieren kann. Am 22. September veröffentlichte das in China ansässige Unternehmen PixVerse R2, das auf langes Gedächtnis setzt: Nutzer können mit Text, Sprache und Bewegungen die sich gerade generierende Welt in Echtzeit verändern, und die Handlung wird sofort erzeugt. Im Ausland kann Genie 3 von Google DeepMind Benutzern bereits ermöglichen, virtuelle 3D-Umgebungen in Echtzeit zu erkunden.

Am 7. Oktober kündigten Google und Unity gemeinsam Playground und das kommende Unity Spark an, mit dem Nutzer kleine Spiele mit natürlicher Sprache erstellen und teilen können.

Natürlich hat die Branche am meisten geschockt, als AMD am 28. September überraschend die Übernahme von World Labs für etwa 8,2 Milliarden US-Dollar in Aktien ankündigte.

Warum hat ein Unternehmen mit Kapital, einem Team und einem neu veröffentlichten Modell so schnell beschlossen, sich verkaufen zu lassen? Li Fei-Fei erklärte: Die nächste Generation der KI erfordert eine enge Zusammenarbeit von Modellentwicklung, Systemen und Chips, und der Beitritt zu AMD ermöglicht den Zugang zu Ingenieurskompetenz und Hardwarekapazitäten.

Dieses Ereignis sendet Tian Keyu ein doppeltes Signal. Einerseits zeigt es den Investoren von Weltmodellen einen klaren Ausstiegsweg, und die Bewertungen in dieser Branche werden neu angekurbelt. Andererseits gibt selbst Li Fei-Fei zu, dass ein reines Modellentrieb nicht mehr ausreicht – der entscheidende Faktor verlagert sich hin zu Rechenleistung, Kosten und Ingenieursystemen. Genau das ist der Grund, warum Tian Keyu auf „eine um eine Größenordnung günstigere“ Lösung setzt. Er wettet mit einem 10-köpfigen Team auf dieselbe Antwort, für die AMD 8,2 Milliarden US-Dollar auszugeben bereit ist.

Warum sind 5Y Capital und IDG Capital bereit, ein 10-köpfiges Unternehmen ohne Produkt zu investieren? Eine mögliche Antwort ist, dass Tian Keyu versucht, das teuerste Problem von Weltmodellen zu lösen: die Kosten der Rechenleistung.

Weltmodelle beginnen, Gewinne zu erzielen

Derzeit ist die dreidimensionale Inhaltserstellung der Bereich, der den Kunden am nächsten ist.

Marble von World Labs wird bereits monatlich abgerechnet: Die Standardversion kostet 20 US-Dollar, die Professional-Version 35 US-Dollar und die höchste Stufe 95 US-Dollar, zudem werden APIs und Schnittstellen für Unternehmenskooperationen angeboten. Nutzer geben Text oder Fotos ein, um erkundbare dreidimensionale Räume zu generieren, Szenendateien zu exportieren und sie anschließend zur weiteren Verarbeitung an Design- oder Spielwerkzeuge weiterzugeben. Das im September veröffentlichte neue Modell Atlas demonstrierte darüber hinaus die Fähigkeit, Videos von bis zu einer Minute Länge in 1440p entlang festgelegter Kameratrajektorien zu generieren, das vollständige Modell befindet sich jedoch noch in der Phase des frühen Zugangs.

Weltmodelle lösen das lästige Problem der Nacharbeit, das Werbeagenturen, Filmstudios und Spieleentwickler am meisten stört. Der Regisseur findet die Kamera zu hoch und möchte sie um 20 Zentimeter absenken; der Künstler möchte das Sofa im Zimmer umstellen. Wenn bei jeder Anpassung alles neu generiert und neu angeordnet werden muss, wird der Effizienzgewinn durch die KI wieder zunichte gemacht. Nur wenn dieselbe Szene wiederholt geändert, exportiert und in die bestehenden Produktionsabläufe integriert werden kann, hat sie die Chance, Teil des Softwarebudgets zu werden.

Diesen August gab World Labs bekannt, dass das Produktionsunternehmen Promise zehn historische Tatorte für die Sendung „Harlan Coben’s Final Twist“ von Paramount+ und CBS rekonstruiert hat. Einige dieser Orte existieren nicht mehr, das Team verfügte nur über alte Fotos oder historische Aufnahmen.

Zuerst reparierte Promise die Bilder, generierte dann mit Marble die dreidimensionale Umgebung, ließ die Künstler die fehlenden Teile ergänzen und Details korrigieren, und schließlich wurden die Szenen in LED-Fotostudios für die Aufnahmen verwendet.

Die Kreativplattform Magnific hat Marble in das 3D-Scenes-Tool integriert. Marketingfachleute können Referenzbilder in dreidimensionale Umgebungen umwandeln, Produkte darin platzieren, Kameras anpassen und Aufnahmen machen. Wenn eine Werbeserie mehrere Blickwinkel erfordert, kann um dieselbe Szene herum weiter fotografiert werden, ohne jedes Mal neu beschreiben und neu generieren zu müssen.

Für Investoren liegt die größere Geschichte in Fabriken, Logistik und autonomem Fahren. Wenn Roboter eine große Anzahl von Trainings- und Testsituationen im Computer absolvieren können, lassen sich kostspielige Fehlversuche mit echten Geräten reduzieren. Dieser Bedarf ist nicht eingebildet.

Diesen März kündigte ABB Robotics an, die Fähigkeiten von Nvidias Omniverse in die industrielle Software RobotStudio zu integrieren. Foxconn führt derzeit Pilotprojekte mit dieser Technologie für die Präzisionsmontage von Unterhaltungselektronik durch. ABB gibt das Ziel an, die Bereitstellungskosten um bis zu 40 % zu senken und die Markteinführungszeit von Produkten um 50 % zu verkürzen.

Autonome Fahrzeuge müssen Situationen wie Regen, Schnee, Straßenbau und plötzlich auftauchende Hindernisse testen. Mit echten Fahrzeugen auf der Straße dauert dies nicht nur lange, es ist auch schwierig, dieselbe Situation wiederholt zu erzeugen. Auch Roboter, die in verschiedene Haushalte, Lager und Geschäfte eindringen, benötigen eine große Fähigkeit zur Prüfung verschiedener Umgebungen.

Die Chance, die Weltmodelle bieten, besteht darin, diese Umgebungen in Massen zu generieren, sodass Unternehmen mehr Tests im Computer durchführen können.

Am 6. Februar veröffentlichte Waymo ein Weltmodell, das auf Genie 3 von Google DeepMind basiert. Das Unternehmen gab damals bekannt, dass seine Fahrzeuge bereits fast 200 Millionen Meilen vollständig autonom gefahren sind, während die gefahrene Strecke in virtuellen Umgebungen mehrere Milliarden Meilen erreichte.

Inhaltserstellung, Roboter und autonomes Fahren – alle drei Wege sind vielversprechend, aber die Risiken sind völlig unterschiedlich. Allgemeine Modelle erfordern fortwährende hohe Ausgaben, um den Vorsprung auszubauen, Anwendungsunternehmen müssen Vertrieb und Lieferung durchführen, und eine Übernahme hängt von der Bereitschaft weniger strategischer Käufer ab.

Dieser Artikel stellt keine Anlageberatung dar.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Pencil Report“, Autor: Pencil Report, veröffentlicht mit Genehmigung von 36Kr.