StartseiteArtikel

ByteDance erforscht autonomes Fahren, das Team des Seed-Weltmodells übernimmt die entsprechende Verantwortung | Exklusiv von 36Kr

大福星2026-08-24 23:51
Autonomes Fahren, die vorherige Station von ByteDance auf dem Weg zur Embodied Intelligence.

Laut mehreren Branchenquellen von 36Kr erkundet ByteDance derzeit den Einstieg in das Bereich des autonomen Fahrens. Dieses Projekt wird derzeit vom Weltmodell-Team um Zhou Chang unter der Leitung von Seed verantwortet. Es ist bekannt, dass Seed nicht nur Teams für multimodale Modelle und Weltmodelle von Zhou Chang umfasst, sondern auch an der Richtung großer Sprachmodelle arbeitet.

Die technischen Routen des autonomen Fahrens und des Weltmodells weisen Überschneidungen auf.

Weitere Quellen teilten 36Kr mit, dass ByteDance im Hinblick auf die Geschäftsrichtung das Szenario des fahrerlosen Logistikverkehrs im Bereich des autonomen Fahrens aufbauen möchte. Dieses Geschäft gehört zur Automobilbranchenlinie von Volcano Engine, die zu ByteDance gehört.

Einige mit ByteDance vertraute Personen gaben an, dass das Team von ByteDance zuvor mit einigen führenden Teams für autonomes Fahren Geschäftsdiskussionen und Austausche geführt hat. Derzeit befindet sich das autonome Fahrprojekt von ByteDance in einem frühen Vorbereitungsstadium. ByteDance hat viele führende Talente für Fahrassistenzsysteme oder autonomes Fahren eingeladen, und einige technische Talente, die diesen Aufbau von ByteDance positiv bewerten, planen ebenfalls, dem Unternehmen beizutreten.

Zu den oben genannten Nachrichten wandte sich 36Kr an ByteDance zur Bestätigung. ByteDance antwortete: „ByteDance führt viele frühe Forschungen und Erkundungen in den bahnbrechenden Bereichen großer KI-Modelle, einschließlich des Bereichs der physischen KI, durch, hat jedoch keine Pläne, das Geschäft für intelligentes Fahren zu betreiben.“

Seed ist ein grundlegendes Forschungsteam für große Modelle unter ByteDance, das 2023 gegründet wurde und eine strategische Abteilung auf erster Ebene von ByteDance ist.

Zhou Chang ist einer der Kernverantwortlichen für die KI-Forschung und -Entwicklung bei ByteDance Seed. Er trat 2024 in ByteDance ein, war für die Forschung und Entwicklung multimodaler großer Modelle verantwortlich, und danach erweiterte sich der von ihm verwaltete Geschäftsbereich ständig. Im vergangenen Jahr wurde das visuelle Generierungsgeschäft in seinen Verantwortungsbereich aufgenommen, und in diesem Jahr berichtet das Seed Robotics-Team ebenfalls an Zhou Chang. Das bedeutet, dass der Verwaltungsbereich von Zhou Chang derzeit mehrere Bereiche abdeckt, darunter multimodale große Modelle, Weltmodelle, visuelle Generierung und verkörperte Intelligenz.

Volcano Engine ist die Cloud-Marke von ByteDance. Bereits 2020 wurde unter Volcano Engine eine Automobilbranchenlinie gegründet. Tan Dai, Präsident von Volcano Engine, äußerte sich öffentlich: „Wir sind der erste aller Cloud-Anbieter, der das Automobilgeschäft zu einer Linie auf erster Ebene gemacht hat.“

Seit diesem Jahr ist die Welle der physischen KI aufgestiegen. Autonomes Fahren und verkörperte Intelligenz gelten als die beiden ersten Szenarien, in denen die physische KI umgesetzt wird. Unter ihnen ist das autonome Fahren als eines der frühesten umgesetzten Szenarien der verkörperten Intelligenz anerkannt.

Daher könnte das autonome Fahren zu einer Plattform für ByteDance werden, die zur verkörperten Intelligenz führt, während große Technologieunternehmen alle den Trend der physischen KI verfolgen.

Für die Branche des autonomen Fahrens könnte ByteDance mit seinen Vorteilen bei Ressourcen, Talenten und Technologie in diesen Bereich einsteigen und das bestehende Muster der Branche wahrscheinlich erschüttern, da das Weltmodell heute zu einem technischen Konsens in der Branche des autonomen Fahrens geworden ist.

Weltmodell wird zum technischen Konsens, ByteDance erhält Gelegenheit zum branchenübergreifenden Einstieg

Tatsächlich hat ByteDance schon lange sein Interesse am Automobilgeschäft gezeigt.

Vor dem Aufbau des autonomen Fahrens ist ByteDance bereits durch das große Modell Doubao in den Bereich des Automobilcockpits eingetreten, um das Interaktionserlebnis des Cockpits neu zu definieren. Jetzt kann der weitere Aufbau des Fahrassistenzsystems durch ByteDance das intelligente Erlebnis des gesamten Fahrzeugs schließen.

36Kr hat zuvor berichtet, dass Volcano Engine unter ByteDance eines der Teams ist, das am meisten in die Intelligenz des Automobilcockpits investiert, und SERES ist derzeit das Automobilunternehmen, das am tiefsten mit ihm zusammenarbeitet. Volcano Engine hat außerdem den Thor-z-Chip bei NVIDIA maßgefertigt und das Cockpit-Modell in Form eines externen „AI Box“ im Fahrzeug bereitgestellt.

SERES hat die führende Verantwortung für die Entwicklung der neuen Cockpit-Interaktion an Volcano übergeben und ihm die gesamte Fahrzeugplattform, die Umsetzungsfähigkeit sowie finanzielle Unterstützung in Höhe von mehreren hundert Millionen Yuan zur Verfügung gestellt.

Im Juni dieses Jahres wurde AIVA, die Automobilmarke in Zusammenarbeit von SERES und Volcano Engine, offiziell vorgestellt. Es wird erwartet, dass das AIVA ME7 mit dem „Doubao-Cockpit“ noch in diesem Jahr auf den Markt kommt.

Es ist jedoch zu beachten, dass der Kooperationspartner für das Fahrassistenzsystem der Marke AIVA DeepRoute ist. Eine Person aus der Branche des autonomen Fahrens bewertete: „Ohne die Integration von intelligentem Cockpit und Fahrassistenzsystem ist es schwierig, das intelligente Erlebnis des gesamten Fahrzeugs zu schließen.“

Der technische Konsens der Branche des autonomen Fahrens über das Weltmodell hat ByteDance gerade die Gelegenheit zum branchenübergreifenden Einstieg gegeben.

Im vergangenen Jahr gab es in der Branche noch einen Streit über die technischen Routen von VLA und Weltmodell. In diesem Jahr schließen sich immer mehr Unternehmen wie Geely, Momenta, Xiaom und Qingzhou Zhixing dem Lager des Weltmodells an, darunter auch einige ehemalige Anhänger der VLA-Richtung.

Zum Beispiel XPeng. In diesem Jahr hat es nicht nur das selbst entwickelte X-World-Weltmodell vorgestellt, sondern auch das „L-Modul“ im VLA, also das Sprachmodul, entfernt und VLA 2.0 auf den Markt gebracht. Das bedeutet, dass XPeng visuelle Inhalte nicht mehr in Sprache umwandelt, um dann zu schlussfolgern, sondern die Vision als „Grundstein der Intelligenz“ betrachtet. Eine solche Modellarchitektur ist dem Weltmodell bereits sehr nahe.

Das auf der GTC-Konferenz in diesem Jahr von Li Auto vorgestellte MindVLA O1 verfügt über einen integrierten 3D-ViT-Raum-Encoder und ein prädiktives latentes Weltmodell, das nicht nur das Verständnis von Sprachanweisungen, sondern auch das strukturierte Verständnis des dreidimensionalen Raums und die Vorhersage der Entwicklung zukünftiger Straßenverhältnisse betont. Letztere beiden Punkte sind genau die Kernpunkte des Weltmodells.

Daher ist es selbstverständlich, dass ByteDance nach dem Start der Forschung und Entwicklung des Weltmodells in den Bereich des autonomen Fahrens einsteigt.

Mit Vorteilen bei Ressourcen und Talenten branchenübergreifend einsteigen – ByteDance wird die Branche des autonomen Fahrens herausfordern

Für ByteDance könnte der Aufbau des autonomen Fahrens es schneller zum Ziel der verkörperten Intelligenz führen.

In diesem Jahr haben Jensen Huang, Gründer von NVIDIA, und Elon Musk, CEO von Tesla, vorhergesagt, dass der ChatGPT-Moment der physischen KI gekommen ist. Autonomes Fahren und verkörperte Intelligenz sind genau die beiden ersten Szenarien, in denen die physische KI umgesetzt wird.

Ihre Fähigkeitsstapel sind hochgradig kompatibel. Unter ihnen sind die Standards für Straßenverhältnisse und die Hardware des autonomen Fahrens bereits einheitlich geworden, und die Industriekette ist nach jahrelanger Entwicklung relativ ausgereift. Daher ist die Branche allgemein der Ansicht, dass es schwierig ist, eine allgemeinere verkörperte Intelligenz zu realisieren, wenn man das autonome Fahren nicht gut beherrscht. Daher ist das autonome Fahren für ByteDance nicht weniger als ein Übungsfeld für die verkörperte Intelligenz.

Eine weitere wichtige Bedeutung des autonomen Fahrens für die verkörperte Intelligenz von ByteDance liegt möglicherweise in den Daten.

Der Mangel an echten Daten aus der physischen Welt ist ein Faktor, der viele Unternehmen im Bereich der verkörperten Intelligenz behindert. Das autonome Fahren hat jedoch natürliche Vorteile bei der Datenerfassung.

Daher wird ByteDance nach dem Aufbau des autonomen Fahrens leichter eine große Menge an Daten aus der physischen Welt erhalten, um sein Weltmodell zu iterieren und dann die Modelfähigkeit auf die verkörperte Intelligenz zu übertragen.

Öffentliche Informationen zeigen, dass Tesla über Milliarden von Meilen an echten Straßendaten für FSD verfügt, und alle Fähigkeiten in den Bereichen Wahrnehmung, Weltmodellierung und Bewegungsplanung können auf den Optimus-Roboter übertragen werden.

Die von der Branche betonte Unterstützung von FSD für den Optimus-Roboter zeigt sich gerade in der „Fahrzeugdatenpipeline“, die es dem Roboter ermöglicht, viele Versuchs- und Irrtumszyklen zu überspringen.

Daher zeigt der Aufbau des autonomen Fahrens durch ByteDance in gewissem Maße sein Streben nach der verkörperten Intelligenz.

Für die Branche des autonomen Fahrens könnte der branchenübergreifende Einstieg von ByteDance in das autonome Fahren einen nicht unerheblichen Einfluss auf das Muster der Branche ausüben.

Die Umstellung der Technologie des autonomen Fahrens auf das KI-Paradigma hat in gewissem Maße die zugrundeliegende Logik des Wettbewerbs in der Branche verändert. Die auf dem KI-Paradigma basierende Technologie des autonomen Fahrens lässt die Produkterlebnisse aller Anbieter schnell aufeinander abstimmen. Darüber hinaus verfügt ByteDance über Vorteile bei Talenten und Ressourcen.

Eine Person aus der Branche des autonomen Fahrens äußerte gegenüber 36Kr, dass der Vorteil von ByteDance darin liegt, dass „es derzeit genug Geld hat, um zu investieren, und über genügend Talente verfügt“, und dass „ByteDance über genügend GPU-Karten verfügt, was es vollkommen ermöglichen kann, später aber schneller als andere erfolgreich zu sein“.

Er erläuterte: „Das allgemeine Weltmodell, an dem ByteDance derzeit arbeitet, unterscheidet sich nicht vollständig vom Weltmodell für das autonome Fahren, und viele technische Details unterscheiden sich stark voneinander. Darüber hinaus hat das spezielle Weltmodell für intelligentes Fahren ein tieferes Verständnis der physischen Gegebenheiten im Verkehr.

Aber ByteDance verfügt über genügend Rechenressourcen. Solange es einen Weg gibt, genügend Verkehrsdaten zu erhalten, ist es kein Problem, ein Weltmodell für intelligentes Fahren neu zu trainieren.

Solange das Cloud-Modell leistungsstark genug ist, kann die fehlende Fähigkeit zur technischen Umsetzung des autonomen Fahrens bei ByteDance durch die Einstellung von Personal schnell ergänzt werden.“

Nach fast zehn Jahren des Wettbewerbs in der Branche des autonomen Fahrens könnte der Einstieg von ByteDance viele neue Variablen in die Branche bringen.