Wang Xingxing enthüllt selbst die „Geschichte der Wertsteigerung von Unitree“
Am zweiten Tag nach dem Börsengang hat Wang Xingxing den inneren Weg von Unitrees „Wachstum“ öffentlich nachvollzogen.
Am 20. August trat Wang Xingxing auf der Veranstaltung der „Weltroboterkonferenz 2026“ auf und hielt eine Rede mit dem Titel „Vom Ausstellungsstück zum Produkt: Das nächste Jahrzehnt der Branche für humanoide Roboter“. Er hat den „Sprung“ von Unitree in den letzten fast zehn Jahren systematisch nachvollzogen, von Technik und Produkten bis hin zu Einsatzszenarien.
Die Geschichte von Unitree beginnt im Jahr 2016. Wang Xingxing erinnerte sich, dass das Unternehmen ursprünglich vierbeinige Roboter herstellte und erst in den letzten Jahren den Fokus auf humanoide Roboter verlagert hat. Das 2024 vorgestellte G1 ist bereits zu einem wegweisenden Produkt im globalen Bereich humanoider Roboter geworden – die überwiegende Mehrheit der humanoiden Roboter auf dem Markt stammt entweder von der gleichen Plattform wie es oder hat eine sehr ähnliche Form.
Aber im Vergleich dazu, das Produkt „herzustellen“, liegt ihm mehr daran, dass es „praktisch eingesetzt wird“. Wang Xingxing enthüllte, dass Unitree in den letzten Jahren ständig daran gearbeitet hat, dass Roboter „wirklich ins Leben eintreten und in Fabriken arbeiten“. In diesem Prozess betonte Wang Xingxing wiederholt das Wort „wirklich“. Mit anderen Worten, auch Unitree ist der Ansicht, dass Bühnendarstellungen nicht das Kern-Einsatzszenario humanoider Roboter sind.
Der Übergang von voraufgezeichneten und choreografierten Bewegungen zu multimodalen End-to-End-Bewegungen, die in Echtzeit aus Sprache generiert werden, ist der technologische Sprungpfad von Unitree in den letzten 10 Jahren. Wang Xingxing gab offen zu, dass die Bewegungen der früheren flüssig wirkenden Demonstrationen alle im Voraus trainiert wurden; die heute gezeigten Fähigkeiten basieren bereits auf der Generierung aus Echtzeit-Sprache.
„Wir hoffen, dass wenn zukünftig echte Roboteranwendungen eingeführt werden, alle ihre Bewegungen vollständig in Echtzeit generiert werden, anstatt im Voraus programmiert zu werden.“
Der Konsens der gesamten Branche für verkörperte Intelligenz lautet: Daten unterstützen die Fähigkeit von Robotern, Bewegungen in Echtzeit zu schlussfolgern und auszuführen.
Nach Wang Xingxings Einschätzung „sind die heutigen Roboter alle KI-gesteuert, und KI ist im Grunde datengesteuert. Wie viele Daten, insbesondere wie viele hochwertige Daten man hat, bestimmt, wie leistungsfähig die KI ist.“
Was die Datentypen betrifft, stützt sich das Vortraining hauptsächlich auf riesige Mengen an menschlichen Daten und Internetdaten, ergänzt um gemessene Daten von Robotern in der physischen Welt. Erstere sind in großer Menge vorhanden, letztere sind unverzichtbar. „Wir müssen den Roboter wirklich mit der physischen Welt abgleichen.“
Wang Xingxing enthüllte, dass die Investition des Unternehmens in Geld und Personal für KI-Modelle „derzeit die größte sein sollte“. Das Weltmodell ist ein umständlicherer Pfad: Anfang 2020 begann man mit der Entwicklung von Weltmodellen, die auf Videogenerierung basieren, bis Ende des Jahres wurde dies vorübergehend eingestellt, da die Ergebnisse nicht zufriedenstellend waren, bis 2025 wieder stark darin investiert wurde. Dieser Rhythmus von „zuerst ausprobieren, einstellen und dann erneut vorantreiben“ spiegelt die wiederholte Erkundung eines Unternehmens für verkörperte Intelligenz im technischen Weg vom Nullpunkt zum ersten Schritt wider.
Neben den Daten ist die Generalisierungsfähigkeit des Modells hinter dem Roboterkörper der Schlüssel für den Übergang von der Bühne zur Fabrik. Die objektive Situation ist, dass heutige Roboter einfache Montageaufgaben erledigen können, aber ihre Effizienz immer noch niedriger ist als die von Menschen, und sie müssen für jede neue Aufgabe neu trainiert werden.
„Wenn man in einem festen Szenario ausreichend Sammel- und Trainingsdaten erfasst, kann die Erfolgsrate fast 100 % erreichen. Aber wenn sich das zu bedienende Objekt oder die Umgebung geringfügig ändert, sinkt die Erfolgsrate sehr stark“, sagte Wang Xingxing.
Wang Xingxing ist der Ansicht, dass die unzureichende Ausrichtung von Ein- und Ausgaben des KI-Modells an der echten physischen Welt zu der schlechten Generalisierungsfähigkeit führt. „Sprachmodelle sind rein digital kodiert und haben im Grunde keine Verluste. Jede Ein- und Ausgabe des Roboters hingegen weist Abweichungen und Verluste auf.“
Für die Lösung dieses Problems stellt sich Wang Xingxing die Idee der „selbstevolutionären physischen KI-Roboter“ vor: Man treibt einen Agenten mit modernsten großen Modellen an, der selbst im Internet nach neuesten Arbeiten und Open-Source-Lösungen sucht, Steuercodes schreibt, diese zuerst in einer Simulationsumgebung überprüft und dann auf dem physischen Roboter einsetzt. Eine positive Schleife entsteht, indem die automatische Bewertung durch KI mit der Bewertung durch menschliche Erfahrung kombiniert wird.
Auf die von der Öffentlichkeit sehr interessierte Frage „Wann werden allgemeine Roboter wirklich in Haushalte eintreten?“ legte Wang Xingxing den Schwellenwert fest: Ein Roboter, der in eine beliebige unbekannte Umgebung gebracht wird, kann etwa 80 % der Aufgaben über Sprachbefehle erledigen. „Das wird der kritische Ausbruchspunkt der echten Industrie in der Zukunft sein.“
Er prognostiziert, dass es in zwei bis drei Jahren schneller gehen kann, in fünf bis zehn Jahren langsamer. In der aktuellen Zeit des großen KI-Booms hat sich die Evolutionsgeschwindigkeit von Robotern insgesamt stark erhöht. „Es könnte sogar noch ein bisschen schneller gehen als ich geschätzt habe“, und dies ist ein „völlig neuer Ausgangspunkt“.
Im Folgenden der vollständige Wortlaut von Wang Xingxings Rede (ohne Änderung des ursprünglichen Sinns wurde sie gekürzt und angepasst)
Hallo zusammen. Zuerst werfen wir einen Blick auf die Situation unseres Unternehmens: Unitree wurde 2016 gegründet, bis zum August dieses Jahres sind es fast genau zehn Jahre. Das Unternehmen stellte ursprünglich vierbeinige Roboter her und hat in den letzten Jahren humanoide Roboter entwickelt.
Eines unserer erfolgreichsten Produkte in den letzten Jahren ist das 2024 vorgestellte G1. Nach seiner Markteinführung ist dieser Roboter im Grunde zu einem wegweisenden Produkt weltweit geworden. Die überwiegende Mehrheit unserer Roboterprodukte, die Sie heute sehen, oder viele weltweit genutzte Roboterprodukte stammen im Grunde von der gleichen Plattform wie es oder haben eine sehr ähnliche Form.
Zu Beginn dieses Jahres war unser WuBot ein repräsentatives Beispiel: Wir haben Dutzende klassischer chinesischer Kung-Fu-Bewegungen im Voraus erfasst, KI-Training durchgeführt und sie dann auf die Bühne gebracht. Der größte Höhepunkt dieses Programms ist die Kombination der weltweit besten Technologie für humanoide Roboter mit der traditionellen chinesischen Kultur des Kung-Fu und des Löwentanzes. Das Video verbreitete sich im Ausland sehr gut, es gab Hunderte von Milliarden Aufrufe, und alle mochten es sehr. Ich denke, dies ist ein sehr gutes Beispiel für die Vermischung von Technik und Kultur.
Außerdem haben wir eine einfache Demonstration am Himmelstempel durchgeführt, bei der etwa 49 Roboter vollständig automatisch auftraten, was sehr beeindruckend war. Der Himmelstempel hat eine Kulturgeschichte von Hunderten von Jahren, und die Roboter vor Ort erwecken den Eindruck, durch Raum und Zeit zu reisen – die Kultur der letzten Jahrhunderte vermischt sich mit der aktuellsten Technik.
In den letzten Jahren haben wir ständig daran gearbeitet, dass Roboter wirklich ins Leben eintreten und in Fabriken arbeiten. 2024 haben wir bereits mit Automobilfabriken zusammengearbeitet, um Einsatzanwendungen umzusetzen. Wir haben auch Roboter in unseren eigenen Fabriken eingesetzt, um einfache Tests und Einsätze durchzuführen. Der überwiegende Teil unseres KI-Teams arbeitet daran, dass Roboter wirklich in Haushalten oder Fabriken arbeiten.
Warum führen wir sie derzeit nicht in großem Maßstab ein? Der Hauptgrund ist, dass die aktuelle Effizienz und Generalisierungsfähigkeit noch nicht ausreichen.
Obwohl Roboter einige einfache Montageaufgaben erledigen können, ist ihre Effizienz im Vergleich zu Menschen immer noch niedriger. Und jedes Mal, wenn eine neue Aufgabe kommt, müssen sie neu trainiert werden, was die Effizienz weiter senkt. Deshalb hoffen wir, die Technik so weit zu entwickeln, dass die Generalisierungsfähigkeit besser wird, bevor wir sie in großem Maßstab einführen – dies ist derzeit der größte gemeinsame Engpass weltweit.
Diesen April haben wir einen Rekord gebrochen: Der schnellste Lauf eines humanoiden Roboters überschritt 10 Meter pro Sekunde. Dieser Roboter wurde aus unserem ersten humanoiden Roboter H1 von 2023 umgebaut. H1 ist auch unser erster humanoider Roboter im Unternehmen, ein sehr klassisches Modell. Später können auch Räder montiert werden, um die Flexibilität zu erhöhen.
Sie wissen, dass heutige Roboter alle KI-gesteuert sind, und KI ist im Grunde datengesteuert – wie viele Daten, insbesondere wie viele hochwertige Daten man hat, bestimmt, wie leistungsfähig die KI ist. Wir erfassen Daten selbst und arbeiten mit Dritten zusammen, um mehr Daten zu sammeln. Die Trainingsdaten für echte KI-Roboter bestehen hauptsächlich aus riesigen Mengen menschlicher Daten oder Internetdaten als Vortrainingsdaten, ergänzt um einige Daten von echten Robotern. Dies sind zwei unverzichtbare Teile. Von der Menge her sind menschliche Daten umfangreicher und wichtiger, aber die tatsächlichen Daten von echten Robotern sind auch sehr entscheidend, weil wir den Roboter mit der echten physischen Welt abgleichen müssen.
Diesen Mai haben wir das weltweit erste serienreife, menschentragende verformbare Mech GD01 vorgestellt, das über drei Meter groß ist und nach dem Beladen mit einer Person etwa 500 Kilogramm wiegt. Es ähnelt einem Geländewagen, der nicht für den Einsatz in Haushalten oder Städten gedacht ist, sondern für Wanderungen im Freien und Transport in komplexen Umgebungen. Das Interessanteste ist, dass er sich in einen Vierbein-Modus verwandeln kann, der eine bessere Stabilität und eine sehr starke Fähigkeit zum Überwinden von Hindernissen bietet.
Vor einigen Monaten haben wir die automatische KI-Bewegungsgenerierung auf Basis multimodaler End-to-End-Technik demonstriert. Viele der von Ihnen gesehenen üblichen Bewegungsdemonstrationen sind im Voraus trainiert. Die Bewegungen hier wurden aus Echtzeit-Sprache generiert – deswegen gibt es eine Verzögerung von einigen Sekunden dazwischen: Nachdem jeder Satz gesprochen wurde, wird die Sprache erkannt, in die Cloud hochgeladen, um KI-Bewegungen zu generieren, und nach erfolgreicher Überprüfung an den Roboter übermittelt. Aber wir hoffen, dass wenn zukünftig echte Einsätze stattfinden, alle Bewegungen vollständig in Echtzeit generiert werden, anstatt im Voraus programmiert zu werden.
Wir haben auch Roboter dazu gebracht, wirklich in Konferenzräumen zu arbeiten. Die Konferenzräume unseres Unternehmens sind oft unordentlich, und das Aufräumen von Konferenzräumen ist eine sehr unverzichtbare Aufgabe. Wir erfassen und trainieren hauptsächlich, dass der Konferenzraum nach beliebigem Durcheinander wieder in einen sauberen und ordentlichen Zustand versetzt wird. Dies wird vollständig End-to-End realisiert, es wurden etwa sieben oder acht verschiedene Aufgaben eingerichtet, die automatisch von einem Modell umgeschaltet und direkt ausgeführt werden können, und es ist störfest. Diese Funktion haben wir in letzter Zeit ständig weiterentwickelt, weil Szenarien wie das Aufräumen von Konferenzräumen, die sowohl praktischen Wert haben als auch nicht besonders schwierig sind, sehr sinnvoll sind.
Auf Basis der automatischen Spracherzeugung haben wir eine Version mit Arbeitsfähigkeit entwickelt: Unter der Steuerung von Sprache können die Bewegungen Arbeitsaufgaben erledigen. Zum Beispiel kann er nach der Ausstattung mit einem multimodalen Modell den Befehl „Hol die blaue Medikamentenschachtel von der dritten Ebene herauf“ erkennen und ausführen, und er ist störfest, keine festen Bewegungen.
Vor einiger Zeit haben wir die neueste Generation des Rad-Fuß-Roboters Go2-W vorgestellt, der sehr leicht ist, ein Eigengewicht von nur etwa 20 Kilogramm hat, aber eine sehr starke Tragfähigkeit und Akkulaufzeit bietet, weitgehend regendicht ist und sowohl drinnen als auch draußen eingesetzt werden kann. Wir haben einige Technologien humanoider Roboter wieder auf vierbeinige Roboter übertragen, um die Flexibilität der vierbeinigen Roboter weiter zu erhöhen. Ihre Tragfähigkeit ist auch sehr stark, und wir hoffen sehr, sie in Szenarien wie Wanderungen im Freien einzusetzen.
Wir haben auch das letztjährige mittel- und kleingroße humanoide Roboter-Modell R1 sowie verbraucherorientierte Produkte wie das A2 aktualisiert, die ein sehr gutes Preis-Leistungs-Verhältnis haben und auf JD.com und Taobao vorbestellt oder gekauft werden können. Vor einiger Zeit haben wir einen neuen Roboter vorgestellt, der nur etwas mehr als drei Monate Entwicklungszeit brauchte. Derzeit ist es nur eine Vorschau, keine offizielle Markteinführung, aber seine Höchstgeschwindigkeit hat bereits 12,65 Meter pro Sekunde erreicht, was die derzeit schnellste Laufgeschwindigkeit der Menschheitsgeschichte übertrifft, und seine Sprunghöhe hat auch fast die höchste Sprunghöhe der Menschheitsgeschichte übertroffen.
Im Jahr 2025 wurden ich persönlich und die Produkte unseres Unternehmens in die Liste des Magazins „Time“ aufgenommen.
Wenn wir die Entwicklung der KI-Modelle für verkörperte Intelligenz in den letzten Jahren zurückblicken, sind die Hauptströmungen derzeit das VLA-Modell und das Weltmodell, und in diesem Jahr hört man am meisten über das Weltmodell. Unsere Investitionen in KI-Modelle waren immer sehr groß, es sollte die Richtung sein, in die das Unternehmen derzeit das meiste Geld und Personal investiert. Anfang 2020 haben wir bereits mit der Entwicklung von Weltmodellen auf Basis von Videogenerierung begonnen, aber Ende 2020 waren die Ergebnisse nicht zufriedenstellend, und wir haben es für eine Weile eingestellt. Letztes Jahr haben wir die Richtung der Weltmodelle auf Basis von Videogenerierung wieder stark vorangetrieben.
Viele Menschen fragen sich, wann allgemeine Roboter wirklich ins Leben und in Haushalte eintreten. Das größte Problem ist der derzeitige weltweite Engpass: Die Generalisierungsfähigkeit der verkörperten Intelligenz ist noch nicht ausreichend. Viele KI-Modelle können in einem festen Szenario eine Erfolgsrate von fast 100 % erreichen, wenn man ausreichend Sammel- und Trainingsdaten erfasst. Aber wenn sich das zu bedienende Objekt oder die Umgebung geringfügig ändert, sinkt die Erfolgsrate sehr stark.
Deshalb hoffe ich, dass wir in zwei bis drei Jahren schneller, in fünf oder zehn Jahren langsamer den Tag erleben werden: Wenn Sie einen Roboter in eine beliebige unbekannte Umgebung, in Ihr Zuhause bringen, und er etwa 80 % der Aufgaben erledigen kann, dann ist der kritische Moment der verkörperten Intelligenz fast erreicht, das wird der kritische Ausbruchspunkt der echten Industrie in der Zukunft sein. Der Bewertungsindex ist sehr einfach: Bringen Sie einen Roboter in etwa 80 % unbekannte Szenarien, und er erledigt 80 % der Aufgaben über Sprach- und Textbefehle, das ist ein sehr wichtiger kritischer Punkt.
Warum ist es am schwierigsten, diesen Punkt zu erreichen? Weil die Ein- und Ausgaben des aktuellen KI-Modells nicht ausreichend mit dem echten Roboter abgestimmt sind. Wenn Sie ihn bewegen lassen, Dinge zusammenmontieren oder Objekte an eine bestimmte Stelle tragen lassen, stimmt der allgemeine Trend, und er kann die Aufgabe ungefähr erledigen. Aber die Erfolgsrate oder Abweichung der letzten paar Zentimeter, der letzten paar Millimeter kann nicht gut mit der echten Welt übereinstimmen. Wenn ich etwas greifen will, und es scheint fast erfasst zu sein, kann die letzte Berührung und der letzte kleine Fehler nicht gut korrigiert werden, sodass die Er