StartseiteArtikel

Das Gehirn der Embodied Intelligence, eine Eintrittskarte für 20 Milliarden.

光锥智能2026-08-10 09:32
Der 20-Milliarden-Club der verkörperten Intelligenz: Ein Artikel, der 5 Unternehmen auf einen Blick vollständig verständlich macht

Zhi Square und Zi Bianliang streiten sich erneut.

Vor wenigen Tagen meldete Bloomberg, dass Zhi Square die Vorbereitungen für einen Börsengang in Hongkong im nächsten Jahr abgeschlossen hat. Kurz darauf tauchte die Nachricht auf, dass Zi Bianliang bereits vertraulich einen Börsengangsantrag bei der Hongkonger Börse eingereicht hat.

Das ist kein Zufall. Vor etwas mehr als einem Monat, am 29. Juni, gaben beide Unternehmen am selben Tag den Abschluss einer neuen Finanzierungsrunde bekannt, und die Bewertung nach der Finanzierung überstieg jeweils 20 Milliarden Yuan.

Die Zahl von 20 Milliarden Yuan war in früheren Jahren kaum vorstellbar. Heute ist sie zu einer neuen Schwelle für führende Unternehmen im Bereich der verkörperten Intelligenz geworden.

Nach öffentlich zugänglichen Angaben gibt es mindestens fünf Unternehmen, die zur „20-Milliarden-Yuan-Klub“ der verkörperten Intelligenz gehören, abgesehen von Herstellern von Teilen wie geschickten Händen: Zhi Square, Zi Bianliang, Xinghaitu, Qianxun Intelligence und Yinhe General.

Man muss wissen, dass dieser 20-Milliarden-Yuan-Klub in einem schrumpfenden Markt ausgewählt wurde.

Laut dem „Tiefenanalysebericht zum chinesischen Private-Equity-Markt im ersten Halbjahr 2026“ von Xiniu Data sind die Beiträge von LP (Geldgebern von Private-Equity-Fonds) bis zum 5. Juli 2026 um 32,65 % gesunken, die der staatlichen LP sind direkt um die Hälfte gefallen, und der durchschnittliche Betrag pro Transaktion hat sich in fünf Jahren um 44,8 % verringert. Gleichzeitig weist der Bericht darauf hin, dass die Zahl der Finanzierungsereignisse im Bereich der verkörperten Intelligenz im Jahresvergleich um 107 % gestiegen ist und sie 4 Plätze unter den Top-10-neuen-Einhörnern einnimmt.

Bevor der kommerzielle Weg validiert wurde, haben fünf Unternehmen durch hochdichte Finanzierungen schnell die Bewertungsschwelle von 20 Milliarden Yuan überschritten. Dies ist die höchste Preisklasse, die der Primärmarkt derzeit bieten kann.

Darüber hinaus kann man nur auf einen Börsengang zurückgreifen, wie zum Beispiel Unitree und Agibot.

Unitree, das sich auf Roboterprototypen konzentriert, verfügt über branchenführende Bewegungssteuerungstechnologie und Fähigkeiten zur Kostenkontrolle. Im Jahr 2025 lieferte Unitree 5500 Einheiten humanoider Roboter aus, mit einem Umsatz von etwa 1,7 Milliarden Yuan. Die Auslieferungsmengen von Agibot liegen auf ähnlichem Niveau, über 5000 Einheiten, und der Umsatz übersteigt 1,05 Milliarden Yuan.

Kürzlich wurde der Ausgabepreis von Unitree veröffentlicht, und die Börsenbewertung beträgt 60,9 Milliarden Yuan. Nach dem Eintritt in die Börsenphase strebt Agibot eine Bewertung von 36,3 bis 43,3 Milliarden Yuan an.

Im Vergleich zu den beiden oben genannten Giganten unterscheiden sich die Mitglieder des 20-Milliarden-Yuan-Klubs: Ihre Auslieferungsmengen haben gerade erst die Schwelle der Spitzenunternehmen erreicht. Wie können sie diese Bewertung rechtfertigen?

Man bezieht sich auf die „bestimmte Preisgestaltung“ auf dem Markt. Nach dem Ausgabepreis von 61 Milliarden Yuan von Unitree und der Zielbewertung von Agibot liegt das Umsatzmultiplikator nach Berechnung des Umsatzes im Bereich von 35 bis 40. Wenn man diesen Maßstab auf den „20-Milliarden-Yuan-Klub“ anwendet, ergibt sich ein Jahresumsatz von etwa 500 Millionen Yuan. Wenn der Umsatz nicht erreicht wird, beweist dies nur, dass die Prämie objektiv existiert.

Es ist nicht schwer zu erkennen, dass diese fünf Unternehmen ihren Schwerpunkt alle auf das „Gehirn“ gelegt haben. Die Vorliebe des Kapitalmarkts für Robotergehirne wird zu einem gemeinsamen Urteil von Investmentinstituten. Mit anderen Worten: Der Markt ist allgemein der Ansicht, dass das Gehirn wertvoller ist.

Dies zeigt sich auch deutlich auf ausländischen Märkten. Zum Beispiel hat Skild AI, das keine Roboterprototypen herstellt und dessen Kernprodukt ein universelles Modell ist, das an Roboterarme, humanoide Roboter und vierbeinige Roboter angepasst werden kann, in diesem Jahr eine Bewertung von 14 Milliarden US-Dollar erreicht. Physical Intelligence konzentriert sich ebenfalls auf grundlegende Modelle der verkörperten Intelligenz, die verschiedene Prototypen und Aufgaben abdecken, und seine Bewertung ist innerhalb eines Jahres von 2 Milliarden auf 5,6 Milliarden US-Dollar gestiegen.

Im Vergleich zu Unternehmen mit einer Bewertung unter 20 Milliarden Yuan haben diese fünf Unternehmen nicht nur den richtigen Weg des „Gehirns“ gewählt, sondern verfügen auch über relativ fortschrittliche Basismodelle, solide Datenkreisläufe und klare Einsatzszenarien.

Das Kapital bewertet diesen Sektor in einem beispiellosen Tempo neu. Die Frage ist: Was bedeutet der Preis von 20 Milliarden Yuan in der Branche der verkörperten Intelligenz? Was genau wird mit diesen 20 Milliarden Yuan gekauft?

Fünf Gehirne lösen dieselbe Gruppe von Problemen

Bevor der kommerzielle Weg erfolgreich umgesetzt wird, wird die technische Stärke zu einem weiteren Maßstab für die Messung des Unternehmenswerts.

Oberflächlich betrachtet werden mit diesen 20 Milliarden Yuan alle „Gehirne“ oder Basismodelle gekauft. Tatsächlich unterscheiden sich die technischen Stacks der fünf Unternehmen voneinander, durchdringen sich aber auch gegenseitig.

Derzeit ist die Hauptroute auf der Gehirnseite auf dem Markt immer noch VLA. Der Unterschied besteht darin, ob VLA verbessert wird oder das Weltmodell mit VLA verschmolzen wird. Die Verbesserung von VLA zielt hauptsächlich darauf ab, das Problem zu lösen, dass das Modell „langsam versteht, aber schnell handelt“. Das Hinzufügen eines Weltmodells verleiht dem Modell eine zusätzliche Fähigkeit zur Vorhersage, um die Generalisierung in unbekannten Szenarien zu bewältigen.

Zhi Square, Xinghaitu und Qianxun Intelligence verfolgen alle die Route des verbesserten VLA.

Um den Konflikt zwischen der Inferenzgeschwindigkeit des Modells und der Echtzeitsteuerung zu lösen, verwendet FiS-VLA von Zhi Square eine Struktur mit zwei Systemen für schnelle und langsame Vorgänge. Das langsame System ist für das Verstehen von Anweisungen, das Zerlegen von Aufgaben und die übergeordnete Inferenz verantwortlich, das schnelle System für die Generierung von Aktionen. Dies ist keine einfache Verbindung von zwei Modellen, sondern das schnelle System wird in das langsame System eingebettet, teilt einige Parameter und läuft asynchron mit unterschiedlichen Frequenzen. Zusammenfassend lässt sich sagen, dass es sowohl die „schnelle Reaktion“ des End-to-End-Verfahrens behält als auch das gesamte System durch L (Sprachmodell) zum „Denken“ bringen kann.

Im Jahr 2026 wurde diese Technologie weiter zum NeuroVLA-Großmodell umgestaltet und zu einer dreischichtigen gehirnähnlichen Struktur aus „Kortex – Kleinhirn – Rückenmark“ gemacht. Das zusätzliche Kleinhirnmodul ist für die Aufrechterhaltung der Aktionsstabilität verantwortlich, z. B. für die schnelle Reaktion nach einem Zusammenstoß. Aus architektonischer Sicht wurde die Reaktion des „schnellen Systems“ weiter verstärkt.

Auch bei der Beschleunigung der Reaktionsgeschwindigkeit besteht die Lösung von Xinghaitu darin, die Art der Informationsübertragung innerhalb des Modells zu verbessern.

Im frühen VLA verlässt sich die Kommunikation zwischen Sehen, Sprache und Aktionen auf Encoder zur Übersetzung, und die Informationen werden bei der Übertragung zwangsläufig komprimiert und gehen verloren. Daher verwendet G0.5 von Xinghaitu eine einheitliche autoregressive Architektur, entfernt den zwischengeschalteten Encoder und wandelt Bilder, Inferenz und Aktionen in einheitliche interne Tokens um, die in derselben Sequenz generiert werden. Auf diese Weise ist die Inferenz nicht nur die Eingabe des Aktionsmodells, sondern wird Teil der Aktionsgenerierung und verläuft reibungsloser.

Im Vergleich zu den ersten beiden Unternehmen, die sich auf die Architektur konzentrieren, wirkt Qianxun Intelligence sehr „fundamentalistisch“ und vertraut mehr auf die Skalierungsfähigkeit von VLA selbst.

Spirit v1.5 von Qianxun Intelligence versucht, durch die Erweiterung des Datenumfangs und der Komplexität dem Modell eine stärkere Generalisierungsfähigkeit über verschiedene Szenarien hinweg zu verleihen. Insbesondere „schmutzige Daten“, die nicht stark gefiltert sind, wie Verdeckungen, Pausen und Fehlschläge, werden verwendet, um zu vermeiden, dass das Modell nur Standardaktionen nachahmt, ohne komplexe Langschwanzinformationen zu verstehen.

Aber die Route des verbesserten VLA hat immer noch Grenzen.

Denn das höhere Ziel des verkörperten Modells ist immer noch das Verständnis und die Generalisierung der physischen Welt. Das herkömmliche VLA kann die nächste Aktion durch Beobachtung und Anweisungen ausführen, kann aber keine Vorhersagen anhand der Umgebung treffen, z. B. wohin der Becher fällt, wenn man die Hand loslässt. Die Route, die das Weltmodell mit VLA verschmilzt, zielt darauf ab, diese Schwäche auszugleichen.

WALL-B von Zi Bianliang kombiniert die physische Vorhersage mit Sehen, Sprache und Aktionen in einem einzigen Netzwerk für das gemeinsame Training, sodass der Roboter nicht nur die Aktionen im Training nachahmt, sondern auch die möglichen Ergebnisse der Aktionen vor der Ausführung vorhersagen kann.

Die Modellarchitektur von Yinhe General ist am komplexesten, da sie nicht ein einziges Modell verwendet, um alle Fähigkeiten abzudecken, sondern mehrere VLA-Modelle auf einem einzigen Basismodell platziert. Dazu gehören GALBOTVLA, das für das Greifen mit dem Oberkörper verantwortlich ist, TrackVLA, das für die Bewegung des Unterkörpers zuständig ist, und eine zusätzliche Mensch-Maschine-Interaktionsschicht zum Verstehen von Anweisungen. Zusammen wird es als GALBOT VLA bezeichnet.

In diesem Jahr hat sich das Basismodell von GALBOT VLA einheitlich zu AstraBrain (Yinhe Star Brain) weiterentwickelt. Es gliedert sich in: Gehirn (WAM 0.5), Kleinhirn (WBC 0.5) und neurale Steuerung für geschickte Hände (DexNDM). Sieht das nicht der gehirnähnlichen Struktur von Zhi Square ähnlich? Darüber hinaus verwendet die Verbindungsart von Groß- und Kleinhirn in diesem Basismodell ebenfalls dieselbe Zwei-System-Struktur für schnelle und langsame Vorgänge wie Zhi Square.

In WAM 0.5, das als Gehirn fungiert, dient das Weltmodell nicht nur als Vorhersageschicht, sondern wird gemeinsam mit VLA in einem einzigen Modell modelliert und nimmt direkt an der Aktionsplanung teil.

Zusammenfassend lässt sich sagen, dass jedes Unternehmen aus architektonischer Sicht seine eigene Route verfolgt, aber in der gesamten Branche löst es eigentlich dieselbe Gruppe von Problemen: Kann der Roboter von der Ausführung einer einzelnen Aktion zur Erledigung von Aufgaben übergehen, die aus Dutzenden von Schritten bestehen? Kann er von bekannten Objekten auf unbekannte Objekte generalisieren? Kann er die Fähigkeiten, die ein Roboterprototyp erlernt hat, auf einen anderen Roboter übertragen? Kann er sich nach einem fehlgeschlagenen Vorgang selbst wiederherstellen?

Interessanterweise gibt es hinter den verschiedenen technischen Routen noch ein weiteres Signal: Wenn der Wettbewerb um die Routen bis zum Ende andauert, beginnen die Architekturen, sich gegenseitig „abzuschreiben“. Dies könnte darauf hindeuten, dass nach der 20-Milliarden-Yuan-Marke nicht mehr darum geht, wer den richtigen Weg wählt, sondern wer auf dem gewählten Weg schneller vorankommt.

Um schneller voranzukommen reicht es nicht aus, nur an den Modellen zu arbeiten. Der wichtigste Engpass liegt in den Daten.

Daten verändern die Macht der Modelle

Die Modellarchitektur bestimmt, wie der Roboter denkt, aber ob sich das Modell ständig weiterentwickeln kann, hängt letztendlich davon ab, auf welche Daten es zugreifen kann.

Bei der Zusammensetzung der Datentypen gibt es in der Branche grob zwei Richtungen: Man legt mehr Wert auf echte Daten oder neigt eher zu Simulationsdaten.

Echte Daten sind ein gemeinsames Problem der Branche: Sie sind selten, teuer und komplexe Langschwanzdaten sind kaum in großen Mengen zu sammeln. Ihr Vorteil liegt jedoch auf der Hand: Sie sind real, und der Fehler beim Übertragen auf das Training ist geringer.

Der Vorteil der Simulationsroute liegt in ihrem großen Umfang, niedrigen Kosten und der Möglichkeit, aktiv Fehlschlagsfälle zu erzeugen, die in der realen Welt schwer zu sammeln sind. Das Problem ist aber ebenfalls offensichtlich: Die Simulationsumgebung kann die Textur der realen Welt nicht vollständig nachbilden, und beim Übertragen auf echte Roboter tritt das Problem der „Sim-to-Real-Lücke“ auf.

Derzeit basiert die Branche noch hauptsächlich auf echten Daten. Bei der spezifischen Erfassungsmethode gibt es jedoch Unterschiede: Manche bevorzugen die Fernsteuerung oder die Erfassung ohne Roboterprototyp, andere lassen die Roboter direkt arbeiten, und jeder hat einen anderen Schwerpunkt.

Die Erfassung ohne Roboterprototyp ist weithin als die kostengünstigste Methode zur Erfassung echter Daten anerkannt. Dies ist die EGO-Route, die von Nvidia entwickelt wurde. Diese Methode ist genauer als echte menschliche Videos und günstiger als die Fernsteuerung.

Zum Beispiel erweitert Qianxun Intelligence hauptsächlich die Erfassungseffizienz durch selbst entwickelte tragbare Geräte. Auf diesem Weg können menschliche Handlungen kostengünstig aufgezeichnet werden, ohne dass für jede Datenmenge ein Roboter konfiguriert werden muss.

Aber die Freiheitsgrade, die Kräfte und der Aktionsbereich des menschlichen Körpers stimmen nicht vollständig mit denen des Roboterprototyps überein. Wie man menschliche Handlungen präzise in Roboteraktionen umwandelt, bleibt ein Problem.

Viele Unternehmen nutzen ihre Produkte direkt als Erfassungswerkzeuge, binden das Modell an den Prototyp, lassen die Roboter Daten während der Arbeit erzeugen und leiten die Daten zurück zum Modelltraining, um einen geschlossenen Kreislauf zu bilden. Dies wird in der Branche als „Rückfluss der Daten durch Einsatz“ bezeichnet. Im Vergleich zu EGO und Fernsteuerung löst der Rückfluss durch Einsatz die Ausrichtung der echten Verteilung und die kontinuierliche Weiterentwicklung, und er kann als die höchste und wertvollste Datenart