Wer Galaxy Universal versteht, versteht die Zukunft der verkörperten künstlichen Intelligenz.
Wie lässt sich der ChatGPT-Moment der verkörperten Intelligenz eigentlich definieren?
Am 19. August, vor Ort auf der Weltroboterkonferenz (WRC), stellte Wang He, Gründer und CTO von Galaxy Universal, diese Frage dem Publikum im Unterforum „Der Evolutionspfad der großen Modelle für verkörperte Intelligenz“, das von Galaxy Universal veranstaltet wurde.
Seine Antwort lautet: Roboter können Null-Shot-Generalisierung bei gängigen Fähigkeiten erreichen, die sie nicht speziell erlernt haben; normale Nutzer können ihm neue Bewegungen beibringen, ohne über Algorithmus-Hintergrund zu verfügen. Um dies zu erreichen, brauchen humanoide Roboter ein Gehirn, das die physische Welt verstehen, den ganzen Körper und die Hände steuern und kontinuierlich lernen kann.
Auf dem neu veröffentlichten kleinen humanoiden Roboter Galbot ET1 („Galaxy StarKid“) von Galaxy Universal erhält diese Vorstellung nun einen neuen Körper. Nach Angaben ist „Galaxy StarKid“ der weltweit erste intelligente humanoide Roboter mit selbstständiger Lernfähigkeit. Er ist mit dem selbstentwickelten AstraBrain-Agent von Galaxy Universal ausgestattet, der die Umgebung in Echtzeit beobachten, menschliche Anweisungen verstehen und Verhalten dynamisch planen kann. Menschen müssen keine Aktionsvideos vorbereiten, um ihm neue Bewegungsfähigkeiten durch Interaktion beizubringen.
Hinter dem agilen Körper von „Galaxy StarKid“ verbirgt sich die neueste Evolution seines großen verkörperten Modells – AstraBrain Galaxy StarBrain. Während die Branche für verkörperte Intelligenz noch einen harten Wettbewerb um die Körperleistung führt, hat Galaxy Universal bereits größere Gewinne auf das große verkörperte Modell gesetzt. Und dieses Modell bestimmt nun die Obergrenze der Roboter.
Das ist auch der Grund, warum Galaxy Universal das am meisten beachtete Unternehmen auf dieser WRC ist.
Wenn Agent in die physische Welt eintritt
Der Grund, warum „Galaxy StarKid“ Diskussionen auslöst, liegt darin, dass er eine neue Produktlogik trägt.
In den letzten zwei Jahren ist Agent zu einem der beliebtesten Konzepte in der KI-Branche geworden. Agenten in der digitalen Welt können Tools zwischen Software aufrufen, Nutzern bei der Suche nach Informationen helfen und Online-Aufgaben für Menschen ausführen. Physische intelligente Agenten stehen vor einer sich ständig verändernden realen Umgebung. Sowohl die Veränderung der Form von Objekten als auch die Änderung von Licht und Position erfordern, dass das Modell dies schnell versteht und dann den Körper dazu antreibt, zu reagieren.
Galaxy Universal definiert AstraBrain-Agent als „natives intelligentes Agent für die physische Welt“. Seine Wahrnehmung und Planung richten sich direkt an den realen Raum, und die Ergebnisse des Denkens werden schließlich zu Körperbewegungen. Nachdem der Roboter die Aktion ausgeführt hat, ändert sich die Umgebung, und neue Rückmeldungen beeinflussen die nächste Beurteilung.
Die interaktive Selbstlernfähigkeit von „Galaxy StarKid“ entsteht genau unter dieser Logik. Er kann die Bewegungstrajektorie menschlicher Tänzer in Echtzeit erkennen und den Bewegungen folgen, um Hip-Hop-Bewegungen auszuführen. Selbst bei schwierigen Bewegungen wie Stützen auf dem Boden und Handstand kann er die Körperstabilität aufrechterhalten. Diese agile Körperleistung kommt genau von der Unterstützung des allgemeinen Kleinhirns AstraBrain-WBC von Galaxy StarBrain.
Hinter diesem Modell stehen mehr als 100.000 Stunden menschlicher Aktionsdaten. Ein Teil stammt von hochpräziser Bewegungserfassung, der andere Teil wird aus menschlichen Videos im Internet umgewandelt. Mit diesen Daten kann das Modell lernen, wie Menschen das Gleichgewicht halten, Gelenke koordinieren und zusammenhängende Bewegungen ausführen, und dann die Bewegungsfähigkeit auf den Roboter übertragen, ohne dass die gesamte Bewegungstrajektorie im Voraus geschrieben werden muss.
Dahinter verbirgt sich die Evolution der Technologie für große verkörperte Modelle. Früher erforderte das Hinzufügen einer Fähigkeit zu einem Roboter normalerweise, dass ein professionelles Team Daten neu erfasst und das Training abschließt, und die Fähigkeit war leicht an einen bestimmten Körper und ein bestimmtes Szenario gebunden. AstraBrain-Agent möchte die bereits erworbenen allgemeinen Fähigkeiten des Modells behalten und dann neue Aufgaben mit geringfügiger Interaktion anpassen. Jedes Mal, wenn der Roboter eine neue Fähigkeit erlernt, erweitert er kontinuierlich dasselbe Gehirn.
Um Galaxy StarBrain herum hat Galaxy Universal eine Ganzgehirnarchitektur aufgebaut, die Großhirn, Brücke zwischen Gehirnteilen und Kleinhirn umfasst. Das Großhirn ist für das Verstehen der Umgebung und die Planung von Handlungen verantwortlich, das Kleinhirn steuert den ganzen Körper und die Hände, und die Brücke zwischen Gehirnteilen überträgt hochrangige Absichten in spezifische Bewegungen.
Dabei verwendet das Großhirn die WAM-Architektur des Welt-Aktions-Modells, die von Galaxy Universal zuerst vorgeschlagen wurde. VLA kann Aktionen basierend auf Sehen und Sprache generieren, und das Weltmodell ist gut darin, abzuleiten, wie sich die Umgebung ändern wird. WAM integriert beide Fähigkeiten in ein einheitliches Modell, sodass der Roboter versteht, welche physischen Folgen eine Aktion haben kann, und dann das nächste Verhalten bestimmt.
Der zentrale Durchbruch von AstraBrain WAM besteht darin, die Fähigkeiten über verschiedene Körper, Szenarien und mehrere Aufgaben hinweg in dasselbe Grundmodell zu integrieren. Dasselbe Gehirn kann den G1-Roboter antreiben, geschickte Hände zu verwenden, um Waren im Supermarkt abzuholen, und flexible Vorgänge wie das Falten von Kleidung auszuführen; nach dem Austausch des Roboter-Körpers kann er auch neue Aufgaben zum Tragen von Kisten ausführen. Die Akkumulation des Modells ist nicht mehr durch Hardware und Szenarien eingeschränkt, und diese umfassende Fähigkeitsübertragung ist in der Branche noch nie vorgekommen.
„Galaxy StarKid“ ist außerdem mit dem selbstentwickelten allgemeinen Kleinhirn-Grundmodell AstraBrain-WBC von Galaxy Universal ausgestattet. Es wird auf der Grundlage großer Mengen menschlicher Bewegungsdaten trainiert und kann die von AstraBrain-Agent generierten Absichten in stabile, zusammenhängende Körperbewegungen umwandeln. Das Modell verfügt auch über eine hervorragende Generalisierungsfähigkeit bei Bewegungen, die im Training nicht aufgetaucht sind.
Tennis ist eines der Szenarien, das diese technischen Fähigkeiten am besten prüfen kann. Diese Sportart ist sehr wettbewerbsintensiv, und die Reaktionszeit für den Roboter ist extrem kurz. Er muss nicht nur die Flugbahn des ankommenden Balls vorhersagen, sondern auch seine Position rechtzeitig anpassen und den Ball präzise schlagen, während er das Gleichgewicht hält. „Galaxy StarKid“ ist mit dem hochdynamischen Tennis-Kontrollrahmen LATENT von Galaxy Universal ausgestattet und kann in der praktischen Demonstration die Bewegungen in Echtzeit an den von einer echten Person kommenden Ball anpassen, um menschenähnliches Gegeneinander-Schlagen zu vollenden.
Vom Folgen von Menschen bis zur unabhängigen Beurteilung hat die Branche allmählich einen neuen Konsens gebildet: Welche Obergrenze ein humanoider Roboter erreichen kann, hängt zunehmend davon ab, wie viele neue Fähigkeiten das „Gehirn“ hinter ihm entwickeln kann. Je mehr Körper er betritt, desto reicher sind die Erfahrungen, die er in der physischen Welt sammelt, und der nächste Roboter wird dadurch einen höheren Ausgangspunkt haben.
Der echte Test eines Gehirns
Auf dem Messestand von Galaxy Universal wird dieses „Galaxy StarBrain“ auch in verschiedene Aufgaben eingebracht, um geprüft zu werden.
Das eindrucksvollste Szenario ist eine scheinbar gewöhnliche Frühstücksaufgabe: Der Roboter muss Schritte wie das Holen von Brot, das Eingießen von Wasser und das Anrichten von Tellern nacheinander ausführen. Während der Ausführung treten oft zufällige Situationen auf, zum Beispiel wird die Tasse von Zuschauern weggenommen oder das Zielobjekt wird plötzlich verdeckt. Aber in der Live-Demonstration plant der Roboter neu basierend auf dem neuen Zustand vor seinen Augen und erledigt die verbleibende Arbeit mühelos.
Herkömmliche Roboter führen voreingestellte Abläufe in einer festen Umgebung aus. Sobald sich die Bedingungen eines Schritts ändern, wird die gesamte Aufgabe leicht unterbrochen, aber die reale Welt folgt selten streng dem im Voraus geschriebenen Drehbuch. Eine Person, die am Tisch die Hand ausstreckt, oder eine Tasse, die vorübergehend verschoben wird, ändert alles, was der Roboter in der nächsten Sekunde tun soll.
Die Schwierigkeit von Langzeitaufgaben verbirgt sich in diesen vorübergehenden Veränderungen. Je länger die Bewegung dauert, desto leichter beeinflussen die vorher entstandenen Fehler die nachfolgenden Schritte. Der Roboter muss sein Verständnis der Umgebung während der Ausführung ständig aktualisieren und gleichzeitig das Gedächtnis für die gesamte Aufgabe behalten.
Ein weiteres schwieriges Szenario ist das Falten von Kleidung, das das Verständnis des großen verkörperten Modells für flexible Objekte stark prüft. Kleidung hat keine feste Form. Jedes Mal, wenn der Roboter greift, ändern sich die Falten des Stoffes. Das Modell muss den aktuellen Zustand der Kleidung neu beurteilen und einen geeigneten Greifpunkt suchen. Ob die Aufgabe fortgesetzt werden kann, hängt davon ab, ob das Modell die Beurteilung nach jedem Schritt aktualisieren kann.
Natürlich reicht für echte industrielle Szenarien ein erfolgreicher Demonstrationslauf bei weitem nicht aus. Die Genauigkeit bei einer großen Anzahl von täglichen Wiederholungsarbeiten bestimmt, ob Kunden bereit sind, kontinuierlich für Roboter zu bezahlen.
Galaxy Universal ist das qualifizierteste Unternehmen für verkörperte Intelligenz, um diese Frage zu beantworten. Dieses Unternehmen hat seine Produkte bereits in großem Maßstab in intelligenten Apotheken und sofortigem Einzelhandel eingesetzt. Roboter müssen das Ziel aus zehntausenden von Waren genau finden und es nach dem Greifen an den Kurier übergeben. Solche Aufgaben werden täglich viele Male wiederholt, und Genauigkeit, Betriebsstabilität und Fähigkeit zur Behandlung von Ausnahmen beeinflussen das Geschäft direkt.
In industriellen Szenarien erreicht die maximale Last des zweiarmligen Galbot S1 von Galaxy Universal 50 Kilogramm, sodass er schwere Materialtransportaufgaben übernehmen kann. Nach der Erhöhung der Last muss der Roboter seine Körperhaltung und die Art der Kraftanwendung neu anpassen und die Position der umgebenden Personen beurteilen, um die Sicherheit der Zusammenarbeit zu gewährleisten.
Die in verschiedenen Szenarien verwendeten Roboter haben unterschiedliche Formen und stehen vor sehr unterschiedlichen Problemen. Auf der einen Seite steht weiche, leicht verformbare Kleidung, auf der anderen Seite dichte Regale, und auf der dritten Seite schwere industrielle Gegenstände. Sie teilen die technische Basis von Galaxy StarBrain und bestätigen die Generalisierungsfähigkeit von Galaxy StarBrain. Das ist genau der Ausgangspunkt für die Allgemeingültigkeit des großen verkörperten Modells.
Für Galaxy Universal hat der Einsatz des Modells in der Industrie noch einen weiteren Wert. Intelligente Apotheken, sofortiger Einzelhandel und industrielle Produktionslinien erzeugen kontinuierlich echte Daten. Diese Daten zeichnen Probleme auf, die in Simulationsumgebungen schwer abzudecken sind, zum Beispiel Veränderungen des Verpackungsmaterials, Abweichungen durch langfristigen Betrieb von Geräten und zufällige Störungen durch Personal vor Ort. Nach einer neuen Trainingsrunde wird die aktualisierte Fähigkeit wieder auf den Roboter übertragen.
Auf dem Forum kündigte Galaxy Universal außerdem an, Simulationsplattformen, Datenerfassungsgeräte, grundlegende Modelle für verkörperte Intelligenz und Post-Training-Pipelines für verstärktes Lernen für Technologieunternehmen und Industriepartner freizugeben. Normale Entwickler können auch neue Bewegungen und Anwendungen rund um „Galaxy StarKid“ erstellen. Das ist auch der notwendige Weg für das große verkörperte Modell zur Allgemeingültigkeit: Je offener die Ökologie wird, desto mehr Teilnehmer gibt es, desto reicher sind die realen Probleme, mit denen das große Modell in Kontakt kommt, und desto schneller beschleunigt sich die Evolution des Modells.
Nur wenn das Modell in die reale Welt eintritt, können technische Ergebnisse zu Produktivkräften werden, die kontinuierlich wachsen. Galaxy Universal hat auf dieser WRC bewiesen, dass Galaxy StarBrain bereits über solche Fähigkeiten verfügt.
Das große verkörperte Modell ist die neue Wasserscheide
In den letzten Jahren lag das Scheinwerferlicht der Branche für humanoide Roboter meist auf dem Körper.
Unitree Robotics, das sich durch herausragende Roboterbewegungssteuerung und Ingenieurfähigkeiten auszeichnet, hat am 19. August sein Börsendebüt gegeben, was ein Beweis dafür ist. Am Tag der Eröffnung erreichte Unitree Robotics einen Anstieg von mehr als 629 %, und der Marktwert lag zeitweise bei 444,9 Milliarden Yuan. Der Kapitalmarkt hat mit einem äußerst lebhaften Börsendebüt einen hohen Preis für den kommerziellen Wert des Körpers von humanoiden Robotern gezahlt.
Dass Roboter schnell laufen, hoch springen und große Stöße aushalten können, ist in der Tat das intuitivste Maß für technische Fortschritte. Aber wenn Roboter in Apotheken, Supermärkte und Fabriken eintreten, kann ein „beweglicher“ Roboter die Anforderungen offensichtlich nicht mehr erfüllen. Er muss Anweisungen mit unklarer Bedeutung verstehen, Objekte verarbeiten, die im Training nicht gesehen wurden, und auch das Herumlaufen von Personen und das Verschieben von Gegenständen bewältigen. Der Körper bestimmt, welche Orte der Roboter erreichen kann, und das Gehirn bestimmt seine Fähigkeitsgrenzen.
Daher wird das große verkörperte Modell zur neuen Wasserscheide der Branche.
Die Leistung des Roboterkörpers kann durch Lieferkette und Ingenieurinvestitionen beschleunigt verbessert werden, aber der Wachstumszyklus eines allgemeinen Gehirns ist oft länger. Es muss physikalische Gesetze in einer großen Anzahl von Aufgaben erlernen und in reale Szenarien geprüft werden. Je reicher die Aufgaben sind, die das Modell durchläuft, desto mehr Erfahrungen kann es bei der Bewältigung neuer Probleme abrufen. Selbst wenn Nachzügler ähnliche Hardware verwenden, ist es schwierig, dieses Know-how schnell nachzuholen.
Das Börsengang von Unitree demonstriert den kommerziellen Wert des Roboterkörpers, während