Wer Galaxy General versteht, versteht die Zukunft der verkörperten Intelligenz.
Wie lässt sich der ChatGPT-Moment der verkörperten Intelligenz eigentlich definieren?
Am 19. August, auf dem Gelände des Weltroboterkongresses (WRC), stellte Wang He, Gründer und CTO von Galaxy General, diese Frage im Rahmen des von Galaxy General veranstalteten Nebenforums „Der Evolutionspfad großer Modelle für verkörperte Intelligenz“ dem Publikum vor.
Seine Antwort lautet: Roboter können Null-Shot-Generalisierung für gängige Fähigkeiten erreichen, die sie nicht speziell gelernt haben; normale Nutzer können ihm neue Bewegungen beibringen, ohne über Algorithmus-Hintergrund zu verfügen. Um dies zu erreichen, braucht ein humanoider Roboter ein Gehirn, das die physische Welt verstehen, den ganzen Körper und die Hände steuern und kontinuierlich lernen kann.
Auf dem neu veröffentlichten kleinen humanoiden Roboter Galbot ET1 („Galaxy Starboy“) von Galaxy General erhält diese Vorstellung einen neuen Körper. Nach Angaben ist „Galaxy Starboy“ der weltweit erste intelligente humanoide Roboter mit selbstständiger Lernfähigkeit. Er ist mit dem von Galaxy General selbst entwickelten AstraBrain-Agent ausgestattet, der die Umgebung in Echtzeit beobachten, menschliche Anweisungen verstehen und Verhalten dynamisch planen kann. Menschen brauchen keine Bewegungsvideos vorzubereiten, um ihm neue Bewegungsfähigkeiten durch Interaktion beizubringen.
Hinter dem agilen Körper von „Galaxy Starboy“ steht eine neueste Evolution seines großen verkörperten Modells — AstraBrain von Galaxy General. Während sich die Branche der verkörperten Intelligenz noch in einem harten Wettbewerb um die Körperleistung befindet, hat Galaxy General größere Wetten auf das große Modell für verkörperte Intelligenz gesetzt. Und dieses Modell bestimmt auch die Obergrenze der Fähigkeiten von Robotern.
Dies ist auch der Grund, warum Galaxy General zum am meisten beachteten Unternehmen dieser WRC geworden ist.
Wenn Agenten in die physische Welt eintreten
Der Grund, warum „Galaxy Starboy“ Diskussionen auslöst, liegt darin, dass er eine neue Produktlogik trägt.
In den letzten zwei Jahren ist Agent zu einem der beliebtesten Konzepte in der KI-Branche geworden. Agenten in der digitalen Welt können Tools zwischen Software aufrufen, Nutzern bei der Suche nach Informationen helfen und Online-Aufgaben für Menschen ausführen. Physische intelligente Agenten stehen vor einer sich ständig verändernden realen Umgebung. Sowohl Änderungen der Form von Objekten als auch Veränderungen von Licht und Position erfordern, dass das Modell dies schnell versteht und dann den Körper antreibt, zu reagieren.
Galaxy General definiert AstraBrain-Agent als „native Intelligenz für die physische Welt“. Seine Wahrnehmung und Planung richten sich direkt an den realen Raum, und die Ergebnisse des Denkens werden schließlich zu Körperbewegungen. Nachdem der Roboter eine Aktion ausgeführt hat, ändert sich die Umgebung, und neue Rückmeldungen beeinflussen die nächste Beurteilung.
Die interaktive Selbstlernfähigkeit von „Galaxy Starboy“ entsteht genau unter dieser Logik. Er kann die Bewegungsbahnen menschlicher Tänzer in Echtzeit erkennen und den Partner folgen, um Hip-Hop-Bewegungen auszuführen. Selbst bei schwierigen Bewegungen wie Stützen auf dem Boden und Handstand kann er die Körperstabilität aufrechterhalten. Diese agile körperliche Leistung stammt aus der Unterstützung des allgemeinen Kleinhirns AstraBrain-WBC von Galaxy AstraBrain.
Hinter diesem Modell stehen mehr als 100.000 Stunden menschlicher Bewegungsdaten. Ein Teil stammt aus der hochpräzisen Bewegungserfassung, der andere Teil wurde aus menschlichen Videos im Internet umgewandelt. Mithilfe dieser Daten kann das Modell lernen, wie Menschen das Gleichgewicht halten, Gelenke koordinieren und zusammenhängende Bewegungen ausführen, und dann die Bewegungskapazität auf den Roboter übertragen, ohne dass die gesamte Bewegungsbahn im Voraus geschrieben werden muss.
Dahinter steht die Evolution der Technik großer Modelle für verkörperte Intelligenz. In der Vergangenheit erforderte das Hinzufügen einer Fähigkeit zu einem Roboter normalerweise, dass ein professionelles Team Daten neu erfasst und das Training abschließt, und die Fähigkeit war leicht an einen bestimmten Körper und ein bestimmtes Szenario gebunden. AstraBrain-Agent hingegen möchte die bereits erworbenen allgemeinen Fähigkeiten des Modells behalten und dann wenige Interaktionen nutzen, um sich an neue Aufgaben anzupassen. Jedes Mal, wenn der Roboter eine neue Fähigkeit erlernt, erweitert er kontinuierlich dasselbe Gehirn.
Um AstraBrain herum hat Galaxy General eine Ganzgehirnarchitektur aufgebaut, die Großhirn, Brücke zum Gehirn und Kleinhirn umfasst. Das Großhirn ist für das Verstehen der Umgebung und die Planung von Handlungen zuständig, das Kleinhirn steuert den ganzen Körper und die Hände, und die Gehirnbrücke überträgt die hochrangige Absicht in konkrete Bewegungen.
Dabei verwendet das Großhirn die von Galaxy General zuerst vorgeschlagene WAM-Architektur (Welt-Aktions-Modell). VLA kann Aktionen basierend auf Sehen und Sprache generieren, und das Weltmodell ist gut darin, abzuleiten, wie sich die Umgebung ändern wird. WAM integriert beide Fähigkeiten in ein einheitliches Modell, sodass der Roboter verstehen kann, welche physischen Ergebnisse eine Aktion bringen kann, und dann das nächste Verhalten bestimmt.
Der zentrale Durchbruch von AstraBrain WAM besteht darin, die Fähigkeiten über verschiedene Körper, Szenarien und mehrere Aufgaben hinweg in dasselbe Basismodell zu integrieren. Dasselbe Gehirn kann den G1-Roboter antreiben, geschickte Hände zu verwenden, um Waren im Supermarkt abzuholen, und flexible Operationen wie das Falten von Kleidung abzuschließen; nach dem Austausch des Roboterkörpers kann er auch neue Aufgaben zum Transport von Kisten ausführen. Die Akkumulation von Modellen ist von den Einschränkungen von Hardware und Szenarien befreit, und diese umfassende Fähigkeitsübertragung ist in der Branche bisher das erste Mal.
„Galaxy Starboy“ ist außerdem mit dem von Galaxy General selbst entwickelten allgemeinen Kleinhirn-Basismodell AstraBrain-WBC ausgestattet. Es wird auf der Grundlage großer Mengen menschlicher Bewegungsdaten trainiert und kann die von AstraBrain-Agent generierten Absichten in stabile, zusammenhängende Körperbewegungen umwandeln. Das Modell verfügt auch über ausgezeichnete Generalisierungsfähigkeit, wenn es auf Bewegungen trifft, die im Training nicht aufgetaucht sind.
Tennis ist eines der Szenarien, das diese technischen Fähigkeiten am besten prüfen kann. Diese Sportart ist sehr wettbewerbsintensiv, und die Reaktionszeit, die dem Roboter bleibt, ist extrem kurz. Er muss nicht nur die Flugbahn des ankommenden Balls vorhersagen, sondern auch seine Position rechtzeitig anpassen und den Ball präzise schlagen, während er das Gleichgewicht hält. „Galaxy Starboy“ ist mit dem hochdynamischen Tennis-Kontrollrahmen LATENT von Galaxy General ausgestattet und kann in praktischen Demonstrationen bereits Bewegungen in Echtzeit an den von echten Personen kommenden Ball anpassen, um menschenähnliches Gegenspiel abzuschließen.
Von dem Folgen von Menschen bis zum unabhängigen Urteilen bildet die Industrie allmählich einen neuen Konsens: Die Obergrenze der Fähigkeiten eines humanoiden Roboters hängt zunehmend davon ab, wie viele neue Fähigkeiten das „Gehirn“ hinter ihm entwickeln kann. Je mehr Körper er betritt, desto reicher ist die Erfahrung, die er in der physischen Welt sammelt, und desto höher ist der Ausgangspunkt des nächsten Roboters.
Ein echter Test für ein Gehirn
Auf dem Stand von Galaxy General wird dieses „AstraBrain“ auch in verschiedene Aufgaben eingebracht, um geprüft zu werden.
Das eindrucksvollste vor Ort ist eine scheinbar gewöhnliche Frühstücksaufgabe: Der Roboter muss nacheinander Schritte wie das Abholen von Brot, das Eingießen von Wasser und das Anrichten von Tellern ausführen. Während der Ausführung treten oft zufällige Situationen auf, zum Beispiel wenn der Becher von Zuschauern weggenommen wird oder das Zielobjekt plötzlich verdeckt wird. Aber in der Demonstration vor Ort plant der Roboter neu basierend auf dem neuen Zustand vor seinen Augen und erledigt die verbleibende Arbeit mühelos.
Herkömmliche Roboter führen voreingestellte Abläufe in einer festen Umgebung aus. Sobald sich die Bedingungen eines Schritts ändern, wird die gesamte Aufgabe leicht unterbrochen, aber die reale Welt folgt selten streng dem im Voraus geschriebenen Drehbuch. Wenn eine Person am Tisch die Hand ausstreckt oder ein Becher vorübergehend verschoben wird, ändert sich alles, was der Roboter in der nächsten Sekunde tun soll.
Die Schwierigkeit langfristiger Aufgaben verbirgt sich in diesen vorübergehenden Änderungen. Je länger die Bewegung dauert, desto leichter beeinflussen die zuvor erzeugten Fehler die nachfolgenden Schritte. Der Roboter muss sein Verständnis für die Umgebung während der Ausführung ständig aktualisieren und gleichzeitig die Erinnerung an die gesamte Aufgabe behalten.
Ein weiteres schwieriges Szenario ist das Falten von Kleidung, was das Verständnis des großen Modells für verkörperte Intelligenz für flexible Objekte stark prüft. Kleidung hat keine feste Form. Jedes Mal, wenn der Roboter greift, ändern sich die Falten des Stoffes. Das Modell muss den aktuellen Zustand der Kleidung neu beurteilen und geeignete Greifpunkte suchen. Ob die Aufgabe fortgesetzt werden kann, hängt davon ab, ob das Modell das Urteil nach jedem Schritt aktualisieren kann.
Natürlich reicht für echte industrielle Szenarien eine einmal erfolgreiche Demonstration bei weitem nicht aus. Die Genauigkeit bei einer großen Anzahl von täglichen Wiederholungsarbeiten bestimmt, ob Kunden bereit sind, kontinuierlich für Roboter zu zahlen.
Galaxy General ist der Hersteller für verkörperte Intelligenz, der diese Frage am besten beantworten kann. Dieses Unternehmen hat seine Produkte bereits in großem Maßstab in intelligenten Apotheken und im Sofort-Einzelhandel eingesetzt. Roboter müssen das Ziel unter zehntausenden von Waren genau finden und es nach dem Greifen an den Lieferfahrer übergeben. Solche Aufgaben werden täglich viele Male wiederholt, und Genauigkeit, Betriebsstabilität und Fähigkeit zur Behandlung von Ausnahmen beeinflussen das Geschäft direkt.
In industriellen Szenarien erreicht die maximale Last des zwearmigen Galbot S1 von Galaxy General 50 Kilogramm und kann schwere Materialtransportaufgaben übernehmen. Nach der Erhöhung der Last muss der Roboter seine Körperhaltung und die Art der Kraftausübung neu anpassen und die Position der umgebenden Personen beurteilen, um die Sicherheit der Zusammenarbeit zu gewährleisten.
Roboter, die in verschiedenen Szenarien verwendet werden, haben unterschiedliche Formen, und die Probleme, mit denen sie konfrontiert sind, unterscheiden sich stark. Auf der einen Seite steht weiche, leicht verformbare Kleidung, auf der anderen Seite dichte Regale, auf der dritten Seite schwere Industriegüter. Sie teilen die technische Basis von AstraBrain und bestätigen auch die Generalisierungsfähigkeit von AstraBrain. Und genau das ist der Ausgangspunkt für die Allgemeingültigkeit des großen Modells für verkörperte Intelligenz.
Für Galaxy General hat der Einsatz von Modellen in der Industrie einen weiteren Wert. Intelligente Apotheken, Sofort-Einzelhandel und industrielle Produktionslinien erzeugen kontinuierlich echte Daten. Diese Daten zeichnen Probleme auf, die in Simulationsumgebungen schwer abzudecken sind, zum Beispiel Änderungen der Verpackungsmaterialien, Abweichungen, die durch den langfristigen Betrieb von Geräten entstehen, und zufällige Störungen durch Personal vor Ort. Nach einer neuen Trainingsrunde werden die aktualisierten Fähigkeiten wieder auf den Roboter übertragen.
Auf dem Forum kündigte Galaxy General außerdem an, Simulationsplattformen, Datenerfassungsgeräte, Basismodelle für verkörperte Intelligenz und Nachverarbeitungspipelines für verstärkendes Lernen für Technologieunternehmen und Industriepartner zu öffnen. Normale Entwickler können auch neue Bewegungen und Anwendungen rund um „Galaxy Starboy“ erstellen. Dies ist auch der notwendige Weg für das große Modell für verkörperte Intelligenz, zur Allgemeingültigkeit zu gelangen: Je offener das Ökosystem wird, je mehr Teilnehmer es gibt, desto reicher sind die realen Probleme, mit denen das große Modell in Kontakt kommt, und desto schneller beschleunigt sich die Evolutionsgeschwindigkeit des Modells.
Nur wenn das Modell in die reale Welt eintritt, werden die technischen Errungenschaften zu einer Produktivität, die kontinuierlich wachsen kann. Galaxy General hat auf dieser WRC bewiesen, dass AstraBrain diese Fähigkeit bereits besitzt.
Große Modelle für verkörperte Intelligenz sind die neue Wasserscheide
In den letzten Jahren lag das Rampenlicht der Branche der humanoiden Roboter meist auf dem Körper.
Unitree Robotics, das sich durch herausragende Leistungen in der Roboterbewegungssteuerung und Ingenieurskapazität auszeichnet, liefert mit seinem Börsendebüt am 19. August ein Beispiel. Am Eröffnungstag erzielte Unitree Robotics einen Anstieg von mehr als 629 %, und sein Marktwert erreichte zeitweise 444,9 Milliarden Yuan. Der Kapitalmarkt hat mit einem äußerst lebhaften Debüt einen hohen Preis für den kommerziellen Wert des Körpers humanoider Roboter gezahlt.
Dass Roboter schnell laufen, hoch springen und große Stöße aushalten können, ist in der Tat das intuitivste Maß für den technischen Fortschritt. Aber wenn Roboter in Apotheken, Supermärkte und Fabriken eintreten, kann ein Roboter, der sich nur „bewegen“ kann, die Anforderungen offensichtlich nicht mehr erfüllen. Er muss Anweisungen mit unklarer Bedeutung verstehen, Objekte verarbeiten, die im Training nicht gesehen wurden, und sich auch an das Gehen von Personen und das Verschieben von Objekten anpassen. Der Körper bestimmt, an welche Orte der Roboter gelangen kann, und das Gehirn bestimmt die Grenze seiner Fähigkeiten.
Daher sind große Modelle für verkörperte Intelligenz zu einer neuen Wasserscheide der Branche geworden.
Die Leistung des Roboterkörpers kann durch Lieferketten und Ingenieureinsätze beschleunigt verbessert werden, aber der Wachstumszyklus eines allgemeinen Gehirns ist oft länger. Es muss in einer großen Anzahl von Aufgaben physische Gesetze lernen und in reale Szenarien eintreten, um geprüft zu werden. Je reicher die Aufgaben sind, die das Modell durchläuft, desto mehr Erfahrungen kann es