StartseiteArtikel

Kevin Kelly × Wang He: Humanoide Roboter treten in die Ära der Koordination von Großhirn und Kleinhirn ein

未来可栖2026-09-28 16:28
Chancen, Einschränkungen und Sicherheitsgrenzen

„Wenn man die Modelle betrachtet, kann man sagen, dass China und die USA jeweils ihre Stärken haben und sich aufeinander zubewegen. Chinas industrielles Ökosystem ist vollständiger, und die iterative Schleife einschließlich Modellen und Daten ist schneller; die USA sind bei der reinen Technik großer Modelle weiter fortgeschritten und können sogar einem Textmodell die Fähigkeit zur Verkörperung beibringen.“

Am 21. September äußerte Wang He, Gründer und CTO von Galaxy Universal, diese Ansicht auf dem Salon „Treffen auf dem Gipfel – Kevin Kelly im Gespräch mit neuen chinesischen Technologieakteuren“, der gemeinsam von 36Kr und Chenyuan 139 von Zhongjian Zhidi veranstaltet wurde.

Veranstaltungsort

Als er auf die spezifischen technischen Durchbrüche und Konzepte einging, bestätigte Kevin Kelly dies ebenfalls: „Das ist eure Mission.“ KK fügte hinzu, er könne sich vorstellen, dass China in KI-bezogenen Bereichen einschließlich verkörperter Roboter zu einem Vorreiter wird.

Der „AstraTennis-Moment“ der verkörperten Intelligenz

Das erste Mal, dass KI die Welt erschütterte, war im Jahr 2016. In diesem Jahr besiegte AlphaGo die besten menschlichen Spieler der Go-Szene und ließ die Welt zum ersten Mal die Stärke der künstlichen Intelligenz spüren. Das erschütterte auch Wang He, der zu dieser Zeit noch Student an der Tsinghua-Universität war. Aber er gab auch zu, dass er sich damals nicht vorstellen konnte, dass nur drei Jahre später das GPT-Paradigma auftauchen würde; und bis 2022 konnte ChatGPT die auf Go spezialisierte Intelligenz schnell zu einer allgemeinen Intelligenz ausweiten, die jede Sprache beherrscht.

Auf der Eröffnungszeremonie der Weltmeisterschaft für humanoide Roboter am 22. August stellte Galaxy Universal das weltweit erste End-to-End-Modell für humanoide Roboter für vollständig autonome Tenniswettkämpfe vor – AstraTennis. Mit einem spannenden Tennisduell zwischen Mensch und Roboter bewies es, dass verkörperte Intelligenz in einem physischen Realraum voller Unsicherheiten Wahrnehmung, Spieltheorie und Ausführung von Ganzkörperbewegungen abschließen kann.

Dazu bewertete der US-Investor Andrew Kang einmal: „AlphaGo für jede Sportart kommt.“

Wang He gab zu, dass er im Juni 2025, als das Team vorschlug, mit einem humanoiden Roboter vollständig autonom Tennis zu spielen, selbst skeptisch war – Tennis stellt extrem hohe Anforderungen an die Treffgenauigkeit, den Auftreffpunkt, die Laufbewegung und das Gleichgewicht. Bis kurz vor dem Frühlingsfest war das Training des Teams in der Simulationswelt abgeschlossen, und er beschloss, eine Woche lang einen echten Platz zu mieten, um die Ergebnisse zu überprüfen. „Schließlich hat der Forschungsfortschritt mein Verständnis erneut übertroffen: Er kann spielen.“

Wang He

Er erwähnte außerdem, dass Galaxy Universal neben der Ganzkörperbewegung auch die geschickte Handbedienung humanoider Roboter durchbrochen hat, was weltweit das erste Mal ist. „Hinter den ständigen Herausforderungen unterstützt uns der Optimismus, von dem Herr KK sprach.“

Zum Entwicklungsverlauf humanoider Roboter und verkörperter Intelligenz sagte Kevin Kelly außerdem: „Die Herstellung humanoider Roboter wird die komplexeste Veränderung sein, die wir je vollzogen haben. Es ist weitaus komplexer als die Luftfahrt oder Fabriken, hinzu kommen die Komplexität von Chips, die Komplexität und Empfindlichkeit der Hände sowie die Leistungs- und Rechenkapazitätssteuerung, die für ihren Betrieb erforderlich ist. Es ist das komplexeste Ding, das wir je gebaut haben. Deshalb ist es auch die schwierigste Maschine, die man gut herstellen kann.“

Und weltweit gehen die „Durchbrüche“ der verkörperten Intelligenz weiter.

Diesen September veröffentlichte OpenAI sein Flaggschiffmodell GPT-6 Astra, das offiziell als „das bisher intelligenteste und am besten ausgerichtete“ Modell bezeichnet wird.

Das Team von Galaxy Universal stellte durch Bewertungen fest, dass GPT-6 Astra bei verkörperten Aufgaben starke Schlussfolgerungsfähigkeiten zeigt. In dem durchgeführten RoboDojo-Experiment erreichte GPT-6 Astra+π0,5 einen durchschnittlichen Wert von 62,6 Punkten bei zehn Aufgaben, fast doppelt so viel wie der Zweitplatzierte. In einem weiteren RoboLab-Experiment betrug die Erfolgsrate von GPT-6 Astra Direct bei 50 Versuchen 98 %; die Erfolgsrate von Astra+π0,5 lag bei 92 %. Dagegen erreichten π0,5, DreamZero und andere in derselben Statistik weniger als 40 %.

„Astra ist das erste Modell der GPT-Serie, das Fähigkeiten zur Verkörperung zeigt. Seine verkörperten Fähigkeiten sind sehr stark und sehr „geschickt“ – ohne spezielles Training kann man es direkt mit Sprachbefehlen anweisen, Aufgaben auszuführen. Zum Beispiel kann man es zufällig anweisen, einen Turm aus Holzblöcken und Holzplatten zu bauen. Man kann sehen, dass GPT-6 Astra ständig darüber nachdenkt, was in jedem Schritt zu tun ist, und entscheidet, ob es das verkörperte Modell π0,5 aufruft oder die Aufgabe selbst erledigt. Eine solche völlig untrainierte Aufgabe kann es beim ersten Mal erledigen. Bei allen derartigen Aufgaben liegt die Erfolgsrate über 60 %, während die besten früheren Modelle nur etwa 10 % erreichten. Das ist die Bedeutung dieses Durchbruchs“, bewertete Wang He.

Das wirklich Starke an GPT-6 Astra ist nicht nur, dass es „versteht“, sondern auch, dass es erkennen kann, „was falsch ist“. Zum Beispiel im Experiment: Wenn es feststellt, dass die Greifhaltung nicht ideal ist, ändert es die Annäherungsweise; während des Verpackens kann es erkennen, dass sich hinter dem Kasten noch übersehene Objekte befinden... Das zeigt, dass GPT-6 Astra nicht mechanisch eine zuvor generierte Bahn ausführt, sondern eine geschlossene Schleife aus „Beobachten – Entscheiden – Ausführen – Wiederbeobachten“ bildet.

Die Koordination von Groß- und Kleinhirn bei Robotern realisieren

„Digitale Intelligenz ist eine Art von knowledge smart, während Roboterintelligenz eine Art von intuitiver Intelligenz ist. Der Großteil des menschlichen Denkens und Überlegens gehört zum langsamen System im Gehirn, dem slow system. Die menschliche Bedienung gehört dagegen zum schnellen System in unserem Gehirn, dem System eins. Ein solches schnelles System erfordert viel Übung, um diese Fähigkeit zu einer angeborenen, unbewussten Reaktion zu machen. Große Modelle können mit sehr komplexen Ketten von Gedanken, den sogenannten chain of thought, eine völlig andere Art von Intelligenz bilden.

Zu den nächsten Schritten sagte Wang He: „Auf diesem Weg hoffen wir, Schritt für Schritt ein System aufzubauen, das wie ein Mensch Großhirn, Kleinhirn und Brücke des Gehirns vollständig verbindet, das sowohl über hochgradige Urteilsfähigkeit als auch über niedriggradige menschenähnliche, bionische Gehirnsysteme verfügt, damit unsere humanoiden Roboter wirklich Intelligenz besitzen.“

Im Hinblick auf den technischen Weg stellte Wang He zwei Pfade für große Modelle der Verkörperung vor: Googles VLA (Vision Language Action) betont, dass jede Datenausgabe eine Roboteraktion sein muss; OpenAIs World Model ist allgemeiner, aber die Daten enthalten nicht unbedingt Roboteraktionen. Galaxy Universal hat als Erster beide kombiniert und das World Action Model (WAM) vorgeschlagen – es kann sowohl die Zukunft vorhersagen als auch Aktionen vorhersagen. Dieser technische Weg wird heute in der akademischen Welt weithin anerkannt.

Unter der Unterstützung des allgemeinen Gehirns WAM absolvierte der Roboter von Galaxy Universal bei der Weltmeisterschaft für humanoide Roboter eine 30-minütige vollständige Herausforderung für Haushaltsarbeiten, die den gesamten Ablauf von Gegenstandsordnung, Müllbeseitigung, Wäschewaschen, Trocknen und Falten abdeckte. Unterwegs konnte er auch auf plötzliche Anweisungen wie das Abholen von Paketen reagieren und gewann schließlich fast mit voller Punktzahl die Goldmedaille des Wettbewerbs.

Wang He

Neben dem Großhirnmodell verdient auch das Kleinhirnmodell von Galaxy Universal Aufmerksamkeit. Wang He sagte: „Früher musste man für das Tanzen von Robotern zuvor menschliche Bewegungsbahnen auf den Roboter übertragen, sie einstellen und dann einsetzen. Jetzt kann unser allgemeines Kleinhirnmodell erreichen, dass der Mensch einen Tanz einmal tanzt und der Roboter ihn sofort nachtanzt. Diese hinterlegte Intelligenz übertrifft sogar die Fähigkeit des Menschen, Körperbewegungen zu beherrschen – es ist wirklich ein allgemeines Kleinhirnmodell, das mit 2 Milliarden Frames menschlicher Bewegungsdaten trainiert wurde.“

Zu diesen Durchbrüchen sagte Kevin Kelly: „Der nächste große Durchbruch wird sein, Roboter wirklich arbeiten zu lassen. Was wir ständig tun, wird enorme Auswirkungen haben. Das ist genau der aufregende Teil.“

Mit Blick auf die Zukunft sagte Wang He: „Wir werden unseren Roboter-Körper, das Groß- und Kleinhirn, die Datenplattform sowie die gesamte Werkzeugkette für Training und Bereitstellung zu einer Infrastruktur aus vier Komponenten ausbauen, die für die gesamte Branche offen ist. Jeder kann dann mit einem sehr einfachen Prozess zur Datenerfassung und Nachbearbeitung Roboter unterrichten. Zu diesem Zeitpunkt werden humanoide Roboter als Produktiv- und Dienstleistungskraft in alle Branchen und Bereiche einziehen.“

Wesen und Sicherheitsgrenzen von Robotern – sie sind Partner, keine Ersetzer

Mit der Entwicklung von intelligenten Agenten werden in Zukunft immer mehr Roboter in der physischen Welt in die Gesellschaft und in Haushalte als menschliche Lebensbereiche eintreten. Wie können Menschen dann die Sicherheitsgrenzen zwischen Mensch und Roboter einhalten? Wird der viel diskutierte „KI-Killer“ Realität werden?

Zum Verhältnis zwischen beiden vertritt Kevin Kelly die Ansicht: „Wenn wir KI einen Körper geben – also Roboter – müssen wir verstehen: Sie sind nicht wie wir, sie sind keine Menschen. Und dass sie nicht wie Menschen sind, ist kein Mangel, sondern genau ihr größter Vorteil. Meiner Meinung nach sind diese intelligenten Träger mit physischem Körper wertvolle Ressourcen mit niedrigen Kosten. Denn es gibt viele intellektuelle Probleme, die Menschen allein nicht lösen können und auch KI allein nicht lösen kann, aber wenn KI und Menschen zusammenarbeiten, geht es. Menschen und Roboter stehen in einer solchen Partnerschaft zueinander.“

Veranstaltungsort

Wang He stimmte der Ansicht von Kevin Kelly zu: „Das Wesen von Robotern ist KI, sie sind keine Menschen. Deshalb bin ich für die Zukunft von Robotern ziemlich optimistisch: Sie werden Partner der Menschen sein, keine Ersetzer oder Gegner der Menschen.“

Wie steht es dann um das Sicherheitsproblem, wenn Roboter in den Alltag der Menschen eintreten? Wang He führte die bereits eingesetzten Apothekenroboter als Beispiel an: In deterministischen abgeschlossenen Szenarien wie Fabriken und Apotheken sind Rechte und Pflichten relativ klar. Galaxy Universal hat im Inland fast hundert Roboter-Apothenstandorte in Betrieb genommen, die die Arbeit der Medikamentenausgabe in der Nacht übernehmen. Um das Risiko falsch ausgegebener Medikamente zu vermeiden, verlässt sich das Team nicht vollständig auf die allgemeine Schlussfolgerungsfähigkeit großer Modelle, sondern fügt zusätzliche deterministische Prüfprogramme hinzu: Medikamente dürfen erst nach dreifacher Überprüfung von Text, Bild und Barcode verpackt und ausgeliefert werden. In den letzten anderthalb Jahren wurden fast eine Million Medikamentenpackungen verarbeitet, ohne dass ein einziges falsch ausgegeben wurde. In solchen Szenarien liegt die Verantwortung für durch Roboterausfälle verursachte Verluste beim Hersteller.

Kevin Kelly vertritt die Ansicht, dass KI-Unternehmen kurzfristig entsprechende Verantwortung übernehmen müssen und auch Mechanismen wie Versicherungen einrichten können. Umgekehrt werden die KI-Unternehmen, die überleben können, definitiv diejenigen sein, die das Verantwortungsproblem gut lösen können.

Gleichzeitig wies Wang He darauf hin, dass in vollständig offenen, komplexen Szenarien wie Haushalten unvorhersehbare Störfaktoren vorhanden sind und die Risikokomplexität sich vervielfacht. „Zum Beispiel, wenn niemand zu Hause ist und der Roboter Wasser umstößt, Wassertropfen in die Steckdose gelangen, einen Kurzschluss und Brand verursachen – und er das nicht selbst beseitigen kann. Er ist gefährlicher als Katzen oder Hunde, weil er Stecker einstecken und alle Dinge in deinem Haus bewegen kann. Wenn so etwas in der Zukunft auftaucht, stimme ich der Aussage von Herrn KK sehr zu: Ich glaube, dass wir bis dahin vielleicht ein System nutzen werden, um die Sicherheit zu gewährleisten.“