GPT hat das „verkörperte Gehirn“ demontiert – wird Embodied PhyStack die nächste Etappe der verkörperten Intelligenz sein?
In den vergangenen zwei Jahren gehörte eine der besonders faszinierenden Geschichten im Bereich der Embodied Intelligence zweifellos zum Thema des „Gehirns“.
Aus Übersee: von der π-Serie von Physical Intelligence über Helix von Figure bis hin zu Gemini Robotics von Google DeepMind – eine Reihe von weltweit hochbeachteten Embodied-Brain-Modellen versuchen alle, visuelle Wahrnehmung, Sprache und Bewegungen in einen einzigen Lernrahmen zu integrieren.
Auch inländische Startups strömen in diese Richtung. Laut Daten von IT Juzi belief sich im ersten Halbjahr 2026 die Gesamtzahl der Finanzierungen im inländischen Embodied-Intelligence-Sektor auf 322 mit einem Gesamtwert von 935 Milliarden Yuan, was einem fünffachen Anstieg gegenüber dem gleichen Zeitraum 2025 entspricht. Mehr als die Hälfte des Kapitals floss in VLA-Modelle, Weltmodelle und Dateninfrastrukturen, sodass der technische Pfad „Gehirn – Kleinhirn – Körper“ zum Mainstream wurde.
Nach zwei Jahren der Entwicklung auf diesem Weg stellte die Branche jedoch fest, dass das „Gehirn“ nach wie vor ein extrem schwierig zu knackendes Problem darstellt. Am 3. September 2026 wurde jedoch GPT-6 Astra veröffentlicht, das neue Variablen für die Entwicklung der Embodied Intelligence brachte.
Die offizielle Positionierung von OpenAI für dieses Modell ist nach wie vor ein allgemeines Modell, das Roboter nicht direkt erwähnt. Als Forscher GPT-6 Astra jedoch an einen humanoiden Roboter anschlossen, löste dies sofort eine Begeisterung in der gesamten Embodied-Intelligence-Branche aus. In der Bewertungsarbeit *GPT-6 Astra as an Embodied Policy*, die am 12. September auf GitHub veröffentlicht wurde, übertraf GPT-6 Astra alle anderen Modelle mit einem überwältigenden Vorsprung und stieg direkt auf den ersten Platz der RoboDojo-Liste auf.
In *GPT-6 Astra as an Embodied Policy* belegt GPT-6 Astra in zehn Roboter-Tests einen deutlichen ersten Platz
Kommen die großen allgemeinen Modelle wirklich zurück an den „Haupttisch“ der Embodied Intelligence?
1. Große allgemeine Modelle: Zurück am „Haupttisch“
Um die Auswirkungen von GPT-6 Astra auf die gesamte Embodied-Intelligence-Branche wirklich zu verstehen, müssen zunächst zwei grundlegende Fragen geklärt werden: Was genau soll die Embodied Intelligence lösen? Und warum ist dies so schwierig?
Das ultimative Ziel der Embodied Intelligence ist immer der automatisierte Betrieb, also die Verwirklichung der „Autonomie“ von Robotern. Den Roboter in Bewegung zu setzen, ist nur der Ausgangspunkt dieses Pfades.
In den letzten mehr als zehn Jahren haben sich im gesamten Robotiksektor die Bereiche „Körper“ und „Steuerung“ am schnellsten entwickelt. Roboterarme lösten wiederholte Arbeiten in deterministischen Umgebungen, und fahrgestellbasierte Roboter erweiterten den Betriebsradius von einzelnen Arbeitsplätzen auf die gesamte Fabrikhalle… Die Vielfalt der Körperformen ermöglicht es Robotern, mehr Szenarien zu erreichen; die Verbesserung der Steuerungsfähigkeiten sorgt dafür, dass Roboter ihre Aufgaben in diesen Szenarien stabil erledigen können. Durch die Kombination beider Aspekte wurde der autonome Bereich von Robotern Schritt für Schritt erweitert.
Der autonome Bereich von fahrgestellbasierten Robotern und Roboterarmen hat jedoch eine Obergrenze – sie sind auf relativ strukturierte Umgebungen angewiesen. Unter allen Körperformen haben zweibeinige humanoide Roboter eine größere Chance, einen vollständigeren und breiteren autonomen Bereich zu erreichen. Denn die menschliche Umgebung ist von vornherein an die zweibeinige Form angepasst: Türgriffe, Treppen, Werkzeuge und Arbeitsplätze sind alle für Menschen konzipiert. Nachdem die Branche dies erkannt hat, wurden die Körper humanoider Roboter über viele Jahre hinweg stetig weiterentwickelt.
Auch die Steuerungsebene entwickelte sich parallel. Im Zeitalter der Embodied Intelligence förderten verstärkendes Lernen und Simulationstraining die Bewegungssteuerung humanoider Roboter. Gehen, Laufen, Treppen steigen und nach einem Sturz wieder aufstehen sind allmählich zu grundlegenden Fähigkeiten der Branche geworden. Geschickte Hände, Motoren, Untersetzungsgetriebe und Kraftsensoren werden weiter verbessert, und die Nutzbarkeit der Roboter-Körper steigt stetig an.
Die beiden Ebenen von Körper und Steuerung reifen allmählich heran. Doch die eigentliche Schwierigkeit tritt gleichzeitig zutage: Kognition und Entscheidungsfindung – also wie man Roboter dazu bringt, in offenen Umgebungen selbstständig zu beurteilen, was zu tun ist und wie es zu tun ist, oder anders ausgedrückt: Roboter mit einem „eigenen Verstand“ auszustatten.
Der zweibeinige humanoide Roboter PHYBOT C2 des inländischen, von Tsinghua-Universität-Alumni gegründeten Startups Dongyi Technology kann als typisches Beispiel betrachtet werden.
Ende 2025 erreichte das Team von Dongyi Technology weltweit als erstes die Fähigkeit, dass ein zweibeiniger humanoider Roboter autonom mit Menschen Badminton spielt; auf der diesjährigen Canton Fair im April spielte dieser 1,35 Meter hohe Roboter mit einem Schläger intelligent gegen Besucher vor Ort, beherrschte Vorhand, Rückhand und das Hochschlagen des Balls, ohne dass Ingenieure während des gesamten Prozesses eingreifen mussten.
(Der zweibeinige humanoide Roboter von Dongyi Technology spielt autonom Badminton mit Menschen)
Die Schwierigkeit, dass ein zweibeiniger humanoider Roboter autonom mit Menschen Badminton spielt, liegt in dem extrem engen Zeitfenster: Der Ball braucht normalerweise weniger als eine Sekunde, um vom Schläger des Gegners zum eigenen Treffpunkt zu gelangen. Der Roboter muss in dieser Zeit die gesamte Kette aus Beobachtung, Beurteilung, Schrittausführung, Schlägerführung und Balltreffer abschließen – jede Verzögerung in einem Glied führt zum Scheitern. Der Erfolg des PHYBOT C2 beweist eines: In einem geschlossenen Regelkreis im Bereich von mehreren zehn Millisekunden kann die Embodied Intelligence bereits durch ein End-to-End-Wahrnehmungs- und Entscheidungsmodell ohne Fernsteuerung und voreingestellte Programme hochdynamische Echtzeit-Interaktionen im autonomen Modus durchführen.
Gleichzeitig ist jedoch zu sehen, dass Badmintonspielen eine Aufgabe mit einem einzigen Ziel und geschlossenen Regeln ist, bei der der Roboter nicht überlegen muss, was er nach dem Spiel tun soll. Der PHYBOT C2 hat zwar einen Durchbruch im Bereich der Echtzeitentscheidungen humanoider Roboter geschafft, aber die Fähigkeiten der Embodied Intelligence zur Planung langfristiger Aufgaben und mehrerer Aufgaben wurden noch nicht durchbrochen. Letzteres erfordert ein Verständnis, das die physische Welt modellieren kann, sowie ein Verständnis, das menschliche Absichten und logische Abläufe erfassen kann.
Mit anderen Worten: Es ist wirklich sehr schwierig, Roboter mit einem „eigenen Verstand“ auszustatten.
In der frühen Phase des Booms großer Sprachmodelle (LLM) haben Forscher bereits versucht, große Sprachmodelle parallel auf Embodied-Intelligence-Roboter zu übertragen – leider waren die Ergebnisse sehr unbefriedigend. Beim Long-Act-Benchmark-Test, der speziell die Planungsautonomie bei langfristigen Haushaltsaufgaben untersucht, betrug die Zielerfüllungsrate von GPT-5 unter dem HoloMind-Framework 59%, die Erfolgsrate bei vollständigen Aufgaben lag nur bei 16%; bei Qwen3-VL-32B lagen die Werte bei 51,2% bzw. 15%. Die Erfolgsrate der menschlichen Probanden in derselben Gruppe betrug 93%.
Da der Weg über LLM nicht funktioniert, sind Ansätze wie VLA-Modelle und Weltmodelle allmählich zum „Liebling“ der Branche geworden. Daraus resultieren groß angelegte Datenerfassung, größere VLA-Modelle, größere Weltmodelle und leistungsfähigere Modellarchitekturen.
Es ist bemerkenswert, dass VLA-Modelle nicht später als LLM-Modelle aufgetaucht sind. Im Jahr 2023 kodierte Googles RT-2 Roboterbewegungen in Text-Token, sodass das Modell Bewegungen genauso generieren kann wie Text, und legte damit den Grundstein für den VLA-Pfad. Danach wurde das „Embodied Brain“ zu einem heißesten Thema unter dem Einfluss massiver Finanzierungen in der Branche. Einige Branchenvertreter scherzten sogar: „Ohne ein Basismodell traut man sich kaum noch, Roboter herzustellen.“
Nachdem das Geld investiert wurde, sind die Probleme jedoch nicht verschwunden. Bei der RoboDojo-Bewertung im Juli dieses Jahres lag die durchschnittliche Erfolgsrate von 30 gängigen Roboter-Richtlinien nur bei 12,8%, die offizielle Bewertung lautete „Die meisten sind noch am Fuß des Berges und gewöhnen sich an die Höhenkrankheit“. Das Problem der „Kamera-Basismodell-Kopplung“ bei VLA-Modellen wurde noch nicht gelöst: Bei einer geringfügigen Änderung der Kameraperspektive sinkt die Aufgabenerfolgsrate drastisch. Die Fähigkeiten zur Planung langfristiger Aufgaben und mehrerer Aufgaben sind noch schwieriger zu realisieren.
Vor diesem Zeitpunkt war die allgemeine Lösung in der Branche: Daten sammeln, noch mehr Daten sammeln, um durch das Scaling Law den Moment des „Emergenz der Intelligenz“ in der Embodied-Intelligence-Branche herbeizuführen.
Erst jetzt beginnen große Modelle, neue Möglichkeiten zu zeigen.
Am 3. September 2026 veröffentlichte OpenAI offiziell GPT-6 Astra. Laut offizieller Angabe ist es „auf komplexes Schlussfolgern, Softwareentwicklung, Computernutzung, wissenschaftliche Forschung und professionelle Dokumente ausgerichtet“, hat ein Kontextfenster von 1,05 Millionen Token und eine maximale Ausgabe von 128.000 Token. Im gesamten Veröffentlichungsbericht wird die Embodied Intelligence mit keinem Wort erwähnt.
In der offiziellen RoboDojo-Bewertung erzielte GPT-6 Astra in 42 Roboteraufgaben mit 2100 Tests eine durchschnittliche Erfolgsrate von 22,48% und 28,97 Punkte. Damit rangiert es höher als alle 40 zu diesem Zeitpunkt vorhandenen öffentlichen Roboterrichtlinien und auch höher als der vorherige öffentliche Spitzenreiter DM0.5 mit 19,34% und 24,90 Punkten.
2. Die Embodied Intelligence: Eine neue Ära bricht an
Eine bisher als „endgültig“ geltende Architekturannahme beginnt sich zu lockern.
In den letzten Jahren war die gängigste Einteilung der Branche die Struktur „Gehirn – Kleinhirn – Körper“: Die obere Ebene ist für Kognition und Entscheidungsfindung zuständig, die mittlere Ebene für Bewegungssteuerung und der Körper für die Ausführung. Mit dem Aufkommen von VLA-Modellen und Weltmodellen investierte die Branche enorme Ressourcen, um das „Gehirn“ alle Aufgaben übernehmen zu lassen: Es soll sowohl die Welt verstehen, Aufgaben zerlegen als auch den Körper direkt steuern.
Doch GPT-6 Astra zeigt eine neue Möglichkeit: Das große allgemeine Modell selbst kann den schwierigsten Teil des früheren „Gehirns“ übernehmen – das tiefe Denken.
Das Team von Dongyi Technology ist der Ansicht, dass Roboterunternehmen kein zentrales, allmächtiges „Gehirn“ mehr selbst entwickeln müssen. Das tiefe Denken kann an große allgemeine Modelle übergeben werden, und Roboterunternehmen müssen die Ebene des oberflächlichen Denkens und der Echtzeitentscheidungen ergänzen. Der zukünftige technische Stack der Embodied Intelligence kann sich von drei auf vier Ebenen erweitern: von oben nach unten das große allgemeine Modell, die physischen Agenten PhyAgents, das Bewegungssteuerungssystem PhyCore und der Roboter-Körper PHYBOT. Dongyi Technology nennt diesen Stack Embodied PhyStack.
Schematische Darstellung des Embodied PhyStack von Dongyi Technology
Erste Ebene: Das große allgemeine Modell. Es nimmt visuelle Eingaben entgegen, plant langfristige Aufgaben und mehrere Aufgaben, versteht durch tiefes Denken menschliche Absichten, zerlegt langfristige und mehrteilige Aufgaben in Aufgabenfolgen, beurteilt logische Abläufe und ruft dann die Fähigkeiten der physischen Agenten PhyAgents auf, um die Aufgaben zu lösen. Gleichzeitig wird das Problem der langsamen Antwort des großen Cloud-Modells durch PhyAgents kompensiert.
Zweite Ebene: Die physischen Agenten. Sie nehmen visuelle Eingaben entgegen, treffen Echtzeitentscheidungen, konzentrieren sich auf die End-to-End-VLA-Fähigkeit und übersetzen durch oberflächliches Denken die vom großen Modell zugewiesenen Unteraufgaben in Anweisungen, die der Roboter in Echtzeit ausführen kann.
Dritte Ebene: Das Bewegungssteuerungsmodell. Es nimmt die Wahrnehmung des Roboter-Körpers entgegen und steuert in Echtzeit – es entspricht dem „Kleinhirn“ des Menschen. PhyCore balanciert den Körper und treibt den Roboter-Körper an, die Ausführung abzuschließen, basierend auf den Aufgabenanweisungen von PhyAgents.
Vierte Ebene: Der Roboter-Körper. Er führt die Aufgaben durch und gibt basierend auf Veränderungen der realen Umgebung und des Körperzustands gezieltes Feedback an die oberen drei Ebenen, um Korrekturen, Neuplanung und erneute Ausführung zu ermöglichen: Probleme bei der Gleichgewichtssteuerung von Gang und Bewegung werden an PhyCore zurückgegeben; Feedback zu Umgebungsänderungen wird an PhyAgents übermittelt, um Echtzeitentscheidungen im Millisekundenbereich zu treffen; Der Gesamtausführungsrhythmus und die Erreichung der Fähigkeitsgrenzen gehen zurück auf die erste Ebene – Signale des Körpers bei Erreichen der Grenzen veranlassen das große allgemeine Modell zu einer Neuplanung.
Die Bedeutung des Embodied PhyStack liegt nicht nur in der zusätzlichen Ebene. Es teilt das „Embodied Brain“, das früher ein Unternehmen vollständig abdecken musste, in eine Arbeitsteilung zwischen großen allgemeinen Modellen und Rob