StartseiteArtikel

Das gesamte Embodied Best Paper Team tritt geschlossen an, um das integrierte Gehirnmodell mit kombinierter Wahrnehmungs- und Steuerungsfunktion zu meistern.

周谣2026-08-18 10:36
Verkörperte Intelligenz, jetzt sind die Erstautoren der Forschungspapiere an der Reihe, selbst mitzumischen.

Ein Kart, etwas, das selbst Menschen nicht unbedingt gut fahren können, wurde tatsächlich von einem zweibeinigen humanoiden Roboter gemeistert??

Von dem Moment an, in dem er „zum Fahrzeug geht“ und „sich im Fahrzeug hinsetzt“, sieht der Roboter selbst den Weg, lenkt selbst und betätigt das Gaspedal.

Der rechte Fuß steuert die Kraft, beide Hände korrigieren ständig die Fahrtrichtung, das visuelle System erkennt Veränderungen der Rennstrecke, während er ständig seinen Schwerpunkt anpassen muss, um das Gleichgewicht des gesamten Körpers zu wahren.

Unglaublich, umfassende Gleichgewichtssteuerung, Koordination von Hand, Auge, Fuß, Gehirn und ganzem Körper, ein äußerst präzises Niveau der Kraftsteuerung – all das besitzt dieser Roboter.

Das Unternehmen, das diese Lösung vorgelegt hat, Synergy Zhixing, ist seit seiner Gründung erst etwas mehr als einen Monat alt.

Das Erstaunlichste aber ist, dass dieser zweibeinige humanoide Roboter im Video eine branchenführende originale End-to-End-Lösung für die integrierte Wahrnehmungs- und Steuerungstechnik verwendet. Er löst das bestehende Widerspruch der Trennung von „Gehirn + Kleinhirn“ in der aktuellen Mainstream-Embodied-Intelligence-Technik: Wahrnehmung, Entscheidungsfindung und Bewegungssteuerung werden nicht mehr in mehrere relativ unabhängige Module aufgeteilt, sondern ein einziges Modell gibt vom Erkennen der Umgebung bis zur endgültigen Aktion des Roboters alle Ausgaben direkt aus.

Man muss wissen, dass End-to-End und Whole-Body Intelligence die technischen Pfade sind, die im akademischen Bereich der Embodied Intelligence im Jahr 2026 die größte Aufmerksamkeit erhalten. Selbst weltweit führende Labore und Unternehmen haben kaum entsprechende Ergebnisse vorgelegt – und das wurde tatsächlich von einem jungen chinesischen Unternehmen, das vor weniger als zwei Monaten gegründet wurde, so praxisnah umgesetzt?

Wer ist Synergy Zhixing eigentlich?

01. Das „Top-Team“ mit Best Papers im Bereich Embodied Intelligence

Synergy Zhixing wurde Ende Juni dieses Jahres gegründet, also vor weniger als 60 Tagen.

Wenn das erste „unvorstellbare“ Merkmal dieses Unternehmens darin besteht, dass es schon nach etwas mehr als einem Monat Gründung branchenführende Ergebnisse für ein integriertes Gehirnmodell zur Wahrnehmung und Steuerung vorgelegt hat, dann ist das zweite „unvorstellbare“ Merkmal sein Gründerteam.

Das Gründerteam von Synergy Zhixing ist praktisch ein junges Top-Team, das zahlreiche Best Papers im Bereich Embodied Intelligence veröffentlicht hat.

CEO Ding Pengxiang, Jahrgang 1995, promoviert an der Zhejiang-Universität und der Westlake-Universität unter der Anleitung von Professor Wang Donglin. Er arbeitet tief im Bereich der Embodied Intelligence und hat eine Reihe von glänzenden Erfolgen vorzuweisen, die als „Traumkarriere in der Forschungswelt“ gelten:

Er ist Erstautor des weltweit ersten vierbeinigen VLA (QUAR-VLA, ECCV 2024) und des ersten humanoiden VLA (Humanoid-VLA, Februar 2025), Kernautor von ReconVLA (AAAI 2026 Best Paper), Erstautor des leichtgewichtigen Benchmark-Modells VLA-Adapter mit 50 Millionen Parametern (die Anzahl der GitHub-Stars hat innerhalb einer Woche 1000 überschritten und liegt aktuell bei über 2000 – es ist das Open-Source-VLA-Projekt mit den meisten Stars in China und das fünfte VLA-Projekt weltweit mit über 1000 Stars), Gründer der Open-Source-Community OpenHelix Robotics für Embodied Intelligence (insgesamt über 5000 Stars) und einer der fünf am häufigsten zitierten Doktoranden für Embodied Intelligence in China.

Die anderen „hochbegabten Mitglieder“ im Kernteam stehen ihnen in nichts nach.

Jedes Teammitglied hat einen Doktortitel, ist im Jahr 2000 oder später geboren und hat Arbeiten auf Top-Konferenzen veröffentlicht. Es ist ein weltweit seltenes Team, das Basismodelle für vierbeinige Roboter, Roboterarme und humanoide Roboter entwickelt hat. Seine Ergebnisse umfassen:

• Den Erstautor einer CoRL-Arbeit, die Pi0.5 geschlagen hat und das erste Best Paper einer chinesischen Forschergruppe auf einer weltweit führenden Robotikkonferenz ist;

• Kandidat für das IJCNN Best Paper;

• Den Erstautor von HEX, der das erste übergreifende Whole-Body Manipulation Model für vollgroße zweibeinige humanoide Roboter vorgestellt hat;

• Den Erstautor von OpenWBC, einem der weltweit ersten quelloffenen Teleoperationssysteme für Humanoide;

• Den Erstautor von Loco-manipulation VLA Trajbooster, der große Aufmerksamkeit in der Branche erregt hat und die Effizienz der Datennutzung über unterschiedliche Roboterplattformen hinweg direkt deutlich verbessert …

Loco-manipulation, Vierbeiner, Roboterarme, Humanoide, WBC-Datenerfassung, Vortraining, Nachtraining, Bewegungssteuerung, übergreifende Nutzung über unterschiedliche Plattformen …

Ihre soliden Fähigkeiten und ihre fortschrittliche Forschung bedeuten praktisch, dass eine Gruppe von Autoren der bahnbrechendsten Doktorarbeiten für Embodied Intelligence in China der letzten zwei Jahre in einem einzigen Unternehmen zusammengekommen ist.

Entscheidender ist: Sie haben nicht einfach nur „ein paar Papers veröffentlicht“. Drei der fünf bahnbrechendsten Arbeiten im internationalen Bereich der Loco-Manipulation stammen von diesem Startup-Team mit weniger als 20 Mitarbeitern – die Dichte an Best-Paper-Autoren ist außergewöhnlich hoch.

Die jüngste Gruppe von „Erstautoren von Forschungspapieren“ im Bereich der chinesischen Embodied Intelligence beginnt, gemeinsam in die Praxis umzusetzen.

Interessanterweise werden Menschen, die den Bereich der Embodied Intelligence genau beobachten, feststellen, dass Synergy Zhixing kein Einzelfall ist.

In den letzten sechs Monaten findet im Bereich der Embodied Intelligence stillschweigend eine „große Verlagerung“ des Talentparadigmas statt. In den letzten zwei Jahren war das typische Gründungsparadigma für Embodied-Intelligence-Unternehmen in China, dass Professoren selbst Startups gründen. Universitätslabore sammeln mehrere Jahre lang technische Erfahrungen, der Professor wird zum technischen Aushängeschild des Unternehmens und bringt dann Doktoranden, Masterstudenten und Laborergebnisse in die Industrie. Viele bekannte Startup-Unternehmen für Embodied Intelligence sind nach diesem Pfad entstanden.

Aber seit 2026 entscheiden sich immer mehr junge Doktoranden, die direkt an der Spitzenforschung arbeiten, selbst Startups zu gründen.

Warum? Aus keinem anderen Grund: Die Technologie entwickelt sich zu schnell. Im Jahr 2023 diskutierte die Branche noch, ob Roboter überhaupt „Großmodelle“ benötigen; 2024 wurde VLA zum Kernkonzept; 2025 wurden duale Systemmodelle wie Figure Helix schnell populär; und 2026 diskutiert die gesamte Branche über „End-to-End“.

Das führt zu einer interessanten „Wissensumkehr“ in der heutigen Branche: Das topmoderne Verständnis der Embodied-Intelligence-Technik liegt nicht unbedingt bei den „erfahrenen“ Branchengrößen. Die Menschen, die als Erste das nächste technische Paradigma kennen, sind wahrscheinlich die Doktoranden an der Frontlinie, die täglich selbst Daten auswerten, Modelle anpassen und Roboter testen.

Welche Lösung nur auf Benchmark-Daten gut abschneidet und welche Methode am echten Roboter scheitert – um zu wissen, wohin die modernste Technik, die besten Talente und Ressourcen unter den aktuellen technischen Strömungen fließen, muss man die Doktoranden fragen, die das Modell gerade erfolgreich zum Laufen gebracht haben.

Diese Veränderung hat die Branche der großen Modelle schon einmal durchlebt. Liang Wenfeng, Gründer von DeepSeek, hat in einem Interview mit 36Kr das Profil seines Kernteams vorgestellt: „Es sind alles Absolventen von Top-Universitäten, Doktoranden im 4. oder 5. Jahr, die noch nicht abgeschlossen haben, und junge Menschen, die erst seit wenigen Jahren ihren Abschluss haben.“

Das gilt nicht nur für China, sondern auch für das Ausland.

Das gilt für große Modelle, und das gilt auch für Embodied Intelligence.

02. End-to-End: Das Endstadium der Embodied Intelligence

Ein Spitzenteam mit einem bahnbrechenden Personalaufbau bringt natürlich auch die bahnbrechendsten Ergebnisse hervor.

Wie bereits erwähnt, liegt die bahnbrechende Eigenschaft von Synergy Zhixing darin, dass es das aktuelle Mainstream- „schichtbasierte“ Konzept überwindet und sich direkt dem weltweiten schwierigen Problem der end-to-end integrierten Wahrnehmungs- und Steuerungstechnik widmet.

Um seine bahnbrechende Bedeutung zu verstehen, muss man zuerst wissen: In den letzten Jahren lag das Mainstream-Denkmodell für humanoide Roboter im Wesentlichen auf dem „schichtbasierten“ Prinzip, also „Gehirn + Kleinhirn“. Das obere Gehirn ist für Wahrnehmung, Verständnis und Planung zuständig, während das untere Kleinhirn die Bewegungssteuerung und das Gleichgewicht übernimmt.

Das Team von Synergy Zhixing gehört zu den ersten Gruppen in China, die diese Architektur vorgestellt haben, und hat bereits 2023 entsprechende Ergebnisse veröffentlicht.

In den letzten zwei Jahren sind aber die Probleme des „schichtbasierten Konzepts“ immer deutlicher geworden. Da zwischen oberer und unterer Schicht natürliche indirekte Kaskadenfehler bestehen, kann die Zuordnung zwischen Wahrnehmung und Steuerung nicht direkt hergestellt werden, und das „Gehirn“ erhält kaum Aktionsrückmeldungen vom „Kleinhirn“, was zu schlechten Aufgabenergebnissen führt.

Ein Vergleich mit Menschen: Wenn ein Mensch eine Tasse auffängt, die vom Tisch fällt, vollzieht er nicht zuerst das visuelle Verständnis, pausiert dann, um die Bewegungstrajektorie zu generieren, und ruft schließlich den Arm auf. Meistens lehnt sich der Körper schon nach vorne und streckt die Hand aus, sobald das Auge die fallende Tasse erkannt hat. Wahrnehmung, Aktion und Gleichgewicht sind eine einzige zusammenhängende Sache.

Bei zweibeinigen humanoiden Robotern ist dieses Problem noch ausgeprägter. Jede Bewegung des Arms, jede Drehung und jede Vorbeugung verändert den Körperschwerpunkt; die Änderung der Kontaktkraft an den Füßen beeinflusst wiederum die Bewegungen des Oberkörpers. Trennung von Ober- und Unterkörper, keine Steuerung des Unterkörpers und keine Kraftsteuerung durch die Aufgabenbedeutung, lange Wiederherstellungsketten nach Fehlern, Schwierigkeiten bei der Vereinheitlichung von Daten und Zielen …

Das ist auch der Grund, warum in den meisten aktuellen Demonstrationen von zweibeinigen humanoiden Robotern kaum Bewegungen zu sehen sind, die wie das „Kartfahren“ von Synergy Zhixing eine Koordination von Hand, Auge, Gehirn und ganzem Körper erfordern. Sie wollen das nicht nicht zeigen – sie können es nicht.

Die Branche hat dieses Problem bereits erkannt. Seit der zweiten Hälfte des Jahres 2025 sind „Whole-Body Intelligence“ und „End-to-End“ auf den Branchen-Top-Konferenzen als zukünftige Richtung anerkannt, aber bisher haben nur sehr wenige Unternehmen entsprechende praktische Ergebnisse vorgelegt.

Synergy Zhixing verfolgt genau diese Richtung.

Das DPC-Modell (Direct Perception Control Model) von Synergy Zhixing ist ein integriertes Basismodell für Loco-Manipulation-Wahrnehmung und Steuerung, das die Barriere zwischen „Gehirn + Kleinhirn“ des Roboters durchbricht und direkt end-to-end eine kooperative Steuerung des ganzen Körpers realisiert.

Es werden multimodale Wahrnehmungsdaten (visuelle Informationen, Sprache, Roboterstatus, physikalische Signale) als Eingabe verarbeitet. Nach der Verarbeitung durch das Unified Perception Control Model werden direkt Ganzkörperbewegungen mit Kraftrückmeldung aus visuellen Informationen, Sprache, Eigenwahrnehmung, historischen Rückmeldungen und Kontaktrückmeldungen generiert.

Am Ende können direkt die koordinierten Drehmomente aller Gelenke des ganzen Körpers ausgegeben werden – das zielt auf das „Endstadium“ des Bereichs der Interaction-Native Whole-Body Intelligence ab.

Besonders bemerkenswert ist, dass das Team von Synergy Zhixing als Erstes nachgewiesen hat, dass das Training mit multi-source heterogenen Daten das Skalieren von Ganzkörperdaten für humanoide Roboter effektiv ermöglicht. Sein eigenes vortrainierungsfreies Algorithmus braucht nur eine sehr geringe Menge an echten Daten, um komplexe kooperative Operationen des ganzen Körpers zu realisieren.

Im Vergleich zu herkömmlichen Lösungen kann das DPC-Modell von Synergy Zhixing die Wahrnehmungs- und Steuersignale von Gehirn und Kleinhirn gleichzeitig optimieren (die Koordination von Hand, Auge, Gehirn und ganzem Körper beim Kartfahren), was die nachgiebige Kraftsteuerungsfähigkeit des Roboters stark verbessert (der Betätigungsweg des Gaspedals und die Geschwindigkeit des Karts). Gleichzeitig kann dasselbe Basismodell universell für unterschiedliche Roboterplattformen und Konfigurationen angepasst werden und besitzt eine starke Null-Shot-Generalisierungsfähigkeit in realen Umgebungen.

Heute ist „End-to-End“ die anerkannte Spitzenrichtung der Embodied-Intelligence-Forschung und auch die 2026 in der Branche allgemein anerkannte Entwicklungsrichtung für das „nächste Generation Roboter-Gehirn“.

In den letzten zwei Jahren ist die WBC-Bewegungssteuerungstechnik ausgereift und verfügbar geworden, die Menge an nutzbaren Daten ist exponentiell angestiegen, und die Entwicklungsrichtung des integrierten VAM-Wahrnehmungs- und Entscheidungs-Basismodells hat sich stabilisiert. Die „drei großen Hindernisse“ vor dem integrierten Wahrnehmungs- und Steuerungsgehirn für Embodied Intelligence sind nach und nach beseitigt worden.

„Im Jahr 2026 sind alle drei Bedingungen gleichzeitig erfüllt. Jetzt gibt es ein Zeitfenster für die Entwicklung des end-to-end integrierten Wahrnehmungs- und Steuer