StartseiteArtikel

In der Simulation funktioniert alles reibungslos und fließend, während es in der realen Welt ständig zu ungewollten Fehlgriffen kommt: DreamSpace ergänzt die verkörperte KI um einen „Physikkurs“, sodass Roboter von der bloßen Nachahmung zu eigenem Verständnis übergehen.

氪报2026-09-29 10:23
Dream Space hat zwei KI-Produkte im Bereich der physikalischen KI auf den Markt gebracht, und Sunwise Technology hat die Seed-Finanzierungsrunde exklusiv gezeichnet.

Mit exklusiver Unterstützung in der Seed-Runde durch Suochen Technology veröffentlicht Meimeng Space duale Kernprodukte im Bereich physikalischer KI und treibt die praktische Implementierung industrieller Serviceroboter voran

Wenn ein menschliches Baby lernt, einen Becher zu greifen, ist dies das Ergebnis unzähliger realer physikalischer Rückmeldungen wie „nicht fest genug gehalten, heruntergefallen, noch einmal versuchen“. Heutige Roboter verhalten sich genau umgekehrt: Sie haben Zehntausende Greifvideos gelernt, agieren in Simulationsumgebungen mühelos, rutschen aber in der realen Welt ständig mit ihren Händen ab. Die gesamte Branche fragt sich: Was genau behindert die großflächige Umsetzung der Embodied Intelligence? Die Wahrheit ist, dass fast alle Roboter vor der physischen Welt eine „Prüfung ohne jegliche Vorbereitung“ ablegen müssen.

Auf der 5. Globalen Messe für Digitalen Handel hat die Hangzhou Meimeng Space Technology Co., Ltd. (Memo) der Embodied Intelligence diese „Physikstunde“ nachgeholt. Es gibt zwei Lehrmittel: das weltweit erste Physical-WAM (Physikalisch-Welt-Handlungsmodell) mit physischer Wahrnehmungsfähigkeit sowie den branchenweit ersten Bewertungsmaßstab RoboTwin-phys für physikalische Drift – einer davon sorgt dafür, dass Roboter „Physik verstehen“ und über menschliche Vorhersagefähigkeiten verfügen, der andere überprüft, ob sie es wirklich „verstanden“ haben.

Meimeng Space konzentriert sich auf die Forschung, Entwicklung und Anwendung von Weltmodellen. Es wurde vom AVS-Forschungszentrum für fortschrittliche visuelle Systeme ausgebrütet, das von Akademiker WEN Gao vom Advanced Institute of Information Technology der Peking University geleitet wird. Das Kernteam verfügt über umfangreiche Forschungserfahrungen in den Bereichen Embodied Intelligence, Videocodierung und -decodierung, räumliche Berechnung und künstliche Intelligenz und kombiniert akademische Tiefe mit praktischer Umsetzungskompetenz im Ingenieurwesen. Im August 2026 schloss Suochen Technology (688507.SH), ein führendes Unternehmen im Bereich physikalischer KI, eine exklusive strategische Investition in der Seed-Runde in Meimeng Space ab. Beide Seiten arbeiten auf technischer Ebene bei Daten, Rechenleistung, physikalischer KI und anderen Bereichen eng zusammen, um gemeinsam die Entwicklung von Weltmodellen und deren industrielle Umsetzung voranzutreiben. Und Physical-WAM sowie RoboTwin-Phys sind genau das neue Ergebnis, das die beiden Seiten gemeinsam der Branche vorlegen.

Datendefizit im Umfang von Zehntausendfachen: Die „Bildung für alle“ der Embodied Intelligence stößt auf Schwierigkeiten

Das Jahr 2026 für Embodied Intelligence ist extrem heiß. Im ersten Halbjahr erreichte die gesamte Finanzierungssumme im inländischen Bereich der Embodied Intelligence 935 Milliarden Yuan, was einem Anstieg von etwa dem 5-fachen gegenüber dem Vorjahreszeitraum entspricht; die Auslieferung von humanoiden Robotern überstieg 40.000 Einheiten und machte damit etwa 97 % des globalen Marktes aus. China ist bereits zu einer wichtigen Säule für die Herstellung und Auslieferung humanoider Roboter weltweit geworden.

Auf der anderen Seite dieser Begeisterung steht das immer noch ungelöste Phänomen „heiße Kapitalströme, schwierige praktische Umsetzung“. Ein Investor sagte offen: „Die Auftragskurve kann nicht mit der Finanzierungskurve Schritt halten.“

LI Minghao, CEO von Meimeng Space, hielt bei der Veranstaltung zur Governance und Marktisierung von Datenelementen im Rahmen der Messe für digitalen Handel einen thematischen Vortrag mit dem Titel *Physical-WAM: Ein physikalisches Welt-Handlungsmodell, trainiert auf Basis beobachtbarer Daten und tiefer physikalischer Daten*, und erläuterte die Ursachen dieses Problems sehr klar: Der Mangel an grundlegendem Verständnis der Roboter für die physische Welt ist das Ergebnis einer Überlagerung zweier Schwierigkeiten.

Die erste Schwierigkeit ergibt sich aus der Datenkluft. Der Bestand an echten physischen Interaktionsproben von Robotern beträgt nur Daten im Millionenbereich, was im Vergleich zu Trainingsmaterialien im Bereich von mehreren Milliarden wie Text, Bildern und Videos eine riesige Lücke von fast Zehntausendfachen darstellt. Die Erfassung physischer Interaktionsproben durch echte Roboter ist mit hohen Kosten verbunden. Die überwiegende Mehrheit der Modelle kann nur die Abbildung zwischen visuellen Bildern und Aktionen lernen, ähnlich wie Schüler, die nur „auswendig lernen“: Sie imitieren im Wesentlichen nur gesehene Aktionen, verstehen aber nicht die dahinter stehenden physikalischen Gesetze.

Die zweite Schwierigkeit ist das Fehlen eines Bewertungsmaßstabs. Die meisten vorhandenen Bewertungssysteme konzentrieren sich nur auf den Abschlussgrad von Aufgaben auf visueller Ebene und ignorieren unsichtbare physikalische Variablen wie Reibung, Masse und Steifigkeit. Zum Beispiel kippt ein Gefäß mit hoher Reibung bei gleicher Schubkraft an Ort und Stelle um, während ein Gefäß mit niedriger Reibung direkt wegrutscht; wenn man ein Nudelholz an derselben Stelle greift, führt eine Verlagerung des Schwerpunkts zu einer Schwingung des Stabes. Diese in der realen Welt allgegenwärtigen „physikalischen Driften“ lassen sich in herkömmlichen Bewertungen nur schwer wirksam überprüfen. Wenn eine Fähigkeit nicht gemessen werden kann, verliert die iterative Optimierung des Modells ihren Ankerpunkt.

Auf die beiden Schwierigkeiten gibt es zwei entsprechende Antworten. Die Lösung von Meimeng Space ist eine völlig neue technische Architektur.

Physical-WAM: Lässt die Embodied Intelligence von der „Nachahmung“ zum „Verständnis“ übergehen

Physical-WAM ist die erste Antwort von Meimeng Space. Als branchenweit erstes WAM-Basismodell mit physischer Wahrnehmungsfähigkeit wird es auf Basis von beobachtbaren Daten und tiefen physikalischen Daten trainiert. Der entscheidende Unterschied zu herkömmlichen Modellen besteht darin: Herkömmliche Modelle können die Entwicklung der physischen Welt ableiten, können aber die Physik an sich nicht wahrnehmen – sie wissen, „wie das Bild im nächsten Frame aussehen wird“, wissen aber nicht, „warum es so aussieht“. Physical-WAM hingegen kann in realen Aufgaben physikalische Veränderungen in Echtzeit erkennen, die Folgen von Aktionen vorhersagen und das Verhalten in Echtzeit korrigieren.

Diese Fähigkeitsarchitektur wird durch die Zusammenarbeit von drei Modulen realisiert. PhysLens fungiert als „physikalischer Übersetzer“, extrahiert nicht direkt beobachtbare physikalische Informationen wie Reibung, Gewicht, Schwerpunkt und Kontaktzustand aus multimodalen Wahrnehmungssignalen und gibt eine einheitliche physikalische Token-Repräsentation aus; PhysDream ist der „physikalische Prophet“, der die zukünftigen Veränderungen des physikalischen Zustands kombiniert mit der aktuellen physikalischen Repräsentation, dem Umgebungszustand und den Kandidatenaktionen ableitet, Risiken wie Ausrutschen und Loslassen vorhersagt und eine Unsicherheitsbewertung liefert; schließlich ist PhysAct für die Ausgabe physikalisch bedingter Aktionen verantwortlich, führt physikalische Eigenschaften und Vorhersagen des zukünftigen Zustands in die Aktionsgenerierung ein und passt die Ausführungsstrategie automatisch an, wenn in der Umgebung physikalische Driften auftreten.

Diese drei Komponenten bilden einen vollständigen geschlossenen Kreislauf aus „Wahrnehmung → Vorhersage → Generierung → Korrektur“. Ein anschauliches Beispiel: Wenn ein Roboter einen Pappbecher greift, erkennt PhysLens die geringe Steifigkeit des Materials des Pappbechers, PhysDream sagt voraus, dass die Erhöhung der Last nach dem Einfüllen von Wasser zu einer Verformung der Becherwand oder zum Verrutschen führen kann, und PhysAct passt die Greifkraft und die Kontaktposition entsprechend an und korrigiert die Strategie während des Einfüllvorgangs kontinuierlich, bis die Operation abgeschlossen ist. Dies ist keine einfache Wiedergabe von Aktionen mehr, sondern reagiert flexibel wie ein Mensch mit „physikalischer Intuition“.

RoboTwin-Phys: Schafft einen Maßstab für „physikalische Intelligenz“

Neben dem Modell ist der zweite Vorschlag von Meimeng Space ein Bewertungsmaßstab.

Dieser Bewertungsmaßstab folgt einer dreistufigen fortschreitenden Logik: Wie genau ist die Schlussfolgerung über physikalische Eigenschaften, werden Aufgaben unter physikalischen Störungen noch abgeschlossen, und wo liegt die Obergrenze der Leistungsunterschiede? Er fügt auf der Grundlage von RoboTwin 13 Arten von in der realen Welt häufigen physikalischen Störfaktoren hinzu und unterstützt Bewertungen von einseitigen Störungen bis hin zu kombinierten Störungen mehrerer Faktoren in fünf Dimensionen: Objekteigenschaften, Kontakteigenschaften, Dämpfung, Aufgabenumgebung und Kamerakonfiguration. Sein zentraler Wert liegt darin, abstrakte physikalische Parameter in der Realität in steuerbare, markierbare und reproduzierbare Variablen umzuwandeln, sodass „physikalische Intelligenz“ einen quantifizierbaren Maßstab erhält.

Wie weit ist der „GPT-Moment“ der Embodied Intelligence noch entfernt?

Die Embodied Intelligence und die Weltmodelle haben noch keinen dem „GPT-Moment“ der großen Sprachmodelle vergleichbaren Punkt erreicht.

WANG Xingxing, Gründer von Unitree Robotics, hat einmal einen Maßstab vorgelegt: Wenn ein Roboter in eine beliebige unbekannte Umgebung gebracht wird und etwa 80 % der Aufgaben durch Sprach- oder Textanweisungen selbstständig erledigen kann, erreicht die Branche den kritischen Punkt des explosionsartigen Wachstums. „Im besten Fall dauert es 2 bis 3 Jahre, im schlechtesten Fall 5 oder sogar 10 Jahre.“ Der Koordinatensystem von WANG He, Gründer von Galaxy Universal, ist noch direkter: Die heutigen großen Embodied-Modelle befinden sich etwa auf dem Niveau von GPT-2, und es wird voraussichtlich bis 2028 dauern, bis sie die Schwelle von GPT-3.5 bis GPT-4 erreichen.

Hinter den unterschiedlichen Zeitplänen steht dieselbe Lücke. Branchenexperten weisen darauf hin, dass die derzeitigen Arten von Weltmodellen noch einen großen Abstand zu Basismodellen haben, die die reale physische Welt wirklich verstehen, vorhersagen und mit ihr interagieren können. Mit anderen Worten: Die Entfernung zum „GPT-Moment“ ist weitgehend die Entfernung zwischen dem Modell und der physischen Welt.

Derzeit haben sich die Weltmodelle in der Branche allmählich in vier Kategorien unterteilt: Repräsentative Weltmodelle konzentrieren sich auf die abstrakte Ableitung der Welt, generative Weltmodelle auf die pixelgenaue Wiedergabe der Welt, interaktive Weltmodelle auf die dreidimensionale interaktive Simulation der Welt, und integrierte Weltmodelle für Verständnis, Generierung und Vorhersage konzentrieren sich auf die Generierung von physikalischem Wissen, um die freie Steuerung des körperlichen Subjekts zu realisieren.

Meimeng Space verfolgt den Weg der „Integration von Verständnis, Generierung und Vorhersage“. Die Ableitung der Welt ist nur ein Mittel, das Ziel ist es, Roboter wie Menschen die physische Welt verstehen zu lassen und ihre Aktionsstrategien in Echtzeit anzupassen. Derzeit hat das Unternehmen ein dreifaches industrielles kooperatives Ökosystem aus „Daten – Modell – Bewertung“ aufgebaut. Aus der Sicht des Tempos der industriellen Umsetzung ist es zu erwarten, dass es als Erster in Szenarien wie industriellen Operationen, Logistiktransporten und Servicerobotern die gemeinsame Überprüfung von physikalischen Daten, Modellfähigkeiten und realen Szenarien erforschen wird.

Im nächsten Schritt wird Meimeng Space entlang der Linie „zuerst visuell, dann schrittweise durch Kraft, Berührung und Ton“ die multimodalen physikalischen Repräsentationsmodelle kontinuierlich weiterentwickeln, den Datensatz für physische Interaktionen erweitern, die Inferenzverzögerung des Modells und die Anpassungsfähigkeit an mehrere Subjekte optimieren und gemeinsam mit den Partnern entlang der Industriekette die drei Puzzleteile physikalische Daten, Weltmodelle und Bewertungsstandards ergänzen.

„Nur wenn Roboter die physische Welt wirklich verstehen, kann Embodied Intelligence in großem Umfang von Laboren in reale industrielle Szenarien gelangen“, sagte LI Minghao. Meimeng Space wird mit einer offenen und quelloffenen Haltung die Branche dabei unterstützen, schneller den „GPT-Moment“ der Embodied Intelligence zu erreichen.