36Kr Exklusiv | Ein Team von Akademikern der Nanyang Technological University hat ein umfassendes System für verkörperte Intelligenz entwickelt und in der Seed-Runde eine von Tang Capital angeführte Finanzierung erhalten, an der sich zudem Woan Robot und Xuyuan Capital beteiligen.
Autor | Qiao Yujie
Redakteur | Yuan Silai
Laut Hard Krypton hat StarMeta, ein Anbieter von Embodied-Intelligence-Systemen für ganzheitliche Szenarien, kürzlich eine Seed-Finanzierungsrunde im Wert von mehreren zehn Millionen Yuan abgeschlossen. Die Runde wurde von Tongchuang Weiye angeführt, mit Beteiligung von Woan Robot – einem Hersteller von haushaltsüblichen embodied-intelligenten Robotern – und Xuyuan Capital. Derzeit zählen zu den Kunden die wichtigsten inländischen Hersteller von intelligenten Embodied-Intelligence-Produkten sowie Kunden aus Branchenszenarien wie Energie und Hochleistungsfertigung.
StarMeta wurde im Juli 2026 gegründet, von Dr. Wen Mingxing, dem geschäftsführenden Direktor des Innovationsforschungs- und Entwicklungszentrums für intelligente Wahrnehmung des Sino-Singapurischen Internationalen Verbundforschungsinstituts. Professor Wang Danwei, Akademiemitglied der Singapurischen Akademie der Ingenieurwissenschaften, übernimmt die Rolle des Chefwissenschaftlers. Die Kernmitglieder des Unternehmens stammen von der Nanyang Technological University in Singapur, der Harbin Institute of Technology, der Beijing Institute of Technology, der South China University of Technology sowie von Führungskräften inländischer börsennotierter Unternehmen.
Mit dem Übergang der embodied Intelligenz von Labor-Demos zu realen Szenarien verschiebt sich das Problem, mit dem Roboter konfrontiert sind, von „ob sie Aktionen ausführen können“ zu „ob sie in Umgebungen mit dynamischen, unsicheren und komplexen Betriebsbedingungen dauerhaft und stabil arbeiten können“. Lichtänderungen, bewegte Objekte, menschliche Störungen in der realen Umgebung sowie Faktoren wie Rauch, Staub und schwaches Licht stellen höhere Anforderungen an die Wahrnehmung, Entscheidungsfindung und Ausführungsfähigkeit von Robotern.
Auf politischer Ebene haben das Ministerium für Industrie und Informationstechnologie und das Ministerium für Notfallmanagement kürzlich gemeinsam den „15. Fünfjahresplan für die industrielle Entwicklung von Sicherheits- und Notfallausrüstung“ herausgegeben. Darin wird festgelegt, dass die industrielle Größe in Schlüsselbereichen bis 2030 1,4 Billionen Yuan erreichen soll, und die weitere Entwicklung von Sicherheits- und Notfallausrüstung in Richtung Hochwertigkeit und Intelligenz gefördert wird. Der Plan sieht vor, die Kerntechnologieforschung in Szenarien wie Chemie, Bergbau, Energiespeicherung, Waldbrände, Überschwemmungen, Erdbeben und extremen Notfallkommunikationssituationen zu verstärken, und die Integration von Spitzentechnologien wie vertikalen KI-Großmodellen, Rettungsrobotern/Drohnen mit Notfallausrüstung voranzutreiben, um die Fähigkeit zur intelligenten Risikoerkennung, Katastrophenvorhersage und unbemannten Bewältigung in komplexen Umgebungen zu verbessern.
Der Gründer Wen Mingxing erläuterte Hard Krypton, dass das Team zuvor langfristig in Singapur an der Forschung und Entwicklung von Robotern und künstlicher Intelligenz gearbeitet und an mehreren nationalen Roboterprojekten teilgenommen hat, darunter der erste Logistikwagen, der erste Sanitärfahrzeug und der erste Feuerwehrroboter Singapurs. Der langfristige Betrieb dieser Roboter in Szenarien wie tropischen Regenwäldern, komplexen städtischen Umgebungen und Katastrophenrettung hat dem Team reiche Erfahrungen in der Wahrnehmung komplexer Umgebungen und der Lieferung von Robotersystemtechnik gesammelt. Im Jahr 2023 trat das Team dem Sino-Singapurischen Internationalen Verbundforschungsinstitut bei und begann mit der technischen Entwicklung für ganzheitliche Szenarien.
Das embodied Intelligenzsystem von StarMeta plant, durch die selbst entwickelte „Multi-Modale-Physik-Asset-Rekonstruktions-Engine + Hochsimulationsszenario-Simulationsgenerator + Ganzheits-Embodied-Intelligenz-Gehirn“ die Gliederung von physischer Datenerzeugung, ganzheitlicher Datensimulation und Modelltraining, kognitiver Entscheidungsfindung und Roboterbereitstellung zu verbinden, damit Roboter Umgebungen und Aufgaben verstehen und komplexe Vorgänge selbstständig abschließen können.
(Quelle des Bildes / Unternehmen)
Im Bereich der Datenerfassung hat StarMeta eine Multi-Modale-Physik-Asset-Rekonstruktions-Engine aufgebaut. Durch selbst entwickelte tragbare Erfassungsgeräte und multimodale Ego-Geräte werden verschiedene Sensoren wie Lidar, Kamera, Wärmebildkamera und 4D-Millimeterwellenradar integriert, und die Datenfusion zwischen verschiedenen Sensoren wird mit Millimeter-genauen Raum-Zeit-Kalibrierungsalgorithmen abgeschlossen. Im Vergleich zu herkömmlichen rein visuellen Lösungen kann die multimodale Fusion die Wahrnehmungsstabilität von Robotern in komplexen Umgebungen wie schwachem Licht, Rauch und Staub erheblich verbessern. Derzeit unterstützt das Unternehmen die kombinierte Kalibrierung verschiedener heterogener Sensoren, wobei der einmalige Kalibrierungsprozess innerhalb von 10 Minuten abgeschlossen werden kann.
In der Datengenerierungsphase wählt StarMeta die geschlossene Datenroute „Real-Sim-Real“, also „Echte Erfassung – Simulationsgenerierung – Echte Überprüfung“, um das Problem unzureichender Datenmenge und begrenzter Szenarioabdeckung während des Trainings von embodied Intelligenzmodellen zu lösen. Konkret werden echte Szenarien und physische Assets mit multimodalen Erfassungsgeräten modelliert und rekonstruiert, die reale Umgebung digitalisiert und in das Simulationssystem importiert, um ein interaktives, ableitbares und trainierbares digitales Zwillings-Trainingsgelände aufzubauen. Anschließend werden mit Simulationstechnologie schnell eine große Menge an Trainingsdaten generiert, um die Datenerweiterung und Bewertung in komplexen Szenarien und Long-Tail-Szenarien zu realisieren. Dadurch können verschiedene komplexe Betriebsbedingungen und Long-Tail-Szenarien vor der tatsächlichen Bereitstellung wiederholt trainiert und überprüft werden, was die Überprüfungseffizienz von Modellen und Robotersystemen vor dem Eintritt in reale Szenarien verbessert.
Auf der Seite des Gehirnsystems wird das Unternehmen auf selbst entwickelte VLM²-, CIRL-Algorithmen und das Agent-Atom-Fähigkeitssystem zurückgreifen, um Umgebungsverstehen, selbstständige Entscheidungsfindung und Aufgabenausführung zu realisieren. Das System unterstützt die fusionierte Wahrnehmung mehrerer Sensoren, ein einziges Gehirn kann an verschiedene Roboter-Körper wie humanoide Roboter, vierbeinige Roboter, fahrerlose Fahrzeuge und hybride Roboter angepasst werden und deckt komplexe Innen- und Außenszenarien wie Bergbau, Industrie und Parkinspektion ab.
Im Geschäftsmodell plant StarMeta, hauptsächlich zwei Wege zu verfolgen. Einerseits werden Roboter-Hersteller durch projektbasierte Ansätze mit Szenarioanpassung, Hard- und Softwareintegration, Vor-Ort-Bereitstellung und nachfolgenden Wartungsdiensten versorgt. Andererseits werden die angesammelten hochwertigen Szenariodaten zu Assets gemacht, um Robotern, Großmodell-Trainingsteams und Lösungsunternehmen Datendienste über API-Schnittstellen oder Lizenzierung anzubieten.
Im Folgenden finden Sie Auszüge aus dem Gespräch zwischen Hard Krypton und dem Gründer Wen Mingxing:
Hard Krypton: Welche Überlegungen stehen hinter der Wahl der REAL-SIM-REAL-Datenroute? Wie wird die Lücke zwischen Sim-to-Real überbrückt?
Wen Mingxing: Unserer Meinung nach wären Suchmaschinen und soziale Netzwerke nicht möglich gewesen, wenn das Internet Nutzer nicht dazu gebracht hätte, Daten „kostenlos“ zu erzeugen – von großen Sprachmodellen ganz zu schweigen. Nach derselben Logik dürfen Daten für den Erfolg von embodied Intelligenz nicht „nur zum Trainieren erfasst“ werden, sondern müssen „entstehen, weil sie nützlich sind“. Unserer Meinung nach sollte das korrekte Paradigma darin bestehen, dass Menschen zuerst Roboter in realen Szenarien arbeiten lassen, und dann die Daten nutzen, die während des Arbeitsprozesses natürlich entstehen, um zu trainieren.
Aber der Bedarf von embodied Intelligenz an der Datenmenge kann kaum durch die reine Erfassung realer Daten erfüllt werden. Unserem Verständnis nach lassen sich Daten in zwei Kategorien einteilen: synthetische Daten einerseits und echte Daten andererseits. Echte Daten umfassen Fernsteuerungsdaten, Umi-Daten, Ego-Daten sowie Daten zur wahrnehmungsbezogenen Ganzkörper-Motion-Capture. Die Erfassung all dieser Daten ist durch die physische Zeit beschränkt, Roboter oder Menschen müssen in die reale Umgebung eintreten, um sie zu sammeln.
Der größte Vorteil synthetischer Daten liegt darin, dass sie nicht an die physische Zeit gebunden sind, schnell eine große Menge an Daten aus verschiedenen Szenarien generieren lassen und den Datenbedarf für komplexe Betriebsbedingungen und Long-Tail-Szenarien gut abdecken. Deshalb ist unsere Kernroute, synthetische Daten zu priorisieren und sie mit echten Daten zur Kalibrierung zu kombinieren. Aber synthetische Daten haben auch ein branchenweit allgemein beachtetes Problem: die Lücke zwischen Sim-to-Real. Viele Simulationsdaten können Modelle nicht effektiv trainieren, was zwei Gründe hat: unzureichende physische Authentizität und unzureichende Datenvielfalt.
Unsere Lösung besteht darin, zuerst mit selbst entwickelten multimodalen Datenerfassungsgeräten echte Szenarien und physische Assets 1:1 zu modellieren und zu rekonstruieren, die reale Welt in die Simulationsumgebung zu übertragen und die hohe Simulationsgenauigkeit der Daten zu gewährleisten. Auf dieser Grundlage nutzen wir die Vorteile synthetischer Daten wie mehrfaches Ausführen, Zeitbeschleunigung und Sichtbereichserweiterung, um die Datenmenge und Abdeckung zu erhöhen. Durch den geschlossenen Real-Sim-Real-Zyklus erhalten die Daten sowohl die Qualität der realen Welt als auch die Fähigkeit zur skalierbaren Erzeugung.
Hochpräzise Rekonstruktion von Innen- und Außenszenarien (Quelle des Bildes / Unternehmen)
Hard Krypton: Wie lösen Sie Probleme der Datenerfassung und Robustheit in ganzheitlichen Umgebungen von der Hardwaregestaltung bis zur Algorithmenseite?
Wen Mingxing: Ganzheitliche Szenarien umfassen saubere Laborszenarien und Szenarien mit komplexen Betriebsbedingungen. Die Anforderungen komplexer Betriebsbedingungen an Roboter bestehen im Wesentlichen darin, mehrdimensionale Informationen für das Umgebungsverstehen zu erhalten. Unser Team hat in den letzten sieben bis acht Jahren kontinuierlich an der Forschung zur Raum-Zeit-Kalibrierung multimodaler Sensoren und robuster Wahrnehmung gearbeitet und bereits gewisse Erfahrungen in Hardware und Algorithmen gesammelt. Derzeit haben wir für verschiedene Betriebsbedingungen einige Prototypen entwickelt. Auf Hardwareebene wählen wir je nach Szenario unterschiedliche Sensorkombinationen wie Lidar, Vision, Wärmebild und Millimeterwellenradar, um die Umgebungs-Wahrnehmungsfähigkeit durch multimodale Fusion zu verbessern.
Raum-Zeit-genaue Ausrichtung multiquelliger heterogener Sensoren (Quelle des Bildes / Unternehmen)
Multimodale robuste Wahrnehmung (Quelle des Bildes / Unternehmen)
Lokalisierung und Kartierung unter starkem Rauch und hohen Temperaturen (Quelle des Bildes / Unternehmen)
Auf Algorithmenseite liegt der Schlüssel darin, wie Daten verschiedener Sensoren fusioniert werden. Beispielsweise kann die reine visuelle Wahrnehmung in Umgebungen mit Rauch, Staub oder schwachem Licht ausfallen, aber durch die Fusion multimodaler Informationen kann das Roboter die kontinuierliche Wahrnehmung der Umgebung beibehalten.
Eine weitere Herausforderung ist die Datenabdeckung komplexer Betriebsbedingungen und Long-Tail-Szenarien. Beispielsweise ist es in Feuerszenarien unmöglich, Menschen wiederholt in gefährliche Bereiche zu schicken, um Daten zu erfassen, wenn ein echter Brand ausbricht. Deshalb ist unser Ansatz, eine Grundlage mit einer kleinen Menge echter Daten zu schaffen, dann Simulationsalgorithmen zu nutzen, um komplexe Umgebungen mit Rauch und Staub zu generieren und mehr Long-Tail-Situationen in das Training einzubeziehen, damit Roboter bei der tatsächlichen Bereitstellung eine stärkere Generalisierungsfähigkeit besitzen. Schließlich wird durch multimodale Datenerfassung, Simulationsgenerierung und Modelltraining eine vollständige Fähigkeit zur Gehirnentwicklung und Umsetzung von Lösungen gebildet.
Hard Krypton: Sie gehören zu den früheren Forschern, die VLA-Modelle untersucht haben. Wie definieren Sie die Beziehung zwischen dem ganzheitlichen embodied Gehirn, an dem StarMeta derzeit arbeitet, und VLA-Modellen oder Weltmodellen?
Wen Mingxing: Das ganzheitliche embodied Gehirn von StarMeta zielt darauf ab, sicherzustellen, dass embodied Intelligenz im Leben und in der Produktion unter beliebigen Umgebungs- und Betriebsbedingungen sicher, dauerhaft und stabil Wert für Kunden liefern kann – das ist unser Ziel. Sowohl VLA als auch das WAM-Welt-Aktionsmodell sind Glieder der technischen Route zur Erreichung dieses Ziels. Wir glauben, dass zukünftig weitere technische Entwicklungen und Durchbrüche der Branche für embodied Intelligenz mehr Überraschungen bringen werden. Bei der Entwicklung des ganzheitlichen embodied Gehir