Im rasant boomenden Segment der Embodied Intelligence transportieren die Roboter von Reconova bereits Gepäck an Flughäfen.
Während Roboter in verschiedenen Segmenten rasant voranschreiten, hat ein Unternehmen für Embodied Intelligence einen eigenen Weg beschritten und sich von der visuellen Intelligenz zum Bereich der Embodied Intelligence entwickelt.
Am 29. April hielt Reconova auf der 3. Chinesischen Industriekonferenz für Embodied Intelligence und humanoide Roboter einen Hauptvortrag über die Durchbrüche bei der szenariobasierten Umsetzung der Embodied Intelligence.
Dieses Unternehmen, das seit 14 Jahren im KI-Bereich tätig ist, hat offiziell ein Signal gesendet: Maschinen, die die Welt verstehen können, beginnen jetzt, praktische Aufgaben zu erledigen. In dem Segment, in dem alle von Allgemeingültigkeit und Größenordnung sprechen, will es ein Akteur sein, der sich auf die praktische Umsetzung konzentriert.
Von visueller KI zu Embodied Intelligence
Im Jahr 2012 wurde Reconova gegründet. Bis heute hat es zwei völlig unterschiedliche KI-Zeitalter vollständig durchlebt.
Im Zeitalter von KI 1.0 lag das Kernproblem der Technik in der Wahrnehmung: Wie kann man Maschinen dazu bringen, Bilder zu „verstehen“, Objekte zu erkennen und Szenen zu begreifen. Das war das goldene Jahrzehnt für die großskalige Umsetzung des tiefen Lernens und zugleich das hektische Jahrzehnt, in dem Unternehmen für visuelle KI ihre Märkte eroberten.
In diesen zehn Jahren erlebte das Segment der visuellen KI eine grausame Bereinigung. Auf dem Höhepunkt gab es Tausende von Unternehmen im Inland, die das Label „KI-Visuell“ trugen, Kapitel strömte wild ein und Bewertungsblasen bildeten sich schnell. Darauf folgte eine lange Phase der Entschärfung: Die Finanzierungsumgebung verschärfte sich, die Kommerzialisierung kam nicht voran und die homogene Konkurrenz drückte die Gewinne. Um 2019 gerieten zahlreiche Akteure nacheinander in Schwierigkeiten, einstige Einhörner wurden mit Rabatt verkauft oder sogar stillgelegt, was längst keine Seltenheit mehr ist.
In der früheren Welt der visuellen KI waren Sicherheit und Finanzwesen die beiden dichtesten Wettbewerbsfelder der Branche. Im Vergleich dazu konzentrierte sich Reconova auf weniger auffällige Szenarien: Die Passagierabfertigung mit zivilen Flughäfen als Kern, Gewerbeimmobilien mit Einkaufszentren als Hauptbestandteil sowie die unterstützende sichere Fahrsteuerung für Nutzfahrzeuge im Frachtverkehr.
Aus externer Sicht war dies eine etwas zurückhaltende Entscheidung. Aber genau deswegen ist Reconova in einer Branche mit extrem hoher Ausfallrate eines der wenigen Unternehmen für visuelle KI, das seit dem Zeitalter der kleinen Modelle bis zum Zeitalter der großen Modelle überlebt hat und immer noch an der Spitze der Branche steht.
Der Ertrag der Fokussierung liegt in der immer stärker werdenden Wettbewerbssperre. Nach Daten von Frost & Sullivan belegt Reconova gemessen am Umsatz von 2024 den ersten Platz auf dem chinesischen Markt für visuelle Intelligenzprodukte für zivile Luftfahrtunternehmen mit einem Marktanteil von 8,9 %; Die Produkte decken bereits ein Drittel der zivilen Flughäfen im Inland ab, und bei großen Drehkreuzflughäfen mit über 10 Millionen Passagieren beträgt die Abdeckungsrate sogar zwei Drittel. Dahinter stehen hundertmillionenfache szenenspezifische Trainings, ein tiefes Verständnis für alle Geschäftsabläufe der zivilen Luftfahrt sowie langjährige Kundenbeziehungen, die mit den Flughafenbetreibern aufgebaut wurden.
Im Zeitalter von KI 2.0 hat sich das Problem der Technik jedoch geändert. Große Modelle bringen nicht nur eine Verbesserung der Wahrnehmungsfähigkeit, sondern auch die Erweiterung vom Verstehen zum Handeln. Für Reconova ist dieser technische Wendepunkt genau der richtige Zeitpunkt, um einen Schritt nach vorne zu machen.
Zhan Donghui, Gründer und Vorsitzender von Reconova, freut sich über diese Veränderung: „In den letzten 12 Jahren haben wir uns ständig mit den ‚Augen‘ beschäftigt – die physische Welt durch visuelle Wahrnehmung zu erkennen und zu verstehen. Aber jetzt gehen wir weiter, in Richtung Gehirn und Hände. Auf der Grundlage des Verstehens der Welt beginnen wir, Entscheidungen zu treffen, Aktionen durchzuführen und Menschen dabei zu helfen, Aufgaben zu erledigen.“
Das bedeutet auch, dass Reconova nicht mehr nur ein Unternehmen für visuelle Intelligenz ist. Es verlagert seinen technischen Schwerpunkt von Wahrnehmung und Erkennung auf Entscheidung und Ausführung, schließt einen vollständigen Kreislauf von „Augen“ über „Gehirn“ bis zu „Gliedmaßen“ ab. Und in der Produktpositionierung wandelt es sich zu einem Anbieter von Embodied-Intelligence-Produkten um, die für kommerzielle Szenarien und komplexe Operationen ausgelegt sind. Das ist das neue Label von Reconova und zugleich das konkrete Segment, das es in dem beliebten Bereich der Embodied Intelligence gewählt hat.
Die echte Wettbewerbssperre in einem lauten Segment
Der derzeit populärste Narrativ der Embodied Intelligence ist die Allgemeingültigkeit. Wessen Roboter mehr Szenarien anpassen können, desto attraktiver ist die Geschichte und desto größer ist der Spielraum für die Bewertung. Nach dieser Logik scheinen Unternehmen, die sich auf vertikale Szenarien konzentrieren, von Natur aus eine schwächere Position im Narrativ einzunehmen.
Zhan Donghui ist der Ansicht, dass allgemeine Fähigkeiten die Bühne für plattformbasierte Unternehmen sind, die Größenordnung, Ökosysteme und vorzeitige Netzwerkeffekte von Daten erfordern. Aber die Barrieren für vertikale Szenarien entstehen nie durch das Anhäufen von Parametern. Sie stammen aus spezifischen Szenarien, aus dem tiefen Verständnis für die Geschäftsprozesse der Kunden und aus dem Know-how, das nach unzähligen gemeinsamen Problemlösungsprozessen mit den Kunden angesammelt wurde – dies kann nicht durch das bloße Anhäufen von Rechenleistung erreicht werden.
In technischer Hinsicht hat Reconova eine Wettbewerbsmatrix aufgebaut, die aus drei Schichten besteht.
Die erste Schicht ist die Wahrnehmungsbasis. Das ist die direkte Umsetzung der 14-jährigen Anhäufung von visuellen Algorithmen: Objekterkennung, räumliches Verstehen, Haltungsschätzung und Echtzeitwahrnehmung in unstrukturierten Umgebungen.
Die zweite Schicht ist die Entscheidungsebene, deren eigenständige Kernentwicklung das VLA-Modell (Visuell-Sprach-Aktion) ist. Reconova baut ein VLA-Modell für vertikale Szenarien auf, das visuelle Wahrnehmung, Verstehen natürlicher Sprache und Aktionsplanung von Robotern in einem End-to-End-Framework vereinheitlicht. Es macht Roboter zu intelligenten Agenten, die Szenensemantik verstehen, nach Kontext urteilen und entsprechende Aktionssequenzen erzeugen. Im Vergleich zu allgemeinen VLA-Modellen hat Reconova zusätzlich Kraft- und Tastsinn eingeführt, sodass die Handlungsentscheidungen der Roboter dem menschlichen Mechanismus der einheitlichen Entscheidungsfindung auf Basis multidimensionaler Informationen näherkommen. Reconova nennt diese Innovation VTFLA.
Die dritte Schicht ist die Ausführungsebene, also die Ergänzung der Fähigkeiten von „Hand“ und „Körper“ durch eigenentwickelte Ausführungskomponenten. Egal wie stark Wahrnehmung und Entscheidung sind, letztendlich kommt es auf die Ausführungsqualität der physischen Aktionen an. Die eigenständige Entwicklung von Reconova auf der Ausführungsseite löst das Problem der zuverlässigen Bedienung von Robotern in unstrukturierten Umgebungen, nämlich Greifstrategien, Kraftsteuerung und die Anpassung der Endeffektoren an verschiedene Objektformen. Das ist eine sehr hohe technische Hürde und zugleich die schwer zu überwindende Kluft zwischen Demonstration und Massenimplementierung.
Bei der Beurteilung des Kommerzialisierungspfads der Embodied Intelligence ist Zhan Donghui der Ansicht, dass komplexe unstrukturierte Sonderszenarien vor allgemeinen Szenarien eine erfolgreiche Kommerzialisierung erreichen werden.
Allgemeine Roboter unterliegen doppelten Einschränkungen durch Technik und Kosten. Sie müssen nicht nur über ausreichende Generalisierungsfähigkeit verfügen, sondern auch die Kosten pro Einheit unter die für Unternehmenskunden akzeptable Beschaffungsschwelle senken. Die Erfüllung beider Bedingungen gleichzeitig braucht in der aktuellen Phase noch Zeit. Im Vergleich dazu können spezielle Roboter, die tief an ein einzelnes Szenario angepasst sind, technisch für bekannte Einschränkungen vollständig optimiert werden und sind in ihrer Kostenstruktur kommerziell machbarer.
Das unterschätzte harte Problem
Die zivile Luftfahrt ist der erste Ansatzpunkt von Reconova für die Embodied Intelligence und zugleich die Grundlage mit den größten Anhäufungen. Das erste umgesetzte Szenario, das Reconova gefunden hat, ist der Gepäcktransport.
Der Gepäcktransport gehört seit jeher zu den Gliedern mit den höchsten Personalkosten in der zivilen Luftfahrtbranche. Schwierigkeiten bei der Einstellung von Personal, hohe Personalfluktuation und große Schwankungen der Arbeitseffizienz je nach Wetter und Flugplan sind Probleme, die die Flughäfen seit vielen Jahren plagen.
Dieses Szenario wirklich gut umzusetzen, ist viel schwieriger als es aussieht. Zhan Donghui erklärt, dass der Gepäcktransportbereich eine hochgradig unstrukturierte Arbeitsumgebung ist, die fast alle ungünstigsten Bedingungen für die Roboterimplementierung vereint.
Zuerst die extreme Vielfalt der Objektformen: Das von Passagieren aufgegebene Gepäck ist nicht standardisiert. Trolleys, weiche Segeltaschen, Kartons und übergroße Sonderstücke tauchen oft in derselben Charge auf. Jedes Gepäckstück, dem der Roboter begegnet, stellt eine neue Herausforderung für das Greifen dar: An welcher Stelle man greifen soll, welche Kraft man anwenden muss, um das Gepäck stabil und unbeschädigt zu halten, und wo man schließlich den besten Platz für das Stapeln findet.
Zweitens die Unregelmäßigkeit des Raums selbst: Der Transportbereich unter dem Terminalgebäude ist nicht für Roboter ausgelegt. Die Gehwege haben unterschiedliche Breiten, die Lücken zwischen den Geräten sind eng, und die Bewegungsbahnen der Roboter müssen in Echtzeit geplant werden.
Zuletzt und am wichtigsten ist die hohe Anforderung an die Zusammenarbeit von Mensch und Maschine: Im Betriebssystem der zivilen Luftfahrt hängen die Genauigkeit und Aktualität des Gepäcktransports direkt von der Pünktlichkeit der Flüge und der Zufriedenheit der Passagiere ab. Um das gesamte Gepäck verschiedener Größen für Flüge in kurzer Zeit zu transportieren, ist die gemeinsame Arbeit von Mensch und Maschine derzeit die beste Lösung. Die parallele Arbeit bedeutet jedoch, dass beide in geringer Entfernung häufig räumlich ineinandergreifen, und jede Verzögerung bei Wahrnehmung oder Entscheidung kann Sicherheitsrisiken verursachen.
Das ist genau der Grund, warum allgemeine Roboter derzeit in diesem Szenario nicht funktionieren können. Die starke Generalisierungsfähigkeit allgemeiner Roboter bedeutet, dass sie in vielen Szenarien „verwendbar“ sind; aber „verwendbar“ und stabil einsatzfähig in strengen Produktionsumgebungen sind zwei völlig unterschiedliche Standards. Gleichzeitig bestimmt die derzeitige Kostenstruktur allgemeiner Roboter, dass sie in solchen Szenarien zur Personalsubstitution vorübergehend keinen akzeptablen ROI erreichen können.
Die Antwort von Reconova ist die Entwicklung eines intelligenten Roboters, der speziell für das Szenario des Flughafengepäcktransports ausgelegt ist. Auf der Internationalen Flughafenmesse 2025 hat der Xiaoyi-Gepäcktransportroboter in einem simulierten Transportbereich des Terminalgebäudes verschiedene Gepäckstücke reibungslos vom Ende des Sortiersystems zu den nachgeschalteten Gepäckanhängern transportiert und effizient gestapelt, womit eines der am wenigsten intelligent ausgebauten Glieder im System der zivilen Luftfahrt abgedeckt wurde.
Eines der Kerndesigns ist das branchenweit erste kooperative Arbeitsmodell zwischen Mensch und Maschine. Nach ausführlicher Kommunikation mit den Kunden wird durch ingenieurstechnische Gestaltung die nahtlose Zusammenarbeit zwischen Roboter und Mensch erreicht, sodass Menschen sicher und natürlich Seite an Seite mit der Maschine arbeiten können. Der Roboter übernimmt die häufigen, schweren Transport- und Stapelaufgaben, während der Mensch außerhalb der Fähigkeitsgrenzen des Roboters eingreift und ausgleicht. Beide erfüllen ihre jeweiligen Aufgaben, und die Gesamteffizienz übertrifft die rein manuelle Arbeit bei weitem.
Zhan Donghui erklärt, dass der Xiaoyi-Gepäcktransportroboter bei den Messungen in Flughafenprojekten die Abhängigkeit von der Anzahl der Arbeitskräfte deutlich verringert und die physische Belastung der Mitarbeiter senkt. Gleichzeitig wird der Durchsatz des Systems um 30 % gesteigert und die Gepäckschadensrate auf 0,12 % gesenkt, was auch einer der Treiber für die Beschaffung durch die Flughafenbetreiber wird.
Derzeit führt Reconova Messungen in mehreren Flughäfen durch und plant die offizielle kommerzielle Umsetzung in der zweiten Hälfte dieses Jahres. Während der Expansion auf dem Inlandsmarkt hat Reconova auch die zivilen Luftfahrtmärkte in Südostasien und im Nahen Osten mit ähnlichen Problemen bei der Gepäckabfertigung in die Pläne für die internationale Expansion aufgenommen.
In dem rasant wachsenden Bereich der Embodied Intelligence hat Reconova einen konkreteren Weg gewählt: Eine schwierige Aufgabe gut zu erledigen, sodass Kunden in ihren tatsächlichen Geschäftsszenarien einen quantifizierbaren Wert erkennen können.
Wenn man einen Standort für Reconova in der aktuellen Industrielandschaft der Embodied Intelligence sucht, ist es weder ein Unternehmen für allgemeine Roboter noch ein Unternehmen für visuelle KI im herkömmlichen Sinne, sondern ein Anbieter von Embodied-Intelligence-Produkten, der sich auf die Bearbeitung komplexer Szenarien und komplexer Aktionen spezialisiert.
Der Hype um das Robotersegment wird letztendlich abklingen, aber Produkte, die in anspruchsvollen Szenarien getestet wurden, werden es nicht tun. In dem Lärm darauf zu bestehen, sich auf kleine Bereiche zu konzentrieren und diese tief zu bearbeiten, ist eine Entscheidung, die Ausdauer erfordert. Aber genau diese Entscheidung gibt Reconova in dem lautesten Hype der Embodied Intelligence eine wirklich seltene Nische und macht es zu einem erwartungsvollen Unternehmen für Embodied Intelligence.