Das „letzte Zentimeter“ der industriellen Embodiment: Der kraftvolle Durchbruch nach neun Jahren reifer Akkumulation
Wenn ein Unternehmen ein großes industrielles KI-Modell von Grund auf trainieren will, ist der erste Schritt möglicherweise nicht die Modellierung, sondern das Warten – auf das Auftreten von Ausfällen in der Produktionslinie, die Meldung von Fehlern und die Rückführung von Daten. Das kann einen Monat dauern, aber auch ein Jahr. Ein großes industrielles KI-Modell ohne echte Produktionsliniendaten steht wie ein Bauwerk auf fließendem Sand. Der Mangel an Daten ist seit langem eine unüberwindbare Barriere für diese Branche.
Heute lässt sich dieses Problem lösen, indem man einfach ein paar Fotos macht.
Dieses Jahr im September hat der industrielle KI-Dienstleister Srit Smart erstmals das erweiterte industrielle Großmodell „DataWing“ vorgestellt, das auf 9 Jahren gesammelter Erfahrung und 48 TB Daten aus realen Szenarien trainiert wurde, sowie den Roboter HaiBot, der mit dem körperbezogenen Groß-Kleinhirn-Modell CogniMotor und dem vorausschauenden Weltaktionsmodell SeerWAM ausgestattet ist. Nach der Einbindung durch Unternehmen lassen sich entsprechende Funktionen mit nur einem Satz oder einem Bild aufrufen, und die Effizienz der Datenerzeugung hat sich im Vergleich zur manuellen Erfassung um mehr als das Zehnfache verbessert.
Dieses Unternehmen hat lange abseits des Rampenlichts gearbeitet, ist aber in der Automobilindustrie keineswegs unbekannt: Es ist die erste lokale Marke für industrielle KI in China, die in die Lieferkette internationaler Luxusautomobilhersteller aufgenommen wurde, und hält mehr als 93 geistige Eigentumsrechte. Es hat fast 100 industrielle Endkunden, von denen mehr als die Hälfte führende Automobilhersteller sind. Gleichzeitig decken die industriellen KI-Lösungen von Srit Smart die vier Kernprozesse Stanzen, Schweißen, Lackieren und Montage vollständig ab. Für diese Lösung gibt es unter den lokalen Unternehmen für industrielle KI keine Konkurrenz, und die Wiederkaufrate über drei Jahre liegt bei über 60 %.
Derzeit lässt die Hype um die beiden Bereiche Großmodelle und körperbezogene Robotik nach. Investoren und Kunden fragen gleichermaßen: Wer kann neben Benchmarks und Leistungstests echten Mehrwert liefern? Srit Smart beantwortet genau die gemeinsame Frage der Kommerzialisierung beider Bereiche: Wie man Modellfähigkeiten in industrielle Zuverlässigkeit umwandelt.
Neun Jahre für ein scharfes Schwert: Andere verbrennen Geld für die Datenerfassung, es verwandelt Produktionslinien in „Datenölfelder“
Auf den ersten Blick erscheint die Einstiegshürde von DataWing sehr niedrig. Hinter dem Prinzip „sofort einsatzbereit“ löst es den Widerspruch, der die industrielle KI seit langem plagt: Unternehmen brauchen dringend KI zur Effizienzsteigerung, können aber kaum kontinuierlich hochwertige multimodale Daten erfassen und keine passenden Modelle trainieren.
Im Vergleich zu Großmodellen für den Endverbrauchermarkt sind industrielle Daten noch knapper: Fabriken unterliegen strengen Geheimhaltungsvorschriften, und Daten werden erst vor der Abnahme durch den Kunden freigegeben. Selbst führende Roboterunternehmen können nur nachts, wenn die Produktion stillsteht, vor Ort begrenzte Daten erfassen. Die kontinuierliche Bereitstellung von Daten für industrielle KI hängt im Wesentlichen von der Reputation des Unternehmens ab, einschließlich des Vertrauens der Kunden und der Fähigkeit zur technischen Umsetzung. Mit diesen beiden Voraussetzungen kann das Unternehmen kontinuierlich neue Projekte durchführen und so Daten aus echten Betriebsszenarien ergänzen.
„Egal wie viel Kapital die Beteiligten haben, sie müssen von Grund auf vor Ort Daten erfassen, also sind Daten eine sehr wertvolle Ressource“, sagte Jia Chunying, Vorstandsvorsitzende von Srit Smart, gegenüber 36Kr.
Die Lösung von Srit Smart dafür ist ein zweirädriges Flywheel, das von echten und synthetischen Daten angetrieben wird.
Tatsächlich ist die absolute Datenmenge in der Branche nicht gering, aber es fehlt wirklich an hochwertigen Daten. Diese Daten müssen verschiedene Szenarien abdecken und gleichzeitig einen ausreichend niedrigen Anteil an Fehlerdaten aufweisen, um die Vielfalt und Genauigkeit des maschinellen Lernens zu gewährleisten.
Von den 48 TB erfassten Daten von Srit Smart decken sie 17 Kategorien von Szenarien ab, mit einem Fehleranteil von weniger als 2 %, und können dem Modell kontinuierlich vielfältige und vollständige Datenquellen liefern.
Das Problem bei echten Daten besteht jedoch darin, dass man warten muss, bis ein bestimmtes reales Szenario tatsächlich eintritt, was viel Zeit verschwendet. Daher führt Srit Smart gleichzeitig VR/AR-Fernsteuerungsdaten zur Demonstration ein und kombiniert sie mit Simulationen durch das Weltmodell, um so weit wie möglich ein mehrdimensionales digitales Zwillingsmodell zu erstellen. Schließlich wird dieses simulierte Szenario mit den Rückführdaten aus dem echten Betrieb abgeglichen. Die vier Modi „Sehen, Tasten, Kraft, Bewegung“ werden auf derselben Zeitachse gebunden, und die Zwillingsdaten werden durch Produktionsliniendaten optimiert, um das Prinzip „Die Produktionslinie ist selbst eine Datenfabrik“ zu realisieren. Das ist der Kern seiner generativen Erweiterung.
Die größte Herausforderung dabei liegt im Verständnis der technischen Prozesse: Ob ein Kratzer als Fehler gilt, muss anhand seiner Position, Größe und den Qualitätsstandards des Kunden beurteilt werden – zwischen der Erstellung eines Bildes mit einem Riss und der Erstellung eines gültigen industriellen Trainingsbeispiels liegt eine Lücke, die nur durch langjährige Erfahrung in den Herstellungsprozessen überbrückt werden kann.
Srit Smart ist seit 2019 in Automobilproduktionslinien tätig und hat im Zusammenspiel mit seinen Kunden allmählich eine Methodik für die digitale Verarbeitung von Herstellungsprozessen entwickelt, einschließlich des Verständnisses der Prinzipien hinter den Prozessen und der Umstände, unter denen Fehler auftreten. In der Branche werden Automobilproduktionslinien als „die Krone der industriellen Fertigung“ bezeichnet, und ihre vier Kernprozesse decken fast alle Bereiche der Fertigung ab. In diesem Umfeld mit hoher Intensität, hohen Anforderungen und strengen Standards ist Srit Smart allmählich zu einem Experten für die vier Kernprozesse der Automobilfertigung geworden.
Heute kann es mit nur 10 echten Fotos große Modelle dazu bringen, Fehlerbeispiele zu erzeugen. Am Beispiel der integrierten Lackoberflächenprüfung „matt + glänzend“, die bei führenden Automobilherstellern implementiert wurde: Im Vergleich zu ähnlichen Lösungen verkürzt sein KI-Agent die Implementierungszeit um die Hälfte, und die Erkennungsgenauigkeit liegt über 98 %.
Kein Wettbewerb um humanoide Roboter, sondern um die Gehirnleistung: Ein technologischer Vorsprung gegenüber „Demo-zentrierten“ körperbezogenen Robotern
Ähnlich wie bei großen KI-Modellen ist die Kommerzialisierung körperbezogener Roboter in eine tiefe Phase eingetreten. Ein Branchenkenner sagte gegenüber 36Kr: Heutzutage schauen Investoren keine Präsentationen mehr an, sondern reisen in Gruppen zu Fabriken, um zu sehen, wie Roboter in der Werkshalle arbeiten, anstatt in Ausstellungsräumen vordefinierte Abläufe vorzuführen. Das Modell, bei dem man nur Visionen vorstellt und mit Demonstrationen Finanzmittel einwirbt, hat sein Ende erreicht.
Die Roboter von Srit Smart fahren bereits in den Fabriken seiner Kunden herum und erledigen Aufgaben wie das Be- und Entladen von Gütern.
Im Vergleich zu anderen Unternehmen für körperbezogene Roboter auf dem Markt konkurriert Srit Smart nicht um die Hardware des Roboters, sondern um seine „Gehirnleistung“. Es folgt nicht dem Trend zu vollständigen humanoiden Robotern, sondern konzentriert sich auf die vier Funktionen Sortieren, Transportieren, Montieren und Qualitätskontrolle. Seine Entwicklungsressourcen werden auf die Daten-Engine und das körperbezogene Modell konzentriert, während die Hardware in Zusammenarbeit mit Partnern entwickelt wird.
Auf der Seite des „Gehirns“ übernimmt CogniMotor das Verstehen, Zerlegen und Planen von Aufgaben; das Weltmodell SeerWAM probt die Aktionen vor ihrer Durchführung und beurteilt, wie sich die Umgebung möglicherweise verändert und welche Störungen während der Ausführung auftreten können.
Bei der praktischen Implementierung unterliegen alle diese Aktionen einer Freigabekontrolle „zuerst bewerten, dann ausführen“. Die vorausschauende Entscheidungsfindung nach dem Prinzip „zuerst denken, dann handeln“ ist der Trennpunkt zwischen industrieller Umsetzung und Labordemonstrationen.
Allerdings können große Gehirn-, Kleinhirn- und Weltmodelle, die nur mit visuellen Daten trainiert werden, das Problem des „letzten Zentimeters“ bei industriellen Vorgängen nicht lösen. Wenn der Roboter mit Objekten in physischen Kontakt kommt, treten häufig Abweichungen von Werkstücken, Verformungen durch Kontakt und Montagewiderstände auf. Diese mehrdimensionalen physikalischen Größen bilden eine strukturelle Obergrenze für Ansätze, die ausschließlich auf visuellen Daten basieren.
Die Lösung von Srit Smart dafür ist die „koordinierte Zusammenarbeit von Hand, Auge und Gehirn“. Neben visuellen Daten führt Srit Smart die fusionierte Wahrnehmung von Kraft und Tastsinn mit visuellen Daten ein, sodass der Roboter im Moment des Kontakts ein „Gefühl für das Objekt“ bekommt. Die Kraft- und Tastdaten nach dem Einsatz des echten Roboters werden schließlich an die Daten-Engine zurückgeführt.
Das industrielle große Modell für Kraft- und Tastsinn VTLA ist der Kern des körperbezogenen Modells von Srit Smart. Der Tastsinn ist die einzige native Wahrnehmung, die physikalische Eigenschaften direkt abbildet. Er kann nicht aus dem Internet bezogen werden, sondern nur aus echten Produktionslinien erfasst werden. Branchenforschungen zeigen, dass es im Bereich der gekoppelten Schulung und Ausführung von industriellen Kraft- und Tastsinnmodellen noch ein Zeitfenster von 12 bis 18 Monaten gibt, um sich eine Position zu sichern. Man kann sagen, dass Kraft- und Tastdaten eine völlig unerschlossene Kategorie sind, für die es bisher keine Angebote in der Branche gibt. Für Unternehmen, die ausschließlich auf visuelle Daten setzen, ist dies eine Lücke, die sie nicht schließen können, und es ist zugleich ein Datenvermögen für die Vorreiter auf diesem Gebiet.
Mit Kraft- und Tastdaten, ergänzt um multimodale Daten wie Sehen, Sprache, Ton und Semantik, baut Srit Smart schließlich eine gekoppelte Kette für physikalische Schulung und Ausführung auf: „VLA-Aktionsgenerierung – Vorprüfung durch das Weltmodell – Freigabekontrolle – Ausführung durch den echten Roboter“, sodass Sehen, Tasten und Kraft in echten Kontakten einen geschlossenen Regelkreis bilden.
Hinter dem industriellen großen Modell für Kraft- und Tastsinn VTLA steht letztendlich die Dichte hochwertiger Kundenszenarien. Srit Smart hat in 9 Jahren Arbeit ein Szenarionetz mit fast 100 industriellen Endkunden aufgebaut, von denen mehr als die Hälfte führende Automobilhersteller sind, und deckt die vier Kernprozesse Stanzen, Schweißen, Lackieren und Montage vollständig ab. Die Dichte der Szenarien ist extrem hoch. Die Ergebnisse zeigen sich bereits in den technischen Kennzahlen: Der zwearmige Roboter HaiBot kann eine Last von bis zu 20 kg tragen, und die Genauigkeit des ersten branchenweiten vier-modalen intelligenten Betriebs, der bei führenden Automobilherstellern implementiert wurde, erreicht 0,1 mm.
Tatsächlich schien es vor der Produktveröffentlichung unzeitgemäß, dass Srit Smart seine Ressourcen auf die Entwicklung von großen Modellen für Gehirn und Tastsinn konzentrierte. Denn der Verkauf von Roboterhardware ist der direkteste Weg zur Umsatzgenerierung, während große Modelle viel Zeit für das Training benötigen und kurzfristig keine Ergebnisse liefern.
Srit Smart hat diesen schwierigeren Weg bewusst gewählt. Die Zuversicht dafür stammt aus der Fähigkeit zur eigenständigen Finanzierung, die das Unternehmen über Jahre im Kerngeschäft der Prüftechnik aufgebaut hat. Es ist nicht auf externe Finanzmittel angewiesen, um zu überleben, und seine technischen Investitionen richten sich nach den Gesetzen der Industrie, nicht nach dem Rhythmus der Kapitalmärkte.
Für Srit Smart steckt hinter der Entwicklung des „Gehirns“ ein größeres Ziel: die Schaffung eines echten industriellen Ökosystems für körperbezogene Roboter. Statt eine vollständig geschlossene Lösung rund um die eigene Roboterhardware zu entwickeln, sollen Modelle und Fähigkeiten offen bereitgestellt werden, um sie in Roboter verschiedener Formen und unterschiedliche Produktionsszenarien einzubringen. Das Unternehmen plant, bis 2029 die heterogene Anpassung verschiedener Roboterformen voranzutreiben.
Dies ist kein Wettbewerb mit der Fraktion der „allgemeinen großen Gehirne“, sondern eine kooperative Konkurrenz auf verschiedenen Ebenen. Allgemeine große Gehirne decken eine breite Palette von Branchen ab, während Srit Smart mit dem „VTLA + Tast-Weltmodell“ das erste vertikale körperbezogene industrielle Gehirn mit vier abgestimmten Modi realisiert und die Fähigkeiten körperbezogener Systeme schließlich in allen Branchen bereitstellt.
Bei seinem Geschäftsmodell nutzen die fünf Umsatzquellen – Datendienste, intelligente Arbeitsplätze, Modelllizenzen, Tastsinn-Simulationsdaten und Qualitätskontrolle – gemeinsam ein einziges Daten-Flywheel, sodass jeder erwirtschaftete Euro gleichzeitig Einnahmequelle und Datenquelle ist.
Vier Eintrittskarten, die man nicht überstürzt erwerben kann
Körperbezogene Industrieroboter sind kein neues Thema. Führende Unternehmen erzählen ähnliche Narrative, und ihre Roboter erledigen bereits Be- und Entladeaufgaben an MMIT-Arbeitsplätzen bei Smartphone-Herstellern wie Longcheer.
Abgesehen von Demonstrationen ist die industrielle Welt jedoch ein Bereich mit langfristigem Potenzial und stabiler Entwicklung. Am Beispiel der Lieferkette von Automobilherstellern: Ihre Zertifizierungsdauer beträgt in der Regel 2 bis 3 Jahre, und sie sind sehr vorsichtig, wenn es darum geht, Partner für die Datenerfassung in ihre Produktionslinien zu lassen. Selbst wenn man Zugang zu den Produktionslinien erhält, dauert es mehrere Jahre, bis man einen Bestand von 48 TB echten Produktionsliniendaten und 100.000 Stunden an Beispieldaten aufgebaut hat, wie Srit Smart es getan hat. Noch wichtiger ist: Die praktischen Erfahrungen bei der Implementierung in Produktionslinien lassen sich nicht in wissenschaftlichen Arbeiten niederschreiben, sie sind erfahrungsbasierte Vermögen, die man nicht durch theoretisches Lernen schnell erwerben kann. Da