StartseiteArtikel

Datenakquisitionszentrum: Fahrschule für Roboter oder die umschlossene Festung des Kapitals

AI前线2026-09-21 09:40
Wer bezahlt für die Nachfrage?

In weniger als zwei Jahren sind in China mindestens 90 Datenerfassungszentren für Embodied Intelligence entstanden.

In Shijingshan, Peking, befindet sich eines mit einer Fläche von 10.000 Quadratmetern und 120 Robotern, das insgesamt 1,17 Millionen Betriebsdaten erzeugt hat; in Tianjin gibt es ein weiteres von Paxini mit 12.000 Quadratmetern, das jährlich 200 Millionen hochwertige Trainingsdaten produzieren soll, und es wurden weitere neue Zentren in Suqian, Wuhan, Zigong und Ganzhou errichtet; Zhi Yuan hat mehr als 100 Roboter im Pudong-Viertel von Shanghai eingesetzt; auch JD ist in das Geschäft eingestiegen und will das „weltgrößte“ Zentrum bauen, an dem 600.000 Menschen Daten erfassen, mit einem Ziel von 10 Millionen Stunden Daten innerhalb von zwei Jahren.

Die rasante Verbreitung von Datenerfassungszentren wird vor allem von lokalen Regierungen vorangetrieben.

Von den Metropolen bis zu den Städten der dritten und vierten Ebene, von den Küstengebieten bis zu den Binnenregionen sind Datenerfassungszentren zu einem neuen Standard für die Investitionsförderung in Industrieparks und zu einem neuen Aushängeschild für zukünftige Industrien geworden. Nach dem Rückgang der Einnahmen aus dem Grundstücksverkauf ist es für viele Orte zu einer neuen Überlegung geworden, Robotikunternehmen mit der Erzählung von Datenvermögen zur Ansiedlung zu bewegen.

Doch trotz des scheinbaren Wohlstands brachen im zweiten Halbjahr 2026 Zweifel massiv aus.

Im August veröffentlichte die Financial Times den Artikel *Wer kauft chinesische Roboter*, der diesem Modell ein äußerst schädliches Etikett verpasste – zirkuläre Finanzierung. Das bedeutet, dass Robotikunternehmen Roboter an von lokalen Regierungen gebaute Datenerfassungszentren verkaufen und das Geld unter dem Vorwand des Datenkaufs zurückfließen lassen. Die buchmäßigen Einnahmen steigen, die Bewertungen werden höher, aber die tatsächlichen Käufer der Daten sind nach wie vor die Unternehmen selbst.

Im September veröffentlichte Shao Tianlan, Gründer von Mech-Mind, zwei aufeinanderfolgende Beiträge auf WeChat Moments, in denen er direkt darauf hinwies, dass „veranstaltungsorientierte“ Unternehmen in der Branche mit Hilfe von Datenerfassungszentren und verbundenen Transaktionen falsche Einnahmen erzeugen, und nannte explizit Galaxy Universal, dessen Bewertung über 20 Milliarden Yuan liegt und das gerade einen Börsengang anstrebt.

Auch die Haltung der Aufsichtsbehörden verschärft sich. Laut einem Bericht von *The Information* hat die China Securities Regulatory Commission (CSRC) einigen Investmentbanken und Investmentinstituten eine Fensterführung zugesandt: Börsenanmeldungen von humanoiden Robotikunternehmen werden nur dann berücksichtigt, wenn sie nachweisen können, dass sie stetige Einnahmen erzielen, sich auf dem Weg zur Verlustminderung befinden oder über echte technologische Innovationen verfügen.

Der Kapitalmarkt reagierte noch früher. Die erste Aktie des humanoiden Robotikbereichs, Unitree, erreichte am ersten Handelstag am 19. August einen Kurs von 1100 Yuan pro Aktie und eine Marktkapitalisierung von 444,9 Milliarden Yuan. Einen Monat später fiel der Kurs unter 500 Yuan, die Marktkapitalisierung schrumpfte um mehr als 240 Milliarden Yuan und wurde fast halbiert.

Der Kern der Kontroverse lässt sich nicht von dem Begriff „Datenerfassungszentrum“ trennen.

Ist es tatsächlich die entscheidende Infrastruktur, mit der Embodied Intelligence den Datenengpass überwinden kann, oder ein Kapitalspiel der Unternehmen zur Erhöhung der Bewertungen und der lokalen Regierungen zur Erfüllung von Investitionsförderungsquoten? Ist es eine weitere innovative Praxis der chinesischen Industriepolitik für harte Technologien oder eine in neuer Verpackung präsentierte zirkuläre Beschaffung?

Die Versorgungslücke von 95 %

Zuerst wollen wir besprechen, warum Embodied Intelligence Datenerfassungszentren braucht.

Die Antwort lautet: Es fehlt an Daten, und zwar extrem an Daten. Große Modelle ernähren sich von Informationen aus der digitalen Welt, während Roboter Interaktionsdaten aus der physischen Welt benötigen.

Wenn Sie einem großen Sprachmodell sagen „reich mir ein Glas Wasser“, kann es das perfekt verstehen. Aber wenn ein humanoider Roboter tatsächlich ein Glas Wasser holen soll, geht das höchstwahrscheinlich schief. Wie groß die Reibung des Glases ist, welche Kraft der Greifarm anwenden muss, damit das Glas nicht zerbricht, und welche Beschleunigung beim Gehen eingehalten werden muss, damit das Wasser nicht verschüttet wird – diese Details der physischen Welt gibt es im Internet nicht.

Zhu Kai, Geschäftsführer des Trainingszentrums in Shijingshan, fasst dieses Problem in sechs Wörtern zusammen: Kann sprechen, aber kaum praktisch handeln.

Laut dem *Forschungs-Weißbuch zur Embodied Intelligence-Datenbranche* weisen Embodied-Daten eine Pyramidenstruktur auf: Die unterste Ebene besteht aus Internetvideos und synthetischen Daten, die große Mengen und niedrige Kosten, aber die geringste Genauigkeit aufweisen. Die mittlere Ebene sind Motion-Capture-Daten: Menschen tragen Motion-Capture-Anzüge und führen Bewegungen aus, Roboter lernen ihnen nach, die Genauigkeit steigt, aber es gibt noch eine Trennung. Die oberste Ebene sind Fernbedienungsdaten: Menschen steuern Roboter direkt an, wobei Kraftwahrnehmung, Tastsinn, Sehen und Gelenkwinkel vollständig synchronisiert werden. Sie haben die höchste Genauigkeit, sind aber auch am teuersten.

Die Datenerfassungszentren übernehmen genau diese Aufgabe auf der obersten Ebene der Pyramide.

Wie teuer ist das? Mitarbeiter von Paxini haben die Rechnung aufgestellt: Ein Roboter-Körper kostet 600.000 bis 700.000 Yuan, das Erfassungspersonal muss ein professionelles Team mit Branchenerfahrung sein, eine große Fläche beginnt bei 10.000 Quadratmetern, dazu kommen Hunderte von PB an Speicher- und Rechenleistung. Zusammengefasst ist die Investition in ein standardmäßiges Datenerfassungswerk keineswegs eine geringe Summe.

Noch entscheidender ist die Lücke bei der Skalierung. Nach Berechnungen von Guojin Securities werden mindestens 10 Millionen Stunden multimodaler Interaktionsdaten benötigt, um ein Embodied-Intelligence-Modell mit praktischen Anwendungsmöglichkeiten zu trainieren. Die weltweit derzeit angesammelte Datenmenge beträgt weniger als 5 % des Bedarfs.

Eine Versorgung von 5 % bedeutet eine Lücke von 95 %.

Diese Lücke ist so schwer zu schließen, weil das bloße Aufstocken von Geräten bei weitem nicht ausreicht. Bei dem globalen Durchschnittsniveau sind allein die Personalkosten für ein Erfassungsgerät plus die Gehälter des Erfassungspersonals bereits sehr hoch. Multipliziert mit zehn Millionen Stunden ist diese Investitionsskala nicht durch den Bau einiger weiterer Datenerfassungszentren und die Hinzufügung einiger Arbeitsplätze zu erreichen.

Außerdem sind Daten nicht umso besser, je mehr es gibt. In der frühen Phase ist Breite erforderlich, in der späteren Phase aber Tiefe. Beispielsweise müssen Roboter für chinesische Haushalte mit den Räumlichkeiten, Gegenständen und Gewohnheiten chinesischer Familien vertraut sein. Daten, die näher an kommerziellen Szenarien liegen, sind schwieriger zu beschaffen und teurer.

Das ist die Grundsituation der gesamten Branche: Daten sind extrem knapp. Wer zuerst genügend Daten sammeln kann, kann möglicherweise einen Vorsprung bei den Modellfähigkeiten erzielen. Gerade wegen der Knappheit ist das Geschäft rund um Daten besonders lebhaft und auch besonders komplex geworden.

Der landesweite Wettlauf um Datenerfassungszentren

Vor 2025 war „Datenerfassungszentrum“ noch ein Nischenkonzept in der Branche. Der Wendepunkt lag im zweiten Halbjahr 2025, danach entwickelte sich die Sache unaufhaltsam weiter.

Der März 2026 war ein Monat mit massiver Entwicklung: Das von Zhi Yuan und dem Bezirk Pidu in Chengdu gemeinsam aufgebaute Industriebasis für Embodied Intelligence im Südwesten nahm die Vormontage auf; das von Leju und dem Kreis Pingyin in Jinan gemeinsam errichtete Datentrainingszentrum für humanoide Roboter ging online; das Trainingszentrum in Shijingshan, Peking, startete seine dritte Ausbaustufe; Paxini kündigte den Bau von vier weiteren Werken in Suqian, Wuhan, Zigong und Ganzhou an, um ein „landesweites verteiltes Erfassungsnetz“ aufzubauen.

Laut Statistiken von Interact Analysis waren bis Ende April 2026 landesweit mindestens 90 Datenerfassungs- und Trainingszentren für humanoide Roboter in Betrieb oder im Bau, davon 64 bereits in Betrieb. 15 davon sind groß angelegt, auch Städte der zweiten und dritten Ebene wie Zhengzhou, Wuxi, Jinan und Mianyang ziehen nach. Die Flächen betragen meist 3000 bis 5000 Quadratmeter, einige erreichen sogar Zehntausende Quadratmeter.

Warum sind die lokalen Regierungen so aktiv?

Auf politischer Ebene wurde Embodied Intelligence 2026 zum zweiten Mal in den Regierungsarbeitsbericht aufgenommen und als Schwerpunktrichtung der zukünftigen Industrien eingestuft. Nachdem die Richtung festgelegt wurde, müssen die unteren Ebenen natürlich nachziehen.

Der praktischere Antrieb ist die Investitionsförderung: Die Ansiedlung eines führenden Robotikunternehmens kann vorgelagert die Komponentenlieferanten fördern, nachgelagert die Entwicklung von Anwendungsszenarien vorantreiben und dazwischen eine Reihe hochqualifizierter Fachkräfte anziehen. Für lokale Regierungen, die nach neuen Wirtschaftswachstumspunkten suchen – insbesondere nach dem Rückgang der Einnahmen aus dem Grundstücksverkauf – sind Datenerfassungszentren ein perfekter Ansatzpunkt: Investitionen, Arbeitsplätze, Industriekette und technologisches Aushängeschild sind alles vorhanden.

Früher wurden die verarbeitenden Unternehmen durch die günstige Vergabe von Industrieland angezogen, wobei die Einnahmen aus der Landveräußerung und Steuern erzielt wurden. Heute werden Robotikunternehmen durch die Finanzierung von Datenerfassungszentren angezogen. Das Land bleibt dasselbe, die Gebäude werden von Fabriken zu Trainingsstätten. Manche nennen das „Daten-Finanzwesen“.

Ob das „Daten-Finanzwesen“ funktionieren kann, hängt von einer Kernfrage ab: Sind die erfassten Daten tatsächlich wertvoll?

Wenn es einen Markt für Daten gibt, Käufer vorhanden sind, die Modelle unterstützt werden und ein echter Wert entsteht, dann sind Datenerfassungszentren Datenbergwerke. Wenn aber der einzige Käufer der Daten das Robotikunternehmen ist, das diese Daten erzeugt, dann ist das „Daten-Finanzwesen“ kein Einnahmequelle, sondern eine in neuer Verpackung präsentierte Ausgabe.

Im August 2026 hat der Bericht der FT dem chinesischen Embodied-Intelligence-Bereich das Etikett „zirkuläre Finanzierung“ angeheftet.

Dieser Begriff wurde ursprünglich zur Beschreibung von Nvidia verwendet: Nvidia investiert in KI-Startups, die Startups verwenden das Geld, um Nvidia-GPUs zu kaufen, das Geld fließt in einer Runde zurück, und Umsatz und Bewertung steigen gleichzeitig an.

Aber die chinesische Variante wiegt schwerer, weil die Zirkulation bei Nvidia zwischen Unternehmen und privatem Kapital stattfindet und eine geschäftliche Handlung ist, während die chinesische Zirkulation lokale Regierungen und öffentliche Gelder einbezieht.

Wie läuft dieser Zyklus ab? Lassen Sie uns das gemeinsam durchgehen.

Erster Schritt: Bau des Zentrums. Das Robotikunternehmen verhandelt mit der lokalen Regierung über eine Zusammenarbeit, beide gründen ein Joint Venture. Die Regierung stellt über eine staatseigene Plattform den Großteil des Kapitals zur Verfügung, das Unternehmen liefert Technik und Marke.

Zweiter Schritt: Verkauf der Roboter. Das gemeinsame Datenerfassungszentrum kauft Dutzende bis Hunderte von Geräten beim Robotikunternehmen, jedes kostet 600.000 bis 700.000 Yuan. Ein Datenerfassungszentrum in einer Stadt der zweiten Ebene tätigt normalerweise einen einmaligen Einkauf im Wert von mehreren zehn Millionen bis zu hundert Millionen Yuan, und das Unternehmen verzeichnet einen Einnahmenzuwachs in der Bilanz.

Dritter Schritt: Kauf der Daten. Nachdem das Zentrum in Betrieb genommen wurde, zahlt das Unternehmen dem Zentrum unter dem Vorwand des „Kaufs von Datendienstleistungen“ Geld, das zurückfließt.

Nach einem Umlauf wird das von der Regierung ausgegebene Geld zu Vermögen und Betriebskosten des Zentrums, und in der Bilanz des Unternehmens erscheinen ein Umsatz und eine Kostenposition für den Datenkauf. Aber wer ist der Endverbraucher der Daten? Das Robotikunternehmen selbst.

Mitarbeiter des von der FT befragten Trainingszentrums gaben offen zu: Nur ein kleiner Teil der Daten wurde an Käufer verkauft, die keine Roboterhersteller sind.

Der unabhängige Technologieanalytiker Zhao Saipo fasste es präzise zusammen: „Die Grenze zwischen unabhängiger Nachfrage und einer Nachfrage, die innerhalb eines von der Politik unterstützten Ökosystems geschaffen wird, wird dadurch verschwommen.“ Übersetzt bedeutet das: Wenn Käufer innerhalb desselben Systems geschaffen werden, verliert der Begriff „Nachfrage“ seine Bedeutung.

Die zwei Seiten der Datenerfassungszentren

An dieser Stelle entsteht leicht der Irrtum, dass Datenerfassungszentren Betrug seien.

Die Sache ist nicht so einfach: Datenerfassungszentren selbst haben einen echten Wert.

Die Branche fehlt tatsächlich an Daten, Roboter müssen tatsächlich üben, und es ist nichts Falsches daran, dass lokale Regierungen die zukünftige Industrie entwickeln wollen. Daten sind der zentrale Produktionsfaktor von Embodied Intelligence – das sagen nicht nur Unternehmen, sondern auch die Nationale Entwicklungs- und Reformkommission hat ausdrücklich darauf hingewiesen, dass ein System zur Erfassung von Echtgerätedaten aufgebaut werden muss, um den „Datenhunger“ zu stillen.

Ein normales Datenerfassungszentrum sollte einen positiven geschlossenen Kreislauf bilden: Roboter betreten reale Szenarien → erzeugen gültige Daten → die Daten fließen in das Modelltraining → die Fähigkeiten verbessern sich → kehren zu den Szenarien zurück und erledigen mehr Aufgaben → Kunden sind bereit, kontinuierlich zu zahlen → neue Aufträge und mehr Daten.

Jeder Schritt erzeugt Wert.

Gibt es solche positiven Beispiele? Ja.

Zum Beispiel die Zusammenarbeit zwischen Its Robotik und Aptiv: Das Entwicklungsteam arbeitet monatelang direkt in den Werkstätten an der Optimierung von Prozessdetails. Die Roboter wurden von einzelnen Arbeitsplätzen auf die gesamte Produktionslinie ausgeweitet, Hundertschaften von Robotern arbeiten stabil im Verbund und schreiten in Richtung einer skalierten Bereitstellung im Tausend-Maßstab voran.

Shanghai Xinzhi Embodied verfolgt den Ansatz des Tastsinns: Es ist aus der Fudan-Universität hervorgegangen und hat ein tausend Quadratmeter großes Datenerfassungswerk für Tastsinn aufgebaut, das alle Dimensionen physischer Informationen bei feinen Bedienvorgängen erfasst. Seine visuellen und taktilen Sensoren werden auch bereits in den Systemen führender Kunden validiert.

Diese Unternehmen betreiben ebenfalls Datenerfassung, arbeiten mit Regierungen zusammen und erhalten Finanzierungen. Der Unterschied liegt darin, dass die Daten tatsächlich