Keynote-Rede: Warum „Industrie für visuelle Szenarien"? | 2026 Globale Konferenz der Industrie für visuelle Szenarien
Von „Die Welt scharf fotografieren“ bis „Die Welt verstehen“ – wenn die Bildverarbeitung nicht mehr nur ein Geschäft mit Geräten ist, definiert Chinas Hardware-Industrie für Bildverarbeitung ihre Grenzen neu. Auf der 2026 Global Conference for Image Scene Industry, die am 22. September in Shenzhen stattfand, hielt Zou Ping, Direktor des 36kr Research Institute, die Hauptrede mit dem Titel „Warum ist es die ‚Bildszene-Industrie‘?“.
Sie stellte fest, dass Chinas Bildszene-Industrie sich von einem reinen Wettbewerb um Hardware zu einem umfassenden Wettbewerb um Ökosystem und Erlebnis weiterentwickelt.
Nach Zou Pings Einschätzung erfährt die Rolle der Bildverarbeitung einen qualitativen Wandel: Auf politischer Ebene ist sie nicht mehr ein geförderter Nischenbereich, sondern als „Infrastruktur für intelligente Wahrnehmung auf der Geräteseite“ und „technologische Kernbasis für branchenübergreifende Befähigung“ in den Leitlinien des 15. Fünfjahresplans verankert. Auf technologischer Ebene verlagert die hybride KI den Wertschwerpunkt der Industrie von der „Bildqualität“ zur „Wahrnehmungsintelligenz“ – Geräte sind nicht mehr nur für die Aufzeichnung von Bildern zuständig, sondern beginnen, die Semantik von Bildern zu verstehen, in Echtzeit zu interagieren und sogar Inhalte zu generieren. Mit anderen Worten: Die Bildverarbeitung entwickelt sich von einer definierten Branche zu einer Grundlage für die digitale und intelligente Transformation von Tausenden von Branchen, und ihr Wachstumspotenzial liegt nicht mehr im ursprünglichen Koordinatensystem.
Die Logik des industriellen Wettbewerbs ändert sich entsprechend. Von der Ära der optischen Bildverarbeitung über die Handybildverarbeitung und die KI-Bildverarbeitung 1.0 bis hin zur KI für Bildverarbeitung auf der Geräteseite hat Chinas Bildszene-Industrie vier Sprünge entlang der technologischen Kurve vollzogen, aber der Wettbewerb konzentrierte sich stets auf Objektive, Sensoren und Bildgebungsparameter. Das Besondere an dieser Runde ist: Die KI auf der Geräteseite gibt die Bildverarbeitungsfähigkeiten, die früher nur Fachleuten zur Verfügung standen, systematisch an normale Nutzer weiter. Die Struktur der Erzeuger wandelt sich von einer Pyramidenform zu einer Olivenform, und der entscheidende Faktor ist nicht mehr nur die einzelne Hardware, sondern wer mehr Szenarien abdecken und die Nutzer mit dem Zubehörökosystem im eigenen System halten kann. Die Daten zeigen bereits Signale: Die nächsten fünf Jahre sind ein Zeitfenster für Chinas inländischen Bildhardware-Markt, in dem das Marktvolumen stark wächst. Dabei beträgt die jährliche Wachstumsrate der peripheren Zusatzgeräte 9,2 %, was deutlich über der der Hauptgeräte liegt. In einem Markt mit einer durchschnittlichen jährlichen Wachstumsrate von 6,73 % erreicht ein Segment eine Wachstumsrate von 9 % – das ist der Beweis für den Wechsel des Wachstumsmotors.
„Die Hauptgeräte sind der Stamm, die peripheren Geräte sind die Zweige und Blätter, und die Anwendungsszenarien sind der Boden. Zusammen bilden sie ein nachhaltig entwickeltes Ökosystem der Bildszene-Industrie.“ Und Zou Pings Schlussfolgerung lautet nur ein Satz: Die nächste Etappe der chinesischen Bildverarbeitung hat den Wettbewerb um Hardware hinter sich gelassen und ist zum Wettbewerb um Szenarienökosysteme geworden.
Im Folgenden ist der redigierte Redetext abgedruckt.
Zou Ping: Guten Morgen allerseits! Ich bin Zou Ping vom 36kr Research Institute. Vielen Dank an Leqi Innovation für die Einladung, dass 36kr an der heutigen Veranstaltung teilnehmen kann. In Zeiten des wirtschaftlichen Abschwungs sehen wir eine dynamische Industrie, die der gesamten industriellen Entwicklung neue Hoffnung geben kann.
Bevor ich mit meinem Bericht beginne, möchte ich kurz das Forschungsinstitut vorstellen: Es befasst sich hauptsächlich mit Forschung zu neuen Wirtschaftsbereichen, neuen Modellen, neuen Geschäftsformen und neuen Industrien. Das heutige Thema, die Bildszene-Industrie, gehört ebenfalls zu unseren Schwerpunktforschungsbereichen. Insbesondere durch die Unterstützung der hybriden KI können wir sehen, dass die Endgeräte für Bildverarbeitung einen tiefgreifenden Wandel durchlaufen. Heute freue ich mich sehr, Ihnen unsere Erkenntnisse zur Bildszene-Industrie vorzustellen, einschließlich der Entwicklungsbedingungen von Bildhardware, dem Wandel der Anwendungsszenarien und der Prognose für das zukünftige Marktvolumen der Hardware-Industrie.
Dieses Jahr ist das Startjahr des 15. Fünfjahresplans. Der Staat und die lokalen Regierungen haben nacheinander die Leitlinien des 15. Fünfjahresplans veröffentlicht und die industriellen Richtungen festgelegt, auf die in den nächsten fünf Jahren der Fokus gelegt wird. Aus den Leitlinien des 15. Fünfjahresplans und den zugehörigen Richtlinien geht hervor, dass die allgemeine Positionierung des Staates für die Bildhardware-Industrie grob auf zwei Kernpunkte zusammengefasst werden kann: die Infrastruktur für intelligente Wahrnehmung auf der Geräteseite und die technologische Kernbasis für branchenübergreifende Befähigung. Das bedeutet, dass Bildverarbeitung nicht mehr nur ein einzelnes Produkt oder eine Funktion ist, sondern zu einer wichtigen Grundlage wird, die Tausende von Branchen wie Industrie, Inhaltsproduktion, Konsum und Film- und Fernsehwesen bei der Umsetzung der digitalen und intelligenten Transformation unterstützt.
Auf dieser Grundlage haben die zuständigen Behörden eine Reihe von begleitenden Unterstützungsrichtlinien nacheinander herausgegeben, die hauptsächlich die Unterstützung durch staatliche Leitfonds und die Öffnung von Szenarien umfassen. Um die hochwertige Entwicklung der Bildszene-Industrie zu fördern, bieten viele lokale Regierungen auch konkrete finanzielle Vorteile, die die Innovationskosten und die Innovationsschwellen von Unternehmen wirksam senken können.
Im Bereich der KI-Bildgenerierung bieten Rechenzentren in Städten wie Peking, Shanghai und Shenzhen Rechenleistungsbeihilfen für das erforderliche Training an und gewähren einmalige Anreize für registrierte generative KI-Dienste. Insgesamt gesehen haben sich die staatlichen Richtlinien von der früheren Vergabe von Ehrenauszeichnungen zu einer Unterstützung entwickelt, die nicht nur Szenarien und Aufträge bereitstellt, sondern auch finanzielle Förderung leistet. Das kann verwandten Unternehmen wirksam dabei helfen, eine hochwertige Entwicklung zu erreichen, und damit auch die großflächige Anwendung der Bildszene-Industrie fördern, die zu einer wichtigen Infrastruktur für die branchenübergreifende Befähigung wird. Wie gerade Herr Zhou Yang sagte, kann sie die grundlegendste Grundlage für die Umsetzung der digitalen und intelligenten Transformation und die hochwertige Entwicklung von Tausenden von Branchen sein.
Unser Forschungsinstitut hat tiefgreifende Forschung im Bereich der künstlichen Intelligenz betrieben. Wir arbeiten eng mit vielen Endgeräteherstellern, Großmodellunternehmen und embodied AI-Unternehmen zusammen und forschen gemeinsam. Aus der Entwicklungsgeschichte der Bildszene-Industrie geht hervor, dass Chinas Bildszene-Industrie durch technologische Antriebskräfte vier Sprünge vollzogen hat:
Die erste Phase ist die Ära der optischen Bildverarbeitung, deren Kern Objektive und Bildsensoren sind. Der Markt wurde damals hauptsächlich von ausländischen Unternehmen wie japanischen und deutschen Unternehmen dominiert. Chinesische Unternehmen waren hauptsächlich in niedrigwertigen Tätigkeiten wie Modulmontage und Fertigung tätig und befanden sich im Grunde am untersten Ende der „Smile Curve“. Mit der rasanten Verbreitung von Smartphones haben die inländischen Marken Huawei, Xiaomi, OPPO und Vivo die Lieferkette, insbesondere die heimische Lieferkette, allmählich aufgebaut und die Bildszene-Industrie in die zweite Phase vorangetrieben. Die dritte Phase ist die Ära der KI-Bildverarbeitung 1.0, bei der szenenbasierte Erkennung, Nachtmodusverbesserung und Porträtunschärfe auf Basis von Deep Learning zum Standard geworden sind. Die KI-Funktionen wandern allmählich von der Cloud zur NPU auf der Geräteseite, bleiben aber auf einzelne Funktionen beschränkt, und das Kernziel ist immer noch, Bilder schöner zu machen. Die vierte Phase ist die Ära der KI für Bildverarbeitung auf der Geräteseite. Das Ziel der hybriden künstlichen Intelligenz ist es, dass die Bildverarbeitung nicht mehr darauf beschränkt ist, Bilder scharf und schön aufzunehmen, sondern die Semantik von Bildern zu verstehen, in Echtzeit zu interagieren und sogar Inhalte zu generieren, zum Beispiel Echtzeitübersetzung und räumliche Rekonstruktion. In dieser Phase verlagert sich der Wertschwerpunkt der gesamten Industrie von der Bildqualität zur Wahrnehmungsintelligenz.
Was ist hybride künstliche Intelligenz, um uns das Verständnis dafür zu erleichtern, wie die KI auf der Geräteseite mit Hardware zusammenwirkt? Der Kern der hybriden künstlichen Intelligenz besteht darin, die Beschränkungen einzelner Modelle und Architekturen zu durchbrechen. Durch die Integration von großen Cloud-Modellen und großen Gerätemodellen wird die Koordination heterogener Rechenressourcen zwischen Gerät und Cloud betont, um eine vielfältige und effiziente intelligente Ökosystemarchitektur aufzubauen.
Beispielsweise kann die hybride künstliche Intelligenz je nach Anforderungen des Bildszenarios, Komplexität der Aufgabe und Datenschutzanforderungen flexibel heterogene Rechenressourcen wie GPU, NPU und CPU aufrufen. Einfache, in Echtzeit zu erledigende Aufgaben mit hohen Datenschutzanforderungen können auf der Geräteseite abgeschlossen werden: Die Verarbeitung von Bildern und Videos mit hohen Datenschutzanforderungen kann auf der Rechenleistung des Geräts erfolgen, ohne in die Cloud zu gelangen, um Schnitt- und Bearbeitungsarbeiten durchzuführen und so Datenschutzverletzungen zu vermeiden. Komplexe Aufgaben wie das Schnitt und die Bearbeitung von Langvideos können bei Bedarf an die Cloud weitergeleitet werden, sodass die Rechenunterstützung flexibel an die Anforderungen der Aufgabe angepasst wird.
Die technischen Veränderungen führen zu einer zunehmenden Vielfalt von Aufnahmegeräten, und die Hürden für die Aufnahme sinken schnell. Früher gab es hohe Barrieren für die Film- und Fernsehproduktion: Man musste Blende und Verschluss verstehen, die Farbkorrektur beherrschen, und die Geräte waren sehr schwer. Heute gibt die KI auf der Geräteseite die Bildverarbeitungsfähigkeiten, die früher nur Fachleuten zur Verfügung standen, systematisch an normale Nutzer weiter. Intelligente Aufnahme und intelligente Bearbeitung sind zu den KI-Anwendungsszenarien geworden, die die Verbraucher am stärksten wahrnehmen. Die Weitergabe von Technologie führt zu einer Vielfalt von Geräteformen, und die Szenariomatrix von professionellen, semiprofessionellen bis hin zu verbraucherorientierten Bereichen wird ständig erweitert und verbessert und entsteht zunehmend.
Nehmen wir als Beispiel tragbare intelligente Bildgeräte: Nach der Prognose von CICC wird der inländische Absatz im Jahr 2026 6,13 Millionen Einheiten erreichen, und im Jahr 2027 wird dieser Absatz weiter auf 7,71 Millionen Einheiten steigen. Umgerechnet ergibt sich ein entsprechender Marktvolumen von 23,1 Milliarden Yuan. Diese Zahl bezieht sich nur auf die Hauptgeräte und schließt die peripheren Zubehörteile nicht ein. Der Kern des Wachstums von tragbaren Geräten liegt darin, dass sie die Lücke zwischen zu schweren professionellen Kameras und nicht ausreichend funktionsfähigen Smartphones schließen. Sie sind leicht, intelligent und sofort einsatzbereit und passen genau zu den beiden großen Szenarien der Kurzvideoproduktion und des Outdoor-Sports.
Die Leistung verbraucherorientierter Geräte ist ebenfalls sehr beeindruckend. Nach Daten von Lu Tu erreichte der Online-Gesamtabsatz von Actionkameras im ersten Halbjahr 3,119 Millionen Einheiten mit einem Umsatz von 8,2 Milliarden Yuan, wobei die Wachstumsraten gegenüber dem Vorjahr beide über 90 % lagen. Wir prognostizieren, dass der Online-Umsatz im Jahr 2026 insgesamt 20 Milliarden Yuan übersteigen wird. Der kombinierte Absatz von DJI und Insta360 macht mehr als 80 % des Marktes aus, was zu einem Wettbewerbsmuster mit zwei führenden Unternehmen führt.
Die größte Veränderung durch die Vielfalt der Geräte und die sinkenden Aufnahmehürden ist die zunehmende Abdeckung der Erzeugergruppe. Bis Ende 2024 belief sich die Anzahl der Konten von Kurzvideoerzeugern in China auf 1,62 Milliarden, und die tägliche Anzahl hochgeladener Kurzvideos im ganzen Land übersteigt 130 Millionen. Aus makroökonomischer Sicht bedeutet die Verankerung der Förderung der Massenkultur und -kunst in den Leitlinien des 15. Fünfjahresplans, dass die Schaffung durch die gesamte Bevölkerung zu einem wichtigen Bestandteil der nationalen Kulturstrategie geworden ist.
Von professionellen Film- und Fernsehteams über semiprofessionelle VLOG-Ersteller und Reiseblogger bis hin zu hunderten Millionen normalen Nutzern wandelt sich die Bevölkerungsstruktur der Bildverarbeitungserzeuger von einer Pyramidenform – bei der nur die Menschen an der Spitze professionelle Aufnahmekenntnisse beherrschen und mit professioneller Ausrüstung ausgestattet sind – zu einer Spindel- bzw. Olivenform: Auch Nutzer ohne professionelle Fähigkeiten können mit Geräten und zugehörigen Einrichtungen in die Bildszene-Industrie eintreten.
Geräte sind nicht mehr nur Produktionsmittel für Fachleute, sondern alltägliche Werkzeuge, mit denen alle Menschen sich ausdrücken und mit der Welt verbinden können.
Das Territorium der Bildszene-Industrie reicht weit über die Hauptgeräte hinaus. Wenn wir unseren Fokus von der Frage „Was aufzunehmen“ auf die Frage „Wie man gut und szenengerecht aufnimmt“ verlagern, bildet sich gerade ein größerer Markt heraus – nämlich die peripheren Geräte. Der Kern des Marktwachstums liegt in der Vielfalt der Anwendungsszenarien.
Vor der Veranstaltung habe ich mir die peripheren Produkte von Leqi Innovation draußen angesehen und war sehr überrascht: Die Geräte können die Anforderungen in verschiedenen Szenarien erfüllen, es gibt Hilfsgeräte für Bildstabilisierung und Kameraführung. Daraus geht hervor, dass die Anzahl der Szenarien, die ein einzelnes Gerät abdecken kann, relativ begrenzt ist.
Zum Beispiel reicht für alltägliche Szenarien ein Smartphone aus. Wenn man ein hochwertiges Video über ein Restaurant aufnehmen möchte, braucht man einen stabileren Ständer. Wenn man eine Outdoor-Live-Übertragung durchführen möchte, braucht man ein Aufnahmegerät, um den Ton klarer zu machen. Es gibt viele ähnliche Szenarien wie Radfahren im Freien und Unterwasseraufnahmen: Je spezialisierter das Szenario ist, desto unaufschiebbarer sind die Anforderungen an die peripheren Geräte.
Die Verbreitung von Hauptgeräten ist der Eingang für den Datenverkehr, und die Vielfalt der Szenarien ist der Verstärker des Werts. Jede Aufnahmehandlung wird zu einer Nachfrage nach einer Reihe von Zubehörteilen wie Stabilisatoren, Mikrofonen, Beleuchtung und Speichermedien. Es ist besonders erwähnenswert, dass die Tischgeräte von einer früheren Option zu einem Wettbewerbsvorteil des Ökosystems werden. Der Wettbewerbsschwerpunkt der Branche hat sich von einem reinen Hardwarewettbewerb zu einem umfassenden Wettbewerb um das Zubehörökosystem und das Nutzererlebnis weiterentwickelt. Das bedeutet, dass wenn Nutzer in das Ökosystem einer Marke eintreten, Zubehörteile wie Stabilisatoren, Mikrofone, Speicherkarten, Filter und Verlängerungsstangen eine kontinuierliche Nachkaufkette bilden werden. Die Tiefe des Zubehörökosystems ist die entscheidende Variable, die bestimmt, ob