StartseiteArtikel

Der große Juli-Wettbewerb um KI-Videogenerierung: Über 20 Milliarden an Kapital strömen scharenweise in den Markt, wer hat den Einzug in die Finalrunde geschafft?

IT桔子2026-07-28 15:20
Noch ist der Juli nicht zu Ende, und der Sektor der KI-Videogenerierung ist bereits extrem heiß gelaufen.

Der Juli ist noch nicht vorbei, und die KI-Videogenerationsbranche ist bereits extrem heiß gelaufen.

Vom 3. Juli bis zum 23. Juli, innerhalb von nur 20 Tagen, haben 5 Unternehmen nacheinander große Finanzierungsrunden angekündigt. Kling AI erhielt 3 Milliarden US-Dollar, Shengshu Technology 500 Millionen US-Dollar, Aishi Technology erhielt mehrere hundert Millionen US-Dollar in der C+ Runde, Zhixiang Future 1,5 Milliarden Yuan in der C-Runde, und selbst ein neues Unternehmen namens FlovaAI, das vor weniger als einem Jahr gegründet wurde, erhielt 80 Millionen US-Dollar in der Angel-Runde.

Zusammen übersteigen die Finanzierungsbeträge der ersten vier Unternehmen, die den Einhorn-Status erreicht haben, 26,2 Milliarden Yuan. Das bedeutet, dass das in diesem Juli 2026 zugeführte Kapital höher ist als die Summe der gesamten Branche in den vergangenen zwei Jahren (2024-2025).

Warum haben sie sich alle im Juli für die Finanzierung entschieden, was ist genau passiert? Das kann kein Zufall sein.

Kling AI: Historische gemeinsame Investition von BAT, ARR vervierfacht sich innerhalb eines Jahres

Am 3. Juli kündigte Kling AI eine A-Runden-Finanzierung mit einer Obergrenze von 3 Milliarden US-Dollar an, angeführt von CPE Yuanfeng und Guofang Innovation, mit Beteiligung von 34 Institutionen – in der Liste der Investoren tauchen Tencent, Alibaba Cloud und Baidu selten gleichzeitig auf. Lighthouse Capital fungierte als Finanzberater.

Die Obergrenze der A-Runde von 3 Milliarden US-Dollar entspricht einer Post-Geld-Bewertung von etwa 18 Milliarden US-Dollar; der derzeit unterzeichnete Teil beträgt etwa 19 Milliarden Yuan.

Warum wagt das Kapital diese Bewertung? Das liegt daran, dass der Geschäftsbericht von Kuaishou für das erste Quartal 2026 dem Markt Vertrauen gegeben hat.

Laut dem veröffentlichten Finanzbericht von Kuaishou für das erste Quartal 2026 übersteigt der Umsatz von Kling AI in einem Quartal 650 Millionen Yuan, was einem Anstieg von über 300 % im Vergleich zum Vorjahr entspricht. Die annualisierte Umsatzlaufrate (ARR) ist von 100 Millionen US-Dollar im März 2025 auf fast 500 Millionen US-Dollar im März 2026 gestiegen, was einer Vervierfachung im Vergleich zum Vorjahr entspricht.

Diese Zahl ist in der KI-Videobranche ein Ausreißer – abgesehen von ByteDance Seedance gibt es kein zweites Unternehmen im Inland, das dieses Volumen erreicht hat.

Der Umsatz von Kling wird durch zwei Treiber gesteigert: API-Aufrufe von B2B-Unternehmenskunden + Abonnements von zahlenden P-Nutzern. Bis Juni 2026 überschritten die globalen Nutzer von Kling AI 100 Millionen, mit fast 50.000 Unternehmenskunden. Zum Beispiel war Kling tief an der Erstellung virtueller Szenen und Spezialeffekte für die beliebte chinesische historische Fernsehserie *Friedensjahre* beteiligt und unterstützte die Erstellung von Hunderten hochwertigen Aufnahmen in der Hollywood-Serie *The David Dynasty*.

Auf Produktseite hat Kling im Februar dieses Jahres die 3.0-Serie von Modellen veröffentlicht, die Videogenerationen von bis zu 15 Sekunden, Shot-Steuerung, Konsistenz des Hauptmotivs und gleichzeitige Erzeugung von Ton und Bild ermöglichen.

Zwei Details sind erwähnenswert. Erstens ist die Bewertung im Vergleich zum im Mai gemunkelten Ziel von 20 Milliarden US-Dollar etwas gesunken, die Preisgestaltung ist pragmatischer, und die Transaktion läuft stattdessen schneller ab. Zweitens ist eine Wandelklausel in der Ankündigung enthalten – falls Beijing Kling bis Oktober 2031 nicht an die Börse geht, haben die Investoren das Recht, die Rücknahme des Anteils nach Kapital plus 8 % einfache Zinsen pro Jahr zu verlangen.

Die Kombination aus Abspaltung, Finanzierung, Aktienanreizen und Rücknahmeklausel hat eine klare Ausrichtung: Kling bereitet den Weg für einen unabhängigen Börsengang.

Shengshu Technology: 500 Millionen US-Dollar Finanzierung am Vorabend des Börsengangs, Voranschreiten vom Videomodell zum „Weltmodell“

Am 6. Juli kündigte Shengshu Technology eine B+-Runden-Finanzierung von 500 Millionen US-Dollar an.

Wenn man die Zeitachse weiter betrachtet, hat dieses Unternehmen innerhalb von 5 Monaten 3 Runden erhalten: Im Februar über 600 Millionen Yuan in der A+-Runde (angeführt von Zhongguancun Science City und Xinglian Capital), im April 2 Milliarden Yuan in der B-Runde (angeführt von Alibaba Cloud), zusammen mit dieser 500-Millionen-US-Dollar-Runde im Juli summiert sich der Betrag auf über 5 Milliarden Yuan.

Drei Runden innerhalb von 5 Monaten – dieser Rhythmus zeigt eines: Das Kapital drängt, einzusteigen. Warum ist es so eilig?

Ende März dieses Jahres hat Shengshu Technology die Umwandlung in eine Aktiengesellschaft abgeschlossen – das ist der Standardschritt vor dem Börsengang. Marktquellen zufolge könnte es den Prozess für den Hongkong-Börsengang frühestens im ersten Halbjahr starten. Deshalb drängt das Kapital, am Vorabend des Börsengangs einzusteigen.

Das Kernprodukt von Shengshu Technology ist Vidu, das im Juli 2024 weltweit veröffentlicht wurde und nach drei Jahren auf die Version Vidu S1 aktualisiert wurde – ein Echtzeit-Interaktionsmodell, das sprachgesteuerte Frame-Steuerung und Generierung mit unbegrenzter Dauer (1 Minute bis 2 Stunden) unterstützt.

Im gesamten Jahr 2025 erzielte Shengshu Technology einen mehr als zehnfachen Anstieg von Nutzern und Umsatz, mit insgesamt über 400 Millionen erzeugten Videos. Vor allem die Liste der B2B-Kunden ist sehr stark: Im Bereich Werbung und E-Commerce gibt es JD.com, Alibaba 1688, Amazon, Meituan, Focus Media, BlueFocus, L'Oréal und Anta; im Bereich Film und Animation werden Tencent Animation, China Literature, CCTV Animation, iQiyi und Mango TV abgedeckt; im Spielbereich werden Lilith und 37 Interactive Entertainment bedient.

Shengshu Technology begnügt sich nicht nur mit der Videogenerierung, sondern erweitert sein Geschäft in diesem Jahr in Richtung Embodied Intelligence.

Im April 2026 veröffentlichte Shengshu Technology offiziell das universelle Welt-Aktionsmodell Motubrain, das die technische Route des World Action Model (WAM) nutzt, um Wahrnehmung, Vorhersage und Aktion in einem einheitlichen Modell zu vereinen. Dadurch erhalten Roboter die Fähigkeit zur „vorausschauenden Wahrnehmung mit einem Gehirn“ und „multifunktionalen Nutzung mit einem Gehirn“, während die kommerzielle Version von MotuBrain die industrielle Validierung erreicht.

Dieses von der Tsinghua-Universität gegründete Unternehmen ist erst 3 Jahre alt und entwickelt sich beschleunigt von einem „Videomodell-Unternehmen“ zu einer „Plattform für universelle Weltmodelle“. Nach dem Eingang der 500 Millionen US-Dollar werden die Mittel hauptsächlich für die Forschung und Entwicklung des „universellen Weltmodells“ verwendet.

Das ist die Geschichte, auf die das Kapital wirklich setzt.

Aishi Technology: Einhorn in drei Jahren, 150 Millionen Nutzer weltweit

Am 14. Juli wurde die C+-Runde von Aishi Technology von Alibaba angeführt. Zusammen mit der im März abgeschlossenen C-Runde über 300 Millionen US-Dollar (angeführt von DHC, mit Beteiligung von fast 20 Institutionen wie China Ruyi und 37 Interactive Entertainment) erreicht die gesamte C-Runden-Finanzierung 2,98 Milliarden Yuan, und die Post-Geld-Bewertung übersteigt 2 Milliarden US-Dollar.

Alibaba hat bereits im September 2025 die B-Runde von Aishi über 60 Millionen US-Dollar angeführt und verstärkt sein Engagement in dieser C+-Runde weiter. Auch Ant Group hat bereits im April 2024 die A2-Runde mit über 100 Millionen Yuan angeführt.

Die kontinuierliche Investition der Alibaba-Gruppe in Aishi zeigt, dass sie Aishi als strategischen Layout-Punkt in der KI-Videobranche betrachtet.

Bis März 2026 überschritten die globalen Nutzer von Aishi Technology 150 Millionen, mit 15 Millionen monatlich aktiven Nutzern, und die annualisierte regelmäßige Einnahme (ARR) erreichte 40 Millionen US-Dollar.

Interessanterweise enthüllte Mitbegründer Xie Xuzhang, dass die Trainingskosten von Aishi für Modelle gleicher Stufe nur etwa 10 % derjenigen von Konkurrenten betragen. Der Schlüssel zu diesem Kostenvorteil liegt in der Auswahl hochwertiger Daten, der Reduzierung ineffektiver Trainingsiterationen, der Nutzung der optimierten Diffusion Transformer-Architektur zur Erhöhung der Ressourcennutzung, der Senkung der Kosten pro Training und der Wiederverwendung von ingenieurstechnischen Erfahrungen.

Im Januar dieses Jahres veröffentlichte Aishi PixVerse R1, das als weltweit erstes universelles Echtzeit-Weltmodell mit 1080P-Unterstützung angekündigt wird. Im Gegensatz zur traditionellen „voraufgezeichneten“ Videogenerierung realisiert R1 die „Echtzeit-dynamische Generierung“ – Nutzer können während der Videowiedergabe jederzeit neue Anweisungen eingeben, und das Bild erreicht in etwa 0,5 Sekunden einen natürlichen und sanften Übergang von Licht, Schatten und Kamera.

Der Weg von Aishi unterscheidet sich von dem anderer Akteure: Während andere die Generierungsqualität verbessern, konzentriert es sich auf die Interaktionsfähigkeit. Nur eine Woche nach der Veröffentlichung von R1 kündigte China Ruyi eine strategische Zusammenarbeit mit Aishi an und investierte 14,2 Millionen US-Dollar.

Die Verwendung der neuesten C+-Runden-Finanzierung ist klar angegeben: für grundlegende Modelle der Videogenerierung, Echtzeit-Weltmodelle und globales Wachstum.

Zhixiang Future: Neues Einhorn, der ungewöhnliche Ansatz von „Modell + Intelligenzagent + Hardware“

Zhixiang Future ist das „neue Einhorn“ auf dieser Liste – nach der Umsetzung der 1,5-Milliarden-Yuan-C-Runde übersteigt seine Post-Geld-Bewertung 1 Milliarde US-Dollar. Gründer Mei Tao ist ausländisches Mitglied der Akademie der Ingenieurwissenschaften Kanadas und ehemaliger Vizepräsident von JD.com.

Dieses Unternehmen hat in den letzten drei Monaten drei Finanzierungsrunden nacheinander abgeschlossen, mit einem Gesamtbetrag von über 2,1 Milliarden Yuan.

Am 23. Juli kündigte Zhixiang Future eine C-Runden-Finanzierung von 1,5 Milliarden Yuan an, angeführt von dem Sozialversicherungsfonds, dem Sichuan Industrial Revitalization Fund und ICBC Investment, mit Beteiligung von Filmindustriekapital wie Shangying New Vision Fund und Huace Film & TV sowie 18 weiteren Institutionen – diese Kombination aus staatlichem langfristigem Kapital, lokalem staatlichem Kapital und Industriekapital ist in der KI-Videobranche nicht häufig zu sehen.

Zhixiang hat bereits im Mai 2024 das weltweit erste frei nutzbare Videogenerierungsmodell mit DiT-Architektur veröffentlicht und auf der kürzlich abgeschlossenen WAIC 2026 das multimodale Kreativagenten vivago R1 vorgestellt, das sich auf Generierung und Bearbeitung von Videos mit unbegrenzter Dauer konzentriert.

Derzeit decken seine Produkte über 100 Länder weltweit ab und bedienen mehr als 50 Millionen Nutzer und 40.000 Unternehmenskunden. Im gesamten Jahr 2025 überstieg der Umsatz 100 Millionen Yuan, und der Umsatz im ersten Quartal 2026 hat bereits den des gesamten Vorjahres übertroffen. Mei Tao erklärte während der Chain Expo 2026, dass aufgrund der hohen Kosten für das Vortraining großer Modelle erwartet wird, dass das Unternehmen im Jahr 2029 den monatlichen Break-Even erreicht.

Mei Tao drückte es sehr direkt aus: „Wir konkurrieren nicht mit ByteDance bei den grundlegenden Fähigkeiten, wir konzentrieren uns auf kommerzielles Marketing und professionelle Filmzusammenarbeit.“

Der Weg von Zhixiang ist sehr klar: Es vermeidet die direkte Konfrontation mit großen Unternehmen und vertieft sich in vertikalen Szenarien. Es baut zuerst eine Nutzerbasis mit Bildmodellen auf und entwickelt sich dann zu Video- und Weltmodellen weiter.

FlovaAI: 80 Millionen US-Dollar in der Angel-Runde, Guo Lies dritter Start

Der Gründer von FlovaAI, Guo Lie, ist ein unumgänglicher Name in der Geschichte des chinesischen mobilen Internets. Im Jahr 2013 schuf Guo Lie FaceQ, danach folgte FaceU – im Jahr 2018 wurde das Team von ByteDance für 300 Millionen US-Dollar übernommen. Danach beteiligte er sich bei ByteDance an der Inkubation von BeautyCam, Xingtu und Jianying – ja, Jianying wurde von ihm mitentwickelt.

Im Jahr 2025 startete Guo Lie erneut und gründete Shenzhen Yuzhou Technology, das im Oktober Flova.ai veröffentlichte. HSG, IDG und Yunjiu Capital haben insgesamt über 80 Millionen US-Dollar investiert.

Die Investoren geben 80 Millionen US-Dollar bereits in der Angel-Runde – sie setzen nicht auf das Produkt, sondern auf Guo Lie selbst. Jedes C-End-Browser-Tool-Produkt, das er früher gemacht hat, wurde zu einem phänomenalen Hit.

Flova ist eine KI-native Videokreations-Agenten-Plattform. Nutzer drücken ihre Kreativanforderungen durch Gespräche aus, und der Agent erledigt den gesamten Prozess von Drehbucherstellung, Charakterdesign, Shot-Design bis hin zu Bild-/Video-/Audiogenerierung und Montage der Zeitleiste.

Im Gegensatz zur gängigen Leinwand-Form auf dem Markt hat Flova ein „Storyboard“-Arbeitsfeld entworfen. Der Agent erhält Anweisungen im Dialogfeld, der Arbeitsprozess wird auf dem linken Storyboard angezeigt, Nutzer sehen das Ergebnis direkt in der mittleren Vorschauzone und können bei Unzufriedenheit jederzeit doppelklicken, um Änderungen vorzunehmen.

Mehrere frühe Nutzer berichten, dass