StartseiteArtikel

Was sieht das Kapital eigentlich in der nativen All-Modal-Technologie, für die es 1,5 Milliarden Yuan als Wette einsetzt?

凡泛2026-07-29 11:31
Einen halben Schritt voraus.

Das Unternehmen für native all-modale große Modelle, Zhaoxiang Future, hat offiziell bekanntgegeben, dass es eine neue Runde der Finanzierung in Höhe von 1,5 Milliarden Yuan abgeschlossen hat. Dies ist bereits die dritte Finanzierungsrunde in den letzten drei Monaten. Die kumulierte Finanzierung übersteigt 2,1 Milliarden Yuan, die Bewertung nach der Investition überschreitet 1 Milliarde US-Dollar, und das Unternehmen zählt zu den Unicorns.

Diese Finanzierungsrunde wurde von dem Sichuan Revitalization Science and Technology Innovation Fund des Sozialversicherungsfonds, ICBC Capital, Hongyi Asset Management und Dunhong Capital angeführt, gefolgt von Shanghai Film New Vision Fund, Xiamen International Trade Capital, Huace Film & Television und anderen, während alte Aktionäre wie Hefei Industrial Investment und Oriental Fortune Hai weitere Beteiligungen tätigten. Staatliches Kapital, Finanzinstitute, marktorientierte Fonds und Kapital der Film- und Fernsehindustrie sind alle darin vertreten.

Besonders erwähnenswert ist diese Stimme des Kapitals der Film- und Fernsehindustrie: Industrieakteure wie Shanghai Film und Huace haben in der Vergangenheit in Inhalte, IP und Kinos investiert, diesmal setzen sie ihr Geld aber auf die grundlegenden Modelle im oberen Bereich. Obwohl es sich um eine Folgeinvestition handelt, wirft es ein echtes Problem auf – wenn KI beginnt, die Inhaltsproduktion neu zu gestalten, worauf genau setzen die beiden führenden Fonds der Film- und Fernsehindustrie, wenn sie in ein Unternehmen für große Modelle investieren?

Part01

Modelle und Anwendungen sind ineinandergreifende Zahnräder

Im Jahr 2026 kehrt die KI-Branche zurück zum Zyklus „Modelle sind Produktivkräfte“. Nachdem Zhipu und MiniMax nacheinander an die Börse gegangen sind, verschiebt sich die Waage des Kapitals von der Kommerzialisierung zurück zur Modellfähigkeit selbst. Die Beurteilung von Mei Tao, Gründer von Zhaoxiang Future, lautet, dass die Branche zurück zu 2023 kommt – „Modelle sind Produktivkräfte, Modelle sind Produkte“.

Im Gegensatz zu einigen Urteilen der „reinen Modelltheorie“ hat sich Zhaoxiang vom ersten Tag an nicht als reines Modellunternehmen definiert.

Die zwölf Jahre, die Mei Tao in dem Microsoft Research Asia verbracht hat, in denen er sein Team zu einem der weltweit führenden Videogenerierungsmodelle TGANs-C geführt hat, lassen ihn glauben, dass es noch große Chancen für Modellinnovationen gibt; und die fünf Jahre, in denen er bei JD für das KI-Geschäft und die industrielle Implementierung verantwortlich war, haben ihm eine andere Tatsache klar gemacht: Technische Führungsstärke bedeutet keinen geschäftlichen Erfolg, und Modellfähigkeiten wandeln sich nicht automatisch in Marktvorteile um.

Das bestimmt, dass Zhaoxiang den Weg der zweirädrigen Antriebskraft „Modell + Anwendung“ geht: Die unterste Schicht ist eine selbst entwickelte native all-modale Architektur, die obere Schicht sind Anwendungen, die wirklich in industrielle Prozesse einfließen können. Nach Mei Taos Auffassung sind die beiden Räder keine zwei unabhängigen Geschäftslinien, sondern eine Gruppe ineinandergreifender Zahnräder – Anwendungen liefern Daten und Rückmeldungen aus echten Szenarien für Modelle, und Modelle bieten Anwendungen ein Fähigkeitspotenzial, das andere kurzfristig nicht einholen können.

Diese zweirädrige Struktur hat den geschlossenen kommerziellen Kreislauf bereits in Szenarien wie Marketing und Film- und Fernsehen validiert. Was aber wirklich die Obergrenze von Zhaoxiang bestimmt, ist die unterste Architektur, die „einen halben Schritt schneller“ iteriert.

Part02

Man muss einen halben Schritt vorauseilen

Mei Tao hat eine weitverbreitete Metapher: „Große Konzerne sind Maschinengewehre mit unbegrenzter Munition; Startups haben nur ein Magazin, und jede Kugel muss in die Zukunft gerichtet sein.“

Seiner Meinung nach ist ein Rückstand bei einer Modellbewertung für Startups nicht tödlich. Das eigentliche Problem ist, von großen Konzernen in einen Zermürbungskrieg gezogen zu werden, bei dem es darum geht, wer länger durchhalten kann. Die Reserve an Rechenleistung, Kapital und Talenten bestimmt, dass beide Seiten nicht in der gleichen Größenordnung liegen. Die praktische Überlebensweise für Startups ist, bei Innovationen der untersten Architektur einen halben Schritt schneller zu sein als große Konzerne – jede Kugel muss in eine Richtung geschossen werden, auf die andere noch nicht reagiert haben.

Dieser halbe Schritt von Zhaoxiang basiert auf einer einheitlichen Architektur namens Native All-Modality (UiT).

Die gängige Praxis in der Branche ist, dass Bildgenerierungsmodelle zuerst das Bild mit VAE komprimieren und es dann an unabhängige Text-Encoder und Generierungsmodelle zur separaten Verarbeitung übergeben. Das spart Rechenleistung, hat aber den Nachteil, dass bei der Kompression und Rekonstruktion leicht hochfrequente Details wie Schriftstriche und Materialtexturen verloren gehen, und wenn Text und Bild getrennt kodiert werden, ist die Semantik schwer abzustimmen.

Die native all-modale Architektur (UiT) verwendet einfach keinen externen VAE und keinen separat vortrainierten Text-Encoder, sondern legt ursprüngliche Pixel, Text-Token und Aufgabenbedingungen in denselben Raum und überlässt sie derselben Transformer-Verarbeitung. Nachdem alle Modalitäten verbunden sind, kann man wirklich „Any-to-Any“ erreichen: Beliebige Eingaben unterstützen beliebige Ausgaben. Das ist auch die Fähigkeit, die ein Weltmodell benötigt – verschiedene Zustände der realen Welt in einer einheitlichen Architektur zu verstehen, zu generieren und vorherzusagen. Das ist eine vorzeitige Positionierung auf der Ebene des Architekturparadigmas.

Diese Positionierung des halben Schritts wird nach und nach wirksam. Im Mai 2026 erreichte das Open-Source-Modell HiDream-O1-Image von Zhaoxiang den ersten Platz weltweit auf der Open-Source-Liste von Artificial Analysis; im Juni erreichte die kommerzielle Version HiDream-O1-Image-1.5 den dritten Platz weltweit.

(Anmerkung zum Bild: Der Screenshot dieser Liste wurde am 22. Juni 2026 erstellt)

Betrachtet man die gesamte Branche, wird die Bedeutung dieses halben Schritts klarer. Die meisten Hersteller in der Branche setzen an dem einzelnen Punkt „Videogenerierung“ an; Zhaoxiang hat seit seiner Gründung darauf bestanden, Bildgenerierung und Videogenerierung „zweifach“ voranzutreiben, und durch die Innovation der nativen all-modalen Architektur (UiT) die Vereinheitlichung von Modalitäten wie Bild, Video, Sprache, 3D-Interaktion und Bewegung realisiert. Das ist ein Unterschied in der Route und auch die eigentliche Quelle des „einen halben Schritts Vorsprung“ – es wird nicht auf einen Platz in der Liste gewettet, sondern darauf, dass das Zeitfenster der nativen all-modalen Route länger ist als das von allgemeinen großen Sprachmodellen und eine sehr hohe Obergrenze hat.

Part03

Der „Planet“-Test

Der Wert der Modellroute wird schließlich von den Nutzern durch Agenten wahrgenommen. Auf der gerade beendeten WAIC 2026 hat Zhaoxiang Future vivago R1 vorgestellt, das als „Inhaltserstellungs-Agent mit unbegrenzter Dauer“ bezeichnet wird.

Sein bester Beweis stammt von einer kniffligen Testaufgabe: Ein Produktprüfer ließ vivago R1 einen „türkischen gefälschten Star Wars“ drehen – einen ultraniedrig budgetigen Kultfilm mit Pappmaché-Monstern, Schöpfkellen als Helmen und Schaumstoffsteinen.

Die Schwierigkeit ist subtil: Die natürliche Tendenz von KI ist, Bilder exquisit zu rendern, aber diese Aufgabe verlangt von ihr, den billigen Effekt von „lächerlich unecht“ beizubehalten. Im fertigen Film von mehr als einer Minute sind Captain Ali mit Schnurrbart und roter Kleidung sowie das Pappmaché-Monster mit der Schöpfkelle als Helm durchweg das gleiche Bild, und sie wurden nicht heimlich zu exquisitem CGI gerendert – die Agenten-Orchestrierung auf der oberen Schicht hat die ästhetische Trägheit des unteren Modells unterdrückt.

Diese Kohärenz beruht nicht auf Glück. R1 läuft nach einer strukturierten Pipeline: Geschichte schreiben → Drehbuch überarbeiten → Szenen aufteilen → Kunststil festlegen → Referenzbilder für Rollen und Szenen sperren → Szene für Szene generieren → zum fertigen Film zusammenfügen.

Der sogenannte „unbegrenzte Dauer“ braucht auch Entmystifizierung: Es gibt nicht sofort einen zweistündigen Film aus, sondern Rollen, Requisiten und Szenen werden im langfristigen Herstellungsprozess zu wiederverwendbaren Vermögenswerten verfestigt, sodass die Geschichte immer weiter fortgesetzt werden kann. Das trifft genau das, was das Industriekapital sehr schätzt – IP von einem statischen Urheberrechtsbestand zu einem wiederholt aufrufbaren digitalen Vermögenswert zu machen.

vivago geht den gemischten Weg „selbst entwickelte Basis + Aggregationsplanung + obere Orchestrierung“. Sein Schutz liegt nicht darin, dass „alle Bilder selbst entwickelt sind“, sondern in der Orchestrierungsfähigkeit und der langfristigen Konsistenz. Aggregation ist ein Mittel, Orchestrierung ist das Produkt, und das letztendliche Erlebnis ist der Ort, um den alle konkurrieren.

Part04

In industrielle Prozesse einfließen

Mit dieser Investition des Industriekapitals ist die Prüfung für Zhaoxiang Future nicht mehr nur der Platz auf der Modellliste, sondern ob es wirklich in industrielle Prozesse einfließen kann.

Für Gu Yuhao, Geschäftsführer des Shanghai Film New Vision Fund, bedeutet die Investition in Zhaoxiang Future nicht nur, seine Produktfähigkeit zu beachten, sondern „die technische Basis für das zukünftige industrielle System von Film und Fernsehen im Voraus aufzubauen“. Er will prüfen, ob dieses Unternehmen das unterste Modell, die mittlere Plattform und die branchenspezifischen Agenten verbinden kann, um Drehbuch, Rollen, Szenen, Aufnahmen und Ton in dasselbe digitale System zu bringen, sodass IP von statischem Urheberrecht zu einem wiederholt aufrufbaren digitalen Vermögenswert wird.

Mit Gu Yuhaos Worten: „Kunden aus der Film- und Fernsehbranche zahlen nicht nach der Liste, am Ende zählt nur das Ergebnis der Lieferung.“ Das ist eine Anerkennung, aber auch eine schwierigere Prüfungsaufgabe: Zwischen einem beeindruckenden Demo und einer stabilen, großmaßstäblichen Lieferung liegt eine nicht kurze „industrielle Distanz“.

Wenn Gu Yuhao die strategische Qualifikation für „Warum investieren“ gegeben hat, dann gibt Zhang Situo, Vizepräsident von Huace Film & Television, ein Urteil ab, das bereits in der Produktionslinie erprobt wurde.

Nach Zhang Situs Auffassung ist der erste Bereich, in dem KI Wert erzeugt, nicht der kreative Bereich, sondern die „zeit- und arbeitsintensiven Abschnitte mit geringem technischen Gehalt“ – erste Filterung von Drehbüchern, Sortierung von Materialien, Schnitt mehrerer Versionen, Untertitelübersetzung. In der beliebten Serie *Taiping Nian*, die von Huace produziert wurde, wurden KI-generierte Hintergrundmaterialien für einige Szenen verwendet, was den Produktionszyklus stark verkürzt und die globale Verteilung für die 68 Millionen ausländischen Abonnenten von Huace wirksam unterstützt.

Noch wichtiger ist sein Kriterium, um zu beurteilen, ob ein Modell wert ist, zusammenzuarbeiten: Aus Sicht von Film- und Fernsehunternehmen ist es nicht, „ob es schöne Bilder generieren kann“, sondern „ob es den Denkstil eines Regisseurs hat – die Sprache der Aufnahmen versteht und den Rhythmus der Erzählung beherrscht“.

Dieser Satz stimmt genau mit der strukturierten Planung von vivago R1 überein, die „zuerst das Drehbuch schreiben, dann die Referenzbilder sperren und szene für szene generieren“ lautet. Der „Regisseur-Denkstil“ auf Modellebene ist genau der Grund, warum Industrieakteure bereit sind, zu investieren.

Nach diesem Kriterium teilt Zhang Situo die Aufwertung der Wettbewerbsfähigkeit von Film- und Fernsehunternehmen in drei Schritte auf: Wettbewerb um Effizienz → Wettbewerb um Vermögenswerte → Wettbewerb um Ökosysteme. Er schätzt den zweiten Schritt am meisten: „Früher war das Wertvollste an Film- und Fernsehunternehmen die Urheberrechtsbibliothek, jetzt müssen statische Urheberrechte zu „berechenbaren Inhaltsvermögenswerten“ aufgewertet werden: Drehbücher können von KI durchsucht werden, fertige Filme können zerlegt und neu zusammengesetzt werden, und Produktionserfahrungen können gesammelt und wiederverwendet werden.“

Das ist fast die gleiche Aussage wie Gu Yuhaos Urteil über „digitale Vermögenswerte“.

Bei dem Implementierungsrhythmus sind sich die beiden Kapitalgeber außerordentlich einig. Der Kooperationspfad von Huace beginnt bei „schnell validierbaren“ Richtungen wie kurzen KI-Qualitätsserien, mittelfristig geht es um die zweite Entwicklung von digitalen IP-Materialien und die vollständige KI-Koordination für lange Hauptserien; Gu Yuhao ist der Meinung, dass KI in der aktuellen Phase besser für Werbematerialien, vorbereitende Entwicklung, Animationen, Manga-Serien und stilisierte Kurzfilme geeignet ist, während lange Realfilme noch viel schwieriger sind. Die beiden Kapitalgeber der Film- und Fernsehbranche haben denselben Zeitplan vorgelegt: Kurzfristig geht es um Unterstützung und leichtgewichtige Inhalte, langfristig erst um die Neugestaltung.

In der Industrie sind die Vorlieben von staatlichem Kapital und Industriekapital immer klar: Wenn man in ein Unternehmen investiert, sollte man am besten mehrere industrielle Ketten antreiben. Visuelle Verarbeitung ist genau eine Ebene in großen Modellen, die sehr nah an der Industrie liegt – Film und Fernsehen, Tourismus, Marketing, E-Commerce sind alles fertige Szenarien, und die Ergebnisse, die Zhaoxiang geliefert hat, können alle einzeln geprüft werden. Das Kapital fließt durch das Unternehmen in die Industrie und kann mit einem Hebel eine große Skala antreiben.

Part05

Das weiter entfernte Ziel ist das Weltmodell

Zhaoxiang Future setzt das weiter entfernte Ziel auf das Weltmodell, aber Mei Tao bleibt bei diesem Begriff immer zurückhaltend: „Wir glauben nicht, dass die Branche heute das Weltmodell vollständig realisiert hat.“ Seiner Meinung nach ist ein Bild der räumliche Zustand zu einem bestimmten Zeitpunkt, und ein Video fügt die Zeitdimension hinzu. Wenn man dieser Linie folgt, muss das Modell noch räumliche Strukturen, Folgen von Bewegungen, Kausalitäten und physikalische Gesetze verstehen.

In diesem Koordinatensystem betrachtet, will Zhaoxiang Future nicht einzelne Produkte vorantreiben, sondern eine untergeordnete native all-modale Route, die verschiedene Modalitäten wie Text, Bild, Video, Ton und Bewegung auf der untersten Ebene ausrichtet und schließlich zu beliebigen Eingaben und Ausgaben verschiedener Modalitäten führt. Damit das Weltmodell wirklich die Fähigkeit erlangt, die reale Welt zu verstehen, vorherzusagen und neu zu gestalten.

Von der visuellen