StartseiteArtikel

1,5 Milliarden Yuan werden als Wetteinsatz in native Omnimodal-Technologie gesteckt – worauf liegt das eigentliche Interesse des Kapitals?

晓曦2026-07-29 11:31
Einen halben Schritt voraus

Das Unternehmen für native multimodale Großmodelle Zhixiang Future hat offiziell den Abschluss einer neuen Finanzierungsrunde in Höhe von 1,5 Milliarden Yuan bekanntgegeben. Dies ist bereits die dritte Finanzierungsrunde innerhalb der letzten drei Monate. Die kumulierte Finanzierung übersteigt 2,1 Milliarden Yuan, die Bewertung nach der Finanzierung liegt über 1 Milliarde US-Dollar, womit das Unternehmen in die Reihe der Unikörpore aufgestiegen ist.

Diese Finanzierungsrunde wurde vom Sozialversicherungsfonds Sichuan Revitalization Science and Technology Innovation Fund, ICBC Capital, Hongyi Asset Management und Dunhong Capital angeführt, gefolgt von Shangying New Vision Fund, Xiamen International Trade Capital, Huace Film und anderen, während alte Aktionäre wie Hefei Industrial Investment und Oriental Fortune Hai weitere Beteiligungen tätigten. Staatseigene Kapitalgeber, Finanzinstitute, marktwirtschaftliche Fonds und Kapital der Film- und Fernsehindustrie sind alle daran beteiligt.

Besonders erwähnenswert ist diese Stimme des Kapitals der Film- und Fernsehindustrie: Industriepartner wie Shangying und Huace haben früher in Inhalte, IPs und Kinos investiert, dieses Mal setzen sie ihr Geld aber auf die grundlegenden Modelle im oberen Bereich. Obwohl es sich um eine Folgeinvestition handelt, wirft sie ein echtes Problem auf – wenn KI beginnt, die Inhaltsproduktion neu zu gestalten, worauf setzen die beiden führenden Fonds der Film- und Fernsehindustrie, wenn sie ein Unternehmen für Großmodelle finanzieren?

Part01

Modelle und Anwendungen sind ein ineinandergreifendes Zahnradpaar

Im Jahr 2026 kehrt die KI-Branche zurück zu dem Zyklus „Modell ist Produktivkraft“. Nach dem Börsengang von Zhipu und MiniMax hat sich die Waage des Kapitals von der Kommerzialisierung wieder zurück zu den Modellfähigkeiten selbst verschoben. Mei Tao, Gründer von Zhixiang Future, geht davon aus, dass die Branche zu 2023 zurückkehrt – „Das Modell ist Produktivkraft, das Modell ist Produkt“.

Im Gegensatz zu der Ansicht einiger Vertreter der „reinen Modelltheorie“ hat sich Zhixiang vom ersten Tag an nicht als reines Modellunternehmen definiert.

Mei Tao verbrachte zwölf Jahre am Microsoft Research Asia und leitete das Team, das TGANs-C entwickelte, eines der weltweit führenden Videogenerierungsmodelle. Das ließ ihn glauben, dass es bei der Modellinnovation noch große Chancen gibt. Fünf Jahre lang war er bei JD für das KI-Geschäft und die industrielle Umsetzung verantwortlich, was ihm eine weitere Erkenntnis vermittelte: Technische Führungsstärke bedeutet nicht automatisch kommerziellen Erfolg, und Modellfähigkeiten wandeln sich nicht von selbst in Marktvorteile um.

Das bestimmt, dass Zhixiang den Weg der zweirädrigen Antriebskonzeption „Modell + Anwendung“ geht: Die untere Ebene ist eine selbst entwickelte native multimodale Architektur, die obere Ebene sind Anwendungen, die tatsächlich in industrielle Prozesse integriert werden können. Für Mei Tao sind die beiden Räder keine zwei unabhängigen Geschäftslinien, sondern ein ineinandergreifendes Zahnradpaar – Anwendungen liefern dem Modell Daten und Feedback aus realen Szenarien, während das Modell den Anwendungen einen Fähigkeitsvorsprung verschafft, den andere kurzfristig nicht einholen können.

Diese zweirädrige Konzeption hat den kommerziellen Kreislauf bereits in Szenarien wie Marketing und Film- und Fernsehen validiert. Was aber die Obergrenze von Zhixiang wirklich bestimmt, ist die unterliegende Architektur, die „einen halben Schritt schneller“ iteriert.

Part02

Man muss einen halben Schritt vorpreschen

Mei Tao hat eine weitverbreitete Metapher: „Große Konzerne sind ein Maschinengewehr, dessen Kugeln nie ausgehen; Startups haben nur ein Magazin, und jede Kugel muss in die Zukunft zielen.“

Seiner Meinung nach ist ein Rückstand bei einer Modellbewertung für ein Startup nicht tödlich. Das eigentliche Problem besteht darin, von großen Konzernen in einen Zermürbungskrieg gezogen zu werden, bei dem es darum geht, wer länger durchhalten kann. Die Reserven an Rechenleistung, Kapital und Talenten machen deutlich, dass die beiden Seiten nicht in der gleichen Größenordnung liegen. Die praktische Überlebensstrategie für Startups besteht darin, bei der Innovation der unterliegenden Architektur einen halben Schritt schneller zu sein als große Konzerne – jede Kugel muss in eine Richtung zielen, auf die andere noch nicht reagiert haben.

Dieser halbe Schritt von Zhixiang basiert auf einer einheitlichen Architektur namens Native Unified Multimodal (UiT).

Die gängige Vorgehensweise in der Branche besteht darin, dass Bildgenerierungsmodelle zuerst das Bild mit einem VAE komprimieren und es dann unabhängigen Textencodierern und Generierungsmodellen zur separaten Verarbeitung übergeben. Das spart Rechenleistung, hat aber den Nachteil, dass bei der Kompression und Rekonstruktion leicht hochfrequente Details wie Schriftzüge und Materialtexturen verloren gehen. Da Text und Bild getrennt codiert werden, ist auch die semantische Ausrichtung oft nicht perfekt.

Die native multimodale Architektur (UiT) verzichtet ganz auf externe VAE und separat vortrainierte Textencodierer, sondern platziert ursprüngliche Pixel, Text-Token und Aufgabenbedingungen im selben Raum und lässt sie von derselben Transformer-Verarbeitungseinheit verarbeiten. Nachdem alle Modalitäten miteinander verbunden sind, kann echte „Any-to-Any“-Funktionalität erreicht werden, bei der jede beliebige Eingabe jede beliebige Ausgabe unterstützt – genau die Fähigkeit, die ein Weltmodell benötigt: das Verstehen, Generieren und Vorhersagen verschiedener Zustände der realen Welt in einer einheitlichen Architektur. Das ist eine vorzeitige Positionierung im Architekturparadigma.

Diese Positionierung durch den halben Schritt wird schrittweise umgesetzt. Im Mai 2026 erreichte das von Zhixiang quelloffene Modell HiDream-O1-Image den ersten Platz weltweit auf der Open-Source-Liste von Artificial Analysis; im Juni erreichte die kommerzielle Version HiDream-O1-Image-1.5 den dritten Platz weltweit.

(Bildunterschrift: Der Screenshot dieser Liste stammt vom 22. Juni 2026)

Betrachtet man die gesamte Branche, wird die Bedeutung dieses halben Schritts noch klarer. Die meisten Hersteller in der Branche setzen an dem einzelnen Punkt „Videogenerierung“ an; Zhixiang verfolgt seit seiner Gründung die parallele Entwicklung von Bildgenerierung und Videogenerierung als „zwei Modi“ und realisiert durch die Innovation der nativen multimodalen (UiT) Architektur die Vereinheitlichung von Modalitäten wie Bild, Video, Sprache, 3D-Interaktion und Bewegung. Das ist ein Unterschied in der Vorgehensweise und die eigentliche Quelle des „halben Schritts Vorsprung“ – es wird nicht nur auf einen Platz in der Liste gewettet, sondern darauf, dass das Zeitfenster für die native multimodale Route länger ist als das für allgemeine große Sprachmodelle und eine viel höhere Obergrenze hat.

Part03

Der „Planet“-Test

Der Wert der Modellroute wird letztendlich von den Nutzern durch Agenten wahrgenommen. Auf der gerade abgeschlossenen WAIC 2026 hat Zhixiang Future vivago R1 vorgestellt, das als „Agent für Inhaltserstellung mit unbegrenzter Dauer“ bezeichnet wird.

Sein bester Beweis stammt von einer kniffligen Testaufgabe: Ein Produktprüfer bat vivago R1, einen „türkischen gefälschten Star-Wars-Film“ zu drehen – einen ultraniedrigbudgetigen Kultfilm mit Monstern aus Pappe, Sieb als Helm und Steinen aus Schaumstoff.

Die Schwierigkeit ist subtil: Die KI neigt dazu, Bilder immer detailreicher und perfekter zu rendern, aber diese Aufgabe verlangt, dass sie die billige, „lächerlich unechte“ Atmosphäre beibehält. In dem fertigen Film von über einer Minute haben Kapitän Ali mit Schnurrbart und roter Kleidung sowie das Pappmonster mit Sieb als Helm durchgehend das gleiche Aussehen, und sie wurden nicht heimlich zu perfekten CGI-Elementen gerendert – die Agenten-Koordination auf der oberen Ebene hat die ästhetische Trägheit des unterliegenden Modells unterdrückt.

Diese Konsistenz ist kein Zufall. R1 läuft nach einem strukturierten Workflow: Geschichte schreiben → Drehbuch überarbeiten → Szenen aufteilen → Kunststil festlegen → Referenzbilder für Charaktere und Szenen sperren → Bild für Bild generieren → zum fertigen Film zusammensetzen.

Der sogenannte „unbegrenzte Zeitraum“ muss auch entmystifiziert werden: Es gibt nicht sofort einen zweistündigen Film auf einmal, sondern Charaktere, Requisiten und Szenen werden im langfristigen Produktionsprozess zu wiederverwendbaren Assets festgelegt, sodass die Geschichte kontinuierlich weitergeführt werden kann. Das trifft genau das, was dem Industriekapital sehr wichtig ist – IPs von statischen Urheberrechtsbeständen zu wiederverwendbaren digitalen Assets zu machen.

vivago verfolgt einen hybriden Weg aus „selbst entwickeltem Basismodell + aggregierter Steuerung + übergeordneter Koordination“. Sein Wettbewerbsvorteil liegt nicht darin, dass „alle Bilder selbst entwickelt sind“, sondern in der Koordinationsfähigkeit und der langfristigen Konsistenz. Aggregation ist ein Mittel, Koordination ist das Produkt, und das letztendliche Nutzererlebnis ist der Ort, an dem alle Wettbewerber um die Vorherrschaft kämpfen.

Part04

In die industriellen Prozesse einfließen

Mit dieser Investition des Industriekapitals wird Zhixiang Future nicht mehr nur an seinen Plätzen in den Modelllisten gemessen, sondern daran, ob es tatsächlich in die industriellen Prozesse integriert werden kann.

Für Gu Yuhao, Geschäftsführer von Shangying New Vision Fund, bedeutet die Investition in Zhixiang Future nicht nur, die Produktfähigkeiten des Unternehmens zu beachten, sondern „die technische Basis für das zukünftige Filmschaffen-System im Voraus aufzubauen“. Er möchte prüfen, ob das Unternehmen das unterliegende Modell, die mittlere Plattform und die branchenspezifischen Agenten verbinden kann, um Drehbuch, Charaktere, Szenen, Aufnahmen und Ton in dasselbe digitale System zu integrieren und IPs von statischen Urheberrechten zu wiederverwendbaren digitalen Assets zu machen.

Mit den Worten von Gu Yuhao: „Kunden aus der Filmbranche zahlen nicht nach Listenplätzen, sondern letztendlich nach dem Ergebnis der Lieferung.“ Das ist eine Anerkennung, aber auch eine schwierigere Prüfungsaufgabe: Zwischen einem beeindruckenden Demo und einer stabilen, großflächigen Lieferung liegt noch eine nicht unerhebliche „distanz zur Industrialisierung“.

Wenn die von Gu Yuhao gegebene Aussage die strategische Qualifikation für „Warum investieren“ ist, dann liefert Zhang Situo, Vizepräsident von Huace Film, eine Beurteilung, die bereits in der Produktionspraxis erprobt wurde.

Zhang Situo zufolge sind die ersten Bereiche, in denen KI Wert erzeugt, nicht die kreativen Phasen, sondern die Schritte, die „zeit- und arbeitsintensiv, aber wenig technisch anspruchsvoll“ sind – erste Filterung von Drehbüchern, Sortierung von Materialien, Bearbeitung mehrerer Versionen, Untertitelübersetzung. In der beliebten Serie *Taiping Nian*, die von Huace produziert wurde, wurden einige Hintergrundszenen mit KI generiert, was den Produktionszyklus stark verkürzte und die globale Verteilung für die 68 Millionen ausländischen Abonnenten von Huace wirksam unterstützte.

Noch wichtiger ist sein Kriterium, ob ein Modell für eine Zusammenarbeit wert ist: Aus Sicht von Filmunternehmen geht es nicht darum, „ob es schöne Bilder generieren kann“, sondern darum, „ob es ein Regisseur-Denken hat – die Sprache der Aufnahmen und den Rhythmus des Geschichtenerzählens versteht“.

Dieser Satz passt genau zu dem strukturierten Planungsprozess von vivago R1: „Zuerst das Drehbuch schreiben, dann die Referenzbilder festlegen, dann Bild für Bild generieren“. Das „Regisseur-Denken“ auf Modellebene ist genau der Grund, warum Industriepartner bereit sind, zu investieren.

Auf der Grundlage dieses Kriteriums teilt Zhang Situo die Steigerung der Wettbewerbsfähigkeit von Filmunternehmen in drei Schritte auf: Wettbewerb um Effizienz → Wettbewerb um Assets → Wettbewerb um Ökosystem. Am wichtigsten ist ihm der zweite Schritt: „Früher waren die wertvollsten Vermögenswerte von Filmunternehmen ihre Urheberrechtsbibliotheken. Jetzt müssen statische Urheberrechte zu „berechenbaren Inhaltsassets“ aufgewertet werden: Drehbücher können von KI durchsucht werden, fertige Filme können zerlegt und neu zusammengesetzt werden, und die Erfahrung aus der Produktion kann gespeichert und wiederverwendet werden.“

Das ist fast die gleiche Aussage in zwei verschiedenen Formulierungen wie Gu Yuhaos Beurteilung zu „digitalen Assets“.

Bei der Umsetzungsgeschwindigkeit sind die beiden Kapitalgeber erstaunlich einig. Der Kooperationspfad von Huace beginnt mit schnell validierbaren Projekten wie hochwertigen KI-Kurzserien, mittel- bis langfristig geht es dann um die Weiterentwicklung von digitalen IP-Materialien und die vollständige KI-Unterstützung für lange Serien. Gu Yuhao ist der Ansicht, dass KI derzeit eher für Werbematerialien, Vorentwicklung, Animationen, Comic-Verfilmungen und stilisierte Kurzfilme geeignet ist, während lange Realfilme noch viel schwieriger sind. Die beiden Filmkapitalgeber haben denselben Zeitplan vorgelegt: Kurzfristig geht es um Unterstützung und leichtgewichtige Inhalte, langfristig erst um die Neugestaltung.

In der Industrie sind die Präferenzen von staatlichem Kapital und Industriekapital immer klar: Wenn man in ein Unternehmen investiert, sollte man am besten mehrere Industrieketten aktivieren. Der visuelle Bereich ist genau eine Ebene in Großmodellen, die sehr nah an der Industrie ist, mit fertigen Szenarien in Film- und Fernsehen, Tourismus, Marketing und E-Commerce, und die von Zhixiang vorgelegten Ergebnisse bestehen alle Prüfungen. Das Kapital fließt durch das Unternehmen in die Industrie und kann mit einem Hebel eine große Skala erzeugen.

Part05

Das weiter entfernte Ziel ist das Weltmodell

Zhixiang Future hat das weiter entfernte Ziel auf das Weltmodell gesetzt, aber Mei Tao ist in Bezug auf diesen Begriff immer zurückhaltend: „Wir glauben nicht, dass die Branche heute bereits das Weltmodell vollständig realisiert hat.“ Seiner Meinung nach ist ein Bild der räumliche Zustand zu einem bestimmten Zeitpunkt, während ein Video die Zeitdimension hinzufügt. Wenn man diesem Weg folgt, muss das Modell noch räumliche Strukturen, Folgen von Bewegungen, Kausalzusammenhänge und physikalische Gesetze verstehen.

In diesem Kontext geht es bei Zhixiang Future nicht primär um einzelne Produkte, sondern um die Förderung einer tieferliegenden nativen multimodalen Route, bei der verschiedene Modalitäten wie Text, Bild, Video, Audio und Bewegung auf der unteren Ebene ausgerichtet werden, um schließlich beliebige Eingaben und Ausgaben verschiedener Modalitäten zu ermöglichen. Das Weltmodell soll in die Lage versetzt werden, die reale Welt wirklich zu verstehen, vorherzusagen und neu zu gestalten.

Von der visuellen Generierung bis zum nativen multimodalen Weltmodell gibt es