StartseiteArtikel

Der Umsatz hat die Marke von 100 Millionen überschritten, diese als Überraschungshit geltende aufstrebende Kraft im Bereich der multimodalen generativen KI beginnt eine neue Reise.

凡泛2026-01-20 16:33
Angesichts der beschleunigten Einführung multimodaler Anwendungen in die Praxis, welche verborgenen kommerziellen Potenziale birgt Zhixiang Future noch?

Es ist fast zwei Jahre her, seit OpenAI das Text-zu-Video-Modell Sora veröffentlicht hat, doch die AIGC-Unternehmen in China und den USA zeigen völlig unterschiedliche Entwicklungsstände: Auf der einen Seite steht Sora 2 mit anhaltend hohen Kosten, der nie in großen Mengen eingeführt werden konnte, sowie die Sora-App mit einer nahezu null liegenden Nutzerbindungsrate. Auf der anderen Seite stehen chinesische Unternehmen, die in einem breiten Anwendungsumfeld verwurzelt sind und sich allmählich gut entwickeln, und deren Kommerzialisierung nun eine umfassende Explosionsphase erlebt.

„Intelligente Emergenz“ hat kürzlich erfahren, dass das auf visuelle multimodale generative KI spezialisierte Startup Zhixiang Future im Jahr 2025 einen Gesamtjahresumsatz von über 100 Millionen Yuan erzielt hat. Sein C-End-Produkt vivago.ai hat kürzlich ebenfalls seinen höchsten Download-Wert erreicht: Im Januar kamen fast zehn Millionen neue Nutzer hinzu, es schaffte es in über 100 Ländern und Regionen weltweit unter die Top 10 der Kategorie „Videowiedergabe & -bearbeitung“ im Google Play Store und zeigt ein enormes kommerzielles Entwicklungspotenzial.

Seit seiner Gründung hat Zhixiang Future nacheinander das Bildgenerierungs-Großmodell HiDream-I1 und das interaktive Bearbeitungsmodell HiDream-E1 veröffentlicht, die im April 2025 vollständig quelloffen gemacht wurden. Innerhalb von 24 Stunden nach der Open-Source-Veröffentlichung erreichte es den Spitzenplatz der international anerkannten KI-Bewertungsliste Artificial Analysis.

Dieses aus Hefei stammende Unternehmen hat durch selbst entwickelte Großmodelle mit über zehn Milliarden Parametern und der weltweit ersten Diffusions-Autoregressiv-Architektur ein perfektes Gleichgewicht zwischen Generierungsqualität und Effizienz gefunden. Derzeit werden seine Produkte bereits weit verbreitet in Bereichen wie Kultur und Kreativität, Film und Fernsehen sowie Werbung eingesetzt.

„Intelligente Emergenz“ hat exklusiv erfahren, dass sich der Finanzierungsprozess von Zhixiang Future weiter beschleunigt: Die B-Runde der Finanzierung ist bereits in der Abschlussphase, die Bedingungsvereinbarung (TS) für die nächste Runde wurde im Voraus unterzeichnet. Laut einer mit den Kernangelegenheiten des Unternehmens vertrauten Quelle belaufen sich beide Finanzierungsrunden auf mehrere hundert Millionen Yuan. In der heutigen Zeit des verschärften Wettbewerbs im Bereich der KI-gestützten visuellen Generierung erhält Zhixiang Future aufgrund seiner harten technischen Stärke und seines klaren Kommerzialisierungspfades kontinuierlich schwere Investitionen von führenden Kapitalgebern.

Welches kommerzielle Potenzial verbirgt sich noch in Zhixiang Future, während sich die Anwendungen im multimodalen Bereich rasch weiterentwickeln?

Der am stärksten industrialisierte Wissenschaftler, die praxisnahste Romantik

Von Anfang an hat Zhixiang Future eine pragmatische Form der Romantik gefunden. Gründer Mei Tao ist ausländisches Mitglied der Akademie der Ingenieurwissenschaften Kanadas und arbeitete zuvor 12 Jahre lang bei Microsoft. Er hat mehr als 300 Papers im Bereich der Multimedia-Analyse und Computer Vision veröffentlicht und wurde 15 Mal mit internationalen Best Paper Awards ausgezeichnet.

Doch Mei Taos Erfahrung beschränkt sich nicht nur auf die Wissenschaft. 2018 trat Mei Tao zu JD.com ein und war stellvertretender Direktor des JD Exploration Research Institute. Diese berufliche Phase ließ ihn den Weg von der Technik zur kommerziellen Umsetzung erkennen.

Als er sich entschied, Zhixiang Future zu gründen, hatte Mei Tao eine klare Vorstellung. Einerseits ist Multimodalität der wahrscheinlichste Weg zur allgemeinen KI (AGI), eine Ansicht, die später auch zum Branchenkonsens wurde. Gleichzeitig bietet Multimodalität im Hinblick auf die kommerziellen Aussichten weitaus mehr Raum als rein sprachbasierte Modelle. „Derzeit stammen 50 bis 60 Prozent der weltweiten AIGC-Einnahmen aus bild- und videobezogenen Anwendungen, mehr als bei rein textbasierten Modellen. Als wir 2023 unsere Gründungsentscheidung trafen, hatten multimodale Unternehmen wie Midjourney bereits durch SaaS-Tools ihre starke Kommerzialisierungsfähigkeit bewiesen und die Markttauglichkeit des Produkts klar validiert“, sagte Mei Tao Mitte 2025 gegenüber 36Kr.

Und genau das ist Mei Taos Hauptarbeitsbereich: Er verfügt über tiefe Fachkenntnisse in den Bereichen Computer Vision (CV) und Multimodalität.

Für chinesische Innovationsunternehmen zu dieser Zeit war Sora jedoch ein riesiges Hindernis am Anfang des Weges. Angesichts des Grads der Wiedergabe der physischen Welt und der beeindruckenden Ergebnisse erwartete die Branche damals sehr, ob chinesische Startups mit Sora konkurrierende Generierungsergebnisse liefern könnten.

Ein Wettlauf begann. Nach der Veröffentlichung von Sora brauchte Zhixiang Future nur ein halbes Jahr, um sein selbst entwickeltes multimodales Großmodell vorzustellen. Im April 2025 veröffentlichte Zhixiang Future gleichermaßen das bildgenerierende Großmodell HiDream-I1 und das interaktive Bearbeitungsmodell HiDream-E1 als Open Source, womit ein geschlossener Kreislauf von der Dialogführung zur Bilderstellung geschaffen wurde. HiDream-I1 erreichte innerhalb von 24 Stunden den Spitzenplatz der renommierten Liste Artificial Analysis und wurde das erste selbst entwickelte chinesische generative KI-Modell, das in die globale Spitzengruppe aufstieg. Es stellte Branchenrekorde in den drei Dimensionen Bildqualität, semantisches Verständnis und künstlerische Darstellung auf.

Dennoch haben mehrere Unternehmer im Nachhinein festgestellt, dass Sora auf der Ebene der Architekturinnovation eher zurückgeblieben ist. Mei Tao war damals auch der Meinung, dass die Gesamtfunktionen von Sora den Erwartungen entsprechen. Ein halbes Jahr später, mit dem Einstieg von Startups wie Zhixiang Future, hat OpenAI im Bereich der aktuellen Videogenerierung keine großen Vorteile mehr. Vor allem aus Sicht der Produktumsetzung unterscheiden sich die Produkte im Ausland und im Inland kaum voneinander.

Gleichzeitig ist Zhixiang Future bei der Erforschung multimodaler Architekturparadigmen sogar führend. Das Unternehmen hat als Erstes die beiden Modelle für Generierung und Verständnis entwickelt und plante anschließend die Integration von Verständnis und Generierung – ein Weg, der als der beste Pfad zur physischen Welt gilt.

Zhixiang Future hat sich stetig bemüht, branchenspezifische Probleme zu lösen. 2025, mit der Open-Source-Veröffentlichung des neuesten Modells und der Einführung von Produkten wie vivago 2.0, sagte Mei Tao gegenüber 36Kr, dass die DiT (Anmerkung des Herausgebers: Diffusion Transformer)-Architektur die starken Fähigkeiten von Transformer nutzt, um Videodaten zu verarbeiten, sodass KI-Modelle räumlich-zeitliche Beziehungen effizient modellieren und Videos mit unterschiedlichen Auflösungen flexibel generieren können – ein wichtiger Fortschritt. Für den gesamten Bereich der generativen KI ist die realistische Wiedergabe komplexer physikalischer Phänomene jedoch noch ein ungelöstes Problem: Dynamische Details wie die Flugbahn von spritzenden Wassertropfen oder die mechanische Rückmeldung bei Kollisionen von Objekten, die für menschliche Intuitionen greifbar sind, befinden sich noch in einer Erkundungsphase, in der sie „nur äußerlich ähnlich, aber nicht im Kern“ sind, und es treten oft visuelle Unstimmigkeiten in entsprechenden Szenen auf.

Mit der Sparse-DiT-Architektur hat Zhixiang Future ein hervorragendes Gleichgewicht zwischen Generierungseffekt und Ausführungsgeschwindigkeit gefunden. Durch adverses Destillationsverfahren wird die Inferenzeffizienz gesteigert und gleichzeitig die Details und Ästhetik der Bilder stark verbessert. Das führte schließlich zu mehreren kreativen Erfolgen des HiDream-I1-Modells von Zhixiang Future.

Einen anderen Weg bei den Algorithmen einschlagen, um das letzte Meile Problem zu lösen

Im Gegensatz zur Logik großer Konzerne, die um Basismodelle und Parameter konkurrieren, legen kleine Unternehmen mehr Wert auf Innovation und praktische Umsetzung. Nach Mei Taos Ansicht liegt genau hier der Wert von Zhixiang Future: das letzte Meile Problem der KI-Umsetzung zu lösen.

Er sagte einst gegenüber 36Kr: „Seit dem ersten Tag unserer Gründung sind wir sehr risikobewusst und haben immer darüber nachgedacht, wie wir die Produkt-Markt-Passung (PMF) erreichen können. Wir sind bei der Kommerzialisierung relativ früh und schnell vorangekommen. Obwohl wir nicht das meiste Geld aufgenommen haben, haben wir jeden ausgegebenen Yuan und jeden eingestellten Mitarbeiter sorgfältig überlegt.“

In der frühen Gründungsphase hat Zhixiang Future das „1+3+N“-Layout geschaffen: ein zentrales multimodales Großmodell, das drei Produktplattformen antreibt – eine Plattform für Kreativwerkzeuge, ein Werkzeug für interaktive Marketinginhalte und ein One-Stop-Agent für Videoproduktion. Bisher decken seine Dienste weltweit über 20 Millionen private Nutzer und mehr als 40.000 Unternehmenskunden ab.

Nach der Festlegung der Positionierung liegt der Kern darin, die Lieferung gut zu gestalten, Kunden gut zu bedienen und dafür zu sorgen, dass KI tatsächlich einen Mehrwert schafft.

Mei Tao sagte gegenüber 36Kr, dass Zhixiang Future über die umfassendste multimodale urheberrechtlich geschützte Korpus in China, hunderttausende Stunden urheberrechtlich geschütztes Videomaterial und zehntausende lizenzierte IPs verfügt. Es deckt nicht nur 70 % der chinesischen Filmdaten ab, sondern hat auch hunderte Millionen AIGC-Umarbeitungsmaterialien aufgebaut, die derzeit weit verbreitet in Szenen wie Film und Fernsehen, Tourismus und Marketing eingesetzt werden.

„Bei Microsoft Research haben wir oft gesagt, dass man hundert Ingenieure braucht, um von einer Technik zu einem Produkt zu gelangen; um das Produkt gut zu verkaufen, braucht man vielleicht noch hundert Lösungspezialisten oder Business-Development-Mitarbeiter. Das zeigt, wie groß die Lücke dazwischen ist. Damals dachte ich mir, dass ich unbedingt einen Ort finden muss, um diese gesamte Kette zu durchbrechen.“

Genau diese Fähigkeit, die gesamte Kette von der Technik bis zur Umsetzung zu beherrschen, hat Zhixiang Future seit seiner Gründung bei Kapitalgebern sehr beliebt gemacht.

2024 schloss Zhixiang Future eine A-Runde der Finanzierung in Höhe von mehreren hundert Millionen Yuan ab, angeführt von Hefei Industrial Investment Group und unter Beteiligung von Institutionen wie dem Anhui Provincial KI-Mutterfonds. Ende 2025 erhöhte die JD-Gruppe als strategischer Investor ihre Investition in Zhixiang Future. Die umfangreichen Geschäftsszenarien im Logistik-, Einzelhandels-, Gesundheits- und Industriebereich hinter der Gruppe sind genau die perfekten Testfelder und Anwendungsumgebungen für die Umsetzung multimodaler KI-Technologie.

Daraufhin gaben vertraute Quellen bekannt, dass Zhixiang Future mit Hochdruck die Vorbereitungen für die B-Runde der Finanzierung aufgenommen hat und plant, diese Anfang 2026 abzuschließen.

36Kr erfuhr kürzlich, dass Zhixiang Future die Bedingungsvereinbarung (TS) für die nächste Runde bereits erfolgreich erhalten hat. Alte Aktionäre beteiligen sich weiter, neue Aktionäre sind Industriekapital, börsennotierte Unternehmen mit tiefen Geschäftskooperationen und bekannte Investmentinstitutionen. Derzeit hat das Finanzierungsvolumen der B-Runde mehrere hundert Millionen Yuan erreicht.

Yuan Guoliang, CEO von Shanghai Dunhong Asset, äußerte sich zur Bewertung von Zhixiang Future wie folgt: „Wir sind fest davon überzeugt, dass die Videogenerierungstechnologie als neues Produktivwerkzeug alle Branchen umfassend befähigen wird. Besonders im E-Commerce sind Videos zum Kernmedium geworden, das Produkte und Verbraucher verbindet. HiDream hat durch seine Produkte bereits den Anwendungswert und das kommerzielle Potenzial im E-Commerce-Bereich vorläufig validiert, was zeigt, dass das Team nicht nur Technik, sondern auch die Branche versteht. Gleichzeitig sind wir der Meinung, dass seine technische Architektur und Entwicklungsrichtung das Potenzial haben, sich zu einem Weltmodell mit höherer Allgemeingültigkeit und kognitiver Tiefe weiterzuentwickeln – ein Sprung auf der Ebene der grundlegenden Fähigkeiten. Wir freuen uns darauf, gemeinsam mit dem Team den langfristigen Pfad der Integration von Technik und Industrie zu erkunden und dazu beizutragen, dass multimodale Generierung zu einer universellen und intelligenten Brancheninfrastruktur wird.“

Das beste Ziel mit sowohl kommerzieller Stärke als auch Architekturinnovation

2025 war das Explosionsjahr der chinesischen multimodalen generativen KI. Mit der zunehmenden Reife der AIGC-Technologie steigen Produktivität und Kreativität deutlich an, was den Anwendungsmarkt zu einem explosiven Wachstum antreibt. Nach Daten von IDC wird die weltweite Marktgröße für generative KI in den nächsten fünf Jahren voraussichtlich eine durchschnittliche jährliche Wachstumsrate von 63,8 % aufweisen und bis 2028 284,2 Milliarden US-Dollar erreichen, was 35 % der gesamten KI-Investitionen ausmacht. Zhixiang Future ist einer der Nutznießer dank seiner extrem starken technischen Fähigkeiten und seinem Denken für industrielle Umsetzung. Der Kommerzialisierungsprozess des Unternehmens schreitet rasch voran, wie 36Kr erfuhr, hat Zhixiang Future im Jahr 2025 einen Gesamtjahresumsatz von über 100 Millionen Yuan erzielt.

Dass solche Ergebnisse im wettbewerbsintensiven Bereich der multimodalen Generierung schnell erreicht werden konnten, verdankt sich den einzigartigen Überlegungen zum Geschäftsmodell und den starken grundlegenden Innovationsfähigkeiten von Zhixiang Future. Man kann sagen, dass Zhixiang Future eines der wenigen Unternehmen der Branche ist, die sowohl Kommerzialisierung als auch technische Innovation gleichermaßen vorantreiben.

In den drei Jahren seit der Gründung von Zhixiang Future hat es unterschiedliche Geschäftsmodelle durchlaufen. Das Modell von 2023 war MaaS, bei dem Modelle und APIs verkauft wurden, ähnlich wie das PaaS-Modell im Cloud-Computing. Das Modell von 2024 war SaaS, bei dem hauptsächlich Werkzeuge verkauft wurden, sodass Nutzer auf der Plattform von Zhixiang Future Werkzeuge zur Erstellung von Inhalten nutzen konnten.

Heute hat das Unternehmen sein Modell weiterentwickelt und ist offiziell zu RaaS übergegangen – ein ergebnisorientiertes, am Nutzwert ausgerichtetes Geschäftsmodell: Dazu gehören Werkzeuge, Inhaltsmaterialien, Videoproduktion und -verbreitung mit begrenztem Umfang, für die nur eine geringe Grundgebühr erhoben wird. Der Hauptertrag stammt aus Provisionen, die durch die Steigerung des GMV der Kunden erzielt werden. Nach Mei Taos Aussage ist der Kundennutzen auf diese Weise relativ klar, Kunden können im Grunde ohne Risiko investieren und die zusätzlichen Erträge werden gemeinsam geteilt.

Mit dem Fortschritt des Unternehmens sagte Mei Tao auch, dass er das Gleichgewicht zwischen kommerzieller Rendite und Fähigkeitssteigerung gefunden hat. Einerseits wird das Niveau stetig