StartseiteArtikel

Zwölf führende KI-Giganten konkurrieren um die nächste Generation der Content-Industrie.

娱乐产业2026-08-17 08:51
Modell + System + Kommerzialisierung

Wenn die KI-Unterhaltungsindustrie im Jahr 2024 noch darum wetteifert, „wer ein beeindruckenderes Video erzeugen kann“, so liegt der Kern des Wettbewerbs im Jahr 2026 bereits darin: Wer zufällig erzeugtes, etwa zehn Sekunden langes Material zu einem stabilen, steuerbaren und nachhaltig profitablen Inhaltsprodukt machen kann.

Diese Veränderung ist von großer Bedeutung.

In der Kultur- und Unterhaltungsindustrie fehlte es nie an neuen Tools, was wirklich knapp ist, ist ein geschlossener Produktionskreislauf: Im oberen Bereich braucht es Modelle, im mittleren Bereich können Drehbuch, Charaktere, Storyboards, Bilder, Ton und Schnitt abgeschlossen werden, im unteren Bereich müssen Kurzvideos, Kurzfilme, Spiele, Werbung, Film und Fernsehen sowie ausländische Anwendungen eingebunden werden, um schließlich zahlende Nutzer zu finden.

Entlang dieser Industriekette haben Internetgiganten wie ByteDance, Kuaishou, Alibaba, Tencent und Baidu, branchenorientierte Unternehmen wie 360 und SenseTime sowie Modell- und Anwendungsunternehmen wie MiniMax, Zhipu AI, StepFun, Kunlun Wanwei und PixVerse völlig unterschiedliche Wege beschritten.

Der Wettbewerb in der AIGC-Unterhaltungsindustrie ist damit in eine echte Tiefphase eingetreten.

Ökosystem der Internetgiganten

Derzeit ist ByteDance dem „Vorgehen entlang der gesamten Industriekette“ am nächsten.

Auf der Modellseite verfügt ByteDance bereits über multimodale Fähigkeiten wie Seedream-Bildmodell, Seedance-Videomodell sowie Musik und Sprache; auf der Produktseite besitzt es Doubao, Jimeng AI und Jianying; auf der Inhaltsseite beherrscht es zudem Zugänge zu Traffic und geistigem Eigentum wie Douyin, TikTok, Fanqie Novel und Hongguo Short Drama.

Seedance 2.0, das im Februar 2026 veröffentlicht wurde, verwendet eine einheitliche Architektur für die gemeinsame Erzeugung von Ton und Video, unterstützt die Eingabe von Text, Bildern, Audio und Video, legt Wert auf komplexe Bewegungen, Kameraführung und native Synchronisation von Ton und Bild. Die Zielszenarien haben sich von „Erzeugen eines ansehnlichen Videos“ auf Werbung, Spezialeffekte für Filme und Fernsehen, Spielanimationen und Produktion von Kurzfilmen verlagert. Die kürzlich veröffentlichte Seedance 2.5 hat sogar noch größere Verbesserungen erzielt.

Der größte Vorteil von ByteDance liegt nicht nur im Ranking der Modelle, sondern darin, dass KI in den Kreislauf des Inhaltskonsums einbezogen werden kann: Fanqie Novel liefert Geschichten, die KI erledigt die Visualisierung, Jianying übernimmt den Nachschnitt, Douyin und Hongguo vervollständigen die Verbreitung, und die Nutzerverhaltensdaten leiten wiederum die Themenauswahl und Produktion an. Für andere Unternehmen ist KI-Video ein neues Geschäftsfeld; für ByteDance könnte es zur Infrastruktur werden, die das gesamte Inhaltsversorgungssystem neu gestaltet.

Kuaishou verfolgt einen anderen, konzentrierteren und klareren Weg – Keling AI zu einer unabhängigen globalen Plattform für kreative Produktion zu machen.

Bis zum ersten Quartal 2026 überstieg der Umsatz von Keling AI in einem einzelnen Quartal 650 Millionen Yuan, was einem Anstieg von mehr als 300 % gegenüber dem Vorjahr entspricht. Die annualisierte Umsatzlaufrate im März lag bei fast 500 Millionen US-Dollar. Keling war auch an der Herstellung virtueller Szenen und Spezialeffekte für die Fernsehserie „Tai Ping Nian“ beteiligt. Das bedeutet, dass KI-Video zum ersten Mal nicht nur über Traffic, Nutzer und Finanzierungsgeschichten verfügt, sondern quantifizierbare kommerzielle Einnahmen und professionelle Produktionsfälle aufweist.

Die Bedeutung von Keling liegt darin, zu beweisen, dass Modellfähigkeiten direkt in Form von Abonnements, Punkten, APIs und Unternehmensdienstleistungen verpackt und verkauft werden können. Das eigene Ökosystem für Kurzvideos, Werbekunden und das Netzwerk der Ersteller von Kuaishou liefern dem Modell wiederum natürliche Sammler-Nutzer. Im Vergleich zur „großen Ökosystem-Synergie“ von ByteDance konzentriert sich Kuaishou eher auf Ressourcen, um Keling zu einem KI-Geschäft zu machen, das separat abgerechnet werden kann.

Alibaba baut Fähigkeiten zur Erstellung von Bildern und Videos rund um Tongyi Wanxiang auf. Wanxiang 2.6 unterstützt bereits die Erzeugung anhand von Referenzvideos, Mehrpersonendialogen, Mehrkamera-Narration, Storyboard-Steuerung und nativem Ton. Die Erzeugungsdauer pro Vorgang kann bis zu 15 Sekunden erreichen, was eindeutig auf professionelle Film- und Werbeszenarien ausgerichtet ist. Wan2.7-Video wurde speziell für die Freiheit des kreativen Schaffens entwickelt.

Aber der echte Trumpf von Alibaba ist Alibaba Cloud, Youku, Damai, Taobao & Tmall Advertising und das riesige Händlersystem. Wanxiang kann nicht nur der Filmproduktion dienen, sondern auch Massenproduktion von Produktvideos, Markenwerbung und Livestream-Materialien durchführen. Die Investition von Alibaba in PixVerse zeigt, dass es nicht nur auf interne Modelle setzt, sondern aktiv exzellente externe Teams für Videogenerierung aufnimmt, um eine dreigleisige Aufstellung aus „selbst entwickelten Modellen, Cloud-Rechenleistung und Industrieeinvestitionen“ zu bilden.

Die Vorteile von Tencent in der Unterhaltungsbranche konzentrieren sich mehr auf Spiele und geistiges Eigentum. Hunyuan baut nicht nur Bilder und Videos auf, sondern stärkt kontinuierlich die Fähigkeiten von 3D-Modellen und Weltmodellen; Tencent Games hat auch die visuelle Generierungsplattform für Hunyuan-Spiele, die GiiNEX-Game-KI-Engine sowie die KI-Spielerstellungsplattform „Codename Craft“ auf den Markt gebracht. Unter anderem kann Hunyuan 3D bereits bearbeitbare 3D-Assets über Text, Bilder und Mehransichten erzeugen und sich weiter auf räumliche Inhalte mit Fähigkeiten zu physischen Kollisionen und Charakter-Roaming erstrecken.

Die meisten Filminhalte sind linear, während Spiele Modelle erfordern, die den dreidimensionalen Raum, die Handlungen der Charaktere und das Feedback der Spieler verstehen. Was Tencent derzeit tut, besteht also nicht nur darin, die Kosten für Grafik durch KI zu senken, sondern zu versuchen, KI in die Generierung von Spielassets, den Aufbau von Levels, die Interaktion von NPCs und die UGC-Erstellung einzubeziehen. Worum es hier geht, ist die „generierbare, interaktive digitale Welt“.

Der Einstiegspunkt von Baidu liegt eher auf unternehmensweiter Videogenerierung und Suchmarketing. MuseSteamer begann mit der Erzeugung von Videos aus Bildern, wurde später zur integrierten Erzeugung von Ton und Video aufgerüstet, deckt Umgebungsgeräusche, menschliche Sprache und Mehrpersonendialoge ab und erstreckt sich auf die Produktion von Langvideos; Unternehmenskunden können die entsprechenden Fähigkeiten über die Qianfan-Plattform aufrufen.

Baidu fehlt eine Inhalts-Community wie Douyin und ein Spielimperium wie Tencent, aber es verfügt über Suchfunktionen, digitale Menschen, Werbekunden und intelligente Cloud. Es ist wahrscheinlicher, dass es zuerst Wert in Marketingvideos, Wissensinhalten, Berichterstattung durch digitale Menschen und kreativen Materialien für Unternehmen realisiert.

Modell-Startups und branchenorientierte Unternehmen kämpfen um die „Inhaltsfabrik“

Internetgiganten wetteifern um Ökosysteme, die zweite Gruppe von Akteuren sucht nach ausreichend scharfen Durchbruchspunkten in der Industrie.

360 hat sich für KI-Manhua-Dramen entschieden. Das Anfang 2026 eingeführte „Nano-Manhua-Drama-Fließband“ bringt die Zerlegung von Drehbüchern, Charakter-Assets, intelligente Storyboards, Bildgenerierung und Nachsynthese in denselben Produktionsablauf ein und bindet externe Modelle einschließlich Seedance 2.0 ein. Das von 360 bekanntgegebene Ziel besteht darin, die Produktionszeit pro Folge auf 30 Minuten bis 1 Stunde zu verkürzen und die Erfolgsrate der Materialgenerierung auf über 90 % zu steigern.

Dieser Weg ist sehr repräsentativ: 360 muss nicht in jedem einzelnen Indikator des Videomodells den ersten Platz belegen, sondern durch die Koordinierung verschiedener Modelle, die Festigung von Arbeitsabläufen und die Verwaltung der Konsistenz von Charakteren das instabile „Zufallsprinzip“ zu einer lieferbaren Produktionslinie machen. Das Modell bestimmt die Obergrenze einer einzelnen Aufnahme, und das Fließband bestimmt, wie viele Folgen ein Studio pro Tag produzieren kann.

SenseTimes Seko entwickelt sich ebenfalls in eine ähnliche Richtung. Seko erzeugt nicht nur Videos, sondern deckt auch die Erstellung von Geschichten, Storyboards, Charaktereinstellungen, Kamerorganisation und die Auslieferung fertiger Filme ab. Bis Juli 2026 überschritt die Zahl der von der Behörde gemeldeten Ersteller-Nutzer 1 Million und 1500 Unternehmenskunden wurden bedient. SenseTime kombiniert seine angesammelte visuelle KI mit Agenten und versucht, von einem Tool zu einer „Traumfabrik für KI-Videos“ aufzusteigen.

Zhipu AI trat früh mit „Qingying“ in den Markt für Videogenerierung ein. Qingying 2.0 verbessert die Fähigkeiten auf 10 Sekunden, 4K und 60 Bilder pro Sekunde und fügt Soundeffekte hinzu, um Nutzer direkt in Zhipu Qingyan zu erreichen. Das Merkmal von Zhipu besteht darin, dass allgemeine große Modelle, Agenten und Videomodelle parallel laufen: Es kann nicht nur Aufnahmen erzeugen, sondern auch Sprachmodelle verwenden, um Kreativität, Skripte und Prompt-Organisation abzuschließen. Aber auf der Unterhaltungsbahn ist Zhipu derzeit eher ein Anbieter von untergeordneten Fähigkeiten und hat noch einen Abstand zu einer starken Inhaltsplattform und einem ausgereiften kommerziellen Kreislauf.

StepFun legt ebenfalls Wert auf ein multimodales Grundgerüst. Sein Step-Video-T2V mit 30 Milliarden Parametern ist unter der relativ lockigen MIT-Lizenz quelloffen, Step-Audio deckt Sprache, Emotionen, Dialekte, Gesang und Rollenspiel ab; die offene Plattform richtet die Fähigkeiten weiter auf IP-Interaktionsspiele, die Erstellung von Online-Romanen sowie Ton- und Videoproduktion aus.

Open Source kann das Entwick