StartseiteArtikel

Die Modelle wechseln ständig die Ranglisten, und Orca Entertainment beginnt, auf die „Infrastruktur“ der nächsten Generation der Industrie zu setzen.

晓曦2026-09-23 19:36
Generative Modelle definieren die Obergrenze der Inhaltserstellungskapazität, während das Produktionssystem darüber entscheidet, ob diese Obergrenze stabil umgesetzt werden kann.

Dass KI ausreichend realistische Videos erzeugen kann, ist an sich nicht mehr neu. Dieses Nachlassen der Neuheit rührt von der schnellen Skalierung des Angebots und des Konsums von KI-Videos her. 

Laut dem Bericht „Daten zu inländischen KI-Dramen und Manhua-Dramen im ersten Halbjahr 2026“ von DataEye wuchs der Marktumfang für inländische KI-Dramen/Manhua-Dramen im Jahr 2026 um 138 % im Vergleich zum Vorjahr; bereits in den ersten fünf Monaten erreichte der Marktumfang 220 Milliarden Yuan. 

Auch tiefgreifendere Veränderungen ereigneten sich: Während die Menschen früher noch darauf achteten, ob ein Video „KI“ ist, interessieren sich die Zuschauer jetzt mehr dafür, ob es sich um einen guten Inhalt handelt. Eine Analyse von Bullet-Chats und Kommentaren zu veröffentlichten KI-Videos durch Orca Entertainment ergab, dass sich die Nutzerdiskussionen im vierten Quartal 2025 noch hauptsächlich auf „Prompts“, „Technik“ und „Echtheit bzw. Falschheit“ konzentrierten; im zweiten Quartal 2026 tauchten Begriffe wie „Handlung“, „Geschichte“, „Hauptdarsteller“ und „Hauptdarstellerin“ häufiger auf. Im gleichen Zeitraum sank der Anteil der Bewertungen im Zusammenhang mit KI-Spuren wie „auf den ersten Blick KI“ von 10,3 % auf 6,5 %, während die positive Bewertungsrate von 50 % auf 73,8 % stieg. 

Du Yanlong, CTO der Orca Entertainment Group, meint: „Wenn Zuschauer beginnen, KI-Werke nach inhaltlichen Maßstäben und nicht nach Maßstäben für technische Demonstrationen zu bewerten, nähert sich die KI erst wirklich dem Ausgangspunkt der Industrialisierung.“ 

Als die Technik gerade aufkam, reichte es aus, dass KI Figuren zum Bewegen bringen konnte, um eine Nachricht zu werden; die Erzeugung einer komplexen Kameraführung war es wert, weiterverbreitet zu werden. Aber wenn das „Erzeugen“ immer einfacher wird, wie kann man KI dann wirklich zu einer Produktivkraft im Film- und Fernsehbereich machen? 

Am 22. September veröffentlichte Orca Entertainment auf der Apsara-Konferenz die branchenweit erste KI-Plattform für Film- und Fernsehproduktion und -verwaltung „Jingrui AI“. Diese Plattform, die im Oktober die interne Betaphase erreichen wird, richtet ihre Aufmerksamkeit auf die Produktionsschritte über den Modellen. 

Du Yanlong sagte: „Das Generierungsmodell bestimmt die Obergrenze der inhaltlichen Fähigkeiten, das Produktionssystem bestimmt, ob diese Obergrenze stabil umgesetzt werden kann.“ 

In den letzten drei Jahren hat die KI-Videobranche den ersten Teil dieses Satzes ständig neu definiert. Was Jingrui AI lösen will, ist der zweite Teil des Satzes. 

KI-Film- und Fernsehen, auf dem Weg zur Industrialisierung 

Von jeher ist die Film- und Fernsehbranche eine Industrie, die stark auf Zusammenarbeit angewiesen ist. 

Damit eine Idee zu einem endgültigen Bild wird, braucht ein Film die gemeinsame Zusammenarbeit von vielen Berufsgruppen wie Regisseuren, Schauspielern, Kameraleuten, Künstlern, Beleuchtern und Postproduktionsmitarbeitern. Damit verschiedene Menschen eine gleiche kreative Absicht genau verstehen, hat die Filmindustrie eine ganze Reihe von Fachsprachen und Arbeitsabläufen entwickelt: Die Storyboards bestimmen die Bilder, Bildausschnitte, Brennweiten und Kamerapositionen leiten die Kameraführung, Positionsbewegungen und Darstellungsregie lenken die Schauspieler, und das Produktionssystem organisiert diese Arbeiten in Budgets und Zeitpläne. 

Die Vorteile, die Hollywood im letzten Jahrhundert aufgebaut hat, stammen zu einem großen Teil auch aus diesem industriellen System. Was wirklich schwer zu kopieren ist, sind nicht nur eine Gruppe von Stars, Regisseuren und Großproduktionen, sondern die Aufspaltung der stark von individueller Kreativität abhängigen Filmproduktion in fachliche Arbeitsteilung, Herstellungsabläufe, Qualitätsstandards und Produktionsverwaltung. An einzelnen Projekten können Hunderte oder sogar Tausende von Personen teilnehmen, aber jede Berufsgruppe weiß, in welcher Phase sie welche Arbeit nach welchen Standards erledigen soll. 

Die Filmindustrie hat sich über hundert Jahre lang entwickelt, um das Problem zu lösen, wie kreative Absichten genau in ausführbare Bilder umgewandelt werden können. 

Aber generative KI macht diese Angelegenheit im Gegenzug wieder unsicher. Die Schöpfer wissen genau, was sie wollen, müssen aber zuerst die komplexe Absicht in einen Prompt komprimieren und dann darauf warten, dass das Modell ein probabilistisches Ergebnis liefert. Die Figuren stimmen, aber die Kameraposition ist möglicherweise falsch; der Ausdruck stimmt, aber die Kameraführung kann Probleme bereiten; wenn man endlich eine zufriedenstellende Komposition erhält, können sich die ursprünglich richtigen Teile wieder ändern, nachdem die Aktion neu angepasst wurde. 

So wird ein Problem, das in der traditionellen Filmindustrie punktuell kommuniziert und kontrolliert werden konnte, bei KI zu wiederholtem Generieren und Filtern. Zwischen der klaren kreativen Absicht und dem stabilen, genauen Erhalt des Ergebnisses fehlt immer noch eine Ebene der Produktionsfähigkeit. 

„Zufallstreffer ziehen“ wird dadurch zu einer repräsentativen Bezeichnung in der KI-Videoproduktion. 

Einzelne Kameraschüsse können noch durch „Zufallstreffer ziehen“ gelöst werden, aber wenn man zu einem vollständigen Projekt übergeht, werden die Kosten schnell größer. Eine Unzufriedenheit bedeutet Neugenerierung, eine Änderung in einem Glied kann nachfolgende Modifikationen nach sich ziehen, und die ursprünglich durch KI eingesparten Herstellungskosten können wieder in Filterung, Versuch und Irrtum sowie Nacharbeit verbraucht werden. 

Gelegentlich einen 100-Punkte-Kameraschuss zu erzeugen, ist die Fähigkeit des Modells; Hunderte von Schüssen, die professionellen Standards entsprechen, nacheinander zu liefern und eine Erzählung zu bilden, ist erst die Produktionsfähigkeit des Systems. 

„Einen guten Schuss zu erzeugen und ein gutes Werk zu liefern, sind zwei völlig verschiedene Dinge“, meint Du Yanlong. 

Du Yanlong, CTO der Orca Entertainment Group 

Das ist auch die Schwelle, die die KI-Filmindustrie überqueren muss, um zur Industrialisierung zu gelangen. Nachdem die Modelle die Obergrenze der Fähigkeiten für einzelne Schüsse ständig angehoben haben, braucht die Branche ein neues Produktionssystem, das diese Fähigkeiten stabil organisiert. 

Die Schaffung „bestimmbarer“ machen 

„An diesem Ausgangspunkt ist die Richtung der nächsten Phase nicht mehr, wer einen einzelnen guten Schuss erzeugen kann, sondern wer dem Kreativteam helfen kann, fortwährend, nachvollziehbar und innerhalb des Budgets ein gutes Werk zu liefern; was im KI-Zeitalter wirklich knapp ist, ist nicht mehr die starke Generierungsfähigkeit des Modells, sondern die Fähigkeit eines Kreativteams, fortwährend gute Inhalte zu liefern“ – das ist auch der Produktgedanke von Jingrui AI. 

Als branchenweit erste KI-Plattform für Film- und Fernsehproduktion und -verwaltung konzentriert sich Jingrui AI auf drei Dinge: der Herstellungsprozess ist kontrollierbar, das Ergebnis ist lieferbar, die Kosten sind verwaltbar. Es sieht wie drei Produktfähigkeiten aus, entspricht aber tatsächlich drei nacheinander in der Filmproduktion auftretenden Problemen: Können die Schöpfer die von ihnen gewünschten Bilder genau erhalten, können die erzeugten Inhalte die professionellen Herstellungsstandards erfüllen, und wenn die Schaffung von Einzelpersonen zu Teams und von Fragmenten zu vollständigen Projekten übergeht, können Kosten und Fortschritt noch kontrolliert werden? 

Der erste Schritt ist, die Wahlmöglichkeit aus der zufälligen Generierung zurückzuholen. 

Jingrui AI stopft nicht weiterhin alle kreativen Anforderungen in den Prompt, sondern zerlegt die bereits in der Filmindustrie ausgebildeten Fachsprachen neu und verwandelt sie in von KI ausführbare Kontrollvariablen. Derzeit bietet die Plattform fünf Arten von Präzisionssteuerungskits für Szenenkontrolle, Schauspiel von Figuren, Kameras, 3D-Virtual-Filmstudios und Lichtanpassung an, darunter über 250 Szenenbearbeitungskombinationen, 49 grundlegende Ausdruckskontrollen, mehr als 40 professionelle Kameraparameter sowie über 100 Arten von Figurenposen und Standpositionen und eine Reihe von Fähigkeiten zur präzisen Steuerung von Bildern und Videos. 

Zum Beispiel, wenn die Schöpfer einen Schuss von zwei Personen machen wollen, die in einem Café sprechen, müssen sie bei früheren KI-Videotools möglicherweise gleichzeitig die Position, Bewegung und den Ausdruck der Figuren, den Kamerawinkel, den Bildausschnitt und das Licht im Prompt beschreiben und dann durch wiederholtes Generieren die Version suchen, die der Erwartung am nächsten kommt; aber in der Produktlogik von Jingrui AI können diese Variablen getrennt gesteuert werden: Zuerst bestimmen sie die Position und Haltung der beiden Figuren im 3D-Virtual-Filmstudio, dann passen sie den Ausdruck der Figuren an, bestimmen die Position, Brennweite und Bewegungsart der Kamera und bearbeiten schließlich das Licht. Wenn eine der Variablen geändert werden muss, muss nicht das gesamte Bild erneut dem Zufall überlassen werden. 

Das sieht nur wie eine Änderung der Interaktionsweise aus, aber dahinter verbirgt sich eine Veränderung der Beziehung zwischen KI und professionellen Schöpfern. Die Filmindustrie hat über hundert Jahre lang eine Sprache zur Ausdrückung kreativer Absichten entwickelt, es ist nicht notwendig, dass Regisseure und Kameraleute wegen des Aufkommens von KI eine neue Maschinensprache lernen. Das Zeichen für die echte Reife der Technik ist vielleicht nicht, dass die Schöpfer KI immer besser verstehen, sondern dass KI die Schöpfer immer besser versteht. 

Aber die genaue Steuerung der Aufnahme löst nur den ersten Schritt der Produktion. Bei der Filmproduktion gibt es noch ein realistischeres Problem: Bis zu welchem Grad gilt das Werk als abgeschlossen? 

Wenn Verbraucher auf ein KI-Video stoßen, reicht es ihnen schon, dass die Figuren natürlich und die Bilder schön aussehen; die „Abnahme des Werks“ in der professionellen Produktion bedeutet auch, dass die Realitätsnähe von Figuren und Vermögenswerten berücksichtigt wird, ob die Kameradarstellung der Erzählung dient, ob der Ton konsistent bleiben kann und ob die endgültige Bildqualität die Anforderungen für die nachfolgende Produktion und Ausstrahlung erfüllt. 

Deshalb erweitert Jingrui AI seine Produktfähigkeiten weiter auf die professionelle „Abnahme des Werks“. Im derzeit veröffentlichten Produktsystem baut die Plattform eine Produktionskette rund um Glieder wie Realitätsnähe, Anpassung von Vermögenswerten mit menschlicher Lebendigkeit, professionelle Kameradarstellung, Superauflösung und HDR sowie Sprachkonsistenz auf und führt gleichzeitig professionelle Skills ein, um einige spezifische Herstellungsmethoden in Arbeitsabläufe zu kapseln. 

Was hier mehr Aufmerksamkeit verdient, ist, dass die professionelle Erfahrung der Filmindustrie die Chance hat, zu softwarebasiert zu werden. Die früheren Fortschritte bei KI haben nur die Fähigkeiten ergänzt, die für die professionelle Filmproduktion benötigt werden, aber Skills ermöglichen es der KI, die schwer zu kopierenden, in den Köpfen der Praktizierenden vorhandenen professionellen Erfahrungen der Filmindustrie zu verstärken. 

Ein Kameramann weiß, welche Brennweite besser zu einer bestimmten Stimmung passt, ein Postproduktionsmitarbeiter weiß, wie er die Bilder bearbeiten muss, damit sie die Lieferstandards erfüllen. Diese Fähigkeiten konnten früher kaum von bestimmten Personen getrennt kopiert werden. Wenn diese Erfahrungen allmählich von KI zu digitalen Vermögenswerten, Skills und Arbeitsabläufen verdichtet werden können, kann die gleiche überprüfte Herstellungsmethode wiederholt aufgerufen und im Team weitergegeben werden. Die Lernobjekte von KI erstrecken sich von den endgültigen Filmwerken weiter auf die Methoden, mit denen die Filmindustrie Werke herstellt.