Über diesen brandneuen Wettbewerb um Echtzeit-Generierungsmodelle
In den letzten zwei Jahren war die häufigste Nutzungsform von KI-Videos folgende: Man gibt einen Prompt ein, wartet Dutzende Sekunden oder noch länger und erhält dann ein vollständiges Video. Diese Vorgehensweise ähnelt eher einem Produktionswerkzeug – der Nutzer stellt eine Anforderung, das Modell generiert das Ergebnis, und der Nutzer wählt anschließend aus den Ergebnissen aus und bearbeitet sie. Das Video selbst ist ein einmaliges Produkt, und sobald die Generierung abgeschlossen ist, endet auch die Interaktion.
Aber in diesem Jahr taucht eine andere Art von Video auf.
Das Video muss nicht erst vollständig generiert werden, bevor es der Nutzer sehen kann. Ein digitaler Mensch kann mitten im Gespräch unterbrochen werden und dann weiter antworten; ein Video, das gerade erstellt wird, kann in Echtzeit mit neuen Personen, neuen Kleidern, neuen Hintergründen versehen oder sogar in seinem Stil verändert werden. Das Modell generiert nicht mehr nur „ein Video“, sondern erzeugt in einem fortlaufenden, dynamischen Szenario ständig neue Bilder auf Grundlage der Eingaben des Nutzers.
Das bedeutet, dass KI-Videos möglicherweise vor einem anderen Problem als früher stehen. Es geht nicht nur um die Nachfrage nach Inhaltsproduktion wie Kurzdramen, Werbung und Film- und Fernsehproduktion, sondern auch um Live-Übertragungen, Spiele, soziale Interaktionen, Begleitung und verschiedene Interaktionsszenarien, die fortlaufende visuelle Rückmeldungen erfordern.
Große Technologieunternehmen beginnen ebenfalls, sich aus verschiedenen Richtungen diesem Thema zu widmen.
Die Maßnahmen von ByteDance sind typisch. Einerseits treiben Seedance 2.0 und Seedance 2.5 die Videogenerierung weiter zu einem leistungsfähigeren Kreativwerkzeug voran; andererseits beginnt das Seed-Team, das Problem der Echtzeit-Interaktion von Audio und Video zu lösen. Das im August veröffentlichte SeedRealtime ist ein natives Vollduplex-Modell für Audio und Video, das Ton-, Bild- und Zeitinformationen fortlaufend verstehen und Unterbrechungen, Umgebungsänderungen und Kontext im Gespräch verarbeiten kann.
Es ist kein Echtzeit-Videogenerierungsmodell im herkömmlichen Sinne, aber es weist auf eine ähnliche Veränderung hin: KI wartet nicht mehr nur auf die Eingabe des Nutzers, um dann ein Ergebnis zu generieren, sondern beginnt, ständig in einem dynamischen Szenario präsent zu sein.
Über diesen brandneuen Wettbewerb um Echtzeit-Videos führte ich ein langes Gespräch mit Zhang Jintao, Leiter der Abteilung für strombasierte Videogenerierung und Inferenz bei Shengshu Technology.
Shengshu Technology ist ein Modellunternehmen, das 2023 vom Team von Professor Zhu Jun der Tsinghua-Universität gegründet wurde. Jintao gehört zur Generation nach 2000 und beschäftigte sich früher hauptsächlich mit der Beschleunigung der Modellinferenz. 2024, in seinem ersten Jahr als Doktorand bei Professor Zhu Jun, entwickelte er gemeinsam mit dem Team SageAttention, um die Attention-Berechnungen mit niedrigen Bitraten zu beschleunigen und eine mehr als zweifache End-to-End-Beschleunigung in den Videomodellen von Shengshu zu erreichen. Diese Erfahrung entspricht genau der praktischen Herausforderung von Echtzeit-Videos: Das Modell muss nicht nur qualitativ hochwertig genug generieren, sondern auch schnell genug arbeiten, und die Kosten müssen für normale Nutzer erschwinglich sein.
Im Mai 2024, als Shengshu die erste Version des Modells vorbereitete und es weltweit online stellen wollte, begann Zhang Jintao als Praktikant an der Inferenzoptimierung von Videomodellen mitzuwirken. Im März 2026 wurde er Leiter des Teams für Echtzeit-Videogenerierung. Vier Monate später veröffentlichte Shengshu Vidu S1 und brachte die Videogenerierung zu Echtzeit-Interaktion: Wenn der Nutzer ein Bild hochlädt, kann eine digitale Figur in Echtzeit reagieren und Bewegungen ausführen, und diese Funktion läuft bereits auf Consumer-Grafikkarten. Zwei Monate später wurde Vidu S2 veröffentlicht, das die Echtzeit-Funktionen von digitalen Menschen auf die Videobearbeitung erweiterte, sodass Personen, Kleidung, Hintergründe und Stile in Echtzeit verändert werden können.
Hinter den Produktveränderungen stecken eigentlich noch größere Fragen:
Wenn Videos ebenso wie Sprache in Echtzeit generiert werden können, welche Art von Medium werden sie letztendlich sein?
Gleichzeitig steigen große Technologieunternehmen in diesen Bereich ein. In diesem brandneuen Wettbewerb ist am Ende das Modell selbst oder die Plattform, die den Zugang zu den Nutzern kontrolliert, wertvoller?
Im Folgenden unser Gespräch.
01
Was unterscheidet diese Runde von Echtzeit-Videos von der Metaverse-Welle?
Gu Lingyu: Warum entwickeln sich KI-Videos von der Offline-Generierung zur Echtzeit-Interaktion?
Zhang Jintao: Es ist nicht so, dass wir von der Offline-Generierung zur Echtzeit-Interaktion wechseln wollen, sondern dass die Echtzeit-Interaktion eine neue Nachfrage ist, die wir erfüllen müssen.
Die Offline-Generierung ist hauptsächlich ein Kreativwerkzeug, dessen Marktpotenzial nicht besonders groß ist. Das wird von der Nachfrage bestimmt. Angenommen, jeder Mensch schaut täglich eine Stunde Video, es gibt 6 Milliarden Menschen auf der Welt, aber ein Inhalt kann von vielen Personen wiederholt abgespielt werden, also muss die endgültige Generierungsnachfrage noch durch die durchschnittliche Abspielmenge geteilt werden. Selbst wenn in Zukunft ein großer Teil der Offline-Videoinhalte von KI generiert wird, wird das Marktpotenzial durch diese Logik eingeschränkt.
Bei der Echtzeit-Interaktion ist das anders. Bei Sprachmodellen hat jede Person ihre eigene Sitzung. Technische Fachkräfte schreiben täglich Code und stellen technische Fragen, wodurch viele Token verbraucht werden; normale Nutzer chatten auch mit Doubao, ChatGPT, Gemini und Claude. Bei Echtzeit-Videos ist das genauso: Sie erfüllen die unabhängige Echtzeit-Unterhaltungsnachfrage und interaktive visuelle Genüsse für jede Person, also hat auch jede Person eine unabhängige Sitzung. Die Nachfrage der Menschen nach interaktiven visuellen Genüssen ist sehr groß, fast alle täglichen Aktivitäten der Menschen sind interaktiv, einschließlich Ausgehen, Kommunizieren mit Freunden und Spielen.
Deshalb glaube ich, dass Echtzeit-interaktive Videos bzw. die Echtzeit-interaktive multimediale Unterhaltungsnachfrage ein neuer, sehr großer Markt sind.
Gu Lingyu: Was unterscheidet diese Runde von Echtzeit-Videos von der Welle der Metaverse-digitalen Menschen?
Zhang Jintao: Zuerst die Kosten. Herkömmliche digitale Menschen nutzen CG plus Motion Capture, man muss das Image und die Standards für Motion Capture im Voraus entwerfen, also sind die anfänglichen Kosten relativ hoch.
Aber bei den heutigen Modellen lädt man ein oder zwei Bilder hoch, klickt auf Start, wartet vier bis fünf Sekunden, und man kann sofort in Echtzeit chatten und das Tool nutzen – es gibt einen deutlichen Unterschied bei den anfänglichen Nutzungskosten. Zweitens können die digitalen Menschen im herkömmlichen Metaverse keine Echtzeit-Interaktion durchführen, sie führen nur die voreingestellten Bewegungen nach Vorlage aus.
Bei den heutigen Echtzeit-Interaktionsmodellen bestimmt der Inhalt deiner Interaktion mit ihm, was er generiert, es gibt keine voreingestellten Vorlagen, alles was du ihm auftragen willst, kann in Echtzeit passieren.
Gu Lingyu: Was ist der entscheidende Faktor, der diese Runde von Echtzeit-Videos erst möglich macht?
Zhang Jintao: Die Fähigkeiten des Modells selbst haben eine neue Stufe erreicht.
Früher waren viele Dinge nicht machbar, nicht weil niemand sie sich vorgestellt hat, sondern weil das Modell sie nicht zu ausreichend niedrigen Kosten ausführen konnte. Heute ist die Qualität der Videogenerierung gestiegen, gleichzeitig hat sich das Verständnisvermögen der Modelle verbessert, und zusammen mit der Inferenzoptimierung wird es möglich, in Echtzeitszenarien einzusteigen.
Die Echtzeit-Videogenerierungstechnik hat sich erst in den letzten sechs Monaten entwickelt, die dazugehörigen nachgelagerten Produkte und die Industrie sind noch nicht vollständig ausgereift, aber der Prozess hat begonnen. Ein Jahr später glaube ich, wird es viele ausgereifte Anwendungen geben, und der Wettbewerb wird noch intensiver sein.
Gu Lingyu: Wann wird diese Branche wirklich explodieren?
Zhang Jintao: In den nächsten zwei Jahren wird ein Punkt erreicht, der dem Explosionspunkt von GPT-3.5 sehr nahe kommt.
Gu Lingyu: Wenn wir weiter in die Zukunft blicken, wie groß wird das Nachfragevolumen von Echtzeit-Videos letztendlich sein?
Zhang Jintao: In 3 bis 5 Jahren wird der Markt für Echtzeit-interaktive Videos bzw. die Echtzeit-interaktive multimediale Unterhaltungsnachfrage mindestens so groß sein wie der der Sprachmodelle, vielleicht sogar noch größer.
Gu Lingyu: Du denkst, das geht schon in 3 bis 5 Jahren?
Zhang Jintao: Zumindest technisch gibt es keine solchen Engpässe mehr.
02
Der erste Indikator für Echtzeit-Videos ist nicht die Bildqualität, sondern „mitzuhalten“
Gu Lingyu: Was ist der wichtigste technische Indikator für Echtzeit-Videos?
Zhang Jintao: Zuerst muss die Geschwindigkeit mindestens mit der Abspielgeschwindigkeit mithalten können. Wenn ein Video mit 24 oder 30 Bildern pro Sekunde abgespielt wird, darf die Generierung eines einzelnen Bildes nicht Hunderte Millisekunden oder mehrere Sekunden dauern, sonst kann es nicht wirklich in Echtzeitszenarien eingesetzt werden. Deshalb müssen wir zuerst die End-to-End-Latenz und den Durchsatz lösen, damit das Modell fortlaufend Bilder erzeugen kann.
Natürlich ist die Bildqualität nach Erreichen der Echtzeitgeschwindigkeit immer noch sehr wichtig. Aber wenn die Geschwindigkeit diesen Schwellenwert nicht überschreitet, kann selbst die beste Bildqualität kein echtes Echtzeiterlebnis erzeugen. Deshalb sehe ich das als eine harte Schwelle: Zuerst Echtzeit erreichen, dann über Qualität, Stabilität und Interaktionserfahrung sprechen.
Gu Lingyu: Kann man von Offline-Videos zu Echtzeit-Videos gelangen, wenn man nur die Generierungsgeschwindigkeit ständig erhöht?
Zhang Jintao: Die Erhöhung der Generierungsgeschwindigkeit ist notwendig, aber das bedeutet nicht, dass Echtzeit-Videogenerierung erreicht ist. Beschleunigungstechniken wie TurboDiffusion können die Zeit für die Videogenerierung stark verkürzen. Aber wenn man die Vorgehensweise der Offline-Generierung beibehält, ist es im Grunde immer noch so, dass man zuerst einen Prompt angibt und dann das gesamte Video generiert. Es löst die Frage „Wie lange dauert es, dieses Video zu generieren?“, aber es bedeutet nicht, dass das Bild sofort reagiert, wenn der Nutzer den Prompt währenddessen ändert.
Bei Echtzeit-Videos geht es um eine andere Geschwindigkeit: Wie viel Zeit vergeht von der neuen Anweisung des Nutzers bis zur tatsächlichen Auswirkung dieser Anweisung auf das Bild.
Zum Beispiel wenn das Video gerade läuft und der Nutzer plötzlich „dreh dich nach links“ sagt, muss das System sofort (z. B. innerhalb von 0,1 Sekunden) diese Aktion ausführen und gleichzeitig die Kohärenz zwischen den vorherigen und nachfolgenden Bildern beibehalten. Wenn man erst das gesamte Video neu generieren und dann abspielen muss, ist es selbst bei sehr schneller Generierung schwer, ein echtes Echtzeit-Interaktionserlebnis zu erzeugen.
Deshalb ist das nicht nur ein Problem der Inferenzbeschleunigung, sondern die Entwurfsziele des Algorithmus und die dazugehörige technische Umsetzung müssen sich ändern. Die Generierungsgeschwindigkeit beantwortet die Frage „Wie schnell wird das Video erstellt?“, die Echtzeiteigenschaft beantwortet die Frage „Wie schnell kann das System auf dich reagieren?“ – das zwei Dinge sind nicht gleichzusetzen.
Gu Lingyu: Welche konkreten Änderungen hat Vidu S2 bei Echtzeit-Videos vorgenommen?
Zhang Jintao: Bei S2 konzentrieren wir uns mehr darauf, dass die generierten Videos wirklich in Echtzeit interagiert und bearbeitet werden können.
Diesmal gibt es zwei Hauptrichtungen. Die eine ist S2 Avatar. Neben einfachen Sprech-, Ausdrucks- und Körperbewegungen kann es auch komplexe Aktionsanweisungen wie Tanzen in Echtzeit beantworten. Während der Generierung können jederzeit neue Referenzbilder hinzugefügt werden. Zum Beispiel kannst du dem Modell mitten in der Interaktion ein Bild eines Gegenstands zeigen, dann kann die Figur diesen Gegenstand aufheben. Das bedeutet, dass Avatar nicht mehr nur ein voreingestellter digitaler Mensch ist, sondern während der Interaktion ständig neue Informationen und Anweisungen empfangen kann. Die andere Richtung ist S2 Editing. Seine Eingabe kann ein laufender Videostream sein: Das Modell empfängt das Video, bearbeitet es in Echtzeit und gibt fortlaufend neue Bilder aus. Zum Beispiel kannst du während der Videowiedergabe jederzeit Stil, Figur, Kleidung oder Hintergrund wechseln, während die ursprünglichen Bewegungen der Person und der Videoinhalt beibehalten werden.
Gu Lingyu: Können die NPCs in Spielen auch mit solchen Modellen erstellt werden?
Zhang Jintao: Ich denke, das ist eine ganz natürliche Richtung. Das Verhalten von herkömmlichen Spiel-NPCs hat viele Voreinstellungen: Was sie unter welchen Umständen sagen und welche Aktionen sie ausführen, ist größtenteils im Voraus entworfen. Wenn das Modell das Verhalten des Spielers in Echtzeit verstehen und dann entsprechende visuelle Rückmeldungen generieren kann, wird die Freiheitsgrade der NPCs stark erhöht.
Aber da gibt es auch ein praktisches Problem: die Kosten. Wenn jede Reaktion eines NPCs viele GPU-Ressourcen verbraucht, ist es eine andere Frage, ob es wirtschaftlich rentabel ist. Deshalb kommen wir wieder zu dem Punkt zurück, den wir gerade genannt haben: Das Modell muss nicht nur gut genug sein, sondern auch schnell genug und preiswert genug.
03
Echtzeit-Videos fehlt es nicht an Rohdaten, sondern an qualitativ hochwertigen Daten
Gu Lingyu: In der Robotik-Branche ist die Entwicklung durch Daten eingeschränkt, manche Leute glauben, dass es keinen plötzlichen, explosiven GPT-Moment geben wird. Denkst du, das gilt auch für die Echtzeit-Videogenerierung?
Zhang Jintao: Ich denke, das ist nicht ganz gleich. Das offensichtliche Problem der embodied Intelligenz heute ist, dass es wenige Daten aus der realen Welt gibt, die direkt für das Training verwendet werden können. Wenn ein Roboter eine Aktion ausführt, muss er sie tatsächlich durchführen und die Daten erfassen, das ist mit hohen Kosten verbunden.
Aber bei Videos fehlt es nicht an Rohdaten. In China werden täglich sehr viele Videos erzeugt, Kurzvideos und Live-Übertragungen sind sehr reichhaltige Datenquellen. Unser Problem ist also nicht „keine Videos zu haben“, sondern