Drei Routen, ein Matchpoint – wer im Billionen-Poker um KI-Videos am Ende das letzte Lachen hat?
In der ersten Hälfte des Jahres 2026 wurde Sora aufgrund von Schwierigkeiten bei der Kommerzialisierung eingestellt, während die inländische KI-Videobranche einen historischen Wendepunkt erlebte.
Von der Veröffentlichung des weltweit ersten Echtzeit-Weltmodells für 1080P, PixVerse R1, durch Aishi Technology im Januar bis zur Neudefinition des industriellen Videogenerationsstandards durch Seedance 2.5 von ByteDance im Juli: In nur einem halben Jahr hat die gesamte Branche gemeinsam drei zentrale Probleme überwunden – die Generierung langer Zeitreihen, die Konsistenz von Objekten und die Echtzeitbearbeitung – und ist offiziell in eine neue Phase der industriellen Nutzbarkeit eingetreten.
Wenn man sagt, dass die Branche in den letzten zwei Jahren noch im Dunkeln nach technischen Möglichkeiten suchte und KI-Video-Anbieter noch darum kämpften, ein Gesicht ohne Verzerrungen zu erzeugen, dann ist jetzt der erste Lichtstrahl der Morgendämmerung durch die Wolken gebrochen, und es gibt eine branchenweite gemeinsame Antwort auf technische Durchbrüche.
Das ist nicht nur ein technisches Fest. Entscheidender ist, dass die kapitalintelligenten Akteure bereits aktiv geworden sind und sich die Finanzierungsgeschwindigkeit der führenden Unternehmen deutlich beschleunigt hat.
Dahinter haben sich die Spielregeln des Kapitals leise verändert. Sie zahlen nicht mehr für technische Geschichten, sondern beginnen, Preise für klare Szenarioschließungen und vorhersehbare Wachstumskurven festzulegen.
Unter der lebhaften Oberfläche vollzieht sich in der Branche eine tiefe Trennung der Entwicklungswege. Drei völlig unterschiedliche technische Wege – industrielle Werkzeuge, Echtzeit-Interaktionsweltmodelle und quelloffene, breit zugängliche Lösungen – entsprechen drei Einschätzungen der endgültigen Form von KI-Videos und treiben die Anbieter in völlig unterschiedliche kommerzielle Wettbewerbsbereiche.
Die technische Wasserscheide ist überschritten, das Kapital ist bereit für den Einsatz, und der echte Wettbewerb hat gerade erst begonnen.
1
KI-Videos haben die technische Wasserscheide überschritten,
Anbieter setzen auf drei Entwicklungswege
Hinter dem Begriff „KI-Video“ in den letzten zwei Jahren verbarg sich nicht nur ein Schlüsselszenario für die Umsetzung großer Modelle, sondern auch unzählige peinliche Situationen, die die Kreativen zum Lachen und zum Weinen brachten.
Die generierten Personen verformen sich beim Gehen, die Kleidung wechselt im nächsten Moment die Farbe; das generierte Video wird nach mehr als 5 Sekunden zu einem „strom des Bewusstseins“ mit Verzerrungen; die Echtzeitänderung eines Details ist ein unmögliches Unterfangen …
In der ersten Hälfte des Jahres 2026 hat sich die Branchenerzählung geändert – die Anbieter haben gemeinsam die Schwelle der Nutzbarkeit von KI-Videos überschritten und beginnen, in verschiedene Richtungen des Endzustands vorzustoßen. Frühere branchenweite Probleme wie lange Zeitreihen, Konsistenz und Steuerbarkeit werden jetzt durch diesen branchenweiten gemeinsamen technischen Fortschritt nacheinander gelöst.
Der technische Durchbruch ist kein Endpunkt, sondern eine Weggabelung. Wenn der Wettbewerb um KI-Videos von der Frage „ob es machbar ist“ zu der Frage „wie gut es umgesetzt werden kann“ übergeht, verfolgen die Anbieter ihre eigenen Wege und Überlegungen.
Große Unternehmen verfolgen den Weg der industriellen Produktion. Sie nutzen ihre eigenen ökologischen Szenarien für die technische Entwicklung, setzen KI-Videos als Werkzeug zur Effizienzsteigerung der Kerngeschäfte ein und sind der Meinung, dass die endgültige Rolle von KI-Videos das digitale Produktionswerkzeug ist.
Seedance 2.5, das von ByteDance im Juli veröffentlicht wurde, ist ein Vertreter dieses Weges. Seine wichtigste Innovation ist nicht nur die Fähigkeit zur nativen kontinuierlichen Generierung von 30 Sekunden, die multimodale Referenzeingabe von 50 Kanälen und die lokale Bearbeitung auf Zeitstempel-Ebene, sondern vor allem, dass es die Fähigkeiten von KI-Videos zum ersten Mal über den Bildschirm hinaus gebracht hat.
Quelle: WeChat-Offizielles Konto von Jimeng AI
KI-Videos sind nicht mehr auf die Erstellung von Online-Inhalten wie Werbung und Kurzdramen beschränkt, sondern sind tief in die Produktionsketten der realen Industrie integriert und werden zu grundlegenden Produktionswerkzeugen in Bereichen wie industrielle Fertigung, körperbezogene Intelligenz und autonomes Fahren.
In der industriellen Fertigungsszene kann Seedance 2.5 direkt CAD-Zeichnungen, reale Fotos von Produktionslinien und SOP-Texte von Verfahren lesen und mit einem Klick standardisierte Betriebsdemonstrationen und Sicherheits Schulungsvideos generieren; im Bereich der körperbezogenen Intelligenz kann es komplexe Interaktionsdaten erzeugen, die den physikalischen Gesetzen entsprechen, und kostengünstige Trainingsbeispiele für Roboter liefern, um das branchenweite Problem der hohen Kosten für die Erfassung realer Daten und der Schwierigkeit, extreme Szenarien zu reproduzieren, zu lösen; im Bereich des autonomen Fahrens kann es massenweise Simulationsvideos von extremen Betriebsbedingungen wie Starkregen und starkem Nebel sowie von Randfällen von Unfällen erzeugen, um den Mangel an echten Daten auszugleichen.
Von der Inhaltserstellung auf dem Bildschirm zur industriellen Produktion außerhalb des Bildschirms wird die Grenze von KI-Videos vollständig geöffnet.
AliBabas HappyHorse verfolgt einen radikalen industriellen Weg der Architektur, der mit einer einsträngigen Transformer-Architektur die gleichzeitige Generierung von Audio und Video in einem Inferenzschritt realisiert, das Problem der asynchronen Ton- und Bildwiedergabe auf unterster Ebene löst und die Inferenz-Effizienz durch Destillations-Technologie um ein Vielfaches steigert. Schließlich gibt es standardisierte APIs über Alibaba Cloud weiter und bindet ökologische Szenarien von Alibaba wie E-Commerce und Marketing ein.
Kuaishou Keling aus derselben Branche konzentriert sich stärker auf die industrielle Effizienzsteigerung der Inhaltsindustrie, legt den Schwerpunkt auf die Konsistenz von Objekten in langen Zeitreihen und die feine Steuerbarkeit und unterstützt die kontinuierliche Videogenerierung von bis zu einer Minute. Intern dient es der Erstellung von Materialien für Kuaishou-Kurzdramen und Magnet-Engine; extern stellt es APIs und SaaS-Werkzeuge zur Verfügung und wird zu einem Standard-Produktionswerkzeug für viele MCNs und Marken.
Wenn der industrielle Weg die Effizienz der bestehenden Industrie steigert und Optimierungen im vorhandenen Rahmen der Videoproduktion vornimmt, dann verfolgen die meisten Startup-Anbieter den Weg des Weltmodells, der das Wesen des Videos direkt neu definiert. Dieser Weg ist ehrgeiziger und geht davon aus, dass KI-Videos der zentrale Einstiegspunkt für die nächste Generation der Mensch-Maschine-Interaktion werden.
Aishi Technology ist ein entschlossener Erforscher in dieser Richtung. Im Januar dieses Jahres lag das Kernverkaufsargument des Echtzeit-Weltmodells PixVerse R1 in seiner Echtzeitfähigkeit und Interaktivität. Benutzer können während der Betrachtung des Bildes Textbefehle eingeben, um Kamera, Licht und Handlungsstrang in Echtzeit anzupassen und so dynamische interaktive Erstellung zu realisieren.
Stellen Sie sich vor: Sie schauen ein Kurzdrama, gefällt Ihnen das Ende nicht, geben Sie einen Satz ein, und die Handlung ändert sich in Echtzeit. Das ist kein linear abgespielter Videostrom mehr, sondern ein dynamisch berechnetes Paralleluniversum.
Quelle: Video-Konto von Aishi Technology
Seit der Veröffentlichung dieses Modells hat PixVerse weltweit über 150 Millionen Nutzer und steht in der Rangliste der Videogenerierungsmodelle von Artificial Analysis weltweit ganz oben.
Kunlun Wanwei legt den Schwerpunkt auf die Bereiche Simulation und Spiele. Auf der Grundlage der DiT-Architektur, die mit Datensätzen der Unreal Engine trainiert wurde, kann es nicht nur die Konsistenz der Szenariologik für eine Minute erreichen, sondern auch die Echtzeit-Rendering mit einer einzelnen Grafikkarte durchführen. Später wird es auf Bereiche wie Robotersteuerung und industrielle Simulation erweitert.
Dieser Weg hat das größte Potenzial, aber die Schwierigkeiten bei der Kommerzialisierung sind auch höher. Es schafft neue Produktkategorien, statt bestehende Produktionsabläufe zu optimieren, und die Markteinführung braucht noch Zeit.
Produktionswerkzeuge und Weltmodelle erforschen im Wesentlichen den Wert nach oben, während der Weg der quelloffenen, breit zugänglichen Lösungen in das Ökosystem hineinwächst und KI zu einer allgemein verfügbaren Versorgung wie Strom, Wasser und Gas macht, indem quelloffene oder kostengünstige APIs angeboten werden. In diesem Weg kann derjenige, der die Generierungskosten auf das Minimum senkt und das Entwicklerökosystem aufbaut, den Branchenstandard definieren.
Die Veröffentlichung des quelloffenen Modells MiniMax H3 war eines der einflussreichsten Ereignisse der ersten Hälfte des Jahres. Neben der Verbesserung der Fähigkeiten zur Generierung aller Modalitäten ist sein eigentliches Killerargument die Preisgestaltung: 0,8 Yuan pro Sekunde für 2K-Auflösung, weniger als ein Drittel des üblichen Branchenpreises. Nach der Veröffentlichung als Open-Source kann das Unternehmen das Modell lokal bereitstellen und frei anpassen, was das Preissystem der Anbieter von geschlossenen APIs direkt durchbricht. Shengshu Technology ist tief mit vertikalen Szenarien verbunden, richtet die Fähigkeiten des Modells vollständig auf den Produktionsablauf von Kurzdramen aus und gewinnt durch seine szenariospezifischen Vorteile große Aufrufvolumina.
Die drei Wege scheinen klar voneinander getrennt zu sein, sind aber keine völlig unabhängigen parallelen Bereiche. Stattdessen gibt es immer mehr Überschneidungen und Integrationen bei technischen Fähigkeiten und Einsatzszenarien.
Seedance 2.5, das den industriellen Weg verfolgt, durchbricht die Grenzen der Inhaltsproduktion und entwickelt Bereiche wie körperbezogene Intelligenz und Simulation des autonomen Fahrens – im Wesentlichen berührt es bereits den Kern des Weltmodells. PixVerse R1, das auf Echtzeit-Interaktion setzt, öffnet auch APIs, um industrielle Inhaltsszenarien wie Werbung und Kurzdramen zu bedienen. Open-Source-Anbieter wie MiniMax verbessern kontinuierlich die Fähigkeiten zur Generierung langer Zeitreihen und zur Konsistenz von Objekten, um die Leistungsgrenzen von geschlossenen industriellen Modellen zu erreichen.
Ihre Einschätzungen zum Endzustand haben unterschiedliche Schwerpunkte und ihre technischen Wege haben unterschiedliche Kompromisse, aber im Kern treiben sie alle dasselbe voran: KI-Videos von einer Demonstration zur Darstellung technischer Fähigkeiten zu einer umsetzbaren, skalierbaren und wiederverwendbaren allgemeinen Fähigkeit zu machen. Die Phase der Vorteile durch reine technische Parameter ist vorbei. Der nächste Wettbewerb ist kein Entweder-Oder zwischen verschiedenen Wegen, sondern die Frage, wer zuerst einen reifen kommerziellen Kreislauf in seinem Hauptbereich realisieren kann.
2
Von Kapital begeistert,
Bewertungslogik wechselt von technischen Geschichten zur Umsetzung in Szenarien
Die Trennung der technischen Wege spiegelt sich auch im Kapitalbereich wider.
Wenn die gesamte Branche die einheitliche Schwelle der technischen Fähigkeiten überschreitet, wechselt die Logik der Kapitalanlagen von der technischen Erzählung zur kommerziellen Umsetzung. Unterschiedliche Einschätzungen zum Endzustand entsprechen unterschiedlichen Geschäftsmodellen und führen natürlich zu unterschiedlichen Finanzierungswegen.
Die Finanzierungswelle, die sich im Juli dieses Jahres konzentrierte, ist ein markanter Punkt für diesen Logikwechsel. In nur 20 Tagen haben fünf Unternehmen wie Keling AI, Shengshu Technology und Aishi Technology nacheinander große Finanzierungen bekanntgegeben, deren Gesamtsumme fast 30 Milliarden Yuan beträgt.
Das ist keine blase aus blindem Trendjagd, sondern der gemeinsame Einstieg des Kapitals. Wenn die technischen Fähigkeiten die industrielle Schwelle überschreiten und der kommerzielle Weg klar wird, wird das Kapital nicht gleichmäßig verteilt. Anbieter mit unterschiedlichem Hintergrund gehen völlig unterschiedliche Finanzierungswege und haben unterschiedliche Wachstumserwartungen.
Die „unauffälligste“ Gruppe ist das geschlossene Ökosystemmodell großer Unternehmen. Wie ByteDance Seedance und Alibaba HappyHorse. Sie nehmen fast keine externen Finanzierungen auf, fehlen ihnen aber nie an Rechenleistung, Szenarien und Kunden, da sie bereits in das kommerzielle geschlossene System der Mutterunternehmen integriert sind.
Nehmen wir ByteDance als Beispiel: Volcano Engine liefert die Grundlage für die Rechenleistung, das Doubao-Großmodell die technische Grundlage, Douyin, Jianying und Hongguo-Kurzdramen die Einsatzszenarien und die Juliang-Engine die zahlenden Kunden. Technische Iteration und kommerzielle Verwertung können gleichzeitig stattfinden. Nach Berichten von spätem LatePost hat das mit Seedance verbundene Geschäft einen jährlichen Umsatz von 2 Milliarden US-Dollar erreicht, der im Grunde die Rechenkosten von Doubao decken kann.
Alibaba verfolgt ein zweigleisiges Modell aus Eigenentwicklung und Investitionen: Einerseits entwickelt es intern HappyHorse weiter, andererseits hat es fast alle wichtigen Anbieter wie Aishi, Shengshu und Keling investiert.
Aber die Kosten dieses Modells sind nicht zu unterschätzen. Intern gegründete Projekte stehen oft vor Konflikten bei der Ressourcenverteilung der Gruppe, und das Innovationstempo kann durch den gesamten strategischen Zyklus der Mutterunternehmen eingeschränkt werden. Wicht