Claude und GPT wagen den Schritt über ihre ursprünglichen Einsatzbereiche hinaus in die Videogenerierung – ist der ökonomische Burggraben der Anbieter der Kategorie Seedance noch intakt?
Im vergangenen Monat war die aufregendste Diskussionswelle im Bereich der KI-Videotechnologie nicht um professionelle Videomodelle wie Seedance, Minmax oder Keling herum, sondern um allgemeine große KI-Modelle, die „über die Grenzen hinaus“ eingedrungen sind.
Claude Opus 5.5 rendert Videos per Code, hat innerhalb weniger Tage eine große Anzahl von populärwissenschaftlichen Animationen, kreativen Kurzfilmen und Musikvideos hervorgebracht. Auf Plattformen wie X sind zahlreiche virale Inhalte entstanden, und es hat sogar ein neues kreatives Paradigma populär gemacht: Vibe Video.
GPT-6 Astra hingegen agiert als „KI-Regisseur“, übernimmt Aufgaben von der Storyboard-Planung bis zur Vorvisualisierung mit einfachen Modellen, greift tief in professionelle Software wie Blender, Unreal Engine und DaVinci Resolve ein, erledigt Arbeiten wie Szenenaufbau, Kamera-Vorvisualisierung und Schnittausführung und besetzt allmählich die vorgelagerte Ebene der Videogenerierung.
Die beiden verfolgen völlig unterschiedliche Wege: Der eine ist die prozedurale Kreativität per Code-Rendering, der andere die filmindustrielle Produktion durch Raumplanung. Keiner von beiden tritt direkt in einen Wettbewerb um die Bildqualität ein, sondern dringt von den vorgelagerten Eingangspunkten und spezialisierten Szenen aus vor und verändert heimlich die Fähigkeitsgrenzen der KI-Videotechnologie.
Während allgemeine große KI-Modelle von außen in den Bereich eindringen und die Fähigkeitsgrenzen der KI-Videotechnologie heimlich verändern, schreitet auch die Entwicklung professioneller Videomodelle mit beschleunigtem Tempo voran. Führende Akteure wie ByteDance, MiniMax und Kuaishou dringen kollektiv in die vorgelagerte Ebene der Kreativarbeit vor und decken nach und nach die gesamte Produktionskette von der Skriptzerlegung, der Storyboard-Koordination bis zum Schnitt des fertigen Videos ab. Diese tiefe Verankerung im gesamten kreativen Prozess verleiht ihnen eine höhere Unersetzbarkeit angesichts dieser grenzüberschreitenden Konkurrenz.
01
Opus 5.5 macht Vibe Video populär
„Malt“ Code direkt Videos?
Am 22. September veröffentlichte Anthropic offiziell Claude Opus 5.5. Der offizielle Fokus der Veröffentlichung lag auf der Programmierfähigkeit und der Ausführung von Agent-Aufgaben, die Videofähigkeit stand nicht im Mittelpunkt der Produktpräsentation. Doch bei den anschließenden Entwicklertests tauchte unerwartet ein Überraschungshit auf: Dieses Modell gibt zwar keine direkten Pixelbilder aus, kann aber durch das Schreiben von Frontend-Code Animationsvideos mit sehr hoher Fertigstellungsqualität erzeugen.
Dies ist keine völlig neue Idee. Früher verbreiteten sich reine Code-Zeichentests wie „Ein Pelikan fährt Fahrrad per SVG“ bereits in der Community. Doch die Codestabilität und Aufgabenplanungsfähigkeit von Opus 5.5 haben diese kreative Methode von spielzeugartigen Demonstrationen zur vollständigen praktischen Anwendung gebracht. Die entsprechenden Werke tauchten zuerst gehäuft auf der Plattform X auf und breiteten sich dann auf inländische Plattformen wie Xiaohongshu und Douyin aus.
Ein Kreativer scherzte, dass seine Timeline in der Woche nach der Veröffentlichung von Opus 5.5 fast vollständig mit verschiedenen KI-Code-Videos gefüllt war.
Inmitten dieser Welle stammt das einflussreichste Beispiel, das über die Szene hinaus bekannt wurde, von dem X-Blogger @anabology. Er lieferte Opus 5.5 nur einen Referenz-Prompt, die Zugriffsberechtigung für Midjourney und ein Moodboard, woraufhin das Modell den gesamten Produktionsprozess selbstständig startete und nach 12 Stunden einen dystopischen Kurzfilm mit filmischer Qualität ausgab. Bisher hat der Beitrag zu diesem Werk mehr als 20 Millionen Aufrufe erzielt.
Elon Musk zeigte großes Interesse an diesem Werk, teilte es mehrfach und interagierte damit und sagte offen: „Dieses Mal spüre ich tiefgreifend die weitreichenden Auswirkungen von AGI“. Er antwortete auch auf einen Beitrag mit der These, dass „Opus 5.5 80 % bis 90 % des Niveaus der allgemeinen künstlichen Intelligenz erreicht hat“ mit dem Wort „Accurate“. Die öffentliche Anerkennung durch einen direkten Konkurrenten ließ die Videofähigkeit von Opus 5.5 noch breiter bekannt werden.
Auch in Szenen wie populärwissenschaftlichen Kurzfilmen und Produktwerbevideos sind zahlreiche Beispiele entstanden, die heftige Diskussionen auslösten. Der Blogger vittorio gab nur eine einzige kreative Anweisung, woraufhin Opus 5.5 einen 2 Minuten und 16 Sekunden langen Kurzfilm zur Geschichte der westlichen Zivilisation erzeugte, ohne dass irgendein professionelles Videogenerierungsmodell verwendet wurde. Zwei Tage nach der Veröffentlichung des Videos überschritt die Anzahl der Aufrufe die Marke von 10 Millionen.
Ein Kreativer nutzte Opus 5.5, um etwa 7400 Zeilen Frontend-Code auf Basis des Remotion-Frameworks zu schreiben, der automatisch die Bewegungsgrafiken und die Übergangsrhythmen des gesamten Videos arrangierte. Zusammen mit quelloffener Sprachausgabe und per Python erzeugter Musik entstand in nur einer Minute ein dreiminütiges Video zum Thema Entwicklungsgeschichte der KI.
Das auf Inferenz spezialisierte Startup Deedy nutzte Opus 5.5, um Produktveröffentlichungsvideos zu erstellen. Die Generierungszeit für ein einzelnes Video betrug nur etwa 1 Minute, die API-Kosten lagen bei nur etwa 2 US-Dollar, und am Ende erzielte das Video 320.000 Aufrufe. Das Team von Wasmer gab den Text der Produktveröffentlichungsmitteilung direkt in Opus 5.5 ein, woraufhin das Modell ein vollständiges Markenwerbevideo auf einmal erzeugte, dessen Verbreitungswirkung die Erwartungen des Teams übertraf.
Diese Beispiele ließen „Vibe Video“ schnell zu einem neuen kreativen Paradigma werden: Ohne auf professionelle Videomodelle angewiesen zu sein, können vollständige Videos erzeugt werden, indem das große KI-Modell nur Code schreibt. Die Beispielsammlungsseite awesome-opus5-5-videos auf GitHub hat bereits mehr als 400 Werke aufgenommen, die Bereiche wie Bewegungsgrafiken, Wissenserklärungen, 3D-Szenen und kleine Spiele abdecken. Jedes Werk enthält die von dem Kreativen veröffentlichten ursprünglichen Prompts und den Code, was bedeutet, dass die ausgereifte Kreativmethodik direkt quelloffen gemacht wurde. Auch inländische Kreative beteiligen sich zahlreich und nutzen diese Methode, um Produktwerbevideos, populärwissenschaftliche Animationen und Datenvisualisierungsvideos zu erstellen.
Die Videogenerierungslogik von Opus 5.5 unterscheidet sich grundlegend von der traditioneller Videogenerierungsmodelle.
Während traditionelle Modelle vollständige Bilder auf einmal auf Basis einer riesigen Menge an Trainingsmaterialien erzeugen, verfolgt Claude den Weg der reinen Code-Rendering: Es baut die Bilder Frame für Frame wie ein professioneller Bewegungsgrafik-Designer auf – es definiert alle visuellen Elemente und Bewegungspfade durch das Schreiben von Frontend-Code wie SVG, Canvas, Three.js und Remotion, führt den Code dann in einem Headless-Browser aus und zeichnet die Bilder Frame für Frame auf, schließlich wird es per FFmpeg zu einer MP4-Datei kodiert und zusammengesetzt. Während des Prozesses werden die Einzelbilder automatisch überprüft und Abweichungen korrigiert.
Im gesamten Prozess übernimmt das große KI-Modell vier Rollen gleichzeitig: Es agiert als Regisseur, der den Storyboard-Rhythmus und den visuellen Stil festlegt, als Produzent, der Aufgaben zerlegt und mehrere Code-Abschnitte zur parallelen Generierung koordiniert, als Zeichner, der Bildelemente Frame für Frame per Code zeichnet, und als Cutter, der die Synchronisation von Ton und Bild abschließt und das fertige Video ausgibt.
Der größte Vorteil dieses Wegs ist die extrem starke Bearbeitbarkeit und die sehr niedrigen Iterationskosten. Wenn das Ergebnis eines traditionellen Videomodells nicht zufriedenstellend ist, muss man meist nur den Prompt ändern und das gesamte Video neu generieren; bei per Code erzeugten Videos muss man nur wenige Zeilen Code für die entsprechende Aufnahme ändern, Parameter, Bewegungen und Stil können präzise gesteuert werden, und die Bildelemente können auch schichtenweise zerlegt werden.
Aber die Grenzen der Anwendungsszenarien von Opus 5.5 sind auch sehr klar. Es ist von Natur aus gut für prozedurale und grafische Inhalte geeignet, wie Textanimationen, Datendiagramme, populärwissenschaftliche Animationen und abstrakte 3D-Szenen, kann aber kaum realistische Bilder von echten Menschen und komplexe natürliche physikalische Effekte bewältigen – genau diese Bereiche sind das Kerngebiet traditioneller Videomodelle.
Das bestimmt auch, dass sich die derzeitige Verbreitung von Vibe Video noch hauptsächlich auf leichte kommerzielle Inhalte, Wissensvermittlung und kreative Experimente konzentriert und noch nicht in den Hauptmarkt für filmreife realistische Inhalte eingedrungen ist.
02
GPT-6 Astra übernimmt den Regiestuhl
Werden Videomodelle zu bloßen „Renderarbeitern“ degradiert?
Wenn Opus 5.5 von Code aus in kreative Videos eindringt, greift GPT-6 Astra in die noch weiter vorgelagerte Planungsphase ein und gestaltet die Produktionslogik von KI-Videos neu. Es generiert ebenfalls keine direkten endgültigen Bilder, sondern übernimmt die Rolle von „Regisseur + Produzent“: Zuerst erledigt es die Kreativplanung, Raumgestaltung und Kamerakoordination, bevor es die Aufgabe an professionelle Videomodelle zum Rendern weitergibt.
GPT-6 Astra wurde am 3. September offiziell veröffentlicht. Seine offizielle Positionierung ist ein neues generatives Agent-Modell, dessen Kernfähigkeiten Bereiche wie Computerbedienung, Programmierung und wissenschaftliche Forschung abdecken. Insbesondere die Fähigkeit, 3D-Erstellungssoftware wie Blender und Unreal Engine zu bedienen, ist der entscheidende Ansatzpunkt für sein Eindringen in die Videoproduktion.
Ein von Higgsfield AI veröffentlichter Test ist sehr repräsentativ. Die Aufgabe bestand darin, eine Einstellungsanimation zu erstellen, die kontinuierlich durch mehrere Räume führt. Astra erzeugte keine Bilder direkt, sondern baute zuerst eine einfache Modellszenen mit einfachen Geometrien in Blender auf, plante die Bewegungen der Figuren und die gesamte Kameraführung. Erst nachdem die Raumlogik und die Kamerabewegungen bestätigt waren, übergab es die Aufgabe an Seedance 2.5, um das fertige Video zu rendern.
Im fertigen Video bewegt sich die Kamera von einem Raum zum nächsten, die Position der Figuren und die Beziehung zur Szene bleiben stets konsistent, was die seit langem bestehenden Probleme von KI-Videos wie räumliche Verwirrung und Kamera-Durchdringung in gewissem Maße mildert.
Die Fähigkeit von Astra zur vollständigen Prozessgestaltung ist ebenfalls bemerkenswert. Der ausländische Kreative Nate Herk führte ein Experiment durch: Er gab nur eine offene Anweisung, damit Astra ein YouTube-Video über seine eigene Veröffentlichung erstellt. Astra erledigte selbstständig die Informationsrecherche und das Schreiben des Skripts, rief Tools auf, um einen klonierten Sprachkommentar zu erzeugen, steuerte eine KI-digitale Person zum Auftreten und erledigte die Bearbeitung von Materialien sowie die Zusammenstellung von Musik und Soundeffekten, um am Ende ein fertiges Video zu liefern, das direkt veröffentlicht werden kann.
Die Integration von professioneller Schnittsoftware verstärkt diese Fähigkeit weiter. Am 8. September wurde DaVinci Resolve 21.1 mit einem nativen MCP-Server ausgestattet, der es KI-Assistenten ermöglicht, die Software direkt per Protokoll zu bedienen. Ein Cutter mit 20 Jahren Berufserfahrung übergab Astra 75 Minuten Rohmaterial. Astra bediente die Schnittsoftware direkt und gab eine 22-minütige Rohschnittversion mit 96 Schnittclips, Untertiteln, Farbkorrektur und Lautstärkekalibrierung aus – der gesamte Prozess erfolgte ohne menschliches Eingreifen.