StartseiteArtikel

Ein weiteres bedeutendes, in China entwickeltes KI-Modell wird als Open-Source veröffentlicht, es belegt weltweit den ersten Platz im Bereich der Audiovideo-Bearbeitung, und 16 Chip- und Plattformanbieter haben bereits am ersten Tag die Kompatibilitätsanpassung abgeschlossen.

智东西2026-08-04 07:54
Alles aus einer Hand für Text, Bild, Audio und Video.

Text, Bilder, Ton und Videos werden allesamt abgedeckt.

Laut Bericht von Zhidx.com am 3. August hat MiniMax das neue generelle Videomodell MiniMax H3 offiziell als Open-Source veröffentlicht.

MiniMax H3 ist ein generatives Allmodalsystem, das multimodale Kontexte, die aus Text, Bildern, Videos und Audio bestehen, einheitlich verstehen kann und Videos mit einer maximalen Länge von 15 Sekunden, einer maximalen Auflösung von 2K und nativem Stereoaudio erzeugt.

Zuvor wurde MiniMax H3 am 31. Juli veröffentlicht. Derzeit belegt MiniMax H3 in der Rangliste für bearbeitete Videos mit Ton von Artificial Analysis mit einem Elo-Ergebnis von 1130 Punkten den ersten Platz und liegt vor in- und ausländischen Videomodellen wie Gemini Omni Flash, HappyHorse-1.0 und Wan 2.7.

MiniMax H3 belegt den Spitzenplatz in der Rangliste für bearbeitete Videos mit Ton

Das H3-System besteht aus drei Modulen: H3-Context-IR, H3-Base, H3-Regenerate-2K. Entwickler können das MiniMax H3-Modell direkt von Hugging Face herunterladen. H3-Base unterstützt derzeit die Bereitstellung über Inferenzframeworks und Workflows wie SGLang, vLLM, diffusers und ComfyUI.

Gleichzeitig mit der Open-Source-Veröffentlichung des Modells haben insgesamt 16 Ökosystempartner, darunter in- und ausländische Chiphersteller wie Huawei Ascend, Moore Threads, MetaX, Hygon Information, Kunlunxin, Iluvatar CoreX, Biren Technology, AMD und Intel, sowie Entwicklergemeinschaften und Cloud-Inferenzplattformen wie Hugging Face, ModelScope, ComfyUI, RunningHub und fal, darüber hinaus Inferenzframeworks wie vLLM-Omni und SGLang, die entsprechende Anpassungsunterstützung abgeschlossen.

Open-Source-Adresse:

huggingface.co/MiniMaxAI/MiniMax-H3

Modell-Erlebnisadresse:

H3-2K direkt Ausgabe:

platform.minimaxi.com/docs/api-reference/video-generation-v2-create

H3-Context-IR:

platform.minimaxi.com/docs/api-reference/video-generation-v2-h3-context-ir

H3-Regenerate-2K:

platform.minimaxi.com/docs/api-reference/video-generation-v2-regeneration

MiniMax Hub: hub.minimaxi.com

Hailuo AI: hailuoai.com

Heute hat Zhidx.com MiniMax H3 praktisch getestet. MiniMax H3 ist bereits in der Lage, verschiedene Arten von Videogenerierungsaufgaben zu erledigen und zeigt gute Leistungen in natürlicher Bildqualität, Kameraführung und konsistentem Gesamtstil. Das Modell hat noch gewisses Verbesserungspotenzial bei Bildrealismus und Kameragestaltung.

Zum Beispiel haben wir das Modell gebeten, ein 15-sekündiges Luftaufnahmevideo von Landschaftsfotografie zu erzeugen. Die natürlichen Landschaften wie Schneeberge und Wiesen im fertigen Video sind relativ realistisch, Farben, Licht und Schatten sowie die Bewegung der Luftaufnahmekamera sind auch relativ natürlich, und die lange Einstellung behält insgesamt eine gute visuelle Kontinuität bei. Allerdings weist das Tempelgebäude im Bild noch einen deutlichen, durch KI erzeugten Charakter auf.

Anschließend haben wir MiniMax H3 gebeten, ein Werbevideo für die Zusammenarbeit zwischen Milchtee und einem Spiel-IP zu erzeugen. Das von MiniMax erzeugte Video enthält 6 Einstellungen, die gesamte Erzählreihenfolge ist relativ klar, der Bildstil und die Werbeatmosphäre sind im Wesentlichen einheitlich. Allerdings ist bei der Anordnung mehrerer Einstellungen ein deutlicher Wiederholungsfehler aufgetreten: Die Aktion, bei der der Verkäufer dem Kunden den Milchtee reicht, wurde zweimal nacheinander dargestellt.

01. Maximale Erzeugung von 15-sekündigen 2K-Videos, gleichzeitige Ausgabe von Bildern und Stereoton

MiniMax H3 ist ein generatives Allmodalsystem. Was die Ausgabespezifikationen betrifft, kann H3 Videos mit einer Dauer von 4 bis 15 Sekunden erzeugen, unterstützt verschiedene Seitenverhältnisse wie 21:9, 16:9, 4:3, 1:1, 3:4, 9:16, gibt sie mit 24 FPS aus und kann gleichzeitig 32kHz-Stereoaudio erzeugen.

Das Modell erzeugt standardmäßig Videos mit einer kurzen Kante von 768 Pixeln, und über H3-Regenerate-2K kann eine 2K-Version weiter erzeugt werden. H3 unterstützt stabil 11 Sprachen wie Chinesisch, Englisch, Japanisch, Koreanisch, Französisch und Deutsch und bietet unterschiedliche Grade an Unterstützung für andere Sprachen.

H3 enthält zwei Versionen FL2VA und Ref2VA, die jeweils für die Erzeugung aus erstem und letztem Frame sowie die allmodale Referenzgenerierung ausgelegt sind.

H3-Base-FL2VA ist der Modus für erstes und letztes Frame, bei dem maximal zwei Bilder eingegeben werden können. Wenn keine Bilder eingegeben werden, führt das Modell die Aufgabe der Text-zu-Video-Erzeugung aus; wenn ein Bild des ersten oder letzten Frames eingegeben wird, kann das entsprechende Video aus dem ersten oder letzten Frame erzeugt werden; wenn zwei Bilder gleichzeitig eingegeben werden, kann der mittlere Videoinhalt basierend auf den angegebenen ersten und letzten Bildern erzeugt werden.

H3-Base-Ref2VA unterstützt den allmodalen Referenzmodus, bei dem maximal 9 Bilder eingegeben werden können; maximal 3 Videos mit einer Dauer von 2 bis 15 Sekunden pro Segment und einer Gesamtdauer von nicht mehr als 15 Sekunden können eingegeben werden; maximal 3 Audiodateien mit einer Dauer von 2 bis 15 Sekunden pro Segment und einer Gesamtdauer von nicht mehr als 15 Sekunden können eingegeben werden, die zusammen mit Bildern oder Videos eingegeben werden müssen und nicht als einzige Eingabe dienen dürfen. Insgesamt können maximal 12 Bilder, Videos und Audiodateien eingegeben werden.

02. Drei Module erzeugen Ton und Video gemeinsam, 2K-Bilder werden über Kontext-Neugenerierung erstellt

Das H3-System besteht aus drei Modulen: H3-Context-IR, das für das Verstehen und Ordnen multimodaler Anweisungen zuständig ist, H3-Base, das für die Erzeugung von Ton und Video zuständig ist, und H3-Regenerate-2K, das für die Erzeugung von 2K-Bildern zuständig ist.

Überblick über das MiniMax H3-System (Quelle: MiniMax)

H3-Context-IR ist ein gehostetes Vorverarbeitungs- und Orchestrierungssystem, das die Beziehungen zwischen Text, Bildern, Audio und Referenzvideos sowie die Beziehungen zwischen diesen Materialien und den erwarteten Erzeugungsergebnissen verstehen kann. Sein interner Workflow umfasst Anweisungsparsing, crossmodale Zuordnung, zeitliches Verständnis und komplexe logische Schlussfolgerung.

H3-Context-IR basiert auf einem mehrstufigen Workflow sowie mehreren gehosteten Modellen und Diensten. Dieses Modul ist derzeit nicht als Open-Source veröffentlicht. MiniMax bietet entsprechende APIs und Prompt-Anleitungen, mit denen Entwickler ihr eigenes multimodales Vorverarbeitungssystem aufbauen können.

Anleitung zum Schreiben von Videoprompts:

huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md

Anleitung zur Ausgabe im vollständigen Referenzmodus:

huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_ref_en.md

H3-Base ist für die tatsächliche Erzeugung von Ton und Video zuständig. Text wird von H3-Encoder kodiert, visuelles Material wird gleichzeitig von H3-Encoder und H3-VisualVAE verarbeitet, Audio wird von H3-AudioVAE kodiert. Informationen verschiedener Modalitäten werden anschließend zu einer einheitlichen Sequenz organisiert und in H3-Omni-Transformer eingespeist.

Überblick über die Architektur von MiniMax H3-Base (Quelle: MiniMax)

Für die 2K-Ausgabe mit hoher Auflösung von H3 verwendet H3 kein herkömmliches spezialisiertes Superauflösungsmodul, sondern nutzt H3-Regenerate-2K, damit das Basismodell das bereits erzeugte 768p-Video unter Kombination des ursprünglichen Texts und der multimodalen Referenzmaterialien neu erzeugt. Diese Methode kann den ursprünglichen Kontext erneut nutzen, was dazu beiträgt, Informationen wie kleinen Text und feine Texturen wiederherzustellen, die nur mit niedrigauflösenden Bildern schwer zu ergänzen sind. Dieses Modul ist derzeit ebenfalls nicht als Open-Source veröffentlicht, Entwickler können den vollständigen 2K-Erzeugungsprozess über die offizielle API nachbilden.

03. Lokale Bereitstellung kann 768p-Ton und Video erzeugen, vollständiger 2K-Workflow erfordert den API-Aufruf

MiniMax bietet Entwicklern zwei Validierungsmethoden: die lokale Bereitstellung von H3-Base und den vollständigen 2K-Workflow. H3-Base wird in zwei unabhängigen Modell-Repositorys FL2VA und Ref2VA veröffentlicht, die alle Inferenzkomponenten wie Prozessor, Tokenizer, Text-Encoder, Omni Transformer, Visual VAE und Audio VAE enthalten. Es kann über Frameworks oder Workflows wie SGLang, vLLM, diffusers und ComfyUI bereitgestellt werden und unterstützt parallele Inferenz auf mehreren GPUs.

Wenn nur H3-Base lokal bereitgestellt wird, können Entwickler Ton und Video mit einer kurzen Kante von 768 Pixeln erzeugen. Die FL2VA-Version unterstützt die Text-zu-Ton-Video-Erzeugung sowie die Erzeugung aus erstem und letztem Frame. Die Ref2VA-Version unterstützt die gemeinsame Referenz von Bildern, Videos und Audio, um Aufgaben wie die Beibehaltung von Charakteren und Szenen, die Bearbeitung von Bewegungen und Lippenbewegungen sowie die Referenz von Klangfarben zu erledigen.

Der vollständige 2K-Workflow erfordert die Kombination des lokalen Modells und der offiziellen API: Zuerst versteht und erweitert H3-Context-IR die Benutzereingabe, anschließend erzeugt das lokal bereitgestellte H3-Base 768p-Ton und Video, schließlich erzeugt H3-Regenerate-2K das 2K-Video unter Kombination des ursprünglichen Kontexts neu. MiniMax bietet zudem nachvollziehbare Fälle wie Text-zu-Ton-Video, Erzeugung von Ton und Video aus dem ersten Frame und allmodale Referenzgenerierung an, die zugehörigen Anfrageparameter, Beispielcodes und Referenzergebnisse können auf der Modellseite von Hugging Face eingesehen werden.

04. Schlussfolgerung: Allmodale Videogenerierung beschleunigt den Übergang zu einem offenen Ökosystem

Aus praktischer Sicht kann MiniMax H3 bereits verschiedene Arten von Erzeugungsaufgaben wie Naturlandschaften und kommerzielle Werbung bearbeiten und zeigt einen hohen Fertigstellungsgrad in Bezug auf natürliche Bildqualität, Kameraführung und konsistenten Stil.

Da mehrere Chiphersteller, Entwicklergemeinschaften, Cloud-Inferenzplattformen und Inferenzframeworks die Anpassung gleichzeitig abgeschlossen haben, hat die Open-Source-Veröffentlichung von MiniMax H3 dieses Mal nicht nur die Fähigkeiten des Modells geöffnet, sondern auch den Ökosystempfad von dem Herunterladen des Modells über die lokale Bereitstellung bis zur Anwendungsentwicklung anfänglich durchgängig gemacht. Der Wettbewerb zwischen allmodalen Videomodellen erstreckt sich von der einzelnen Bildwirkung weiter auf die Tonerzeugung, das Verständnis komplexer Anweisungen und den Aufbau des industriellen Ökosystems.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto "Zhidx.com" (ID: zhidxcom), Autor: YANG Jingli, Redakteur: LI Shuiqing, veröffentlicht mit Genehmigung von 36Kr.