Womit realisiert MiniMax AGI?
Die Dynamik im Bereich der großen KI-Modelle wird ständig weiter angeheizt.
In letzter Zeit ist die Geschwindigkeit, mit der ausländische Akteure ihre großen KI-Modelle aktualisieren, besonders erstaunlich. Am 1. September veröffentlichte Anthropic Claude Fable 5.1, das Modell wird als „das weltweit fortschrittlichste Modell für Programmierung und Wissensarbeit“ angepriesen; am 2. September veröffentlichte Meta Muse Spark 1.3 und nannte es „einen der größten Leistungssprünge in der Geschichte der Modelle“, während Google Gemini 3.8 Flash veröffentlichte; am 3. September veröffentlichte OpenAI GPT-6 Astra. Auf der Vorstellungsveranstaltung sagte Greg Brockman, Mitbegründer und Präsident von OpenAI: „Willkommen im Zeitalter der AGI.“
Die sogenannte AGI, also Artificial General Intelligence, bezeichnet die fortgeschrittene Form der KI als allgemeine künstliche Intelligenz: Die KI kann die Welt wie ein Mensch verstehen, selbstständig schlussfolgern und flexibel komplexe Aufgaben über verschiedene Bereiche hinweg bewältigen. Im Vergleich zu früheren Agenten, die auf die API-Schnittstellen von Softwareherstellern angewiesen waren, kann GPT-6 Astra direkt die Bildschirmpixel wie ein Mensch erfassen, jede Software mit grafischer Benutzeroberfläche über Maus und Tastatur bedienen und Schlussfolgerung, Codeausführung, visuelle Erkennung, Computervorgänge und Tool-Aufrufe in eine einzige Ausführungskette verbinden. Es kann selbstständig einen vollständigen End-to-End-Arbeitsablauf planen und abschließen, was bereits der Definition der hochgradigen Autonomie von AGI entspricht.
Sowohl in- als auch ausländische KI-Akteure befinden sich im weiteren Sinne in der Welle der Verfolgung von AGI, insbesondere im Bereich großer Modelle. Obwohl die Definitionen von AGI bei den verschiedenen Anbietern unterschiedlich sind und ihre Fortschritte voneinander abweichen, haben die meisten von ihnen derzeit die Verwirklichung von AGI als eines ihrer ultimativen Ziele festgelegt.
Im Vergleich dazu war die technische Präsenz der inländischen Akteure Anfang September relativ schwach, und der Rhythmus der Modellaktualisierungen war nicht besonders dicht. Alibaba aktualisierte am 2. September Qwen3.8-Max, während iFlytek am 7. September offiziell iFlytek Spark X2.5 veröffentlichte. Eine weitere Nachricht im Zusammenhang mit inländischen Modellen lautet, dass HUMAIN, ein KI-Unternehmen unter dem öffentlichen Investitionsfonds von Saudi-Arabien, am 3. September das weltweit erste große arabische Sprachmodell veröffentlichte, das auf dem Open-Source-Modell M3 von MiniMax nachtrainiert wurde.
Man muss wissen, dass MiniMax einer der Pioniere im Bereich der inländischen großen Modelle ist. Es wurde Ende 2021 gegründet und veröffentlichte im April 2022 sein erstes Textmodell abab1, noch vor der Veröffentlichung von ChatGPT durch OpenAI im November 2022. Darüber hinaus blieb MiniMax nicht auf ein einzelnes Modalitätsfeld beschränkt, sondern entwickelte gleichzeitig selbst Modelle für Text, Sprache, Video und Musik, um der AGI schneller in Form einer vollständigen Modalitätsfusion näherzukommen. Nach dem Börsengang an der Hongkonger Börse am 9. Januar 2026 stieg der Aktienkurs von MiniMax zeitweise sprunghaft an, und der Marktwert überstieg zeitweise 410 Milliarden Hongkong-Dollar (umgerechnet etwa 350,9 Milliarden Yuan).
Aber nach dem Höhepunkt zog der Aktienkurs von MiniMax stark zurück, und die Zweifel aus der Öffentlichkeit häuften sich. Der Vorsprung durch den frühen Markteintritt konnte nicht in einen absoluten technischen Vorsprung umgewandelt werden. Wenn die Entfernung zur AGI zu einer gemeinsamen Frage der gesamten Branche wird, hat MiniMax immer noch keine deutlichere Vorreiterposition als andere Akteure gezeigt.
01
Deutlichere Kosteneffizienz
Derzeit liegt der Kernvorteil von MiniMax im Preis und nicht in der Modellqualität.
Auf der technischen Route wählte MiniMax eine für Startups seltene Investition in alle Modalitäten, die vier Bereiche Text, Sprache, Video und Musik umfasst. Das große Sprachmodell von MiniMax gehört zur M-Serie und wurde am 1. Juni auf M3 aktualisiert; das Videomodell heißt Hailuo, abgekürzt H-Serie, und wurde am 31. Juli auf H3 aktualisiert; es gibt außerdem ein Sprachmodell, das auf Speech 2.8 aktualisiert wurde, und ein Musikmodell, das auf Music 3.0 aktualisiert wurde.
In keinem einzelnen Bereich, einschließlich des wichtigsten und grundlegendsten großen Sprachmodells, hat MiniMax einen überwältigenden Vorteil aufgebaut.
Laut dem neuesten Intelligenzindex-Ranking der Modellbewertungsplattform Artificial Analysis sind die ersten sechs Plätze mit den höchsten Intelligenzwerten großer globaler Modelle alle von ausländischen Modellen belegt, darunter Claude Fable 5.1, GPT-6 Astra, Muse Spark 1.3 usw.; die am höchsten platzierten inländischen Modelle sind nacheinander GLM-5.3 von Zhipu auf Platz 7, Kimi K3 auf Platz 9, Alibaba Qwen 3.8 2.4T A95B auf Platz 13 und DeepSeek V4 Pro 0813 auf Platz 15, während MiniMax-M3 auf Platz 17 liegt.
Auf der allgemeinen Bewertungsliste der chinesischen großen Modellbewertungsplattform SuperCLUE lagen im Juli 2026 die ersten vier Plätze der Gesamtwertung bei den Modellen Qwen3.8, Kimi K3, DeepSeek V4 Pro und Doubao-Seed-2.1-pro, während MiniMax-M3 auf Platz 9 lag.
Im Vergleich dazu zeigt die H-Serie der Videomodelle eine stärkere Leistung. Auf der aktuellen Liste der Videomodelle von Artificial Analysis belegt MiniMax H3 den ersten Platz bei der Umwandlung von Bild in Video, den zweiten Platz bei der Videobearbeitung und den dritten Platz bei der Generierung von Video aus Text; zu den hoch platzierten Videomodellen gehören außerdem Gemini Omni Flash und Veo 3.1 von Google, Seedance von ByteDance, Wan 3.0 und HappyHorse-1.1 von Alibaba sowie Kling 3.0 von Kuaishou.
MiniMax H3 integriert alle Aufgaben wie Text-zu-Video, Bild-zu-Video, Videobearbeitung und Bewegungsübertragung in ein einziges vortrainiertes Framework, das die Aufgabenbeziehungen in natürlicher Sprache einheitlich beschreiben kann, anders als die beiden Vorgängermodelle, die unabhängige Pipelines für Text-zu-Bild, Bildbearbeitung, Bewegung, Klangfarbe usw. einrichten. Das heißt, der Benutzer muss nur einen Satz eingeben, z. B. die Kamerabewegung eines bestimmten Videos als Referenz nehmen, die Figur in einem bestimmten Bild singen lassen und einen bestimmten Ton zuordnen, und das Modell kann Verständnis, Anordnung und Generierung selbstständig abschließen. Es unterstützt die beliebige kombinierte Eingabe von Text, Bild, Ton und Video, wobei maximal 12 Referenzmaterialien auf einmal gemischt werden können.
Diese innovative Architektur heißt „Kontextuelle omni-modale Repräsentation“ (Contextual Omni Representation). Sie verleiht MiniMax H3 die Fähigkeit, komplexe Textmaterialien darzustellen. Es ist erwähnenswert, dass frühere Modelle bei der Videogenerierung häufig unleserlichen Text erzeugten, da diese Modelle nur probabilistische Pixelvorhersagen für Text durchführen, Striche nachahmen, aber den Text nicht verstehen können. MiniMax H3 hingegen kann den Text wirklich in die visuelle Komposition einbeziehen, sogar die perspektivischen Beziehungen auf der Oberfläche von Objekten berücksichtigen und sich mit der Kamerabewegung und der Bewegung des Hauptmotivs ändern.
Obwohl einige Technologien herausragende Leistungen zeigen, konnte MiniMax H3 im Bereich der Videogenerierung keinen absoluten Qualitätsvorteil aufbauen, sondern zeichnet sich durch seine Kosteneffizienz aus.
Gemäß den offiziellen Preisen der verschiedenen Modelle ist bei einer Auflösung von 1080p derzeit Seedance 2.5 und Veo 3.1 das teuerste der Welt mit einem Preis von etwa 3 Yuan pro Sekunde, während Wan 3.0, Kling 3.0 und Gemini Omni Flash bei etwa 1,1 Yuan pro Sekunde liegen. Die höhere 2K-Auflösung von MiniMax H3 kostet nur 0,8 Yuan pro Sekunde. Natürlich unterscheidet sich die tatsächliche Nutzungslogik der Videogenerierung stark von der der Textgenerierung: Ersteller müssen oft wiederholt generieren und mehrfach filtern, um ein brauchbares Material aus mehreren Materialien auszuwählen, sodass die tatsächlichen Ausgaben oft ein Vielfaches des angegebenen Preises betragen.
In den Augen vieler Praktiker der Film- und Fernsehbranche ist MiniMax H3 eine kostengünstige Wahl. In der ausländischen Community Reddit wird MiniMax H3 meist als schnell, günstig und das zuverlässigste Modell in dieser Preisklasse bewertet. Xiao Yan, ein Praktiker für Kurzdramen, sagte gegenüber Haike Finance, dass ihr Unternehmen Seedance für das Modell mit dem insgesamt besten Effekt halte, aber es sei preislich hoch, sodass sie es nur für die wichtigsten Aufnahmen verwenden; in der tatsächlichen Produktion nutzen sie MiniMax H3 häufiger, das etwa 80 bis 90 Prozent des Effekts von Seedance erreicht, aber viel günstiger ist.
02
Umorientierung auf B2B als Hauptgeschäft
Wenn die Modellfähigkeiten keine technische Prämie stützen können, verlagert sich der gesamte kommerzielle Druck auf Umfang und Effizienz.
Gemäß dem Finanzbericht unterteilt MiniMax seine kommerziellen Kanäle in zwei Hauptbereiche: Erstens die KI-nativen Produkte für Privatkunden (To C), einschließlich Talkie/Xingye, Conch AI, MiniMax Agent usw., deren Einnahmen aus Abonnementgebühren und In-App-Käufen stammen; zweitens die offene Plattform und andere Unternehmensdienstleistungen für Geschäftskunden (To B), die Unternehmenskunden und Entwicklern Modell-API-Aufrufe, Token-Pakete und Tools wie MiniMax Code anbieten, was im Wesentlichen der Verkauf von Modellfähigkeiten nach Verbrauch ist.
Ursprünglich stammten die Einnahmen von MiniMax hauptsächlich aus dem C-Ende. Aus dem Finanzbericht geht hervor, dass der Umsatz von MiniMax in den Jahren 2024 und 2025 30,523 Millionen US-Dollar (umgerechnet etwa 204 Millionen Yuan) bzw. 79,038 Millionen US-Dollar (umgerechnet etwa 530 Millionen Yuan) betrug, wobei die Einnahmen aus KI-nativen Produkten 71,4 % bzw. 67,2 % des Gesamtumsatzes ausmachten.
Aber ein Fokus auf das C-Ende bedeutet, sich den Herausforderungen bei der Kundengewinnung und dem Betrieb zu stellen. Talkie/Xingye ähnelt im Wesentlichen eher einem gamifizierten Sozialprodukt, das der Logik des Internetbetriebs folgt. Nach Beobachtungen von Haike Finance ermöglicht dieses Produkt Benutzern, selbst Rollen zu erstellen, Aussehen, Stimme, Charakter und Hintergrundeinstellungen der Rolle anzupassen und die Rolle dann in Form einer KI-Rollenkarte zu speichern. Jeder Benutzer kann mit dieser Rolle per Text oder Sprache interagieren, wobei die KI nur die zugrundeliegende technische Unterstützung des Produkts ist. Die Produkteinnahmen stammen hauptsächlich aus Gacha-Spielen, In-App-Käufen und Abonnements, sodass die kommerzielle Leistung stark von Betriebsförderung, Inhaltsversorgung und Community-Aktivität abhängt.
Conch AI und MiniMax Agent hingegen hängen stärker von den ursprünglichen Fähigkeiten des Modells ab. Die explosionsartige Verbreitung solcher Produkte erfordert oft einen technischen Sprung, um den natürlichen Datenverkehr auszulösen, und es ist schwierig, den Weg von ChatGPT oder DeepSeek zu nachahmen. Für normale Benutzer gibt es viele ähnliche Plattformen und Produkte, und die Umstellungskosten sind nahezu Null, sodass es für das Unternehmen nicht einfach ist, die Zahlungsrate zu erhöhen.
Heute hat sich der Einnahmenschwerpunkt von MiniMax auf das B-Ende verlagert. Gemäß dem Finanzbericht betrug der Umsatz des Unternehmens im ersten Halbjahr 2026 116 Millionen US-Dollar (umgerechnet etwa 778 Millionen Yuan), davon 42,6 Millionen US-Dollar (umgerechnet etwa 285 Millionen Yuan) aus Einnahmen von KI-nativen Produkten, was 36,6 % entspricht. Die Einnahmen aus der offenen Plattform und Unternehmensdienstleistungen stiegen im Jahresvergleich um 700 % auf 73,9 Millionen US-Dollar (umgerechnet etwa 495 Millionen Yuan), was 63,4 % des Gesamtumsatzes ausmacht.
API-Aufrufe auf dem B-Ende entsprechen eher der wesentlichen Logik von großen Modellprodukten: Das Modell ist das Produkt, und die Einnahmen hängen direkt von den Modellfähigkeiten und der Preisgestaltung ab. Die Wettbewerbsfähigkeit von MiniMax in diesem Bereich stammt jedoch immer noch hauptsächlich von niedrigen Preisen.
Gemäß den von Artificial Analysis berechneten Kosten pro Aufgabe (Cost per Intelligence Index Task) belegen derzeit OpenAI und Anthropic im Ausland dank ihres weltweit führenden technischen Niveaus fest den Hochpreismarkt: Claude Fable 5 kostet 8,75 US-Dollar (umgerechnet etwa 58,6 Yuan), GPT-6 Astra kostet 3,26 US-Dollar (umgerechnet etwa 21,8 Yuan); im Inland liegen Qwen3.8 2.4T A95B, GLM-5.3 und Kimi K3 alle bei etwa 2 US-Dollar (umgerechnet etwa 13,4 Yuan), DeepSeek V4 Pro kostet 0,67 US-Dollar (umgerechnet etwa 4,4 Yuan), während MiniMax M3 nur 0,51 US-Dollar (umgerechnet etwa 3,4 Yuan) kostet.