首页文章详情

Luo Fuli setzt auf groß angelegtes RL, und Xiaomis leistungsstärkstes Open-Source-Modell feiert Premiere: Innerhalb von 6 Tagen wurden über 20 Millionen Yuan verbraucht, wobei mehrere Agent-Benchmarks mit geschlossenen Flaggschiffmodellen mithalten können.

AI前线2026-09-22 15:23
Modellvorstellung, technische Umsetzungsdetails und Praxistestfälle sind alle hier.

Am 22. September hat das MiMo-Team von Xiaomi die MiMo-V2.6-Serie veröffentlicht und als Open-Source bereitgestellt, darunter das Flaggschiffmodell MiMo-V2.6-Pro sowie das auf Effizienz und Kosten ausgerichtete MiMo-V2.6-Flash. Gleichzeitig hat Xiaomi zudem MiMo-V2.6-Pro-UltraSpeed für Szenarien mit niedriger Latenz vorgestellt: Laut offiziellen Angaben erreicht es bei gleichbleibender Modellqualität eine bis zu 20-fache Ausgabegeschwindigkeit im Vergleich zur Standard-Pro-Version.

Das neue Flaggschiffmodell der Xiaomi-Serie

Im Gegensatz zur bloßen Erweiterung der Modellparameter betont MiMo-V2.6 diesmal die rechnerische Skalierung in der Phase des Verstärkungslernens. Xiaomi beschreibt dies als Versuch, den Pfad von RSI (Recursive Self-Improvement, rekursive Selbstverbesserung) zu erkunden: Es wird mehr Aufwand in das Verstärkungslernen in komplexen Umgebungen mit überprüfbaren Ergebnissen wie Programmierung, generischen Agenten, visuellen Aufgaben und Cybersicherheit investiert, sodass das Modell seine Fähigkeit zur Aufgabenerfüllung durch wiederholtes Erkunden, Umgebungsfeedback und Ergebnisbewertung verbessert.

Aus den derzeit veröffentlichten Informationen geht jedoch hervor, dass die „Selbstverbesserung“ von MiMo-V2.6 hauptsächlich in einem geschlossenen Kreislauf des Verstärkungslernens stattfindet, der aus Trainingssystem, Aufgabenumgebung und Bewerter besteht. Das bedeutet noch nicht, dass das Modell bereits in der Lage ist, sich von dem von Menschen entworfenen Trainingsrahmen zu lösen, seine eigene Architektur autonom zu modifizieren oder die nächste Trainingsrunde zu starten.

Laut Beschreibung verwenden sowohl MiMo-V2.6-Pro als auch MiMo-V2.6-Flash eine spärliche Mixed-Experts-Architektur und unterstützen nativ Eingaben von Text, Bildern, Videos und Audio, wobei das maximale Kontextfenster 1 Million Token beträgt.

Dabei verfügt MiMo-V2.6-Pro über insgesamt 1,02 Billionen Parameter, von denen bei jeder Inferenz etwa 42 Milliarden aktiviert werden. MiMo-V2.6-Flash hat insgesamt 309 Milliarden Parameter mit etwa 15 Milliarden aktivierten Parametern. Beide Modelle verwenden dieselben visuellen und Audiocodierer und sind mit einem Fünf-Ebenen-Mehr-Token-Vorhersagemodul für die spekulative Dekodierung ausgestattet.

Aus der Positionierung heraus ist Pro für komplexe Programmierung, langfristige Agenten und Forschungsaufgaben ausgelegt, während Flash die Inferenzkosten durch weniger aktivierte Parameter senken soll. Die Gewichte beider Modelle sind unter der MIT-Lizenz auf Hugging Face veröffentlicht worden.

Die MiMo-V2.6-Serie enthält zudem ein 9-Milliarden-Parameter-Modell, das aus der Qwen-Architektur destilliert wurde, aber die Hauptprodukte von Xiaomi bei dieser Veröffentlichung sind nach wie vor die beiden Versionen Pro und Flash. Die Modellkollektion von Hugging Face listet derzeit insgesamt drei MiMo-V2.6-Modelle auf.

Nach der Modellveröffentlichung fasste Luo Fuli, Leiterin des großen Modells bei Xiaomi und ehemalige Forscherin bei DeepSeek, ihre Beiträge auf X zusammen und beschrieb den Entwicklungsprozess von MiMo-V2.6 als „einen schwierigen Weg der Skalierung des Verstärkungslernens“.

Sie erklärte, gemessen am rechnerischen Aufwand sei MiMo-V2.6 „höchstwahrscheinlich eines der größten einzelnen Verstärkungslern-Trainings, das jemals von einem Open-Source-Modellteam durchgeführt wurde“. Trotz der nach wie vor sehr angespannten Rechenressourcen hat Xiaomi sich dafür entschieden, ein Team von mehreren Dutzend Mitarbeitern einzusetzen, um dieses groß angelegte RL-Training konzentriert abzuschließen.

Wie ist die Leistung bei Benchmarks?

Wie sieht die Benchmark-Leistung dieser Modellserie aus?

Laut den von Xiaomi veröffentlichten Testergebnissen erzielt MiMo-V2.6-Pro 71,9 Punkte auf DeepSWE v1.1, deutlich mehr als die 19 Punkte der Vorgängergeneration MiMo-V2.5-Pro; Flash erreicht 67,9 Punkte. Auf Terminal Bench 2.1 erzielen die beiden Modelle 89,9 Punkte bzw. 87,6 Punkte.

In den generischen Agenten-Tests erreicht Pro 53,1 Punkte auf AutomationBench v1.0.6 und liegt damit über Claude Opus 5, GPT-5.6 Sol und Claude Fable 5 in der Vergleichstabelle; Flash erzielt 52,3 Punkte. Auf OSWorld-Verified erreichen die beiden Modelle 82 Punkte bzw. 80,8 Punkte.

Die Ergebnisse zeigen aber auch, dass MiMo-V2.6 nicht in allen Projekten führend ist. Pro erzielt 26,5 Punkte auf ProgramBench und liegt damit unter den 37 Punkten von Claude Opus 5; bei Terminal Bench 4.0 liegt die Punktzahl bei 34,9, unter den 49 Punkten von Claude Opus 5. Auch in Tests wie Toolathlon-Verified und GDPval-AA 2.1 ist Pro nicht das Modell mit der höchsten Punktzahl.

Xiaomi zitiert zudem die Ergebnisse des Artificial Analysis Intelligence Index v4.3, wonach MiMo-V2.6-Pro 46,32 Punkte erreicht und als das Open-Source-Modell mit der derzeit höchsten Punktzahl beschrieben wird.

Ein bemerkenswerter Punkt von MiMo-V2.6 bei dieser Veröffentlichung ist, dass Xiaomi beginnt, Programmierfähigkeiten auf breitere Produktionsaufgaben auszudehnen.

Die Benchmark-Ergebnisse scheinen stark zu sein, wie sieht die praktische Anwendungsleistung aus? Xiaomi hat mehrere offizielle Beispiele bereitgestellt.

In den von der Regierung vorgestellten Beispielen kann das Modell die Spielentwicklungsaufgabe an mehrere Agenten aufteilen, basierend auf Text-, Bild- oder Videobeschreibungen, die 3D-Szenenkonstruktion, das Schreiben von Interaktionslogik und die visuelle Überprüfung jeweils abschließen, und basierend auf den Renderergebnissen wiederholt Anpassungen vornehmen. Xiaomi nennt diesen von natürlicher Sprache angetriebenen Ansatz, der sich von der Softwareentwicklung bis zum Aufbau interaktiver Welten erstreckt, „Vibe World“.

In 3D-Modellszenarien kann das Modell Blender steuern und Objekte und Szenen basierend auf Text oder Referenzbildern generieren. In einem körperlichen Simulationsumfeld kann das Modell zudem die Bilder mehrerer Kameras lesen, den Franka Panda-Roboterarm durch visuelles Feedback steuern und Aufgaben wie Greifen, Farbabgleich und Objektplatzierung abschließen.

MiMo-V2.6 zeigt zudem Fähigkeiten bei der Erstellung von Frontend-Seiten, Präsentationen, Videoschnitten und Musikkomposition.

Beispielsweise kann MiMo-V2.6 einen End-to-End-Hochqualitäts-Videokreationsdienst anbieten. Für Kreativ- und Produktpromotionsvideos kann es visuelle Gestaltung, Aufnahmen und dynamische Sequenzen, Musikkomposition sowie taktgenaue Schnittbearbeitung nach Benutzeranforderungen verarbeiten. Für Lehrvideos kann es abstrakte Konzepte wie die Fourier-Zerlegung in verständliche Erklärungen und zusammenhängende Animationen umwandeln und MiMo-V2.5-TTS verwenden, um einen Kommentar zu generieren, der genau mit den Bildern synchronisiert ist. Dadurch wird die vollständige Prozessautomatisierung von der Konzeptzerlegung bis zur endgültigen Videoausgabe erreicht, und komplexes Wissen wird in lebendige Inhalte umgewandelt, die für das Publikum leicht verständlich sind.

Diese Beispiele zeigen, dass das Ziel von MiMo-V2.6 nicht nur darin besteht, Code zu generieren, sondern Code, visuelles Verständnis, Tool-Aufruf und Computeroperationen gemeinsam für eine vollständige Aufgabe einzusetzen.

Darüber hinaus hat Xiaomi zwei wissenschaftliche Forschungsbeispiele vorgestellt.

Das erste Beispiel betrifft die Materialforschung. Die Materialexperten von Xiaomi forderten MiMo-V2.6-Pro auf, ein metallorganisches Gerüstmaterial zu entwerfen, das per- und polyfluorierte Alkylsubstanzen adsorbieren kann. Das Modell schloss Literatur- und Patentrecherchen, Hypothesenaufstellung und Innovationsanalyse ab, rief Open-Source-Berechnungstools auf, um Simulationen durchzuführen, berechnete die Bindungsstärke zwischen verschiedenen Materialien und Zielsubstanzen und filterte Kandidatenstrukturen für die Nass-Experimentphase aus.

Das zweite Beispiel ist der formale mathematische Beweis. Unter den von den Forschern entworfenen Erkundungsstrategien und Multi-Agent-Kooperationsprozessen beteiligte sich MiMo-V2.6-Pro an der Vervollständigung der Lean-4-Formalisierung des Haupttheorems des klassischen Aufsatzes „Period Drei impliziert Chaos“. Das endgültige Projekt enthält mehr als 6000 Zeilen Lean-Code und wurde vom Lean-Kern überprüft, ohne dass unvollständige Beweisplatzhalter verblieben.

Es ist jedoch zu beachten, dass diese Arbeiten nicht alle unabhängig vom Modell abgeschlossen wurden: Das Materialbeispiel wurde von Fachpersonal durch mehrere Runden von Hinweisen und Filterung vorangetrieben, und das mathematische Beispiel hing ebenfalls von den Forschern ab, die Erkundungsstrategien entwarfen und anschließende Überarbeitungen und Integrationen durchführten. Aus dieser Sichtweise zeigen sie also eher das Potenzial des Modells als Hilfswerkzeug für die wissenschaftliche Forschung, als dass sie beweisen, dass das Modell bereits die Fähigkeit hat, selbstständig wissenschaftliche Forschung durchzuführen.

Ca. 1,5 Millionen Trajektorien in 6 Tagen abgeschlossen, Kosten für das Verstärkungslernen über 3,4 Millionen US-Dollar

Die bemerkenswerteste Änderung von MiMo-V2.6 ist nicht die Parametergröße, sondern die Trainingsmethode des Verstärkungslernens.

Interessanterweise hat das MiMo-Team von Xiaomi vor der offiziellen Veröffentlichung von MiMo-V2.6 den Produktions-Trainingsvorgang dieser Runde des Verstärkungslernens öffentlich live übertragen und der Außenwelt den Trainingsfortschritt, die Aufgabenpunktzahlen und den Ressourcenverbrauch der beiden Modelle gezeigt.

Im Gegensatz zur Offenlegung der Ergebnisse nach der Veröffentlichung des Modells stellte diese Live-Übertragung ein fast 6 Tage andauerndes groß angelegtes RL-Training direkt der Öffentlichkeit vor: Ob das Modell kontinuierlich verbessert wird, ob während des Trainings Schwankungen auftreten und ob der Rechenaufwand zu einer Leistungssteigerung führt, kann anhand von Echtzeitkurven beobachtet werden. Mit der Veröffentlichung des Modells und des technischen Berichts sind der Trainingsumfang und die technischen Details hinter dieser Live-Übertragung nun ebenfalls weiter ans Licht gekommen.

Xiaomi gibt an, dass MiMo-V2.6-Pro und MiMo-V2.6-Flash jeweils in weniger als 6 Tagen 30 Schritte des Verstärkungslernens abgeschlossen haben, wobei jedes Modell etwa 750.000 Trajektorien verarbeitet.

Die Trainingskosten von Flash betragen etwa 850.000 US-Dollar, die von Pro etwa 2,62 Millionen US-Dollar, insgesamt etwa 3,47 Millionen US-Dollar.

Seine einzelne Trainingscharge enthält 1568 Hinweise, aus jedem Hinweis werden 16 Trajektorien generiert, pro Schritt werden etwa 3,5 bis 3,7 Milliarden Token verarbeitet, und das maximale Trainingskontext erreicht 1 Million Token.

Im Gegensatz zu dem unabhängigen Verstärkungslernen, das jeweils für Programmierung, Visuelles oder Agenten durchgeführt wird, mischt Xiaomi Programmierung, generische Agenten, visuelle und Cybersicherheitsaufgaben in derselben Trainingsrunde, in der Hoffnung, dass Strategien, die in verschiedenen Aufgaben gebildet werden, gegenseitig übertragen werden können.

Bei der Belohnungsphase verwendet das MiMo-Team nicht nur das binäre Signal „bestanden oder nicht bestanden“, sondern führt einen Mechanismus zum Vergleich innerhalb der Gruppe ein: Der Bewertungsagent vergleicht mehrere Trajektorien, die derselben Aufgabe generiert wurden, horizontal, unterscheidet die Qualität der Lösungen, die die Aufgabe bereits abgeschlossen haben, weiter und weist höhere Belohnungen den Ergebnissen zu, die kürzere Pfade, weniger Token-Verbrauch oder höhere Ausführungsqualität aufweisen.

Der direkte Zweck dieser Methode ist es, ein Problem beim Training langfristiger Agenten zu lösen: Zwei Trajektorien können beide den Test bestehen, aber es gibt deutliche Unterschiede in ihrer Ausführungseffizienz, der Angemessenheit der Schritte und der Stabilität, die nicht nur durch die Endergebnisse des Tests widergespiegelt werden können.

Um Belohnungsbetrug zu kontrollieren, gibt Xiaomi an, dass es während des Trainings Umgeb