Das mysteriöse Modell „Niulai“ entpuppt sich tatsächlich als Produkt von Zhipu, es handelt sich um das erste native multimodale Modell auf GLM-Basis, das zudem mit in China hergestellten Rechenchips betrieben wird.
Endlich ist die Identität des geheimnisvollen Modells „Niu Lai“ (Ox Alpha), das in den letzten Tagen im Internet heftig diskutiert wurde, enthüllt!
Und es stammt tatsächlich von chinesischen Entwicklern —
Es handelt sich um das GLM-5.3 Flash, das gerade von Zhipu veröffentlicht und Open Source gemacht wurde, das erste native multimodale Modell in der 5er-Serie.
Während „Niu Lai“ in den letzten Tagen populär wurde, haben bereits viele Nutzer die Version Ox Alpha in der Praxis getestet.
Eine der am häufigsten durchgeführten Anwendungen ist die Erstellung einer 3D-interaktiven Webseite für den SpaceX Raptor-Triebwerk von Grund auf.
Zum Beispiel hat der Blogger Tim Jayas die Aufgabe nach einigen Tagen mit demselben Prompt zweimal an „Niu Lai“ übergeben und dann folgende Eindrücke geäußert:
Es wirkt so, als könnte „Niu Lai“ ein Modell sein, das sich kontinuierlich selbst weiterbildet.
Zufällig haben auch wir die Berechtigung für die interne Testphase von GLM-5.3 Flash erhalten und dasselbe Projekt durchgeführt; nach der Eingabe des Prompts sind keine weiteren Aktionen erforderlich:
Nach kurzer Wartezeit ist das 3D-Raptor-Triebwerk-Projekt fertiggestellt, lassen Sie uns das Erlebnis erleben:
Aus dem Vergleich der Ergebnisse geht hervor, dass das von GLM-5.3 Flash erstellte 3D-Raptor-Triebwerk noch weiter verbessert ist, was keine weiteren Erklärungen erfordert.
Warum ist das Modell „Niu Lai“ so populär?
Aus den offiziellen Beiträgen verschiedener Plattformen können wir bereits einen Teil der Gründe erkennen.
Auf OpenRouter zum Beispiel hat „Niu Lai“ am ersten Tag die Spitzenposition erreicht und den historischen Rekord für den täglichen Tokens-Verbrauch gebrochen:
OpenCode hat hingegen mitgeteilt, dass Ox Alpha bei seiner Veröffentlichung den Rekord von DeepSeek beendet hat, der 56 Tage lang ununterbrochen die Spitzenposition auf OpenCode belegt hatte:
Nachdem Zhipu „Niu Lai“ offiziell bestätigt hat, haben wir weitere Highlights von GLM-5.3 Flash entdeckt.
Bezüglich der Modellgröße beträgt GLM-5.3 Flash nur 320B, übertrifft aber in allen Fähigkeiten das GLM-5.2 mit einer Größe von 753B vollständig.
Darüber hinaus zeigt die neueste AA-Bestenliste, dass GLM-5.3 Flash bereits 57 Punkte erreicht hat, weltweit zu den fortschrittlichsten Modellen gehört und die gleiche Punktzahl wie Claude Opus 4.8 aufweist.
Bezüglich des Preises liegt die Preisgestaltung von GLM-5.3 Flash bei 1/10 des Preises der 5.3-Version, der zeitlich begrenzte Rabatt beträgt 1/20 des Preises von GLM-5.3 und 1/40 des Preises von Opus 4.8, der Preis liegt unter dem von DS-V4-Flash.
Und es gibt noch etwas, worauf man stolz sein kann —
Die oben erwähnten 62T Tokens laufen alle auf in China hergestellten Chips! Das geheimnisvolle Modell, das ausländische Entwickler einen Monat lang verfolgt haben, ist ein rein in China entwickeltes Modell.
Als Nächstes gehen wir nach der üblichen Vorgehensweise zu einer ausführlichen Praxisprüfung über~
GLM von Zhipu hat nun endlich multimodale Fähigkeiten erlangt
Wie bereits erwähnt ist GLM-5.3 Flash das erste native multimodale Modell in der 5er-Serie.
Daher konzentrieren wir uns in der ersten Praxisprüfung auf den Bereich Multimodalität.
Zum Beispiel übergeben wir GLM-5.3 Flash ein Video mit mehreren sprechenden Personen, damit es anhand des Originalvideos unterscheidet, wer spricht, und genaue Untertitel erstellt.
Der Prompt lautet wie folgt:
Identifizieren Sie zuerst die verschiedenen Sprecher und erstellen Sie dann Untertitel mit Farbcodierung für die Personen und einem Karaoke-fähigen Nachsprecheffekt: Die Hintergrundfarbe für jede Person bleibt fest, das aktuell gelesene Wort oder die Phrase wird zusätzlich hervorgehoben. Verwenden Sie eine kontrastreiche Kombination aus Cyanblau, Warmgelb, Korallenrot und Weiß, das aktuelle Wort wird von geringer Helligkeit sanft zu einer hellen Farbe übergehen. Unterscheiden Sie zwischen Hauptredner, Moderator und Personen, die nur kurz ein Wort einwerfen, Hintergrundmusik, Applaus und Umgebungsstimmen werden nicht als separate Sprecher aufgeführt. Die Untertitel müssen anhand des endgültigen Zeitachsen neu ausgerichtet werden, bei allen bearbeiteten Abschnitten dürfen die alten Zeitpositionen des Quellvideos nicht übernommen werden. Sehen Sie sich zuerst das gesamte Video an, bevor Sie Entscheidungen treffen, um zu vermeiden, dass die nachfolgende Struktur nur anhand der ersten Beispiele im Anfangsteil abgeleitet wird. Sorgen Sie dafür, dass die Schnittstellen natürlich wirken und die menschlichen Stimmen klar verständlich sind. Platzieren Sie die Untertitel im sicheren Bereich des Bildes und verwenden Sie Konturen oder Hintergründe, um die Lesbarkeit auch bei komplexen Hintergründen zu gewährleisten.
Diese Aufgabe prüft die Fähigkeiten eines Modells bei der multimodalen Verarbeitung stark: Zum Beispiel muss es zuerst das Video verstehen, die Personen den richtigen Stimmen zuordnen und vor allem die Untertitel exakt erstellen.
Schauen wir uns die Leistung von GLM-5.3 Flash an:
Ein Detail ist, dass GLM-5.3 Flash selbst das nur einmal im Bild erscheinende Namensschild erfassen kann, um die Beziehung zwischen Stimme, Name und Person herzustellen.
Daraus geht hervor, dass die multimodalen Fähigkeiten von GLM-5.3 Flash bei dieser Aufgabe recht zuverlässig sind.
Wenn Sie denken, dass die Erstellung von Untertiteln eine zu einfache Aufgabe ist, übergeben wir GLM-5.3 Flash anschließend den gesamten klassischen Film „The Myth“, damit es direkt ein Video mit Filmbeschreibungen erstellt.
Der Prompt lautet wie folgt:
Bearbeiten Sie diesen vollständigen Film zu einem chinesischen Filmbeschreibungsvideo, erläutern Sie die Haupthandlung und die Beziehungen zwischen den Figuren, heben Sie wichtige Konflikte und emotionale Wendepunkte hervor, stellen Sie sicher, dass der Inhalt der Beschreibung mit dem Originalfilm übereinstimmt, und erstellen Sie eine Sprachausgabe sowie chinesische Untertitel.
Schauen wir uns das endgültige Ergebnis an:
Im Vergleich zur vorherigen Aufgabe der Untertitel-Erstellung muss GLM-5.3 Flash diesmal ein Video mit deutlich längerer Dauer „ansehen“, die gesamte Handlung erfassen und zusammenhängende, wichtige Ausschnitte auswählen.
Aus dem Endergebnis geht hervor, dass GLM-5.3 Flash alle wichtigen Schritte hinter der Erstellung von Filmbeschreibungen selbst verstehen und ausführen kann, und die Ergebnisse entsprechen den Anforderungen.
Anschließend prüfen wir zusätzlich zu den multimodalen Fähigkeiten auch die Coding-Fähigkeiten des Modells.
Die ungefähre Aufgabe lautet: Übergeben Sie GLM-5.3 Flash einen vollständigen Produktdesignentwurf, damit es anhand dieses Bildes eine interaktive Nutzeroberfläche für das Produkt erstellt.
Der vorbereitete Designentwurf lautet wie folgt (scrollen Sie nach oben und unten, um das gesamte Bild anzuzeigen):
Der Prompt lautet wie folgt:
Implementieren Sie eine vollständige mobile Einkaufs-App anhand dieses UI-Designentwurfs, reproduzieren Sie die Farbschemata, Schriftarten, Bilder, Karten und Seitenlayouts des ursprünglichen Designs so genau wie möglich und machen Sie die im Bild gezeigten Hauptseiten sowie den Einkaufsprozess zu einer tatsächlich interaktiven Version. Implementieren Sie Funktionen wie Startseite/Entdecken, Produktliste, Filter, Produktbeschreibung, Bewertungen, Favoriten, Warenkorb, Lieferung, Adresse, Zahlung, Bestellungsabschluss, Filialkarte, persönlicher Bereich und Einstellungen.
Schauen wir uns das endgültige Interaktionsergebnis an:
Alle Funktionen können wie im Prompt gefordert reibungslos interagiert werden.
Für noch komplexere Aufgaben hat das offizielle Team von Zhipu das Ergebnis einer 3D-Blender-Szenen-Konstruktionsaufgabe gezeigt, die von GLM-5.3 Flash 12 Stunden lang unabhängig ausgeführt wurde:
Die aktuelle Situation von GLM-5.3 Flash ist: Solange Sie ihm genug Zeit geben, kann es komplexe Aufgaben zu günstigen Preisen selbstständig lösen.
Die Architektur ist ebenfalls neu entwickelt
Nachdem Sie die Ergebnisse der Praxisprüfung gesehen haben, fragen Sie sich möglicherweise:
Wie kann ein Modell mit 320B Parametern solche Ergebnisse erzielen?
Die Antwort liegt hinter dem Begriff „Flash“.
Diesmal optimiert Zhipu die Effizienz direkt an der Modellarchitektur selbst.
GLM-5.3 Flash hat insgesamt 320B Parameter, die tatsächliche Anzahl der aktivierten Parameter beträgt nur 18B, und die Anzahl der Schichten wurde von 92 Schichten bei GLM-4.5 auf 45 Schichten reduziert. Trotz der Verkleinerung übertrifft seine Leistung das größere Vorgängermodell GLM-5.2. In Kombination mit dem neuesten multimodalen Vortrainingskorpus von 30T Token verfolgt Zhipu das Ziel, weniger Berechnungen durchzuführen, aber keine Leistung einzubüßen.
Die wichtigste Optimierung betrifft den Aufmerksamkeitsmechanismus. GLM-5.3 Flash verwendet eine gemischte Architektur aus linearer Aufmerksamkeit und spärlicher Aufmerksamkeit.
Die lineare Aufmerksamkeit erfasst lokale Informationen, während die spärliche Aufmerksamkeit über einen leichtgewichtigen Indexer die wirklich relevanten globalen Kontextinformationen abruft. Bei sehr langen Kontexten wie 1M muss nicht jedes Token mit allen anderen Token komplexe Berechnungen durchführen.
Zhipu hat zusätzlich einen IndexPool hinzugefügt, der die ursprünglich 4 Cache-Vektoren des Indexers auf 1 reduziert. Im Vergleich zu GLM-5.3 wird der Berechnungsaufwand für die Aufmerksamkeit bei GLM-5.3 Flash um das 3,01-fache reduziert, und der KV-Cache wird um das