StartseiteArtikel

Das mysteriöse „Niu Lai“-Großmodell geht im gesamten Internet viral und ist für begrenzte Zeit kostenlos verfügbar.

机器之心2026-08-23 10:03
Wessen KI ist so krass?

In der Szene großer KI-Modelle sind Tests unter einem Decknamen weit verbreitet.

Vor kurzem ist ein anonymes Modell namens Ox Alpha plötzlich auf OpenRouter erschienen. „Ox“ bedeutet auf Englisch „Ochse“, und chinesische Netznutzer gaben ihm schnell einen greifbareren Spitznamen:

Das „Ochse kommt“-Großmodell.

Nach den von OpenRouter veröffentlichten Informationen verfügt Ox Alpha über einen Kontext von 1 Million Token, unterstützt die Eingabe von Texten, Bildern und Videos, kann Tools aufrufen und ist derzeit vollständig kostenlos.

Kurz nach der Inbetriebnahme schlossen Entwickler es an einen Codierungs-Agent an und testeten es in echten Code-Repositories.

Erste Testergebnisse zeigen, dass dieses unbekannte „Ochse kommt“-Großmodell bereits Fähigkeiten aufweist, die den derzeit führenden Codierungsmodellen nahekommen.

Gleichzeitig berichteten einige Netznutzer, dass ein anonymes Modell namens korrine derzeit auf Code Arena getestet wird. Einige vermuten, dass es sich um Kimi K3.1 handelt, andere verweisen es auf Qwen und MiMo – es gibt die unterschiedlichsten Vermutungen.

Im August verwandelte sich die Szene der großen KI-Modelle plötzlich in ein großes Ratespiel.

Das „Ochse kommt“-Großmodell zeigt herausragende Leistungen

Die Aufmerksamkeit von Ox Alpha wurde vor allem durch seine Codierungsfähigkeiten erregt.

Der Entwickler Ben Davis entnahm 10 Aufgaben aus DeepSWE zum Testen. Ox Alpha erledigte 8 davon, was eine Erfolgsquote von 80 % ergab. In den von ihm veröffentlichten Vergleichsergebnissen erreichte Fable 5 Max 65 %, GLM-5.3 Max und Grok 4.6 xhigh jeweils 62 % und GPT-5.6 Sol Max 52 %.

DeepSWE prüft die Fähigkeiten im Bereich der echten Softwareentwicklung. Das Modell muss Code-Repositories lesen, Probleme lokalisieren, Code ändern, Tests ausführen und dann die Fehler basierend auf Fehlermeldungen weiter beheben. Im Vergleich zu einrundigen Programmieraufgaben kommt es der tatsächlichen Arbeit von Codierungs-Agenten viel näher.

Allerdings ist die Stichprobe von 10 Aufgaben sehr klein. Später testeten andere Entwickler es auf einer anderen Teilmenge von DeepSWE und erzielten ein Ergebnis von etwa 63 %. Die Aufgabenbereiche und Ausführungskonfigurationen der beiden Tests sind nicht vollständig identisch, sodass der genaue Rang von Ox Alpha vorläufig nicht bestimmt werden kann.

Trotzdem zeigen diese Ergebnisse vorläufig, dass dieses anonyme Modell bereits ein starkes Potenzial für langfristige Codierungsaufgaben aufweist und seine Fähigkeiten den derzeit führenden Modellen nahekommen.

Wem gehört das „Ochse kommt“-Großmodell eigentlich?

Die weitverbreitetste Behauptung zur Identität des „Ochse kommt“-Modells lautet derzeit, dass es sich um das noch nicht veröffentlichte GLM-5.3 Flash von Zhipu oder die multimodale Version von GLM-5.3 handelt.

Einige haben sogar einen speziellen Blogbeitrag zur Analyse verfasst:

1. Der stärkste Beweis stammt vom Video-Encoder. Bei vier Videos mit unterschiedlichen Bildraten, Laufzeiten und Auflösungen ist die Anzahl der von Ox Alpha verbrauchten visuellen Token vollständig identisch mit der von GLM-5V-Turbo. MiMo, Qwen und GLM-4.6V zeigen alle deutlich abweichende Ergebnisse.

2. Der Text-Tokenizer stimmt ebenfalls sehr gut überein. Forscher testeten 25 Gruppen von Prompts, und die Anzahl der Token von Ox Alpha und GLM-5.3 behielt stets einen festen Unterschied von 75 Token bei.

3. Weitere Merkmale weisen ebenfalls auf Zhipu hin. Ox Alpha weigert sich, Audiodaten zu verarbeiten, was der Routing-Methode von GLM-5V entspricht; sein Antwortstil, die Anzahl der Ausführungsschritte des Agenten und die Schnittstelle für Schlussfolgerungen ähneln ebenfalls stark GLM. Zhipu hat zuvor GLM-5 bereits anonym unter dem Namen Pony Alpha getestet, es gibt also einen Präzedenzfall für diese Vorgehensweise.

https://ox-alpha-evidence-production.up.railway.app/

Einige Netznutzer fanden weitere Hinweise in den Dialogverläufen.

Ben Davis ist zu 99 % sicher, dass es sich um GLM-5.x handelt.

Diese Hinweise erhöhen die Glaubwürdigkeit der These, dass es sich um GLM handelt, reichen aber noch nicht aus, um die Identität endgültig zu bestätigen.

Bislang haben weder OpenRouter noch Zhipu öffentlich dazu Stellung genommen.

Die Identität von korrine ist noch undurchsichtiger

Die Identität des „Ochse kommt“-Modells ist noch unklar, da tauchte auf Code Arena ein weiteres anonymes Modell namens korrine auf.

Zuerst vermuteten viele, dass es sich um Kimi K3.1 handelt, denn vor der Veröffentlichung von Kimi K3 wurde angenommen, dass es unter dem Codenamen kivine getestet wird. Die Ähnlichkeit der Namensstruktur von kivine und korrine führte zu dieser Vermutung.

Allerdings ergänzte der ursprüngliche Informant später, dass das neue Modell von Moonshot, von dem er zuvor erfuhr, möglicherweise einem anderen Codenamen adamant-ananke entspricht. korrine könnte auch von anderen chinesischen Teams wie Qwen stammen.

In den Kommentarbereichen verweisen einige es auch auf MiMo V3.

Warum nutzen Hersteller von großen KI-Modellen gerne Decknamen für ihre Tests?

Anonyme Tests werden zu einem wichtigen Schritt vor der offiziellen Veröffentlichung großer KI-Modelle.

Wenn Hersteller und Modellbezeichnungen in der Arena verborgen werden, lassen sich die vorgefassten Meinungen aufgrund von Markennamen weitgehend reduzieren. Die Nutzer sehen die Identität des Modells nicht, sondern wählen nur basierend auf den tatsächlichen Ausgaben. Die daraus resultierenden Kampfergebnisse spiegeln die echte Nutzererfahrung daher viel genauer wider.

OpenRouter bietet eine andere Art von Testumgebung.

Entwickler schließen das Modell an verschiedene Codierungs-Agenten an, lassen es in echten Repositories arbeiten, kontinuierlich Tools aufrufen und Softwareentwicklungsaufgaben mit einer Dauer von mehreren Stunden bearbeiten. Ob der Kontext stabil bleibt, ob die Toolaufrufe zuverlässig sind und ob das Modell bei langwierigen Aufgaben in Schleifen gerät oder vom Weg abweicht – all das zeigt sich schnell bei intensiver Nutzung.

Für Modellanbieter ist dies gleichbedeutend mit einem öffentlichen Belastungstest. Die Teams können Fehlerfälle im Voraus beobachten, die Belastbarkeit der Inferenzdienste überprüfen und zudem vor der offiziellen Veröffentlichung echte positive Bewertungen sammeln.

Darüber hinaus wird das „Raten von Modellen“ zunehmend zu einem Marketinginstrument. Die Ungewissheit über die Identität kann den Diskussionszeitraum erheblich verlängern.

Zum Schluss kehren wir zum Modell selbst zurück: Wenn Ox Alpha tatsächlich ein Flash-Modell ist und seine Codierungsfähigkeiten bereits das Niveau der führenden Modelle erreichen, wohin wird dann die Obergrenze von der vollständigen Version verschoben, die mit höherem Ressourceneinsatz und umfassenderen Fähigkeiten ausgestattet ist?

Referenzlinks:

https://x.com/Adidotdev/status/2090833298713096241

https://x.com/davis7/status/2090669483740279155?s=20

https://x.com/davis7/status/2090655207831298095?s=20

https://x.com/MaxForAI/status/2090783750217162788

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Machine Heart“ (ID: almosthuman2014), Autor: ein KI-Interessierter, veröffentlicht mit Genehmigung von 36kr.