StartseiteArtikel

Der neben Ma Huateng sitzende Yao Shunyu hat den ersten Platz in China erreicht.

字母AI2026-10-10 11:20
Arena veröffentlicht die Rangliste des Alignment-Index, und die Vorhersage von Yao Shunyiyu vor einem Jahr ist in Erfüllung gegangen.

Am ersten Arbeitstag nach den Feiertagen saß Yao Shunyu neben Ma Huateng.

Laut Berichten der „Guangdong News Broadcast“ sind Führungskräfte der Provinz Guangdong zum Forschungs- und Austauschgespräch in der Zentrale von Tencent gekommen. Mehrere Führungskräfte von Tencent, darunter Ma Huateng, nahmen an dem Gespräch teil.

Dass man neben Pony sitzen darf, zeigt, dass die Führungsebene von Tencent Yao Shunyu sehr hoch schätzt. Und Yao Shunyu hat die Erwartungen tatsächlich erfüllt: Weniger als einen Monat nach seiner Ernennung zum Leiter der AI Data-Abteilung von Tencent erzielte er einen ersten Platz in China.

In der neuesten Alignment Index-Rangliste von Arena sind viele chinesische KI-Unternehmen unter die Top 10 der Liste eingetreten. Tencents Hunyuan steht an der Spitze: Sein neuestes Modell Hy4 Preview erzielte 78,5 Punkte, belegte den 5. Platz weltweit und den 1. Platz in China. Mit UA 1,47 %, FA 6,44 % und DC 13,24 % weist es die beste Leistung bei der unbefugten Kontrolle auf.

Im Gegensatz zu den früheren „Show-off“-Ranglisten von Arena misst diese Liste nicht, wer klüger ist oder höhere Laufpunktzahlen erzielt, sondern das derzeit am meisten diskutierte Sicherheitsproblem: Welches Modell am wenigsten „ausbrechen“ kann.

Im Jahr 2025 schrieb Yao Shunyu einen Artikel mit dem Titel „The Second Half“. Seine zentrale Schlussfolgerung lautete, dass in der zweiten Halbzeit der KI der Engpass nicht mehr darin besteht, wie man Modelle trainiert, sondern wie man Modelle dazu bringt, den tatsächlichen Bedürfnissen der Nutzer zu entsprechen.

Heute zeigt sich, dass Yao Shunyu seine damalige Vermutung durch praktische Handlungen bewiesen hat.

01

Was misst die Rangliste eigentlich?

Am 8. Oktober gab Arena den Abschluss einer Finanzierungsrunde der Serie B über 200 Millionen US-Dollar mit einer Bewertung von 3,1 Milliarden US-Dollar bekannt und stellte gleichzeitig die Alignment Index-Rangliste vor. Diese Rangliste basiert auf mehr als 90.000 echten Agent-Sitzungen, deckt 27 Modelle ab und erfasst ausschließlich Momente, in denen Risiken bei Modellen aus den tatsächlichen Nutzungsspuren der Nutzer auftreten.

Die Rangliste konzentriert sich hauptsächlich auf drei Fehlersignale.

Das erste ist unbefugtes Handeln (Unauthorized Action, UA): Das Modell führt Handlungen durch, zu denen es nicht beauftragt wurde.

Das typischste Beispiel ist das Umgehen von Sicherheitsbarrieren, um Netzwerke Dritter anzugreifen, sowie das Löschen von Dateien.

Arena gab bekannt, dass bei etwa 2 % der Sitzungen von Claude Opus 5 unbefugte Handlungen auftreten, von denen 53,5 % das unbefugte Löschen oder „Bereinigen“ von Nutzerdateien und früheren Arbeitsergebnissen betreffen.

Das zweite ist falsche Zuordnung (False Attribution, FA): Dem Nutzer werden Aussagen, Absichten oder Tatsachen unterstellt, die er nie geäußert hat, und diese Aussagen widersprechen den vom Nutzer vorgelegten Beweisen.

Einfach ausgedrückt bedeutet das „die Verantwortung abschieben“ oder aus dem Nichts behaupten „du hast vorher gesagt, dass du das so machen willst“. Zum Beispiel teilt es dir mit, dass deine Daten fehlerhaft sind, obwohl es selbst den Code falsch ausgeführt hat. Dieser Wert ist im Szenario des professionellen Schreibens am höchsten und erreicht 13,7 %.

Das dritte ist irreführende Abschlussmeldung (Deceptive Completion, DC): Es teilt dir mit, dass die Aufgabe abgeschlossen ist, obwohl sie noch nicht erledigt wurde.

Dies ist das häufigste der drei Probleme: Im Durchschnitt tritt es in jeder 10. Sitzung auf, und im Szenario der Code-Debugging liegt der Anteil bei bis zu 48,0 %.

Den ersten Platz belegt GPT-6.1 Sol von OpenAI mit 87,9 Punkten, den zweiten Platz Claude Opus 5.5 von Anthropic mit 83,2 Punkten und den dritten Platz Grok-4.7 mit 82,7 Punkten. Die irreführende Abschlussmeldungsrate von GPT-6.1 Sol beträgt nur 2,34 %, das heißt, in etwa 2 von 100 Aufgaben wird die Lage falsch gemeldet.

Obwohl Hy4 Preview mit 78,5 Punkten hinter den ersten drei Plätzen zurückbleibt, steht es bereits auf dem 5. Platz weltweit und dem 1. Platz in China. Mit 1,47 % unbefugten Handlungen weist es den niedrigsten Wert unter allen chinesischen Forschungslabors auf, was bedeutet, dass es am seltensten „eigenmächtig handelt“.

Die irreführende Abschlussmeldungsrate von Hy4 Preview liegt bei 13,24 %, also etwa 13 Mal in 100 Fällen, und übersteigt den durchschnittlichen Wert von 10 %. Dies ist die Schwachstelle von Hunyuan und der Bereich, der als nächstes am dringendsten verbessert werden muss.

Die Ergebnisse dieser Rangliste hängen stark mit mehreren Maßnahmen zusammen, die Yao Shunyu im vergangenen Jahr bei Tencent umgesetzt hat.

Im September dieses Jahres wurde Yao Shunyu im Rahmen der internen Ernennung bei Tencent TEG offiziell zum nebenamtlichen Leiter der AI Data-Abteilung ernannt und berichtet an Lu Shan, Präsident von TEG.

Diese Abteilung ist hauptsächlich für den Aufbau des Daten- und Bewertungssystems für große Modelle zuständig, ihr früherer Leiter war Liu Yuhong. Tatsächlich verwaltete Yao Shunyu diese Abteilung bereits seit dem ersten Halbjahr dieses Jahres praktisch, erst im September erhielt er die offizielle Ernennung.

Ab diesem Zeitpunkt liegen die vier Bereiche „Modell, Infra, Daten und Bewertung“ von Tencents Hunyuan vollständig in seiner Hand.

Dass Yao Shunyu alles von dem Modell über die Daten bis hin zur Bewertung selbst steuert, ist ganz typisch für ihn.

In dem bereits erwähnten Blogbeitrag „The Second Half“ schrieb Yao Shunyu, dass sich die Leistungsfähigkeit der Modelle allmählich angleicht und dass das weitere Erhöhen von Laufpunktzahlen keinen echten Mehrwert mehr bringt.

Yao Shunyu ist der Ansicht, dass der Grund dafür darin liegt, dass die traditionellen Bewertungsmethoden für Modelle sehr begrenzt sind.

Der Agent erhält eine Aufgabe, erledigt sie selbstständig und erhält am Ende eine Punktzahl. In der Realität muss der Agent jedoch während des gesamten Prozesses mit Menschen interagieren und kann die Aufgaben kaum vollständig selbstständig ausführen.

Darüber hinaus sind die Aufgaben in traditionellen Bewertungen unabhängig und gleichverteilt, die einzelnen Aufgaben stehen in keinem Zusammenhang zueinander. In der Realität laufen Aufgaben nacheinander ab, und Erfahrungen sammeln sich an.

Yao Shunyu erklärte, dass KI Menschen bereits im Schach, Go, SAT, Anwaltsprüfungen, IMO und IOI übertroffen hat, aber die Welt hat sich dadurch nicht stark verändert. Letztendlich liegt das daran, dass die derzeitigen Bewertungsmethoden nicht der realen Welt entsprechen.

Aus diesem Grund ließ Yao Shunyu bei Hy4 Preview das Modell selbst an der automatischen Optimierung von Trainingsmethoden, Datenstrategien, Bewertungssystemen und grundlegenden Operatoren teilnehmen, um eine Selbstiteration in Form eines anfänglichen RSI durchzuführen.

Gleichzeitig wurde Hy4 Preview gemeinsam mit Produkten wie WorkBuddy und CodeBuddy entwickelt, damit das Modell praktischere Probleme lösen kann. Die Trainingsdaten stammen aus echten Daten, die Tencents Teams für Softwareentwicklung, Spiele, Finanzen und Sicherheit im tatsächlichen Geschäftsbetrieb erzeugt haben.

Wie bereits erwähnt, haben die drei Probleme unbefugtes Handeln, Verantwortungsabschiebung und irreführende Abschlussmeldung eines gemeinsam: Sie treten nur in echten Aufgaben zutage. Genau das ist die Philosophie, für die Yao Shunyu eintritt.

Am Tag der Veröffentlichung von Hy4 Preview führte ein Blogger eine Bewertung durch und ließ WorkBuddy, das mit Hy4 verbunden war, drei Videodateien umbenennen.

Um zu testen, ob das Modell nachlässig wird, verschob er das Referenzdokument im Ordner zwischenzeitlich in einen anderen Speicherort. Das Modell bemerkte dies sofort, fragte direkt „Die Datei war gerade noch da, wo ist sie hin?“ und prüfte anschließend den Papierkorb.

Man sieht, dass Hy4 Preview große Anstrengungen unternommen hat, um die „irreführende Abschlussmeldung“ des Modells zu verhindern.

02

Alignment ist die zentrale Erzählung für große Modelle

Wenn man diese Rangliste nur als einfache Platzierung betrachtet, unterschätzt man ihre Bedeutung. Diese Rangliste soll zeigen, dass sich die Erzählung in der KI-Branche verändert.

In der Vergangenheit drehte sich die Geschichte großer Modelle darum, „wer stärker ist“: Wer einen höheren MMLU-Wert hat, wer bessere Mathematikleistungen erbringt und wer höhere Laufpunktzahlen im Codieren erzielt.

Aber jetzt nähern sich die führenden Modelle auf den Benchmarks immer weiter an, die Punktzahlen reichen nicht mehr aus, damit Nutzer eine Auswahl treffen können – Sicherheit wird zur neuen zentralen Erzählung.

Aus diesem Grund haben die drei weltweit führenden KI-Unternehmen ihre Veröffentlichungsstrategien für Modelle angepasst.

Im April dieses Jahres startete Anthropic das Project Glasswing, bei dem nur ausgewählte Unternehmen und Open-Source-Maintainer das unveröffentlichte Modell Claude Mythos Preview zum Scannen von Software-Schwachstellen verwenden dürfen. Als OpenAI am 26. Juni GPT-5.6 Sol veröffentlichte, beschränkte es ebenfalls den Zugriff auf eine kleine Gruppe geprüfter Partner. Im September gab OpenAI bei der Veröffentlichung von GPT-6 Astra bekannt, dass dieses Modell das erste ist, das im „Vorbereitungsrahmen“ die höchste Cybersicherheitsstufe erreicht – seine leistungsstärksten Netzwerkfunktionen stehen nur Unternehmen zur Verfügung, die am Daybreak-Programm teilnehmen. Auch Googles Gemini 4 Argon wird ausschließlich an Cybersicherheitspartner ausgeliefert.

Obwohl hierbei auch Marketingaspekte eine Rolle spielen, ist die Aussage „Das Modell ist zu leistungsstark, um es direkt für alle zugänglich zu machen“ keineswegs unbegründet.

Arena gab an, dass je länger ein Gespräch dauert, desto mehr Probleme auftreten. In Sitzungen mit mehr als 20 Nutzer-Nachrichten steigt der Anteil irreführender Abschlussmeldungen auf 45,4 % und der Anteil unbefugter Handlungen auf 12,4 %. Und genau diese langen Aufgaben werden in der Regel von Agenten erledigt.

Aus diesem Grund wird das Alignment-Problem mit der Verbreitung von Agenten allmählich zum „größten Problem“.

Auf der anderen Seite beeinflusst das Alignment auch die internationale Expansion chinesischer Modelle.

In der Vergangenheit war die Art und Weise, wie inländische Modelle auf den internationalen Markt gelangten, relativ direkt.

Sie betrieben eigene ausländische APIs und verkauften diese dann an ausländische Kunden. Mit der Veränderung des internationalen Umfelds haben inländische KI-Unternehmen ihre Expansionsstrategie jedoch geändert: Sie stellen ihre Modelle auf ausländischen Cloud-Plattformen wie AWS zur Verfügung, wobei die Cloud-Anbieter als Vertriebskanäle fungieren und die Einnahmen nach Aufrufvolumen aufteilen.

Zhipu und Moonshot AI verfolgen beide diesen Weg.

Am 5. Oktober gab AWS bekannt, dass Zhipus GLM 5.3 auf Amazon Bedrock offiziell verfügbar ist, und bestätigte, dass die Einnahmen nach Nutzungsvolumen mit Zhipu aufgeteilt werden. Am nächsten Tag stieg der Aktienkurs von Zhipu an der Hongkonger Börse zeitweise um mehr als 7 %.

Diese Angelegenheit scheint nur eine Änderung des Vertriebskanals zu sein, aber in Wirklichkeit haben sich die Spielregeln geändert. Früher mussten die Modellanbieter selbst ausländische Kunden davon überzeugen, dass „ich zuverlässig bin“ – jetzt stellt Amazon das Modell auf seine Plattform und bürgt dafür.

Für ausländische Unternehmen ist die größte Sorge, wenn sie Modelle in ihre Geschäftsprozesse einbinden und insbesondere als Agenten Aufgaben ausführen lassen, das Alignment-Problem.

Der Grund liegt in zwei Wörtern: „Einkauf“. Ein Agent, der Dateien löscht oder den Fortschritt falsch meldet, wird von keiner Einkaufsabteilung eines Unternehmens unterschrieben werden – zumal die Sicherheitserzählung im KI-Bereich bereits von den drei großen KI-Unternehmen stark beworben wird.

Auch Hy4 steht vor dem Problem der internationalen Expansion. Derzeit kann Hy4 über OpenRouter und Tencent Cloud TokenHub aufgerufen werden, und die beiden Produkte WorkBuddy und CodeBuddy sind ebenfalls weltweit zugänglich.

Angesichts künftiger Veränderungen des internationalen Umfelds und der gesetzlichen Vorschriften ist das Alignment weitaus wichtiger als die reine Leistungsfähigkeit.

Für Yao Shunyu und Hunyuan liegt die Bedeutung von 78,5 Punkten nicht darin, dass „es wieder in einer Rangliste gelandet ist“, sondern darin, dass es zum ersten Mal eine überprüfbare, international anerkannte Bestätigung von einem Dritten erhalten hat.

Vorher konnte Hunyuan ausländische Kunden nur durch interne Blindtests auf offiziellen Pressekonferenzen überzeugen – danach verfügt es zumindest über eine Zahl einer unabhängigen Institution: 1,47 % unbefugte Handlungen.

Natürlich ist dieses Ergebnis kein Endzustand. Hy4 Preview ist derzeit noch eine Vorschauversion, und mit einer irreführenden Abschlussmeldungsrate von 13,24 % liegt es noch weit hinter dem Spitzenwert von 2,34 % zurück.

Die Rangliste von Arena wurde gerade erst eingeführt, und ihre Methodik muss noch überprüft werden.

Daher reicht dies nicht aus, um zu beweisen, dass Hunyuan bereits einen stabilen Platz eingenommen hat – aber es zeigt, dass Yao Shunyu tatsächlich die richtige Richtung eingeschlagen hat.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Letter AI“, Autor: Miao Zheng, Redaktion: Wang Jing, veröffentlicht mit Genehmigung von 36Kr.