StartseiteArtikel

Hy4Preview ist jetzt noch mehr "Yao Shunyu"-artig.

字母AI2026-08-31 18:07
Hy4 Preview ist nicht nur ein Modellupgrade, sondern Yao Shunyus Erklärung zu seiner offiziellen Festanstellung.

Hy4 preview wurde erst vor 3 Tagen veröffentlicht, als Tencent WorkBuddy bereits eine Notfall-Erweiterung der Inferenz-Cluster für Hy4 preview durchführte. Laut offizieller Angabe werden die Ressourcen fortlaufend dynamisch angepasst.

WorkBuddy gibt jedoch an, dass aufgrund des begrenzten Gesamtumfangs an Hochleistungs-Rechenkapazität und der hohen Spitzenkonkurrenz Warteschlangen in einzelnen Zeiträumen weiterhin nicht ausgeschlossen werden können. Daher empfiehlt die offizielle Seite den Nutzern, während der Warteschlange bei Hy4 preview zu Hy3 zu wechseln, und die kostenlose Nutzungsfrist von WorkBuddy für Hy3 wurde gleichzeitig bis zum 30. September 2026 um 23:59 verlängert.

Hy4 preview hat insgesamt 770B Parameter, davon 49B aktivierte Parameter, eine Kontextgröße von 1M, einen Terminal Bench 2.1-Wert von 85,4 – der erste Platz unter Open-Source-Modellen und der dritte Platz weltweit – sowie einen SWE-bench Multilingual-Wert von 82,9, der ebenfalls den ersten Platz unter Open-Source-Modellen belegt.

Am Veröffentlichungstag am 28. August überschritt die Zahl der Nutzer, die in der API-Warteschlange standen, bereits 5000.

Warum ist Hy4 preview so beliebt?

Einerseits wächst die Nutzerzahl von WorkBuddy selbst: Laut Daten vom Juni überschritt die monatlich aktive Nutzerzahl (MAU) von WorkBuddy 20 Millionen.

Noch wichtiger ist jedoch, dass dies das erste neue Modell ist, das seit der Gründung der Abteilung für Basismodelle von Tencent entwickelt wurde, und ein Produkt, das die Philosophie von Yao Shunyus von Anfang an vollständig umsetzt.

In dem technischen Bericht von Hy4 preview gibt Tencent offen an, welche Technologien für Hy4 preview verwendet wurden, und erläutert die spezifischen Methoden zur entsprechenden Modifikation.

Das Interessante daran ist, dass Hy4 preview auch bei der Verwendung von Technologien Dritter einen einzigartigen Stil entwickelt hat.

Drei Arten der „Selbstevolution“

Alles beginnt mit der Selbstevolution.

In der README-Datei von Hy4 preview steht geschrieben: Die Inspiration stammt von DeepSeek und GLM (inspired by DeepSeek and GLM).

Der Aufmerksamkeitsmodul von Hy4 Preview nutzt die Gated- und MTP-Schichten von DeepSeek für die spekulative Dekodierung; es wird mit dem IndexCache von Zhipu für die wiederverwendbare schichtübergreifende dünne Indexierung kombiniert; die Restwegverbindung nutzt iHC (Identity Hyper-Connections) von ByteDance.

Wenn man nur diese Punkte sieht, verpasst man das wirklich ungewöhnliche Merkmal von Hy4.

Das Hunyuan-Team gibt in dem Papier an, dass Hy4 preview zum ersten Mal den gesamten Prozess seiner eigenen Herstellung begleitet hat: In vier Gliedern – Trainingsverfahren, Datenstrategie, Bewertungssystem und untere Operatorebene – wurde der Selbstevolutionsmechanismus des Modells vollständig eingeführt.

Interessanterweise weicht Hy4 preview trotz der angegebenen Inspiration durch Zhipu und DeepSeek in der Richtung der Selbstevolution vollständig von DeepSeek und GLM ab.

Die Selbstevolution von Zhipu findet in der Trainingsphase statt, mit dem Ziel, das Modell selbst intelligenter zu machen.

Zhipu hat für GLM-5.3 eine Pipeline gebaut, die „selbst Prüfungsfragen erstellt und diese selbst löst“. Ein „KI-Forscher“ beobachtet die Arbeitsumgebungen echter Ingenieure und wandelt praktische Geschäftsaufgaben in Trainingsdaten um. Anschließend löst ein „KI-Prüfer“ die Fragen zunächst ohne Einsicht in die Lösungen. Nur wenn bestätigt wird, dass die Frage tatsächlich eine Lösung hat, wird sie in die Fragendatenbank aufgenommen.

In Kombination mit den Frameworks SAO und Slime erreicht GLM-5.3 ohne Austausch des Basismodells eine um etwa 2,3-fache höhere Trainingsgeschwindigkeit für die Langzeitkodierung im Vergleich zu GLM-5.2.

Das Wesen dieser Logik ist die Evolution im biologischen Sinne: Gene passen sich in Iterationen immer besser an die Umgebung an.

Die Selbstevolution von DeepSeek findet in der Betriebsphase statt, mit dem Ziel, dass der „Körper“ des Modells durch DSH unbegrenzt umgestaltet werden kann.

Das zentrale Gestaltungsprinzip von DSH lautet „alles ist ein Plug-In“. Wenn der Agent feststellt, dass etwas fehlt, ergänzt er es sofort vor Ort und baut es nach der Nutzung spurlos wieder ab. Die offizielle Seite nennt dies Self-Modification.

Dies ist die Evolution im werkzeugtechnischen Sinne: Der Mensch selbst bleibt unverändert, er lernt nur, verschiedene Werkzeuge zu nutzen, um mehr Aufgaben erledigen zu können.

Die Selbstevolution von Tencents Hy4 preview findet weder in der Trainingsphase noch in der Betriebsphase statt, sondern im Entwicklungsprozess selbst.

Hy4 folgt weder dem Ansatz von Zhipu, „sich selbst intelligenter zu machen“, noch dem von DeepSeek, „die Anzahl der eigenen Werkzeuge zu erhöhen“. Es definiert sich selbst: „Als Hy4 Preview, wie sollte ich beschaffen sein?“ Zum Beispiel, wie sollte mein Trainingsverfahren gestaltet werden, wie sollte die Datenstrategie festgelegt werden, wie sollte das Bewertungssystem aufgebaut werden.

Man definiert zuerst, was man selbst ist, und entwickelt sich dann in die gewünschte Richtung weiter.

Um eine vollständige Selbstevolution über die gesamte Kette zu erreichen, ist der erste Schritt die einheitliche Organisation.

Die vier Glieder der Selbstevolution von Hy4 preview stellen tatsächlich die vollständige Kette der Entwicklung großer Sprachmodelle dar: Von den grundlegenden Schritten Training, Daten und Bewertung bis hin zur effizienten Ausführung des trainierten Modells.

Das bedeutet, dass Yao Shunyuyu nun die gesamte Entwicklung des großen Modells vollständig koordinieren kann.

In der Vergangenheit waren diese Bereiche getrennt: Tencent teilte sie in zwei parallele Abteilungen auf, die Abteilung für große Sprachmodelle und die Abteilung für multimodale Modelle. Jede verfügte über unabhängige Trainingsdaten, technische Frameworks, Entwicklungsprozesse und Bewertungsstandards.

Zudem verwalteten damals die Bereiche AI Infra, AI Data und die Datenplattform von Tencent jeweils unterschiedliche Datenbestände.

Im Juli wurden die Bereiche zur Abteilung für Basismodelle zusammengelegt. Seitdem Yao Shunyuyu die alleinige Leitung übernommen hat, wurde diese Kette zum ersten Mal durchgängig verbunden. Dass Hy4 preview an der gesamten Kette teilnehmen kann, zeigt bereits, dass die Organisation nun einheitlich ausgerichtet ist.

Yao Shunyuyu legt großen Wert auf die Engineering-Umsetzung.

Unter den drei Unternehmen hat nur Tencents Hunyuan Punkte wie die „Optimierung der unteren Operatorebene“ und die „Steigerung des Inferenz-Durchsatzes“, die für den praktischen Betrieb des Modells entscheidend sind, in die Liste der Selbstevolution aufgenommen.

Die erste Maßnahme von Yao Shunyuyu nach seinem Einstieg war der Wiederaufbau der Infrastruktur. In einem Gespräch mit Tang Daosheng im Juni erwähnte er: „Wir haben die gesamte Infrastruktur neu aufgebaut, sowohl für das Vortraining als auch für das verstärkende Lernen.“

Selbst bei OpenAI und Anthropic ist Rechenkapazität die knappste Ressource. Tang Daosheng hat öffentlich bestätigt, dass „der schwere Mangel an Rechenkapazität das Modelltraining und die Produktentwicklung verlangsamt hat“. Yao Shunyuyu muss jede verfügbare Rechenkapazität vollständig ausnutzen.

Der Kernpunkt liegt in Yao Shunyuyus Methodik – Co-Design. Man trainiert das Modell und nutzt es gleichzeitig, sodass Produktfeedback die Iteration des Modells vorantreibt.

Zur Zeit von Hy3 fand das Co-Design hauptsächlich zwischen Modell und Produkt statt, beispielsweise wurden die Nutzerfeedback von CodeBuddy und WorkBuddy zurück in das Modelltraining eingespeist.

Bei Hy4 preview wurde der Geltungsbereich des Co-Designs erweitert: Der gesamte Modellentwicklungsprozess folgt dieser Methodik.

Das bedeutet, dass Yao Shunyuyu das Hunyuan-Modell vereinheitlicht hat, das Modell mit allen Bereichen von Tencent verbunden hat und sein Verständnis von KI vollständig in das Modell einfließen ließ.

Das Modell ist der materielle Beweis von Yao Shunyuyus Methodik

Der Grund, warum Yao Shunyuyus Philosophie vollständig in das Modell umgesetzt wird, liegt darin, dass er selbst einer der Pioniere der Forschung zu sprachlichen Agenten ist.

ReAct ist Yao Shunyuyus repräsentative Arbeit. Das zugehörige Papier wurde im Oktober 2022 veröffentlicht und auf der ICLR 2023 vorgestellt. Es wurde zu den bemerkenswerten Top-5%-Arbeiten gezählt und hat bereits mehr als 10.000 Zitationen erhalten.

ReAct ist heute zudem das Funktionsprinzip aller Agenten. Sein Kern besteht darin, die beiden getrennten Schritte „Schlussfolgern“ und „Handeln“ in einem gemeinsamen Prompt-Template abwechselnd auszuführen: Einen Schritt denken, einen Schritt ausführen, das Ergebnis prüfen und weiterdenken.

Ob bei Claude Code oder Codex – der zugrundeliegende Zyklus „Nachdenken – Werkzeug aufrufen – Ergebnis beobachten – weiter nachdenken“ ist im Wesentlichen eine Variante von ReAct.

Yao Shunyuyus zweites großes repräsentatives Werk ist Tree of Thoughts (ToT), eine Strategie zur Verbesserung des Schlussfolgerungsvermögens.

An wichtigen Entscheidungspunkten werden mehrere Denkrichtungen entwickelt, jeweils bewertet und dann der optimale Pfad zur Fortsetzung ausgewählt.

Diese Methode hat auf Forschungsebene große Auswirkungen, aber in praktischen Produkten wird ToT selten direkt verwendet, da die Token-Kosten für die Baumsuche zu hoch sind. In Produkten wird meist die vereinfachte Version „mehrere Pfade ausprobieren“ oder „an Verzweigungspunkten gründlicher nachdenken“ eingesetzt.

ToT erweitert die Fähigkeit des Modells zum „tiefen Nachdenken“. Insbesondere wenn im ReAct-Zyklus wichtige Entscheidungspunkte auftreten, bietet ToT einen Mechanismus, der das Modell dazu anregt, „noch einmal gründlich nachzudenken“.

Von Hy3 bis Hy4 preview ist der direkteste Eindruck, dass Yao Shunyuyu seine Forschungsergebnisse vollständig in das Modell eingebaut hat.

Hy3 ist als „starker Agenten-Modell“ positioniert, der ReAct-Zyklus hat bereits eine Grundlage und kann mehrstufige Aufgaben ausführen. Aber Hy3 weist keine Merkmale der „übermäßigen Überprüfung“ auf, was darauf hindeutet, dass sein Schlussfolgern meist auf einem einzelnen Pfad basiert: Er folgt einmal gewählten Pfaden bis zum Ende, ohne Mechanismen zur Erkundung und Bewertung mehrerer Pfade.

Nur wenn ein Modell wirklich mehrere Kandidaten entwickelt, diese nacheinander bewertet und erst nach Bestätigung der Richtigkeit Ergebnisse ausgibt, zeigt es das Verhaltensmerkmal „Ich muss das unbedingt gründlich überprüfen“.

Hy4 preview ist in der Tiefe des Schlussfolgerns deutlich stärker: Beispielsweise kann das Modell sich wiederholt selbst überprüfen und weist einen längeren Schlussfolgerungsprozess auf – dies sind alles systemische Umsetzungen der ToT-Philosophie in der Ingenieurspraxis.

Von Hy3 bis Hy4 preview hat sich nicht nur die Anzahl der Parameter vergrößert, sondern die gesamte Logik des Produkts wurde verändert: Sie wurde von der „einzelpfadbasierten Ausführung“ auf die heutige „mehrpfadbasierte Erkundung + tiefe Überprüfung“ aktualisiert.

Sogar das offizielle Hunyuan-Team gibt in dem Papier offen an, dass Hy4 preview bei komplexen Aufgaben möglicherweise zu lange Denkzeiten hat und eine Tendenz zur übermäßigen Selbstüberprüfung aufweist.

Yao Shunyuyu nutzt nun endlich seine langjährigen Forschungsergebnisse: Die Dinge, an denen er früher im Labor gearbeitet hat, haben nun endlich die Chance, in die Ingenieurpraxis umgesetzt zu werden.

Aber Methoden allein reichen nicht aus, man braucht auch entsprechende Trainingsdaten zur Unterstützung.

Die Trainingsdaten der meisten großen Modelle sind „ergebnisorientiert“: Es werden Fragen und die zugehörigen Antworten bereitgestellt, aber der Zwischenprozess wird weggelassen. Das Modell kann nur lernen, „auf diese Frage diese Antwort zu geben und auf jene Frage jene Antwort zu geben“.

Modelle, die mit solchen Daten trainiert werden, meistern einfache Aufgaben problemlos. Bei komplexen Aufgaben jedoch, die mehrere Schritte, Versuch und Irrtum sowie die Anpassung von Strategien nach Zwischenergebnissen erfordern, treten leicht Probleme auf, da das Modell nie gelernt hat, „während der Ausführung zu beobachten und anzupassen“.

Da ReAct und ToT aber den Zyklus betonen, in dem das Modell während der Bearbeitung beobachtet und antwortet, wie kann dieses Problem gelöst werden?

Hy4 preview schreibt in seinem Papier, dass die Daten gemeinsam mit internen Software-Ingenieuren, Spieleentwicklern, Finanzanalytikern und Sicherheitsexperten von Tencent erstellt werden, die sich an ihren tatsächlich ausgeführten Arbeitsaufgaben orientieren, und anschließend gemeinsam mit echten Produkten wie CodeBuddy und WorkBuddy gestaltet werden.

Jeder Fortschritt des Modells ist an die tatsächliche Produktivität gebunden. Das Modell selbst ist der materielle Beweis von Yao Shunyuyus Methodik.

Hy4 preview trägt deutlich stärker die Handschrift von Yao Shunyuyu als Hy3. Hy3 erscheint heute eher als Bestätigung von Yao Shunyuyus Fähigkeiten, während er bei Hy4 preview seine Position vollständig etabliert hat.

Dieser Artikel stammt aus dem WeChat-öffentlichen Konto "Letter AI", Autor ist Miao Zheng, die Veröffentlichung erfolgt mit Genehmigung von 36Kr.