Exklusiv | Hu Han, Leiter des Bereichs für multimodales Verständnis von Hunyuan, verlässt das Unternehmen, um ein eigenes Startup zu gründen, und das ursprüngliche Team wird sich voraussichtlich auf Weltmodelle konzentrieren.
Text | Zhou Xinyu
Redaktion | Zhang Yuxin
„Intelligent Emergence“ erfuhr exklusiv, dass Hu Han, der Leiter der multimodalen Verständnisforschung bei Tencents Hunyuan, kürzlich seinen Rücktritt eingereicht hat.
Zuvor war er Chefwissenschaftler in der Gruppe für visuelles Rechnen am Microsoft Research Asia. Anfang 2025 trat er Tencent bei und war für die Forschung an visuellen Großmodellen verantwortlich. In nachfolgenden Anpassungen wechselte er zur Forschungsgruppe für Spitzentechnologie „Frontier“ unter der Abteilung für große Sprachmodelle, wo er die Forschung im Bereich des multimodalen Verstehens leitete und an Yao Shunyu berichtete.
Wie bekannt ist, war Hu Han auch an der Entwicklung von Weltmodellen beteiligt.
Gleichzeitig überprüft Yao Shunyu, der Leiter der Abteilung für große Sprachmodelle von Tencent, in jüngster Zeit intensiv die Teams unter seiner Leitung. Die Forschungsgruppe, der Hu Han früher angehörte, wird sich möglicherweise auf die Spitzenforschung zu Weltmodellen konzentrieren.
Bis zum Redaktionsschluss hat Tencent keine Stellungnahme zu den oben genannten Informationen abgegeben.
Große Sprachmodelle bleiben das wichtigste Anliegen von Hunyuan
Seit Mitte 2026 laufen personelle Veränderungen im gesamten Hunyuan-System kontinuierlich ab. Anfang Juli trat Tian Yonglong, ehemaliger OpenAI-Forscher und Doktor des Massachusetts Institute of Technology, der Abteilung für große Sprachmodelle bei – wie wir erfahren haben, wird er Hu Han bei der Forschung und Entwicklung von visuell-sprachlichen Modellen (VLM) ersetzen und an Yao Shunyu berichten.
Seit Yao Shunyu eingetreten ist, ist es die Hauptaufgabe der KI-Abteilung von Tencent, Schwachstellen zu beheben und die Fähigkeiten des Hunyuan-Basismodells schnell in die erste Liga zu heben.
Die Neuausrichtung der Ressourcenverteilung, bei der Talente und Rechenleistung auf die von der Abteilung für große Sprachmodelle verantwortete Forschung an Basismodellen konzentriert werden, ist eine der Kernmaßnahmen nach Yao Shunyus Amtsantritt.
Beispielsweise wurden nach der Auflösung von Tencents AI Lab alle Kernentwickler in die Abteilung für große Sprachmodelle integriert. Die Einstellungsoffensive für Talente im Bereich großer Sprachmodelle hat sich mit dem Eintritt von Yao Shunyu ebenfalls verstärkt, so kamen beispielsweise mehrere Mitarbeiter aus dem Seed-Infra-Team und dem Nachbearbeitungsteam von ByteDance.
Später stellte Tang Daosheng, Senior Executive Vice President von Tencent Group und CEO der Cloud- und Intelligent Industry Group, auf der Tencent Cloud AI Industry Application Conference am 5. Juni Yao Shunyu in gewisser Weise eine scharfe Frage, die von der Außenwelt gestellt wurde: Viele Leute sagen, Tencent sei im Bereich KI zurückgefallen. Glauben Sie, dass wir wirklich zurückgefallen sind?
Aber tatsächlich ist „Shunyu noch eifriger als die Führungsebene von Tencent“, wie ein Forscher von Hunyuan gegenüber „Intelligent Emergence“ erklärte. Er erwähnte, dass Yao Shunyu mehrfach bei den Führungskräften von Tencent für Hunyuan um mehr Rechenressourcen geworben hat.
Ein weiteres Detail ist, dass „LatePost“ einmal berichtet hat, dass einen Monat vor der Veröffentlichung von Hy3 ein Problem mit einer Reihe von Daten aufgetreten ist. Yao Shunyu ermahnte das Team mit ungewöhnlich strengen Worten: „Daten sind sehr wichtig. Wenn so etwas das nächste Mal wieder passiert, müssen die Verantwortlichen das Unternehmen sofort verlassen.“
Neubewertung des Nutzens des multimodalen Verstehens
Wenn keine der KI-Fronten eine führende Position erreicht hat, muss Tencent, um einen Durchbruch zu schaffen, zwangsläufig den Nutzen jeder KI-Technikrichtung neu bewerten.
Einerseits ist die von Hu Han betriebene Forschung zum multimodalen Verstehen bereits weitgehend ausgereift, sodass der Nutzen durch weitere Ressourceninvestitionen sehr begrenzt ist.
„In der Forschung zum multimodalen Verstehen erreichen die Genauigkeit der Erkennung von Text, Bildern und Videos im Grunde über 85 %“, sagte ein multimodaler Forscher zu uns. „Das Schwierige ist eigentlich das visuelle Schlussfolgern, also das Verständnis des Modells dafür, was Bilder und Videos bedeuten. Dieser Schritt reicht mit multimodaler Forschung nicht aus, sondern erfordert die Verbesserung der Schlussfolgerungsfähigkeit des Sprachmodells.“
Da die technischen Dividenden allmählich schwinden, ist der durch das multimodale Verstehen erzielbare kommerzielle Nutzen auch nicht klar definiert.
Früher nahm die multimodale Forschung einmal eine zentrale Position im KI-System von Tencent ein. Der Hauptgrund dafür war, dass Computer-Vision-Technologien direkt eng mit den „Cash-Cow“-Geschäften wie Werbung, Spielen und Audio-Video kombiniert werden können, um Einnahmen für Tencent zu generieren.
Aber im Vergleich zu Generierungstechnologien können die Szenarien, die dem multimodalen Verstehen entsprechen, wie „Bilderkennung“ und „Bildbeschreibung generieren“, eigentlich nicht direkt kommerzialisiert werden.
„Kein Nutzer ist bereit, für Bilderkennung zu bezahlen, es gibt auf dem Markt zahlreiche kostenlose Alternativprodukte“, erwähnte ein Produktmanager des Yuanbao-Produkts. Das, wofür Nutzer wirklich bereit sind zu bezahlen, sind Büroszenarien wie Dokumentenverarbeitung, PPT-Erstellung und Erstellung von Forschungsberichten – dahinter stecken die Schlussfolgerungs-, Codierungs- und Agent-Fähigkeiten des Modells.
Andererseits sind die Rechenressourcen von Tencent begrenzt und haben keinen Vorteil gegenüber ByteDance und Alibaba.
Der Finanzbericht von Tencent für 2025 zeigt, dass die gesamten Kapitalausgaben von Tencent im Jahr 79,2 Milliarden Yuan betrugen; im Vergleich dazu beliefen sich die Kapitalausgaben von Alibaba im Geschäftsjahr bis März 2026 auf 126 Milliarden Yuan; und laut einem Bericht von Bloomberg plant ByteDance im Jahr 2026, die Investitionen in die KI-Infrastruktur auf bis zu 70 Milliarden US-Dollar zu erhöhen.
Bei begrenzten Ressourcen ist es in Hunyuan unvermeidlich, dass mehr Bewerber als verfügbare Stellen vorhanden sind. Zu diesem Zeitpunkt ist die Entscheidung von Tencent nach Abwägung des Nutzens, die Forschung zum multimodalen Verstehen mit begrenzten technischen Dividenden vorübergehend zu verlangsamen und sich auf die Forschung an zukunftsweisenden Spitzenrichtungen zu konzentrieren.
Am 6. Juli legte Yao Shunyu seine erste offizielle Arbeitsprüfung nach seinem Eintritt bei Tencent vor: das Großmodell Hy3. Bei mittelgroßen Modellen mit gleicher Parameteranzahl kann Hy3 bereits mit GLM-5.2 und DeepSeek V4 Pro mithalten.
Im eigenen Koordinatensystem von Tencents KI haben die von Yao Shunyu seit seinem Eintritt durchgeführte Organisationsumstrukturierung, die Neugestaltung der Infrastruktursysteme (Daten, Infra, Bewertung) und die Strategie der Rückkehr zum Basismodell dazu geführt, dass Hunyuan innerhalb von nur einem halben Jahr die Berechtigung erhalten hat, am Tisch der KI-Tier-1-Modelle mitzuspielen.
(Li Zhaofeng, Autor von „Intelligent Emergence“, hat ebenfalls zu diesem Artikel beigetragen.)