StartseiteArtikel

Exklusiv | Hu Han, Leiter des multimodalen Verständnisses von Hunyuan, hat das Unternehmen verlassen, um ein eigenes Startup zu gründen, und das ursprüngliche Team wird sich voraussichtlich auf Weltmodelle konzentrieren.

阿菜cabbage2026-07-23 16:07
Der ehemalige OpenAI-Forscher Tian Yonglong wird die Arbeit von Hu Han übernehmen.

Text | Zhou Xinyu

Redaktion | Zhang Yuxin

Wie *Intelligente Emergenz* exklusiv erfuhr, hat kürzlich Hu Han, Leiter des multimodalen Verstehens von Tencent Hunyuan, seinen Rücktritt eingereicht.

Zuvor war er Chefforscher in der Gruppe für visuelles Rechnen am Microsoft Research Asia. Nach seinem Eintritt bei Tencent Anfang 2025 war er für die Forschung an visuellen Großmodellen verantwortlich. Bei späteren Anpassungen wechselte er zur Forschungsgruppe für Spitzentechnologie „Frontier“ unter der Abteilung für große Sprachmodelle, wo er für die Forschung im Bereich des multimodalen Verstehens zuständig war und an Yao Shunyu berichtete.

Wie bekannt ist, war Hu Han auch für die Forschung und Entwicklung des Weltmodells verantwortlich.

Gleichzeitig sortiert Yao Shunyu, Leiter der Abteilung für große Sprachmodelle von Tencent, derzeit intensiv seine Teams, Die Forschungsgruppe, der Hu Han zuvor angehörte, wird sich möglicherweise auf die Spitzenforschung am Weltmodell konzentrieren.

Bis zum Zeitpunkt der Veröffentlichung hat Tencent keine Stellungnahme zu den oben genannten Informationen abgegeben.

Große Sprachmodelle bleiben das Wichtigste für Hunyuan

Seit Mitte 2026 finden personelle Veränderungen im gesamten Hunyuan-System statt. Anfang Juli trat Tian Yonglong, ehemaliger Forscher bei OpenAI und Doktor am Massachusetts Institute of Technology, in die Abteilung für große Sprachmodelle ein – wir erfahren, dass er Hu Han bei der Forschung und Entwicklung des visuellen Sprachmodells (VLM) ablöst und an Yao Shunyu berichtet.

Seit dem Eintritt von Yao Shunyu ist es die Hauptaufgabe von Tencent AI, die Schwächen auszugleichen und die Fähigkeiten des Grundmodells von Hunyuan schnell auf die erste Leistungsstufe zu heben.

Die Neuordnung der Ressourcenverteilung und die Konzentration von Talenten und Rechenleistung auf die Forschung und Entwicklung von Grundmodellen, für die die Abteilung für große Sprachmodelle zuständig ist, ist eine der Kernmaßnahmen nach dem Amtsantritt von Yao Shunyu.

Beispielsweise wurden nach der Auflösung des AI Lab von Tencent alle Kernforschungsmitarbeiter in die Abteilung für große Sprachmodelle integriert. Die Bemühungen um die Einstellung von Talenten für große Sprachmodelle haben sich mit dem Eintritt von Yao Shunyu verstärkt, beispielsweise mehrere Mitarbeiter aus dem Seed-Infra-Team und dem Nachschulungsteam von ByteDance.

Später, auf der Tencent Cloud AI Industrial Application Conference am 5. Juni, stellte Tang Daosheng, Senior Executive Vice President der Tencent Group und CEO der Cloud und Smart Industry Group, Yao Shunyu in gewisser Weise eine scharfe Frage, die von der Außenwelt gestellt wurde: Viele Leute sagen, Tencent sei im Bereich KI zurückgeblieben. Glauben Sie, dass wir wirklich zurückgeblieben sind?

Aber eigentlich ist „Shunyu noch eifriger als die Führungskräfte von Tencent“, sagte ein Forscher von Hunyuan gegenüber *Intelligente Emergenz*. Er erwähnte, dass Yao Shunyu wiederholt bei den Führungskräften von Tencent mehr Rechenressourcen für Hunyuan beantragt hat.

Ein weiteres Detail: Der *LatePost* hat einmal erwähnt, dass einen Monat vor der Veröffentlichung von Hy3 ein Problem mit einer Reihe von Daten aufgetreten ist. Yao Shunyu hat das Team mit selten strengen Worten ermahnt: „Daten sind sehr wichtig. Wenn so etwas erneut auftritt, müssen Sie das Unternehmen sofort verlassen.“

Neubewertung des Nutzens des multimodalen Verstehens

Wenn keine der KI-Fronten eine führende Position erreicht hat, muss Tencent, um aus der Masse hervorzugehen, zwangsläufig den Nutzen verschiedener technischer Richtungen der KI neu bewerten.

Einerseits ist die Forschung zum multimodalen Verstehen, an der Hu Han arbeitet, bereits weit ausgereift, und der Nutzen, der durch weitere Investitionen in Ressourcen erzielt wird, ist bereits sehr begrenzt.

„In der Forschung zum multimodalen Verstehen erreicht die Genauigkeit der Erkennung von Texten, Bildern und Videos im Grunde über 85 %“, sagte ein multimodaler Forscher zu uns. „Das Schwierige ist eigentlich das visuelle Schlussfolgern, also das Verständnis des Modells für die Bedeutung von Bildern und Videos. Dieser Schritt reicht mit multimodaler Forschung nicht aus, sondern erfordert die Verbesserung der Schlussfolgerungsfähigkeit des Sprachmodells.“

Mit dem allmählichen Rückgang des technologischen Dividends ist der kommerzielle Nutzen, der durch das multimodale Verstehen erzielt werden kann, auch nicht klar ersichtlich.

Zuvor nahm die multimodale Forschung im KI-System von Tencent einst eine zentrale Position ein. Der Hauptgrund dafür ist, dass die Computer-Vision-Technologie direkt stark mit den „Cash-Cow“-Geschäften wie Werbung, Spielen und audiovisuellen Inhalten verbunden werden kann, um Einnahmen für Tencent zu erzielen.

Aber im Vergleich zu Generierungstechnologien können die Szenarien, die dem multimodalen Verstehen entsprechen, wie „Bilderkennung“ und „Bildbeschreibung generieren“, eigentlich nicht direkt kommerzialisiert werden.

„Kein Nutzer ist bereit, für Bilderkennung zu bezahlen, es gibt zahlreiche kostenlose Alternativen auf dem Markt“, sagte ein Produktmanager von Yuanbao. Was die Nutzer wirklich bereit sind zu bezahlen, sind Büroszenarien wie Dokumentenverarbeitung, PPT-Erstellung und Forschungsberichterstellung – dahinter stehen die Fähigkeiten des Modells zum Schlussfolgern, zur Codierung und zum agierenden Handeln.

Andererseits sind die Rechenressourcen von Tencent begrenzt und haben keinen Vorteil gegenüber ByteDance und Alibaba.

Der Finanzbericht von Tencent für 2025 zeigt, dass die gesamten Kapitalausgaben von Tencent im Jahr 79,2 Milliarden Yuan betrugen; im Vergleich dazu beliefen sich die Kapitalausgaben von Alibaba im Geschäftsjahr bis März 2026 auf 126 Milliarden Yuan; und laut einem Bericht von Bloomberg plant ByteDance im Jahr 2026, die Investitionen in die KI-Infrastruktur auf bis zu 70 Milliarden US-Dollar zu erhöhen.

Bei begrenzten Ressourcen ist es unvermeidlich, dass innerhalb von Hunyuan mehr Nachfrage als Angebot herrscht. Zu diesem Zeitpunkt ist es die Entscheidung von Tencent nach Abwägung des Nutzens, die Forschung zum multimodalen Verstehen mit begrenztem technologischen Nutzen vorübergehend zu verlangsamen und sich auf die Forschung an zukunftsweisenden Spitzenrichtungen zu konzentrieren.

Am 6. Juli legte Yao Shunyu sein erstes offizielles Ergebnis nach seinem Eintritt bei Tencent vor: das Großmodell Hy3. Bei mittelgroßen Modellen mit gleicher Parameteranzahl kann Hy3 bereits mit GLM-5.2 und DeepSeek V4 Pro mithalten.

Auf der eigenen Koordinatenachse von Tencent KI haben die seit dem Eintritt von Yao Shunyu durchgeführte Organisationsumstrukturierung, der Wiederaufbau der Infrastruktursysteme (Daten, Infra, Bewertung) und die Strategie der Rückkehr zum Grundmodell dazu geführt, dass Hunyuan innerhalb von nur sechs Monaten die Berechtigung erhalten hat, am Tisch der KI Tier 1 teilzunehmen.

(Li Zhaofeng, Autor von *Intelligente Emergenz*, hat ebenfalls zu diesem Beitrag beigetragen.)