StartseiteArtikel

Am Tag des Launches wurden die Server sofort vollständig überlastet, Tencents KI hat endlich einmal richtig stark aufgetrumpft.

蓝字计划2026-09-01 17:56
Die alten „drei etablierten Marktführer“ geben jetzt alles.

Tencents KI erlebt einen wahren Boom.

Am 28. August wurde Hunyuan Hy4 Preview erstmals in WorkBuddy, der KI-Arbeitsplatzplattform von Tencent, integriert. Am ersten Tag der Einführung bildeten sich bereits Warteschlangen in der Aufgabenwarteschlange; drei Tage später kündigte Tencent eine dringende Erweiterung des Inferenzclusters an und verlängerte die kostenlose Testphase von Hy3 bis zum 30. September, um einen Teil der Nachfrage abzufedern.

Aber selbst dadurch lassen sich Warteschlangen in Spitzenzeiten nicht vermeiden. Aus der aktuellen praktischen Erfahrung geht hervor, dass Aufgaben, die bei normaler Nutzung auf WorkBuddy nach der Auswahl von Hunyuan Hy4 Preview eigentlich in 2 Minuten erledigt werden sollten, nun häufig mehr als 5 Minuten in Anspruch nehmen.

Die Geschwindigkeit ist noch relativ langsam

Die Begeisterung der Öffentlichkeit für Hy4 Preview ist unvermindert hoch, und die Wartesituation hat sich nicht verbessert. Ein solch beispielloser Ansturm ist für Tencents KI wirklich selten. Manche mögen behaupten, dass die zeitlich begrenzte Kostenfreiheit von Hy4 Preview zu den Warteschlangen in Spitzenzeiten führt, aber dies ist offensichtlich nur einer der Faktoren.

Die Leistung ist viel entscheidender. Ein Blick auf die "Identitätsinformationen" von Hy4 Preview macht das deutlich:

Es handelt sich um ein reines Sprachmodell, dessen Hauptverbesserungen sich auf Agenten, Software-Engineering und Büroaufgaben konzentrieren: Die Gesamtparameter sind von 295 Milliarden bei Hy3 auf 770 Milliarden gestiegen, die aktivierten Parameter von 21 Milliarden auf 49 Milliarden, und die Kontextlänge wurde von 256K auf über 1 Million Token erweitert.

Mit größeren Parametern, längerem Kontext und mehr aufrufbaren Fähigkeiten ist Tencent sehr zuversichtlich bei diesem neuen Modell und hat es mit dem Slogan "Entstanden für Produktivität" versehen.

Ist Tencent dieses Mal wirklich aufgeholt?

Eines der alten "drei Top-Unternehmen" ist zurückgekehrt

Hy4 Preview verwendet weiterhin die MoE-Architektur, aber der Umfang des Modells ist völlig anders.

Die Gesamtparameter sind von 295 Milliarden bei Hy3 auf 770 Milliarden gestiegen, und das Kontextfenster wurde direkt von 256K auf 1M erweitert. Obwohl sich die Gesamtparameter mehr als verdoppelt haben, sind an jeder Inferenz nur 49 Milliarden Parameter tatsächlich an der Berechnung beteiligt, sodass nicht alle 770 Milliarden Parameter aufgerufen werden müssen.

Einfach ausgedrückt kann Hy4 mehr Wissen und Fähigkeiten in das Modell aufnehmen und bei der tatsächlichen Beantwortung von Fragen nur die Teile aktivieren, die für die aktuelle Aufgabe relevant sind. Dadurch wird nicht nur die Obergrenze der Fähigkeiten erweitert, sondern auch verhindert, dass die Inferenzkosten im gleichen Maße wie der Gesamtparameterumfang steigen.

Aus den von der Behörde veröffentlichten Ergebnissen geht hervor, dass diese "Leistungssteigerung" hauptsächlich auf Software-Engineering- und Agentenaufgaben abzielt.

Terminal-Bench 2.1 simuliert die KI bei der Erledigung realer Aufgaben im Terminal: Es muss Anforderungen verstehen, Befehle eingeben, Abhängigkeiten installieren, Fehler beheben und die Aufgabe vollständig durchführen. Hy4 hat bei diesem Test die Punktzahl von 70,8 bei Hy3 auf 85,4 verbessert.

DeepSWE und SWE-bench Pro entsprechen noch stärker dem täglichen Arbeitsalltag von Programmierern. Sie verlangen vom Modell, dass es nicht nur einen Codeabschnitt schreibt, sondern das gesamte Code-Repository versteht, Probleme lokalisiert, mehrere Dateien ändert und die Tests besteht.

Hy4 hat seine Punktzahl bei DeepSWE von 28,0 auf 64,3 gesteigert und bei SWE-bench Pro 65,7 Punkte erreicht, womit es bereits in den Wettbewerbsbereich von GLM-5.3, Kimi K3 und GPT-5.6 Sol eingetreten ist.

Die Benchmark-Ergebnisse sind sehr beeindruckend Quelle: Offizielles Konto von Hunyuan

Bei den Tool-Aufrufen erzielte Hy4 74,1 Punkte bei Toolathlon-Verified und 37,1 Punkte bei APEX-Agents.

Tencent hat außerdem 163 interne Experten organisiert, um einen Blindtest mit 203 echten Ingenieuraufgaben durchzuführen. Hy4 erreichte durchschnittlich 2,99 Punkte, was leicht über den 2,94 Punkten von Kimi K3 und den 2,92 Punkten von GLM-5.3 liegt.

Obwohl alle diese Ergebnisse aus offiziellen Veröffentlichungen stammen und die tatsächlichen Nutzererfahrungen nicht direkt ersetzen können, beweist dies zumindest eines: Die Fortschritte von Hy4 konzentrieren sich auf das Schreiben von Code, das Aufrufen von Tools und die Erledigung langwieriger Aufgaben, und Tencent hat Hunyuan in die erste Reihe der Open-Source-Modelle gebracht.

Das erklärt auch, warum Hy4 den Slogan "Entstanden für Produktivität" betont.

Produktivitätsagenten haben eigentlich nicht viel Spielraum für Fehler. Die meisten Nutzer stellen ihm eine Aufgabe, lassen ihn dann laufen und widmen sich anderen Dingen, um die Ergebnisse erst nach einigen Stunden abzurufen.

Das bedeutet, dass sobald der Agent in einem Dutzend Schritten einen Fehler macht, die zuvor abgeschlossenen Suchvorgänge, Analysen und Operationen umsonst sein könnten. Daher ist es wichtiger, dass das Modell die gesamte Aufgabenkette durchläuft, als dass es eine einzelne Antwort besonders schön formuliert.

Auf der anderen Seite ist neben der Fokussierung auf die Modellfähigkeiten auch die Preisgestaltung von Hy4 Preview eindeutig auf die praktische Produktivität ausgerichtet.

Der Eingabepreis von Hy4 Preview beträgt 6 Yuan pro Million Token, der Ausgabepreis 18 Yuan.

Der entscheidendste Punkt ist, dass ein Cache-Treffer nur 0,3 Yuan pro Million Token kostet, was nur einem Zwanzigstel des normalen Eingabepreises entspricht.

Preis-Leistungs-Verhältnis Quelle: Offizielles Konto von Hunyuan

Dies ist besonders wichtig für Agenten. Bei langen Aufgaben mit Hunderttausenden von Token muss das Modell in mehreren Runden von Operationen häufig dieselben Dokumente oder Codes wiederholt lesen, sodass der Anteil wiederholter Aufrufe sehr hoch ist. Wenn der Preis für Cache-Treffer niedrig genug ist, lassen sich diese Kosten deutlich senken.

Obwohl die Ein- und Ausgabepreise von Hy4 nicht die niedrigsten auf dem Markt sind, liegen sie in einem relativ günstigen Bereich. Zusammen mit dem niedrigen Cache-Trefferpreis von 0,3 Yuan lassen sich die Gesamtkosten für Entwickler bei der Ausführung von Aufgaben mit langem Kontext und mehrstufigen Agenten deutlich leichter kontrollieren.

Aus diesem Grund hat Tencent dieses Mal bei Parametern, Benchmarks, internen Blindtests und sogar der gesamten Preisgestaltung den Spitzenwettbewerbsbereich erreicht.

Damit stellt sich die Frage:

Zwischen Hy3 und Hy4 liegt nur eine Generation. Welche "Magie" hat Yao Shunyu eigentlich, die das Modell so große Fortschritte machen lässt?

Tencent hat den richtigen Weg zum Aufholen gefunden

Dass Tencent zwischen zwei Modellgenerationen schnell aufgeholt hat, hängt auch mit der Neuorganisation der Modellentwicklung zusammen.

Dieses Mal hat Tencent nicht nur das Modellteam dazu veranlasst, Daten für öffentliche Ranglisten vorzubereiten. Die hochwertigen Trainingsdaten von Hy4 wurden zudem gemeinsam von internen Fachexperten aus Bereichen wie Software-Engineering, Spiele, Finanzen und Sicherheit von Tencent erstellt.

Die Aufgaben, die diese Abteilungen dem Modell stellen, sind wertvoller als die einfache Anforderung "schreibe einen Codeabschnitt".

Das Software-Engineering-Team verlangt von ihm, lange Code-Repositories zu verstehen und Planung, Debugging und Verifizierung abzuschließen; das Finanzteam lässt es mehrere Dokumente und komplexe Daten analysieren; das Spielteam testet, ob es ausgehend von einer einzigen Anforderung die Engine aufrufen kann, um einen Prototyp zu erstellen, der weiter bearbeitet werden kann.

Gemeinsame Erstellung von Daten innerhalb von Tencent Quelle: Offizielles Konto von Hunyuan

Wenn diese Anforderungen schließlich in WorkBuddy übernommen werden, entwickeln sich die Aufgaben zu Materialzusammenstellungen, Tabellenanalysen und PPT-Erstellungen.

Daher wurden die internen Geschäftsbereiche von Tencent zu den ersten Testnutzern von Hunyuan. An welchem Schritt das Modell hängen bleibt, welche Art von Dateien es nicht versteht und warum es beim Aufrufen von Tools abbricht, all das kann zu Problemen werden, die in der nächsten Trainings- und Bewertungsrunde gelöst werden müssen.

Das ist das Co-Design, das Yao Shunyu immer betont hat.

Das Modell wird zuerst in CodeBuddy und WorkBuddy eingesetzt, um echte Aufgaben zu erledigen. Die Produktseite erfasst die Nutzungsweisen und Fehlerfälle der Nutzer und gibt diese Rückmeldungen dann an die Daten-, Trainings- und Bewertungsbereiche zurück. Bereits in der Hy3-Ära hat Tencent diesen Kreislauf zwischen Modell und Produkt in Gang gesetzt.

Der Produkt-Daten-Kreislauf von Tencent

Darüber hinaus gibt es bei Hy4 noch eine weitere Entwicklungslinie, das sogenannte "Selbstevolution".

Nach Angaben von Tencent hat Hy4 bereits damit begonnen, an der automatischen Optimierung von Trainingsmethoden für große Modelle, Datenstrategien, Bewertungssystemen und unterliegenden Operatoren mitzuwirken. Das Modell kann Lösungen vorschlagen, Experimente durchführen und die Ergebnisse anschließend weiter modifizieren; die Codes, Protokolle und Rückmeldungen aus den Experimenten werden wiederum zur Grundlage für die nächsten Versuche.

Schließlich sorgen WorkBuddy und CodeBuddy dafür, dass das Modell echte Anforderungen und Aufgaben erhält, und teilen dem Entwicklungsteam mit, wo das Modell nicht gut funktioniert. Die automatisierte Entwicklung, an der Hy4 beteiligt ist, hilft dem Team, Lösungen schneller auszuprobieren.

Ersteres liefert die Probleme, Letzteres beschleunigt die Lösung.

Darüber hinaus hat Tencent im Juli dieses Jahres die Abteilung für das Hunyuan-Großsprachmodell und die Abteilung für Multimodal-Modelle zur Abteilung für Basismodelle zusammengelegt, die von Yao Shunyu einheitlich verwaltet wird. Die Sprach-, Multimodal- und KI-Infra-Fähigkeiten, die bisher separat vorangetrieben wurden, werden nun in einheitliches Entwicklungssystem konzentriert.

Daher bedeutet der aktuelle Boom von Hy4 nicht nur eine bessere Ergebnisliste.

Positive Bewertungen der Nutzer für Hy4

Tencent hat interne Experten, echte Produkte, Modelltrainings und Infrastruktur schrittweise zu einer iterativen Kette verbunden, was dem nachfolgenden Modelltraining eine solide Grundlage schafft.

Tencent hat endlich einen Weg zum Aufholen gefunden, der besser zu ihm passt.

Tencent ist endlich "an Bord gegangen"

Auf der Hauptversammlung von Tencent im Mai dieses Jahres hat Ma Huateng einmal gesagt:

"Vor einem Jahr dachten wir, wir wären bereits an Bord, aber später stellten wir fest, dass das Schiff leckte. Wir wechselten dann zu einem neuen Schiff, und jetzt haben wir das Gefühl, darauf stehen zu können, auch wenn wir noch nicht sitzen können. Wir hoffen nur, dass die Geschwindigkeit des Schiffs noch etwas höher wird."

Nach der Veröffentlichung von Hy4 Preview hält die hohe Beliebtheit an, und es scheint, dass das Schiff, auf dem man stehen kann und das schnell fährt, das Ma Huateng wollte, nun da ist.

Das einzige Problem ist, dass es viel zu viele Menschen gibt, die an Bord gehen wollen.

Die Beliebtheit ist extrem hoch

Vielleicht ist das das Schicksal beliebter inländischer Modelle. Das erinnert stark an den Anfang des Jahres 2025, als DeepSeek-R1 plötzlich boomte und die Meldung "Server ausgelastet, bitte versuchen Sie es später noch