StartseiteArtikel

Alibaba plant eine Investition von 300 Millionen US-Dollar, um sich das sogenannte „Bewertungsrecht für Prüfungsarbeiten“ zu sichern: In der zweiten Hälfte der Entwicklung großer KI-Modelle bestimmt derjenige, der den Standard für „gut“ definiert, die Entwicklungsrichtung der nächsten Generation.

Tao财经2026-09-28 17:14
"Das Recht zur Benotung von Prüfungsarbeiten": Wer definiert, was gut ist, bestimmt die nächste Generation

Medienberichten zufolge erwägt Alibaba die Führung einer Investitionsrunde von rund 300 Millionen US-Dollar in UniPat, ein Unternehmen für KI-Evaluierung und Nachtraining, mit einer Bewertung von etwa 2,5 Milliarden US-Dollar. Tencent und der Altaktionär HSG sollen ebenfalls Interesse an einer Beteiligung gezeigt haben. Zuerst muss klar festgehalten werden: Diese Transaktion befindet sich noch in der Verhandlungsphase. Betrag, Bewertung, Bedingungen und die endgültige Liste der Investitionsparteien sind noch nicht festgelegt, weit davon entfernt, "abgeschlossen" zu sein, und können jederzeit Änderungen unterliegen.

Doch wichtiger als die Transaktion selbst ist das Problem, auf das das Unternehmen UniPat hinweist. Es wurde Ende 2025 gegründet. Sein Gründer Li Kuan, geboren in den 1990er Jahren, absolvierte vor der Unternehmensgründung ein Praktikum im Tongyi-Labor von Alibaba, beteiligte sich am Tongyi DeepResearch-Projekt und arbeitete an Nachtrainingsanalysen, Datensynthese und verstärktem Lernen. Das Team hat an komplexen Inferenzforschungen wie WebSailor gearbeitet und eine Reihe von Evaluationsdatensätzen wie BabyVision, SaaS-Bench, EvoCode-Bench und Terminal-X veröffentlicht, die sich auf Software-Engineering-Agenten, Browseroperationen und langwierige Prozessaufgaben für Unternehmens-SaaS konzentrieren.

Das Unternehmen einfach als "KI-Prüfer" zu bezeichnen, würde es unterschätzen. Seine eigentliche Position ist eine Ebene, die in der zweiten Phase der Entwicklung großer Modelle am leichtesten übersehen wird: Nachdem das Modell eine Frage beantwortet hat, wer beurteilt das Ergebnis, wie werden Fehler korrigiert und wie werden diese Korrekturen zu Trainingssignalen für die nächste Runde umgewandelt. Diese Ebene ist genau der Bereich, der in der gesamten Branche derzeit am meisten fehlt und am leichtesten von Kapital falsch eingeschätzt wird.

Nachdem das Modell die Frage beantwortet hat – wer beurteilt das Ergebnis?

In der ersten Phase der Entwicklung großer Modelle standen Parameter, Rechenleistung und Korpora im Vordergrund. Die Qualität eines Modells wurde anhand von Benchmarks gemessen: Man gibt eine Frage ein, erhält eine Antwort und berechnet die Genauigkeit. Dieses System reichte in der Ära des "Fragebeantwortens" aus und war einfach zu handhaben.

Doch im Zeitalter der Agenten verliert es seine Gültigkeit. Denn die Aufgaben eines Agenten bestehen nicht mehr aus einer einzelnen Frage, sondern aus einer Kette von Aktionen: Verstehen der Umgebung, Planen von Schritten, Aufrufen von Tools, Ändern von Codes, Abfragen von Datenbanken, Behandeln von Ausnahmen, Rollback und Übermitteln von Ergebnissen. Wenn einer von Dutzenden Zwischenschritten fehlschlägt, nützt auch das schönste Endergebnis nichts. Herkömmliche statische Fragendatensätze können nicht messen, "ob die Aufgabe wirklich erledigt werden kann".

Der erste Bereich, in dem UniPat tätig ist, ist die "produktionsreife Evaluierung": Es wird nicht abgefragt, ob das Modell "etwas weiß", sondern es wird in eine Umgebung gesteckt, die der Realität nahe kommt, um zu prüfen, ob es die Aufgabe abschließen kann. SaaS-Bench packt 23 echte Open-Source-SaaS-Systeme in Docker und führt 106 anwendungsübergreifende Langzeitprozessaufgaben aus. EvoCode-Bench prüft die kontinuierliche Entwicklung unter mehrfachen Anforderungsänderungen. Terminal-X testet komplexe Ingenieuraufgaben und Versionsaktualisierungen. Dies bedeutet, die Evaluierung von der "Prüfungsbewertung" auf eine "praxisnahe Übung" zu heben.

Ein anschauliches Beispiel: Bei einem herkömmlichen Benchmark für eine Mathematikaufgabe gilt das Modell als gut, wenn es die richtige Antwort gibt. Im Agenten-Szenario hingegen erhält das Modell die Aufgabe "Ändere die Bestellanfrage eines Kunden in einem ERP-System". Es muss zuerst die Anforderung verstehen, dann die richtige Seite finden, die richtigen Felder ändern, speichern und sicherstellen, dass keine anderen Daten beschädigt werden. Wenn einer der Zwischenschritte unterbrochen wird, schlägt die Aufgabe fehl – selbst wenn die endgültige Ausgabe perfekt formuliert ist. Aus diesem Grund reicht die "fragetypische Evaluierung" im Zeitalter der Agenten nicht mehr aus: Sie misst, "ob das Modell etwas weiß", während Unternehmen tatsächlich daran interessiert sind, "ob das Modell die Aufgabe erledigen kann".

Doch der wirklich wertvolle Teil liegt in der zweiten Ebene.

Nach Abschluss der Evaluierung sind die wertvollsten Ergebnisse nicht die Punktzahlen, sondern die Fehlerverläufe: Welcher Entscheidungsschritt falsch war, warum der Prüfer das Ergebnis abgelehnt hat, wie das menschliche Bewertungsschema Punkte abzieht und ob ein alternativer Weg zum Erfolg führt. Diese Verläufe, Zwischenzustände, Prüfsignale und Präferenzmarkierungen können direkt für SFT, Belohnungsmodelle oder verstärktes Lernen verwendet werden.

So entsteht ein geschlossener Kreislauf: Evaluierung identifiziert Schwachstellen → Extrahiert Fehlerverläufe → Markiert Bewertungsschemata und Präferenzen → Synthetisiert Trainingsdaten → Aktualisiert Strategien durch Nachtraining → Führt erneute Evaluierung durch → Findet weitere Schwachstellen. Was UniPat anbietet, ist keine einmalige Prüfung, sondern eine Rückkopplungsschleife, durch die sich das Modell kontinuierlich verbessert. Die Berichte erwähnen auch, dass die Zusammenarbeit mit Alibaba sich hauptsächlich auf Daten für das Nachtraining durch verstärktes Lernen konzentriert: Zuerst werden kostengünstige Experimente an kleineren Modellen durchgeführt, um wirksame Lösungen zu ermitteln, bevor diese skaliert werden. Diese Strategie "zuerst klein, dann groß" ist der praktischste Weg im Geschäft mit Nachtrainingsdaten: Fehler werden mit geringen Kosten getestet, bevor das erfolgreiche Verfahren skaliert wird.

"Das Recht zur Prüfungsbewertung": Wer definiert "gut", bestimmt die nächste Generation von Modellen

Der Begriff "Recht zur Prüfungsbewertung" bedeutet korrekt übersetzt die Kontrolle über drei Dinge.

Das erste ist das Recht zur Aufgabendefinition. Was bedeutet "Aufgabe abgeschlossen"? Ist das Endergebnis im JSON-Format korrekt, oder sind die Zustände über verschiedene Systeme hinweg konsistent? Lässt sich der Code ausführen, oder bestehen die Tests ohne die vorhandene Logik zu beeinträchtigen? Wie die Aufgaben gestaltet werden, bestimmt, in welche Richtung sich die Modelle entwickeln. Die Person, die die Fragen stellt, bestimmt im Grunde die Ausrichtung der Modelle.

Das zweite ist das Recht auf die Bewertungsstandards. Wird ein regelbasierter Prüfer verwendet, oder ein Bewertungsschema in Kombination mit menschlichen Experten? Wie werden Punkte für den Prozess vergeben? Sollen Sicherheit, Compliance, Kosten und Rollback-Fähigkeit in die Zielfunktion aufgenommen werden? Eine Änderung der Standards führt dazu, dass die Rangfolge der Modellqualität vollständig neu definiert wird.

Das dritte ist das Recht auf Rückkopplungsdaten. Das am meisten fehlende Element ist nicht "Frage-Antwort", sondern "Umgebung-Aktion-Ergebnis-Belohnung". Wer in der Lage ist, nachweisbare Verläufe stabil zu erzeugen, kontrolliert die Angebotsseite des Nachtrainings.

Daher ist das "Recht zur Prüfungsbewertung" gleichzusetzen mit Bewertungsstandards + Belohnungssignalen + Quelle von Trainingsdaten. Sein Wert ergibt sich nicht daraus, wie maßgeblich ein bestimmter Benchmark ist, sondern daraus, dass Modelle ausgetauscht werden können, die Rückkopplungsebene aber wiederholt verwendet wird. Wer die Definitionsgewalt darüber hat, "was als gut gilt", nimmt Einfluss auf die Richtung der Entwicklung der nächsten Generation von Modellen.

Diese drei Elemente sind eng miteinander verknüpft. Die Aufgabendefinition bestimmt, wofür das Modell trainiert wird, die Bewertungsstandards bestimmen, was das Modell zu optimieren trainiert wird, und die Rückkopplungsdaten bestimmen, mit welchen Signalen das Modell verbessert wird. Ein Unternehmen, das alle drei Elemente beherrscht, hält die Antwort auf die ultimative Frage "Was ist gut?" in der Hand. In der zweiten Phase der Entwicklung großer Modelle ist diese Antwort viel wertvoller als die Frage "Wer hat mehr Parameter" – denn Parameter können erweitert werden und Rechenleistung kann gekauft werden, aber die Definitionsgewalt über "gut" gibt es nur einmal.

Alibaba und Tencent investieren gemeinsam – ein seltenes Ereignis, das mit drei unumgänglichen Hürden verbunden ist

Die Logik von Alibaba ist am direktesten. Tongyi benötigt Nachtraining, und die Unternehmenskunden von Alibaba Cloud brauchen Prüfverfahren. Unternehmen interessieren sich nicht für die Rangfolge der Modelle in öffentlichen Ranglisten. Entscheidend für den Einkauf ist, ob das Modell in der Lage ist, Bestellanfragen im ERP-System zu ändern, Arbeitsaufträge im Kundenservicesystem abzuschließen und Komponententests im Entwicklungsprozess durchzuführen. Wenn Fähigkeiten wie die von UniPat in die Lieferstandards von Alibaba Cloud integriert werden, hält Alibaba das Maß für die Beurteilung "ob das Modell funktioniert" in der eigenen Hand. Hinzu kommt die Vertrauenskette ehemaliger Mitarbeiter des Tongyi-Labors, die die Kosten für die technische Ausrichtung senkt.

Wenn Tencent mitinvestiert, folgt es einer anderen Logik: Es setzt nicht unbedingt darauf, dass ein bestimmter Benchmark von UniPat dauerhaft erfolgreich ist, sondern auf eine "modellneutrale" Rückkopplungsinfrastruktur. Für WeChat, WeCom, Werbung und Kundenservices muss unabhängig davon, ob das Hunyuan-Modell oder externe Modelle verwendet werden, immer die Frage beantwortet werden: "Ist der Agent stabil und funktionieren die Prozesse reibungslos?" Eine Investition in die Evaluierungsebene ist grundlegender als die Wette auf ein einzelnes Modell – Modelle werden ausgetauscht, aber für die "Prüfung" wird immer ein Maßstab benötigt.

Dass Alibaba und Tencent gemeinsam investieren, ist selten. Das Signal liegt nicht in persönlichen Beziehungen, sondern in einem Konsens: Evaluierung und Nachtrainingsdaten sind keine kleinen Zusatzfunktionen, sondern Voraussetzungen für den Einkauf im Zeitalter der Agenten.

Doch außerhalb des geschlossenen Kreislaufs gibt es drei unumgängliche Hürden.

Die erste Hürde ist die Neutralität

Alibaba führt die Investition an, Tencent beteiligt sich, aber die Kunden umfassen auch andere Hersteller großer Modelle. Daher wird die Glaubwürdigkeit natürlich in Frage gestellt: Wird das Bewertungsschema für das eigene Modell gelockert? Scale AI dient als warnendes Beispiel. UniPat muss entweder die Prüfer transparent gestalten oder die kommerzielle Evaluierung von den öffentlichen Benchmarks trennen. Andernfalls wird der "Prüfer" früher oder später als "eigener Trainer" angezweifelt. Dies ist eine besonders unumgängliche Hürde im chinesischen KI-Bereich – denn Kunden und Aktionäre sind dieselben großen Konzerne.

Die zweite Hürde ist das Einkommen

Derzeit sind die Evaluationsdatensätze und der technische Ruf bestätigt, aber nachhaltige Verträge und die Bruttomargenstruktur sind ungewiss. Der Preis für maßgeschneiderte Nachtrainingsdaten ist hoch, aber dies hängt von den Budgets der führenden Forschungslabore ab. Sobald die Ausgaben der Spitzenlabore gekürzt werden, schwankt das Einkommen.

Die dritte Hürde ist die Ingenieurstechnik

Die Wartungskosten für echte SaaS-Umgebungen, Browserumgebungen und Aufrufe mehrerer Tools sind extrem hoch. Es ist normal, dass Benchmarks übertroffen werden. Fehlende Urteile der Prüfer führen direkt zu einer Verunreinigung der Belohnungssignale. Ob die Evaluierung zu einer aufrufbaren RL-Umgebung umgewandelt werden kann, anstatt nach der Veröffentlichung der Ranglisten veraltet zu sein, bestimmt, ob das Unternehmen letztendlich ein Datenunternehmen oder ein Infrastrukturunternehmen wird.

Diese drei Hürden sind drei Seiten derselben Sache: UniPat möchte eine "neutrale Infrastruktur" aufbauen. Aber einer seiner Großaktionäre ist Alibaba, ein Hersteller von großen Modellen. Sein Einkommen hängt von den Budgets dieser Modellanbieter ab, und seine Ingenieurstechnik muss ständig mit der Weiterentwicklung der Modelle Schritt halten. Ein Unternehmen, das als neutraler Schiedsrichter fungieren möchte, muss gleichzeitig die Teilnehmer zufriedenstellen, von ihnen leben und schneller laufen als sie. Diese Situation bedeutet, dass jeder Schritt auf einem Drahtseil vollzogen wird.

Kehren wir zu der genannten Investition von 300 Millionen US-Dollar zurück. In der ersten Phase der Entwicklung großer Modelle wurde darum gekämpft, wer mehr Parameter, mehr GPUs und mehr Trainingsdaten hat. In der zweiten Phase geht es darum, nach der Entwicklung eines Modells zu wissen, ob es sich tatsächlich verbessert hat – und nicht nur in den Ranglisten. Das Vortraining nutzt die vorhandenen Daten des Internets, das Nachtraining basiert auf nachweisbaren Rückkopplungen. Wenn Agenten in der Praxis eingesetzt werden, ist die richtige Antwort keine einzelne Ausgabe mehr, sondern die Konsistenz der Zustände über lange Verläufe hinweg, erfolgreiche Tool-Nutzung, Ausnahmebehandlung und nachweisbare Geschäftsergebnisse.

Kapital konzentriert sich auf UniPat nicht wegen seines aktuellen Einkommens, sondern weil es darum geht, ob es das Rückkopplungsnervensystem für Modellunternehmen aufbauen kann: Modelle evaluieren, Schwachstellen identifizieren, Daten bereitstellen, Belohnungen geben und Modelle erneut trainieren. Unabhängig davon, ob die Transaktion abgeschlossen wird, ist die Richtung bereits klar: Die Teilnehmer werden weiterhin um Fortschritte kämpfen, und die "Prüfungsräume" werden ebenfalls umkämpft sein. Sobald die Kontrolle über die "Prüfungsräume" erlangt ist, werden die Regeln für das nächste Spiel nicht mehr von den Teilnehmern selbst festgelegt.