StartseiteArtikel

Büro-Agenten erleben einen enormen Hype, der Modellwettbewerb tritt in die nächste Phase ein.

极客公园2026-08-05 08:00
Der Kampf um die KI-Modelle ist letzten Endes ein Kampf um Zugangsportale und Ökosysteme.

Der Kampf der Modelle ist letztlich ein Kampf um Zugangspunkte und Ökosysteme.

Von Juni bis Anfang August dieses Jahres, in weniger als 60 Tagen, ist etwas fast gleichzeitig bei den neuen BAT-Unternehmen passiert.

Zuerst im Juni leitete Alibaba die umfassende Integration der Produktlinien und Fähigkeiten seiner internen Agenten ein. Am 3. August kündigte es offiziell das Qwen3.8-Modell mit stark verbesserten Fähigkeiten im Programmieren (Coding) und professionellen Büroarbeiten (Cowork) an und fusionierte gleichzeitig die drei intern entwickelten Agentenprodukte QoderWork, Wukong und MuleRun zu einem einheitlichen Agentenprodukt „Qianwen Office“.

Kurz darauf, am 20. Juli, startete Tencent die Geschäftsintegration, wobei die zugehörigen Geschäfte und Teams von QClaw in das System von WorkBuddy eingegliedert wurden.

Zehn Tage später, am 30. Juli, gab ByteDance bekannt, dass das gesamte Produktteam von Feishu in Doubao eingegliedert wird, und Xie Xin, Leiter von Feishu, berichtet nun an Zhao Qi, Leiter von Doubao.

Mit unterschiedlichen Organisationsstrukturen, unterschiedlichen Produktvoraussetzungen und dominanten Märkten haben die drei führenden Internetunternehmen Chinas zur ähnlichen Zeit ähnliche Integrationsentscheidungen getroffen. Das ist kaum ein Zufall.

Die plausiblere Schlussfolgerung ist, dass diese Integration eine unvermeidliche Wahl ist, nachdem die KI-Industrie die Erprobungsphase durchlaufen hat und in die Phase des Wettbewerbs um Zugangspunkte eintritt: In der Vergangenheit mussten große Konzerne mehrere Teams einsetzen, um verschiedene Wege wie Desktop-Bedienung, Cloud-Ausführung und Unternehmenszusammenarbeit zu validieren. Nun sind die Hauptproduktformen allmählich klar geworden, und der Wettbewerb verlagert sich von der Frage, ob man einen Agenten entwickeln kann, hin zu der Frage, wer der einheitliche Zugangspunkt für Nutzer und Unternehmen werden kann.

Als das neueste Produkt, das in dieser Konsolidierungsphase eingeführt wurde, ist Qianwen Office auch das geeignetste Beispiel, um die Veränderungen in der Branche zu beobachten.

Als eine phasenweise Fähigkeitsumstrukturierung von Alibaba bündelt es die bisher verstreuten Errungenschaften in Modellen, Desktop, Cloud und Unternehmenszusammenarbeit in einem neuen unabhängigen Produkt.

Gleichzeitig verkörpert es auch mehrere der entscheidendsten Probleme im Wettbewerb um Unternehmensagenten: Warum das interne Wettbewerbsmodell gerade jetzt endet, warum Unternehmens-Instant-Messaging und Cloud zu den zugrunde liegenden Vermögenswerten von Agenten werden und wie Modelle, Produkte und echte Aufgaben einen gemeinsam evolvierenden Kreislauf bilden.

Wer es versteht, versteht den eigentlichen Wendepunkt des unternehmensweiten Agentenwettbewerbs.

01 Warum große Konzerne gleichzeitig ihre Wege konsolidieren

Warum haben große Konzerne fast gleichzeitig damit begonnen, ihre Agentenprodukte zu integrieren?

Nehmen wir Alibaba als Beispiel: Anfang dieses Jahres war es sinnvoll, QoderWork, Wukong und MuleRun gleichzeitig zu betreiben.

Die drei Produkte repräsentieren drei unterschiedliche Annahmen.

QoderWork läuft auf dem Computer des Nutzers und ist gut darin, lokale Dateien zu lesen und zu verarbeiten. Wukong versucht, in die Unternehmenskonten, Berechtigungen und Anwendungssysteme von DingTalk einzudringen. MuleRun läuft von Anfang an in der Cloud, kann Aufgaben über lange Zeit ausführen und ist früher in den Überseemarkt eingetreten. Bis Mai dieses Jahres hat es bereits Unternehmen und Nutzer in 43 Ländern und Regionen bedient, wobei der Anteil der Nutzer mit monatlichen Zahlungen von über 200 US-Dollar 34 % erreicht hat.

Wenn der Markt noch nicht ausgereift ist, können drei Teams, die jeweils lokale Ausführung, Unternehmenszusammenarbeit und Cloud-Betrieb testen, Alibaba helfen, die Richtung schneller zu finden.

Das Problem ist, dass die Testphase nicht ewig andauert. Im ersten Halbjahr dieses Jahres hat sich das Verständnis der Branche für allgemeine Agenten deutlich verändert.

Anthropic stellte fest, dass viele nicht technische Mitarbeiter die gewöhnliche Chat-Oberfläche umgehen und Claude Code direkt verwenden, um Dateien zu organisieren, Tabellen zu verarbeiten und mehrstufige Wissensarbeiten zu erledigen. Daraufhin wurde Cowork entwickelt: Es behält die Aufgabenausführungsfähigkeit von Claude Code bei, verwendet aber eine Interaktionsmethode, die für gewöhnliche Wissensarbeiter besser geeignet ist.

Ähnliche Veränderungen sind auch bei seinem alten Rivalen OpenAI aufgetreten. Bei OpenAI bearbeitet ein Teil der Nutzer Programmierprobleme in ChatGPT, während ein anderer Teil der Nutzer nicht programmierbezogene Aufgaben wie Berichte, Bild- und Datenverarbeitung in Codex erledigt. Die ursprünglich klaren Produktgrenzen zwischen Chat, Programmierung und Büroarbeit werden von den Nutzern aktiv durchbrochen. Ende Juli hat OpenAI Codex, das fast ein Jahr lang unabhängig betrieben wurde, in den Desktop-Client von ChatGPT integriert, wodurch Chat, Work und Codex zu einer Einheit verschmolzen sind.

Die Maßnahme von Qianwen Office ist ebenfalls eine Neukombination der Fähigkeiten, die durch die drei Experimente von Alibaba validiert wurden: Die Desktop-Ebene erbt die Fähigkeiten für lokale Dateien und Computerbedienung, die Cloud-Ebene übernimmt Langzeitaufgaben, Ressourcenplanung und multimodale Generierung, und die Unternehmensebene dringt weiter in Organisationsidentitäten, Berechtigungen und Geschäftssysteme ein. Die bisher verstreuten Produktfähigkeiten und Feedbackdaten werden in einem Zugangspunkt, einem einheitlichen Ingenieursystem und einem iterativen Kreislauf gebündelt.

Laut Praxistest von Qianwen Office kann es nicht nur schnell professionelle Berichte nach Anforderungen erstellen, sondern auch direkt mit DingTalk verbunden werden, um diese an die Chat-Oberfläche zu senden.

Nutzer stimmen spontan mit ihrem Verhalten ab, und der Markt lässt großen Konzernen kaum noch Zeit, um verstreute Experimente fortzusetzen.

Der Bericht von Analysys für das zweite Quartal zeigt, dass im Juni 2026 die gesamte Zugriffszahl von 17 gängigen KI-Büroagenten für Desktops bereits über 60 Millionen Mal lag. Die Produkte der Tencent-Gruppe, der ByteDance-Gruppe und der Alibaba-Gruppe summieren sich auf etwa 56,22 Millionen, sodass der Markt für andere Teilnehmer weniger als 5 Millionen beträgt.

Die technischen Wege werden allmählich festgelegt, und der Head-Effekt tritt ein. Zu diesem Zeitpunkt wird die Verstreuung zu einer Belastung für die Ressourcenverteilung.

Auf der Ingenieursebene ist es genauso. In der Vergangenheit musste jedes der drei Teams bei jeder Aktualisierung des Modells die Aufgabenplanung, Kontextverwaltung, Werkzeugaufruf, Fehlernachbearbeitung und Berechtigungssteuerung neu anpassen, was im Wesentlichen unnötige Doppelarbeit darstellt.

„Qianwen Office“ ist das Ergebnis, das in diesem wettbewerbsintensiven Umfeld entstanden ist.

02 Der Wendepunkt für Unternehmensagenten

Die meisten allgemeinen Büroagenten auf dem Markt lösen derzeit vor allem Probleme der individuellen Produktivität. Sie können Dateien auf dem Computer des Nutzers lesen, persönliche Dokumente analysieren, historische Chats verstehen, persönliche Zeitpläne organisieren und begrenzte externe Werkzeuge nach den Berechtigungen aufrufen, die der Nutzer selbst hat.

Aber das sind hauptsächlich individuelle Kontexte. Die Überlagerung individueller Kontexte ergibt noch keinen Unternehmenskontext. Die Summe der Effizienz aller Mitarbeiter im Unternehmen ergibt noch keine Unternehmenseffizienz. Wenn jeder Mitarbeiter mit einem klügeren persönlichen Assistenten ausgestattet wird, kann die lokale Leistung verbessert werden, aber es ist nicht unbedingt möglich, den gesamten Informationsfluss, die Aufgabenkoordination und die Effizienz der Umwandlung persönlicher Ergebnisse in organisatorische Handlungen und Ergebnisse zu verbessern.

Unternehmen stehen vor anderen Arten von Problemen.

Ein Unternehmen ist keine einfache Ansammlung einzelner Konten. Die Summe aller Dateien, Chats und Aufgaben der Mitarbeiter wird nicht automatisch zur Betriebsweise des Unternehmens. Dieselbe Datei kann für einen persönlichen Agenten nur ein zu zusammenfassendes Material sein; für einen Unternehmensagenten geht es darüber hinaus darum, wer sie lesen darf, wer sie bestätigen muss, an welche Abteilungen die Schlussfolgerung weitergegeben werden soll und wer die nachfolgenden Aufgaben genehmigen muss.

Das ist der grundlegendste Unterschied zwischen unternehmensweiten Agenten und persönlichen Büroagenten. Es ist auch eine kognitive Grundlage für die offensichtlichen Unterschiede im Handlungslogik großer Konzerne in China und den USA unter ähnlichen Integrationsbedingungen.

OpenAI und Anthropic konzentrieren sich hauptsächlich darauf, die Zugangspunkte für Chat, Programmierung und Desktop-Ausführung zu verschmelzen. Der Integrationsbereich chinesischer Großkonzerne umfasst Unternehmenszusammenarbeit-Software wie DingTalk und Feishu, und gleichzeitig wird die Cloud zu einem Teil der grundlegenden Fähigkeiten von Agenten.

Bei der internen Produktkoordination in Unternehmen wird die Produktlinie von Doubao gleichzeitig mit Feishu integriert und tief mit Volcano Engine verbunden. Qianwen Office fusionierte Wukong, das zuvor hauptsächlich für die DingTalk-Szenarien entwickelt wurde, und erbt gleichzeitig die umfassenden Ressourcen von Alibaba Cloud in den letzten Jahren auf dem Markt für unternehmensweite Dienstleistungen in Bezug auf Branchenkenntnisse, Datenverwaltung und Ressourcenplanung.

Das heißt, die Agenten beginnen, Instant-Messaging-Dienste und Cloud zu absorbieren und sie zu einer grundlegenden Infrastruktur zu machen.

Die Bedeutung der Cloud als Kerninfrastruktur von Agenten braucht keine weitere Erläuterung. Hier werfen wir einen Blick auf die Integrationslogik von Instant-Messaging-Diensten.

Herkömmliche Bürosoftware unterteilt die Welt nach Funktionen: E-Mails dienen der Kommunikation, Dokumente dienen dem Schreiben, Tabellen dienen der Datenverarbeitung… Aber in der realen Welt benötigen Nutzer eine Kombination verschiedener Werkzeugfähigkeiten, um ein Ziel zu erreichen, und das gilt auch für Agenten.

Aus diesem Grund wird die Instant-Messaging-Software im Stil von DingTalk, die in den letzten zehn Jahren Kommunikation, Mitarbeiteridentitäten, Organisationsbeziehungen, Kooperationsnetzwerke, Dateien, Besprechungen, Genehmigungen, Berechtigungen und Verbindungen zu verschiedenen Unternehmensanwendungen integriert hat, als die Software mit den meisten Funktionen und vollständigem Organisationskontext zwangsläufig zur grundlegendsten Fähigkeitsunterstützung im Zeitalter der Agenten.

Ich habe eine dreiköpfige Diskussion über Themen in einer selbst erstellten DingTalk-Gruppe simuliert und Qianwen Office gebeten, die Diskussionspunkte zusammenzufassen und die anstehenden Aufgaben zu extrahieren. Es hat nicht nur fünf anstehende Aufgaben aus dem Chat erkannt, für jede Aufgabe den zuständigen Mitarbeiter korrekt zugewiesen, sondern die dringendste Aufgabe mit der Priorität „hoch“ und dem Status „bald fällig“ markiert und direkt in das Aufgabenverwaltungssystem von DingTalk geschrieben.

Natürlich ist es für einen externen Drittagenten nicht schwierig, Gruppen-Nachrichten über einen Konnektor zu lesen, eine Zusammenfassung zu erstellen oder Investitionsforschung, Webseitenerstellung oder Tabellenverarbeitung durchzuführen. Das wirklich Schwierige ist das Zurückschreiben: Aufgaben erstellen, Zeitpläne anpassen, E-Mails senden, Genehmigungen einreichen oder Aufgaben der richtigen Person zuweisen.

Das Lesen erfordert nur eine Schnittstelle, während das Zurückschreiben ein höheres Vertrauensniveau erfordert. Unternehmen müssen sicherstellen, was der Agent sehen darf, für wen er handeln kann, welche Schritte genehmigt werden müssen und wie Fehler nachverfolgt und rückgängig gemacht werden können. Aus dieser Sicht ist das, was DingTalk in den letzten zehn Jahren für Agenten angesammelt hat, nicht nur Werkzeuge, sondern auch ein Schutzgraben aus Vertrauen und unternehmensweitem Kontext.

03 Modelle und Agenten bilden ein intelligentes Schwungrad

Wenn man den Blick weiter auf die Spitzenakteure im Inland richtet, ist leicht zu erkennen, dass Alibaba eine seltene Bedingung in diesem Wettbewerb hat: Es verfügt gleichzeitig über erstklassige große Modelle, eine Unternehmenszusammenarbeitsplattform und Cloud-Computing-Infrastruktur.

Aber die Tatsache, dass sowohl Modelle als auch Anwendungen in eigener Hand sind, führt nicht automatisch zu Vorteilen. Diese Kombination ist nur dann wirklich wertvoll, wenn Modelle und Agenten sich gegenseitig Feedback geben können.

Daher sehen wir, dass Alibaba am selben Tag der Einführung von Qianwen Office leise das Qwen3.8-Modell veröffentlicht hat, das stark verbesserte Fähigkeiten im Programmieren (Coding) und professionellen Büroarbeiten (Cowork) aufweist.

Die dahinterstehende Logik ist, dass Agenten in der Produktionsumgebung Feedback liefern können, das wertvoller ist als Chat-Protokolle, und Modelle wiederum die grundlegenden Probleme von Agenten ein für alle Mal lösen können.

Viele Probleme, die in vielen Agentenprodukten auf der Anwendungsebene aufzutreten scheinen, haben ihre Wurzeln tatsächlich auf der Modellebene. In der Vergangenheit konnte das Produktteam eine Aufrufregel hinzufügen, um das Problem zu lösen, wenn das Modell das falsche Werkzeug auswählte; wenn das Modell die ursprünglichen Anforderungen in einer Langzeitaufgabe vergaß, konnte das Team einen zusätzlichen Workflow darüber legen. Diese Anwendungsreparaturen können die Fehlerquote objektiv senken, aber sie verbessern nicht das Urteils- und Erkenntnisvermögen des Modells selbst.

Daher können wir sehen, dass OpenAI bei der Einführung von Codex nicht nur das allgemeine Modell mit einem Code-Editor verbunden hat, sondern codex-1 für Softwareentwicklungsaufgaben trainiert hat. Es verwendet echte Programmieraufgaben für verstärktes Lernen, kann Dateien lesen und ändern, Tests ausführen und die Ergebnisse basierend auf den Testergebnissen weiter anpassen, bis es ein erfolgreiches Ergebnis erhält. Sein Auftreten hat zahlreiche Probleme von Entwicklern bei Programmieraufgaben auf einmal verbessert und wurde zum Schlüsselfaktor für OpenAys Aufholjagd im Bereich der Programmierung.

Modelle lösen die grundlegenden Fähigkeitsprobleme von Agenten, und Agenten können den Modellen vollständigeres