StartseiteArtikel

Heute steigt Gemini umfassend in den Wettbewerb im Bereich der KI-gestützten Büroanwendungen ein.

智东西2026-10-09 11:39
Derzeit befindet sich dieses Produkt noch in der Vorschauphase.

Bericht von Zhidongxi vom 9. Oktober: Heute früh hat Google Cloud auf der Konferenz Gemini at Work 2026 den unternehmensweiten universellen Agenten Gemini Agent offiziell vorgestellt. Das Ziel ist es, Aufgaben, die bisher verstreut in Bürosoftware, Datenplattformen und Entwicklungswerkzeugen liegen, an einen Agenten zu übergeben, der selbstständig planen, Werkzeuge aufrufen und Aufgaben kontinuierlich ausführen kann.

Die Fähigkeiten von Gemini Agent beschränken sich nicht mehr auf das Beantworten von Fragen oder das Generieren von Texten. Nutzer können das Endziel direkt in natürlicher Sprache beschreiben, sodass der Agent Aufgaben selbstständig zerlegen, Unternehmensdaten abrufen, Code schreiben und ausführen sowie Dokumente und multimediale Inhalte erstellen und komplexe Arbeiten in der Cloud kontinuierlich vorantreiben kann.

Bei großen Aufgaben kann er zudem mehrere Unteragenten zur koordinierten Ausführung organisieren und sogar als digitaler Kollege mit unabhängiger Unternehmensidentität an der Teamarbeit teilnehmen.

Nehmen Sie die Vorbereitung von PPT-Materialien als Beispiel: Nutzer können Gemini Agent direkt auffordern, eine PPT zu erstellen, ein Umsatzprognosemodell aufzubauen und ein passendes Werbevideo zu generieren. Der Agent muss das Ziel selbst verstehen, entsprechende Fähigkeiten, Unternehmensdaten und Generierungsmodelle abrufen, alle Schritte abschließen und die Ergebnisse an den Nutzer übergeben.

In diesem Prozess können Nutzer den Fortschritt weiterhin überprüfen, Anforderungen anpassen und entscheiden, ob sie kritische Vorgänge autorisieren, müssen aber nicht ständig vor dem Computer sitzen und jeden Ausführungsschritt schrittweise anleiten.

Um den Agenten in den täglichen Arbeitsablauf von Unternehmen zu integrieren, hat Google Cloud um Gemini Agent herum Fähigkeiten wie vierfache Gedächtnismechanismen, plattformübergreifende Zusammenarbeit, Zugriff auf Unternehmensdaten, sichere Isolierung und Kostenkontrolle ergänzt und ein Agentensystem gebildet, das Unternehmensaufgaben von der Anweisung bis zum Ausführungsergebnis vorantreiben kann.

Diese Produktform von Gemini Agent erinnert an inländische Produkte wie Doubao Work, Tencent WorkBuddy und Qiangwen Office von Alibaba: Sie sind ebenfalls Büro-Agentenplattformen und setzen auf „selbstständiges Zerlegen von Aufgaben, Aufrufen von Werkzeugen und kontinuierliches Vorantreiben von Arbeiten“.

Es ist jedoch zu beachten, dass Gemini Agent ein Enterprise-Produkt ist. Derzeit sind keine spezifischen offiziellen kommerziellen Termine und Preispläne bekanntgegeben worden, und die Vorschau steht nur ausgewählten Unternehmenskunden offen.

01.

Vom Gespräch zur Ausführung

Gemini Agent soll der universelle Kollege des Unternehmens werden

Bisher waren die KI-Fähigkeiten in Unternehmen normalerweise auf verschiedene Produkte verteilt: Einige nutzen Chatbots zum Verfassen von Texten, andere greifen auf Programmierassistenten zur Datenverarbeitung zurück, wieder andere nutzen KI-Funktionen in Bürosoftware zum Erstellen von Präsentationen.

Gemini Agent möchte diese Fähigkeiten in einem einheitlichen Agenten zusammenführen, sodass derselbe Agent unterschiedliche Aufgaben wie Wissensabfragen, Dokumentenerstellung, Codeausführung und multimediale Erstellung bearbeiten kann.

Was die Nutzungszugänge angeht, erstreckt Google Cloud diese auf Umgebungen wie Web, Mobilgeräte, Desktop und Befehlszeile, fördert die Zusammenarbeit des Agenten mit Arbeitswerkzeugen wie Google Workspace, Microsoft 365 und Slack und kann zudem über MCP auf andere Dienste zugreifen. Nutzer können den Agenten in ihrer täglichen Arbeitsumgebung aufrufen, statt jedes Mal den Hintergrund von Grund auf neu erläutern zu müssen.

Gemini Agent bietet zudem spezialisierte Versionen für die Finanzdienstleistungsbranche und die Rechtsbranche an, um Aufgaben in den entsprechenden Bereichen besser erledigen zu können.

Aufgaben mit langer Ausführungsdauer sind eine weitere Hürde, die Gemini Agent zu durchbrechen versucht.

Gewöhnliche Chatbots arbeiten normalerweise rund um das aktuelle Gespräch. Sobald Aufgaben mehrere Systeme, lange Ausführungszeiten oder wiederholte Überprüfungen erfordern, müssen Nutzer ständig nachverfolgen. Gemini Agent hingegen nutzt die Cloud-Laufzeitumgebung, um den Aufgabenstatus aufrechtzuerhalten, sodass einige komplexe Arbeiten weiter vorangetrieben werden können, nachdem der Nutzer den Computer verlassen hat.

Beispielsweise kann eine Datenanalyseaufgabe mehrere Phasen wie Datenextraktion, Codegenerierung, Modelltraining, Ergebnisprüfung und Berichtsaufbereitung durchlaufen. Der Agent muss nicht nach Abschluss jedes Schritts darauf warten, dass der Nutzer neue Anweisungen erteilt, sondern kann nach den festgelegten Zielen weiter ausführen und bei Schritten, die eine Beurteilung oder Autorisierung erfordern, die Beteiligung des Nutzers anfordern.

Google Cloud hat zudem einen dynamischen Multi-Agent-Koordinationsmechanismus für Gemini Agent eingeführt. Wenn das Aufgabenvolumen groß ist, kann das System die Arbeit an mehrere Unteragenten verteilen, die jeweils Schritte wie Datenverarbeitung, Codierung oder Inhaltserstellung bearbeiten, bevor die Ausführungsergebnisse zusammengefasst werden.

Neben der aktiven Initiierung von Aufgaben durch Mitarbeiter hat Google Cloud das Konzept des digitalen Kollegen (Coworker Agent) vorgeschlagen.

Diese Art von Agent kann über eine unabhängige Unternehmens-E-Mail, einen exklusiven Speicherplatz und eine Identität im Unternehmensverzeichnis verfügen und an der Zusammenarbeit bei E-Mails und Dokumenten teilnehmen. Mit entsprechenden Autorisierungsmechanismen kann er als Arbeitsidentität eines Teammitglieds dauerhafte Aufgaben übernehmen, statt nur zu arbeiten, wenn der Mitarbeiter das Chatfenster öffnet.

Beispielsweise können Unternehmen dem Agenten bestimmte periodische Aufgaben wie Datenaufbereitung, Informationszusammenfassung oder E-Mail-Vorbereitung übergeben, sodass er diese nach festgelegten Regeln kontinuierlich vorantreibt.

02.

Vierfaches Gedächtnis lässt den Agenten das Unternehmen verstehen

Unterstützt Modelle wie Gemini und Claude

Damit ein Agent langfristig an der Arbeit im Unternehmen teilnehmen kann, reicht es nicht aus, nur die aktuellen Anweisungen zu verstehen. Er muss sich zudem merken, welche Aufgabe der Nutzer gerade bearbeitet, wie das Unternehmen Geschäftsindikatoren definiert und wie bisherige Arbeitsabläufe normalerweise ausgeführt werden. Zu diesem Thema hat Google Cloud vier Arten von Gedächtnismechanismen vorgeschlagen und die Modellauswahl weiter von spezifischen Aufgaben entkoppelt.

Die vier Arten von Gedächtnis lösen jeweils unterschiedliche Probleme:

Die erste Art ist das Sitzungsgedächtnis (Session Memory), das den Kontext der aktuellen Aufgabe oder des aktuellen Gesprächs speichert, um zu vermeiden, dass Nutzer dasselbe wiederholt erläutern müssen.

Die zweite Art ist das semantische Gedächtnis (Semantic Memory), das Unternehmenswissen und Geschäftskonzepte organisiert und dem Agenten hilft, interne Unternehmensbegriffe, Datendefinitionen und Wissensbeziehungen zu verstehen.

Die dritte Art ist das prozedurale Gedächtnis (Procedural Memory), das Arbeitsabläufe und Ausführungsmethoden speichert, sodass der Agent definierte Aufgabenschritte wiederverwenden kann.

Die vierte Art ist das episodische Gedächtnis (Episodic Memory), das Erfahrungen und Ergebnisse im Zusammenhang mit vergangenen Aufgaben aufzeichnet und Referenzen für nachfolgende Arbeiten liefert.

Diese vier Arten von Gedächtnis speichern nicht einfach alle vergangenen Gespräche in einem größeren Kontextfenster, sondern versuchen, verschiedene Arten von Informationen zu unterscheiden, sodass der Agent den entsprechenden Hintergrund bei Bedarf abrufen kann.

Beispielsweise muss der Agent, wenn ein Mitarbeiter die Erstellung eines Verkaufsanalyseberichts anfordert, nicht nur die aktuelle Anweisung verstehen, sondern auch die Definition des Unternehmens für Indikatoren wie Umsatz und Gewinnspanne kennen, das Format wissen, das der Bericht verwenden soll, und auf Ausführungserfahrungen aus verwandten vergangenen Aufgaben verweisen.

Für Unternehmen liegt der Wert dieser Art von Fähigkeit darin, die Kosten für wiederholte Hintergrunderläuterungen zu senken. Ob das Gedächtnis jedoch genau und dauerhaft funktioniert, hängt weiterhin von der Qualität des Unternehmenswissens, den Berechtigungseinstellungen und dem Informationsaktualisierungsmechanismus ab.

Auf Modellebene möchte Google Cloud vermeiden, dass der Unternehmensagent vollständig an ein einziges Modell gebunden ist.

Gemini Agent unterstützt die Auswahl zwischen eigenen Google-Modellen und Drittmodellen wie Anthropic Claude und verteilt verschiedene Aufgaben über intelligentes Routing an das passende Modell. Relativ einfache Arbeiten können von kostengünstigeren Modellen erledigt werden, während komplexe Inferenzaufgaben stärkere Modelle aufrufen können.

Nach Angaben von Google Cloud können die Gesamtbetriebskosten der entsprechenden Aufgaben nach der Einführung des intelligenten Routings auf 1/3 der Kosten sinken, die bei ausschließlicher Verwendung von Spitzenmodellen anfallen, und die Ausführungsgeschwindigkeit steigt um 40 %.

Auf der Ebene der Basismodelle hat Google zudem das in der vergangenen Woche veröffentlichte Gemini 4 Argon erwähnt. Dieses Modell ist auf komplexe Inferenzaufgaben und lang andauernde Softwareentwicklungsaufgaben ausgerichtet und hat Fortschritte bei entsprechenden Benchmark-Tests und internen technischen Anwendungen von Google erzielt, um die Modellfähigkeiten für die Ausführung komplexer Arbeiten durch den Agenten zu unterstützen.

03.

Unternehmensdaten sind nicht mehr nur gespeicherte Vermögenswerte

Google Cloud ergänzt die Datenbasis des Agenten

Ob der Agent in die Produktionsumgebung integriert werden kann, hängt zudem davon ab, ob er Daten genau abrufen, Abläufe kontinuierlich ausführen und während des gesamten Prozesses die Unternehmensregeln einhalten kann.

Google Cloud hat für Gemini Agent mehrere auf spezifische Szenarien ausgerichtete Skills entwickelt. Der Skill für Betriebsberichte ermöglicht es Nutzern, die Betriebsdaten des Unternehmens durch einfache Gespräche zu verstehen, während der Skill für maschinelles Lernen in KI-Entwicklungsszenarien wirken kann.

Damit der Agent Aufgaben selbstständig ausführen kann, muss er Unternehmensdaten verstehen und nutzen können. Allerdings befinden sich viele Unternehmensinformationen noch verteilt in Datenbanken, Cloud-Speichern, Bürodokumenten und Geschäftssystemen. Selbst wenn das Modell selbst leistungsstark genug ist, ist es schwierig, End-to-End-Geschäftsaufgaben zu erledigen, wenn es die Bedeutung der Daten nicht verstehen oder keine angemessenen Zugriffsrechte erhalten kann.

Google Cloud hat bei dieser Gelegenheit Fähigkeiten wie Knowledge Catalog, Smart Storage und Borderless Lakehouse in Gemini Agent integriert, um die Hürden für die Nutzung von Unternehmensdaten durch den Agenten zu senken.

Der Schwerpunkt von Knowledge Catalog liegt darauf, dem Agenten zu helfen, die Geschäftssemantik hinter den Daten zu verstehen.

Derselbe