StartseiteArtikel

Claude bildet selbst Teams zur Bug-Suche! In 116.000 Codezeilen wurden 66 Bugs ermittelt, wobei ein einzelner Agent maximal nur 27 davon finden konnte.

新智元2026-10-11 14:40
Claude bildet selbst Teams zur Bug-Suche! In 116.000 Codezeilen wurden 66 Bugs aufgespürt, während ein einzelner Agent maximal nur 27 davon finden konnte.

Das beste Ergebnis eines einzelnen Agenten war die Entdeckung von 27 Fehlern.

Wenn Claude selbst Teams bildet, wurden bei drei aufeinanderfolgenden Läufen jedes Mal 66 Fehler erkannt.

Dies sind eine Gruppe von Testergebnissen, die Anthropic gerade veröffentlicht hat: 70 Fehler wurden im Voraus in 116.000 Zeilen Code eingebettet, und ein einzelner Agent sowie ein dynamischer Workflow wurden jeweils dreimal ausgeführt.

Das Ergebnis: Bei der Einzelarbeit wurde selbst im besten Fall weniger als 40 % der Fehler erkannt; bei der Zusammenarbeit im Team wurden hingegen in allen drei Durchläufen mehr als 90 % der Fehler gefunden.

Vergleich der Fehlererkennungsergebnisse zwischen einzelnem Agent und dynamischem Workflow, veröffentlicht von Anthropic.

Hinter diesen Ergebnissen steht, dass Claude nun selbst die Arbeitsteilung arrangiert und mehrere Agenten zur Zusammenarbeit organisiert.

Am 10. Oktober startete die öffentliche Testphase für den dynamischen Workflow Claude Managed Agents.

Mit dieser Funktion kann der Hauptagent nach Erhalt einer Aufgabe selbst Programme für die Arbeitsteilung schreiben, andere Agenten anweisen, die Aufgabe in Phasen zu erledigen, und schließlich die Ergebnisse zusammenfassen.

Am selben Tag erweiterte auch Claude Code Projects den Umfang der öffentlichen Testphase: Alle Pro- und Max-Nutzer, die zuvor in die Warteliste aufgenommen wurden, haben nun Zugriff auf die Funktion.

In Projects können Sie kontinuierlich Anforderungen für ein Projekt stellen, während Claude die Aufgaben aufteilt und mehrere Threads koordiniert, die parallel voranschreiten.

Die eine Funktion ermöglicht es Entwicklern, die Multi-Agent-Zusammenarbeit in ihre eigenen Anwendungen zu integrieren, die andere erlaubt Nutzern, Arbeitsaufträge direkt in den Projektgesprächen zu erteilen und den Fortschritt zu verfolgen.

Beide Updates zielen auf dieselbe Veränderung ab: Neben der Ausführung von Aufgaben übernimmt Claude nun auch Tätigkeiten, die bisher von Menschen erledigt werden mussten – wie die Zuweisung von Aufgaben, die Fortschrittsüberwachung und die Übergabe von Ergebnissen.

Sie geben das Ziel vor

Claude verteilt die Arbeit selbst

Es ist nicht schwierig, mehrere AI-Fenster gleichzeitig zu öffnen.

Das Problem ist, dass man jedem Fenster den Hintergrund noch einmal erklären, die Erkenntnisse aus einem Fenster an das andere weiterleiten und dann nacheinander nachfragen muss: Wo stehst du gerade? Wo hängst du? Was fehlt noch?

Je mehr Fenster es gibt, desto mehr wird der Mensch zum Übermittler von Nachrichten.

Projects soll diesen Teil der Arbeit übernehmen.

Sie stellen kontinuierlich Anforderungen im selben Projektgespräch, und Claude entscheidet, ob ein neuer Aufgaben-Thread erstellt wird oder ob die Aufgabe an einen bereits mit verwandten Arbeiten befassten Thread übergeben wird.

Jeder Thread kann als unabhängiges Arbeitsgespräch verstanden werden, das die Aufgabe eigenständig vorantreibt.

Projects koordiniert die Übersicht über Gespräche und Aufgaben

Anthropic hat ein Beispiel genannt: Das gleichzeitige Deaktivieren alter Schnittstellen für API, Web und Mobile.

Diese Angelegenheit betrifft mehrere Code-Repositories, und die Änderungen an allen Stellen müssen miteinander abgestimmt werden.

Claude kann die Aufgaben nach Code-Repositories aufteilen, die Codes jeweils ändern, Tests ausführen, Pull Requests einreichen und Ihnen dann mitteilen, welche Änderungen zuerst zusammengeführt werden müssen.

Jeder Cloud-Thread verfügt über einen eigenen Kontext und eine eigene Kopie des Codes, arbeitet auf seinem eigenen Branch und meldet die Ergebnisse zurück an das Projektgespräch.

Sie können jederzeit in einen bestimmten Thread einsteigen, um Details anzusehen und die Richtung zu korrigieren. Die Projektübersicht listet die laufenden, auf Ihre Antwort wartenden und zu prüfenden Aufgaben getrennt auf.

Wenn Sie eine Weile weg waren und zurückkommen, müssen Sie nicht in jedem Fenster nach dem Fortschritt fragen, sondern können direkt an der Stelle anknüpfen, an der Ihre Bearbeitung erforderlich ist.

Um die Zeit für wiederholte Kommunikation zu sparen, muss sichergestellt werden, dass die zuvor erteilten Aufträge gespeichert werden.

Projects sammelt das Projektgedächtnis.

Welche Anforderungen geändert wurden, welche Entscheidungen getroffen wurden und an welchen Stellen bereits Probleme auftraten, können alle aufgezeichnet werden, sodass nachfolgende Cloud-Threads darauf zugreifen können.

Die offizielle Seite nennt ein alltägliches Arbeitsszenario: Das Veröffentlichungsdatum wurde auf Freitag verschoben, warum eine bestimmte Funktion gestrichen wurde, wen man zuerst bestätigen muss, bevor ein bestimmter Dienst geändert wird – all diese Informationen können im Projektgedächtnis gespeichert werden.

Die Wissensdatenbank speichert auch hochgeladene Materialien und von Claude generierte Dateien, sodass nachfolgende Aufgaben auf den vorhandenen Ergebnissen aufbauen können.

Die Anforderungen werden an die Threads auf der rechten Seite verteilt, und verwandte Entscheidungen sowie Arbeitsergebnisse werden schrittweise angesammelt, um für nachfolgende Aufgaben verwendet zu werden.

Die neue Version von Projects startete am 17. September in der gestaffelten öffentlichen Testphase.

Bei dieser Erweiterung wird der Zugriffsbereich ausgeweitet, die Funktion selbst befindet sich weiterhin in der öffentlichen Testphase. Nutzer, die sich noch nicht angemeldet haben, können weiterhin der Warteliste beitreten.

Die Cloud-Threads können auch nach dem Schließen des Computers weiterarbeiten. Aufgaben, die lokale Tools oder lokale Datenbanken erfordern, können über Remote Control auf dem Computer ausgeführt werden, solange der Computer aktiv bleibt.

Nachdem das Projekt koordiniert wird, wie soll die Arbeit innerhalb einer komplexen Aufgabe weiter aufgeteilt werden?

300 Verträge

Die Arbeitsteilung wird in ein Programm geschrieben

Der dynamische Workflow Managed Agents befasst sich mit genau solchen Problemen.

Die offizielle Seite nennt ein konkretes Aufgabenbeispiel:

Prüfen Sie 300 Verträge und finden Sie heraus, welche Klauseln zur Änderung der Kontrolle enthalten – also Vereinbarungen darüber, wie mit dem Vertrag umzugehen ist, wenn sich die Kontrolle über das Unternehmen ändert.

Es ist schon sehr aufwendig, jeden Vertrag einzeln durchzulesen. Außerdem muss sichergestellt werden, dass jeder Vertrag geprüft wird, die Schlussfolgerungen nachprüfbar sind und übersehene Verträge rechtzeitig nachgeprüft werden.

Claude schreibt für die Aufgabe ein Workflow-Programm, das festlegt, welche Agenten die Materialien lesen, welche Schritte die Ergebnisse verarbeiten und wie es danach weitergeht.

Die Vertragsleseaufgaben werden parallel ausgeführt, anschließend erfolgt die Prüfung und Zusammenfassung

Arbeitsteilung und Übergabe sind in das Programm geschrieben und können direkt ausgeführt werden.

Nachdem ein Agent das Material gelesen hat, wird das Ergebnis an das Programm übergeben. Das Programm leitet das Ergebnis an den nachfolgenden Agenten weiter oder entscheidet anhand dessen, welcher Zweig als Nächstes ausgeführt wird.

Bei Arbeiten, die wiederholt geändert werden müssen, können auch Schleifen integriert werden.

Das Beispiel in der offiziellen Dokumentation ist die Manuskriptprüfung: Das Dokument wird kontinuierlich überarbeitet, bis es die Prüfung besteht oder eine voreingestellte Anzahl von Runden erreicht ist.

Bei der normalen Unteragenten-Zuweisung muss der Hauptagent die Berichte lesen und dann den nächsten Schritt entscheiden. Der dynamische Workflow hingegen schreibt einen Großteil der zwischenzeitlichen Übergaben in das Programm und führt sie im Hintergrund aus.

Während der Wartezeit kann der Hauptagent weiterhin mit dem Nutzer kommunizieren und den Fortschritt einsehen. Nach Abschluss des Laufs liest er die Ergebnisse, antwortet dem Nutzer oder startet die nächste Arbeitsrunde.

Nachdem die Threads im Workflow die Ergebnisse zurückgegeben haben, kann der Hauptagent jedoch nicht mehr Fragen an denselben Thread stellen, wie bei normalen Unteragenten. Daher sollten Prüfung und Nacharbeit vorab in den Prozess integriert werden.

Das offizielle Beispiel für eine Anweisung zur Vertragsprüfung sieht Folgendes vor:

In der ersten Runde wird jeder Vertrag an einen Agenten übergeben. In der zweiten Runde prüft ein anderer Agent alle Verträge erneut, auch diejenigen, bei denen die Zielklausel in der ersten Runde nicht gefunden wurde. Verträge, die die Prüfung nicht bestehen, werden nach der Überarbeitung erneut geprüft.

Dadurch erhalten die in der ersten Runde übersehenen Klauseln eine zusätzliche Chance, entdeckt zu werden.

Natürlich zeigt das Vertragsbeispiel nur die Arbeitsweise.

Anthropic hat in dem Beitrag zu den Bug-Tests keine genaue Arbeitsteilung offengelegt, daher kann nicht davon ausgegangen werden, dass diese 66 Fehler nach demselben Prozess gefunden wurden.

1000 Agenten

Müssen auch in der richtigen Reihenfolge angeordnet werden

Maximal 1000 Agenten pro Lauf ist eine der auffälligsten Zahlen dieser öffentlichen Testphase.

Das bedeutet, dass während der gesamten Laufzeit eines Workflows maximal 1000 Agenten insgesamt gestartet werden können.

In der aktuellen Dokumentation ist die Obergrenze für gleichzeitig arbeitende Threads mit 64 angegeben. Die offizielle Seite weist darauf hin, dass diese Parallelitätszahl angepasst werden kann.

Der Workflow kann nacheinander in Batches ausgeführt werden, oder er kann warten, bis die vorherige Phase die Ergebnisse zurückgibt, bevor die nachfolgende Phase arrangiert wird.

Jeder Agent hat einen unabhängigen Gesprächsverlauf und teilt gleichzeitig die Dateien und die Sandbox in der Sitzung – also die Arbeitsumgebung zum Ausführen von Code und Verarbeiten von Materialien.

Entwickler können spezielle Agenten im Voraus konfigurieren, oder der Workflow kann sie je nach Aufgabenbedarf vorübergehend definieren.

Bei der Integration setzen Sie im Multiagent-Konfigurationsteil den Typ auf multiagent_20261001 und konfigurieren dann Modell, Tools und Aufgabenanforderungen.

Nach der Aktivierung des dynamischen Workflows können Sie Claude die Aufgabe erteilen, damit er den Plan für die Arbeitsteilung erstellt. Das Beispiel im Bild zeigt die Suche nach Kontrolländerungsklauseln in 300 Verträgen.

Es reicht jedoch nicht, die Arbeit zu verteilen – Sie müssen auch klar angeben, was noch nicht erledigt ist.

Eine offizielle Beispielanweisung sieht vor: Wenn ein Agent einen Vertrag nicht lesen kann, wird dieser Vertrag als "nicht abgedeckt" markiert, während die übrigen Aufgaben fortgesetzt werden.

"Kein Problem gefunden" und "Gar nicht geprüft" müssen getrennt voneinander behandelt werden. Andernfalls kann eine saubere Zusammenfassung leicht die Lücken in den Aufgaben verbergen.

Entwickler können die Laufphasen und die Aufzeichnungen aller Threads einsehen und die Probleme anhand der Aufzeichnungen lokalisieren.

Am Beispiel der Vertragsprüfung können Entwickler Phasen wie Lesen und Prüfen verfolgen und die Ausführungsaufzeichnungen jedes Aufgaben-Threads einsehen.

Wenn es mehr