OpenAI-Führungskräfte berichten aus erster Hand: Wie wir innerhalb einer Woche einen Konkurrenten zu Jev entwickelt haben
Die Ergebnisse von Computer Use lassen sich offensichtlich sehr leicht überprüfen – warum schreitet die Entwicklung dieser Technologie so langsam voran? Wann wird KI wirklich lernen, einen Computer zu bedienen?
Diese Frage, die der bekannte Podcast-Moderator Dwarkesh Patel im Juni dieses Jahres aufwarf, hat in der Branche viele Kontroversen ausgelöst.
Drei Monate später stellte OpenAI am Entwicklertag am 29. September Dot, Computer Use und eine Reihe neuer Entwicklerschnittstellen vor. Jeder Dot kann einen eigenständigen Cloud-Linux-Computer nutzen, sowohl Browser öffnen als auch Desktop-Anwendungen ausführen; Nutzer können Aufgaben, die sie sonst Schritt für Schritt auf Webseiten oder in Software erledigen müssen, an ihn übergeben. Nach der Produktvorführung wirft diese Frage noch mehr Detailfragen auf: Wie weit ist Computer Use heute tatsächlich fortgeschritten? Welche Veränderungen haben die Fähigkeiten von Agenten zur Aufgabenerfüllung erfahren?
Nach dem Ende des Entwicklertags führte *The AI Engineer Podcast* von Latent Space ausführliche Gespräche mit dem CUA-Team von OpenAI und dem Leiter der API-Plattform. Im Podcast wurde zuerst Ari Weinstein interviewt, Mitbegründer von Sky und heutiger Leiter des Produkt- und Ingenieurteams für Computer Use bei OpenAI. Ari ist der Ansicht, dass der wichtigste Fortschritt im vergangenen Jahr darin besteht, dass Agenten besser darin geworden sind, Fehler zu beheben und es erneut zu versuchen, wenn sie auf Hindernisse stoßen. Sie können nicht mehr nur Screenshots ansehen und Schritt für Schritt klicken: Seitenstrukturen, Barrierefreiheitsinformationen und selbst geschriebener Code können alle zu Mitteln werden, mit denen sie Software bedienen. Aber wenn Agenten auf Websites zugreifen und Zahlungen abwickeln können, an welchen Stellen Menschen die Kontrolle übernehmen müssen, bleibt eine Frage, die das Produkt beantworten muss.
Nikunj Handa, Produktleiter der OpenAI-API, teilte im Interview verschiedene Praktiken mit, die für Agenten auf API-Ebene entwickelt wurden: von der Möglichkeit, dass Modelle während der Ausführung von Tools weiter schlussfolgern, bis hin zu schnellen Entscheidungen, Leistungsoptimierung und Kontextverwaltung. Als er über die Decisions API sprach, räumte Nikunj Handa ein, dass diese von Jev inspiriert wurde und ursprünglich nicht im Entwicklungsplan stand. Rund eine Woche nach Projektstart hatte das Team bereits einen lauffähigen Prototyp fertiggestellt. Sie haben das Modell nicht neu trainiert, sondern die Gewichte von Luna weiterverwendet, die Ausgaben auf strukturierte Ergebnisse beschränkt und das Inferenzsystem speziell optimiert, um die Rückgabezeit der ersten Entscheidung so kurz wie möglich zu halten – mehrere Aufgaben können zudem parallel verarbeitet werden. Es funktioniert eher wie eine extrem schnelle Klassifizierungs- und Entscheidungsschicht, die für die Klassifizierung von Kundenservice-Tickets, Bewertungen und Computer Use eingesetzt werden kann. Es kann auch mit GPT Live zusammenarbeiten, damit Agenten bei Bedarf für schnelle Entscheidungen reaktionsschneller sind.
Ausgehend von der Frage „Warum ist KI noch nicht gut darin, Computer zu bedienen?“ rücken die beiden Interviews die Details immer näher: Wie erkennen Agenten, dass sie etwas falsch gemacht haben, wie entscheiden sie über den nächsten Schritt und wie arbeiten sie über lange, kleinteilige praktische Aufgaben hinweg kontinuierlich weiter. Die Demo am Entwicklertag zeigte das Ergebnis, während dieses Interview aus unterschiedlichen Perspektiven von Produkt und Plattform die Praktiken im Bereich Computer Use vorstellte.
Version für Eilige:
Moderator Vibhu: Dot stellt jedem Agenten einen eigenen Cloud-Computer zur Verfügung. Wie sollen Nutzer seine Fähigkeiten erkunden?
Ari Weinstein: Dot kann auf einem Cloud-Linux-Computer Browser und Desktop-Anwendungen nutzen. Ein praktischer Ausgangspunkt ist, die täglichen zeitaufwändigen Computeraufgaben aufzulisten und zu versuchen, geeignete davon an Agenten zu übergeben.
Moderator Swyx: Es gibt die Ansicht, dass Computer Use in den letzten zwei Jahren fast keine Fortschritte gemacht hat. Wie sieht die tatsächliche Situation aus?
Ari Weinstein: Früher konnten Agenten in der Regel Aufgaben starten, blieben aber leicht stecken, wenn sie auf Probleme stießen. Heute sind sie besser darin, Fehler zu beheben, Methoden anzupassen und es erneut zu versuchen. Das ist eine der auffälligsten Veränderungen im vergangenen Jahr.
Moderator Vibhu: Kommen die verbesserten Fähigkeiten hauptsächlich vom Modell oder vom Laufwerkframework der Agenten?
Ari Weinstein: Beide tragen dazu bei. Agenten können jetzt Screenshots, Barrierefreiheitsinformationen, Seitenstrukturen und Playwright kombinieren, um Software zu bedienen, zudem Code schreiben und mehrere Schritte auf einmal ausführen; auch die Fähigkeiten und die Geschwindigkeit des Modells selbst haben sich verbessert.
Moderator Vibhu: Was ist der nächste große Engpass für Computer Use?
Ari Weinstein: Die Engpässe verteilen sich auf mehrere Glieder: Modell, Inferenz, Laufwerkframework und Informationsdarstellung. Mit steigender Ausführungsgeschwindigkeit der Agenten wird die Zeit, die Operationen selbst wie das Warten auf das Laden von Websites benötigen, immer deutlicher spürbar.
Moderator Swyx: Was müssen Entwickler beachten, wenn sie die Computer-Use-Fähigkeit über die Agents API nutzen?
Ari Weinstein: Sie sollten die Websites und Anwendungen einschränken, auf die Agenten zugreifen dürfen, je nach Aufgabe, und vor Operationen mit wichtigen Folgen wie Zahlungen die Zustimmung der Nutzer einholen. Zuverlässigkeit und angemessene Sicherheitsüberprüfungen sind die Grundlage für das Vertrauen der Nutzer.
Moderator Vibhu: Wie wird Computer Use den Softwareentwicklungsprozess verändern?
Ari Weinstein: Agenten können die von ihnen entwickelte Software tatsächlich öffnen und testen. So entsteht ein geschlossener Kreislauf zwischen Code-Schreiben und Ergebnisüberprüfung, sodass weniger Fälle auftreten, in denen Menschen die gesamte Testarbeit nach Abschluss der Entwicklung übernehmen müssen.
Moderator Vibhu: Welche bemerkenswerten Veränderungen gibt es bei den neu veröffentlichten APIs?
Nikunj Handa: Asynchrone Funktionsaufrufe erlauben es dem Modell, während der Ausführung von Tools weiterzuarbeiten und danach die Ergebnisse abzurufen; Mid-Prompt-Guidance erlaubt es Entwicklern, Nachrichten während der Laufzeit des Modells hinzuzufügen. Diese Fähigkeiten helfen bei Aufgaben mit häufigen Tool-Aufrufen und langer Ausführungsdauer.
Moderator Swyx: Wie hat OpenAI mit der Entwicklung der Decisions API begonnen?
Nikunj Handa: Die Einführung von Jev hat die Aufmerksamkeit von Nutzern und internen Teams geweckt – vorher stand die Decisions API nicht auf dem Entwicklungsplan. Das Team hat zuerst überprüft, ob der Prototyp funktioniert, und dann damit begonnen, die Rückgabegeschwindigkeit von Entscheidungen zu optimieren.
Moderator Vibhu: Für welche Probleme eignet sich die Decisions API?
Nikunj Handa: Derzeit ist die klare Anwendung die schnelle Klassifizierung, zum Beispiel die Bearbeitung von Kundenservice-Tickets. Sie kann auch für bestimmte Aufgaben eingesetzt werden, bei denen der nächste Schritt schnell ausgewählt werden muss – aber die Fähigkeiten für schnelle Entscheidungen unterscheiden sich von denen, die für komplexe, lang andauernde Aufgaben benötigt werden.
Moderator Swyx: Wenn dieselbe Luna verwendet wird, was ist der Unterschied zwischen der Decisions API und normalen strukturierten Ausgaben?
Nikunj Handa: Die erste Version trainiert das Modell nicht neu, sondern basiert auf den vorhandenen Gewichten von Luna, beschränkt die Ausgaben, verarbeitet mehrere Probleme parallel und optimiert speziell die Rückgabezeit der ersten Entscheidung.
Moderator Swyx: Wie gehen langlaufende Agenten mit der Obergrenze des Kontexts um?
Nikunj Handa: Entwickler können Schwellenwerte festlegen, damit die Responses API den Kontext automatisch komprimiert; sie können auch /compact aufrufen, um den Zeitpunkt der Komprimierung selbst zu steuern.
1
Wenn KI einen eigenen Computer hat – welche Aufgaben lassen sich an sie übergeben?
Moderator Vibhu: Heute ist OpenAI DevDay, wir nehmen diese Sonderausgabe des Interviews direkt vor Ort auf.
Moderator Swyx: Wir sind das erste Podcast-Interview, das nach Ende eures Livestreams geführt wurde.
Moderator Vibhu: Heute ist Ari bei uns, der das Produkt- und Ingenieurteam für Computer-Use-Agenten leitet. Bevor wir tiefer auf diese Technologie eingehen, kannst du zuerst einen Überblick geben, was heute alles veröffentlicht wurde?
Ari Weinstein: Wir sind gerade von der Keynote zurückgekommen, heute gibt es mehrere Veröffentlichungen im Bereich Computer Use, die Aufmerksamkeit verdienen.
Zuerst Dot: ein neues Produkt für persönliche Assistenten mit einigen sehr erwarteten Computer-Use-Funktionen.
Dann GPT-6.1 Sol: ein hervorragendes neues Modell, das meiner Meinung nach besonders für Computer Use geeignet ist, da es Vorteile bei Kosten und Geschwindigkeit hat. Wir haben anscheinend veröffentlicht, dass seine Kosten ein Fünftel von Astra betragen; speziell für Computer Use sind die Kosten sogar nur ein Siebtel – das ist wirklich bemerkenswert.
Die Agents API verfügt jetzt ebenfalls über Computer-Use-Fähigkeiten, Entwickler können dieselbe Implementierung nutzen, die auch in Codex und ChatGPT verwendet wird, um Produkte zu bauen. Vor Ort wurden zudem vorhandene Funktionen vorgeführt, zum Beispiel App Shots: damit kannst du den Inhalt, mit dem du gerade auf deinem Computer arbeitest, schnell in Codex und ChatGPT übernehmen.
Außerdem gibt es natives Computer Use für Mac: Roman ließ es automatisch Screenshots von seinen eigenen Anwendungen aufnehmen, und während es die Anwendungen bedient, kann er selbst noch andere Dinge auf dem Computer erledigen. Die Keynote war also wirklich großartig.
Moderator Swyx: Ganz zu schweigen von der Decisions API. Ich frage direkt: Stecken hinter all dem dasselbe Modell, oder verschiedene Modelle, die aus demselben Datensatz destilliert wurden? Genauer gesagt: Wird für Computer Use die Decisions API verwendet, oder sind beide relativ unabhängig voneinander?
Ari Weinstein: Die Decisions API ist sehr interessant, sie hat mehrere neue Fähigkeiten: sie kann parallel schlussfolgern, keine Denkprozesse durchführen und nutzt ein kleineres Modell als das, das wir für Computer Use einsetzen. Das macht sie sehr schnell, aber bei komplexeren Aufgaben mit längerem Ausführungszyklus sind ihre Fähigkeiten etwas schwächer. Wie man diese Methoden kombiniert, ist noch eine offene Forschungsfrage. Ich freue mich schon darauf zu sehen, was alle mit der Decisions API bauen werden.
Moderator Vibhu: Eine interessante Sache ist, dass jeder Dot jetzt mit einem eigenen PC ausgestattet ist.
Ari Weinstein: Genau.
Moderator Vibhu: Also scheinen sie die Arbeitsumgebung dauerhafter behalten zu können. Du nutzt es schon eine Weile – wie sollen Nutzer die Grenzen seiner Fähigkeiten erkunden? In welche Richtungen sollen sie experimentieren? Ich selbst lasse es oft Kundenservice-Probleme bearbeiten, zum Beispiel: „Dieses Ding funktioniert nicht, ich möchte mich nicht anmelden und keine Identitätsüberprüfung durchführen“ – such die relevanten Informationen und löse das Problem. Was können Nutzer darüber hinaus noch ausprobieren?
Ari Weinstein: Dot ist ein sehr interessantes Produkt, weil jeder Dot eine eigene virtuelle Linux-Maschine in der Cloud nutzen kann – das unterscheidet es von unseren anderen Produkten. Früher haben wir normalerweise nur einen Cloud-Browser bereitgestellt oder Agenten den Zugriff auf deinen eigenen Computer erlaubt; jetzt hast du eine ganze eigene Linux-Maschine in der Cloud. Sie kann vollständige Desktop-Anwendungen ausführen und auch den Browser nutzen. Ich denke, Computer Use ist so leistungsstark und so erwartungsvoll, weil es Agenten erlaubt, alles zu tun, was ein Mensch tun kann. Alle Software der Welt wurde ursprünglich für Menschen entwickelt, jetzt können Agenten diese Software auch nutzen – also kannst du Arbeit an sie übergeben. Alles, was du normalerweise auf dem Computer machst, kannst du Dot erledigen lassen. Welche Anwendungen am nützlichsten sind, hängt davon ab, wer der Endnutzer ist und was für einen Wert es für sein Leben hat.
Ich empfehle: Denk zuerst darüber nach, womit du normalerweise deine Zeit verbringst, und überlege dann, ob du diese Dinge an Agenten übergeben kannst. Alles, was du auf dem Computer machst, kann von Dot erledigt werden. Welche Anwendungen am nützlichsten sind, hängt davon ab, wer der Endnutzer ist und was für sein Leben wertvoll ist. Ich rate dir, zuerst zu überlegen, womit du normalerweise deine Zeit verbringst, und dann zu prüfen, ob du diese Dinge an Agenten übergeben kannst.
Moderator Swyx: Genau, zum Beispiel Flugtickets buchen, einkaufen – ehrlich gesagt sogar Spiele spielen, das funktioniert auch, oder?
Ari Weinstein: Absolut. Ich habe kürzlich einen Essenslieferdienst gebucht, um mich gesünder zu ernähren. Ich mag diesen Service sehr, weil er es mir erlaubt, jede Mahlzeit sehr detailliert anzupassen, zum Beispiel „wie viele Gramm Huhn, wie viele Gramm Reis ich möchte“. Aber die Bedienung war so kompliziert, dass ich zwei Stunden für eine Bestellung gebraucht habe. Später habe ich herausgefunden, dass Computer Use mir helfen kann, die Bestellung aufzugeben – es hat das in 15 Minuten erledigt. Mit GPT-6.1 Sol ist es achtmal so schnell wie ich und spart mir zwei Stunden. Ich denke, solche Aufgaben zeigen besonders gut seinen Wert.
Moderator Swyx: Als Ersteller fällt mir sofort die wichtigste Verwendung ein: Die Abläufe auf YouTube automatisieren. Viele Funktionen von YouTube bieten keine offizielle API an, du kannst es nur in eine virtuelle Maschine einbinden und den Agenten selbst arbeiten lassen. Zum Beispiel A/B-Tests oder das Veröffentlichen von Community-Beiträgen – dafür gibt es keine APIs, weil die Entwickler von YouTube das nicht wollen.
Ari Weinstein: Ich habe das auch schon von Leuten aus dem Entwicklererfahrungs-Team gehört. Sie nutzen es oft, um Dinge auf YouTube zu erledigen, es funktioniert wirklich sehr gut.
2
Computer Use betritt eine neue Phase: Es versteht Oberflächen besser und ist besser darin, Fehler zu beheben und schneller zu arbeiten
Moderator Swyx: Ich möchte eine etwas schärfere Frage stellen. Wir haben Freunde, die einen einflussreichen KI-Podcast betreiben – sie haben eine bekannte Ansicht: Computer Use hat in den letzten zwei Jahren überhaupt keine Fortschritte gemacht. Diese Aussage ist interessant, und du solltest einer der Menschen auf der Welt sein, die am qualifiziertesten sind, über dieses Thema zu sprechen. Welche Fortschritte gibt es tatsächlich?
Ari Weinstein: Ich erinnere mich, dass sie das vor einigen Monaten gesagt haben – ich hoffe, sie haben ihre Meinung inzwischen geändert, denn Computer Use hat sich im Vergleich zu früher komplett verändert.
Moderator Swyx: Du hast fast deine gesamte Karriere mit irgendeiner Form von Computerautomatisierung verbracht – von Shortcuts bei Apple über Sky bis hin