StartseiteArtikel

Gerade ist GPT-6 Astra erschienen und hat bei AGI-Tests fast die volle Punktzahl erreicht.

智东西2026-09-04 08:38
OpenAI startet eine umfassende Offensive gegen Claude Fable 5.1.

OpenAI geht voll auf Konfrontationskurs mit Claude Fable 5.1.

Berichtet von Zhidong am 4. September, hat OpenAI gerade GPT-6 Astra vorgestellt und bezeichnet es als das intelligenteste und ausgewogenste Modell der heutigen Welt.

Sam Altman, Mitbegründer und CEO von OpenAI, veröffentlichte einen Beitrag: „Wir sind überzeugt, dass es derzeit das beste Modell in Bereichen wie Computernutzung, berufliche Arbeit, wissenschaftliche Forschung, Programmierung und Cybersicherheit weltweit ist.“

Wie bekannt ist, erzielte GPT-6 Astra im FrontierMath Tier 4-Test eine hohe Punktzahl von 97,6 % und hat dazu beigetragen, lang bestehende offene Probleme im Bereich der Mathematik zu lösen; im ARC-AGI-3-Test erreichte es eine hohe Punktzahl von 99,9 % und im ExploitBench-Test die volle Punktzahl von 100 %. Es stellte neue Rekorde bei der Nutzung von Computern und Browsern auf, erzielte hervorragende Ergebnisse bei Geschwindigkeit, Genauigkeit und Urteilsvermögen bei der Bearbeitung komplexer beruflicher Aufgaben und übertraf Claude Fable 5.1 in allen Punkten in den Tests von OpenAI.

Laut Berichten ausländischer Medien wie The Information hat Greg Brockman, Präsident von OpenAI, sogar in einer Telefonkonferenz verraten: Astra könnte der Beginn des „AGI-Zeitalters“ sein.

Unmittelbar nach der Veröffentlichung des Modells erregte es die Aufmerksamkeit zahlreicher Internetnutzer. Ein Nutzer schrieb auf der sozialen Plattform X: „Nachdem OpenAI lange Zeit hinter dem Fable-Modell zurückgeblieben ist, scheint es nun die Führungsposition eingenommen zu haben.“ Zuvor, am 2. September, hatte Anthropic gerade die neue Generation des weltweit stärksten Modells Claude Fable 5.1, Claude Mythos 5.1 vorgestellt.

Und erst vor zwei Tagen veröffentlichte OpenAI gerade die Bewertungsergebnisse zur Sicherheitsfähigkeit von Astra und erklärte, dass Astra das erste Modell des Unternehmens ist, das den Schwellenwert für Cybersicherheitsfähigkeiten der Stufe „Kritisch“ im Preparedness Framework erreicht.

GPT-6 Astra wird ab heute für einige Organisationen eingeführt und wird in den nächsten Tagen für alle Nutzer von ChatGPT Plus, Pro, Business und Enterprise freigegeben und über die OpenAI-API und AWS bereitgestellt. Für Entwickler ist GPT-6 Astra bereits über gpt-6-astra in der OpenAI-API verfügbar und kann auch in Amazon Bedrock verwendet werden.

Der Preis von GPT-6 Astra beträgt das 2,5-fache des Preises des vorherigen Flaggschiffmodells von OpenAI, GPT-5.6 Sol. Die Standardversion wird mit 10 US-Dollar pro Million Eingabe-Token und 50 US-Dollar pro Million Ausgabe-Token berechnet, wobei der Cache-Eingang 1 US-Dollar und der Cache-Schreibvorgang 12,5 US-Dollar kostet. Dies entspricht dem Preis des kürzlich von Anthropic veröffentlichten Fable 5.1-Modells.

In der API ist für GPT-6 ein Schnellmodus verfügbar, dessen Verarbeitungsgeschwindigkeit bis zum 2,5-fachen der Standardversion erreichen kann und dessen Preis das Doppelte der Standardversion beträgt.

01. Vollständige Konfrontation mit Fable 5.1 im Wettbewerb um die „Aufgabenerfüllung“

Der Terminal-Bench Science 0.1-Test prüft, ob Agenten wissenschaftliche Arbeitsabläufe mit Code und Terminalwerkzeugen abschließen können, einschließlich Datenanalyse, Ausführung von Simulationen und Anpassung von Modellen. Unter allen verglichenen Modellen erzielte GPT-6 Astra das beste Ergebnis mit einer Punktzahl von 64,6 %.

Während die Punktzahl von Claude Fable 5.1 52,6 % beträgt, liegen die geschätzten API-Kosten von Astra um etwa 31 % niedriger. In einer Umgebung mit niedrigeren Kosten erzielte Astra eine Punktzahl von 61,1 %, während das beste Ergebnis von GPT-5.6 Sol 22,4 % beträgt, wobei die geschätzten API-Kosten von Astra um etwa 27 % niedriger liegen.

Der ARC-AGI-3-Test prüft die Lernfähigkeit von Agenten bei der Lösung unbekannter interaktiver Aufgaben. GPT-6 Astra erzielte in der Bewertung ein hervorragendes Ergebnis mit einer Punktzahl von 99,9 %. Die durchschnittliche Punktzahl menschlicher Tester beträgt nur 48 %. OpenAI bewertete GPT-6 Astra mit einem Antwort-API-Testtool, das die Leistung in praktischen Anwendungsszenarien besser widerspiegelt als das ursprüngliche Benchmark-Testtool. OpenAI schätzt, dass Sol mit diesem Testtool eine Punktzahl von etwa 30 % erreicht.

Der FrontierMath-Test der Stufe 4 prüft, ob die Prüflinge über fortgeschrittene mathematische Schlussfolgerungsfähigkeiten bei der Lösung extrem schwieriger Probleme verfügen.

Der Terminal-Bench 4.0-Test prüft die Leistung von Agenten bei komplexen Terminalaufgaben, einschließlich Software-Engineering, Systemkonfiguration und Datenanalyse. Die Erfolgsrate von GPT-6 Astra erreichte mit 57,9 % einen historischen Höchstwert, während die Erfolgsraten von GPT-5.6 Sol und Claude Fable 5.1 37,3 % bzw. 55,8 % betrugen, wobei die API-Kosten pro Aufgabe um etwa 9 % bzw. 63 % gesenkt werden konnten.

Der AutomationBench-Test prüft, ob Agenten mehrstufige Geschäftsprozesse über verschiedene Anwendungen hinweg abschließen können. In den gemeldeten Ergebnissen erzielte GPT-6 Astra einen neuen Höchstwert und erledigte 41,4 % der Aufgaben, während die Erledigungsraten von Claude Fable 5.1 und Claude Opus 5 31,4 % bzw. 26,9 % betrugen.

Laut OpenAI ist Astra das derzeit Modell von OpenAI, das den Nutzeranforderungen am nächsten kommt, mit deutlichen Verbesserungen beim Verständnis der Nutzerabsicht und des Modellverhaltens.

Nutzer können Aufgaben vertrauensvoller an Astra übergeben und auf sein Urteilsvermögen vertrauen. Um dies zu überprüfen, hat OpenAI sich auf das „Hugging Face“-Ereignis bezogen und ein neues Bewertungsmodell erstellt, das prüft, ob das Modell bei schwierigen oder unmöglichen Aufgaben seinen erwarteten Rahmen überschreitet.

Im Vergleich zu GPT-5.6 Sol, das in 48 % der Fälle ohne Sicherheitsmaßnahmen in der Produktionsumgebung den autorisierten Rahmen überschreitet, tritt dieser Fall bei GPT-6 Astra zu 0 % auf.

02. „Das weltweit beste Modell für Computernutzung“

Laut OpenAI ist Astra „das weltweit beste Modell für Computernutzung“ und markiert einen neuen Meilenstein bei Geschwindigkeit, Genauigkeit und Sicherheit der Computernutzung.

Es kann mühsame Aufgaben erledigen, wie das Ausfüllen von Online-Formularen, das Aktualisieren von Kundendatensätzen im CRM und das Verwalten des Zeitplans von Nutzern. Es kann Online-Recherchen durchführen und Zusammenfassungen in den E-Mails oder Dokumenteneditoren von Nutzern erstellen. Es kann wissenschaftliche Daten analysieren, Diagramme generieren, Websites erstellen und Frontend-Qualitätsprüfungen durchführen, um sicherzustellen, dass alle Funktionen auf der Website ordnungsgemäß funktionieren. Es kann Nutzern helfen, Software selbst zu installieren und zu testen sowie Probleme zu lösen, die Nutzer auf ihrem Bildschirm sehen. Diese Verbesserungen spiegeln sich auch in den modernsten Bewertungsergebnissen von OpenAI wider.

Der Agents' Last Exam-Test prüft die Fähigkeit von Agenten, komplexe berufliche Aufgaben in echter Software zu erledigen, wobei die Aufgabenbereiche Finanzmodellierung, Ingenieurwesen und Medienproduktion umfassen. In diesem Vergleichstest erzielte GPT-6 Astra ein hervorragendes Ergebnis von 59,3 %, weit über 55,5 % von Claude Opus 5 und 53,6 % von GPT-5.6 Sol. Bei diesen höchsten Einstellungen verwendete Astra auch etwa 65 % weniger Ausgabe-Token als Opus 5.

Der ScreenSpot-Pro-Test prüft, ob das Modell Oberflächenelemente in hochauflösenden Screenshots professioneller Software korrekt lokalisieren kann. GPT-6 Astra stellte einen neuen Genauigkeitsrekord von 92,7 % auf.

Der OSworld 2.0-Test prüft, ob das Modell Aufgaben durch Bedienung von Computeranwendungen erledigen kann. Astra erzielte einen höheren Aufgabenwert als jedes andere verfügbare Modell, und die Anzahl seiner Ausgabemarken ist weit geringer als bei GPT-5.6 Sol.

Diese Verbesserungen steigern auch die Effizienz bei praktischen Wissensarbeitsaufgaben erheblich. In der Latenzsimulation von OSworld 2.0 war die Computernutzungsleistung von Astra etwa 47 % schneller als die von GPT-5.6 Sol, wodurch die Dauer jeder Aufgabe um etwa 47 % verkürzt wurde. Astra erzielte eine Punktzahl von 72,6 % und jede Aufgabe dauerte etwa 40 Minuten, während GPT-5.6 Sol eine Punktzahl von 65,7 % erzielte und jede Aufgabe etwa 75 Minuten dauerte.

Die Fähigkeit von GPT-6 Astra zur Computernutzung zeigt sich in den Ausgaben verschiedener Bereiche, einschließlich Spieleentwicklung, Elektrotechnik und alltäglicher Wissensarbeit:

Dies ist eine 15-sekündige gekürzte Wiedergabe des PCB-Layouts (Leiterplattenlayout) von GPT-6 Astra in KiCad. Es wandelt elektronische Schaltpläne durch Platzieren