StartseiteArtikel

Über Nacht wurde GPT-5.6 Sol von OpenAI um das 14-fache beschleunigt

机器之心2026-08-14 07:44
750 Token pro Sekunde

Hat die KI begonnen, das Informationsasymmetrieproblem zu adressieren?

In den frühen Morgenstunden des 14. August hat OpenAI gemeinsam mit dem KI-Chiphersteller Cerebras offiziell die neue Dienstebene „Ultrafast Mode“ für sein Flaggschiffmodell GPT-5.6 Sol vorgestellt.

In diesem Modus erreicht die Ausgabegeschwindigkeit von GPT-5.6 Sol maximal 750 Token pro Sekunde. Im Vergleich zur aktuellen Inferenz-Baseline von rund 53 Token pro Sekunde im Standard-Modus steigt die Geschwindigkeit um das bis zu 14-fache, ohne jegliche Qualitätseinbußen. Im direkten Vergleich ist das beschleunigte GPT-5.6 Sol 11-mal schneller als Fable 5 und 5-mal schneller als Opus 4.8 im Fast-Modus.

Der Ultrafast-Modus wird zuerst in der OpenAI-API eingeführt, eine begrenzte Vorschauversion steht derzeit bereits für einen Teil der Kunden zur Verfügung.

Aus diesem Grund haben OpenAI und Cerebras eine Tabelle erstellt, die die aktuelle Geschwindigkeit und Intelligenz der fortschrittlichen großen KI-Modelle vergleicht – GPT-5.6 Sol Ultrafast nimmt eine absolut führende Position ein:

In dem Blog von Cerebras stellen die Ingenieure die Tests vor, die an „Humanity's Last Exam (HLE)“ durchgeführt wurden. Sie haben das Modell im Ultrafast-Modus direkt mit seinen Konkurrenten verglichen. Bekanntlich ist HLE eine anspruchsvolle Modell-Benchmark mit 2500 Aufgaben, die normalerweise nur Doktoranden in Bereichen wie Chemie, Ökonomie und Literatur lösen können.

GPT-5.6 Sol hat alle Fragen im Ultrafast-Modus in nur 11 Stunden und 11 Minuten beantwortet. Claude Fable 5 benötigt dagegen 78 Stunden und 27 Minuten, also mehr als drei Tage ununterbrochene Berechnung, um die gleichen Ergebnisse zu erzielen. Der Ultrafast-Modus von GPT hat die Aufgaben im Bereich der Spitzenleistungen des menschlichen Wissens innerhalb eines einzigen Arbeitstages abgeschlossen – bei ähnlicher Genauigkeit ist die Geschwindigkeit fast 7-mal so hoch wie die von Claude Fable.

Mit der kontinuierlichen Verbesserung der Modellkapazitäten wird sich der Anwendungsbereich der schnellen Inferenz ebenfalls erweitern. GPT-5.6 Sol ist das bisher beste Modell von OpenAI bei juristischen Dokumenten, Finanzmodellen und technischen Berichten. Bei GDP-Val, der Benchmark für die Messung von wissensbasierten Arbeitsaufgaben mit wirtschaftlichem Wert, erreicht Ultrafast eine 5,6-fache End-to-End-Geschwindigkeitssteigerung ohne Qualitätseinbußen, was deutlich zeigt, wie eine schnellere Inferenz die Durchführung von Arbeiten mit wirtschaftlichem Wert beschleunigen kann.

Eine schnellere KI-Verarbeitungsgeschwindigkeit eröffnet viele neue Möglichkeiten für neuartige Arbeitsabläufe: Heutzutage können Agenten direkt in den kritischen Pfad von Problemen eingebunden werden. OpenAI nennt einige Anwendungsszenarien:

  • Ereignisreaktion und Zuverlässigkeit: Wenn ein kritisches System ausfällt, analysiert die KI Anwendungsprotokolle, aktuelle Codeänderungen und Ingenieurberichte, um mögliche Ursachen zu ermitteln und bei der Vorbereitung von Korrekturen zu helfen, während der Ausfall noch andauert.
  • Finanzforschung und Sicherheit: Analysieren Sie Marktsignale, bewerten Sie Transaktionen und erkennen Sie verdächtige Aktivitäten in einem sich ständig ändernden Marktumfeld.
  • Kundensupport und Sprache: Lösen Sie komplexe Kundenprobleme in Echtzeit, auch wenn die Suche nach der Antwort mehrere Schritte oder Systeme erfordert, ohne den Dialog zu unterbrechen.
  • Geschäft: Beantworten Sie Produktfragen, prüfen Sie den Lagerbestand, geben Sie personalisierte Empfehlungen und lösen Sie Probleme beim Bezahlvorgang, während der Käufer noch unentschlossen ist, damit das Zögern nicht zum Abbruch des Warenkorbs führt.
  • Echtzeitforschung und Experimente: Wandeln Sie Forschungsarbeiten, die früher über Nacht abgeschlossen werden mussten, in interaktive Arbeitssitzungen um, damit Teams Ideen testen, Ergebnisse prüfen, Methoden anpassen und weitere Experimente durchführen können, ohne den Arbeitsablauf zu unterbrechen.

Innerhalb von OpenAI haben die Entwickler GPT-5.6 Sol im Ultrafast-Modus getestet – die Ereignisreaktion ist ein Beispiel für die Nutzung von Ultrafast. Wenn ein Alarm ausgelöst wird, müssen Ingenieure ein genaues Bild des Ereignisses erstellen, während sich Systeme und Beweise noch ändern. Mit der Intelligenz auf Sol-Ebene kann das Team schnell Protokolle lesen, Ablaufverfolgungen analysieren, Gespräche zusammenfassen, die nächsten zu prüfenden Schritte festlegen und bei der Vorbereitung oder Überprüfung von Korrekturen helfen. Der Ultrafast-Modus verkürzt die Verzögerungen zwischen dem Erkennen von Signalen, dem Überprüfen von Hypothesen und der Auswahl der nächsten Maßnahme, während die Ingenieure weiterhin für die Beurteilung und Bereitstellung verantwortlich sind.

Auf der Forschungsseite nutzt das OpenAI-Team Ultrafast, um schnell in Wissensdatenbanken zu suchen, Daten abzufragen und Informationen aus verschiedenen Tools schnell zu sammeln, zu ordnen und zusammenzufassen. Der übliche Ablauf in früheren Forschungsphasen bestand darin, dass Teammitglieder eine Reihe von Experimenten über Nacht starten und die Ergebnisse am nächsten Morgen prüfen. Mit Ultrafast kann der Entdeckungsprozess verkürzt werden, sodass mehrere Iterationen innerhalb eines Arbeitstages möglich sind.

Der Durchbruch des Ultrafast-Modus liegt darin, dass er den Engpass der Speicherbandbreite herkömmlicher GPU-Cluster in der Dekodierungsphase der Inferenz großer Modelle durchbricht. Die Umsetzung basiert hauptsächlich auf der Wafer-Level-Hardwarearchitektur von Cerebras.

Unter den KI-Chipherstellern ist die Lösung von Cerebras einzigartig: Seine Chips der verschiedenen Generationen werden aus ganzen Wafern hergestellt und integrieren eine riesige Anzahl von Rechenkernen und ein ultraschnelles Verbindungsnetz auf einem einzigen Chip.

Herkömmliche GPUs sind bei der Ausführung der autoregressiven Dekodierung zur Generierung von Tokens bei großen Modellen durch die Bandbreite des Grafikspeichers eingeschränkt, sodass die riesigen Modellgewichte ständig zwischen dem externen HBM und den Rechenkernen hin- und hertransportiert werden müssen. Gleichzeitig führt die Aufteilung auf mehrere Karten zu Kommunikationsverzögerungen durch die Inter-Chip-Verbindung (PCIe/NVLink).

Jeder der neuesten Wafer-Level-Chips (WSE-3) von Cerebras integriert 4 Billionen Transistoren, eine KI-Rechenleistung von 125 Petaflops und einen On-Chip-Hochgeschwindigkeits-SRAM von bis zu 44 GB. Alle Modellparameter befinden sich direkt dauerhaft im On-Chip-SRAM mit extrem hoher Bandbreite, sodass die Wartezeit durch das wiederholte Laden von Gewichten aus dem externen Speicher entfällt.

Natürlich übersteigt die vollständige Anzahl der Parameter von GPT-5.6 Sol als fortschrittliches Flaggschiffmodell offensichtlich die Kapazität des Chips. Cerebras verfügt zudem über den Mechanismus des „Pipelined across wafers“, bei dem die verschiedenen Netzschichten des Modells auf mehrere Wafer verteilt werden, wobei die Parameter jeder Schicht dauerhaft im SRAM des jeweiligen Chips gespeichert sind, sodass Token nahtlos im Fluss zwischen den Wafern übertragen werden können.

Für viele Nutzer großer Modelle bedeutet die 14-fache Geschwindigkeitssteigerung des Flaggschiffmodells, dass viele Aufgaben, für die früher unbedingt auf sekundäre Modelle wie Luna und Terra gewechselt werden musste, nun direkt und uneingeschränkt mit voller Leistung ausgeführt werden können. Bei Agent-Aufgaben, die mehrere Runden von Tool-Aufrufen, Fehlerbehebung bei Codegenerierung und komplexes verkettetes Denken erfordern, können Prozesse, die früher mehrere Stunden dauerten, auf wenige Minuten verkürzt werden.

Eine höhere Geschwindigkeit könnte auch bedeuten, dass sich die Art und Weise, wie wir KI nutzen, verändert:

In der KI-Community freuen sich die Menschen bereits auf die Ultrafast-Modi der Luna- und Terra-Versionen – es bleibt nur abzuwarten, ob die Chips von Cerebras ausreichen.

Quellenangaben:

https://openai.com/index/previewing-ultrafast/

https://www.cerebras.ai/blog/accelerating-gpt-5-6-sol-ultrafast-with-openai

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Machine Heart“ (ID: almosthuman2014), Autor: Machine Heart, das sich auf große Modelle konzentriert, veröffentlicht mit Genehmigung von 36Kr.