StartseiteArtikel

Elon Musk veröffentlichte das neue Grok-Modell, das an der Spitze der Bewertungen für intelligente Agenten steht und um die Hälfte günstiger ist als das von OpenAI.

智东西2026-07-30 11:14
Die Reaktionszeit beträgt nur 0,7 Sekunden.

Bericht von Zhidx vom 30. Juli: Heute hat SpaceXAI unter der Leitung von Elon Musk die Einführung des neuen Sprachmodells der nächsten Generation Grok Voice Think Fast 2.0 angekündigt, das das bislang leistungsstärkste Speech-to-Speech-Modell des Unternehmens ist.

Elon Musk hat zwei Tweets nacheinander veröffentlicht. Im ersten kündigte er an, dass „Grok Voice jetzt den ersten Platz bei der Leistung von Agenten belegt“, und im zweiten rief er die Nutzer direkt auf, „das neue Grok Voice auszuprobieren“.

Elon Musk veröffentlicht den Beitrag

In dem Speech to Speech Index der angesehenen Bewertungsstelle Artificial Analysis belegt die Version mit hoher Schlussfolgerungsfähigkeit von Grok Voice Think Fast 2.0 mit einem Ergebnis von 82,9 % den zweiten Platz, nur hinter Qwen Audio 3.0 Realtime Plus (84,1 %); im Tau-Voice-Benchmark, der die Leistung von Agenten misst, rangiert dieses Modell mit einem Ergebnis von 56,5 % auf dem ersten Platz und schlägt die Sprachmodelle von Herstellern wie OpenAI, Google und Alibaba Qwen.

Was noch bemerkenswerter ist, dass die durchschnittliche Antwortzeit für das erste Audiosegment dieses Modells nur 0,70 Sekunden beträgt und es das einzige Modell unter den ersten fünf der Rangliste ist, das unter 1 Sekunde liegt, was eine deutliche Verbesserung gegenüber dem Vorgängermodell Grok Voice Think Fast 1.0 mit 1,25 Sekunden darstellt.

Was die Preisgestaltung betrifft, kostet Grok Voice Think Fast 2.0 0,08 US-Dollar pro Minute (entspricht etwa 4,80 US-Dollar pro Stunde eingehenden Audios), was gegenüber den 3,00 US-Dollar des Vorgängermodells gestiegen ist, aber nur etwa 45 % des Preises von GPT-Realtime-2.1 High beträgt.

In den Kommentarbereichen zeigen viele Nutzer hohe Erwartungen an das neue Modell.

Einige Nutzer gaben an, dass sie hoffen, mit Grok Voice mehrrollige Hörspiele zu erstellen.

Ein anderer Entwickler sagte, dass er bisher hauptsächlich Gemini verwendet hat und jetzt endlich eine neue Alternative hat.

01. Viele Entwickler geben nach praktischen Tests positive Bewertungen: Sehr schnelle Antworten, natürlichere Gespräche

Nick White, CEO des KI-Unternehmens Helionova AI, hat seine praktischen Erfahrungen auf X geteilt.

Er erklärte, dass er das Full-Stack-Echtzeit-Sprachupgrade für grok-voice-think-fast-2.0 auf seinem eigenen Produkt Tradecraft abgeschlossen habe, was „absolut ein sprunghafter Fortschritt“ sei.

In dem von Nick White veröffentlichten Testaudio ließ er Grok Voice einen Kunden spielen, der wütend beschwert, weil das Wartungspersonal einen Termin verpasst hat, während er selbst den Kundendienstmitarbeiter spielte, und die beiden führten einen mehrstufigen Echtzeit-Telefongespräch über die verspätete Terminvereinbarung.

Während des gesamten Prozesses gibt es kaum merkliche Pausen im Modell, es kann die Handlung entsprechend dem Gesprächsinhalt kontinuierlich vorantreiben und in Echtzeit auf die Antworten des Kundendienstes reagieren.

Ein anderer Entwickler hat Think Fast 2.0 in das Terminal-Tool GrokTerm integriert, um die Gesprächsgeschwindigkeit von Grok Voice Think Fast 2.0 zu demonstrieren.

In dem Video bittet der Tester zuerst das Modell, die Highlights der neuen Version vorzustellen, und das Modell antwortet extrem schnell. Anschließend gibt der Tester nacheinander Anweisungen wie „Wechsle das Thema der App zum Cyberpunk-Stil“, „Wechsle zurück zum ursprünglichen Thema“, „Wechsle zum anderen Bildschirm“, „Wechsle wieder zu Cyberpunk“ usw., das Modell reagiert schnell und führt alle Operationen durch, und antwortet flüssig während des gesamten Prozesses.

Parker Conrad, Software-Ingenieur bei SpaceXAI, schrieb auch: „Das gesamte Sprachteam hat enorme Anstrengungen, Überlegungen und Leidenschaft hineingesteckt. Die Intelligenz, Genauigkeit und Fähigkeiten des Modells fühlen sich fast unwirklich an. Der Sprachbereich ist immer noch voller Reibungsverluste, und Think Fast 2.0 macht einen großen Schritt in Richtung des Ziels „sofort einsatzbereit“ – genau so sollte ein Sprachmodell sein.“

02. Antwortzeit nur 0,7 Sekunden, schnellere Schlussfolgerung, genauere Erkennung

Grok Think Fast 2.0 ist als Sprachmodell der nächsten Generation positioniert, und seine Verbesserungen konzentrieren sich auf drei Bereiche: Modellfähigkeit, Antwortgeschwindigkeit und Schlussfolgerungseffizienz.

Zuerst die Modellfähigkeit.

Laut den von Artificial Analysis veröffentlichten Daten erreicht die Gesamtpunktzahl von Think Fast 2.0 82,9 %, was um 7,2 Prozentpunkte höher ist als die 75,7 % der Vorgängerversion.

Dabei erreicht es 97,2 % im Big Bench Audio-Sprachschlussfolgerungstest; der Full Duplex Bench, der das Erlebnis der Echtzeit-Sprachinteraktion mehrerer Personen misst, erreicht 95,1 %, was eine deutliche Verbesserung gegenüber den 77,8 % der Vorgängerversion darstellt; der Tau-Voice-Sprachagententest erreicht 56,5 % und belegt damit derzeit den ersten Platz in dieser Rangliste.

Gleichzeitig ist das neue Modell auch das Modell mit der schnellsten Antwortgeschwindigkeit unter den ersten fünf der aktuellen Rangliste.

Seine durchschnittliche erste Sprachantwortzeit beträgt nur 0,70 Sekunden, schneller als GPT-Realtime-2 High (1,14 Sekunden), GPT-Realtime-2.1 High (1,21 Sekunden) und Think Fast 1.0 (1,25 Sekunden).

Neben der Geschwindigkeit hat Grok Think Fast 2.0 auch die Spracherkennung stark optimiert.

In Tests mit 24 Sprachen und Tausenden von Phrasen ist die gesamte Transkriptionsgenauigkeit von Think Fast 2.0 im Vergleich zu Think Fast 1.0 um etwa das 1,4-fache gestiegen und im Vergleich zu Deepgram Nova 3 und ElevenLabs Scribe v2 um etwa das 1,5- bis 2-fache.

In realen Szenarien mit starkem Hintergrundrauschen und Telefonkompression wird dieser Vorteil noch größer, und der Erkennungsfehler kann um etwa das 10-fache reduziert werden.

Eine weitere Änderung betrifft die Schlussfolgerungseffizienz.

Im Gegensatz zu vielen Sprachmodellen, die zuerst die Schlussfolgerung abschließen müssen, bevor sie Sprache generieren, unterstützt die Think-Fast-Serie die Durchführung der Schlussfolgerung während des Sprechens, sodass komplexe Aufgaben bei gleichzeitig niedriger Latenz verarbeitet werden können.

Think Fast 2.0 optimiert weiter die Effizienz der Nutzung von Schlussfolgerungs-Tokens, wobei der Median des Verbrauchs an Schlussfolgerungs-Tokens nur etwa 40 % der Vorgängerversion beträgt. Das bedeutet, dass der Tool-Aufruf normalerweise bereits vor Ende des ersten Satzes des Modells ausgeführt wird, was die gesamte Antwortzeit weiter verkürzt.

Neben der Schlussfolgerungseffizienz wurde auch die Gesprächsweise angepasst. Das Entwicklungsteam hat eine große Menge an Verstärkungslernungsdaten verwendet, um das Modell der echten menschlichen Kommunikationsweise näher zu bringen. Im Vergleich zu früheren Versionen verwendet das neue Modell mehr kurze Sätze, stellt jeweils nur eine Frage und vermeidet nach Möglichkeit langwierige, sich wiederholende Ausdrücke.

Aus Sicht der Nutzer ist der gesamte Kommunikationsprozess natürlicher, und selbst wenn das Modell im Hintergrund komplexe Prozessplanungen durchführt, werden die Nutzer keine merkliche Wartezeit spüren.

03. Schlussfolgerung: Der Wettbewerb um Sprachmodelle tritt in das „Zeitalter der Agenten“ ein

Im vergangenen Jahr haben Hersteller wie OpenAI, Google und Alibaba Qwen ihre Echtzeit-Sprachmodelle kontinuierlich verbessert, und der Schwerpunkt des Wettbewerbs hat sich allmählich von Spracherkennung und Sprachsynthese hin zur Verarbeitung komplexer Aufgaben, mehrstufigen Gesprächen und Fähigkeiten zum Aufruf von Tools verschoben.

Aus dieser Veröffentlichung geht hervor, dass SpaceXAI diese Richtung fortgesetzt hat.

Einerseits verbessert Think Fast 2.0 die Fähigkeiten zur Sprachschlussfolgerung, Echtzeitinteraktion und Spracherkennung weiter; andererseits soll es durch „Schlussfolgern während des Sprechens“, niedrigeren Verbrauch an Schlussfolgerungs-Tokens und schnellere Geschwindigkeit beim Aufruf von Tools ermöglichen, dass Sprachagenten echte Geschäftsszenarien wie Kundendienst, Telefonassistent und Vertrieb wirklich übernehmen können.

Aus der neuesten Rangliste von Artificial Analysis geht hervor, dass Think Fast 2.0 bereits den ersten Platz bei den Fähigkeiten von Sprachagenten (Tau Voice) belegt hat und unter die Spitzengruppe der Gesamtliste für Speech-to-Speech eingestiegen ist.

Wenn das Standardmodell am 5. August das Upgrade abgeschlossen hat, wird seine tatsächliche Leistung in weiteren Anwendungen von Entwicklern und Unternehmen weiter überprüft.

Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „Zhidx“ (ID: zhidxc om), Autor: Jiang Yu, Redakteur: Li Shuiqing, veröffentlicht mit Genehmigung von 36Kr.