StartseiteArtikel

Der weltweit in allen sozialen Medien viral gewordene neue Top-KI-Star Jev, der kein einziges Wort spricht – wie zum Teufel soll man damit überhaupt spielen?

爱范儿2026-09-20 19:00
Das angesagteste Modell in der KI-Szene verfolgt einen ganz anderen Ansatz als ChatGPT.

Immer wieder tauchen neue Modelle auf, die der ganzen Welt beweisen wollen, dass sie schreiben und chatten können. Das derzeit beliebteste, überall im Internet verbreitete Top-Modell ist aber Jev.

Es spricht nicht.

Diogo Almeida ist Forscher bei OpenAI, er war an der Entwicklung von ChatGPT beteiligt und entwickelte später den Algorithmus für verstärkendes Lernen auf Basis menschlichen Feedbacks (RLHF).

Dies hat in gewisser Weise die Richtung der großen Sprachmodelle der letzten Jahre bestimmt. Doch während diese Methode die gesamte Branche zum Wohlstand führte, wurde Almeida ihr gegenüber immer skeptischer.

„Wir haben eine einmalige erfolgreiche Innovation, aber wir haben sie nicht zu etwas wirklich Nützlichem gemacht.“

Er brauchte lange, um herauszufinden, wo das Problem liegt: Wir haben ständig die Fähigkeit zur Verarbeitung menschlicher Sprache optimiert... In vier Jahren sind wir sehr gut darin geworden, menschliche Sprache zu verarbeiten, aber das ist für die Automatisierung nicht nützlich, da Computer eine andere „Sprache“ verwenden.

Vor zwei Jahren verließ Almeida OpenAI und gründete zusammen mit Erik Gafni und Sasha Sheng TypeSafe AI. Das Unternehmen blieb bis zum 15. September im Verborgenen, bevor es offiziell vorgestellt wurde – gleichzeitig gab es zwei Neuigkeiten: eine Seed-Finanzierungsrunde über 40 Millionen US-Dollar, angeführt von DCVC, und ihr erstes Modell Jev.

Jev ist weiterhin ein auf Transformer basierendes Modell, aber es ist bewusst kein großes Sprachmodell und gibt keine vollständigen Sätze aus.

Wenn Sie ihm einen Programmzustand und eine vordefinierte Frage übergeben, gibt es eine typisierte Antwort, eine Option, einen Wert oder eine Wahrscheinlichkeit zwischen 0 und 1 zurück, ergänzt um einen Konfidenzwert.

TypeSafe nennt diese Ausgabe „kalibrierte Entscheidungen“. Das ist auch der Grund, warum viele Menschen zunächst verwirrt waren, als der Name Jev zum ersten Mal öffentlich bekannt wurde.

Der Screenshot zeigt den Leistungsvergleich zwischen Jev und großen Sprachmodellen bei der Bearbeitung derselben Anfrage.

Das beliebteste Modell im KI-Bereich verfolgt einen anderen Ansatz als ChatGPT

Um zu verstehen, was Jev macht, sollten Sie zunächst die Denkgewohnheiten für große Sprachmodelle ablegen.

Das wird in einem Kundenservice-Szenario leicht verständlich. Ein Nutzer sendet eine Nachricht: Der Zahlungsdienst ist seit mehreren Tagen nicht erreichbar, was das Geschäft beeinträchtigt. Nun müssen mehrere Entscheidungen getroffen werden: Soll das Problem an das Technikteam oder das Buchhaltungsteam weitergeleitet werden, wie unzufrieden ist der Nutzer und wie dringend ist die Angelegenheit?

Gemäß dem Schnittstellendesign von TypeSafe teilen sich die Fragen in derselben Anfrage eine gemeinsame Eingabe, werden aber unabhängig und parallel ausgewertet. Klassifizierung und Dringlichkeit können gemeinsam bearbeitet werden.

Genauer gesagt hat die Ausgabe drei grundlegende Formen. Die erste heißt Choice: Sie wählt einen Eintrag aus einer von Ihnen definierten Liste aus, unterstützt maximal 255 Optionen und eignet sich für Routing und Klassifizierung. Die zweite heißt Score: Sie bewertet die Eingabe auf einer von Ihnen festgelegten Skala, um Dringlichkeit, Qualität oder Risiko zu messen. Die dritte heißt Noul, im Wesentlichen eine Ja-Nein-Entscheidung, deren Antwort eine Zahl ist, die die Wahrscheinlichkeit darstellt, dass diese Tatsache zutrifft.

Jede Antwort wird mit einer vollständigen Wahrscheinlichkeitsverteilung und einem Konfidenzwert geliefert. Es handelt sich um ein stark typisiertes Ergebnis, es sind keine JSON-Prompts erforderlich, kein zusätzlicher Parser wird benötigt und Sie müssen sich keine Sorgen machen, dass das Ergebnis plötzlich in einem Markdown-Codeblock eingebettet wird.

Der direkte Vorteil dieser Methode ist Zeit- und Kostenersparnis sowie die Verringerung von Formatfehlern, die durch freie Generierung entstehen.

Die von TypeSafe veröffentlichten Zahlen zeigen, dass die End-to-End-Latenz von Jev zwischen 70 und 500 Millisekunden liegt, was 20 bis 200 Mal schneller ist als bei vergleichbaren großen Sprachmodellen.

Gemäß dem aktuellen öffentlichen Preis beträgt die Eingabe 42 US-Dollar pro Milliarde Token, was nach üblicher Angabe 0,042 US-Dollar pro Million Token entspricht; die Ausgabe ist kostenlos. Neue Fragen und Optionsbeschreibungen belegen zwar weiterhin Eingabe-Token, es fallen aber keine zusätzlichen Kosten nach der Länge der generierten Antwort an.

Da Nutzer das Ausgabeergebnis im Voraus definieren können, erzeugt das Modell keine Halluzinationen. (Dass Jev keine Halluzinationen erzeugt, bedeutet, dass es nicht außerhalb des vordefinierten Optionsbereichs falsche Antworten gibt, aber Fehler innerhalb des Optionsbereichs sind weiterhin möglich.)

In einer öffentlichen Ably-Pong-Demonstration traf Jev 47 Handlungsentscheidungen innerhalb von 12 Sekunden, während Gemini, Claude und GPT in derselben Zeit nur zwei bis drei Entscheidungen trafen, obwohl die letzteren in den meisten Fällen weiterhin richtige Urteile lieferten.

In der Ably-Pong-Demonstration übergab das Programm Jev direkt die Zahlen aus dem Spiel: die Position des Balls, die Bewegungsrichtung, die Position des Schlägers sowie die vertikale Koordinate, an der der Ball voraussichtlich die Position des Schlägers erreicht. Jev kann anhand dieser Zahlen eine der drei Optionen „nach oben, nach unten, stillhalten“ auswählen.

Welche Einsatzmöglichkeiten gibt es für Jev?

Um mit Jev ein spielbares Produkt zu erstellen, werden ein Spielprogramm und Echtzeitkommunikation benötigt. Bei dem genannten Projekt steuert das Backend den Spielablauf, ruft das Modell auf und sendet den neuen Zustand über Ably an den Browser. Das heißt, die Spielregeln, die Grafik und die Netzwerkverbindung werden nicht von Jev erzeugt, es wird nur in den wiederholt ausgeführten Schritt mit der Auswahl aus drei Optionen eingefügt.

Die Geschwindigkeit führt zu einer Erweiterung der Anwendungsbereiche. Jev kann als Entscheidungsebene für Computeroperationen fungieren und Agenten anleiten, Anweisungen schnell auszuführen; es kann auch zur Kontextkompression verwendet werden, um zu beurteilen, welche Inhalte wichtige Informationen sind, und so den Kontext von Millionen von Token schnell einzugrenzen.

Das öffentliche Projekt jev-ultrafast von Browser Use realisiert konkret einen Browser-Agenten. Bei jeder neuen Webseite liest er zuerst die aktuell bedienbaren Seitenelemente aus und erstellt eine nummerierte Liste: Welches Element ist ein Button, welches ein Eingabefeld, wie heißt es und was ist derzeit darin eingetragen.

Jev erhält diesen strukturierten Zustand, das Nutzerziel und den Verlauf der durchgeführten Aktionen. Der Auswahlraum, den das Programm ihm gibt, wird dynamisch aus den tatsächlich auf der aktuellen Seite vorhandenen Elementen erzeugt.

Jev als Operationsebene verwenden, um das Modell anzuleiten, schnell den Computer zu bedienen: https://x.com/gregpr07/status/2100411066966749359

Am Beispiel der Flugbuchung kann das Ziel lauten: „Suchen Sie einen Einzelflug von Zürich nach London, legen Sie das angegebene Datum, die Anzahl der Personen und die Kabinenklasse fest und stoppen Sie, wenn passende Ergebnisse angezeigt werden.“

In jeder Runde stellt das Programm gleichzeitig mehrere Fragen: Soll der nächste Schritt ein Klick, eine Eingabe, die Auswahl einer Dropdown-Option oder ein Warten sein? Wenn geklickt werden soll, welche Nummer soll ausgewählt werden? Wenn eine Eingabe erfolgen soll, welches Eingabefeld soll verwendet werden? Diese Fragen teilen sich denselben Webseiten-Zustand, werden aber separat beantwortet.

Am Ende verwendet das Programm nur das Ergebnis, das zur tatsächlichen Operation passt: Wenn ein Klick ausgewählt wurde, wird das Klickziel verwendet, die anderen Antworten werden vorübergehend nicht berücksichtigt.

Wenn ein Städtename eingegeben werden muss, ruft das Programm separat ein kleines Modell zur Texterzeugung auf, das anhand des Ziels und des aktuellen Eingabefelds den einzutragenden Inhalt erstellt. Nachdem der Browser die Aktion ausgeführt hat, liest er den neuen Zustand der Seite aus.

Jev beurteilt die wichtigen Informationen im Kontext und realisiert nahezu sofortige Kontextkompression: https://x.com/tamarajtran/status/2100694549362553153

Pranit Sharma, Software-Ingenieur bei Vercel, gibt an, dass sein Unternehmen ChatGPT Luna 5.6 von OpenAI verwendet hat, um einen Klassifikator auszuführen, der die Sicherheit von Befehlen prüft. Nachdem Vercel OpenAI Luna durch Jev ersetzt hat, stieg die Verarbeitungsgeschwindigkeit um das 5- bis 18-fache und die Genauigkeit verbesserte sich erheblich.

Ein weiterer Entwickler, Nikhil Mudholkar, CTO von Bryo AI, hat ebenfalls Jev und Gemini getestet, um ihre Leistung bei der Klassifizierung von Geschäftsmails zu bewerten. In seinem Test war die Genauigkeit von Gemini etwas höher, aber die Kosten lagen um das 10- bis 20-fache höher.

Sie können diesen Ansatz auch selbst nachbauen: Erstellen Sie zuerst eine Tabelle, in der jede Zeile den Titel der E-Mail, den Text, das Empfangsdatum und die erforderlichen Kontextinformationen enthält.

Anschließend teilen Sie das Geschäft in klare Fragen auf. Beispielsweise kann bei einer E-Mail mit dem Inhalt „Die Bestellung wurde doppelt abgebucht, ich hoffe, das Problem wird heute bearbeitet“ mit Choice entschieden werden, ob die E-Mail in die Warteschlange für Kundendienst, Vertrieb, Kooperation oder andere Bereiche eingeht; mit Noul kann beurteilt werden, ob der Absender explizit eine Handlung verlangt; und mit Score kann die Priorität der Bearbeitung festgelegt werden.

„Letztendlich verlagert dieser Ansatz die Verantwortung für den Umgang mit Halluzinationen ein wenig auf den Nutzer“, erklärt Armin Ronacher, CTO von Earendil. „Der Nutzer muss entscheiden: Wenn die Wahrscheinlichkeit für einen Sachverhalt nur 50 % beträgt, kann man ihn vielleicht ignorieren. Aber wenn die Wahrscheinlichkeit 95 % erreicht, kann ich ihn nutzen.“

Ronacher gibt an, dass ein weiteres potenzielles Anwendungsgebiet von Jev das Modell-Routing ist. Es ist nützlich, vorherzusagen, ob eine bestimmte Aufgabe ein spezialisiertes Modell erfordert, aber die Verwendung großer Sprachmodelle für diese Aufgabe wäre sehr teuer. Da Jev kostengünstig ist und schnell läuft, kann es diese Echtzeit-Routing-Funktion realisieren.

Automatische Zuweisung des passenden Modells zur Bearbeitung je nach Komplexität der Aufgabe: https://x.com/mdlahfir/status/2100314182201802811

Die klügste Entscheidung

Der Name Jev leitet sich von dem Ökonomen William Stanley Jevons aus dem 19. Jahrhundert ab. Das von Jevons aufgestellte Paradoxon besagt: Wenn die Kosten eines Gutes sinken, wird dieses Gut immer häufiger verwendet. In diesem Fall sollte der Rückgang der Kosten für Intelligenz zu einer breiten Anwendung von Intelligenz führen.

Das heißt, sobald der Aufruf günstiger wird, wird er in vielen Bereichen eingesetzt, für die er vorher nicht lohnenswert war. Al