Ist Jev, der im gesamten Internet über alle Maßen angepriesen wird, wirklich so unglaublich?
Fast 40 Millionen Menschen haben es verfolgt, mehr als 70.000 Nutzer haben es geliked – eine KI, die nicht einmal sprechen kann, hat die gesamte KI-Branche in Aufregung versetzt?
Freunde, die die Entwicklungen im KI-Bereich verfolgen, wissen bestimmt, dass kürzlich ein Modell namens Jev viral geworden ist. Sein offizieller Ankündigungs-Tweet hat bereits fast 40 Millionen Aufrufe erzielt.
Sein Gründer hat ebenfalls einen beachtlichen Hintergrund: Er ist ehemaliger OpenAI-Forscher und zählt zu den Schlüsselfiguren bei der Entwicklung von ChatGPT.
Das Besondere an Jev ist, dass es ein „Modell ohne Sprechfähigkeit“ ist. Die Entwickler haben es als System-One-Modell bezeichnet, eine KI, die nur für Entscheidungen zuständig ist und keine Ausgaben in natürlicher Sprache erzeugt.
Während andere große KI-Modelle das menschliche Denken nachahmen, lässt sich Jev als Nachahmung der menschlichen Intuition beschreiben: Es trifft innerhalb kürzester Zeit die Entscheidung, die es für die am meisten richtige hält.
Die Entwickler haben zudem angegeben, dass ein einzelner Aufruf von Jev nur 70 bis 500 Millisekunden dauert. Der Preis ist unglaublich niedrig: Nur 0,042 US-Dollar pro Million Eingabe-Token, und Ausgaben sind völlig kostenlos, der Preis ist so niedrig, dass er kaum messbar ist!
Nach der Veröffentlichung dieses Modells gerieten die Nutzer im Internet sofort in eine hitzige Debatte.
Einige Nutzer sind der Meinung, dass Jev die Zukunft darstellt. Seine Geschwindigkeit ist so hoch, dass viele Leute bereits damit begonnen haben, sehr ungewöhnliche Anwendungsfälle zu entwickeln – zum Beispiel kann es an WeChat angeschlossen werden, um die Absichten von Vorgesetzten zu analysieren.
Einige Nutzer haben damit Minecraft in 8 Minuten und 43 Sekunden durchgespielt, außerdem kann es Spiele wie Subway Surfers und Super Mario spielen.
Sogar ein Nutzer hat berichtet, dass er mit Jev einen Echtzeit-Handelsroboter gebaut hat – der ihm allerdings 31.680 US-Dollar Verlust eingebracht hat.
Aber eine andere Gruppe von Nutzern hat sofort Einwände erhoben: Wenn man euch so zuhört, sind das nicht alles Dinge, die auch alte Klassifikationsmodelle schon schaffen konnten? Das scheint doch reine Marketingwerbung zu sein.
Also ist eine KI, die nur Multiple-Choice-Aufgaben lösen kann, wirklich so leistungsstark?
Ich habe drei Spiele vorbereitet, um die Leistung von Jev zu testen. Zuerst das Fazit: Es kann die Spiele spielen, aber es ist wirklich nicht besonders gut darin...
Da jemand behauptet hat, dass es Spiele sehr schnell durchspielen kann, habe ich sein Open-Source-Projekt verwendet, einen Minecraft-Server erstellt, Jev als Spieler teilnehmen lassen und den gesamten Vorgang beobachtet.
Allerdings wurde darauf hingewiesen, dass man nicht nur Jev verwenden kann, sondern ein intelligenteres Modell als „Berater“ eingesetzt werden muss. Also habe ich GLM 5.3 als Unterstützung hinzugefügt.
Nach mehreren Versuchen hat es das Spiel tatsächlich durchgespielt: Es ist in das Nether gegangen, dann in das End, und hat den Enderdrachen schließlich mit Sprengbetten getötet – die gesamte Zeit betrug 12 Minuten und 39 Sekunden. Das klingt doch ziemlich beeindruckend, oder?
Aber wenn man sich den Quellcode ansieht, erkennt man, dass der Unterschied zu einem echten, selbstständigen Speedrun sehr groß ist. Der Entwickler hat bestätigt, dass der Code alle erforderlichen Wege auf der Karte im Voraus markiert hat, und für den Kampf gegen den Drachen wurde ein fest vordefiniertes Modul verwendet.
Und das Wichtigste: Von den 274 Entscheidungen, die Jev getroffen hat, hatten 250 Aufgaben nur eine einzige Option. Das ist ein komplett vorbereitetes Spiel – nach dem Anschauen hatte ich das Gefühl, dass ich zum Narren gehalten wurde.
Kein Wunder, dass ich es manchmal in Lava schwimmen und manchmal nur auf der Stelle drehen gesehen habe – seine Leistung ist wirklich sehr enttäuschend.
Dann habe ich beschlossen, selbst ein einfaches Spiel zu programmieren. Zum Beispiel das Spiel „Dou Dizhu“ ist im Grunde auch ein Spiel, bei dem man Karten auswählt. Also habe ich eine 1-gegen-1-Version von Dou Dizhu erstellt, um gegen Jev zu spielen – fragt mich nicht, warum es 1 gegen 1 ist, ich habe wirklich Angst gehabt, dass es mit mehr Spielern überfordert ist.
Dann habe ich eine Runde gegen Jev gespielt – und leider habe ich verloren. In der Endphase des Spiels habe ich ein Paar 9 ausgespielt, und es hat sofort mit einem Königspaar-Joker geantwortet und mich besiegt. Das lag einfach an meinen schlechten Fähigkeiten.
Aber es war interessant, dass ich dieselbe Endphase mehrmals wiederholt habe: In 6 von 10 Runden hat es den Königspaar-Joker ausgewählt, in 2 Runden hat es stattdessen ein Paar K gespielt.
Wahrscheinlich liegen die Wahrscheinlichkeiten für den Königspaar-Joker und das Paar K in dieser Situation sehr nah beieinander, sodass kleine Abweichungen bei der Berechnung jedes Mal zu einer anderen Entscheidung führen können.
So gesehen trifft es nicht jedes Mal dieselbe Entscheidung für dieselbe Aufgabe – es ähnelt sehr einem Menschen, der seine Meinung ständig ändert.
Da es sich um ein Kartenspiel handelt, habe ich mich entschieden, Slay the Spire auszuprobieren. Dieses Spiel besteht ja auch aus einer Kette von Multiple-Choice-Entscheidungen. Also habe ich Jev ohne weitere Unterstützung spielen lassen, keine zusätzlichen Hilfsmittel, nur das Spiel selbst.
Es hat 10 Runden nacheinander gespielt, hat das Spiel aber nicht durchgespielt. Die beste Runde hat es bis zur 19. Etage geschafft, im Durchschnitt ist es um die 11. Etage herum gestorben – das ist eigentlich schon ein ganz passables Ergebnis.
Aber eine Runde war sehr auffällig: Es hatte noch 16 Lebenspunkte, 3 Energiepunkte und 3 Verteidigungskarten in der Hand, und das Monster würde ihm 18 Punkte Schaden zufügen.
Es hat tatsächlich gewählt, die Runde zu beenden – und dann war das Spiel für es vorbei.
Als ich die Protokolle durchgelesen habe, habe ich herausgefunden, dass die 3 Verteidigungskarten als drei separate Optionen aufgelistet waren. Jev hat ihnen jeweils 17, 20 und 18 Punkte gegeben, während die Option „Runde beenden“ 21 Punkte erhalten hat – also hat es sich entschieden, keine Karte zu spielen.
Das zeigt, dass die Entscheidungen von Jev sehr leicht von der von Menschen gestalteten Umgebung beeinflusst werden können.
Das liegt an der Funktionsweise von Jev: Wenn es eine Multiple-Choice-Aufgabe bearbeitet, gibt es keine direkte einzelne Antwort aus, sondern erzeugt eine Wahrscheinlichkeitsverteilung für alle Optionen.
Als unser Programm die drei Verteidigungskarten als drei separate Optionen aufgelistet hat, konnte Jev nicht flexibel reagieren. Die Wahrscheinlichkeit, die eigentlich auf die Aktion „Verteidigen“ entfallen sollte, wurde auf drei Teile aufgeteilt, sodass sie niedriger war als die Wahrscheinlichkeit für „Runde beenden“ – das hat schließlich zu seinem Tod geführt.
Welche Aktionen als eine einzelne Option gezählt werden und ob