StartseiteArtikel

Wofür ist das von Silicon Valley total gehypte Jev eigentlich gut? Wir haben es persönlich für dich ausprobiert.

蓝字计划2026-09-24 18:43
Der nächste Manus-Moment?

Ein "exzentrischer Sonderling" im KI-Kreis ist plötzlich viral geworden. 

Am 15. September veröffentlichte TypeSafe Jev. Nur wenige Tage später taucht es bereits in Entwicklertools wie Vercel, Cloudflare, LangChain und Langfuse auf. Laut Vercel haben innerhalb von 24 Stunden nach der Integration von Jev in das AI Gateway fast 13 % der zahlenden Teams das Tool bereits genutzt.

Obwohl die Angebote im KI-Bereich überaus leistungsfähig erscheinen und viele Leute es kaum erwarten können, sie auszuprobieren, wissen die meisten noch nicht, wo sie anfangen sollen, wenn sie es selbst in die Hand nehmen wollen. Was muss man herunterladen? Muss man zuerst die Umgebung konfigurieren? Kann man es auch nutzen, ohne programmieren zu können? 

Aus diesem Grund nutzen wir die Gelegenheit, dass der Test derzeit kostenlos ist, um für alle die ersten Erfahrungen zu sammeln: Wir testen Jev selbst und versuchen, allen beizubringen, es ohne komplizierte Schritte zu nutzen. 

Aber vor dem Start muss man sagen: Nach unseren Tests liegt die erste Hürde von Jev niedriger als erwartet. Genau wie das frühere OpenClaw, von dem wir sagten, dass seine Konfigurationsanforderungen niedrig sind und es in Zukunft vielleicht sogar auf Smartwatches laufen kann. 

Die erste Nutzung von Jev ist noch einfacher: Man muss nicht einmal den Computer öffnen, sondern kann es direkt über die Webseite nutzen. 

Auf der anderen Seite hängt das von uns ausgewählte Testbeispiel eng mit den tatsächlichen Bedürfnissen der meisten Nutzer beim Surfen im Internet zusammen. Mit dem großen Boom der KI sind die Nachrichten in den sozialen Medien immer unübersichtlicher geworden. Welche Nachrichten sind wahr? Welche sind bloße Unsinnigkeiten? Welche wurden von KI erzeugt?

Den Schritt der "Nachrichtenprüfung", den früher niemand für jede einzelne Nachricht durchführen konnte, überlassen wir diesmal Jev. 

Mit Jev eine "scharfe Urteilskraft" entwickeln 

Mittlerweile gibt es bereits viele Zugänge, um Jev auszuprobieren. Zum Beispiel haben wir diesmal eine Drittanbieter-Website namens Jev AI Dev ausgewählt, auf der man alle grundlegenden Funktionen testen kann. Jeder Account hat täglich sechs kostenlose Testguthaben, was sich gut eignet, um sich erst einmal mit dem Tool vertraut zu machen. 

Die Adresse lautet: https://jevai.dev/zh-Hans/playground/

Wenn man diesen Link öffnet, gelangt man zur chinesischen Testseite. Klicken Sie zuerst oben rechts auf "Anmelden", melden Sie sich nach den Anweisungen an, und scrollen Sie dann nach unten, um die Punkte "Einzelne Frage" und "Mehrere Fragen" zu finden. 

Diese beiden Optionen lassen sich so verstehen: Sie verwenden dasselbe Material, um nur eine Frage zu stellen oder mehrere Fragen auf einmal zu stellen. Wenn Sie Jev beispielsweise eine technische Nachricht geben, können Sie es nur bitten zu beurteilen, "zu welcher Kategorie diese Nachricht gehört", oder gleichzeitig fragen, "wie vertrauenswürdig die Nachricht ist" und "ob die darin enthaltenen Aussagen belegt sind". 

Da wir ein Tool zur Informationsüberprüfung erstellen wollen, wählen wir diesmal "Mehrere Fragen", damit wir mehrere Fragen zu einer Nachricht gleichzeitig stellen können.

Scrollen Sie weiter nach unten, sehen Sie, dass die Seite standardmäßig ein Beispiel für die "Übergabe von Aufgaben an den KI-Assistenten" ausfüllt. Sie können dieses Beispiel direkt bearbeiten und den Inhalt durch Ihre eigenen Angaben ersetzen. 

Suchen Sie zuerst das Eingabefeld, löschen Sie den ursprünglichen Beispieltext und geben Sie diese Nachricht ein. 

„Am 23. September veröffentlichte ein KI-Unternehmen ein neues Modell und behauptet, dass seine Codierfähigkeit im Vergleich zur Vorgängergeneration um 30 % verbessert wurde. Bislang wurden jedoch nur Werbematerialien veröffentlicht, keine vollständigen Testdaten.“ 

Danach können Sie direkt die drei Funktionen von Jev ausprobieren: Choice, Score und Noul. Auch wenn die Namen zunächst unbekannt erscheinen, sind sie nach der Nutzung leicht verständlich: 

Bei Choice wählt Jev eine Antwort aus mehreren Optionen aus. Zum Beispiel legen wir einige Optionen fest, damit es beurteilt, wie der nächste Schritt für einen Inhalt aussehen soll. Nach der Übermittlung teilt es uns mit, welche Antwort es ausgewählt hat, und gibt gleichzeitig die Wahrscheinlichkeit für jede Antwort an. 

Wenn wir diese Nachricht klassifizieren wollen, müssen wir ihm zuerst mitteilen, welche Kategorien zur Auswahl stehen. Geben Sie unter "Frage / Anweisung" unter Choice ein: "Zu welcher Kategorie lässt sich diese Nachricht am besten einordnen?"

Anschließend können Sie den ursprünglichen Inhalt im Feld "Optionen" durch die folgenden vier Zeilen ersetzen: 

  • product: Produktveröffentlichung
  • performance: Leistungssteigerung
  • funding: Finanzierungsnachricht
  • other: Sonstiges

Wenn Jev schließlich "product" zurückgibt, bedeutet das, dass es die Nachricht als Kategorie "Produktveröffentlichung" einstuft. Damit haben wir Jev eine Multiple-Choice-Aufgabe gestellt. 

Es wählt eine der vier Antworten aus und gibt gleichzeitig die Wahrscheinlichkeit für jede Antwort an, sodass wir sehen können, wie stark es zu den einzelnen Optionen neigt.

Bei Score handelt es sich um eine Bewertung. Die Klassifizierung sagt uns nur, was für eine Nachricht es ist, aber nicht, wie sehr wir ihr vertrauen können. Deshalb brauchen wir ein zusätzliches Bewertungssystem zur Unterstützung. 

Geben Sie unter "Frage / Anweisung" bei Score ein: "Wie hoch ist der Grad der Vertrauenswürdigkeit dieser Nachricht?" 

Die "Bewertungsstufen" darunter müssen wir selbst festlegen. Geben Sie pro Zeile eine Stufe ein, sortiert von niedrig nach hoch: 

  • Sehr niedrig
  • Niedrig
  • Mittel
  • Hoch
  • Sehr hoch

Auf diese Weise geben wir Jev quasi einen Maßstab zur Bewertung an, um zu beurteilen, wie hoch die Vertrauenswürdigkeit des eingegebenen Materials wirklich ist. 

Die letzte Funktion ist Noul, was sich einfach als die Beantwortung von "Ja" oder "Nein" verstehen lässt.  Auf der Webseite heißt dieser Bereich "Probability (Noul)". 

Manchmal wollen wir noch genauere Informationen wissen als die Frage "Wie hoch ist die Vertrauenswürdigkeit?". Nehmen wir das ursprüngliche Beispiel: Wir könnten uns fragen, ob das Unternehmen wirklich Beweise dafür vorgelegt hat, dass die Codierfähigkeit um 30 % gestiegen ist. 

Geben Sie in diesem Bereich unter "Frage / Anweisung" ein: "Hat dieses Unternehmen bereits nachgewiesen, dass die Codierfähigkeit des neuen Modells im Vergleich zur Vorgängergeneration um 30 % gestiegen ist?", und ändern Sie die Definitionen für "Nein" und "Ja" darunter in die folgenden zwei Zeilen: 

  • false: Nicht nachgewiesen
  • true: Bereits nachgewiesen

An dieser Stelle sind alle drei Fragen eingerichtet. Lassen Sie uns noch einmal zusammenfassen: Durch diese Einrichtung lassen wir Jev die gleiche Nachricht klassifizieren, bewerten und beurteilen, ob die Aussage zur Leistungssteigerung belegt ist. Klicken Sie anschließend unten auf "Jev testen", um alle drei Fragen zu übermitteln.

Da dieser Test auf der Webseite läuft, können Sie das von Jev zurückgegebene Ergebnis sowohl auf dem Computer als auch auf dem Smartphone einsehen. 

Schließlich sehen Sie, dass Choice "product" ausgewählt hat, also "Produktveröffentlichung", mit einer entsprechenden Wahrscheinlichkeit von 0,62. Die Wahrscheinlichkeit für "Leistungssteigerung" beträgt 0,38. Jev beurteilt dies als eine Produktveröffentlichung. 

Die von Score vergebene Punktzahl beträgt 1,09. Im Vergleich zu den fünf festgelegten Stufen liegt dieses Ergebnis nahe an "niedriger Vertrauenswürdigkeit". 

Das Ergebnis von Noul beträgt 0,04, was bedeutet, dass es basierend auf dem von uns bereitgestellten Material eher der Ansicht ist, dass der Nachweis noch nicht erbracht wurde. 

Nach diesem gesamten Prozess hat Jev sein vorläufiges Urteil abgegeben: Eine Nachricht erhält eine Klassifizierung, eine Bewertung der Vertrauenswürdigkeit und eine Beurteilung der spezifischen Aussagen. Seine Grundlage ist jedoch nur der von uns eingegebene Text – es hat nicht selbst im Internet nach dem vollständigen Testbericht gesucht.

Aus diesem Grund führen wir die Tests weiter fort. Um ein echtes Tool zur automatischen Beurteilung der Echtheit zu erstellen, müssen wir Jev direkt über Python aufrufen, damit es uns einen automatischen Prüfprozess für technische Nachrichten erstellt. 

Vollautomatisch: Ein selbst erstelltes Prüftool 

Unterhalb der Startseite von Jevs Playground haben wir die KI-Modell-Aggregationsplattform OpenRouter gefunden. Nachdem Sie sich registriert, angemeldet und einen API-Schlüssel erstellt haben, können Sie Jev in Python aufrufen. 

Hier reicht die Erstellung eines normalen OpenRouter-API-Schlüssels, Sie müssen keinen separaten, speziell für Jev bestimmten Schlüssel beantragen.

Darüber hinaus werden die täglichen sechs kostenlosen Testguthaben der Drittanbieter-Website nicht auf OpenRouter übertragen. Stellen Sie vor der Ausführung sicher, dass auf Ihrem Konto ausreichend Guthaben verfügbar ist. 

Als Nächstes müssen Sie im Programm die zu beurteilende Nachricht, die zu stellenden Fragen und die auswählbaren Antworten eingeben. Das ist genau dasselbe wie das Ausfüllen der Formulare auf der Webseite zuvor, nur dass die Übermittlung und der Empfang der Ergebnisse nun von Python übernommen werden.

Für den ersten Test geben wir Jev eine Nachricht wie diese: 

„Ein KI-Unternehmen gibt bekannt, dass die Genauigkeit seines neuen Modells um 50 % gestiegen ist, aber bislang wurden keine Testmethoden, Datensätze oder vollständigen Testergebnisse veröffentlicht.“ 

Wir teilen Jev im Voraus mit, dass es nur drei Auswahlmöglichkeiten gibt: publish (veröffentlichen), verify (überprüfen), reject (ablehnen). Gleichzeitig lassen wir es die Vertrauenswürdigkeit dieser Nachricht beurteilen und prüfen, ob eine menschliche Prüfung erforderlich ist. 

Auch hier werden die drei zuvor genannten Funktionen verwendet. Choice übernimmt diesmal die Auswahl des nächsten Schritts, Score die Bewertung und Noul die Beurteilung, ob eine menschliche Prüfung erforderlich ist. Die Werte der letzten beiden Funktionen müssen in Kombination mit den im Programm festgelegten Bewertungsstandards und Prüfbedingungen verwendet werden.

Das Ergebnis lautet: Nächster Schritt: verify; Vertrauenswürdigkeit: 0,35; Wahrscheinlichkeit für menschliche Prüfung: 0,88. 

Das bedeutet, dass Jev der Ansicht ist, dass diese Nachricht vorerst nicht direkt veröffentlicht werden kann, sondern zuerst überprüft werden sollte, und dass sehr wahrscheinlich eine menschliche Überprüfung erforderlich ist. Nachdem das Python-Programm dieses Ergebnis erhalten hat, kann es die Nachricht automatisch in die Warteschlange "Zu überprüfen" einreihen und das Kennzeichen "Menschliche Prüfung erforderlich" hinzufügen. 

Der gesamte Prozess lässt sich einfach so zusammenfassen: 

Nachricht kommt an → Jev beurteilt → Programm wertet Ergebnis aus → Nächster Schritt wird automatisch ausgeführt

Wir wollen aber noch eine Variante ausprobieren, die näher an einem echten Nutzungsszenario liegt. 

Bei der täglichen Nutzung von KI zur Überprüfung von Nachrichten stoßen wir oft auf ein Problem: Die KI kann eine überzeugende Antwort liefern, aber man muss selbst beurteilen, wie fundiert diese Antwort ist und ob man sie direkt verwenden kann.

Deshalb lassen wir diesmal zuerst eine gewöhnliche KI die Frage beantworten und übergeben ihre Antwort anschließend an Jev zur Prüfung. Wir wollen sehen, ob das Programm zuerst filtern kann, um die Antworten zu behalten, die überprüft werden müssen.

Also geben wir zuerst eine Frage an die KI ein: 

„Ist die Codierfähigkeit des neuesten Modells von OpenAI im Vergleich zur Vorgängergeneration um