StartseiteArtikel

Die nicht sprechende KI hat eine Bewertung von 1,4 Milliarden.

融资中国2026-09-28 09:20
Der virale JEV

Im September fehlt es im KI-Bereich ohnehin nicht an Aufregung: Neue Modelle mehrerer großer Unternehmen treten nacheinander auf die Bühne. Nach der Gewohnheit der vergangenen Jahre sollte das Zentrum der Aufmerksamkeit bei ihnen liegen. In der vergangenen Woche jedoch diskutierten Entwickler auf X, GitHub und verschiedenen technischen Gruppen ununterbrochen über ein Modell, das sich weigert, auch nur einen vollständigen Satz zu sagen.

Es heißt Jev, wurde erst am 15. September veröffentlicht. Nur wenige Tage nach dem Start wurde die offizielle Schnittstelle von den herbeiströmenden Entwicklern so überlastet, dass sie nicht mehr aufgerufen werden konnte. Am 21. September entfernte das Unternehmen kurzerhand die Warteliste und öffnete den Zugang für alle. Jeder registrierte Nutzer erhielt ein Guthaben von 5 US-Dollar, was etwa 120 Millionen Token entspricht. Es ist in diesem Jahr selten, dass ein neues Modell auf diese Weise „über die Ufer tritt“.

Das Unternehmen hinter Jev heißt TypeSafe AI mit Hauptsitz in San Francisco. Zwei Jahre lang blieb es im Verborgenen, und als es sich nun zeigte, brachte es zwei Dinge mit: das Modell selbst und eine Seed-Finanzierungsrunde in Höhe von 40 Millionen US-Dollar unter der Leitung von DCVC, was etwa 280 Millionen Yuan entspricht. Laut einer mit der Angelegenheit vertrauten Person, die von Forbes zitiert wurde, beträgt die Bewertung in dieser Runde 200 Millionen US-Dollar, also etwa 1,4 Milliarden Yuan.

Noch neugieriger macht der Gründer Diogo Almeida. Er arbeitete vier Jahre lang bei OpenAI und war an der Entwicklung von RLHF, InstructGPT, ChatGPT und GPT-4 beteiligt. RLHF steht für Reinforcement Learning from Human Feedback (Verstärkendes Lernen mit menschlichem Feedback). Diese Technologie hat maßgeblich dazu beigetragen, dass ChatGPT Anweisungen versteht und angemessen spricht. Mit anderen Worten: Er gehörte zu den Leuten, die damals die großen Modelle lehrten, „wie Menschen zu sprechen“. Nach seinem Abschied von OpenAI hat er etwas geschaffen, das genau das Gegenteil ist.

Ein „stummes“ Modell wird wild gespielt

Die meisten Menschen, die schon große Modelle für Klassifizierungen verwendet haben, kennen dieses Ärgernis: Man will es nur bitten, zu beurteilen, ob eine E-Mail dringend ist, und ein „Ja“ oder „Nein“ reicht völlig aus. Stattdessen fängt es erst mit einer langen Analyse an, ist langsam und verschwendet viele Token. Der Ansatz von Jev ist einfach und radikal: Es lässt das Modell gar nicht erst sprechen. Es liest ungeordnete Zustandsinformationen ein und gibt Entscheidungen aus, deren Typ von den Entwicklern im Vorfeld definiert wurde. Jede Antwort wird mit einem kalibrierten Wahrscheinlichkeitswert versehen. TypeSafe nennt es das System-One-Entscheidungsmodell, eine Anspielung auf das „schnelle Denken“ aus dem Buch Schnelles Denken, Langsames Denken. Dinge, die Menschen auf einen Blick entscheiden können, werden ihm überlassen.

Almeida hat dieses Design in einem Podcast erläutert. Jev hat nur drei Ausgabearten: „Choice“ wählt eine aus den vorgegebenen Optionen aus, „Score“ dient zum Sortieren oder zum Vergleich mit einem Schwellenwert, und „Noul“ beantwortet Ja-Nein-Fragen, gibt aber eine Wahrscheinlichkeit zurück, sodass das Programm selbst entscheidet, ob es einen bestimmten Zweig durchläuft. Im Klartext: Es ist für den Code geschrieben.

Geschwindigkeit und Preis sind die direkten Gründe für seinen Durchbruch. Die von der offiziellen Seite angegebene End-to-End-Latenz liegt zwischen 70 und 500 Millisekunden, also 40 bis 200 Mal schneller als bei modernen großen Modellen. Die Gebühr beträgt 0,042 US-Dollar pro Million Token, und die Ausgabe ist kostenlos.

TypeSafe hat noch beeindruckendere Zahlen veröffentlicht: In eigenen Workflow-Tests konnte die Geschwindigkeit bei einigen Aufgaben um bis zum 193,6-fachen gesteigert werden, und der Preis konnte im langsamsten Fall um das 444,6-fache gesenkt werden. Diese Zahlen stammen jedoch aus selbst durchgeführten Tests des Unternehmens und wurden nicht von unabhängigen Labors validiert.

Das Unternehmen weist auch darauf hin, dass die tatsächliche Leistung je nach Aufgabe und Vergleichsmethode variieren kann. Daten von Dritten sind vorsichtiger: Nach unabhängigen Tests liegt die Übereinstimmungsrate bei der Klassifizierung auf einem ähnlichen Niveau wie bei DeepSeek V4.1 Flash, mit einer mittleren Latenz von 0,32 Sekunden. Selbst wenn man diese Werte nach unten korrigiert, ist der Preis so attraktiv, dass einige Artikel ihn sogar als „Mixue Ice City“ der KI-Branche bezeichnen.

Was die Popularität wirklich angetrieben hat, sind die vielfältigen Spielweisen der Entwickler. Die offizielle Seite hat ein Beispiel gegeben: Sie ließ Jev das ursprüngliche Spiel Doom spielen. Jede Sekunde traf es etwa zehn Entscheidungen, um die Figur zu steuern, Feinden auszuweichen und zu schießen. Nach einer Stunde Dauerbetrieb beliefen sich die Kosten auf etwa 7 US-Dollar.

Das Team von Browser Use hat diese Funktion in die Browser-Automatisierung integriert. Beim Öffnen einer Webseite und dem Abrufen von Flügen von Zürich nach London dauerte der gesamte Vorgang nur 7,1 Sekunden und kostete 0,0039 US-Dollar. Das Echtzeitkommunikationsunternehmen Ably lieferte einen noch anschaulicheren Vergleich: Innerhalb weniger Minuten traf Jev 47 Entscheidungen, während Modelle wie Gemini, Claude und GPT nur ein oder zwei trafen. Auch chinesische Entwickler blieben nicht stehen: Bei der Verwendung großer Modelle zum Ausspielen von Karten gab es deutliche Verzögerungen. Nach dem Wechsel zu Jev dauerte eine einzelne Entscheidung nur noch 0,7 Sekunden – bevor die Animation des ausgespielten Kards endete, war der nächste Zug bereits erledigt. Alle diese Szenarien erfordern schnelle und dichte Entscheidungen, aber jede einzelne Entscheidung ist an sich nicht schwierig.

Die Spiele selbst sind unterhaltsam, aber die Maßnahmen im Geschäftsleben sprechen noch mehr für sich. Vercel hat das KI-Gateway sofort mit Jev verbunden. Entwickler nutzen es als Schiedsrichter für große Modelle: Innerhalb weniger zehn Millisekunden prüft es, ob das Verhalten eines großen Modells rechtmäßig und sachlich begründet ist, und gibt eine Bewertung für die Faktenkonsistenz ab. Wenn die Kosten so niedrig sind, dass sie fast vernachlässigbar sind, lassen sich plötzlich auch die Dinge berechnen, die früher nicht berechnet werden konnten.

Ein Mitwirkender von ChatGPT gießt kaltes Wasser über die Branche

Almeidas Lebenslauf hat in der Branche hohes Ansehen. In der Liste der Mitwirkenden von GPT-4 bei OpenAI wird er in der Rubrik „Grundlegende Arbeiten zu RLHF und InstructGPT“ aufgeführt. Er verbrachte vier Jahre bei OpenAI, um die Antworten von ChatGPT zu verfeinern. 2024 verließ er das Unternehmen, um mit dem Training eines neuen Grundmodells zu beginnen. Unter den beiden anderen Mitgründern war COO Sasha Sheng früher Forschungsingenieur bei Meta und FAIR, und Erik Gafni ist CTO. Die drei arbeiteten zwei Jahre lang im Stillen, und die Außenwelt hatte kaum von diesem Unternehmen gehört.

Normalerweise würde eine Person mit solchem Hintergrund, die ein Unternehmen gründet, höchstwahrscheinlich ein Modell entwickeln, das noch besser chatten kann. Almeida machte genau das Gegenteil: Er kritisiert genau die Methoden, an deren Gestaltung er selbst mitgewirkt hat.

Seine Logik ist nicht kompliziert. Bei RLHF werden menschliche Präferenzen gesammelt und anschließend optimiert – das bedeutet, dass Menschen direkt in die Trainingsschleife einbezogen werden. Das Ziel ist es, Menschen zufrieden zu stellen, nicht dass die Software autonom funktioniert. Gegenüber Forbes drückte er es noch deutlicher aus: Die Branche optimiert ständig für Menschen, und die Fähigkeit der Modelle, Menschen zu gefallen, übertrifft bereits die der Menschen. Er erzählte in einem Vortrag einen Witz: Jemand schickte ChatGPT einen Furz-Geräuscheffekt und bat es, das von ihm „geschaffene“ Musikstück ehrlich zu bewerten. ChatGPT antwortete, es schaffe eine sehr unheimliche Atmosphäre. Wenn Menschen daneben stehen, ist diese Glattheit harmlos. Aber wenn die Software im Hintergrund unbeaufsichtigt laufen soll, wird ein Modell, das Fehler macht, aber immer versuchen will, fehlerfrei zu wirken, zu einem großen Problem.

Deshalb traut er sich zu sagen, dass die nächste Ära nicht die Ära von Claude Code sein wird. Er gibt zu, dass er selbst Claude Code gerne nutzt, aber es gehört noch zur „Ära der Unterstützung“ und basiert im Grunde immer noch auf RLHF. Ausgesprochen von einem der Schöpfer von ChatGPT klingt das ein wenig ironisch.

Die Investoren setzen zu einem großen Teil auf diese Einsicht und auf die Person, die diese Einsicht ausspricht. Die Bewertung des US-Investors Trace Cohen ist repräsentativ: Seiner Meinung nach ist die 40-Millionen-US-Dollar-Seed-Runde für ein Unternehmen, das noch kein Produkt ausgeliefert hat, eine Wette auf den Hintergrund, eine Wette auf das Team, nicht auf das Produkt. Die von OpenAI abwandernden Forscher waren schon immer die begehrtesten Gründer im Silicon Valley, und diese Art von Bewertungslogik ist längst nichts Besonderes mehr. Interessanterweise hatte TypeSafe selbst vor dem Launch keine große Sicherheit bezüglich des Produkts.

Almeida erinnerte sich später in einem Podcast: Vor dem Launch war das Feedback ziemlich schlecht. Nicht technische Mitarbeiter befürchteten, dass sie „Vitamine“ statt „Schmerzmittel“ verkaufen würden. Das Unternehmen hatte kaum Einnahmen, mehr als die Hälfte der Tester verstand das Produkt nicht, und die erste Reaktion derjenigen, die es verstanden, war die Frage, wie die Genehmigung für den Einkauf abläuft. Er selbst hatte große Angst und trieb deswegen die möglichst schnelle Veröffentlichung voran.

Er hat den Zustand nach dem Launch wahrscheinlich nicht erwartet. Anfragen zur Erhöhung des Aufruflimits strömten von überall her. Nach seinen Angaben im Podcast überschreitet die tägliche Anzahl von aufgerufenen Token bereits 1 Billion. Auch spät in der Nacht laufen die Aufrufe kontinuierlich – das zeigt, dass Programme im Hintergrund laufen, nicht dass Menschen es nur einmal ausprobieren und dann vergessen. Diese Zahl stammt bisher nur von der Seite des Gründers, aber das Detail der nächtlichen Aufrufe sagt mehr als die Anzahl der Registrierungen darüber aus, ob das Produkt wirklich genutzt wird.

Auch der Name hat eine Bedeutung. Jev leitet sich von dem Ökonomen William Stanley Jevons ab, dem Wissenschaftler, der das Jevons-Paradoxon aufgestellt hat. Im 19. Jahrhundert wurden Dampfmaschinen immer kohlesparender, aber der Kohleverbrauch in Großbritannien stieg stattdessen stetig an. Die Absicht hinter diesem Namen ist nicht schwer zu erraten.

Die „große Aufteilung der Intelligenz“ – wem schadet sie?

Jaya Gupta, Partnerin bei Foundation Capital, hat einen langen Artikel geschrieben, der einen größeren Hintergrund für den Erfolg von Jev liefert. Sie nennt es die „große Aufteilung der Intelligenz“. Ihre Beobachtung lautet: Das Wunder der großen Modelle in den vergangenen drei Jahren lag im „Bündeln“: Informationsextraktion, Suche, Sortierung, Urteil, Auswahl von Werkzeugen, Erstellen von Antworten und sogar anspruchsvolle Schlussfolgerungen wurden alle demselben hinreichend intelligenten Modell überlassen. Die Entwickler sparten Aufwand, aber die Kosten wurden versteckt. Ein Agent teilt ein einziges menschliches Ziel in Hunderte oder Tausende von maschinellen Entscheidungen auf. Die winzigen Unterschiede bei Kosten und Latenz in jedem Schritt summieren sich und bestimmen schließlich das Wirtschaftsmodell des gesamten Produkts. Sie nennt diese Verschwendung „Dekodierungssteuer“: Die Software braucht nur ein einziges „Zulassen“ oder „Ablehnen“, aber das große Modell muss erst einen Text generieren, bevor das Programm den Text wieder in eine Entscheidung zurückübersetzt.

Diese Rechnung geht letztendlich zu Lasten der Unternehmen für große Modelle. In ihrem Artikel erwähnt Gupta, dass die Bruttomarge von Anthropic Berichten zufolge über 80 % liegt. Eine einfache Klassifizierungsaufgabe, die nur in einem Aufruf von Claude ausgeführt wird, muss bereits zu den Preisen eines modernen Spitzenmodells bezahlt werden.

Ihre Schlussfolgerung lautet: Günstige, vorhersehbare häufige Operationen werden schrittweise abgezweigt. Den Spitzenmodellen bleiben unklarere, langwierigere und schwieriger zu überprüfende Aufgaben übrig. Jeder Aufruf mag wertvoller sein, aber die Anzahl der Aufrufe wird sinken. Auch die Arbeit auf der Anwendungsebene ändert sich: Man muss die Aufgaben aufteilen und für jeden Schritt die ausreichende und günstigste Intelligenz einkaufen. Früher hat ein System vielleicht nur 1 % der Vorgänge stichprobenartig geprüft. Nachdem die Urteile so günstig geworden sind, besteht die Möglichkeit, alle Vorgänge vollständig zu prüfen: Kundenservice-Gespräche, Transaktionsaufzeichnungen und Vertragsbestandteile können alle einzeln durchgegangen werden. Die Szenarien, auf die Almeida setzt, liegen in diesem Bereich: Zum Beispiel die „Dunklen Daten“, die große Unternehmen jahrelang angehäuft haben, die aber wegen der zu hohen Kosten für Aufrufe großer Modelle nie analysiert wurden. Er nennt das Beispiel der Versicherungsrisikoprüfung: Das Modell liest die Unterlagen durch und gibt direkt die Wahrscheinlichkeit an, dass ein bestimmtes Gebäude jemals von einem Brand betroffen war.

Die Geschichte klingt gut, aber das Problem des Schutzgrabens (Wettbewerbsvorteils) taucht fast gleichzeitig auf. Nur zwei Tage nach der Veröffentlichung von Jev sind auf GitHub mindestens sechs Nachbauprojekte entstanden. Jemand hat ein kleines Modell von Qwen auf einem Laptop weniger als zwei Stunden lang trainiert und damit ein Entscheidungsmodell mit derselben Schnittstelle erstellt.

Viele dieser Nachbauten zielen darauf ab, eine kostengünstige Alternative zu sein. Das am schnellsten wachsende Projekt Laya hat innerhalb von 5 Tagen 18.000 Sterne (Stars) erhalten. Kev, entwickelt von Jared Palmer, basiert auf Qwen3.5 und ist vollständig kompatibel mit dem offiziellen SDK von TypeSafe – der Geschäftscode muss nicht geändert werden, man muss nur die Adresse der Anfrage ändern, um auf die lokale Version umzuschalten. Nimble von Bespoke Labs basiert auf Qwen3.5-9B und erreicht eine Testgenauigkeit von 90,1 %, was nahe der von TypeSafe offiziell angegebenen 93,2 % liegt. Unter all dieser Aufregung ist Alibaba Tongyi Qianwen unerwartet zur „Basis“ in dieser Nachbauwelle geworden. Die Nachbauten haben aber auch Nachteile: Einige Bewertungen zeigen, dass bei beliebigen Fragen und Szenarien mit Dutzenden von langen Optionen derzeit immer noch Jev die bessere Wahl ist.

Die eigenen Grenzen von Jev sind ebenfalls offensichtlich. Es ist eine geschlossene API, das Modell kann nicht heruntergeladen werden, und die Daten müssen an die Server von TypeSafe übermittelt werden – das ist eine Hürde für viele Unternehmenskunden. Das von der offiziellen Seite versprochene „keine Halluzinationen“ muss ebenfalls relativiert werden: Es garantiert nur, dass die Antworten nicht außerhalb des von den Entwicklern definierten Formats liegen, nicht dass die Antworten unbedingt korrekt sind.

Almeida vermeidet diese Punkte nicht. Er gibt zu, dass die Kalibrierung nicht perfekt ist und das Modell viele Fehler machen kann. Solange der Nutzen hoch genug und der Schwellenwert angemessen eingestellt ist, kann es trotzdem eingesetzt werden. Ein Moderator hat nach dem Ausprobieren festgestellt, dass die Genauigkeit bei einzelnen Schritten sehr hoch ist, aber die Leistung mit zunehmender Anzahl von Schritten allmählich abnimmt. Seine Antwort lautet: Welche Aufgaben für System 1 geeignet sind, hängt letztendlich von der praktischen Leistung ab. Der externe Druck ist ebenfalls vorhanden: Große Unternehmen senken ständig die Inferenzkosten und erhöhen die Geschwindigkeit. Wie lange