Exklusivinterview mit dem Erfinder von Jev: Behalten Sie die Arbeitsabläufe im Programm unter Kontrolle und integrieren Sie KI nur an Stellen, wo Verständnis und Urteilsvermögen erforderlich sind.
Künstliche Intelligenz ist bereits in der Lage, extrem schwierige Probleme in der Mathematik zu lösen, hat aber nach wie vor große Schwierigkeiten bei der Automatisierung einer Vielzahl grundlegender Arbeitsabläufe.
Nach Ansicht von Diogo Almeida, Gründer und CEO des US-amerikanischen KI-Startups TypeSafe, liegt das Problem möglicherweise nicht darin, dass die KI „nicht klug genug“ ist, sondern darin, dass die Modelle der Vergangenheit von Anfang an nicht für die echte Softwarewelt konzipiert wurden.
Jev ist die Antwort, die er gegeben hat. Es handelt sich um das erste große, programmierbare Modell, das von TypeSafe veröffentlicht wurde, und als „System-One-Modell“ (System One Model) definiert ist. Es ist nicht auf Chats ausgerichtet und betrachtet Benchmark-Ergebnisse nicht als Hauptziel, sondern versucht, das Modell direkt zu einem Bestandteil von Software zu machen. Seine zentrale Optimierungsmetrik ist nur eine: Intelligenz pro Dollar.
Nach der Veröffentlichung von Jev tauchte sein Name überall in den sozialen Medien auf, die Discord-Community verzeichnete über Nacht 100.000 neue Mitglieder, und die Anzahl der Aufrufe des Veröffentlichungsvideos überstieg 38 Millionen.
Almeida war zuvor am Aufbau der Anweisungsfolge-Modelle von OpenAI beteiligt. Nach seinem Ausscheiden bei OpenAI verbrachte er mehr als zwei Jahre damit, die Antwort auf eine weitere Frage zu suchen: Warum ist eine KI, die bereits klug genug ist, nach wie vor schwer zuverlässig in echte Arbeitsabläufe zu integrieren?
Einige Tage nach der Veröffentlichung von Jev gab er ein exklusives Interview mit dem Technik-Podcast-Moderator swyx.
Während des gesamten Interviews betonte Almeida wiederholt mehrere Punkte:
Erstens: Die größte Lücke der KI liegt derzeit möglicherweise nicht in ihrer Fähigkeit, sondern in ihrer Zuverlässigkeit. Modelle können komplexe Probleme beantworten, aber wenn sie tatsächlich im Hintergrund von Software eingesetzt werden, kann eine gelegentliche Verweigerung der Antwort, eine Abweichung der Ausgabe oder ein unvorhersehbares Verhalten das gesamte System funktionsunfähig machen.
Zweitens: TypeSafe möchte KI nicht zu einem „menschenähnlicheren“ Chat-Partner machen, sondern zu einer intelligenten Infrastruktur, die von Software direkt aufgerufen werden kann. Nach Ansicht von Almeida sollte KI eher einer Datenbank ähneln als einem Kollegen.
Drittens: RLCD (Reinforcement Learning mit Code-Feedback) stellt eine Neudefinition der Ausrichtung des Modelltrainings durch TypeSafe dar. RLHF (Reinforcement Learning mit menschlichem Feedback) optimiert, „was Menschen mögen“, RLVR (Reinforcement Learning mit überprüfbarer Belohnung) konzentriert sich stärker auf überprüfbare Aufgaben, während das Ziel von RLCD darin besteht, das Modell zuverlässig im Programmknoten arbeiten zu lassen.
Viertens: Zuverlässigkeit bedeutet nicht Determinismus. Dasselbe Eingabewert immer genau dieselbe Ausgabe ergibt, ist nicht unbedingt das Wichtigste. Für echte Software ist es wichtiger, dass ähnliche Probleme ähnliche Ergebnisse liefern.
Fünftens: Zukünftige Software wird KI möglicherweise nicht mehr als Aufruf eines großen Modells behandeln, sondern Aufgaben in eine Vielzahl kleinerer, leichter überprüfbarer intelligenter Entscheidungen aufteilen. Zustände, Anweisungen und Standards können alle strukturiert werden, und die Modelle werden an den Stellen in der Software platziert, an denen Intelligenz tatsächlich benötigt wird.
Almeida geht sogar davon aus, dass er selbst dann, wenn ihm nur 1 Milliarde US-Dollar zur Verfügung stünden, nicht wählen würde, ein großes Modell von Grund auf vortrainieren. Er würde die Ressourcen lieber in Daten, Nachschulung und neue Formen von Intelligenz investieren.
Im Folgenden die gekürzte Fassung des Interviewprotokolls:
01 Das „System-One-Modell“, das für Code entwickelt wurde
Frage: Warum hast du angefangen, TypeSafe und Jev zu entwickeln?
Almeida: Ich habe immer über eine Frage nachgedacht: Warum kann KI bereits Millennium-Preis-Probleme im Bereich der Mathematik lösen, aber trotzdem viele grundlegende Arbeitsabläufe nicht automatisieren? Später habe ich erkannt, dass das Fehlende möglicherweise kein stärkerer Automatisierungs-Engine ist, sondern ein „Stecker“, um KI in die echten wirtschaftlichen Arbeitsabläufe zu integrieren.
Als ich bei OpenAI an Anweisungsfolge-Modellen mitarbeitete, stellte ich fest, dass die Modelle zwar gut darin sind, „Anweisungen einzugeben und Text auszugeben“, aber ein großer Teil des Werts letztendlich in Szenarien wie der Textgenerierung verbleibt. Also begann ich darüber nachzudenken: Wenn KI zu einer Infrastruktur werden soll, wer sind die echten Nutzer? Meine Antwort ist Code. Das ist auch der Grund, warum wir später Jev entwickelt haben.
Frage: Definiere Jev in einem Satz für diejenigen, die es nicht kennen: Was ist Jev?
Almeida: Jev kann als „maschinen-natives, systemisches, großes, programmierbares Modell“ definiert werden, dessen Kernziel darin besteht, Code zum direkten Nutzer des Modells zu machen.
Anmerkung: Das sogenannte System-One-Modell ist ein schnelles, direktes und zuverlässiges Modell, das kleine Entscheidungen im Programm trifft und Ausgaben liefert, die direkt von Code verarbeitet werden können. Das System-Two-Modell ist ein langsames Modell mit langen Schlussfolgerungsketten, das gut in Mathematik und komplexen Schlussfolgerungen ist, aber anfällig, ungleichmäßig und teuer. Diogos Kernaussage lautet: Die Branche konzentriert sich übermäßig auf System-Two-Schlussfolgerungsmodelle, aber das System-One-Modell ist dasjenige, das wirtschaftswertvolle Arbeitsabläufe tatsächlich automatisieren kann.
Im Gegensatz zu vortrainierten Modellen, die für die Vervollständigung von Internettexten verwendet werden, und RLHF-Modellen, die hauptsächlich die Anweisungsfolge lösen, wurde Jev von Anfang an für die Verwendung in Programmen konzipiert, und von der Innenseite des Modells bis zu den externen Schnittstellen wurde alles für Software optimiert. Die Metrik, auf die wir wirklich achten, ist „Intelligenz pro Dollar“. Kosten und Geschwindigkeit sind natürlich wichtig, aber letztendlich zahlen die Nutzer für Intelligenz.
Jev möchte an der Spitze dieser Metrik stehen. Wir sind überzeugt, dass Nutzer, sobald sie ein wirklich gutes Modell verwenden, sehr schnell spüren werden, ob es wirklich nützlich ist.
02 Das Gift von RLHF: Wie der Moduskollaps die Kalibrierung zerstört
Frage: Du kritisierst RLHF ständig. Was ist sein größtes Problem?
Almeida: Ich denke, das größte Problem ist, dass es das Modell leicht zu konservativ macht, was als sogenannter „Moduskollaps“ bezeichnet wird. Um Fehler so weit wie möglich zu vermeiden, gibt das Modell allmählich seltene, aber potenziell wertvolle Antworten auf und wählt nur die sichersten Ergebnisse aus, die am leichtesten eine Belohnung erhalten. Auf diese Weise scheint das Modell stabiler zu sein, verliert aber tatsächlich viel Raum für Erkundungen.
Frage: Welchen Zusammenhang hat das mit den Ansichten von Yann LeCun?
Almeida: Ich vertraue Yann LeCun sehr, viele seiner Ansichten sind sehr korrekt. Er hat ein berühmtes Diagramm, das zeigt, dass mit zunehmender Länge des von Sprachmodellen generierten Textes die Wahrscheinlichkeit von Fehlern normalerweise steigt. Aber ich denke, die tatsächliche Situation ist nicht so einfach. Um Fehler zu vermeiden, wird das Modell immer selbstbewusster oder konservativer und komprimiert schließlich seinen eigenen Beurteilungsraum. Deshalb halte ich es nicht für eine gute Lösung, Modelle, die hauptsächlich für die Textgenerierung verwendet werden, direkt für komplexe Entscheidungen einzusetzen.
03 RLCD: Entfernen des Menschen aus dem Regelkreis
Frage: Was ist RLCD? Was ist der Unterschied zu RLHF und RLVR?
Almeida: RLCD ist kein Begriff, der erfunden wurde, um cool zu klingen. Es stellt unseren neuen „Polarstern“ dar. Das Ziel von RLHF ist es, das Modell dazu zu bringen, menschliche Anweisungen besser zu verstehen und Antworten zu geben, die Menschen mögen. RLVR wird häufiger für Aufgaben verwendet, die automatisch durch Programme überprüft werden können. RLCD hingegen ermöglicht es dem Modell, zuverlässig im Programmknoten zu arbeiten. Früher war „der Mensch im Regelkreis“, und das Programm war nur ein Hilfswerkzeug. Wir möchten den Menschen aus dem Regelkreis entfernen, damit das Programm wirklich in den Regelkreis eintritt.
Frage: Du positionierst TypeSafe als Datenlabor und nicht als Modelllabor?
Almeida: Wir legen schon immer großen Wert auf Daten. Die Fähigkeiten von Modellen hängen letztendlich von Daten ab, und die Daten selbst sind unvorstellbar komplex. Zuverlässigkeit kommt ebenfalls von Daten. Der Turing-Preisträger von 2024, Richard Sutton, sagte einmal, grob gesagt, dass Algorithmen letztendlich die Berechnung übertreffen. Ich bin eher davon überzeugt, dass Daten wichtiger sind als Berechnung. Das wirklich Schwierige ist, die richtigen Aufgaben auszuwählen und die richtige Richtung zu finden.
Wenn wir auf die Entwicklung von großen Sprachmodellen zurückblicken, denke ich, dass es bereits mehrere wichtige Richtungsänderungen gegeben hat: RLHF, RLVR, und jetzt ist die Reihe an dem von uns vorgeschlagenen RLCD. Wir trainieren keine Modelle mit Nutzerdaten, da die Daten der realen Welt viele Vorurteile und Verteilungsprobleme aufweisen. Wir interessieren uns mehr dafür, wie KI in vielen Jahren aussehen wird. Unser Ziel ist es, das Modell zu einer allgemeinen Infrastruktur zu machen, die in Teile des Software-Stacks vordringt, die heute noch nicht einmal vorstellbar sind.
Frage: Warum sind Daten so wichtig?
Almeida: Man kann sich kaum vorstellen, wie viel Dinge Daten verändern können. Unser Datenforschungsteam untersucht ständig die Kernfähigkeiten der Modelle. Sie finden heraus, wo das Modell instabil arbeitet, und bearbeiten diese Probleme schrittweise. Sie lösen nicht nur einzelne spezifische Fälle, sondern suchen nach den allgemeinen Gesetzen dahinter. Diese Arbeit erfordert viel Intelligenz, deshalb stellen wir ständig Fachkräfte im Datenbereich ein.
Frage: Wenn dir jetzt 1 Milliarde US-Dollar zur Verfügung stünden, wie würdest du das Geld investieren? Würdest du ein großes Modell von Grund auf trainieren?
Almeida: Nein. Wenn mir nur 1 Milliarde US-Dollar zur Verfügung stünden, würde ich nicht wählen, ein großes Modell von Grund auf vortrainieren. Ich würde mehr Ressourcen in Daten, Nachschulung und neue Formen von Intelligenz investieren.
Heutzutage erfordert das Training eines Grundmodells von Grund auf sehr große Rechenressourcen, und viele Unternehmen führen ähnliche Arbeiten durch. Ich bin eher daran interessiert, auf der Grundlage des Bestehenden weiter zu erforschen, was Modelle noch werden können, und wie durch Daten und Trainingsmethoden Intelligenz wirklich in Software und reale Arbeitsabläufe integriert werden kann.
Das ist auch der Grund, warum wir viel Energie auf Daten und Nachschulung verwenden. Das Wichtigste ist nicht, das Modell einfach größer zu machen, sondern neue Wege zu finden, um das Modell nützlicher und zuverlässiger zu machen.
04 Keine Jagd nach öffentlichen Benchmarks und keine Sicherheit durch Verweigerung der Antwort
Frage: Warum lehnst du öffentliche Benchmarks ab?
Almeida: Weil öffentliche Benchmarks sehr leicht „hochgespielt“ werden können. Selbst wenn diejenigen, die die Aufgaben stellen, sich bemühen, dies zu vermeiden, können Modellentwickler immer noch verschiedene Wege finden, um sich auf die Tests zu optimieren. Früher hatte jedes Labor Personen, die speziell Daten wie MMLU sammelten, damit das Modell in einem bestimmten Benchmark stärker erscheint. Im Wesentlichen bereitet man sich so nur auf die Prüfung vor, nur mit einer zusätzlichen Verpackung.
Ich bin überzeugt, dass langfristig echtes Vertrauen aus der tatsächlichen Nutzung entsteht. Man platziert das Modell in echte Arbeitsabläufe, testet es mit echten Aufgaben und spürt selbst, ob es gut funktioniert. Das, was uns wirklich wichtig ist, ist die ständige Verbesserung der Zuverlässigkeit, nicht die Erhöhung eines öffentlichen Scores.
Eigentlich hätten wir Jev schon vor eineinhalb Jahren veröffentlichen können, aber das hätte bedeutet, dass wir einige Dinge akzeptieren müssen, mit denen wir nicht zufrieden sind. Während der Finanzierung haben uns einige Personen auch aufgefordert, Benchmark-Ergebnisse vorzulegen, aber wir bestanden darauf, dass das nicht der Weg ist, den wir gehen wollen. Sobald einige Prinzipien festgelegt sind, sollte man daran festhalten.
Frage: Du betreibst auch keine Sicherheitsausrichtung im herkömmlichen Sinne und lehnst keine Antworten ab. Warum?
Almeida: Ich bin nicht gegen Sicherheitsprinzipien, aber ich denke, dass Sicherheitsausrichtung und Nutzerbedürfnisse manchmal nicht übereinstimmen. Bei Chatbots ist eine Verweigerung der Antwort möglicherweise kein großes Problem. Wenn ein Mensch auf einen Chatbot trifft, der die Antwort verweigert, kann er das Gespräch fortsetzen. Aber wenn KI eine Softwareabhängigkeit ist, die im Hintergrund läuft, kann ein plötzliches Verweigern der Ausführung dazu führen, dass andere Programme, die davon abhängen, direkt fehlschlagen.
Für Softwareentwickler ist das jedoch inakzeptabel. Ich denke, Intelligenz ähnelt eher einer Datenbank als einem Kollegen, der mit dir über Werte diskutieren muss. Eine Datenbank beurteilt nicht, ob die von ihr bereitgestellten Daten „falsch verwendet“ werden, sie stellt nur Daten zur Verfügung. Wenn wir zu viele moralische Urteile direkt in die Intelligenz einprogrammieren, wird die Intelligenz immer weiter zersplittert. Mit jeder zusätzlichen Einschränkung für bestimmte Fälle kann das Modell einen Teil seiner allgemeinen Fähigkeiten verlieren.
Frage: Die API von Jev hat drei Primitive: choice, score und no. Wie sind diese Konzepte entstanden?
Almeida: Wir haben lange über diese Konzepte diskutiert. „no“ stammt von der Bernoulli-Wahrscheinlichkeit, es kann als fortlaufendes „Ja oder Nein“ verstanden werden. Wir haben sogar darüber nachgedacht, es „pool party“ zu nennen, aber niemand war damit einverstanden. Diese Konzepte sind absichtlich nicht direkt mit Typen in der traditionellen Programmierung verknüpft. Zum Beispiel ist score keine gewöhnliche Ganzzahl, und no ist kein einfacher Boolescher Wert. Sie ähneln traditionellen Typen, sind aber nicht genau gleich. Wir legen mehr Wert darauf, klar auszudrücken, was das Modell wirklich kann, anstatt es so aussehen zu lassen wie Dinge, die Entwickler bereits kennen.
ba b
Frage: Wie entsprechen sie konkret Programmierkonzepten?
Almeida: choice ähnelt am meisten dem switch im Programm, es kann als Auswahl einer aus mehreren Optionen verstanden werden; no entspricht