Sowohl Codex als auch Claude Code sind vom Kurs abgekommen. Ein ehemaliger OpenAI-Forscher bezeichnet die KI-Welt vor dem Aufkommen von Jev als eine Tragödie.
Übersetzung und Redaktion | Lin Qibei, Cai Fangfang
Konzeption | Tina
„Es wird allmählich in den Hintergrund der Software zurücktreten und zu einer gewöhnlichen Fähigkeit werden, die Entwickler nach Belieben aufrufen können, genau wie Datenbanken, reguläre Ausdrücke oder andere Infrastrukturen.“
Dies ist die Vision von Diogo Almeida, CEO von TypeSafe und Gründer von Jev, für KI: Wenn Intelligenz wirklich in die Software integriert ist, müssen die Nutzer nicht einmal ihre Existenz wahrnehmen. Aber wie kann man Entwickler dazu bringen, Urteile vertrauensvoll der KI zu überlassen, ohne ständig daneben zu stehen und sie zu überprüfen?
Vor einigen Monaten stellte dieser Forscher, der an der Arbeit an OpenAI InstructGPT beteiligt war, in einer Rede auf der AI Engineer-Konferenz fest: „Die nächste Ära ist nicht die Ära von Claude Code.“ Seiner Ansicht nach gehören Claude Code und Codex im Wesentlichen immer noch zur gleichen Phase – die Hauptrolle der KI besteht nach wie vor darin, den Menschen zu unterstützen. Er fragt sich: Warum ist die KI so intelligent, dass sie die Millenniumsprobleme der Mathematik lösen kann, aber nicht einmal die grundlegendsten Aufgaben automatisieren kann?
Am 22. September sprach Diogo in einem Interview im Latent Space-Podcast erneut über diese Unzufriedenheit und drückte sich noch direkter aus: „Meiner Meinung nach war die KI-Welt vor dem Erscheinen von Jev schlichtweg eine Tragödie.“ Seiner Ansicht nach liegt das Problem darin, dass zwar ein leistungsstarker „Intelligenzmotor“ vorhanden ist, aber die Schnittstellen, um ihn in tatsächliche Geschäftsprozesse einzubinden, noch fehlen.
Diesmal hat er seine eigene Antwort – Jev – vorgestellt. Durch Reinforcement Learning mit kalibrierten Entscheidungen (RLCD) hofft das Team, dass die Modellauswahlen, Bewertungen und Wahrscheinlichkeiten direkt von Code verwendet werden können, sodass Entwickler Schwellenwerte basierend auf der Unsicherheit festlegen können, um zu entscheiden, wann eine Aktion ausgeführt wird und wann sie an Menschen übergeben wird.
Von der Beteiligung am Training von Modellen, die menschliche Anweisungen verstehen, bis hin zum Versuch, Intelligenz direkt durch Code aufzurufen – warum hat Diogo das Trainingziel neu gewählt? Und wie will er die KI zu einer so gewöhnlichen Softwarefähigkeit wie eine Datenbank machen? Dieses zweistündige Interview beschreibt seine Urteile und Versuche.
Version für Eilige:
Swyx: Was genau ist Jev für Leute, die die Situation vielleicht nicht gut kennen oder nur eine klare Antwort haben wollen?
Diogo Almeida: Der derzeit genaueste Begriff ist System1-Modell, dessen Fähigkeiten weit über die Entscheidungsfindung selbst hinausgehen. Das Ziel dieser Art von Modellen ist es, Code zum direkten Nutzer der Modellausgaben zu machen.
Swyx: Eine Ihrer Kernmeinungen zu RLHF lautet: Die Antworten des Modells neigen dazu, das zu sagen, was der Nutzer hören möchte, anstatt sein echtes internes Konfidenzniveau zu einer Sache widerzuspiegeln. Können Sie das genauer erläutern?
Diogo Almeida: Kaum jemand bemerkt die Nachteile von RLHF, insbesondere das „Mode-Dropping“ (Mode-Kollaps). Das Mode-Dropping bei RLHF führt dazu, dass das Modell dazu neigt, sicherere und häufigere Antworten zu generieren, und dabei die echte Kalibrierung der Wahrscheinlichkeitsverteilung opfert. Dies verschleiert sowohl die Anhäufung von Fehlern in langen Texten als auch erklärt, warum Textmodelle nicht gut in der Entscheidungsfindung sind.
Swyx: Was ist der Kernunterschied zwischen RLCD und RLHF?
Diogo Almeida: Der Unterschied liegt zuerst im Optimierungsziel: RLHF konzentriert sich darauf, das Modell dazu zu bringen, menschlichen Anweisungen zu folgen und anerkannte Antworten zu geben, während RLCD hofft, dass das Modell zu einer Fähigkeit wird, die Software zuverlässig aufrufen kann.
Swyx: Warum fügt Jev den Mechanismus zur Ablehnung von Antworten nicht direkt in die unterste Schicht des Modells ein?
Diogo Almeida: Ich bin nicht gegen Sicherheit an sich, aber ich denke, dass bestimmte Werturteile nicht direkt in die grundlegenden Fähigkeiten eines allgemeinen Modells geschrieben werden sollten. Stattdessen sollte wie bei Datenbanken eine klare Grenze zwischen technischen Fähigkeiten und spezifischen Nutzungsverantwortlichkeiten gezogen werden.
Swyx: Was verstehen Sie unter Zuverlässigkeit? Können Entwickler darauf vertrauen, dass das Verhalten derselben Version stabil bleibt?
Diogo Almeida: Ich lege mehr Wert auf Robustheit: Wenn sich die Bedeutung des Problems nicht ändert, sollte das Urteil nicht stark verändert werden, nur weil irrelevante Zeichen hinzugefügt wurden, anstatt nur zu verfolgen, dass derselbe Eingang denselben Ausgang ergibt. Bei bereits bereitgestellten Modellen werden wir keine stillschweigenden Änderungen vornehmen, da die API eine Abhängigkeit in den Programmen anderer Personen ist. Wir werden jedoch schnell neue Versionen veröffentlichen, und derzeit können wir nicht versprechen, jede alte Version dauerhaft zu warten.
Swyx: Wie beurteilen Sie, dass das Modell eine höhere Kosten-Leistungs-Rate erreicht, ohne sich auf öffentliche Ranglisten zu verlassen?
Diogo Almeida: Wir vergleichen Kosten und Fähigkeiten durch interne Bewertungen und streben nach stärkeren Fähigkeiten bei gleichen Kosten und günstigeren Preisen bei gleichen Fähigkeiten. Ich bin nicht gegen Bewertungen, sondern gegen die Optimierung rund um Ranglisten, die die Punktzahlen von dem tatsächlichen Wert trennen. Entwickler müssen das Modell schließlich in ihren eigenen Workflow einbinden, um die tatsächliche Leistung zu messen, und können sich nicht nur auf Preis, Geschwindigkeit oder eine Gesamtpunktzahl verlassen.
Swyx: Wie sollten Entwickler Aufgaben organisieren, um Jev zuverlässiger zu nutzen?
Diogo Almeida: Ich empfehle, komplexe Aufgaben in kleinste, unabhängig beurteilbare semantische Einheiten zu zerlegen, notwendige Informationen durch strukturierte Eingaben bereitzustellen und dann das endgültige Verhalten durch Code zu steuern. Choice entspricht Auswahlzweigen, Noul entspricht bedingten Urteilen und Score entspricht Bewertungen, Sortierungen und Filterungen. Jeder Schritt kann separat bewertet und der Schwellenwert angepasst werden. Wenn die Fähigkeit nicht ausreicht, wird die Aufgabe an Menschen übergeben oder vorerst nicht bereitgestellt.
Swyx: Welche Anwendungsrichtungen von Jev sind für Unternehmensentwickler wertvoll, um ausprobiert zu werden?
Diogo Almeida: Wir haben vier Kategorien zusammengestellt: Analyse von „Dunklen Daten“, die aufgrund zu hoher Verarbeitungskosten ungenutzt bleiben; Bereitstellung schneller Urteile für Echtzeitprozesse; Überprüfung der Aufrufe und Ausgaben anderer Modelle; Einbettung intelligenter Urteile in die Kernlogik von Software. Ich bin besonders optimistisch bei der Analyse dunkler Daten und Programmier-Agenten, aber wie genau Modelle kombiniert werden, hängt immer davon ab, ob sie Kosten senken und Probleme lösen können, die zuvor nicht gelöst werden konnten.
Swyx: Angesichts der Risiken der hochmodernen KI ist das Verlangsamen des Entwicklungstempos die einzige Wahl?
Diogo Almeida: Ich denke, diese Diskussion geht oft davon aus, dass alle weiterhin mehr Ressourcen entlang der bestehenden RLVR-Route investieren müssen, aber sowohl die Forschungsziele als auch die technischen Routen können neu gewählt werden. Wie viel Handlungsspielraum man dem Modell gibt, um die Leistung zu verbessern, ist an sich eine Designentscheidung und sollte nicht als unvermeidliche Voraussetzung betrachtet werden. Ich möchte lieber andere Richtungen erkunden, damit vorhandene Intelligenz zuverlässig in die Software gelangt und praktische Arbeiten automatisiert werden.
Swyx: Würden Sie Forschern, die in hochmodernen Labors keine Ressourcen erhalten, empfehlen, ein eigenes Unternehmen zu gründen?
Diogo Almeida: Es hängt davon ab, warum sie gehen. Wenn sie nur frei Forschungsthemen ausprobieren wollen, sind die vorhandenen Labors möglicherweise immer noch am besten geeignet. Wenn sie eine neue Aufgabe gefunden haben, der sie sich langfristig widmen wollen, werde ich die Unternehmensgründung unterstützen. Ich glaube nicht, dass ein schöner Forschungslebenslauf automatisch Wert schafft, und ich bin auch nicht optimistisch bei dem Ansatz, nach Erhalt von Finanzmitteln vorhandene Arbeiten zu wiederholen. Klären Sie zuerst Ihr Kernziel und führen Sie dann Forschungen zu Problemen durch, die es wert sind, gelöst zu werden.
1 In der ersten Woche nach der Veröffentlichung von Jev war die Stimmung des Gründers schrecklich
Swyx: Willkommen im Studio. Diese Woche hat mein guter Freund Diogo Jev veröffentlicht, das fast alle heißen Themen auf sozialen Plattformen erobert hat. Wie fühlen Sie sich gerade?
Diogo Almeida: Emotional gesehen war ich noch nie so schlecht. Ich fühle mich jetzt wie ein erschöpfter Wandertoter, weil zu viele Dinge gleichzeitig passieren und überall Probleme auf mich warten, die ich bearbeiten muss.
Aber psychologisch gesehen ist das völlig anders. Ich erzähle das oft, und ich habe es in den letzten Jahren bei vielen kleinen und großen Projektveranstaltungen wiederholt: Die gesamte KI-Branche ist wie ein Spiegelzimmer in einem Vergnügungspark, und alle sind verrückt. Jeder sagt seltsame und unlogische Dinge.
Aber diese Woche fühle ich mich plötzlich mehr mit der Realität verbunden, als würde ich plötzlich spüren: „Oh, die Leute sehen es endlich.“ – KI kann viel mehr tun, als die Menschen früher gedacht haben. Wir könnten wirklich eine von KI angetriebene wirtschaftliche Revolution vorantreiben, und diese Sache ist wieder auf den Tisch gekommen – es ist einfach großartig. Ich bin besonders aufgeregt, dass Entwickler wirklich verstehen, was wir tun, und das Gefühl ist sehr stark. Ich möchte diesen Entwicklern auch meinen langjährigen Dank aussprechen. Ich bin sehr aufgeregt über die gesamte Entwicklergemeinschaft und alles, was gerade passiert – es ist wirklich großartig.
Swyx: Du hast mir gestern noch gesagt, dass du beschlossen hast, zuerst Town Hall, also offene öffentliche Kommunikation mit der Gemeinschaft, zu priorisieren, anstatt deine ganze Zeit mit VIPs, Investoren und ähnlichen Personen zu verbringen. Weil du sicherstellen willst, dass diejenigen, die deine meiste Aufmerksamkeit erhalten, Ingenieure und Entwickler sind – die Leute, die das Produkt wirklich nutzen.
Diogo Almeida: Ja. Damals hatte ich wirklich das Gefühl: „Mein Gott, ich spreche gerade mit einigen sehr wichtigen Personen.“ Ich sollte vielleicht nicht preisgeben, wer sie sind. Aber für mich wäre es unangenehm, wenn die Entwicklergemeinschaft nicht in meinem riesigen Zeitplan mit Gesprächspartnern auftauchen würde. Tatsächlich würde ich in meinem Idealfall ständig mit der Entwicklergemeinschaft kommunizieren. Ich habe gerade sogar gedacht: „Soll ich auf dem Weg zu deinem Studio eine Community-Versammlung abhalten?“ Dann habe ich gedacht: „Nein, das ist zu verrückt.“
Swyx: Was genau ist Jev für Leute, die die Situation vielleicht nicht gut kennen oder nur eine klare Antwort haben wollen?
Diogo Almeida: Diese Frage ist eigentlich schwer zu beantworten, aber so sehe ich das: Wir brauchen eine völlig neue Kategorie von Modellen. Wir haben uns nicht an einen bestimmten Namen geklammert, wie diese Kategorie letztendlich heißt.
Derzeit ist der genaueste Begriff, den wir uns ausgedacht haben, System-1-Modell. Der Grund, warum wir es nicht „Entscheidungsmodell“ nennen, liegt darin, dass die Fähigkeiten von System 1 weit über die Entscheidungsfindung selbst hinausgehen. Im Moment kann ich nur so viel sagen. Wir haben nicht erwartet, dass diese Veröffentlichung so viel Aufmerksamkeit erregen wird, also haben wir noch Dinge, die wir nicht herausgegeben haben.
Swyx: Ihr hättet sagen sollen, dass dies eine „bescheidene Forschungsvorschau“ ist.
Diogo Almeida: In gewisser Weise ist es das auch, es ist wirklich ein bisschen wie eine Forschungsvorschau. Kurz gesagt, wir haben intern mehrere Wörter, um diese neue Art von Modellen zu beschreiben. Zum Beispiel maschinennatives Modell (machine-native), System-1-Modell, großes programmierbares Modell (large programmable). Mein Verständnis ist, dass das Ziel dieser Art von Modellen darin besteht, Code zum direkten Nutzer der Modellausgaben zu machen.
Vor trainierte große Sprachmodelle waren ursprünglich für die Vervollständigung von Internettexten ausgerichtet; Chat- und anweisungsbefolgende Modelle, die mit RLHF trainiert wurden, sind für Textantworten ausgerichtet; zwischen RLVR und RLHF gibt es einen Bereich mit unscharfen Grenzen. Und wir hoffen, dass die Ausgaben dieser Modelle direkt von Code verarbeitet werden können, deshalb heißt unsere Firma TypeSafe.
Was wir wirklich wollen, ist die KI so leistungsfähig wie möglich zu machen. Und wir glauben, dass der Weg, dies zu erreichen, darin besteht, sie mit Software zu kombinieren. Deshalb haben wir bei der Gestaltung nicht nur die externe Nutzung des Modells berücksichtigt, sondern auch die tiefen internen Mechanismen des Modells für die Software optimiert. Jev ist unser erstes großes programmierbares Modell, auch System-1-Modell genannt – nennen Sie es, wie Sie wollen. Sein Optimierungsziel ist „Intelligenz pro Dollar“, und daher stammt auch der Name Jev.
Swyx: Jevons-Paradoxon.
Diogo Almeida: Genau, das Jevons-Paradoxon. Sein Ziel ist es, das intelligenteste Modell mit dem besten Preis-Leistungs-Verhältnis zu erreichen. Ich diskutiere gerne mit Menschen, was zwischen Zuverlässigkeit, Kosten, Kalibrierung und Geschwindigkeit am wichtigsten ist. Der Name Jev wird in Zukunft eine Reihe von hochmodernen Modellen repräsentieren, die in Bezug auf „Intelligenz pro Dollar“ führend sind. Natürlich gibt es andere Optimierungsrichtungen. Im maschinellen Lernen geht es zumindest für diejenigen, die sich gut mit maschinellem Lernen auskennen, um alles um Kompromisse. Und wir haben beschlossen, in diese Richtung voll und ganz einzusetzen.
2 Von Mode-Kollaps zu Kalibrierungsverzerrung: Die andere Seite von RLHF
Swyx: Ich denke, „Kalibrierung“ ist ein Problem, das erst in letzter Zeit Aufmerksamkeit erregt. Wir hatten zuvor Clementine Foreia von Hugging Face in einer Sendung eingeladen, und wir haben damals über dieses Thema gesprochen. Das ist auch eine Ihrer Kernmeinungen zu RLHF: Die Antworten des Modells neigen dazu, sich auf das zu konzentrieren, was der Nutzer hören möchte, oder das, was am wahrscheinlichsten ist, anstatt sein echtes internes Konfidenzniveau zu einer Sache widerzuspiegeln.
Diogo Almeida: Ich habe gehört, dass Ihre Zuhörer einen starken technischen Hintergrund haben, also möchte ich dieses Thema jetzt ausführlich erläutern. Ich habe mir große Mühe gegeben, jede Aussage im Veröffentlichungsvideo zu überprüfen, um sicherzustellen, dass sie korrekt und wahr ist. Offensichtlich ist diese Vorgehensweise ziemlich selten. Fast niemand bemerkt einen Punkt im Video, nämlich die Nachteile von RLHF, insbesondere das „Mode-Dropping“.
Swyx: Mode Dropping oder Mode Collapse?
Diogo Almeida: Hier meine ich dasselbe. Später möchte ich einen speziellen Blog-Beitrag darüber schreiben, aber jetzt möchte ich versuchen, die Sache so vielen Menschen wie möglich zu