Zeitalter der großen Abflachung
Die Shenyi-Büro ist ein Übersetzungsteam von 36Kr, das sich auf Bereiche wie Technik, Wirtschaft, Arbeitswelt und Leben konzentriert und vor allem neue Technologien, neue Ansichten und neue Trends aus dem Ausland vorstellt.
Anmerkung der Redaktion: Verabschieden Sie sich vom traditionellen Entwicklungsmodell, das auf die Anhäufung von Personal setzt. Wenn sich die Kosten für intelligente Funktionen alle vier Monate halbieren, gehört die Zukunft dem Zeitalter der „großen Abflachung“, in dem Engpässe mit Token überflutet werden. Der Artikel stammt aus einer Übersetzung.
Das Erwachen großer Modelle
Im vergangenen Jahr ist etwas passiert, das die meisten Menschen noch nicht vollständig verarbeitet haben. Große Modelle haben im Bereich der Programmierung ein Niveau erreicht, das über das menschliche Niveau hinausgeht – es zeigt nicht nur einen Trend, es kommt nicht nur annähernd heran, sondern übertrifft die Menschen in diesem Moment wirklich. Ich stand früher an der Spitze der indischen Rangliste bei Wettbewerben wie Google Code Jam, Topcoder und ACM ICPC, aber die modernsten Modelle haben mich weit hinter sich gelassen. Ich bin jeden Tag zutiefst beeindruckt davon.
Solch leistungsstarke Modelle sind längst nicht mehr dafür geeignet, auf Ihrem PC beschränkt zu bleiben. Bei jeder neuen Version können die Modelle länger autonom laufen, ihre eigene Arbeit planen und spezielle Hilfsprogramme ableiten. Ein Gerät, das immer in Ihrer Nähe sein und eingeschaltet bleiben muss, ist keineswegs der richtige Ort, um all dies zu tragen. Die Zukunft der Softwareentwicklung liegt in der Cloud. Der folgende Inhalt dieses Artikels erläutert die dahinterstehende Logik und die erforderlichen Bedingungen.
Sie sind noch Teil der Schleife (Humans in the loop)
Mit jeder Iteration steigen die Unabhängigkeit und Effizienz des Modellbetriebs weiter an. Aber wenn Sie in jedes Ingenieurbüro gehen, werden Sie immer noch sehen, dass Menschen an den Prozess gebunden sind: Eingabe von Hinweisen, Überprüfung von Code, Korrektur von Abweichungen, ständig vor dem Gerät festgehalten. Ich habe all das selbst erlebt. Ich habe Claude Code intensiv genutzt und wie eine Nanny jede Sitzung die ganze Zeit überwacht, aber übermäßige Einmischung hat den Geschwindigkeitsvorteil zunichte gemacht; wenn man es dagegen unbeaufsichtigt lässt, läuft man leicht von der festgelegten Richtung ab. Die neuesten Modelle beenden die meisten dieser Probleme. Sie können stundenlang unbeaufsichtigt laufen, ihre Arbeit selbst planen, den Kontext vereinfachen und die Ausgabe vor der Vorlage der Ergebnisse selbst überprüfen. Ist die nannyhafte Überwachung damit beendet? Nein. Wie alle Engpässe wurde sie nur auf eine höhere Ebene gehoben. Früher haben Sie einzelne Sitzungen überwacht, jetzt überwachen Sie das gesamte System: Trauen Sie sich, eine Zusammenführungsanforderung zu akzeptieren, die Sie nicht Zeile für Zeile überprüft haben? Können zwanzig autonome Sitzungen gleichzeitig auf denselben Code-Basis zugreifen, ohne Konflikte zu erzeugen? Wurden die Ergebnisse in einem echten Software-Stack überprüft, bevor sie Ihnen vorgelegt werden?
Sie streben nach maximaler Parallelfähigkeit. Sie möchten Ihren Laptop schließen und zurückkommen, wenn die Arbeit bereits erledigt ist. Je mehr Sie aus dieser Schleife herausgezogen werden, desto mehr Arbeit muss in der Cloud ausgeführt werden.
Warum also hat die Cloud noch nicht alle vollständig angenommen? Weil die Cloud, die ihnen derzeit angeboten wird, blind ist. Ein Agent kann zwar Code auf einem virtuellen Rechner irgendwo schreiben, aber er kann Ihre Anwendung nicht ausführen und nicht alle Ihre Dienste starten, um End-to-End-Tests durchzuführen. Daher muss jeder Zweig schließlich auf den lokalen Laptop zurückgezogen werden, um überprüft zu werden, und Sie werden wieder in diese Schleife gezogen. Die Cloud muss das Problem der End-to-End-Ausführung und -Prüfung praktisch lösen, um Ihnen wirklich Zeit zu sparen.
Das gesamte Unternehmen wird abgeflacht
Das Schreiben von Code ist nicht mehr das Problem. Früher erhielten Ingenieure Anweisungen von Managern, hörten sich die Anforderungen von Produktmanagern an und setzten sie dann um; die Informationen schwanden bei der Weitergabe durch mehrere Ebenen, und die Iterationszyklen wurden endlos verlängert. Diese Zeit ist vorbei. Wenn Sie eine Idee innerhalb weniger Minuten in produktiven Code umwandeln können, verlagern sich die knappen Ressourcen auf neue kreative Ideen, die Fähigkeit, Anforderungen direkt von Kunden zu extrahieren, und den Mut, das nächste Experiment zu starten. Ich war Mitbegründer und CTO von Rippling. In letzter Zeit habe ich jede Woche mehr Codezeilen ausgeliefert als die Ingenieure unter mir – nicht weil ich technisch versierter bin, sondern weil Kunden Ideen während eines Anrufs vorbringen, diese Ideen direkt in die Entwicklungssitzung gelangen und sogar vor Ende des Anrufs zusammengeführt werden. Backlogs (Rückstände von Anforderungen) sollten nicht mehr existieren, eine Idee sollte innerhalb weniger Minuten zu einem produktiven Ergebnis werden.
Wenn Sie diesen Wandel weiterverfolgen und über Ihren Schreibtisch hinausgehen, wird er das gesamte Unternehmen vollständig umgestalten. Jedes Unternehmen hat eine feste „Grenze menschlicher Zellen“: die Schnittstelle, die der Außenwelt direkt gegenübersteht. Verkäufe, Kundenbeziehungen und Momente, in denen ein Mensch das Unternehmen vertreten muss, um einem anderen Menschen gegenüberzutreten. Diese Bereiche bleiben vorerst in menschlicher Hand … zumindest im Moment. Innerhalb der Grenze hingegen laufen Planung, Gestaltung, Architektur, Überprüfung und Ausführung alle auf Harness (das Steuerungsframework, also das System, das die Arbeitsausführung antreibt) zu. Das Organigramm schrumpft nicht einfach, sondern verändert seine Form. Im Inneren braucht es vielleicht nur eine Person oder gar keine Person mehr. Das ist die große Abflachung.
Daher bewegt sich die Arbeit selbst auf die „Meta“-Ebene zu. Sie konzentrieren sich nicht mehr darauf, die vorliegende konkrete Aufgabe zu lösen, sondern fragen stattdessen, warum dieser Organismus die Aufgabe nicht selbst lösen kann. Die Kernarbeit jeder Person wird zu Selbstanalyse und -untersuchung: Welche Entscheidungsrahmen gibt es in Ihrem Kopf, die nicht in der Codebasis geschrieben sind? Wie bestimmen Sie Prioritäten? Welche Daten müssen Sie abrufen? Und welche einzigartigen Entscheidungen treffen Sie? Diese „Urteilskraft“ wird zum einzigen knappen Vermögenswert. Wo also soll sie angesiedelt sein?
Harness (Steuerungsframework)
Wenn die heutige Arbeit dazu geworden ist, Urteilskraft zu kodieren, statt mechanisch Operationen auszuführen, braucht diese Urteilskraft einen Träger. Sie befindet sich in Harness. Harness ist der einzige Ort, an dem Ihre Ingenieurstandards nicht nur in Ihrem Kopf bleiben, sondern in jeder Sitzung tatsächlich ablaufen: Wie Sie Probleme verteilen, Ihre einzigartigen Architekturentscheidungen und die unveränderlichen Liefergrenzen. Wenn Sie sie nur in Dokumente schreiben, werden sie am nächsten Tag zu veralteten Inhalten, die niemand mehr liest; wenn Sie sie in Harness schreiben, wird Ihre Urteilskraft auch dann millionenfach in Arbeiten umgesetzt, die Sie nicht beobachten, wenn Sie nicht anwesend sind. Das ist die Verkörperung der „Meta-Arbeit“. Wenn Sie Ihre Prinzipien neuen Mitarbeitern vermitteln, geht etwas verloren, die Hälfte davon wird nie mündlich ausgedrückt; aber wenn Sie sie Harness vermitteln, bleibt sie intakt und erzeugt einen Zinseszinseffekt – denn jede Entscheidung, die Sie kodieren, bedeutet, dass Sie sie nicht ein zweites Mal treffen müssen. Das ist ein zentraler Schutzmechanismus, den Konkurrenten niemals kopieren können, weil es die konkrete, niedergeschriebene Form Ihres Unternehmens ist.
Der zweite Grund, warum Harness ausschließlich Ihnen gehören muss, ist: Mit jeder neuen Version des Modells verschlingt es die darunter liegende technische Ebene. Manuelle Kontextverwaltung, benutzerdefinierte Sub-Agent-Konfigurationen, clevere Umgehungslösungen, die sich die Menschen ausgedacht haben … AI-Labore verfolgen genau, welche Lösungen funktionieren und integrieren sie direkt. Daher werden die cleveren Tricks, auf die Sie sich in diesem Quartal verlassen, im nächsten Quartal zu Standardfunktionen des Systems. Wenn Sie auf Mechanismen setzen, spielen Sie im Grunde gegen das AI-Labor, und Sie werden bei jeder neuen Modellversion verlieren. Es gibt jedoch zwei Dinge, die sie strukturell niemals liefern können: Erstens Ihre Urteilskraft, also die Entscheidungen, die nur Sie treffen (das ist der Kern des vorherigen Abschnitts); zweitens Neutralität. Die heutigen Labor-Harness können zwar ihre eigenen Sub-Agents verwalten und ihre eigenen Überprüfungsverfahren ausführen – das ist echtes Ingenieurdesign und wirklich gut – aber sie sind immer auf eine einzige Familie beschränkt und auf eine durchschnittliche Codebasis abgestimmt, denn kein Labor wird Ihre Arbeit an das Modell eines Konkurrenten weiterleiten. Da wir keine Modelle trainieren, bleibt diese Ebene absolut neutral: Ihre Urteilskraft kann flexibel zwischen den besten Modellen verschiedener Labore wechseln, und die Arbeit fließt dorthin, wo das Modell in dieser Woche bei einer bestimmten Aufgabe am besten abschneidet. Wir trainieren keine Modelle, Labore liefern ihre eigenen Präferenzen, und nur Sie können Ihre eigenen Präferenzen liefern.
Analysieren Sie den Engpass und überfluten Sie ihn mit Token
Wie bauen Sie also ein solches Harness auf? Sicher nicht durch klügere Modelle oder schnellere automatische Vervollständigung. Menschen, die bereits in dieses Muster eingetreten sind, stimmen einer Methode zu: Sie stimmen die Konfiguration fein auf ihre eigene Codebasis ab und schütten Token massiv in die Phasen des Entwicklungslebenszyklus, in denen Sie am ehesten ins Straucheln geraten. In der Branche gibt es dafür ein beliebtes Wort: Tokenmaxxing (Token-Maximierung).
Wer dies verstanden hat, ist in ein neues Paradigma eingetreten. Die Teamgröße bleibt schlank, der Informationssymmetriegrad und die Effizienz der Ideen sind sehr hoch. Funktionen, die Ihr Team aufgrund überfüllter Warteschlangen monatelang abgelehnt hat, sind jetzt fertig, wenn Sie aufwachen. Hier ist das wahre Bild einiger meiner aktuellen Kunden:
Ein Produktmanager fungiert allein als gesamtes Entwicklungsteam. Er lädt jeden Tag 1000 US-Dollar an Token auf und führt Code schneller zusammen als jedes Team, das er je geleitet hat.
Ein von Risikokapital finanzierter Einzelgründer hat beschlossen, überhaupt keine Mitarbeiter mehr einzustellen.
„Sitzplätze“ sind die falsche Maßeinheit für Rechenleistung, „Token“ ist die richtige Einheit. Die Regel ist sehr klar: Bei jeder Modelliteration analysieren Sie, wo menschliche Zeit verbraucht wird und wo der Engpass liegt, und schlagen dann mit Token zu, bis der Engpass beseitigt ist. Das Ziel lautet: Beginnen Sie mit einem Hinweiswort, minimieren Sie menschliche Eingriffe in der Mitte und enden Sie mit einer erfolgreichen einmaligen Zusammenführung (One-shot merge). Die Zeit der Menschen ist der Engpass, nicht die Token.
Diese Regel konsequent umzusetzen, ist selbst eine Vollzeitbeschäftigung. Infrastruktur aufbauen, Sub-Agents konfigurieren, geeignete Modelle für verschiedene Aufgaben zuweisen, gegnerische Überprüfungsmechanismen einbinden und alles neu anpassen, wenn alle paar Wochen neue Modelle veröffentlicht werden und der Thron des besten Modells wechselt – die meisten Teams haben keine solche Stelle auf ihrer Gehaltsliste, und was sie manuell aufbauen, wird oft innerhalb eines Quartals veraltet. Opus 4.5 hat die Branche Ende Mai umgestaltet; zwei Wochen später hat Fable 5 die Regeln neu geschrieben, verschwand aber wenige Tage nach seiner Veröffentlichung wieder. Egal, wofür Sie sich letzte Woche abgestimmt haben, diese Woche könnte eine bessere Alternative auftauchen.
Zwischen einem Hinweiswort und der endgültigen Zusammenführung der Pull Request gibt es sechs Engpässe: Gerät, Planung, die Organisation vieler Mikropläne zu einer einzigen Änderung, Test