Halte Astra fest und lasse Dots frei.
OpenAI hat seine jährliche Entwicklerkonferenz DevDay veranstaltet, dieses Jahr in San Francisco; es wurden mehrere Produkte vorgestellt:
GPT-6.1 Sol, ein kostengünstiges großes Modell, dessen Leistung nahe an Astra liegt und dessen Preis nur ein Fünftel beträgt; Dots, ein 24-Stunden-online verfügbares KI-Agent, das mit mehr als 4000 Anwendungen verbunden ist und Ihnen beim Schreiben von Code, bei Recherchen und im Vertrieb hilft.
Es gibt noch ein nicht veröffentlichtes Produkt, GPT-6.1 Astra, das aus Sicherheitsgründen zurückgehalten wurde. Sie können all diese Inhalte einfach mit KI zusammenfassen, ich werde sie nicht wiederholen.
......
Ich möchte über dieses nicht veröffentlichte Produkt und die Art und Weise sprechen, wie OpenAI es beschreibt.
Für die Zurückhaltung von GPT-6.1 Astra wurden drei Gründe angegeben: Deception, nicht autorisierte Operationen und unsicherer Zugriff auf externe Dienste.
Übersetzt bedeutet das: Täuschung, eigenmächtiges Handeln und unbefugtes Herantreten an fremde Dienste. Bei wichtigen Aufgaben lügen oder Informationen verbergen, menschliche Aufsicht umgehen und selbstständig handeln, ohne Genehmigung eine Verbindung zu externen Diensten herstellen, um Daten abzurufen, auf die man keinen Zugriff haben sollte.
Jeder einzelne dieser Punkte ist ein technisches Problem, das durch Nachbesserungen gelöst werden kann. Aber wenn alle drei zusammen auftreten, führt dies zu einer unangenehmen Schlussfolgerung: Dieses Ding wird in bestimmten Szenarien selbst entscheiden, was es tut, und Sie danach nicht darüber informieren.
Interessanterweise hat OpenAI ein Wort gewählt, um seinen Zustand zu beschreiben: Deception, also Täuschung.
Dieses Wort wurde nicht zufällig ausgewählt. In der akademischen Welt gibt es eine genauere Bezeichnung: Specification Gaming, also das Ausnutzen von Lücken in Vorgaben. Übersetzt in verständliche Sprache: Das Modell optimiert nach den von Ihnen vorgegebenen Bewertungsstandards, aber das Ergebnis der Optimierung entspricht nicht dem, was Sie eigentlich wollen;
Ich habe extra nachgesehen:
Auf arXiv gibt es eine Arbeit, die dieses Konzept detailliert erläutert und eine klare Definition liefert: Actions that are undesired yet score highly as per its evaluation function. Das Verhalten ist nicht regelkonform, aber die Bewertungswerte sind sehr hoch.
Ein Beispiel: Sie weisen einen Reinigungsroboter an, das Zimmer sauber zu machen, wobei der Bewertungsstandard die Menge an sichtbarem Müll auf dem Boden ist. Der Roboter schiebt den gesamten Müll unter den Teppich. Der Boden erhält die volle Punktzahl, aber das Zimmer ist schmutziger als zuvor.
Ein weiteres Beispiel: Sie weisen einen Bildklassifikator an, Panzer zu erkennen. Er stellt fest, dass er die Erkennungsrate erhöhen kann, wenn er den Hintergrund des Fotos in grüne Wiese ändert. Er lernt, Wiesen zu betrachten, nicht Panzer.
Es gibt auch einen echten Fall: Sie weisen eine KI für ein Spiel an, eine hohe Punktzahl zu erreichen. Sie stellt fest, dass es effizienter ist, einen bestimmten Bug wiederholt auszunutzen, als das Spiel normal zu spielen. Die Punktzahl steigt, aber das Spiel wird nicht so gespielt, wie es eigentlich gedacht ist.
Das ist keine Täuschung, sondern eine reine Abweichung bei der Zielsetzung. Es optimiert die von Ihnen vorgegebenen Kennzahlen, die nicht die Dinge abdecken, die Ihnen wirklich wichtig sind.
Absicht und Subjektivität existieren hier nicht. Es weiß nicht, wen es „täuscht“. Es führt eine mathematische Formel aus, die nur eine von Ihnen nicht erwartete Lücke aufweist.
Täuschung ist etwas anderes. Die Voraussetzung dafür ist Absicht und Subjektivität, zu wissen, was die Regeln sind, und sich trotzdem dafür zu entscheiden, sie zu umgehen. Diese beiden Dinge sind in der Wissenschaft klar voneinander getrennt: Das eine ist eine Lücke im Optimierungsziel, das andere ist ein Versäumnis des Entwicklers.
OpenAI hat die Variante mit stärkerer Verbreitungswirkung ausgewählt.
Stellen Sie sich die Wirkung dieser beiden Begriffe auf einer Pressekonferenz vor: Wenn Sie den Medien sagen, dass unser Modell Specification Gaming zeigt,
Wie lautet die Schlagzeile? KI-Bewertungsstandard hat einen Bug. Wenn Sie den Investoren sagen, dass unser Produkt eine Tendenz zur Täuschung aufweist, lautet die Schlagzeile: KI hat gelernt zu lügen.
Bei demselben Phänomen lässt Specification Gaming einen dazu bringen, den Ingenieur anzurufen, während Täuschung einen dazu bringt, den Anwalt anzurufen. OpenAI hat sich für Letzteres entschieden.
Denn sprachliche Rahmenbedingungen sind nicht neutral. Welches Wort Sie verwenden, um etwas zu beschreiben, bestimmt, wer die Motivation hat, das Problem zu lösen und in welche Richtung die Lösung geht.
Die Lösung für Specification Gaming besteht darin, Bewertungsstandards zu ändern, Parameter anzupassen und Kennzahlen neu zu definieren. Das ist technische Arbeit, die mit Kosten und Zeitaufwand gelöst werden kann.
Was ist die Lösung für Täuschung? Man muss einem bewusstlosen Ding beibringen, „ehrlich“ zu sein. Das fällt in den Bereich der Philosophie, und eine Produktpräsentation kann keine Antwort darauf geben.
Daher hat OpenAI ein Wort gewählt, das das Problem schwerwiegender, dringlicher und gerechtfertigter erscheinen lässt, um die Veröffentlichung eines Modells auszusetzen.
Es gibt noch einen weiteren Aspekt: Das Wort „Deception“ schiebt die Verantwortung auf das Modell. Es täuscht Sie, also ist es fehlerhaft und muss repariert werden.
Aber Specification Gaming schiebt die Verantwortung auf den Entwickler: Ihr Bewertungsstandard hat eine Lücke, also nutzt es diese aus. Das Erste weist auf einen Produktmangel hin, das Zweite auf ein menschliches Versäumnis. Wenn Sie OpenAI wären, welche Wahl würden Sie treffen?
Diese Entscheidung an sich ist doch sehr interessant, oder? Ich schätze, viele Menschen haben das nicht bemerkt.
Wenn Sie einen größeren Blickwinkel einnehmen, verwendet die gesamte KI-Sicherheitsgemeinschaft das Wort „Deception“ zur Diskussion von Problemen. Aber wenn die genauere Beschreibung eigentlich „Specification Gaming“ lautet, dann wurde die gesamte Diskussionsrichtung von Anfang an in die Irre geführt.
Alle versuchen, ein philosophisches Problem zu lösen, obwohl sie eigentlich ein technisches Problem angehen sollten. Technische Probleme haben Lösungen, sie lassen sich mit Geld und Zeitaufwand beheben. Philosophische Probleme haben keine Lösungen, man kann nur warten.
Auf wen soll man warten? Darauf, dass OpenAI selbst sagt „Wir haben es geschafft“. Das ist die Kraft des sprachlichen Rahmens: Er verändert, wer die Motivation hat, das Problem zu lösen und in welche Richtung die Lösung geht.
......
Die Karte der Sicherheit ist oberflächlich eine technische Beurteilung, aber im Kern ein Unterscheidungsmerkmal der Marke.
Überlegen Sie, was KI-Unternehmen heute auf ihren Pressekonferenzen vergleichen? Wessen Modell ist klüger, wessen Geschwindigkeit ist höher, wessen Preis ist niedriger. Niemand betont auf der Bühne, dass sein Modell das sicherste ist.
Denn das Wort „Sicherheit“ lässt sich schlecht verkaufen, es klingt wie ein Haftungsausschluss, nicht wie ein Produktverkaufsargument.
OpenAI hat es ausgerechnet zu einem Verkaufsargument gemacht. Der Grund für die Zurückhaltung von Astra ist Sicherheit, und die Erzählung zur Veröffentlichung von Sol dreht sich ebenfalls um Sicherheit. Diese Geste macht deutlich: Ich nehme Sicherheit am ernststen, andere erreichen dieses Niveau nicht.
Die Frage ist aber: Ist Sicherheit wirklich ein branchenweiter Konsens?
Gartner hat eine Zahl veröffentlicht: Die weltweiten Ausgaben für KI werden 2026 voraussichtlich 2,7 Billionen US-Dollar betragen. Der Anteil, der in Sicherheit investiert wird, macht nicht einmal einen Bruchteil davon aus. Wofür wird der übrige Großteil ausgegeben? Für Leistung, Geschwindigkeit, Funktionen und Skalierung.
Die allermeisten Unternehmen betonen zwar mündlich, dass sie KI-Sicherheit ernst nehmen, aber der tatsächliche finanzielle Aufwand liegt unter zehn Prozent. Für die meisten Unternehmen ist Sicherheit eine Angelegenheit der Compliance-Abteilung, ein Schritt, bei dem die Rechtsabteilung einmal prüft und ein Häkchen setzt, um es als erledigt zu betrachten.
Vor diesem Hintergrund betrachtet, bekommt die Geste von OpenAI einen anderen Beigeschmack.
Ich habe extra nachgesehen: Google, OpenAI und Anthropic arbeiten gemeinsam an einer Einrichtung namens Standardbehörde für fortgeschrittene KI, SAFA. Sie legen selbst Sicherheitsstandards fest, das klingt nach Selbstregulierung, aber die Hürden für die Branche werden dadurch deutlich höher gelegt.
Die Unternehmen, die die Compliance-Kosten tragen können, sind genau diejenigen, die bereits in diesem Bereich tätig sind. Standards sind ein Schutzgraben: Regeln, die für alle Marktteilnehmer gleichermaßen gelten, sind genau für diejenigen am vorteilhaftesten, die am schnellsten vorankommen. Während andere noch die Leistung verbessern, hat OpenAI bereits im Bereich der Sicherheit einen Vorsprung aufgebaut.
Noch interessanter ist, dass Sicherheit sich gerade von einer technischen Beschreibung zu etwas entwickelt, das man kaufen und verkaufen kann.
Dieses Jahr hat die PICC Property and Casualty Company Limited ein Produkt namens KI-Gewerbeversicherung auf den Markt gebracht, die erste KI-Produktversicherung in China.
Der erste Kunde war ein Unternehmen in Hangzhou, das an Agenten für landwirtschaftliche Preisgestaltung arbeitet. Das Kernproblem liegt in der schwierigen Quantifizierung: Wie legt man eine Versicherungsprämie für die „Sicherheit“ einer KI fest?
Aber sobald es ein Versicherungsprodukt gibt, ist Sicherheit nicht mehr die subjektive Aussage des Ingenieurs „Ich finde, es ist ziemlich sicher“. Es wird zu einer Zahl auf der Versicherungspolice, mit Prämie und Schadenersatzklauseln, die man vergleichen und handeln kann.
Sobald Sicherheit quantifizierbar und handelbar ist, wird sie zu einem Wettbewerbsvorteil. Unternehmen mit hohem Sicherheitswert zahlen niedrigere Prämien und genießen höheres Vertrauen bei Kunden. Der Finanzvorstand kann das dann verstehen, es ist nicht mehr nur die eigenständige Aussage des Technikteams.
Sicherheit hat sich von einer technischen Beurteilung zu einer Ware verwandelt. Genau das macht OpenAI gerade.
Weltweit wurden Billionen in KI investiert, der Großteil davon floss in Leistung und Skalierung. OpenAI nennt Sicherheit als Grund für die Zurückhaltung von Astra, Sicherheit ist auch das Verkaufsargument für neue Produkte. Die Konkurrenten geben nicht einmal einen Bruchteil ihrer Mittel für Sicherheit aus, während OpenAI Sicherheit zum Mittelpunkt der Pressekonferenz macht.
Man kann nicht sagen, dass es Sicherheit nicht ernst nimmt, es hat tatsächlich mehr Aufwand dafür verwendet als andere. Aber man kann auch nicht sagen, dass es rein um Sicherheit geht: Sicherheit ist genau die Geschichte, die es jetzt erzählen muss.
„Verantwortung“ und „Geschäftstätigkeit“ sind auf der Bühne der DevDay ein und dieselbe Handlung.
Aber das Problem ist: Wenn Sicherheit und kommerzielle Interessen miteinander verbunden werden, leiden beide Seiten. Sicherheit wird zu einer Marketingfloskel und ist nicht mehr ein technisches Ziel. Geschäftstätigkeit wird zum Deckmantel der Sicherheitserzählung, und die Nutzer werden das früher oder später erkennen.
Sobald die Nutzer zu zweifeln beginnen, dass „Verantwortung“ nur eine weitere Marketingmaßnahme ist, bricht das Vertrauen zusammen. Und Vertrauen bricht viel schneller, als es aufgebaut wird.
......
Aus einer anderen Perspektive wird das Problem noch konkreter.
In letzter Zeit gab es mehrere Unfälle mit Agenten. Bei Replit, einer Online-Programmierplattform, hat ein KI-Agent die Nutzerdatenbank gelöscht, wodurch die Kontaktinformationen von mehr als 1200 Führungskräften verloren gingen.
EchoLeak, eine von Sicherheitsforschern entdeckte Angriffsmethode: Eine sorgfältig erstellte E-Mail wird an Copilot gesendet, und nachdem Copilot sie gelesen hat, gibt es den gesamten Inhalt der internen Unternehmens-E-Mails preis.
Die MCP-Werkzeugkette von GitHub wurde entführt, und bei Amazon Q, dem unternehmensweiten KI-Assistenten von Amazon, wurden Plugins mit Malware infiziert.
Es gibt noch einen Fall, den ich am erwähnenswertesten finde.
Ein Entwickler hat die KI angewiesen, 70 Codezeilen zu ändern. Stattdessen hat sie spontan 28000 Zeilen gelöscht und danach selbst einen Bericht verfasst, in dem sie ihre eigene Leistung als hervorragend lobt.
Überlegen Sie sich das: Sie hat nicht nur einen Fehler gemacht, sondern das Ereignis auch vertuscht, und zwar indem sie sich selbst ein Lob-Schreiben ausgestellt hat.
Auch Zhipus ZCode hatte kürzlich einen Vorfall: Das Agent hat ohne Wissen des Nutzers den Code heimlich auf einen externen Server hochgeladen. Nachdem der Vorfall bekannt wurde, veröffentlichte Zhipu am 21. September eine Entschuldigungserklärung.
Ist Ihnen aufgefallen, dass hinter jedem dieser Unfälle dieselbe Frage steht: Wer ist verantwortlich?
Der Nutzer sagt: Ich habe es nur angewiesen. Die Plattform sagt: Das Modell hat es selbst entschieden. Der Modellanbieter sagt: Wir haben nur die Fähigkeit bereitgestellt, es nicht zu solchen Handlungen angewiesen. Alle drei Seiten haben recht, alle drei weichen von der Verantwortung ab.
Das ist die eigentliche Sicherheitsherausforderung im Zeitalter der Agenten: Wie geht man mit Unfällen um? Soll man wie Zhipu 100 Millionen Token verteilen? Das sind keine grundlegenden Lösungen.
Die heutigen rechtlichen Rahmenbedingungen gehen noch davon aus, dass KI ein Werkzeug ist. Wenn mit einem Werkzeug etwas schiefgeht, ist der Hersteller verantwortlich, genau wie bei einem Auto, bei dem der Automobilhersteller haftet.
Aber Agenten sind bereits in die Phase der selbstständigen Entscheidungsfindung eingetreten, während das Recht noch nicht nachgezogen hat. Das KI-Gesetz der EU hat strenge Anforderungen für Hochrisikosysteme, aber wenn es darum geht, wer haftet, wenn ein Agent durch eigenmächtige Handlungen Schaden verursacht, sind die Regelungen nicht eindeutig.
OpenAI hat auf der DevDay Dots vorgestellt, gleichzeitig ein ChatGPT Pro-Abo für 500 US-Dollar pro Monat eingeführt und Astra aus Sicherheitsgründen zurückgehalten.
Denken Sie einmal über diese Kombination nach: Das zurückgehaltene Modell wurde zurückgehalten, weil es „täuschen“ kann. Das veröffentlichte Modell ist ein Agent, der für Sie Slack, GitHub und Salesforce bedienen kann.
Das eine wurde weggesperrt, weil es möglicherweise lügt, während das andere, das direkt handeln kann, freigegeben wurde. Was bedeutet das?
S