Die weltweit erste interaktive Buchliste zum Literaturnobelpreis im gesamten Internet ist erschienen, dies ist die unterhaltsamste neue Funktion von GPT-6
Als Mo Yan 2012 den Literaturnobelpreis erhielt, brauchte ich eine ganze Nacht, um die Lesereihenfolge der Werke *Große Brüste und Breite Hüften*, *Die Frösche* und *Rotes Sorghum* zu ordnen.
In diesem Jahr sind die chinesische Schriftstellerin Can Xue und der japanische Schriftsteller Haruki Murakami erneut ohne Preis geblieben, die kanadische Dichterin und Schriftstellerin Anne Carson hat den Literaturnobelpreis 2026 gewonnen.
Ich hatte mich bereits darauf vorbereitet, wieder eine Nacht mit Recherchen, Sortieren und Erstellen einer Leseliste zu verbringen, aber als ich ChatGPT nur einen Satz schickte „Bitte erstelle mir eine Leseliste für Anne Carsons Werke im Stil von Karten-Tagebüchern“, erhielt ich in weniger als drei Minuten eine anpassbare und auswählbare Lesekarte.
Du kannst die Karten nacheinander durchblättern, um zu prüfen, welches Buch für Anfänger geeignet ist, an welcher Stelle es stehen sollte und was du vor dem Lesen wissen musst. Nachdem du ein Buch gelesen hast, klickst du auf „Lesen abgeschlossen“, die Karte wird markiert und der Lesefortschritt wird automatisch aktualisiert.
Wer hätte gedacht, dass all diese Funktionen von GPT-6 und Intelligent UI bereitgestellt werden, die OpenAI am 7. Oktober unter dem Titel „GPT‑6 and Intelligent UI for everyone“ veröffentlicht und für alle ChatGPT-Nutzer ausgerollt hat.
Alle Szenarien können visualisiert werden
Das ist nicht das einzige interessante Beispiel für Intelligent UI.
OpenAI definiert Intelligent UI als „intelligente Oberfläche“, das heißt, ChatGPT kann bei der Beantwortung von Nutzerfragen Texte, Bilder, Schaltflächen, Formulare, Diagramme und interaktive Tools dynamisch kombinieren.
Das bedeutet, dass künstliche Intelligenz früher nur Texte ausgeben konnte, während das aktuelle GPT-6 auf Basis deiner Fragen eigenständige Oberflächen mit Layouts, Schaltflächen, Formularen, Diagrammen und verschiedenen interaktiven Steuerelementen vor Ort zusammenbauen kann.
Die Frage, die du stellst, bleibt unverändert, aber das Ergebnis ist nicht mehr nur eine einfache Antwort.
Nach den offiziellen Beispielen von OpenAI umfassen solche Anwendungen hauptsächlich Szenarien wie Wissenslernen, Unterhaltung und Alltagsleben: Wenn du beispielsweise einen Plan für einen Sonntagsbraten erstellst, können Rezept, Einkaufsliste und Zeitplan gleichzeitig angezeigt werden. Bei der Planung einer Autoreise können die Rastplätze entlang der Route direkt auf der Karte markiert werden, zusammen mit Hinweisen auf Stellen, die umfahren werden müssen.
Neben der vollständigen Nachbildung dieser Szenarien haben wir auch einige interessante neue Nutzungsmöglichkeiten entwickelt.
Zum Beispiel haben wir einen wichtigen Wissenspunkt aus dem Chemielehrbuch der Mittelstufe getestet: Wir haben nur den Befehl gegeben „Erkläre mir, wie man einen Alkoholbrenner benutzt“.
Das Modell sucht zuerst Informationen und erzeugt nach etwa 52 Sekunden ein interaktives Konzept. Die Nutzung des Alkoholbrenners ist in sechs wichtige Schritte unterteilt, jeder Schritt ist mit einem entsprechenden Hinweis versehen. Nutzer können der Reihenfolge nach lernen oder direkt zu den Teilen springen, die sie nicht kennen: Warum man den Brenner nicht ausblasen darf, warum die Kappe zweimal aufgesetzt werden muss und was zu tun ist, wenn der Alkohol fast aufgebraucht ist.
Intelligent UI kann auch zur Erstellung kleiner persönlicher Spiele verwendet werden.
Wenn du beispielsweise ein Retro-Spiel spielen möchtest, kannst du direkt zu GPT sagen „Ich spiele gerne Snake, erstelle mir ein kleines Snake-Spiel“.
Du erhältst eine Oberfläche, auf der du direkt spielen kannst, keine Anleitung für Spielregeln. Das Spiel hat vollständige Regeln, eine Punktzählung und Echtzeit-Feedback. Nach jedem verzehrten Energieblock bekommst du 10 Punkte, die Punktzahl ändert sich mit der Bewegung der Schlange und der Bildschirm aktualisiert sich entsprechend.
Wer sieht das und ruft nicht aus, dass 4399 zurück ist!
Wenn dir das gewöhnliche Snake langweilig erscheint, kannst du es weiter anpassen und eigene Regeln festlegen, zum Beispiel den Befehl geben „Verändere die Schlange zu einem niedlichen Bären und setze die Punktzahlregel so, dass man 20 Punkte für jeden verzehrten Energieblock bekommt“.
Das Modell ersetzt nicht nur einen Codeabschnitt, sondern passt auch das Charakterbild, die Spielregeln, die Punktzählung und die Oberflächendarstellung an. Nach der Eingabe der neuen Anforderung ändert sich die Spieloberfläche entsprechend, der Vorgang dauert aber etwas länger als die erste Generierung.
In praktischen Alltagsszenarien wird der Wert von Intelligent UI sehr deutlich.
Wenn du ein Haustier hast und dir nicht sicher bist, wie du es am besten anziehen sollst, kannst du die Fotos hochladen und fragen „Welches Outfit passt besser zu den Eigenschaften meines Haustiers?“
GPT stellt die beiden Kleidungsstücke nebeneinander und markiert Informationen wie Farbe, Größe, Material und Anwendungsbereich, sodass Nutzer je nach Nutzungsszenario und Präferenz wählen können.
Das bedeutet nicht, dass Diagramme, Schaltflächen und Texte einfach zusammengewürfelt werden, sondern dass die Antwort die Fähigkeit erhält, weiterverwendet zu werden.
Die „Black Box“, die die Antwort auslöst
Als wir zum ersten Mal die Demo von OpenAI für das interaktive Mahjong sahen, dachten wir, wir hätten die Zukunft der Chat-Oberfläche gefunden. Auf dem Spielbrett erscheinen Schaltflächen, die Kacheln können bedient werden und die Seite ändert sich entsprechend der Antwort.
Das Modell gibt nicht nur Texte aus, sondern stellt dir direkt etwas vor, mit dem du spielen kannst.
Aber bei der praktischen Nutzung haben wir festgestellt, dass die UI-Oberfläche sehr zufällig erscheint.
Wir haben auf dieselbe Weise wie in der Demo versucht, ein Mahjong-Spiel zu generieren, aber das Ergebnis zeigte keinen Mahjong-Tisch, keine Schaltflächen und keine klickbaren Elemente, sondern nur einen vollständigen, sehr höflichen und gewöhnlichen Text.
Aarush Selvan, Produktmanager bei OpenAI, erklärt diese Zufälligkeit so: „Unser Designteam hat viel Zeit damit verbracht, zu untersuchen, in welchen Fällen das Hinzufügen von Diagrammen und Schaltflächen nützlich ist und in welchen Fällen es Benutzer verwirrt.“
Aber bei praktischen Tests ist der Eindruck, dass du nie weißt, auf welche Weise deine Frage beantwortet wird – ob du nur einen Text oder ein interaktives Produkt bekommst. Wie der Satz aus dem Film *Forrest Gump* lautet: „Das Leben ist wie eine Schachtel Pralinen, man weiß nie, was man bekommt.“
Ohne besondere Hinweise entscheidet ChatGPT je nach Aufgabe, ob die Antwort interaktiv gestaltet wird. Vergleichsfragen können nebeneinander angeordnet werden, komplexe Konzepte können durch interaktive Diagramme dargestellt werden, einfache Fragen werden vorrangig mit Text beantwortet.
Das liegt daran, dass Intelligent UI nicht einfach eine von dem Modell spontan „gezeichnete Webseite“ ist, sondern eine Bibliothek nativer Komponenten in Kombination mit einem zugehörigen Oberflächencompiler. Das Modell kann Elemente wie Texte, Diagramme, Schaltflächen, Formulare und Interaktionsbereiche aufrufen, und der Compiler zeigt die Ergebnisse schrittweise an, während er die Ausgaben des Modells erhält.
Aber genau hier liegt auch der Unterschied zu einem gut nutzbaren interaktiven Erlebnis: Dynamische Diagramme und interaktive Komponenten wirken eher wie ein einmaliges Erlebnis.
Ihnen fehlt ein stabiler, zuverlässiger Code-Sandbox und ein eigener Zugriff auf Assets, sodass Intelligent UI bei leichten Aufgaben sehr flüssig funktioniert, aber bei Szenarien, die hohe Genauigkeit und Professionalität erfordern, noch unzureichend ist.
Intelligent UI unterstützt derzeit noch nicht Pro Effort, das auf GPT-6 Astra basiert. Das bedeutet, dass die neue interaktive Oberfläche und das leistungsstärkste Denkmodus nicht gleichzeitig verwendet werden können. Echte komplexe Aufgaben, die langwieriges Nachdenken erfordern, kehren möglicherweise wieder zum traditionellen Textformat zurück. Wann diese beiden Funktionen endgültig kombiniert werden können, ist noch ein Problem, das OpenAI lösen muss.
Im Chat-Fenster „aktiv spielen“
Erinnere dich an die ersten Szenarien der Interaktion mit großen Sprachmodellen in Chat-Fenstern: Damals hat uns eine Antwort, die den fortlaufenden Kontext verstehen konnte, schon sehr begeistert.
Heute beginnt Intelligent UI, die gewöhnlichen Fragen und Antworten zu kleinen Oberflächen zu verwandeln, die man anklicken, ziehen und mit denen man spielen kann – sodass wir im Chat-Fenster „aktiv spielen“ können.
Seine zugrundeliegende Logik liegt darin, dass die Multimodalitätsintegration unsere Art der Interaktion mit großen Sprachmodellen verändert hat.
Natürliche Sprache eignet sich gut zur Beschreibung komplexer Ziele, aber nicht unbedingt für präzise Bedienvorgänge. Grafische Oberflächen eignen sich gut zur Beobachtung von Zuständen, zum Vergleich von Optionen und zur Anpassung von Parametern – beide Interaktionsarten ergänzen sich gegenseitig.
Das ist vergleichbar mit dem ersten iPhone im Jahr 2007, das Tippen, Wischen und Zoomen mit zwei Fingern eingeführt hat, um die Bedienung von Mobiltelefonen neu zu definieren und die indirekte Bedienung über physische Tasten durch das direkte Berühren des Bildschirms zu ersetzen.
Einfacher, effizienter und direkter.
Intelligent UI wandelt die Interaktion von der reinen Beantwortung von Fragen in eine Beteiligung des Nutzers an der Problemlösung um. Die Antwort ist nicht mehr das Ende des Gesprächs, sondern ein Objekt, das berührt, angepasst und weiterverwendet werden kann.
Über die Chat-Szenarien hinaus ist diese Veränderung bereits in mobilen intelligenten Assistenten zu sehen. Die technische Vorschauversion des Doubao-Mobilassistenten verbindet den Chat mit der Systembedienungsebene. Honor hat in den Veröffentlichungsunterlagen zu MagicOS 9.0 demonstriert: Wenn der Nutzer sagt „Bestelle mir einen heißen Latte Macchiato“, ruft YOYO die übliche Essensliefer-App auf, findet das bevorzugte Café, schließt die Bestellung ab und bittet den Nutzer um Bestätigung vor der Bezahlung.
Der Wert dieser Interaktion liegt darin, dass der Nutzer nicht mehr nur Leser von Antworten ist, sondern an der Aufgabenbearbeitung teilnimmt.
OpenAI drückt es noch direkter aus: „In den letzten Jahrzehnten mussten die Menschen lernen, mit festen Programmen zu arbeiten, die für bestimmte Aufgaben entwickelt wurden. In Zukunft soll Software sich an die vielfältigen Arbeitsweisen der Menschen anpassen.“
Ob diese Veränderung wirklich der Beginn einer neuen Form von Software ist, schrieb Anne Carson in ihrem Buch *Die Autobiographie des Roten*: „Wie sieht Entfernung aus? …… Sie hängt vom Licht ab.“
Jetzt hat Intelligent UI dieses Licht in das Chat-Fenster gebracht.
Dieser Artikel stammt aus dem WeChat-Offiziellen Konto „APPSO“, Autor: APPSO für zukünftige Produkte, und wird mit Genehmigung von 36Kr veröffentlicht.