ChatGPT lehrt mich Mahjong zu spielen, Praxistest der intelligenten Benutzeroberfläche von OpenAI: Neudefinition der KI-Interaktion
Das alte Modell reicht für OpenAI nicht mehr aus. Am 7. Oktober kündigte OpenAI an, GPT-6 allen Nutzern von ChatGPT zugänglich zu machen und gleichzeitig eine neue Funktion namens Intelligent UI (Intelligente Oberfläche) zunächst für zahlende Nutzer einzuführen.
Im Vergleich zu den üblichen Verbesserungen von GPT-6 in Bereichen wie Schlussfolgerung und Programmierung interessiere ich mich viel mehr für diese „kleine Funktion“. Der Grund ist einfach: ChatGPT existiert seit fast vier Jahren, die Fähigkeiten großer Modelle sind heute nicht mehr mit früher zu vergleichen, aber die Art und Weise, wie wir mit KI interagieren, hat sich kaum verändert.
Die Branche hat längst erkannt, dass ein reiner textbasierter Chatbot nicht die optimale Lösung für die KI-Interaktion sein kann. Letztes Jahr erforschte Google auf Gemini 3 die generative UI, und Ant Linguang versuchte auch, KI dazu zu bringen, interaktive Oberflächen und Anwendungen in Echtzeit zu generieren.
Jetzt gibt auch OpenAI seine eigene Antwort.
Bildquelle: Lei Technology @ChatGPT
Einfach ausgedrückt generiert GPT-6 in der neuen Version von ChatGPT nicht nur Inhalte in verschiedenen Formen wie Text, Bildern oder Tabellen gemäß der Frage, sondern kann auch aktiv beurteilen, welche Art von Oberfläche der Nutzer benötigt, und sogar direkt bedienbare interaktive Tools in die Antwort einfügen. Nutzer müssen weder neue Bedienmethoden erlernen noch ausdrücklich die Anforderung zur Generierung einer Oberfläche stellen.
Klingt zunächst so, als würde nur die Darstellungsform der Antworten von ChatGPT vielfältiger, aber nach praktischen Erfahrungen von Lei Technology liegt der eigentliche interessante Punkt von Intelligent UI in der Interaktion.
KI lehrt mich Mahjong spielen? ChatGPT stellt direkt ein Kartenspiel auf
„Lehre mich Kantonesisches Mahjong.“ Zuerst habe ich ChatGPT eine sehr einfache Anfrage gestellt.
Die Grundregeln von Mahjong sind nicht schwer zu finden, aber es besteht noch eine große Lücke zwischen dem Auswendiglernen von „vier Kartengruppen plus einem Paar“ und dem Wissen, welche Karte man aus einer Hand ausspielen soll. Wenn man es nur mit Text erklärt, müssen Nutzer die Regeln lesen, die Karten im Kopf aufstellen und sich vorstellen, was nach dem Ziehen und Ausspielen einer Karte passiert.
ChatGPT erläutert zuerst, dass es die Lehrversion des kantonesischen „Tuidohu“-Mahjongs verwendet, und stellt dann mit begleitenden Bildern die Kategorien Wan, Tong, Tiao und Schriftkarten vor. Bei der Erklärung der Gewinnregeln werden vier Kartengruppen und ein Paar direkt gruppiert angeordnet.
Bildquelle: Lei Technology @ChatGPT
Zur Übung erscheint auf der Seite ein Bereich für die Handkarten, in dem 14 kleine Kästchen 14 Karten darstellen, darunter befinden sich Ausspieloptionen und die Schaltfläche „Ausspielen bestätigen, weiter üben“.
Bildquelle: Lei Technology @ChatGPT
Es gibt keinen Mahjong-Tisch, keine Animationen zum Mischen und Ziehen von Karten, und die Karten werden sogar hauptsächlich als Text wie „1 Wan“ oder „2 Tong“ dargestellt. Aber zwischen den Karten gibt es Positionen und Gruppierungen, sodass die Regeln einen Bezugspunkt haben. Ich kann zuerst sehen, welche Karten bereits eine Sequenz bilden, dann die verbleibenden Ost- und Westwinde betrachten und schließlich entscheiden, welche Karte ich ausspiele.
In der Antwort hat ChatGPT mich auch gleich dazu gebracht, eine Übungsaufgabe zu lösen.
In der ersten Runde habe ich mich entschieden, den Ostwind auszuspielen. Während ChatGPT meinen Zug bestätigte, wies es darauf hin, dass das Ausspielen des Westwinds ebenfalls sinnvoll ist, und zeigte, wie man nach dem Behalten des Westwinds ein Paar bildet. Danach zog ich eine Sechs-Tong, die neue Karte wurde mit einem goldenen Rand markiert, und ich sollte entscheiden, ob ich weiter auf den Westwind warten oder eine andere Gewinnmöglichkeit wählen wollte.
Um fair zu sein, diese Darstellungs- und Interaktionsmethode ist natürlich viel leichter nachvollziehbar, als wenn man Regeln, Spielweisen und Wahrscheinlichkeiten auf einmal vollständig erklärt. Das gerade Gelernte kann sofort in der nächsten Schritt angewendet werden, und meine Wahl wird wiederum zur Grundlage der folgenden Erklärungen.
Bildquelle: Lei Technology @ChatGPT
Natürlich konnten frühere Versionen von ChatGPT auch Multiple-Choice-Fragen stellen und Spielsituationen simulieren. Der Unterschied besteht darin, dass die Optionen jetzt zu klickbaren Steuerelementen geworden sind und die Handkarten stets sichtbar bleiben. Ich muss mich nur darauf konzentrieren, wie ich in diesem Schritt spiele, anstatt jedes Mal die Karten und Auswahlmöglichkeiten neu beschreiben zu müssen.
Bei der dritten Aufgabe bildeten die Tong-Karten eine Sequenz aus Zwei, Drei, Vier, Fünf und Sechs Tong. Ich wählte, die Sechs-Tong auszuspielen, und bat um eine detaillierte Erklärung von vier verschiedenen Spielweisen. Die Antwort listete die verschiedenen Optionen sofort in einer Tabelle auf und zeigte getrennt auf, wie man nach dem Behalten von Zwei, Drei, Vier und Fünf Tong mit dem Ziehen von Zwei-Tong und Fünf-Tong jeweils gewinnt.
Unter der Annahme, dass 60 unbekannte Karten übrig sind, verglich es auch mit einem Balkendiagramm die Wahrscheinlichkeit, sofort zu gewinnen, bei verschiedenen Auswahlmöglichkeiten.
Bildquelle: Lei Technology @ChatGPT
Tabellen eignen sich zur schrittweisen Überprüfung, Kartengruppen zur Betrachtung von Kombinationen und Diagramme zum Erkennen von Unterschieden – man muss nicht alle Zusammenhänge noch einmal im Text beschreiben. Noch wichtiger ist das „freie“ Fragen: Die Optionen machen es mir leicht, weiterzulernen, und das Chatfenster erlaubt mir, jederzeit eine neue Frage einzufügen und den weiteren Inhalt zu ändern.
Für Aufgaben, bei denen beim Lernen ständig neue Fragen auftauchen, ist der Dialog von GPT-6 auf Basis der intelligenten Oberfläche sehr natürlich, und man kann sich fast vorstellen, wie nützlich dies für viel mehr Arten von Lernaufgaben sein wird.
Intuitivere Antworten sind leichter verständlich
Natürlich betrifft dies nicht nur lernbezogene Dialoge. Die „intelligente Oberfläche“ beeinflusst auch das Dialogerlebnis von ChatGPT in hohem Maße. Wenn wir früher die KI baten, ein Produkt oder ein Ereignis vorzustellen, bekamen wir meist nur eine längere oder kürzere Beschreibung.
Aber mit GPT-6 bat ich ChatGPT, mir das Microsoft Surface Laptop Ultra auf intuitive und anschauliche Weise umfassend vorzustellen. ChatGPT gab immer noch eine sehr lange Antwort, aber unterschiedliche Informationen hatten unterschiedliche Darstellungsformen: Das Produktdesign wurde mit Bildern dargestellt, Spezifikationen in Karten, Vergleiche zwischen Produkten in Tabellen und bei der Erklärung der Rechenarchitektur wurde direkt ein Beziehungsdiagramm gezeichnet.
Die Vorteile der Spezifikationskarten liegen auf der Hand: Informationen wie Preis, Prozessor, Arbeitsspeicher und Bildschirm haben jeweils ihren Platz, große Zahlen werden mit Erläuterungen versehen, und man findet die interessierenden Punkte auf einen Blick. Es behält die Lesereihenfolge des Haupttextes bei und gibt mir gleichzeitig eine Möglichkeit, wichtige Informationen schnell zu erfassen.
Bildquelle: Lei Technology @ChatGPT
Noch nützlicher ist das Architekturdiagramm. Bei der Erklärung der Beziehung zwischen RTX Spark CPU, GPU und Arbeitsspeicher stellte die Antwort die verschiedenen Rechenarchitekturen als Kästchen und Verbindungslinien dar, um den Unterschied zwischen unabhängigem Arbeitsspeicher und gemeinsam genutzten Speicherpools zu zeigen. Später, als die Beziehung zwischen Hardware, lokaler und Cloud-Berechnung sowie der Agent-Ausführungsumgebung diskutiert wurde, wechselte es zu Schichtdiagrammen und Flussdiagrammen.
Bildquelle: Lei Technology @ChatGPT
Als ich weiter fragte, welche Art von PC Microsoft neu definieren wollte, gab GPT-6 nicht nur eine Meinung, sondern fasste auch die neue KI-PC-Generation von Microsoft mit einem vierstufigen Beziehungsdiagramm zusammen und stellte den Arbeitsablauf unter dem Konzept von Microsofts Hybrid Intelligence anschaulich mit einem Flussdiagramm dar.
Bildquelle: Lei Technology @ChatGPT
Diese Art von Informationen kann man auch mit Text erklären, aber das Problem ist, dass die Leseschwelle und die Kosten sehr hoch sind: Nutzer müssen sich die vorherigen Konzepte merken und sie im Kopf verbinden. Das Diagramm stellt die Beziehungen direkt vor Augen, und der folgende Text kann weiter erläutern, welche Probleme jede Ebene löst und welche Einschränkungen es gibt.
Besonders in einer langen Antwort dienen diese Diagramme auch als Bezugspunkte beim Lesen. Wenn man später die Position eines Konzepts vergisst, kann man zum Diagramm zurückkehren, anstatt den vorherigen Text noch einmal zu lesen.
Aber die Kombination von Text und Bild ist nur ein Teil des Leseerlebnisses. Wenn ich zum Beispiel frage, wie man ein Papierflugzeug falten muss, damit es am weitesten fliegt, ruft GPT-6 GPT Images 2.5 auf, um Schritt-für-Schritt-Diagramme zu generieren. Bei weiteren Nachfragen nach dem Prinzip stellt es die Inhalte flexibel mit Zeichnungen, Formeln und Detaildarstellungen dar.
Bildquelle: Lei Technology @ChatGPT
Dies ist sowohl eine vollere Nutzung der Fähigkeiten des großen Modells als auch eine bessere Informationsdarstellung für Nutzer.
Besonders bemerkenswert ist, dass OpenAI die KI nicht „vollständig generieren“ lässt, sondern der KI einen relativ einheitlichen Grundstein für die Oberfläche bereitstellt.
Nach offiziellen Angaben verwendet Intelligent UI eine native Komponentenbibliothek, und der Compiler stellt die Oberfläche schrittweise während des Generierungsprozesses von Inhalten durch das Modell dar. Das Training des Modells umfasst auch, wie Inhalte organisiert, Layouts angeordnet werden und wann Interaktionen hinzugefügt werden sollten oder wann Text bereits ausreicht.
Dies zeigt einen anderen technischen Schwerpunkt als der Ansatz von Google in seinen öffentlichen Forschungen, bei dem HTML, CSS und JavaScript generiert werden, um benutzerdefinierte Seiten zu erstellen. Das freie Schreiben von Seiten bietet mehr Gestaltungsspielraum, während die Verwendung einheitlicher Komponenten es leichter macht, vertraute Schaltflächen, Formulare und Lesegewohnheiten beizubehalten.
Aus heutiger Sicht ist der Ansatz von Intelligent UI tatsächlich viel nachahmenswerter.
Wird Intelligent UI zum neuen Standard der KI-Interaktion?
Letztes Jahr zeigte Google in Gemini 3.0 die Erforschung der generativen Oberfläche (Generative UI). Bei unterschiedlichen Fragen beschränkte sich Gemini nicht mehr auf Text und Bilder, sondern konnte direkt Webseiten mit interaktiven Funktionen generieren und Nutzer sogar dazu bringen, durch Bedienen der Oberfläche Wissen zu verstehen und Probleme zu lösen.
Das chinesische Unternehmen Ant Linguang geht ebenfalls sehr rad