GPT Images 2.5 ist plötzlich online gegangen, die „Seelengemälde“ der Netznutzer sind eines absurder als das andere.
Gerade hat OpenAI das neue Bildgenerierungsmodell der nächsten Generation ChatGPT Images 2.5 veröffentlicht.
Der offizielle Vertreter erklärte, dass das neue Modell vor allem die Detailqualität von Bildern, die Generierungsgeschwindigkeit, die Bearbeitungsgenauigkeit und die Konsistenz während mehrerer Änderungen verbessert hat. Es wurden neue Funktionen wie Sketch-Handzeichnung-Referenz, Erstellungsvorlagen und Bildkommentarbearbeitung hinzugefügt, sodass Nutzer den AI-Erstellungsprozess näher an den professionellen Designablauf durchführen können.
Laut OpenAI generieren Nutzer derzeit wöchentlich mehr als 3 Milliarden Bilder über die ChatGPT Images und die GPT Image-Serie von Modellen in der API.
Die Einführung von Images 2.5 bedeutet, dass OpenAI den Anwendungsbereich von AI-Bildwerkzeugen in Szenarien wie persönliche Kreation, Marketingdesign und Produktvisualisierung weiter ausweiten möchte.
Im Vergleich zum Vorgängermodell Images 2.0 liegt die größte Veränderung von Images 2.5 in der verbesserten Fähigkeit, das Konzept der „Änderung“ zu verstehen.
In der Vergangenheit waren AI-Zeichnungsprogramme normalerweise besser darin, Bilder von Grund auf neu zu erstellen. Wenn Nutzer jedoch bestimmte Details anpassen wollten, neigten die Modelle dazu, andere Teile versehentlich zu verändern. Beispielsweise kann die Änderung der Kleidung einer Person die Gesichtsmerkmale verändern, und die Anpassung des Hintergrunds kann zu einer Änderung des gesamten Stils führen.
OpenAI gibt an, dass Images 2.5 im Bereich der präzisen Bearbeitung optimiert wurde, sodass es die von Nutzern angegebenen Änderungen genauer ausführen kann und gleichzeitig das ursprüngliche Motiv, die Komposition und den visuellen Stil beibehält.
Nutzer können einzelne Elemente wie Produkte, Hintergründe und Texte anpassen, ohne das gesamte Bild neu generieren zu müssen. Es trifft wirklich genau die Stelle, die man ändern möchte.
In den von OpenAI gezeigten Beispielen kann ein Porträtfoto in verschiedene Szenen und Stile umgewandelt werden, beispielsweise indem ein gewöhnliches Porträt zu einem Retro-Fotostudio-Porträt gemacht wird oder ein Haustierfoto zu einem neuen visuellen Thema umgewandelt wird, während die Schlüsselmerkmale der ursprünglichen Person und des Tieres beibehalten werden.
Ich habe auch selbst mehrere verschiedene Arten von Generierungsaufgaben mit Images 2.5 ausprobiert.
Beispielsweise habe ich im Porträt-Generierungstest das Modell aufgefordert, die Gesichtsmerkmale der Referenzperson beizubehalten und ein hochauflösendes kreatives Fotowerk zu erstellen.
Die praktischen Ergebnisse zeigen, dass Images 2.5 die Fähigkeit zur Beibehaltung der Merkmale der Referenzperson verbessert hat. Das Modell kann den Fotostil, die Kleidung und die Umgebung verändern und gleichzeitig die Identität der Person mit hoher Konsistenz beibehalten.
Und jetzt kann Images 2.5 endlich auch den Fortschritt der Bildgenerierung durch Zahlen intuitiv anzeigen.
Laut Tests von Nutzern im Internet kann man sogar während der Bildgenerierung das Spiel „Snake“ spielen.
Ähnliche Fähigkeiten zeigen sich auch in Szenarien der Synthese von Film- und Fernsehfiguren. Beispielsweise habe ich das Szenario getestet, in dem Elon Musk „ein Selfie mit dem Pate am Filmset macht“. Ich habe das Modell aufgefordert, die Gesichtsstruktur, den Ausdruck und die Haltung der Personen auf dem Referenzfoto beizubehalten und ein Selfie hinter den Kulissen des Films im Verhältnis 1:1 zu generieren.
Solche Aufgaben hatten in der Vergangenheit leicht Probleme wie Veränderungen im Gesicht der Person und falsche Proportionen, während Images 2.5 die Beibehaltung des Hauptmotivs der Person stabiler macht.
Im Stil der Straßenfotografie hat Elon Musks „Lebensfoto“ auch ein tolles Ergebnis erzielt.
Neben Personen hat Images 2.5 auch das Verständnis für die visuelle Gestaltung von Produkten verbessert. In einem Produktdesign-Test habe ich das Modell aufgefordert, eine Cola-Dose zu generieren, die vollständig aus weichem Plüschmaterial besteht.
In einem Test mit komplexen visuellen Logiken habe ich versucht, ein rekursives Bild zu generieren.
Die Prompt forderte: „Ein orangefarbener Kater sitzt auf einem Bürostuhl und hält ein iPad. Auf dem Bildschirm des iPad wird wieder derselbe Kater gezeigt, der dasselbe iPad hält, und das wiederholt sich unendlich.“
Diese rekursive Struktur erfordert, dass das Modell gleichzeitig das Motiv, den Bildschirminhalt und die Wiederholungsbeziehung versteht. Das Generierungsergebnis kann diese visuelle Verschachtelungsbeziehung erkennen und den mehrschichtigen rekursiven Effekt erzielen.
Neben fotorealistischen Bildern hat Images 2.5 auch das Verständnis für komplexe künstlerische Stile verbessert.
In diesem Bild im Stil von Black Myth: Wukong ist der Gesamtstil von Images 2.5 näher an dem Konzept-Kunstwerk des Spiels, anstatt einfach nur Symbole zu stapeln.
Es gibt auch Illustrationen im Stil der Comic-Bilder von „Die Drei Reiche“.
Das Generierungsergebnis kann die Merkmale traditioneller Comics wie schwarz-weiße Linienzeichnung, helle Farbauftragung und alte Papiertextur verstehen. Der gesamte visuelle Stil ist näher an dem klassischen chinesischen Illustrationsstil, anstatt einfach nur Elemente von antiker Kleidung hinzuzufügen.
Wie die Vorgängermodelle zeigt Images 2.5 auch bei der Verarbeitung von Chinesisch hervorragende Leistungen.
Insgesamt lassen sich die Verbesserungen von Images 2.5 hauptsächlich in drei Aspekten zusammenfassen.
Erstens ist die Fähigkeit zum Verständnis komplexer Prompts gestiegen, sodass mehrere Stile, Motive und Einschränkungen gleichzeitig verarbeitet werden können. Zweitens ist die Fähigkeit zur Beibehaltung von Referenzbildern verbessert, sodass Kernelemente wie Personen und Produkte während mehrerer Änderungen stabiler bleiben. Drittens ist der Bearbeitungsablauf näher an dem echten Designarbeitsprozess: Nutzer können dasselbe Bild kontinuierlich anpassen, anstatt wiederholt neue Ergebnisse zu generieren.
Laut den praktischen Testergebnissen des Nutzers @aimlapi ist der Effekt von Images 2.5 im Vergleich zu Nano Banana Pro deutlich künstlerischer.
Allerdings hat Images 2.5 auch keine vollkommenen Mängel, beispielsweise ist der Bereich des Bildrauschens immer noch katastrophal schlecht.
Ein weiteres Beispiel: Einige Nutzer haben festgestellt, dass es in den von OpenAI offiziell gezeigten Beispielen immer noch einige Detailfehler gibt.
Neben der Verbesserung der Modellfähigkeiten hat OpenAI auch eine Reihe neuer Funktionen für den Erstellungsablauf zu ChatGPT hinzugefügt.
Unter anderem erlaubt die