Praxistest GPT Images 2.5: Selbst völlig unleserliche, wirre Kritzeleien werden erkannt – die sogenannten Seelenzeichner stehen tatsächlich kurz vor ihrem großen Durchbruch.
Der Hund auf dieser folgenden Vermisstenanzeige für Hunde (genauer gesagt eine Anzeige, die einem verlorenen Hund hilft, seinen Besitzer zu finden) ist sehr skizzenhaft gezeichnet.
Sein Körper besteht aus einem Wirrwarr von Linien, seine Augen sind weit aufgerissen und sein Schwanz ragt in die Luft. Wenn man diese Zeichnung ChatGPT Images 2.5 übergibt, erhält man einen Hund mit zerzaustem Fell und wachem Ausdruck. Vergleicht man das Ergebnis mit dem echten Foto, sind sie nicht bis ins kleinste Detail identisch, aber die etwas unbeholfene, unordentliche Stimmung kommt sehr gut überein.
Das von ChatGPT Images 2.5 anhand der Vermisstenanzeige für Hunde erratene Aussehen des Hundes
So sieht der Hund in Wirklichkeit aus
Zu beobachten, wie eine KI eine ungenaue Zeichnung versteht, sagt manchmal mehr aus, als wenn man sie ein perfektes Bild erzeugen lässt.
Heute hat OpenAI ChatGPT Images 2.5 veröffentlicht, das auf Bildtreue, präzise Bearbeitung und Konsistenz bei mehreren aufeinanderfolgenden Überarbeitungen setzt. Die Verzögerung bei der Bilderzeugung ist im Vergleich zur Version 2.0 um bis zu 50 % gesunken.
APPSO interessiert sich dieses Mal vor allem für eine andere Frage: Wenn man Skizzen, Fotos von Personen und konkrete ästhetische Anforderungen an das Modell übergibt, wie viel von dem Endergebnis entspricht dann eigentlich noch der ursprünglichen Vorstellung des Nutzers?
Deine Vorstellung wird verstanden
Manche Ideen lassen sich leichter zeichnen als mit Worten beschreiben.
Die neue Sketch-Funktion bietet Nutzern eine Leinwand. Gemäß der offiziellen Hilfedokumentation kann man durch die Eingabe von @Sketch in ChatGPT Umrisse zeichnen und anschließend textliche Anforderungen ergänzen. Position, Größe und Form lassen sich direkt auf dem Bild festlegen, ohne dass alles in Sätzen formuliert werden muss.
Die Zeit für talentierte, aber ungeschickte Zeichner ist gekommen: Man muss nur Spuren auf dem Bildschirm hinterlassen, den Rest erledigt die KI.
Die Skizze, die ich erstellt habe, ist sehr einfach: Auf beiden Seiten stehen nach innen geneigte Gebäude, in der Mitte schwebt eine kleine Figur, und darunter steht der Titel eines Films. Die Fenster sind schief und krumm, die Figur hat kaum Details.
Die Prompt-Anweisung ließ viel Spielraum: Ich habe nur gefordert, Thema, Stimmung und Handlung beizubehalten, und dem Modell erlaubt, Formen, Materialien und Details neu zu gestalten. Daraufhin bot mir ChatGPT 5 künstlerische Richtungen zur Auswahl an.
Ich habe mich für einen psychologischen Thriller-Stil, der an künstlerische Filme angelehnt ist, und einen Stil für Retro-Filmplakate entschieden. Bei einem Bild wurde die Sättigung abgesenkt, sodass grauer Nebel die Lücken zwischen den Gebäuden füllt und die schwebende Figur besonders isoliert wirkt. Bei dem anderen Bild wurde der Himmel rot gefärbt, ergänzt um einen Vollmond, Papierfalten und abgenutzte Ränder – das gesamte Bild wirkt wie der Druck eines alten Filmplakats.
Die beiden Bilder haben unterschiedliche Stile, aber man erkennt in beiden die Komposition der Skizze wieder. Dieser Vorgang ähnelt ein wenig dem Spiel "Zeichne und rate": Nachdem die KI richtig geraten hat, kann man weiter darüber diskutieren.
Ich habe auch eine Skizze eines Stilllebens gezeichnet. Ein paar braune Linien bilden einen Tisch, blaue Linien umreißen eine Obstschale, und bunte Kreise stellen Weintrauben dar.
Das erzeugte Bild ergänzte Holzmaserung, Keramikglasur und natürliches Seitenlicht – die ursprünglich kindlichen, einfachen Linien verwandelten sich in ein ordentliches Foto eines Stilllebens.
Nutzer, die eine Vorstellung von einem Bild im Kopf haben, diese aber nicht in Worte fassen können, sollten diese neue Funktion unbedingt ausprobieren.
Andere Kameraperspektiven
Rose und Jack sind so wunderschön – wer möchte sie nicht aus allen Blickwinkeln betrachten?
Ich habe Images 2.5 angewiesen, 8 verschiedene Perspektiven der Szene zu erstellen, in der Rose und Jack auf dem Bug der Titanic stehen.
Von der Seitenansicht und Rückansicht bis hin zu Vogelperspektive, niedrigem Kamerastandpunkt und Fernansicht ändert sich die Größe der Figuren im Bild ständig. Roses dunkler Mantel, die helle Seidentuch, Jacks Frisur und die orangefarbene untergehende Sonne über dem Meer bilden durchgehende visuelle Hinweise.
In der angezeigten Größe stimmen die Gesichtsmerkmale der Figuren im Großen und Ganzen überein, Kleidung und Handlung ändern sich nicht vollständig, wenn sich der Kamerastandpunkt ändert. Nahaufnahmen eignen sich zur Betrachtung von Gesichtsausdrücken, Fernaufnahmen zeigen die Beziehung zwischen dem Schiffsbug und dem Meer – mehrere Bilder zusammen wirken wie eine Sammlung von Kamerawinkeln.
Diese Bildergruppe dreht sich hauptsächlich um denselben Ort und dieselbe Haltung und deckt noch keine großen Veränderungen wie Kleidungswechsel, starke Verdeckungen oder Szenenwechsel ab. Sie eignet sich zur Beobachtung der Kontinuität bei geändertem Kamerastandpunkt, kann aber noch nicht als umfassender Nachweis für die Konsistenz von Figuren angesehen werden.
Eine weitere Gruppe von Vlog-Storyboards zeigt den Tag eines Mädchens mit kurzen Haaren auf 16 Bildern: Aufstehen, persönliche Gegenstände zusammenpacken, aus dem Haus gehen, fahren, essen, am Meer aktiv sein und schließlich zurück in die Wohnung kehren. Schal, Frisur und Mantel ziehen sich durch mehrere Szenen, und die Bilder sind mit Nahaufnahmen von Landschaften und Objekten durchsetzt.
Als vorläufige Konzeption hilft es uns bereits, die Reihenfolge der Handlung und den Rhythmus der Aufnahmen zu beurteilen.
Images 2.5 zeigt hervorragende Leistungen im Bereich des Geschichtenerzählens. Wenn Sie möchten, können Sie im Anschluss Seedance 2.5 verwenden, um vollständige dynamische Szenen zu erstellen.
Das ist sehr künstlerisch
Das Verständnis von ChatGPT Images 2.5 für komplexe künstlerische Stile hat sich ebenfalls verbessert.
Auf einem gewöhnlichen Reisefoto wurden nach der Bearbeitung die Kleidung der beiden Personen mit farbigen Wachsmaltexturen versehen, und um sie herum erschienen Blumen, Herzen und handgeschriebene Zeichen. Gesichter, Haut und die Berge in der Ferne behalten ihre fotografische Qualität, während raue Linien den Körperkonturen folgen und für mehr Spaß sorgen.
Prompt:Keep the original photo fully realistic and unchanged. Add playful hand-drawn doodles directly onto the photo, as if someone casually drew over a printed snapshot with crayons and markers. Randomly choose 2–4 creative interventions based on the scene: redraw parts of the clothing as colorful crayon outfits, extend or replace accessories with doodle versions, add funny objects or props, simple hearts, stars, arrows, utensils, flowers, symbols, or short handwritten annotations. Use rough black outlines, chunky uneven strokes, flat bright colors, visible waxy crayon texture, imperfect childlike coloring, and slightly messy hand-drawn edges. Make the doodles naturally interact with the people and objects in the photo and follow their body shapes, poses, and perspective. Keep faces, skin, hair, hands, and the environment photorealistic. Do not cartoonize the entire image. Each photo should receive a different, spontaneous combination of doodles, like a quirky personal photo diary.
Die Illustration, die anhand einer Szene aus der koreanischen Fernsehserie "Typhoon Trading Company" erstellt wurde, behält die Beziehung der beiden Personen bei, die sich durch eine Tür hindurch ansehen, und reduziert die komplexen Texturen aus dem Originalfoto.
Die lange Prompt-Anweisung enthielt klare Vorgaben zu geometrischer Vereinfachung, begrenzter Farbpalette, Leerraum und schwacher Perspektive. Das Modell hat diese Anforderungen eingehalten, und der Mensch entscheidet immer noch, was es wert ist, beibehalten zu werden.
Prompt @ukiyo_teyanday: Erstellen Sie eine raffinierte Illustration mit einer stark vereinfachten grafischen Komposition. Das Bild soll das Gefühl eines hochwertigen redaktionellen Posters im mittelalterlichen modernen Stil vermitteln, aber mehr auf flaches Design, flache Komposition und abstraktes graf