Gerade wurde GPT-Image-2.5 veröffentlicht.
Gerade hat OpenAI GPT-Images-2.5 veröffentlicht:
Die Generierungsverzögerung wird höchstens halbiert, die Bearbeitungsgenauigkeit wird verbessert, die neue Funktion für handgezeichnete Eingaben per Sketch wird hinzugefügt, und auf der API-Seite werden erstmals zwei Modelle mit unterschiedlicher Geschwindigkeit getrennt angeboten.
https://x.com/OpenAI/status/2097394956457623964
Es ist für alle Nutzer von ChatGPT, ChatGPT Work und Codex verfügbar, einschließlich der kostenlosen Version.
Umgerechnet nach diesen Zahlen durchlaufen täglich rund 430 Millionen Bilder dieses System. Die spürbare Veränderung durch die beschleunigte Generierung deckt einen weit größeren Bereich ab als gewöhnliche Funktionsaktualisierungen.
OpenAI hat die Gesamtgenerierungsmenge von ChatGPT Images und der GPT-Image-API bekannt gegeben: 3 Milliarden Bilder pro Woche.
Die Demo ist beeindruckend: Chinesische Schriftzeichen als unleserlicher Code existieren nicht mehr
Wie leistungsstark ist GPT-Image-2.5 eigentlich? Sehen wir uns direkt die Demo an.
Die unleserlichen chinesischen Zeichen sind vollständig verschwunden!
Dies ist das Referenzbild:
Dies ist das ausgegebene Retro-Bild:
Können Sie noch zwischen echten Fotos und KI-generierten Bildern unterscheiden?
Gedruckte alte Fotos zu extrahieren und zu hochauflösenden elektronischen Fotos umzuwandeln, ist ein Kinderspiel.
Sie möchten Kleidung wechseln, um die visuelle Wirkung auszuprobieren? Überlassen Sie es einfach ChatGPT:
Eingabe:
Ausgabe:
Eingabe des Originalbilds, die Decke ist unordentlich:
Ausgabe des Bilds mit der ordentlich gefalteten Decke:
Die Szenenkonsistenz ist extrem hoch, es sind keine unnatürlichen Stellen zu erkennen.
Die Geschwindigkeit ist halbiert, die Änderungen führen nicht zu Unordnung
Die Geschwindigkeitssteigerung ist am direktesten. Die von OpenAI angegebene Zahl besagt, dass die Generierungsverzögerung im Vergleich zu Images 2.0 um bis zu 50 % reduziert wird.
Gleichzeitig verbessert sich die Renderqualität von Fotos und Texturen, und die Wiedergabetreue des Hauptmotivs der Personen in den Referenzfotos ist ebenfalls höher.
Die präzise Bearbeitung zielt auf ein altes Problem von Bildgenerierungstools ab: Wenn Nutzer verlangen, nur einen Teil zu ändern, ändert das Modell auch Teile, die nicht verändert werden sollen.
Nach Angaben von OpenAI kann Images 2.5 nur den angegebenen Bereich ändern und Komposition, Beleuchtung und Hauptmerkmale der übrigen Bildelemente beibehalten. Die Stabilität in Szenen mit komplexem Hintergrund und mehreren Hauptmotiven ist deutlich verbessert.
Nutzer können außerdem direkt Kommentare und Markierungen auf dem Bild platzieren, um den zu ändernden Bereich zu markieren. Die Bedienlogik ähnelt der des Designtools Figma.
Die Konsistenz bei mehrfachen Bearbeitungen ist die dritte Verbesserung.
Wenn dasselbe Bild in langen Gesprächen wiederholt bearbeitet wird, bleiben die Bearbeitungsergebnisse der vorherigen Runden erhalten, und die Bildqualität nimmt nicht mit der Anzahl der Runden ab.
Axultan Alimkulov, Produktleiter von Higgsfield AI, äußerte sich bei der Bewertung von Flare wie folgt:
Was uns am meisten beeindruckt, ist sein Verständnis dafür, „was nicht geändert werden soll“.
Eine sinnvolle Bearbeitung führt nicht dazu, dass Charakter, Komposition und visueller Stil des Originalbilds verloren gehen.
Sketch und Vorlagen: Von der Texteingabe zum Zeichnen
Auf Produktebene bringt Images 2.5 vier neue Funktionen mit sich.
Der Zugang zu Sketch erfolgt durch die Eingabe von @Sketch im ChatGPT-Dialogfeld, wo das Zeichenfenster geöffnet wird. Nutzer zeichnen eine Skizze und fügen eine Textbeschreibung für Stil und Details hinzu, dann generiert ChatGPT das fertige Bild unter Verwendung der Skizze als Kompositionsreferenz.
Die von OpenAI bereitgestellten Beispiele umfassen die Umwandlung von Raumlayout-Skizzen in Renderbilder für Inneneinrichtungen sowie die Umwandlung von Umrissskizzen von Personen in Illustrationen. Die Hürde liegt nicht in der Zeichenfähigkeit, sondern darin, räumliche Beziehungen und grobe Proportionen darzustellen, damit das Modell die Bildstruktur versteht.
Die Vorlagen decken gängige Formate wie Poster, Produktbilder und Flyer ab.
Wählen Sie eine Vorlage aus, geben Sie Informationen und Stilpräferenzen ein, und das Modell generiert Bilder nach der voreingestellten Struktur, was das Ausprobieren von Prompts von Grund auf überflüssig macht.
Die Prompt-Freigabe ermöglicht es Nutzern, den vollständigen Prompt für die generierten Bilder weiterzugeben. Andere Nutzer können ihre eigenen Fotos und Details einfügen und eine persönliche Version im selben Rahmen generieren.
Ein Prompt für „Retro-Porträts im Stil der 80er Jahre“ ist bereits auf sozialen Plattformen verbreitet. Nutzer laden einfach ihr Selfie hoch, um ein Foto im gleichen Stil zu erhalten.
Alle vier Funktionen zielen auf dieselbe Veränderung ab: Der Prozess, die Vorstellungen im Kopf in Bilder umzuwandeln, hängt nicht mehr nur von der Texteingabe ab!
Flare und Sunburst: Die API wird erstmals in zwei Teile geteilt
Für Entwickler hat OpenAI auf der API-Seite gleichzeitig zwei Bildmodelle eingeführt: GPT-Image-2.5 Flare und GPT-Image-2.5 Sunburst.
Flare setzt auf Geschwindigkeit und Massengenerierung. OpenAI positioniert es als Standardoption für die meisten Anwendungen.
Die Anwendungsbereiche umfassen soziale Inhalte, Produkterlebnisbilder, schnelle Prototypen und häufige Bildgenerierung.
Lucky Liao vom Bewertungsteam von Manus hat spezifischere Daten vorgelegt: In ihren Tests erreichte die Bildgenerierungsgeschwindigkeit von Flare das 2- bis 4-fache von GPT-Image-2. Die Verbesserung bei der Generierung von transparenten Hintergründen ist direkt nützlich für die programmgesteuerte Erstellung von Markenmaterialien, Präsentationen und Webbildern.
Sunburst ist für hochwertige kreative Arbeitsabläufe ausgelegt und nutzt eine längere Generierungszeit für eine feinere Bearbeitungskontrolle.
Das von OpenAI angegebene typische Szenario sind fertige Materialien für das Markenmarketing und fein bearbeitete Produktbilder.
Adobe hat bestätigt, dass das Images 2.5-Modell in Firefly integriert wird.
Matt Chotin, Senior Director of Product bei Adobe, erklärte, dass die Version 2.5 eine schnellere Generierungsgeschwindigkeit und Konsistenz der Auflösung mit sich bringt. Die Bilder bleiben auch nach mehrfacher Feinbearbeitung klar und realistisch.
Die Trennung der beiden Modelle entspricht zwei Anforderungen: hoher Frequenz mit niedriger Latenz und hochpräziser Anpassung.
Flare ist für Szenen mit hohem Durchsatz gedacht, Sunburst für Szenen mit hochwertigen Ergebnissen. Entwickler können das Modell nach ihren geschäftlichen Anforderungen auswählen, ohne Wartezeit für nicht benötigte Präzision aufwenden zu müssen.
Dies ist das erste Mal, dass die Bild-API von OpenAI nach Geschwindigkeit und Qualität unterteilt wird, die Logik folgt der Einstufung der Sprachmodell-API.
Die Benennung von Images 2.5 folgt dem Rhythmus der Bildproduktlinie von OpenAI: Die Architektur bleibt unverändert, Geschwindigkeit und Genauigkeit werden zuerst deutlich verbessert.
GPT-Image-1.5 Ende 2024 folgte genau diesem Muster.
Die beiden .5-Versionen liegen weniger als ein Jahr auseinander, die Iterationsfrequenz der Bildmodelle nähert sich der der Sprachmodelle an.
Dies ist das weltweit leistungsstärkste Bildgenerierungsmodell, das einen deutlichen Vorsprung vor anderen hat.
Die ständig wachsenden