Handzeichnungen lassen sich direkt in Poster umwandeln, das in China entwickelte quelloffene multimodale Modell haucht Bildern neues Leben ein.
Kann eine handgezeichnete Skizze mit einfachen Linien, Spaltenrahmen und Prozesspfeilen nach der Übergabe an KI direkt zu einem hochpräzisen Poster zum „Prozess der Tiefseetauchausrüstung“ werden, das den Standards für kommerzielle Veröffentlichungen entspricht?
In dem folgenden Fall erkennt das Modell nicht nur Ausrüstungen wie Sauerstoffflaschen, Masken und Tauchcomputer in der Skizze, sondern behält auch die Struktur aus fünf Teilen bei: „Übersicht über die Ausrüstung, detaillierte Erklärung der Funktionen, Überprüfung vor dem Tauchen, sicherer Tauchprozess und Überprüfung nach dem Tauchen“. Es ergänzt Bilder, Icons und Erläuterungen für verschiedene Spalten und verwandelt die ursprüngliche grobe Vorstellung in einen vollständigen Entwurf im tiefblauen Technologie-Stil.
Das Modell erstellt ein farbiges Poster anhand der Skizze
Von der Skizze zum farbigen Poster muss die KI den Inhalt und die Struktur verstehen, die Details gemäß den Anforderungen ergänzen, den Stil vereinheitlichen und die Teile beibehalten, die nicht geändert werden dürfen.
Diese Aufgabe wird von dem neuesten quelloffenen leichtgewichtigen nativen einheitlichen Multimodal-Modell von SenseTime erledigt: SenseNova U1.5-Lite-Preview.
01.8B-Leichtgewichtige Größe liefert leistungsstarke Generierungs- und Bearbeitungsleistung
Als aktualisierte Version des quelloffenen Modells SenseNova U1 ist das größte Highlight von U1.5-Lite-Preview wie folgt: Mit einer leichtgewichtigen Größe von nur 8B-MoT integriert es alle Fähigkeiten: Bilderkennung, visuelles Schlussfolgern, 4K-Ultra-HD-Generierung und hochpräzise Bearbeitung.
Es setzt das von SenseTime selbst entwickelte native einheitliche Multimodal-Architektur NEO-Unify fort, verzichtet auf das ineffiziente Modell der Modellverkettung in herkömmlichen Lösungen und realisiert die einheitliche Darstellung und Interaktion multimodaler Informationen innerhalb eines einzigen Netzwerks.
Gemäß den Bewertungsergebnissen ist der Qwen-Image-Bench-Wert von U1.5-Lite-Preview von 47,14 Punkten bei U1 stark auf 55,20 Punkte gestiegen. Bei dem GEdit-Bench-Test zur Messung der Bildbearbeitungsfähigkeit übertreffen der englische Teil (8,17 Punkte) und der chinesische Teil (8,05 Punkte) zahlreiche quelloffene und geschlossene Modelle mit großen Parametergrößen.
Bewertungsergebnisse von SenseNova U1.5-Lite-Preview
Darüber hinaus zeigt sich die direkteste Veränderung von SenseNova U1.5-Lite-Preview in Fähigkeiten wie 4K-Bildqualität, Ausführung komplexer Prompt, Erstellung anhand von Referenzbildern und Bildbearbeitung.
Derzeit ist das Modell weltweit quelloffen. Entwickler können es über Hugging Face, GitHub und ModelScope kostenlos abrufen und bereitstellen.
Quelloffene Adressen:
GitHub:
https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face:
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
ModelScope:
https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
02. Auch komplexe Prompts werden „verstanden“, 4K-Bildqualität wird gleichzeitig verbessert
Wenn Nutzer nur Bilder mit klarem Hauptmotiv und einfacher Komposition erstellen möchten, reichen normalerweise einige Beschreibungen in natürlicher Sprache aus. Bei der Erstellung von Infografiken, kommerziellen Postern und visuellen Markeninhalten müssen Nutzer jedoch oft gleichzeitig das Hauptmotiv, das Layout, den Text, den Stil sowie die Inhalte angeben, die beibehalten oder vermieden werden sollen – das entspricht der Einreichung eines vollständigen Erstellungskonzepts an das Modell.
Auf der Grundlage von U1 verbessert SenseNova U1.5-Lite-Preview die Fähigkeit zur Einhaltung von Prompts und die visuelle Steuerungsfähigkeit bei langen Kontexten. Bei langen Prompts mit mehreren Einschränkungen kann das Modell die detaillierten Anforderungen in dasselbe Bild umsetzen.
Die starke Fähigkeit von U1.5-Lite-Preview zur Einhaltung von Prompts beruht nicht auf dem Auswendiglernen fester Vorlagen. Auch ohne starke Abhängigkeit von speziell formatierten Prompt-Enhance-Daten für das Training kann das Modell lange, mehrfach eingeschränkte und hierarchische visuelle Anweisungen relativ stabil ausführen – das ist einer der Vorteile, die die native einheitliche Multimodal-Architektur mit sich bringt.
In diesem Fall wird das Modell angewiesen, die 24 Sonnenwende in einer horizontalen Langrolle darzustellen und sie in mehrere vertikale Spalten in zeitlicher Reihenfolge zu unterteilen. Jede Spalte soll den Namen des Sonnenwendes, das Datum und die entsprechende Naturlandschaft enthalten, gleichzeitig den Stil chinesischer Malerei beibehalten und den Wechsel der vier Jahreszeiten durch Veränderungen von Pflanzen, Wetter und Farben zeigen.
Vollbild der 24 Sonnenwende, erstellt vom Modell
Dem Effekt nach zu urteilen geht das Bild von Weiden und Blumenfeldern im Frühjahr allmählich zu Lotus und Sonnenblumen im Sommer über, wechselt dann zu Weizenfeldern und roten Blättern im Herbst sowie zu Schneebergen im Winter. Die Inhalte der 24 Spalten sind dicht angeordnet, aber Namen der Sonnenwende, Bilder und Textinformationen behalten eine klare Hierarchie, und die Farbveränderungen zwischen den vier Jahreszeiten sind natürlich und kohärent.
Natürlich bedeutet komplexes Erstellen nicht, dass Nutzer Tausende von Wörtern an Prompts selbst schreiben müssen. SenseTime hat auch das experimentelle Prompt-Enhance-Skill entwickelt, das relativ kurze Ideen zu strukturierten Erstellungskonzepten ergänzt, die Hauptmotiv, Layout, Stil, Text und Einschränkungen enthalten. Einfache Aufgaben können direkt beschrieben werden, und bei komplexen Aufgaben kann dieses Tool helfen, die Anforderungen vollständiger zu formulieren.
Nach dem Verstehen komplexer Anforderungen muss das Bild auch der Vergrößerung standhalten. SenseNova U1.5-Lite-Preview unterstützt nativ die Generierung von 4K-Bildern, was höhere Anforderungen an Details wie Haut von Personen, Material von Produkten, Texturen von Gebäuden und Lichtschatten der Umgebung sowie die Konsistenz des gesamten Bildes stellt.
In diesem 4K-Bild von Fischern, die Fischernetze ordnen, sind die verflochtenen Knoten des Netzes, der fleckige Lack des Schiffsrumpfes und der Rost auf den mechanischen Geräten deutlich sichtbar. Die Wasserspiegelung in der Ferne, die Häuser am Ufer und die Strommasten behalten ebenfalls die räumliche Hierarchie bei. Das Bild enthält viele kleine Objekte, aber zwischen Personen, Fischernetzen und Geräten im Schiffsraum bleiben klare Grenzen erhalten, und das gesamte Licht sowie die Farben sind relativ einheitlich.
4K-Bild von Fischern beim Ordnen von Fischernetzen, erstellt vom Modell
Von komplexen Prompts bis zu 4K-Details kann SenseNova U1.5-Lite-Preview nicht nur die Anforderungen zeichnen, sondern auch dafür sorgen, dass das generierte Ergebnis der Vergrößerung standhält.
03. Referenzbilder verstehen und neu erstellen: Stil kann übernommen und Materialien kombiniert werden
Neben der Text-zu-Bild-Generierung kann SenseNova U1.5-Lite-Preview auch anhand von Referenzbildern weiter erstellen.
Manchmal möchten Nutzer die Farbgebung, Komposition und Designsprache eines Bildes übernehmen und dann das Thema durch ihre eigenen Inhalte ersetzen. Manchmal müssen sie Personen, Produkte, Szenen oder andere Elemente aus mehreren Bildern separat verwenden, um ursprünglich unzusammenhängende Materialien zu einem neuen Bild zu kombinieren.
Für diese Art von Aufgaben muss das Modell Bilder verstehen, beurteilen, was aus jedem Bild entnommen werden soll und wie es gemäß den neuen Anforderungen neu organisiert wird.
Gestützt auf die native einheitliche Multimodal-Architektur kann SenseNova U1.5-Lite-Preview Bilder erkennen und verstehen sowie gemäß den Anforderungen der Nutzer erstellen.
In dem folgenden Fall erstellt das Modell anhand eines Posters zum Thema erneuerbare Energien als Referenz, übernimmt dessen braunbeige Retro-Textur, die Typografie mit großen roten und weißen Buchstaben sowie die Silhouettenkomposition und generiert ein neues Poster zum Thema „alter Gewürzhandel“.
Das Modell erstellt Werke anhand des Stils eines einzelnen Referenzbildes
Dem Effekt nach zu urteilen ersetzt das Modell die Windräder und Solarplatten im Originalbild durch Segelboote, Kamele, Tontöpfe und Gewürze und fügt auf der Erde transregionale Handelsrouten hinzu. Thema und Inhalt des neuen Posters haben sich vollständig geändert, aber die Bildkomposition, Farben, Texthierarchie und retro körnige Textur stimmen mit dem Referenzbild überein.
Wenn für die Erstellung mehrere Materialien benötigt werden, kann das Modell auch Inhalte aus verschiedenen Bildern separat extrahieren.
Sehen Sie sich diese Erstellung mit mehreren Referenzbildern an: Drei Referenzbilder von Personen zeigen jeweils ein Mädchen mit blonden Haaren und gelber Kleidung, ein Mädchen mit schwarzen Haaren, Fuchsohren und roter Kleidung sowie ein Mädchen mit blauer Kleidung. Das Modell muss ihre Merkmale von Aussehen, Kleidung und Accessoires extrahieren und dann die drei Personen in dieselbe Szene einfügen.
Das Modell erstellt Werke anhand mehrerer Referenzbilder
Dem Effekt nach zu urteilen werden Haarfarben, Farbschemata der Kleidung und markanten Dekorationen der drei Personen gut beibehalten. Das Bild verwendet zudem goldenes Feuer, rote Blüten und blaue Energie, um jeweils verschiedene Personen zu entsprechen. Positionen der Personen, Lichtschatten und Hierarchie von Vorder- und Hintergrund werden neu organisiert und bilden eine einheitliche Komposition.
04. Texte ändern, Elemente austauschen: KI übernimmt die feine Bildbearbeitung
Bei der Erstellung anhand von Referenzbildern geht es darum, „was aus dem Eingabebild entnommen und wie es neu kombiniert wird“. Aber oft haben Nutzer bereits ein gutes Bild und möchten nur einen Inhalt darin ändern.
Zum Beispiel ist das Produktposter fertig gestaltet, aber das Veröffentlichungsdatum wird vorübergehend angepasst. Der Nutzer möchte nur ein Datum ersetzen, aber die KI generiert das gesamte Poster neu – die ursprünglich zufriedenstellende Komposition, Typografie und der Bildstil ändern sich ebenfalls.
Das ist genau der Schwerpunkt der Verbesserung von SenseNova U1.5-Lite-Preview: Es kann genau beurteilen, „wo geändert werden muss und wo nicht“. Gestützt auf die einheitliche Architektur kann es den gesamten Ablauf aus Bilderkennung, Positionierung und Bildbearbeitung in demselben Modell abschließen.
Wenn Sie das Layout von Bildelementen anpassen, ein englisches Poster ins Chinesische umwandeln oder ein bestimmtes Produkt oder einen bestimmten Text im Bild ersetzen möchten, kann das Modell die Änderung gemäß den Anforderungen abschließen, ohne andere Inhalte zu beeinträchtigen.
Bei der Layoutanpassung des Posters zur Brückenverstärkung vergrößert das Modell die Vergleichsbilder „vor und nach der Umgestaltung“, verschiebt sie in die Mitte des Bildes, passt den Haupttitel und vier Vorteile nach unten an und behält gleichzeitig die Eisenbahnbrücke im Hintergrund, die ursprünglichen Textinhalte sowie den verwitterten Industriestil bei. Nach der Änderung sind die Informationsschwerpunkte hervorgehobener, die Hierarchie des Bildes ist klarer, und andere Teile, die nicht angepasst werden müssen, bleiben im Wesentlichen unverändert.