Die von KI generierten Bilder wirken unstimmig, das liegt an diesen Details.
Shen Yiju ist das Übersetzungs- und Redaktionsteam von 36Kr, das sich auf Bereiche wie Technologie, Wirtschaft, Arbeitswelt und Leben konzentriert und vor allem neue Technologien, neue Ansichten und neue Trends aus dem Ausland vorstellt.
Anmerkung der Redaktion: Viele KI-generierte Bilder zeichnen sich durch eine exquisite und realistische Textur sowie eine detaillierte Rendering aus, wirken aber dennoch oft unheimlich. Das Problem liegt meist nicht an Fehlern in der menschlichen Körperstruktur, sondern daran, dass das Bild gegen die physikalischen Logiken der Realität verstößt. Dieser Text ist eine Übersetzung, wir hoffen, dass er Ihnen neue Anregungen liefert.
Viele KI-generierte Bilder sind äußerst realistisch, mit feinen Texturen, sichtbaren Poren auf der Haut und einem insgesamt ästhetischen Bildaufbau. Dennoch hat man immer das Gefühl, dass etwas nicht stimmt. Man kann das Problem zwar nicht genau benennen, ist sich aber sicher, dass es sich nicht um ein echtes Foto handelt. Der Fehler liegt darin, dass wir nach den falschen Anzeichen suchen. Wir blicken nicht mehr auf die offensichtlichen einfachen Fehler, haben aber auch nie gelernt, die heute verbliebenen tiefgreifenden Lücken zu erkennen. Bei den von hochmodernen KI generierten Bildern gibt es kaum noch sichtbare grobe Fehler, die Unstimmigkeiten sind äußerst verborgen: Nur Ergebnis, keine Ursache.
Nur Ergebnis, keine Ursache
Auf einem echten Foto lässt sich für jeden Bildeffekt eine entsprechende physikalische Quelle finden. Dieser Schatten stammt von einem Objekt; diese Unschärfe ergibt sich aus einer bestimmten Blende und Aufnahmeentfernung; die Reflexion im Auge stammt von einem Fenster. Eine Kamera erzeugt nichts aus dem Nichts, sie zeichnet lediglich die Ergebnisse auf, die sich aus der Kausalität der Realität ergeben.
Generative KI verhält sich genau umgekehrt. Sie lernt, wie Dinge aussehen, versteht aber nicht, wie sie funktionieren. Sie weiß, wie Reflexionen aussehen, wie Schatten aussehen und wie die Unschärfe bei Porträts wirken soll, versteht aber nicht, warum diese Phänomene entstehen. Deshalb zeichnet die KI Licht- und Schatteneffekte willkürlich an ansprechenden Positionen und ignoriert vollständig die physikalischen Regeln, die die Position von Licht und Schatten in der realen Welt bestimmen.
Das ist die Wurzel aller Probleme, merken Sie sich diesen Satz: KI versteht keine Kausalzusammenhänge, sondern nur Korrelationen. Die KI hat Millionen von Bildern gesehen und weiß, dass Augen normalerweise Glanzlichter haben, Hintergründe meist unscharf sind und Brillen in der Regel Reflexionen aufweisen. Sie weiß nur, welche Elemente häufig gemeinsam auftreten, versteht aber nicht, was Ursache und was Wirkung ist. Deshalb zeichnet die KI Bilder, die nur Effekte, aber keine Ursachen haben. Für das Modell gibt es keine sogenannten Ursachen, sondern nur visuelle Elemente, die häufig paarweise auftreten.
Das ist das Erkennungsmerkmal von KI-Bildern im Jahr 2026: Es handelt sich nicht mehr um offensichtliche Mängel, die man auf einen Blick erkennen kann, sondern um perfekte visuelle Effekte, denen die entsprechende reale Ursache fehlt. Wenn Sie diese Erkennungsmethode beherrschen, lassen Sie sich nicht mehr von KI-generierten Bildern täuschen. Im Folgenden werden mehrere reale Beispiele aufgeführt, von den relativ offensichtlichen bis zu den äußerst verborgenen, um sie nacheinander zu erläutern.
Die Augen sind der Ort, an dem die Unstimmigkeiten zuerst sichtbar werden
Bei der Erkennung schaut man zuerst auf die Augen. Hier treten am häufigsten Modellfehler auf, die aber fast niemand beachtet.
Sehen Sie sich die Iris in diesem Bild an: Im Inneren der Pupille erscheint ein sternförmiges Glanzlicht.
Das sternförmige Glanzlicht im Auge kann nur von einer Lichtquelle mit bestimmter Form stammen: Ringlichter, unterteilte Fenster, Filter, es handelt sich im Wesentlichen um Reflexionen. Reflexionen sollten auf der Hornhaut erscheinen, also der feuchten Oberfläche der äußeren Augenschicht. Die Iris liegt unterhalb der Hornhaut, innerhalb der Kammerwasser. Die Iris selbst reflektiert kein Licht, sondern absorbiert und beugt es nur.
In diesem Bild wollte die KI die Reflexion einer geformten Lichtquelle zeichnen, hat aber fälschlicherweise das sternförmige Glanzlicht im Inneren der Iris eingebrannt und die radiäre physiologische Struktur der Iris zerstört. Das Glanzlicht wurde an eine untere Position gezeichnet, die eigentlich nicht dafür vorgesehen ist. Dieser Stern befindet sich nicht auf der Augenoberfläche, sondern ist in das Augengewebe eingebettet. In der realen Welt gibt es keine Leuchte, die diesen Effekt erzeugen kann. Damit das Licht diese Position erreicht, müsste es eine Gewebeschicht durchdringen, die das Licht eigentlich blockieren sollte.
Die Iris sollte eine regelmäßige Kreisform haben. Sobald die Form der Iris verzerrt ist, kann man mit hoher Wahrscheinlichkeit davon ausgehen, dass das Bild Probleme aufweist.
Die Reflexion im Auge ist eine Momentaufnahme der realen Lichtquelle
Es gibt einen weiteren allgemein anerkannten Schlüsselpunkt im Bereich der Fotografie: Die Reflexion im Auge kann die tatsächliche Position der Lichtquelle wiedergeben.
Die Form des Augenlichts entspricht vollständig dem leuchtenden Objekt selbst – quadratische Softboxen, rechteckige Fenster, ringförmige Fülllichter. Wenn man die Reflexion im Auge richtig deutet, kann man das gesamte Beleuchtungsschema rekonstruieren. Wenn die Lichtquelle, die der Reflexion im Auge entspricht, mit der Beleuchtung der übrigen Teile des Gesichts kollidiert, bricht die Realitätsnähe dieses Bildes sofort zusammen.
Dieses Selfie in einem Zelt bei Nacht ist ein typisches Beispiel.
Zuerst ist zu sehen, dass die Iris bereits verzerrt ist, aber das ist nicht der einzige Grund, der den hyperrealistischen Effekt zerstört: Die Beleuchtungslogik ist ebenfalls sehr merkwürdig.
Das Licht auf der Vorderseite der Stirn ist hart und stark, das ist der Effekt eines Blitzes, egal ob es sich um einen Aufsteckblitz oder einen handgehaltenen Blitz handelt. Ein Blitz bedeutet, dass die Kamera über einen Blitzschuh verfügt. In Kombination mit der komprimierten Perspektive des Gesichts sollte die Kamera ein Objektiv mit 50 mm oder längerer Brennweite verwenden. Hier liegt der Widerspruch: Das Bild zeigt die Perspektive eines Selfies mit ausgestrecktem Arm, aber das Gerät, das diesen Bildeffekt erzeugen kann, ist eine Tele-Spiegelreflexkamera. Die Länge des menschlichen Arms reicht nicht aus, um diese Aufnahmeentfernung zu erreichen. Das Gerät, das dieses starke Licht erzeugt, kann nicht in der Hand der Person im Bild gehalten werden.
Es gibt noch ein weiteres Detail, das nur Personen bemerken, die regelmäßig mit Belichtungsmessgeräten arbeiten. Wenn man einen Frontblitz verwendet und vermeiden möchte, dass die Person in der dunklen Umgebung hart und unnatürlich wirkt, wird in der Fotografie die Technik des Ausgleichs zwischen Umgebungslicht und Blitz angewendet. Zuerst misst man die Parameter des Hintergrunds, stellt die Kamera entsprechend der Hintergrundbelichtung ein und drosselt dann die Blitzleistung, damit das Bild weich verschmilzt. Die KI hat den weichen, graduellen Bildeffekt nachgeahmt, der aus dieser Ausgleichstechnik resultiert, hat aber gleichzeitig einen extrem starken Blitz hinzugefügt – die beiden Effekte können nicht koexistieren. Die KI hat das Ergebnis nachgeahmt, das durch diese Technik entsteht, versteht aber nicht das Prinzip hinter dieser Technik.
Midjourney ahmt die fertigen Werke von Fotografen nach, versteht aber nicht die Operationslogik der Fotografen. Dieser Mangel an Verständnis kommt in Beleuchtungseffekten zum Vorschein, die in der Realität nicht existieren können.
Schatten ohne Ursprung
Diese Unstimmigkeit ist noch verborgener, aber sobald man sie erkannt hat, kann man sie nicht mehr ignorieren.
Auf Schulter und Brust des T-Shirts befindet sich ein Schatten. Dieser Schatten zeigt an, dass an der Seite eine Wand oder ein Objekt das Sonnenlicht blockieren muss. Wenn es tatsächlich ein Hindernis gäbe, würde das Gesicht, das sich höher auf derselben Ebene befindet, ebenfalls von Schatten bedeckt sein. Aber das Gesicht ist vollständig beleuchtet.
Der Schatten hört abrupt am Haaransatz auf, mit scharfer Kante, aber es gibt kein physisches Objekt, das den Schatten wirft. Selbst wenn man sich eine erhabene Struktur ausdenkt, um den Schatten zu erklären, ist dies aus Sicht der fotografischen Komposition unlogisch: Dieser Schatten teilt das Bild nicht auf, hebt auch keine Stimmung hervor und erfüllt keine kompositorische Funktion. Sein Auftreten widerspricht sowohl den physikalischen Gesetzen als auch der kreativen Logik.
Der Grund dahinter ist, dass die Beleuchtung der Person und die Beleuchtung der Umgebung von der KI separat generiert wurden, und die beiden Beleuchtungen passen nicht zueinander. Auf einem echten Foto ist die Sonne eine einheitliche Lichtquelle, Schatten von Gesicht und Objekten werden von demselben Licht gesteuert, ohne dass der Fotograf zusätzliche Anpassungen vornehmen muss. Die KI hat kein Konzept eines einheitlichen „Lichts“. Sie hat die beiden Bildproben „helles Gesicht“ und „Schatten auf Stoff“ separat gelernt und die Effekte willkürlich zusammengesetzt, ohne die physikalischen Regeln zu beachten, die verlangen, dass die beiden übereinstimmen. Dadurch wirken Person und Hintergrund so, als wären sie aus zwei verschiedenen Fotos zusammengefügt.
In einer realen Szene beleuchtet dieselbe Lichtquelle das gesamte Bild. Wenn in einem Bild zwei widersprüchliche Beleuchtungslogiken auftreten, handelt es sich im Wesentlichen um eine Zusammensetzung aus zwei Bildern.
Verflachte unscharfe Hintergründe
Das ist das am leichtesten zu erkennende, aber von der Öffentlichkeit am meisten übersehene Merkmal. Denn unscharfe Hintergründe werden in der Wahrnehmung der Öffentlichkeit gleichgesetzt mit professioneller Fotografie.
Selfies mit dem Handy haben zwei Merkmale: Verzerrungen durch das Weitwinkelobjektiv und eine große Schärfentiefe, sodass fast alle Objekte scharf dargestellt werden. Dieses Bild erfüllt keine der beiden Bedingungen. Es hat den unscharfen Hintergrund eines Porträts, das mit einer Kamera mit großem Sensor aufgenommen wurde, aber die Komposition ist die Perspektive eines Selfies mit ausgestrecktem Arm. In der Realität gibt es kein Aufnahmegerät, das beide Effekte gleichzeitig erzeugen kann.
Wenn man die Unschärfe selbst genauer betrachtet, wird die Unstimmigkeit noch deutlicher. Bei optischer Unschärfe gilt das Gesetz: Der Grad der Unschärfe nimmt mit zunehmender Entfernung zu. Ein Objekt in einem Meter Entfernung ist weniger unscharf als ein Objekt in fünf Metern Entfernung. Aber in diesem Bild sind Ziegel, Leuchte und Vorhang alle gleich stark unscharf, als befänden sich alle Hintergrundobjekte in derselben Entfernung. Das ist eine falsche, zweidimensionale Unschärfe, so als hätte man das gesamte Bild in Photoshop unscharf gemacht und hinter die Person gelegt.
Das ist kein Zufall. Der KI-Trainingsdatensatz enthält viele nachbearbeitete zusammengesetzte Materialien: ausgeschnittene Personenebenen, die über einen unscharfen zweidimensionalen Hintergrund gelegt werden. Die KI hat diesen trickreichen Modus gelernt und reproduziert ihn immer wieder. Wenn die Unschärfe des Bildhintergrunds keine Gradienten nach Entfernung aufweist, bedeutet das, dass die KI auf solche minderwertigen zusammengesetzten Proben aus dem Trainingsdatensatz zurückgegriffen hat.
Beispielbild: Bei großer Blende nimmt der Grad der Unschärfe mit zunehmender Entfernung allmählich zu. Bildquelle: Sasun Bughdaryan, Unsplash
Schauen Sie sich die Brille an, die die Person trägt: Hier verbirgt sich eine weitere Lücke – es fehlen die Nasenpads. Die kleinen Bauteile am Rahmen, die auf beiden Seiten