KI‑Kompass
Kompass

Bilder erzeugen

Diffusionsmodelle von innen: wie aus Rauschen ein Bild wird, was Schrittzahl und Führungsstärke tun und welche rechtlichen Fragen offen sind.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Nehmen Sie ein Foto und schütten Sie schrittweise Rauschen darüber, bis nur noch Grieß übrig ist. Ein Modell wird darauf trainiert, jeden dieser Schritte rückgängig zu machen: aus etwas verrauschtem Bild ein etwas weniger verrauschtes.

Zum Erzeugen startet man dann bei reinem Rauschen und lässt das Modell fünfzig Mal ein bisschen entrauschen. Was übrig bleibt, ist ein Bild, das es nie gab.

Die Regler

ReglerWirkung
SchritteMehr Schritte, sauberere Details, längere Rechenzeit
FührungsstärkeWie eng dem Prompt gefolgt wird
StartwertDerselbe Startwert erzeugt dasselbe Bild reproduzierbar
Negativer PromptWas ausdrücklich nicht erscheinen soll

Führung steuern

Der wichtigste Kunstgriff heißt klassifikatorfreie Führung: Das Modell rechnet jeden Schritt zweimal, einmal mit und einmal ohne Prompt, und verstärkt die Differenz.

Klassifikatorfreie Führung

ε̂ = ε_θ(x, ∅) + w · ( ε_θ(x, c) − ε_θ(x, ∅) )

Die Vorhersage ohne Prompt wird in Richtung der Vorhersage mit Prompt übertrieben.

ε_θ
die vom Modell geschätzte Rauschkomponente
c
die Bedingung, also der Prompt
ohne Bedingung
w
die Führungsstärke, üblich 3 bis 9

Die Formel erklärt beide Randfälle: bei w = 1 bleibt nur die bedingte Vorhersage, bei sehr großem w wird die Differenz so verstärkt, dass Farben übersteuern und Bildinhalte stereotyp werden.

Kontrollierte Erzeugung

VerfahrenWozu
Bild zu BildEin vorhandenes Bild als Ausgangspunkt, Stärke regelt die Abweichung
InpaintingNur einen maskierten Bereich neu erzeugen
ControlNetKanten, Tiefenkarte oder Pose als zusätzliche Vorgabe
LoRAEin Stil oder ein Objekt wird mit wenigen Bildern angelernt

Für betriebliche Anwendungen ist ControlNet meist der entscheidende Baustein: Es macht aus einem zufälligen Generator ein Werkzeug, das eine vorgegebene Geometrie einhält.

Der Vorwärtsprozess

Rauschen hinzufügen, in einem Schritt

x_t = √ᾱ_t · x₀ + √(1 − ᾱ_t) · ε, ε ∼ 𝒩(0, I)

Der Zustand nach t Schritten lässt sich direkt berechnen, ohne alle Zwischenschritte zu durchlaufen.

x₀
das ursprüngliche Bild
x_t
das Bild nach t Rauschschritten
ᾱ_t
das kumulierte Produkt der Rauschplanfaktoren
ε
Standardnormalverteiltes Rauschen

Diese Eigenschaft macht das Training überhaupt bezahlbar: Für jeden Trainingsschritt wird ein zufälliges t gezogen, x_t in einer Zeile berechnet und das Modell darauf trainiert, das eingemischte ε vorherzusagen.

Trainingsverlust

L = E_{x₀, ε, t} [ ‖ ε − ε_θ(x_t, t, c) ‖² ]

Der Verlust ist der quadratische Fehler zwischen dem tatsächlich eingemischten Rauschen und dem vorhergesagten.

ε_θ
die Vorhersage des Netzes
t
ein zufällig gezogener Zeitschritt

Warum latente Diffusion

Diffusion direkt auf Pixeln bei 1024 × 1024 bedeutet über eine Million Dimensionen je Schritt. Latente Diffusion komprimiert das Bild zuvor mit einem Autoencoder um den Faktor 8 je Kante, also auf 128 × 128 × 4 = 65.536 Dimensionen: ein Faktor 48 weniger Rechenaufwand je Schritt bei kaum sichtbarem Qualitätsverlust. Das ist der Grund, warum Bildgenerierung auf einer einzelnen Karte mit 8 GB möglich ist.

Der rechtliche Stand

Zwei Fragen sind sauber zu trennen:

  • Training. In der EU stützt sich das Text- und Data-Mining auf Art. 4 der DSM-Richtlinie, umgesetzt in § 44b UrhG in Deutschland und § 42h UrhG in Österreich. Der Vorbehalt des Rechteinhabers ist maschinenlesbar zu erklären. Ob und wie wirksam dieser Vorbehalt greift, ist Gegenstand laufender Verfahren.
  • Ergebnis. Ein ohne menschliche schöpferische Gestaltung erzeugtes Bild ist in der EU regelmäßig kein Werk und damit gemeinfrei. Wer es exklusiv nutzen will, braucht andere Mittel als das Urheberrecht.
  • Kennzeichnung. Nach Art. 50 AI Act müssen Anbieter Ausgaben maschinenlesbar als künstlich erzeugt kennzeichnen, und Betreiber müssen Deepfakes offenlegen.

Siehe Urheberrecht.

Passende Kurse und Quellen

StudieKostenlosEN

Denoising Diffusion Probabilistic Models

Rauschen schrittweise entfernen statt Bilder in einem Zug erzeugen. Die Grundlage aller heutigen Bildmodelle.

Für das Verständnis aller heutigen Bildmodelle, vom Rauschen her gedacht.

StudieKostenlosEN

Generative Adversarial Networks

Zwei Netze, die gegeneinander lernen. Der erste Ansatz, der überzeugende Bilder erzeugte, heute weitgehend abgelöst.

Historisch wichtig; heute weitgehend abgelöst, aber für das Verständnis der Entwicklung nützlich.

StudieKostenlosEN

High-Resolution Image Synthesis

Diffusion nicht im Bild, sondern in einem kleineren Zwischenraum. Der Schritt, der Bildgenerierung auf gewöhnlicher Hardware möglich machte.

Für alle, die Bildgenerierung selbst betreiben wollen; erklärt, warum es auf üblicher Hardware läuft.

War diese Seite hilfreich?
Bilder erzeugen