KI‑Kompass
Kompass

Diffusionsmodelle

Die zweite große Modellfamilie neben Transformern: entrauschen statt fortsetzen, warum das für Bilder besser passt und wo beide zusammenkommen.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Zwei Richtungen. Vorwärts: Man nimmt ein Bild und mischt schrittweise Rauschen hinzu, bis nichts mehr erkennbar ist. Dieser Weg ist trivial und braucht kein Modell. Rückwärts: Man lernt, einen dieser Schritte umzukehren.

Kann man einen Schritt umkehren, kann man alle umkehren. Also startet man bei reinem Rauschen und entrauscht wiederholt, bis ein Bild dasteht.

Der Unterschied zum Sprachmodell

SprachmodellDiffusionsmodell
Erzeugtein Token nach dem anderenalles gleichzeitig, schrittweise verfeinert
Schrittzahlso viele wie Tokenfest gewählt, meist 20 bis 50
Passend fürSequenzen mit ReihenfolgeBilder, Ton, alles ohne feste Reihenfolge
SteuerungPrompt im KontextPrompt als Bedingung in jedem Schritt

Der Rauschplan

Wie schnell das Rauschen zunimmt, ist eine Entwurfsentscheidung mit spürbarer Wirkung.

PlanVerlaufEigenschaft
LineargleichmäßigEinfach, ursprüngliche Variante
Kosinusanfangs langsam, später schnellBessere Detailtreue
Sigmoidweich an beiden EndenFür hohe Auflösungen

Der Grund für den Kosinusplan: Bei linearem Verlauf ist das Bild schon nach einem Drittel der Schritte fast reines Rauschen, und die restlichen zwei Drittel tragen kaum zum Lernen bei.

Die Löser

LöserSchritteBemerkung
DDPM1.000Ursprünglich, stochastisch
DDIM20 bis 100Deterministisch, gleicher Startwert gleiches Bild
DPM-Solver++15 bis 30Heute üblich
Destilliert1 bis 4Ein Modell lernt, mehrere Schritte auf einmal zu machen

Vorwärts und rückwärts

Vorwärtsprozess und Trainingsziel

x_t = √ᾱ_t · x₀ + √(1−ᾱ_t) · ε L = E [ ‖ ε − ε_θ(x_t, t, c) ‖² ]

Der verrauschte Zustand lässt sich in einem Schritt berechnen, und das Netz wird darauf trainiert, das eingemischte Rauschen zu erkennen.

x₀
das saubere Bild
x_t
das Bild nach t Rauschschritten
ᾱ_t
kumuliertes Produkt der Planfaktoren
ε_θ
das Netz, das das eingemischte Rauschen vorhersagt

Ein Entrauschungsschritt, DDIM

x̂₀ = (x_t − √(1−ᾱ_t)·ε_θ) / √ᾱ_t x_{t−1} = √ᾱ_{t−1} · x̂₀ + √(1−ᾱ_{t−1}) · ε_θ

Aus dem verrauschten Bild und dem vorhergesagten Rauschen wird das saubere Bild geschätzt und anschließend auf das nächstniedrigere Rauschniveau zurückgemischt.

x̂₀
die aus dem aktuellen Zustand geschätzte saubere Fassung

Die Deterministik von DDIM ist praktisch bedeutsam: Derselbe Startwert und dieselbe Bedingung ergeben exakt dasselbe Bild, was Reproduzierbarkeit und gezielte Variation überhaupt erst ermöglicht.

Warum latent gerechnet wird

Diffusion auf Pixeln bei 1024 × 1024 × 3 bedeutet 3,1 Millionen Dimensionen je Schritt, und es sind zwanzig bis fünfzig Schritte. Ein vorgeschalteter Autoencoder komprimiert um den Faktor 8 je Kante:

EbeneDimensionenVerhältnis
Pixelraum 1024² × 33.145.7281
Latenter Raum 128² × 465.5361/48

Der Rechenaufwand je Schritt sinkt entsprechend, bei kaum sichtbarem Qualitätsverlust. Das ist der Grund, warum Bilderzeugung auf einer Karte mit 8 GB läuft.

Wo Diffusion und Transformer zusammenkommen

Aktuelle Bildmodelle ersetzen das früher übliche U-Net durch einen Transformer über Bildkacheln. Der Diffusionsprozess bleibt derselbe, nur das Netz, das den Entrauschungsschritt vorhersagt, ist ein Transformer. Damit gelten dieselben Skalierungseigenschaften wie bei Sprachmodellen, mehr Parameter und mehr Daten verbessern das Ergebnis vorhersagbar, was bei U-Netzen weniger klar der Fall war.

Passende Kurse und Quellen

StudieKostenlosEN

Denoising Diffusion Probabilistic Models

Rauschen schrittweise entfernen statt Bilder in einem Zug erzeugen. Die Grundlage aller heutigen Bildmodelle.

Für das Verständnis aller heutigen Bildmodelle, vom Rauschen her gedacht.

StudieKostenlosEN

High-Resolution Image Synthesis

Diffusion nicht im Bild, sondern in einem kleineren Zwischenraum. Der Schritt, der Bildgenerierung auf gewöhnlicher Hardware möglich machte.

Für alle, die Bildgenerierung selbst betreiben wollen; erklärt, warum es auf üblicher Hardware läuft.

BuchKostenlosEN

Understanding Deep Learning

Modernes Lehrbuch mit ungewöhnlich klaren Abbildungen, das Transformer und Diffusionsmodelle bereits vollständig behandelt. Frei als PDF.

Für den modernen Einstieg; behandelt Transformer und Diffusion bereits vollständig.

War diese Seite hilfreich?
Diffusionsmodelle