KI‑Kompass
Kompass

Bestärkendes Lernen

Lernen durch Belohnung statt durch Beispiele: wie ein System eine Strategie entwickelt, warum das so schwer zu bändigen ist und wo es bei Sprachmodellen auftaucht.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Sie bringen einem Hund nicht bei, wie ein Sitz aussieht, indem Sie ihm tausend Fotos zeigen. Sie warten, bis er sich hinsetzt, und geben ein Leckerli. Nach einer Weile hat er die Verbindung.

Bestärkendes Lernen funktioniert genauso: es gibt keine richtige Antwort, sondern nur eine Bewertung im Nachhinein.

Wozu es gut ist

Überall dort, wo es keine Beispielsammlung geben kann, weil das System die Situation erst selbst erzeugt: Regelungstechnik, Logistikplanung, Spielstrategien, Ressourcenverteilung in Rechenzentren.

Die Begriffe

BegriffBedeutung
Zustand sWas das System gerade sieht
Aktion aWas es tun kann
Belohnung rRückmeldung nach der Aktion
Policy πDie Strategie: welche Aktion in welchem Zustand
Rendite GDie Summe aller künftigen Belohnungen, abgezinst

Der Zielkonflikt

Erkunden oder ausnutzen. Wer immer die beste bekannte Aktion wählt, findet nie eine bessere. Wer immer probiert, verschenkt Ertrag. Übliche Lösung: mit Wahrscheinlichkeit ε zufällig handeln und ε im Verlauf senken.

import numpy as np
rng = np.random.default_rng(0)

wahre_guete = np.array([0.2, 0.5, 0.75])     # drei Optionen, unbekannt
schaetzung  = np.zeros(3); zaehler = np.zeros(3)

for t in range(1, 2001):
    eps = max(0.02, 1.0 / np.sqrt(t))         # Erkundung faellt langsam ab
    a = rng.integers(3) if rng.random() < eps else int(schaetzung.argmax())
    r = float(rng.random() < wahre_guete[a])
    zaehler[a] += 1
    schaetzung[a] += (r - schaetzung[a]) / zaehler[a]

print(schaetzung.round(3), zaehler.astype(int))

Die Bellman-Gleichung

Zustandswert unter einer Policy

V^π(s) = E[ r + γ · V^π(s') | s, a ∼ π ]

Der Wert eines Zustands ist die unmittelbare Belohnung plus der abgezinste Wert des Folgezustands.

V^π(s)
der erwartete Gesamtertrag ab Zustand s unter Strategie π
γ
Abzinsungsfaktor zwischen 0 und 1, üblich 0,95 bis 0,99
r
die unmittelbare Belohnung
s'
der Folgezustand

Der Abzinsungsfaktor ist keine Feinheit: bei γ = 0,99 liegt der effektive Horizont bei rund 1/(1−γ) = 100 Schritten. Wer ein Problem mit Tausend-Schritt-Konsequenzen mit γ = 0,9 rechnet, hat einen Horizont von zehn Schritten und wundert sich über kurzsichtiges Verhalten.

Wo es bei Sprachmodellen steckt

In der Ausrichtungsstufe. Das Modell erzeugt zwei Antworten, ein Mensch wählt die bessere, daraus wird ein Belohnungsmodell trainiert, und die Policy wird gegen dieses Modell optimiert, mit einem KL-Term, der verhindert, dass sich das Modell zu weit vom Ausgangszustand entfernt.

Zielfunktion bei RLHF

max_θ E[ r_φ(x, y) ] − β · D_KL( π_θ(y|x) ‖ π_ref(y|x) )

Maximiere die Belohnung, aber bestrafe jede Abweichung vom Ausgangsmodell.

r_φ
das gelernte Belohnungsmodell
π_θ
die zu optimierende Policy
π_ref
das Ausgangsmodell vor der Ausrichtung
β
wie stark die Abweichung bestraft wird

Ohne den KL-Term kollabiert die Policy regelmäßig auf wenige Formulierungen, die das Belohnungsmodell hoch bewertet, sichtbar als Antworten, die einander auffällig ähneln. Siehe RLHF und Alignment.

Passende Kurse und Quellen

KursKostenlos1200 Min.EN

Hugging Face Kurs zu bestärkendem Lernen

Belohnung, Politik und Erkundung an spielbaren Umgebungen. Nützlich, um zu verstehen, was bei der Ausrichtung von Sprachmodellen eigentlich passiert.

Für alle, die verstehen wollen, was bei der Ausrichtung von Sprachmodellen tatsächlich passiert.

Hugging FaceZum Angebot
War diese Seite hilfreich?
Bestärkendes Lernen