Reinforcement Learning
Lernen durch Belohnung statt durch Beispiele: wie ein System eine Strategie entwickelt, warum das so schwer zu bändigen ist und wo es bei Sprachmodellen auftaucht.
Die Idee
Sie bringen einem Hund nicht bei, wie ein Sitz aussieht, indem Sie ihm tausend Fotos zeigen. Sie warten, bis er sich hinsetzt, und geben ein Leckerli. Nach einer Weile hat er die Verbindung.
Reinforcement Learning funktioniert genauso: es gibt keine richtige Antwort, sondern nur eine Bewertung im Nachhinein.
Wozu es gut ist
Überall dort, wo es keine Beispielsammlung geben kann, weil das System die Situation erst selbst erzeugt: Regelungstechnik, Logistikplanung, Spielstrategien, Ressourcenverteilung in Rechenzentren.
Die Begriffe
| Begriff | Bedeutung |
|---|---|
Zustand s | Was das System gerade sieht |
Aktion a | Was es tun kann |
Belohnung r | Rückmeldung nach der Aktion |
Policy π | Die Strategie: welche Aktion in welchem Zustand |
Rendite G | Die Summe aller künftigen Belohnungen, abgezinst |
Der Zielkonflikt
Erkunden oder ausnutzen. Wer immer die beste bekannte Aktion wählt, findet nie
eine bessere. Wer immer probiert, verschenkt Ertrag. Übliche Lösung: mit
Wahrscheinlichkeit ε zufällig handeln und ε im Verlauf senken.
import numpy as np
rng = np.random.default_rng(0)
wahre_guete = np.array([0.2, 0.5, 0.75]) # drei Optionen, unbekannt
schaetzung = np.zeros(3); zaehler = np.zeros(3)
for t in range(1, 2001):
eps = max(0.02, 1.0 / np.sqrt(t)) # Erkundung fällt langsam ab
a = rng.integers(3) if rng.random() < eps else int(schaetzung.argmax())
r = float(rng.random() < wahre_guete[a])
zaehler[a] += 1
schaetzung[a] += (r - schaetzung[a]) / zaehler[a]
print(schaetzung.round(3), zaehler.astype(int))Die Bellman-Gleichung
Der Abzinsungsfaktor ist keine Feinheit: bei γ = 0,99 liegt der effektive
Horizont bei rund 1/(1−γ) = 100 Schritten. Wer ein Problem mit
Tausend-Schritt-Konsequenzen mit γ = 0,9 rechnet, hat einen Horizont von zehn
Schritten und wundert sich über kurzsichtiges Verhalten.
Wo es bei Sprachmodellen steckt
In der Alignment-Stufe. Das Modell erzeugt zwei Antworten, ein Mensch wählt die bessere, daraus wird ein Belohnungsmodell trainiert, und die Policy wird gegen dieses Modell optimiert, mit einem KL-Term, der verhindert, dass sich das Modell zu weit vom Ausgangszustand entfernt.
Ohne den KL-Term kollabiert die Policy regelmäßig auf wenige Formulierungen, die das Belohnungsmodell hoch bewertet, sichtbar als Antworten, die einander auffällig ähneln. Siehe RLHF und Alignment.
Passende Kurse und Quellen
Hugging-Face-Kurs zu Reinforcement Learning
Belohnung, Politik und Erkundung an spielbaren Umgebungen. Nützlich, um zu verstehen, was beim Alignment von Sprachmodellen eigentlich passiert.
Für alle, die verstehen wollen, was beim Alignment von Sprachmodellen tatsächlich passiert.