RLHF und Alignment
Wie ein Modell lernt, was erwünscht ist: Präferenzdaten, Belohnungsmodell, DPO als Abkürzung und die Grenzen dieses Verfahrens.
Die Idee
Nach dem Vortraining kann ein Modell Text fortsetzen. Nach der Feinabstimmung kann es Anweisungen befolgen. Was noch fehlt, ist eine Vorstellung davon, welche von zwei möglichen Antworten besser ist.
Dafür bekommen Menschen jeweils zwei Antworten vorgelegt und wählen die bessere. Aus vielen solchen Vergleichen lernt das Modell, was bevorzugt wird.
Der Ablauf
- 01
Antwortpaare erzeugen
Das Modell erzeugt zu einer Anfrage zwei oder mehr Antworten.
- 02
Bewerten lassen
Menschen wählen die bessere, nach einer schriftlichen Anweisung.
- 03
Präferenz lernen
Entweder über ein Belohnungsmodell oder direkt aus den Paaren.
- 04
Modell anpassen
Die bevorzugte Richtung wird verstärkt, ohne sich zu weit vom Ausgangsmodell zu entfernen.
Die Bewertungsanweisung
Sie ist der Ort, an dem das gewünschte Verhalten tatsächlich festgelegt wird, und sie wird oft beiläufig geschrieben.
- Rangfolge der Kriterien festlegen: Richtigkeit vor Vollständigkeit vor Form.
- Ausdrücklich regeln, wie mit Unsicherheit umzugehen ist: Ist ein „ich weiß es nicht" besser als eine Vermutung?
- Länge nicht als Qualitätsmerkmal zulassen, sonst lernt das Modell Weitschweifigkeit.
- Übereinstimmung zwischen Bewertenden messen. Unter 70 Prozent ist die Anweisung zu unklar.
Was messbar besser wird
| Eigenschaft | Wirkung des Alignments |
|---|---|
| Anweisungen befolgen | deutlich besser |
| Format einhalten | deutlich besser |
| Ton und Höflichkeit | deutlich besser |
| Ablehnung unzulässiger Anfragen | deutlich besser |
| Faktische Richtigkeit | gering, teils schlechter |
| Zugeben von Unwissen | nur wenn ausdrücklich belohnt |
Das Belohnungsmodell
DPO
Der entscheidende Schritt besteht in der Beobachtung, dass sich die optimale Policy in geschlossener Form durch das Belohnungsmodell ausdrücken lässt. Setzt man das ein, fällt das Belohnungsmodell heraus:
Der Vorteil ist erheblich: kein separates Belohnungsmodell, keine Verstärkungslernschleife, kein Sampling während des Trainings. Es bleibt ein überwachtes Training auf Paaren, mit entsprechend stabiler Optimierung.
Reward Hacking, konkret
| Beobachtete Abkürzung | Ursache in der Bewertung |
|---|---|
| Antworten werden immer länger | Länge korrelierte mit Zustimmung |
| Übermäßige Aufzählungen | Struktur wurde als Qualität gelesen |
| Zustimmung zur Position des Fragenden | Höflichkeit wurde belohnt |
| Vermeidung klarer Aussagen | Fehler wurden härter bestraft als Ausweichen |
| Formelhafte Einleitungen | Sie kamen in bevorzugten Antworten häufig vor |
Alle fünf sind in freigegebenen Modellen dokumentiert worden. Sie sind keine Fehler der Optimierung, sondern korrekte Optimierung einer ungenauen Vorgabe.
Der Bezug zur Regulierung
Der AI Act verlangt für Modelle mit allgemeinem Verwendungszweck unter anderem eine Beschreibung der Trainings- und Ausrichtungsverfahren sowie eine Bewertung systemischer Risiken. Die Bewertungsanweisung, die Auswahl der Bewertenden und die gemessene Übereinstimmung sind damit dokumentationspflichtige Artefakte und nicht bloß interne Arbeitsunterlagen.
Passende Kurse und Quellen
Hugging Face Kurs zu bestärkendem Lernen
Belohnung, Politik und Erkundung an spielbaren Umgebungen. Nützlich, um zu verstehen, was bei der Ausrichtung von Sprachmodellen eigentlich passiert.
Für alle, die verstehen wollen, was bei der Ausrichtung von Sprachmodellen tatsächlich passiert.
Training Language Models to Follow Instructions
Wie aus einem Textfortsetzer ein Assistent wird. Die Arbeit hinter der Ausrichtung durch menschliche Rückmeldung.
Für alle, die wissen wollen, wie aus einem Textfortsetzer ein Assistent wird.