Die Transformer-Architektur
Der Bauplan hinter fast jedem heutigen Modell: Blöcke, Positionskodierung, Parameterrechnung und was sich seit 2017 wirklich geändert hat.
Die Idee
Ein Transformer besteht aus einem Stapel gleichartiger Blöcke. Jeder Block macht zwei Dinge: Er lässt jedes Token auf alle anderen schauen, und danach verarbeitet er jedes Token für sich weiter. Das wiederholt sich zwanzig bis hundert Mal.
Am Ende steht eine Vorhersage über das nächste Token, also eine Wahrscheinlichkeit für jeden Eintrag des Vokabulars.
Der Aufbau eines Blocks
- 01
Normalisieren
Die Werte auf einen brauchbaren Bereich bringen.
- 02
Attention
Jedes Token mischt Information aus allen vorherigen ein.
- 03
Addieren
Das Ergebnis wird zur Eingabe addiert, nicht ersetzt.
- 04
Zwischenschicht
Ein kleines Netz verarbeitet jedes Token einzeln weiter, wieder mit Normalisierung und Addition.
Die Parameterrechnung
Durchgerechnet für L = 32, h = 4096, f = 11008, V = 128.000:
| Posten | Rechnung | Parameter |
|---|---|---|
| Attention, 32 Blöcke | 32 × 4 × 4096² | 2,15 Mrd. |
| Zwischenschicht, 32 Blöcke | 32 × 2 × 4096 × 11008 | 2,88 Mrd. |
| Einbettung | 128.000 × 4096 | 0,52 Mrd. |
| Summe | 5,55 Mrd. |
Mit einer gebundenen Ausgabeschicht bleibt es dabei, sonst kommen weitere 0,52 Milliarden hinzu. Die Rechnung erklärt auch, warum die Zwischenschicht der größte Posten ist, und warum Mixture of Experts genau dort ansetzt.
Positionskodierung
| Verfahren | Prinzip | Verhalten bei längerem Kontext |
|---|---|---|
| Absolut gelernt | Eine Tabelle je Position | Bricht jenseits der Trainingslänge ab |
| Sinusförmig | Feste Funktion je Position | Verallgemeinert etwas besser |
| RoPE | Dreht Query und Key je nach Position | Lässt sich durch Skalierung verlängern |
| ALiBi | Straft weite Abstände im Score | Verallgemeinert am besten |
RoPE hat sich durchgesetzt, weil es relative Abstände direkt im Skalarprodukt kodiert und sich nachträglich strecken lässt, um den Kontext zu verlängern.
RoPE
Das ist die entscheidende Eigenschaft: Das Modell lernt relative Abstände, nicht
absolute Positionen. Eine Verlängerung des Kontexts gelingt dann durch
Streckung der Frequenzen, etwa indem b erhöht oder die Position skaliert wird.
Was sich seit 2017 geändert hat
| Damals | Heute | Grund |
|---|---|---|
| Post-Norm | Pre-Norm | Stabilität bei großer Tiefe |
| LayerNorm | RMSNorm | Schneller, gleich gut |
| ReLU in der Zwischenschicht | SwiGLU | Messbar bessere Qualität |
| Absolute Positionen | RoPE oder ALiBi | Längerer Kontext möglich |
| Multi-Head-Attention | Gruppierte Abfragen | KV-Cache um Faktor 4 bis 8 kleiner |
| Encoder-Decoder | Nur Decoder | Einfacher, skaliert besser |
| Dichte Zwischenschicht | Teilweise Mixture of Experts | Mehr Kapazität bei gleichem Aufwand |
Der Grundaufbau, ein Stapel identischer Blöcke aus Attention und Zwischenschicht mit Residuen, ist unverändert. Alle Änderungen sind Verbesserungen an Stabilität, Effizienz und Kontextlänge, nicht am Prinzip.
Gruppierte Abfragen
Statt je Kopf eigene Schlüssel und Werte zu berechnen, teilen sich mehrere Abfrageköpfe einen Schlüssel-Wert-Kopf.
Bei 32 Abfrageköpfen und 8 Schlüssel-Wert-Köpfen ist g = 4, der Cache also ein
Viertel so groß. Der gemessene Qualitätsverlust liegt im Bereich weniger Zehntel
Perplexität, der Gewinn an möglicher Kontextlänge bei einem Faktor vier. Siehe
Speicher und Bandbreite.
Passende Kurse und Quellen
Attention Is All You Need
Die Arbeit von 2017, die den Transformer einführte. Alles, was heute Sprachmodell heißt, steht auf diesen acht Seiten.
Die acht Seiten, auf denen alles steht, was heute Sprachmodell heißt.
BERT
Vortraining auf maskiertem Text, danach Feinabstimmung je Aufgabe. Das Muster, das die Sprachverarbeitung vor den großen Modellen geprägt hat.
Für das Verständnis dessen, was vor den großen Modellen die Sprachverarbeitung geprägt hat.
Deep Learning Specialization
Fünf Kurse von den Grundlagen neuronaler Netze bis zu Sequenzmodellen. Ausführlich, mit Programmierübungen, und in Teilen älter als die aktuelle Praxis.
Für alle mit Programmierkenntnissen, die den Bereich vollständig durcharbeiten wollen.
Hugging Face NLP-Kurs
Tokenisierung, Transformer, Feinabstimmung und Bereitstellung, durchgehend mit Code. Setzt Python voraus, dafür arbeitet man am Ende mit echten Modellen.
Für Entwicklung mit Sprachmodellen, wenn es über das Aufrufen einer Schnittstelle hinausgehen soll.
Understanding Deep Learning
Modernes Lehrbuch mit ungewöhnlich klaren Abbildungen, das Transformer und Diffusionsmodelle bereits vollständig behandelt. Frei als PDF.
Für den modernen Einstieg; behandelt Transformer und Diffusion bereits vollständig.