Wahrscheinlichkeit
Bedingte Wahrscheinlichkeit, der Satz von Bayes und warum ein Modell mit 99 Prozent Trefferquote trotzdem meistens falschliegen kann.
Die Idee
Wahrscheinlichkeit ist ein Maß für Unwissen, nicht für Zufall. Wenn ein Modell sagt, ein Dokument sei „mit 87 Prozent eine Rechnung", heißt das: unter allen Dokumenten, die so aussehen wie dieses, waren in den Trainingsdaten 87 Prozent Rechnungen.
Wozu es gut ist
Jede Ausgabe eines Sprachmodells ist eine Wahrscheinlichkeitsverteilung über das gesamte Vokabular. Jede Klassifikation ist eine Verteilung über Klassen. Wer diese Zahlen lesen kann, erkennt, wann ein Modell rät.
Das Beispiel, das alles erklärt
Ein Prüfsystem erkennt betrügerische Rechnungen mit 99 Prozent Trefferquote und 1 Prozent Fehlalarmquote. Von 10.000 Rechnungen sind 10 betrügerisch.
| tatsächlich Betrug | tatsächlich in Ordnung | Summe | |
|---|---|---|---|
| System schlägt an | 9,9 | 99,9 | 109,8 |
| System schweigt | 0,1 | 9.890,1 | 9.890,2 |
| Summe | 10 | 9.990 | 10.000 |
Von 109,8 Alarmen sind 9,9 echt. Das sind 9 Prozent. Neun von zehn Alarmen sind Fehlalarme, obwohl das System zu 99 Prozent „richtig" arbeitet.
def posterior(prevalence, sensitivity, specificity):
tp = prevalence * sensitivity
fp = (1 - prevalence) * (1 - specificity)
return tp / (tp + fp)
print(round(posterior(0.001, 0.99, 0.99), 4)) # 0.0902
print(round(posterior(0.100, 0.99, 0.99), 4)) # 0.9167Dieselbe Modellgüte, zwei Größenordnungen Unterschied im Nutzen.
Die Formeln
Wo das im Modell selbst steckt
Ein autoregressives Sprachmodell zerlegt die Wahrscheinlichkeit einer ganzen Sequenz über die Kettenregel der Wahrscheinlichkeit:
In der Praxis rechnet man mit Logarithmen, weil das Produkt tausender Zahlen
unter eins in float32 sofort auf null unterläuft. Aus dem Produkt wird eine
Summe von Log-Wahrscheinlichkeiten, und aus der mittleren negativen
Log-Wahrscheinlichkeit wird die Perplexität, siehe
Information und Entropie.
Kalibrierung messen
Der Expected Calibration Error teilt die Vorhersagen in Konfidenzbänder und vergleicht die mittlere angegebene Konfidenz je Band mit der tatsächlichen Trefferquote in diesem Band. Ein ECE über 0,1 heißt: die Konfidenzangaben des Modells sind als Entscheidungsgrundlage unbrauchbar und müssen nachkalibriert werden, etwa über Temperature Scaling auf einem Validierungssatz.
Passende Kurse und Quellen
Mathematics for Machine Learning
Genau die Mathematik, die maschinelles Lernen braucht, ohne den Rest. Lineare Algebra, Analysis und Wahrscheinlichkeit in einem Band, frei als PDF.
Für alle, die genau die Mathematik wollen, die maschinelles Lernen braucht, und nicht mehr.
Probabilistic Machine Learning
Kevin Murphys Bände, die maschinelles Lernen konsequent aus der Wahrscheinlichkeitsrechnung heraus aufbauen. Umfangreich und frei verfügbar.
Für alle, die maschinelles Lernen konsequent aus der Wahrscheinlichkeitsrechnung aufbauen wollen.