KI‑Kompass
Kompass

Überwachtes Lernen

Klassifikation und Regression: wie ein Modell aus Beispielen mit bekannter Antwort lernt und woran man erkennt, dass die Etiketten das eigentliche Problem sind.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Sie legen einem Lehrling zweitausend bearbeitete Fälle vor, jeweils mit dem Ergebnis daneben. Nach einer Weile erkennt er das Muster und kann neue Fälle selbst einschätzen. Genau das ist überwachtes Lernen: Beispiele mit Lösung, aus denen eine Regel entsteht.

Wozu es gut ist

Es ist die mit Abstand häufigste Art von KI im Betrieb: Dokumente einsortieren, Tickets zuweisen, Preise schätzen, Ausfälle vorhersagen, Anrede erkennen.

Die Aufgabentypen

AufgabeAusgabeÜbliche VerlustfunktionÜbliche Metrik
Binäre Klassifikationja / neinBinäre KreuzentropiePrecision, Recall, ROC-AUC
Mehrklasseneine von kKreuzentropieMakro-F1, Konfusionsmatrix
Mehrfachetikettmehrere von kBinäre Kreuzentropie je EtikettMikro-F1
RegressionZahlMSE oder MAERMSE, MAE, R²
RangordnungReihenfolgePaarweiser VerlustNDCG, MRR

Der Schwellwert ist eine Geschäftsentscheidung

Ein Klassifikator gibt eine Wahrscheinlichkeit aus. Wo daraus ein Ja wird, legt nicht das Modell fest, sondern die Frage, was ein Fehlalarm gegenüber einem übersehenen Fall kostet.

import numpy as np
from sklearn.metrics import precision_recall_curve

y_true  = np.array([0,0,1,0,1,1,0,1,0,0])
y_score = np.array([.1,.3,.8,.4,.6,.9,.2,.55,.35,.05])

p, r, thr = precision_recall_curve(y_true, y_score)
for pi, ri, ti in zip(p[:-1], r[:-1], thr):
    print(f"Schwelle {ti:.2f}  Precision {pi:.2f}  Recall {ri:.2f}")
# Die Zeile mit dem fuer den Betrieb akzeptablen Recall waehlen,
# nicht die mit dem hoechsten F1.
  • Kosten je Fehlerart schriftlich festhalten, bevor der Schwellwert gesetzt wird.
  • Den Schwellwert auf der Validierung wählen, nie auf dem Testsatz.
  • Bei Klassenverschiebung im Betrieb den Schwellwert neu bestimmen, nicht das Modell neu trainieren.

Die Zielfunktion

Empirisches Risiko mit Regularisierung

J(θ) = (1/n) · Σᵢ L(f(xᵢ; θ), yᵢ) + λ · Ω(θ)

Minimiert wird der mittlere Fehler auf den Trainingsdaten plus ein Aufschlag für Modellkomplexität.

n
Anzahl der Trainingsbeispiele
L
die Verlustfunktion je Beispiel
λ
Stärke der Regularisierung
Ω(θ)
ein Strafterm für komplexe Modelle, meist ‖θ‖²

Die Obergrenze durch Etikettenrauschen

Bei einer Etikettenfehlerquote ε und einem Modell, das die wahre Funktion perfekt lernt, ist die gemessene Genauigkeit gegen den verrauschten Testsatz höchstens 1 − ε. Bei ε = 0,05 ist bei 95 Prozent Schluss, egal wie gut das Modell wird. Wer über diesem Wert misst, misst Überanpassung an das Rauschen.

Daraus folgt eine Reihenfolge, die selten eingehalten wird: erst die Etiketten prüfen, dann das Modell wechseln. Ein Doppelblind-Abgleich an 200 Fällen mit einem zweiten Annotator kostet einen Tag und beantwortet die Frage, ob sich weitere Modellarbeit überhaupt lohnt. Siehe Annotation und Labeling.

Kalibrierung nicht vergessen

Baumverfahren und Boosting liefern Scores, keine Wahrscheinlichkeiten. Wenn die Ausgabe in eine Kostenrechnung eingeht, muss sie kalibriert werden, Platt Scaling oder isotone Regression auf einem separaten Teil der Validierung. Ohne das ist jede Erwartungswertrechnung darauf ohne Grundlage.

Passende Kurse und Quellen

KursTeilweise kostenlos5400 Min.EN

Machine Learning Specialization

Der Kurs von Andrew Ng in überarbeiteter Fassung. Regression, Klassifikation, neuronale Netze und die Fehler, die in der Praxis tatsächlich passieren. Rechnen inbegriffen.

Kostenlos anzusehen, das Zertifikat kostet. Wer nur verstehen will, braucht es nicht.

DeepLearning.AIZum Angebot
War diese Seite hilfreich?
Überwachtes Lernen