Fehlersuche
Wenn die Ergebnisse schlechter werden: die Reihenfolge, in der geprüft wird, und die fünf Ursachen, die es fast immer sind.
Die Prüfreihenfolge
- 01
Hat sich das Modell geändert?
Version und Prüfsumme gegen das Protokoll halten. Viele Anbieter wechseln hinter derselben Bezeichnung.
- 02
Hat sich der Prompt geändert?
Systemprompt, Vorlage, Parameter. Eine Änderung ohne erneute Messung ist die zweithäufigste Ursache.
- 03
Haben sich die Eingaben geändert?
Neue Dokumentart, anderes Format, andere Quelle, andere Sprache.
- 04
Hat sich die Datenlage geändert?
Bei Abruf: neue Fassungen, gelöschte Dokumente, geänderte Berechtigungen.
- 05
Erst danach: liegt es am Modell selbst?
Diese Frage kommt zuletzt, nicht zuerst.
Die fünf häufigsten Ursachen
| Ursache | Anzeichen |
|---|---|
| Stiller Modellwechsel | Alles war gut, dann plötzlich nicht mehr |
| Geänderter Prompt ohne Messung | Verschlechterung genau ab einem Datum |
| Verschobene Eingabeverteilung | Nur bestimmte Fälle betroffen |
| Veraltete Quellen im Abruf | Antworten sind plausibel und überholt |
| Zu niedrige Prüfquote | Fehler waren immer da, fallen jetzt auf |
Verschlechterung belegen
- Das eingefrorene Eval-Set erneut rechnen, mit derselben Auswertung.
- Ergebnisse je Kategorie vergleichen, nicht als Gesamtwert. Eine Kategorie kann eingebrochen sein, während der Mittelwert hält.
- Konfidenzintervalle angeben. Zwei Prozentpunkte bei 200 Fällen sind Rauschen.
- Die Verteilung der Eingaben mit der zum Zeitpunkt der letzten Messung vergleichen.
Verteilungsverschiebung erkennen
Ein einfacher und harter Test: Trainieren Sie einen Klassifikator, der unterscheidet, ob ein Fall aus dem Zeitraum der letzten Messung oder aus dem aktuellen Betrieb stammt. Erreicht er eine ROC-AUC deutlich über 0,5, unterscheiden sich die Verteilungen messbar, und jede alte Güteangabe ist für den heutigen Betrieb nicht mehr gültig. Siehe MLOps.
Wenn es am Abruf liegt
Bei Systemen mit eigenen Quellen ist die Ursache meist nicht das Modell, sondern die Suche. Getrennt messen:
| Größe | Was sie zeigt |
|---|---|
| Recall@k | Ob der richtige Abschnitt überhaupt gefunden wurde |
| Treue | Ob die Antwort durch die gelieferten Abschnitte gedeckt ist |
| Ablehnungsquote | Ob bei fehlender Deckung geraten wird |
Ein System mit niedrigem Recall und hoher Treue hat ein Suchproblem, kein Modellproblem. Jede Arbeit am Prompt ist dort verschwendet. Siehe RAG, technisch.
Was in den Vorfallsbericht gehört
- Ab wann, betroffener Umfang, wie bemerkt.
- Was sich geändert hat, mit Datum und Quelle der Änderung.
- Welche Entscheidungen auf fehlerhaften Ausgaben beruhten.
- Sofortmaßnahme, Ursache, dauerhafte Maßnahme.
- Was die Erkennung verzögert hat, und was daran geändert wird.