KI‑Kompass
Kompass

Fehlersuche

Wenn die Ergebnisse schlechter werden: die Reihenfolge, in der geprüft wird, und die fünf Ursachen, die es fast immer sind.

·2 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
2 Abschnitte

Die Prüfreihenfolge

  1. 01

    Hat sich das Modell geändert?

    Version und Prüfsumme gegen das Protokoll halten. Viele Anbieter wechseln hinter derselben Bezeichnung.

  2. 02

    Hat sich der Prompt geändert?

    Systemprompt, Vorlage, Parameter. Eine Änderung ohne erneute Messung ist die zweithäufigste Ursache.

  3. 03

    Haben sich die Eingaben geändert?

    Neue Dokumentart, anderes Format, andere Quelle, andere Sprache.

  4. 04

    Hat sich die Datenlage geändert?

    Bei Abruf: neue Fassungen, gelöschte Dokumente, geänderte Berechtigungen.

  5. 05

    Erst danach: liegt es am Modell selbst?

    Diese Frage kommt zuletzt, nicht zuerst.

Die fünf häufigsten Ursachen

UrsacheAnzeichen
Stiller ModellwechselAlles war gut, dann plötzlich nicht mehr
Geänderter Prompt ohne MessungVerschlechterung genau ab einem Datum
Verschobene EingabeverteilungNur bestimmte Fälle betroffen
Veraltete Quellen im AbrufAntworten sind plausibel und überholt
Zu niedrige PrüfquoteFehler waren immer da, fallen jetzt auf

Verschlechterung belegen

  • Das eingefrorene Eval-Set erneut rechnen, mit derselben Auswertung.
  • Ergebnisse je Kategorie vergleichen, nicht als Gesamtwert. Eine Kategorie kann eingebrochen sein, während der Mittelwert hält.
  • Konfidenzintervalle angeben. Zwei Prozentpunkte bei 200 Fällen sind Rauschen.
  • Die Verteilung der Eingaben mit der zum Zeitpunkt der letzten Messung vergleichen.

Verteilungsverschiebung erkennen

Ein einfacher und harter Test: Trainieren Sie einen Klassifikator, der unterscheidet, ob ein Fall aus dem Zeitraum der letzten Messung oder aus dem aktuellen Betrieb stammt. Erreicht er eine ROC-AUC deutlich über 0,5, unterscheiden sich die Verteilungen messbar, und jede alte Güteangabe ist für den heutigen Betrieb nicht mehr gültig. Siehe MLOps.

Wenn es am Abruf liegt

Bei Systemen mit eigenen Quellen ist die Ursache meist nicht das Modell, sondern die Suche. Getrennt messen:

GrößeWas sie zeigt
Recall@kOb der richtige Abschnitt überhaupt gefunden wurde
TreueOb die Antwort durch die gelieferten Abschnitte gedeckt ist
AblehnungsquoteOb bei fehlender Deckung geraten wird

Ein System mit niedrigem Recall und hoher Treue hat ein Suchproblem, kein Modellproblem. Jede Arbeit am Prompt ist dort verschwendet. Siehe RAG, technisch.

Was in den Vorfallsbericht gehört

  • Ab wann, betroffener Umfang, wie bemerkt.
  • Was sich geändert hat, mit Datum und Quelle der Änderung.
  • Welche Entscheidungen auf fehlerhaften Ausgaben beruhten.
  • Sofortmaßnahme, Ursache, dauerhafte Maßnahme.
  • Was die Erkennung verzögert hat, und was daran geändert wird.
War diese Seite hilfreich?
Fehlersuche