KI‑Kompass
Kompass

Werkzeuge bewerten

Wie man ein Werkzeug an eigenen Fällen misst statt an einer Vorführung, und welche Zahlen eine Entscheidung tragen.

·1 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
3 Abschnitte

Das Eval-Set

  1. 01

    Echte Fälle sammeln

    50 bis 300 Vorgänge aus dem Betrieb, zufällig gezogen, nicht ausgewählt.

  2. 02

    Erwartetes Ergebnis festhalten

    Bei geschlossenen Aufgaben die richtige Antwort, bei offenen ein Kriterienkatalog.

  3. 03

    Schwierige Fälle aufnehmen

    Randfälle, mehrdeutige Fälle und solche, bei denen die richtige Antwort „keine Auskunft“ ist.

  4. 04

    Einfrieren und versionieren

    Ab jetzt ist er der Maßstab über Modellwechsel hinweg.

Was gemessen wird

GrößeWofür
Trefferquote je Feld oder KategorieDer eigentliche Gütewert
Anteil unveränderter ÜbernahmenMisst den praktischen Nutzen
Anteil abgelehnter AusgabenZu niedrig heißt: es wird geraten
Zeit je VorgangGegen den Vergleichswert von heute
Kosten je VorgangEinschließlich Prüfaufwand
Fehler, die niemand bemerkt hätteDie wichtigste Kategorie

Zwei Werkzeuge vergleichen

  • Auf denselben Fällen, nicht auf zwei Stichproben.
  • Gepaart auswerten: gezählt werden die Fälle, in denen genau eines richtig lag.
  • Mit Konfidenzintervall. Zwei Prozentpunkte bei 200 Fällen sind Rauschen.
  • Die Anzahl der geprüften Konfigurationen mit angeben. Wer zwanzig Prompts probiert, findet zufällig einen Gewinner.
  • Kosten je erledigtem Vorgang, nicht je Anfrage.

Der Prüfaufwand gehört in die Rechnung

Ein Werkzeug, das 20 Prozent Zeit spart und 30 Prozent Prüfaufwand erzeugt, ist teurer als der bisherige Vorgang. Die vollständige Rechnung lautet:

PostenVorherNachher
Bearbeitungszeitgemessengemessen
Prüfzeit0gemessen
Nachbesserung bei Fehlerngemessengemessen
Kosten je Anfrage0gemessen
Einführung, verteilt über die Nutzungsdauer0geschätzt

Wenn ein Modell als Bewerter eingesetzt wird

Für offene Aufgaben ist eine automatische Bewertung die einzige Skalierung. Die bekannten Verzerrungen und ihre Gegenmittel:

  • Längere Antworten werden bevorzugt: Länge ausdrücklich aus dem Maßstab ausschließen.
  • Der erste Vorschlag gewinnt: Reihenfolge tauschen und beide Läufe mitteln.
  • Der eigene Stil wird bevorzugt: ein anderes Modell als Bewerter einsetzen.
  • Vor der Verwendung: Übereinstimmung mit menschlichen Bewertungen an 50 bis 100 Fällen messen. Unter 70 Prozent ist die automatische Bewertung unbrauchbar.

Siehe Benchmarks lesen.

Der Anbieterfragebogen

KOSTENLOSES KONTO

Anbieterfragebogen mit Bewertungsbogen

Die Fragen, die vor einer Beschaffung schriftlich beantwortet sein müssen, mit einem Bogen, der die Antworten vergleichbar macht.

Arbeitsblatt3 Elemente

Kein Passwort nötig. Wir schicken Ihnen einen Anmeldelink. Ein Konto abonniert keinen Newsletter. Den bestellen Sie separat.

War diese Seite hilfreich?
Werkzeuge bewerten