Werkzeuge bewerten
Wie man ein Werkzeug an eigenen Fällen misst statt an einer Vorführung, und welche Zahlen eine Entscheidung tragen.
Das Eval-Set
- 01
Echte Fälle sammeln
50 bis 300 Vorgänge aus dem Betrieb, zufällig gezogen, nicht ausgewählt.
- 02
Erwartetes Ergebnis festhalten
Bei geschlossenen Aufgaben die richtige Antwort, bei offenen ein Kriterienkatalog.
- 03
Schwierige Fälle aufnehmen
Randfälle, mehrdeutige Fälle und solche, bei denen die richtige Antwort „keine Auskunft“ ist.
- 04
Einfrieren und versionieren
Ab jetzt ist er der Maßstab über Modellwechsel hinweg.
Was gemessen wird
| Größe | Wofür |
|---|---|
| Trefferquote je Feld oder Kategorie | Der eigentliche Gütewert |
| Anteil unveränderter Übernahmen | Misst den praktischen Nutzen |
| Anteil abgelehnter Ausgaben | Zu niedrig heißt: es wird geraten |
| Zeit je Vorgang | Gegen den Vergleichswert von heute |
| Kosten je Vorgang | Einschließlich Prüfaufwand |
| Fehler, die niemand bemerkt hätte | Die wichtigste Kategorie |
Zwei Werkzeuge vergleichen
- Auf denselben Fällen, nicht auf zwei Stichproben.
- Gepaart auswerten: gezählt werden die Fälle, in denen genau eines richtig lag.
- Mit Konfidenzintervall. Zwei Prozentpunkte bei 200 Fällen sind Rauschen.
- Die Anzahl der geprüften Konfigurationen mit angeben. Wer zwanzig Prompts probiert, findet zufällig einen Gewinner.
- Kosten je erledigtem Vorgang, nicht je Anfrage.
Der Prüfaufwand gehört in die Rechnung
Ein Werkzeug, das 20 Prozent Zeit spart und 30 Prozent Prüfaufwand erzeugt, ist teurer als der bisherige Vorgang. Die vollständige Rechnung lautet:
| Posten | Vorher | Nachher |
|---|---|---|
| Bearbeitungszeit | gemessen | gemessen |
| Prüfzeit | 0 | gemessen |
| Nachbesserung bei Fehlern | gemessen | gemessen |
| Kosten je Anfrage | 0 | gemessen |
| Einführung, verteilt über die Nutzungsdauer | 0 | geschätzt |
Wenn ein Modell als Bewerter eingesetzt wird
Für offene Aufgaben ist eine automatische Bewertung die einzige Skalierung. Die bekannten Verzerrungen und ihre Gegenmittel:
- Längere Antworten werden bevorzugt: Länge ausdrücklich aus dem Maßstab ausschließen.
- Der erste Vorschlag gewinnt: Reihenfolge tauschen und beide Läufe mitteln.
- Der eigene Stil wird bevorzugt: ein anderes Modell als Bewerter einsetzen.
- Vor der Verwendung: Übereinstimmung mit menschlichen Bewertungen an 50 bis 100 Fällen messen. Unter 70 Prozent ist die automatische Bewertung unbrauchbar.
Siehe Benchmarks lesen.
Der Anbieterfragebogen
KOSTENLOSES KONTO
Anbieterfragebogen mit Bewertungsbogen
Die Fragen, die vor einer Beschaffung schriftlich beantwortet sein müssen, mit einem Bogen, der die Antworten vergleichbar macht.
Arbeitsblatt3 Elemente