Was KI heute leistet
Eine nüchterne Bestandsaufnahme: welche Aufgaben verlässlich funktionieren, welche mit Einschränkung, und welche trotz aller Ankündigungen nicht.
Drei Stufen der Verlässlichkeit
| Stufe | Aufgaben | Was zu tun ist |
|---|---|---|
| Verlässlich | Zusammenfassen, umformulieren, übersetzen, strukturieren, Entwürfe schreiben, sortieren | Stichprobe prüfen |
| Mit Einschränkung | Aus eigenen Dokumenten antworten, Code entwerfen, Bilder erkennen, Sprache verschriftlichen | Jede Ausgabe prüfen, Quelle verlangen |
| Unzuverlässig | Fakten aus dem Gedächtnis, Rechnen, Fundstellen, Fristen, aktuelle Ereignisse | Nicht ohne Werkzeug oder Quelle verwenden |
Die erste Zeile hat eine gemeinsame Eigenschaft: Das Material liegt vor, und das Ergebnis lässt sich gegen das Material halten. Genau darin liegt die Verlässlichkeit.
Was gut funktioniert, konkret
- Eine zehnseitige Notiz auf eine halbe Seite bringen.
- Einen Text in einfache Sprache übertragen oder übersetzen.
- Eine E-Mail in drei Tonlagen entwerfen.
- Freitext in Kategorien einsortieren.
- Aus einer Besprechungsnotiz Aufgaben herausziehen.
- Ein Formular oder eine Tabelle aus einem PDF auslesen.
Die Frage, die weiterhilft
Nicht „kann das Modell das?“, sondern:
- 01
Wie oft liegt es daneben?
Gemessen an fünfzig echten Fällen aus dem eigenen Betrieb, nicht an einer Vorführung.
- 02
Was kostet ein Fehler?
Ein falsch einsortiertes Ticket kostet Minuten. Eine falsche Frist kostet ein Verfahren.
- 03
Wird der Fehler bemerkt?
Ein auffälliger Fehler ist harmlos. Ein plausibler Fehler in einer Zahl, die niemand nachrechnet, ist gefährlich.
- 04
Was ist der Vergleichswert?
Wie oft liegt der heutige Vorgang daneben? Ohne diesen Wert lässt sich kein Fortschritt behaupten.
Was sich in den letzten Jahren wirklich verändert hat
| Bereich | Damals | Heute |
|---|---|---|
| Sprache verstehen und erzeugen | brauchbar in engen Domänen | breit verlässlich |
| Bilder erkennen | gut mit vielen eigenen Beispielen | gut mit wenigen hundert |
| Mehrstufiges Schlussfolgern | kaum | brauchbar, teuer |
| Werkzeuge benutzen | nicht vorhanden | verbreitet, fehleranfällig |
| Verlässlichkeit von Fakten | schlecht | schlecht, aber mit Abruf lösbar |
Die letzte Zeile ist die wichtigste: Was sich geändert hat, ist nicht das Faktengedächtnis, sondern die Möglichkeit, das Modell an Quellen zu binden.
Grenzen, die aus der Bauart folgen
- Halluzination. Das Trainingsziel minimiert den Abstand zur Textverteilung, nicht zur Wahrheit. Bessere Modelle senken die Rate, beseitigen sie nicht.
- Kein Determinismus. Gleitkommaaddition ist nicht assoziativ; identische Eingaben können auf derselben Karte unterschiedliche Ausgaben erzeugen.
- Rechnen. Zahlen werden in Token zerlegt. Zuverlässiges Rechnen entsteht erst durch Abgabe an ein Werkzeug.
- Lost-in-the-Middle-Problem. In langen Eingaben wird die Mitte messbar schlechter genutzt als Anfang und Ende.
- Zeitpunkt. Ein Modell kennt die Welt bis zu seinem Trainingsstichtag. Aktualität entsteht nur durch Abruf.
Wie man Ankündigungen liest
Ein neues Modell wird typischerweise mit Benchmarkwerten vorgestellt. Drei Fragen machen diese Werte einordenbar:
| Frage | Warum |
|---|---|
| Waren die Testdaten im Training? | Kontamination macht Werte bedeutungslos |
| Wie viele Varianten wurden geprüft? | Mehrfachtestung erzeugt zufällige Gewinner |
| Wie groß ist das Konfidenzintervall? | Unter drei Punkten Unterschied meist Rauschen |
Für eine Entscheidung im eigenen Haus zählt keine dieser Zahlen, sondern die Messung an fünfzig eigenen Fällen. Siehe Benchmarks lesen und Werkzeuge bewerten.
Was in zwei Jahren anders sein dürfte
Belastbar ist wenig. Zwei Beobachtungen tragen: Der Preis je Leistung fällt seit Jahren um etwa eine Größenordnung pro Jahr, und die Bindung an Quellen wird besser statt das Gedächtnis. Wer plant, plant deshalb sinnvollerweise mit fallenden Kosten und mit Architekturen, die Quellen einbinden, nicht mit einem Modell, das irgendwann alles weiß.
Der Eignungsbogen
KOSTENLOSES KONTO
Eignungsbogen: taugt KI für diese Aufgabe?
Sechs Fragen, die vor jedem Versuch beantwortet sein sollten, mit einer Auswertung, die eine Antwort gibt statt eines Gefühls.
Arbeitsblatt2 Elemente
Passende Kurse und Quellen
AI for Everyone
Nicht-technischer Einstiegskurs von Andrew Ng. Etwa sechs Stunden, gut geeignet für Führungskräfte.
Für Führungskräfte ohne technischen Hintergrund, die entscheiden müssen statt bauen.
AI Index Report
Jährlicher Bericht mit belegten Zahlen zu Modellen, Kosten, Einsatz und Regulierung. Nützlich, wenn eine Aussage eine Quelle braucht statt eines Eindrucks.
Wenn eine Aussage eine Quelle braucht statt eines Eindrucks.