KI‑Kompass
Kompass

Was KI heute leistet

Eine nüchterne Bestandsaufnahme: welche Aufgaben verlässlich funktionieren, welche mit Einschränkung, und welche trotz aller Ankündigungen nicht.

·2 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
4 Abschnitte

Drei Stufen der Verlässlichkeit

StufeAufgabenWas zu tun ist
VerlässlichZusammenfassen, umformulieren, übersetzen, strukturieren, Entwürfe schreiben, sortierenStichprobe prüfen
Mit EinschränkungAus eigenen Dokumenten antworten, Code entwerfen, Bilder erkennen, Sprache verschriftlichenJede Ausgabe prüfen, Quelle verlangen
UnzuverlässigFakten aus dem Gedächtnis, Rechnen, Fundstellen, Fristen, aktuelle EreignisseNicht ohne Werkzeug oder Quelle verwenden

Die erste Zeile hat eine gemeinsame Eigenschaft: Das Material liegt vor, und das Ergebnis lässt sich gegen das Material halten. Genau darin liegt die Verlässlichkeit.

Was gut funktioniert, konkret

  • Eine zehnseitige Notiz auf eine halbe Seite bringen.
  • Einen Text in einfache Sprache übertragen oder übersetzen.
  • Eine E-Mail in drei Tonlagen entwerfen.
  • Freitext in Kategorien einsortieren.
  • Aus einer Besprechungsnotiz Aufgaben herausziehen.
  • Ein Formular oder eine Tabelle aus einem PDF auslesen.

Die Frage, die weiterhilft

Nicht „kann das Modell das?“, sondern:

  1. 01

    Wie oft liegt es daneben?

    Gemessen an fünfzig echten Fällen aus dem eigenen Betrieb, nicht an einer Vorführung.

  2. 02

    Was kostet ein Fehler?

    Ein falsch einsortiertes Ticket kostet Minuten. Eine falsche Frist kostet ein Verfahren.

  3. 03

    Wird der Fehler bemerkt?

    Ein auffälliger Fehler ist harmlos. Ein plausibler Fehler in einer Zahl, die niemand nachrechnet, ist gefährlich.

  4. 04

    Was ist der Vergleichswert?

    Wie oft liegt der heutige Vorgang daneben? Ohne diesen Wert lässt sich kein Fortschritt behaupten.

Was sich in den letzten Jahren wirklich verändert hat

BereichDamalsHeute
Sprache verstehen und erzeugenbrauchbar in engen Domänenbreit verlässlich
Bilder erkennengut mit vielen eigenen Beispielengut mit wenigen hundert
Mehrstufiges Schlussfolgernkaumbrauchbar, teuer
Werkzeuge benutzennicht vorhandenverbreitet, fehleranfällig
Verlässlichkeit von Faktenschlechtschlecht, aber mit Abruf lösbar

Die letzte Zeile ist die wichtigste: Was sich geändert hat, ist nicht das Faktengedächtnis, sondern die Möglichkeit, das Modell an Quellen zu binden.

Grenzen, die aus der Bauart folgen

  • Halluzination. Das Trainingsziel minimiert den Abstand zur Textverteilung, nicht zur Wahrheit. Bessere Modelle senken die Rate, beseitigen sie nicht.
  • Kein Determinismus. Gleitkommaaddition ist nicht assoziativ; identische Eingaben können auf derselben Karte unterschiedliche Ausgaben erzeugen.
  • Rechnen. Zahlen werden in Token zerlegt. Zuverlässiges Rechnen entsteht erst durch Abgabe an ein Werkzeug.
  • Lost-in-the-Middle-Problem. In langen Eingaben wird die Mitte messbar schlechter genutzt als Anfang und Ende.
  • Zeitpunkt. Ein Modell kennt die Welt bis zu seinem Trainingsstichtag. Aktualität entsteht nur durch Abruf.

Wie man Ankündigungen liest

Ein neues Modell wird typischerweise mit Benchmarkwerten vorgestellt. Drei Fragen machen diese Werte einordenbar:

FrageWarum
Waren die Testdaten im Training?Kontamination macht Werte bedeutungslos
Wie viele Varianten wurden geprüft?Mehrfachtestung erzeugt zufällige Gewinner
Wie groß ist das Konfidenzintervall?Unter drei Punkten Unterschied meist Rauschen

Für eine Entscheidung im eigenen Haus zählt keine dieser Zahlen, sondern die Messung an fünfzig eigenen Fällen. Siehe Benchmarks lesen und Werkzeuge bewerten.

Was in zwei Jahren anders sein dürfte

Belastbar ist wenig. Zwei Beobachtungen tragen: Der Preis je Leistung fällt seit Jahren um etwa eine Größenordnung pro Jahr, und die Bindung an Quellen wird besser statt das Gedächtnis. Wer plant, plant deshalb sinnvollerweise mit fallenden Kosten und mit Architekturen, die Quellen einbinden, nicht mit einem Modell, das irgendwann alles weiß.

Der Eignungsbogen

KOSTENLOSES KONTO

Eignungsbogen: taugt KI für diese Aufgabe?

Sechs Fragen, die vor jedem Versuch beantwortet sein sollten, mit einer Auswertung, die eine Antwort gibt statt eines Gefühls.

Arbeitsblatt2 Elemente

Kein Passwort nötig. Wir schicken Ihnen einen Anmeldelink. Ein Konto abonniert keinen Newsletter. Den bestellen Sie separat.

Passende Kurse und Quellen

KursTeilweise kostenlos360 Min.EN

AI for Everyone

Nicht-technischer Einstiegskurs von Andrew Ng. Etwa sechs Stunden, gut geeignet für Führungskräfte.

Für Führungskräfte ohne technischen Hintergrund, die entscheiden müssen statt bauen.

DeepLearning.AIZum Angebot
ArtikelKostenlosEN

AI Index Report

Jährlicher Bericht mit belegten Zahlen zu Modellen, Kosten, Einsatz und Regulierung. Nützlich, wenn eine Aussage eine Quelle braucht statt eines Eindrucks.

Wenn eine Aussage eine Quelle braucht statt eines Eindrucks.

Stanford HAIZum Angebot
War diese Seite hilfreich?
Was KI heute leistet