KI‑Kompass
Kompass

Spracherkennung

Von der Schallwelle zum Text: Merkmalsextraktion, moderne Modelle, Wortfehlerrate und die Frage, was in einem Protokoll stehen darf.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Ein Mikrofon liefert eine Zahlenreihe: den Luftdruck, sechzehntausendmal je Sekunde gemessen. Damit kann ein Modell wenig anfangen. Deshalb wird daraus zuerst ein Bild gemacht: die Zeit auf der einen Achse, die Tonhöhe auf der anderen, die Lautstärke als Helligkeit.

Auf diesem Bild arbeitet dann ein Modell, ähnlich wie bei der Bilderkennung.

Was die Genauigkeit bestimmt

FaktorWirkung
Mikrofonabstandsehr groß
Störgeräuschesehr groß
Nachhall im Raumgroß
Mehrere gleichzeitig Sprechendegroß
Dialekt und Akzentgroß
Fachbegriffe und Eigennamenmittel, mit Wörterbuch behebbar
Modellwahlmittel

Die Reihenfolge ist bemerkenswert: Ein besseres Mikrofon bringt fast immer mehr als ein besseres Modell.

Die Kette

  1. 01

    Vorverarbeiten

    Auf 16 kHz bringen, in Mono wandeln, Pegel normalisieren.

  2. 02

    Merkmale bilden

    Kurzzeit-Fouriertransformation, dann Umrechnung auf die Mel-Skala.

  3. 03

    Erkennen

    Ein Encoder-Decoder-Modell erzeugt daraus Text, meist in Abschnitten von 30 Sekunden.

  4. 04

    Nachbearbeiten

    Zeichensetzung, Groß- und Kleinschreibung, Zahlen ausschreiben, Fachbegriffe korrigieren.

  • Ein Wörterbuch mit Eigennamen und Fachbegriffen als Kontext übergeben, wenn das Modell das unterstützt.
  • Lange Aufnahmen an Sprechpausen schneiden, nicht an festen Zeitmarken.
  • Zeitstempel je Wort mitschreiben; sie sind für die spätere Prüfung unverzichtbar.
  • Die Konfidenz je Abschnitt speichern und niedrige Werte zur Nachkontrolle ausleiten.

Die Kennzahl

Wortfehlerrate

WER = (S + D + I) / N

Die Summe aller drei Fehlerarten, geteilt durch die Wortzahl der richtigen Fassung; sie kann größer als eins werden.

S
Ersetzungen
D
Auslassungen
I
Einfügungen
N
Anzahl der Wörter in der Referenz

Für die Praxis ist die reine Wortfehlerrate oft irreführend. Ein Protokoll mit 5 Prozent WER kann unbrauchbar sein, wenn die Fehler auf Zahlen und Eigennamen fallen. Deshalb wird zusätzlich eine Entitätsfehlerrate erhoben: Anteil der falsch erkannten Namen, Beträge und Termine.

Mel-Spektrogramm

Mel-Skala

m = 2595 · log₁₀( 1 + f / 700 )

Die Skala bildet ab, dass das Ohr Unterschiede bei tiefen Tönen feiner auflöst als bei hohen.

f
Frequenz in Hertz
m
wahrgenommene Tonhöhe in Mel

Übliche Parameter: Fensterlänge 25 ms, Verschiebung 10 ms, 80 Mel-Bänder. Daraus ergeben sich 100 Merkmalsvektoren je Sekunde: eine Datenreduktion um etwa den Faktor 160 gegenüber der Wellenform bei 16 kHz.

Der datenschutzrechtliche Rahmen

Eine Sprachaufnahme enthält mehr als Worte: Stimme ist ein biometrisches Merkmal, sobald sie zur Identifikation verwendet wird.

  • Die Aufnahme, die Transkription und eine etwaige Sprecheridentifikation sind drei getrennte Verarbeitungen mit je eigener Rechtsgrundlage.
  • Alle Beteiligten sind vor der Aufnahme zu informieren, nicht danach.
  • Im Beschäftigungskontext sind Mitbestimmungsrechte regelmäßig berührt.
  • Emotionserkennung aus der Stimme am Arbeitsplatz ist nach AI Act verboten.
  • Löschfristen für Aufnahme und Transkription getrennt festlegen; meist kann die Aufnahme deutlich früher gelöscht werden.

Siehe Datenschutz-Grundlagen und Risikoklassen.

Passende Kurse und Quellen

KursKostenlos1200 Min.EN

Hugging Face Audio-Kurs

Vom Signal über Spektrogramme bis zu Erkennung und Synthese, durchgehend mit Code. Die praktische Ergänzung zu den Artikeln über Sprache und Audio.

Für alle, die Sprachtechnik selbst bauen wollen; setzt Python und etwas Signalwissen voraus.

Hugging FaceZum Angebot
StudieKostenlosEN

Robust Speech Recognition

Spracherkennung, die mit Störgeräuschen, Akzenten und Sprachwechsel umgeht. Der Stand, an dem sich Diktatlösungen messen lassen.

Für alle, die Diktat oder Transkription einführen und einen Maßstab brauchen.

BuchKostenlosEN

Speech and Language Processing

Jurafsky und Martin, das Standardwerk der Sprachverarbeitung, kapitelweise frei. Deckt klassische Verfahren und Sprachmodelle in einem Bogen ab.

Für alle, die Sprachverarbeitung systematisch lernen wollen, klassisch und modern in einem Bogen.

War diese Seite hilfreich?
Spracherkennung