KI‑Kompass
Kompass

Embeddings

Bedeutung als Richtung im Raum: wie aus Wörtern, Sätzen und Bildern Vektoren werden, wofür man sie benutzt und wo die Ähnlichkeit trügt.

·2 Min. Lesezeit·Von Fachredaktion Technik
DETAILGRAD
3 Abschnitte

Die Idee

Jedes Wort, jeder Satz, jedes Bild bekommt einen Punkt in einem Raum mit hunderten Dimensionen. Dinge, die einander ähneln, liegen nahe beieinander. Damit wird die Frage „was ist ähnlich?" zu einer Abstandsmessung.

Wozu es gut ist

  • Suche ohne exakte Stichwörter.
  • Doppelte Einträge finden.
  • Texte gruppieren und sortieren.
  • Grundlage jeder RAG-Anwendung.

Die Arten

ArtWas eingebettet wirdBeispielverwendung
WortembeddingEin Wort, unabhängig vom SatzKlassische Textanalyse
KontextembeddingEin Token im SatzzusammenhangInnerhalb eines Sprachmodells
Satz- oder AbsatzembeddingEin ganzer TextabschnittSuche, RAG, Gruppierung
BildembeddingEin BildBildsuche, Duplikaterkennung
Gemeinsames Bild-Text-EmbeddingBeides im selben RaumSuche über Modalitäten hinweg
import numpy as np

def normieren(v):
    # Nach dem Normieren ist das Skalarprodukt gleich der Kosinusaehnlichkeit.
    return v / np.linalg.norm(v, axis=-1, keepdims=True)

E = normieren(np.random.default_rng(0).normal(size=(5, 384)))
frage = normieren(np.random.default_rng(1).normal(size=(384,)))
scores = E @ frage
print(np.argsort(scores)[::-1][:3], np.sort(scores)[::-1][:3].round(3))
  • Immer normieren, bevor gespeichert oder verglichen wird.
  • Denselben Präfix verwenden, den das Modell im Training benutzt hat; viele Modelle unterscheiden zwischen Frage- und Dokumentembeddings.
  • Die Modellversion mitspeichern. Ein Modellwechsel macht den gesamten Index ungültig.

Wie sie trainiert werden

Kontrastiver Verlust

L = − log( exp(q·d⁺/τ) / ( exp(q·d⁺/τ) + Σⱼ exp(q·d⁻ⱼ/τ) ) )

Die Ähnlichkeit zum richtigen Dokument soll groß sein, die zu allen anderen im Batch klein.

q
der Anfragevektor
d⁺
das passende Dokument
d⁻ⱼ
nicht passende Dokumente aus demselben Batch
τ
Temperatur, meist 0,02 bis 0,07

Die Qualität hängt stark davon ab, wie schwer die Gegenbeispiele sind. Zufällige Gegenbeispiele sind zu leicht: Ein Modell lernt daraus nur, Themen grob zu trennen. Der eigentliche Hebel sind harte Gegenbeispiele: Dokumente, die ähnlich aussehen und trotzdem falsch sind.

Die Dimension als Kompromiss

DimensionSpeicher je 1 Mio. (float32)Typische Güte
3841,5 GBFür die meisten Anwendungen ausreichend
7683,1 GBEtwas besser, üblicher Standard
1.5366,1 GBSelten messbar besser
3.07212,3 GBNur bei sehr großen, heterogenen Beständen

Verfahren mit gestaffelter Darstellung erlauben, einen langen Vektor an einer beliebigen Stelle abzuschneiden und dabei den größten Teil der Güte zu behalten. Damit lässt sich zweistufig suchen: grob mit 128 Dimensionen über den ganzen Bestand, fein mit 768 über die besten Tausend.

Der datenschutzrechtliche Punkt

Ein Embedding ist keine Anonymisierung. Zwei Angriffe sind praktisch durchführbar:

  • Inversion. Aus einem Satzembedding lässt sich der Ausgangstext näherungsweise rekonstruieren, bei kurzen Texten oft nahezu wörtlich.
  • Zugehörigkeit. Aus der Nähe zu einem bekannten Vektor lässt sich ableiten, ob ein bestimmtes Dokument im Bestand ist.

Für die Praxis folgt daraus: Der Vektorindex unterliegt denselben Schutzpflichten wie der Ausgangsbestand, einschließlich Löschung und Auskunft. Siehe Vektordatenbanken.

Passende Kurse und Quellen

StudieKostenlosEN

Efficient Estimation of Word Representations

Die Arbeit, die Wörter erstmals als Vektoren mit rechenbarer Bedeutung etablierte. Der Ursprung aller Einbettungen.

Der Ursprung aller Einbettungen; kurz und bis heute erhellend.

VideoKostenlos180 Min.EN

Essence of Linear Algebra

Fünfzehn kurze Filme, die zeigen, was eine Matrix mit dem Raum macht. Wer Vektoren bisher nur als Zahlenlisten kannte, sieht danach etwas anderes.

Für alle, die Vektoren bisher nur als Zahlenlisten kannten und eine Anschauung brauchen.

3Blue1BrownZum Angebot
StudieKostenlosEN

Learning Transferable Visual Models

Bilder und Texte in einem gemeinsamen Raum. Die Grundlage der Suche nach Bildern per Beschreibung und der Bildgenerierung.

Für das Verständnis von Bildsuche über Beschreibungen und von Bildgenerierung.

StudieKostenlosEN

Retrieval-Augmented Generation

Die Arbeit, die Abruf und Erzeugung verbunden hat. Der Ursprung des Musters, mit dem eigene Dokumente belegbar nutzbar werden.

Für alle, die eigene Dokumente nutzbar machen wollen; der Ursprung des Musters.

War diese Seite hilfreich?
Embeddings