Ableitung
MATHEMATIKDie Ableitung ist eine rein lokale Auskunft. Sie sagt, was ein winziger Schritt bewirkt, nicht wohin der Weg führt.
Siehe auch: Gradient, Kettenregel
Ausführlich im ArtikelNACHSCHLAGEN
Kurze Erklärungen zu allen Begriffen, die in diesem Wiki vorkommen. Jeder Eintrag verlinkt den Artikel, der ausführlich darauf eingeht.
Die Ableitung ist eine rein lokale Auskunft. Sie sagt, was ein winziger Schritt bewirkt, nicht wohin der Weg führt.
Siehe auch: Gradient, Kettenregel
Ausführlich im ArtikelAdam hält je Parameter zwei zusätzliche Zustände. Bei sieben Milliarden Parametern sind das 56 Gigabyte allein für den Optimierer.
Ausführlich im ArtikelEin Agent ist eine Schleife: denken, Werkzeug aufrufen, Ergebnis lesen, wiederholen. Die Zuverlässigkeit fällt exponentiell mit der Anzahl der Schritte.
Siehe auch: Werkzeugaufruf, Prompt Injection
Ausführlich im ArtikelEs erreicht dieselbe Güte mit 30 bis 60 Prozent der Annotationen, macht den Datensatz aber unbrauchbar als Testsatz.
Siehe auch: Annotation, Testsatz
Ausführlich im ArtikelAlignment bringt Vorlieben bei, nicht Wissen und nicht Wahrheit. Die Bewertungsanweisung an die Bewertenden ist die eigentliche Spezifikation des Verhaltens.
Ausführlich im ArtikelWer ein fremdes Modell wesentlich verändert oder unter eigenem Namen anbietet, kann dadurch selbst zum Anbieter werden.
Siehe auch: Betreiber, EU AI Act
Ausführlich im ArtikelVon wenigen Sekunden je Fall bei einer Klassifikation bis zu einer Viertelstunde bei Segmentierung. Der Faktor dazwischen ist rund 200.
Siehe auch: Label, Cohens Kappa
Ausführlich im ArtikelPseudonymisierung ist keine Anonymisierung: pseudonymisierte Daten bleiben personenbezogen und unterliegen weiter der DSGVO.
Siehe auch: Pseudonymisierung, Differenzielle Privatheit
Ausführlich im ArtikelJedes Token fragt mit seiner Query bei allen Keys nach und mischt die Values entsprechend. Der Aufwand wächst quadratisch mit der Länge.
Siehe auch: Transformer, KV-Cache
Ausführlich im ArtikelSie braucht einen Vertrag mit den Pflichtangaben aus Art. 28 Abs. 3, einschließlich Unterauftragnehmern, Löschung und Auditrechten.
Siehe auch: DSGVO, Datenresidenz
Ausführlich im ArtikelNach Art. 22 DSGVO bestehen dann Ansprüche auf menschliches Eingreifen, Darlegung des Standpunkts und Anfechtung.
Siehe auch: Menschliche Aufsicht, DSGVO
Ausführlich im ArtikelDer Rückwärtsdurchlauf kostet etwa das Doppelte des Vorwärtsdurchlaufs, braucht aber ein Vielfaches an Speicher für Zwischenwerte.
Siehe auch: Kettenregel, Gradient
Ausführlich im ArtikelEin Basismodell ist kein Assistent. Erst das Fine-Tuning auf Anweisungen und das Alignment machen daraus ein System, das antwortet statt fortzusetzen.
Siehe auch: Fine-Tuning, Alignment
Ausführlich im ArtikelDie Basisrate zu ignorieren ist der häufigste Fehler bei der Bewertung von KI-Ergebnissen. Bei seltenen Ereignissen entscheidet sie alles.
Siehe auch: Satz von Bayes, Präzision
Ausführlich im ArtikelKontinuierliches Batching nimmt eine neue Anfrage auf, sobald eine fertig ist, und erhöht den Durchsatz oft um den Faktor fünf bis zwanzig.
Ausführlich im ArtikelUnterschiede unter drei Prozentpunkten auf einem allgemeinen Benchmark sind für eine Entscheidung wertlos.
Siehe auch: Kontamination, Eval-Set
Ausführlich im ArtikelSie geht über den Datenschutz hinaus: Ein Auftragsverarbeitungsvertrag allein genügt nicht, der Dienstleister muss verpflichtet und belehrt sein.
Siehe auch: Auftragsverarbeitung, DSGVO
Ausführlich im ArtikelBetreiberpflichten sind schlanker als Anbieterpflichten, aber sie bestehen: menschliche Aufsicht, Information, Protokollierung, geeignete Eingabedaten.
Siehe auch: Anbieter, Menschliche Aufsicht
Ausführlich im ArtikelEin geschütztes Merkmal wegzulassen beseitigt die Verzerrung nicht, sondern nur ihre Messbarkeit.
Siehe auch: Fairness, Repräsentativität
Ausführlich im ArtikelDie Gegenmittel sind gegenläufig. Wer die falsche Diagnose stellt, macht es schlimmer statt besser.
Siehe auch: Varianz, Overfitting
Ausführlich im ArtikelAuch der aus einem Gesicht erzeugte Vektor ist ein biometrisches Datum, selbst wenn das Bild gelöscht wurde.
Siehe auch: Embedding, Hochrisiko
Ausführlich im ArtikelBM25 sättigt die Worthäufigkeit: das zwanzigste Vorkommen trägt kaum mehr bei als das zehnte. Das entspricht der Wirklichkeit.
Siehe auch: Hybridsuche
Ausführlich im ArtikelDer Hystereseschritt verbindet unterbrochene Linien und unterdrückt gleichzeitig isolierte Störpunkte.
Ausführlich im ArtikelDas Chunking entscheidet über die Güte eines RAG-Systems mehr als die Wahl des Modells. Getrennt wird an Überschriften, nicht nach Zeichenzahl.
Ausführlich im ArtikelDamit lässt sich ein Bild mit einem Satz vergleichen, ohne dass für diese Klasse je trainiert wurde.
Siehe auch: Embedding, Vision Transformer
Ausführlich im ArtikelEin CNN bringt zwei Annahmen mit, die für Bilder zutreffen: Nachbarschaft zählt, und ein Muster bedeutet überall dasselbe.
Siehe auch: Faltung, Vision Transformer
Ausführlich im ArtikelUnter 0,6 heißt: die Anleitung ist unklar. Ein Modell kann in einer solchen Aufgabe keine hohe Genauigkeit erreichen.
Siehe auch: Annotation, Label
Ausführlich im ArtikelSie ist Pflichtdokument, nicht Kür: Für Hochrisikosysteme verlangt der AI Act genau diese Angaben.
Siehe auch: Repräsentativität, Hochrisiko
Ausführlich im ArtikelIn den meisten Projekten bringt Datenbereinigung mehr als ein Modellwechsel, und sie wirkt auf jedes künftige Modell weiter.
Siehe auch: Duplikat, Cohens Kappa
Ausführlich im ArtikelDer Serverstandort allein genügt nicht: entscheidend ist auch, ob ein Mutterkonzern aus einem Drittland Zugriff nehmen kann.
Siehe auch: Auftragsverarbeitung, Drittlandtransfer
Ausführlich im ArtikelSie ist bei umfangreicher Verarbeitung besonderer Kategorien, systematischer Überwachung und Profilbildung mit erheblicher Wirkung erforderlich.
Siehe auch: Hochrisiko, Grundrechte-Folgenabschätzung
Ausführlich im ArtikelEin guter Deskriptor bleibt bei Drehung und Helligkeitsänderung gleich und macht so eine Zuordnung über Bilder hinweg möglich.
Siehe auch: Homographie, RANSAC
Ausführlich im ArtikelDice und IoU erzeugen dieselbe Ordnung und sind ineinander überführbar, aber ihre Werte sind nicht vergleichbar.
Siehe auch: Segmentierung, IoU
Ausführlich im ArtikelNur mit einer solchen Garantie und einem dokumentierten Budget lässt sich Anonymität gegenüber einer Aufsichtsbehörde begründen.
Siehe auch: Synthetische Daten, Anonymisierung
Ausführlich im ArtikelAnders als ein Transformer arbeitet es nicht sequenziell, sondern verfeinert das gesamte Ergebnis in jedem Schritt.
Siehe auch: Transformer
Ausführlich im ArtikelDer Tiefenfehler wächst mit dem Quadrat der Entfernung: ein System mit einem Zentimeter Genauigkeit auf zwei Metern liegt auf zehn Metern 25 Zentimeter daneben.
Siehe auch: Kalibrierung
Ausführlich im ArtikelDistillation senkt Kosten und Latenz erheblich und kostet messbar Qualität. Wie viel, hängt von der Aufgabe ab und muss gegen ein eigenes Eval-Set gemessen werden.
Siehe auch: Inferenz
Ausführlich im ArtikelDa sich die optimale Policy geschlossen durch das Belohnungsmodell ausdrücken lässt, fällt dieses aus der Rechnung heraus. Übrig bleibt stabiles überwachtes Training.
Ausführlich im ArtikelDer häufigste Ausfall ist kein Absturz, sondern stille Verschlechterung. Ohne Messung fällt sie erst nach Wochen auf.
Siehe auch: Population Stability Index, Modellregister
Ausführlich im ArtikelSie braucht eine eigene Grundlage: Angemessenheitsbeschluss, Standardvertragsklauseln mit Folgenabschätzung oder eine Ausnahme.
Siehe auch: Datenresidenz, Auftragsverarbeitung
Ausführlich im ArtikelBeim Vortraining großer Modelle hilft es meist nicht, weil die Daten ohnehin nur einmal gesehen werden. Beim Fine-Tuning sehr wohl.
Siehe auch: Regularisierung
Ausführlich im ArtikelDer AI Act ersetzt die DSGVO nicht. Beide gelten nebeneinander, mit unterschiedlichen Auslösern und unterschiedlichen Pflichten.
Siehe auch: Rechtsgrundlage, Zweckbindung
Ausführlich im ArtikelDuplikate sind die häufigste stille Fehlerquelle: derselbe Fall kann in Training und Test landen.
Ausführlich im ArtikelLatenz und Durchsatz stehen im Zielkonflikt: Batching erhöht den Durchsatz und verlangsamt die einzelne Anfrage.
Ausführlich im ArtikelAuf dem Gerät zu rechnen ist zuerst ein rechtlicher Vorteil und erst danach ein technischer.
Siehe auch: Quantisierung, Datenresidenz
Ausführlich im ArtikelEin Embedding ist kein anonymisiertes Datum: Aus einem Satzembedding lässt sich der Ausgangstext teilweise rekonstruieren.
Siehe auch: Vektor, Kosinusähnlichkeit, Vektordatenbank
Ausführlich im ArtikelÜbersetzung und Spracherkennung nutzen ihn, weil dort die ganze Eingabe vorliegt, bevor die Ausgabe beginnt. Sprachmodelle nutzen dagegen meist nur den Decoder, weil sie fortlaufend weiterschreiben.
Siehe auch: Transformer, Attention, Embedding
Ausführlich im ArtikelEin Würfel hat mehr Entropie als eine Münze, weil mehr passieren kann. Bei Modellen zeigt hohe Ausgabeentropie an, dass geraten wird.
Siehe auch: Kreuzentropie, Perplexität
Ausführlich im ArtikelEntzerrung hebt die OCR-Trefferquote bei Handyfotos typischerweise von unter 60 auf über 90 Prozent.
Siehe auch: OCR, Homographie
Ausführlich im ArtikelDer AI Act reguliert nicht Technik, sondern Verwendung. Dasselbe Modell kann je nach Zweck unbedenklich oder hochriskant sein.
Siehe auch: Hochrisiko, Anbieter, Betreiber
Ausführlich im ArtikelFünfzig eigene Fälle sind aussagekräftiger als jede fremde Rangliste. Das Eval-Set wird versioniert und eingefroren.
Siehe auch: Benchmark, Kreuzvalidierung
Ausführlich im ArtikelF1 gewichtet beide gleich. Das sind sie praktisch nie: Kosten je Fehlerart gehören in die Kennzahl, nicht in eine Fußnote.
Ausführlich im ArtikelMehrere gängige Fairnesskriterien sind nachweislich nicht gleichzeitig erfüllbar. Die Wahl ist normativ und begründungspflichtig.
Siehe auch: Bias
Ausführlich im ArtikelJe nachdem welche Zahlen in der Matrix stehen, zeichnet das Ergebnis Kanten nach, zeichnet weich oder hebt Muster hervor.
Ausführlich im ArtikelDer Farbraum ist eine Entscheidung, keine Eigenschaft des Bildes. Für Farbfilter ist HSV fast immer richtig.
Siehe auch: Pixel
Ausführlich im ArtikelFine-Tuning bringt Form bei, nicht Wissen. Für Wissen ist Abruf billiger, aktueller und belegbar.
Ausführlich im ArtikelDer Speicherbedarf sinkt von quadratisch auf linear in der Sequenzlänge. Ohne das wären Kontexte über 8.000 Token nicht bezahlbar.
Siehe auch: Attention, KV-Cache
Ausführlich im ArtikelOhne Freigabeprozess entsteht Schatten-KI: Werkzeuge im Einsatz, von denen niemand weiß und für die niemand verantwortlich ist.
Siehe auch: Nachweis, KI-Inventar
Ausführlich im Artikelfloat16 läuft bei 65.504 über, bfloat16 nicht. Deshalb hat sich bfloat16 fürs Training durchgesetzt.
Siehe auch: Quantisierung
Ausführlich im ArtikelBeim Kauf entscheidet der Speicher zuerst, die Bandbreite zweitens und die Rechenleistung erst drittens.
Siehe auch: VRAM, Speicherbandbreite
Ausführlich im ArtikelLernen heißt: alle Parameter ein Stück entgegen dem Gradienten verschieben und das millionenfach wiederholen.
Siehe auch: Ableitung, Lernrate
Ausführlich im ArtikelGrounding ist der wirksamste Hebel gegen erfundene Angaben. Es besteht aus Abruf, Zitierpflicht und einer Nachprüfung, ob die Aussagen tatsächlich gedeckt sind.
Siehe auch: RAG, Halluzination
Ausführlich im ArtikelBei 32 Query-Heads und 8 Key-Value-Köpfen ist der KV-Cache ein Viertel so groß, bei kaum messbarem Qualitätsverlust.
Siehe auch: KV-Cache, Attention
Ausführlich im ArtikelSie tritt neben die Datenschutz-Folgenabschätzung und ersetzt sie nicht; die Prüfgegenstände überschneiden sich nur teilweise.
Siehe auch: Hochrisiko, Datenschutz-Folgenabschätzung
Ausführlich im ArtikelEin Sprachmodell erzeugt die wahrscheinlichste Fortsetzung. Wo keine Information vorliegt, entsteht trotzdem eine plausible, und Plausibilität ist nicht Wahrheit.
Siehe auch: Grounding, Temperatur
Ausführlich im ArtikelDas Histogramm verrät Belichtungsprobleme in einer Sekunde und ist die billigste Qualitätsprüfung, die es gibt.
Siehe auch: Pixel, Otsu-Schwellwert
Ausführlich im ArtikelHNSW findet bei einer Million Vektoren rund 96 Prozent der wirklich nächsten Nachbarn in etwa einer Millisekunde statt in 380.
Siehe auch: Vektordatenbank, Recall
Ausführlich im ArtikelHochrisiko ergibt sich aus Anhang I bei Sicherheitsbauteilen und Anhang III bei benannten Einsatzfeldern wie Beschäftigung und Bildung.
Siehe auch: EU AI Act, Grundrechte-Folgenabschätzung
Ausführlich im ArtikelVier Punktpaare bestimmen sie eindeutig. Sie ist das Werkzeug, mit dem ein schräg fotografiertes Dokument geradegezogen wird.
Siehe auch: Deskriptor, RANSAC
Ausführlich im ArtikelReine Vektorsuche versagt bei Aktenzeichen und Eigennamen. Die Kombination hebt Recall@10 regelmäßig um 5 bis 15 Punkte.
Ausführlich im ArtikelBei der Inferenz ändert sich nichts am Modell. Sie ist deutlich billiger als Training je Vorgang, in Summe über die Lebensdauer aber oft teurer.
Ausführlich im ArtikelIoU ist strenger als es aussieht: zwei sichtbar überlappende Rechtecke können weit unter der üblichen Schwelle von 0,5 liegen.
Siehe auch: mAP, Non-Maximum Suppression
Ausführlich im ArtikelEine Kalibrierung gilt nur für diesen Aufbau. Jede Verschiebung einer Kamera macht sie ungültig.
Siehe auch: Disparität
Ausführlich im ArtikelIn der klassischen Bildverarbeitung wählt ein Mensch die Werte, in einem CNN werden sie gelernt.
Siehe auch: Faltung
Ausführlich im ArtikelAus der Produktform der Kettenregel folgt unmittelbar, warum Gradienten in tiefen Netzen verschwinden oder explodieren.
Siehe auch: Gradient, Backpropagation
Ausführlich im ArtikelOhne Inventar ist keine Pflichtenprüfung möglich, weil unbekannt ist, worauf sie sich beziehen soll.
Siehe auch: Freigabeprozess, Hochrisiko
Ausführlich im ArtikelDie Pflicht trifft Anbieter und Betreiber gleichermaßen und ist an den konkreten Einsatz gebunden, nicht an eine allgemeine Schulung.
Siehe auch: Betreiber, Menschliche Aufsicht
Ausführlich im ArtikelBei RLHF misst sie, wie weit sich ein Modell vom Ausgangszustand entfernt hat, und begrenzt genau das.
Siehe auch: Kreuzentropie, RLHF
Ausführlich im ArtikelEs sagt, wie genau die Messung ist, nicht wie gut das Modell. Eine Genauigkeitsangabe ohne Intervall ist eine Momentaufnahme.
Siehe auch: Standardfehler
Ausführlich im ArtikelEin Modell, das eine bekannte Aufgabe löst und dieselbe Aufgabe mit anderen Zahlen nicht, hat sie nicht verstanden, sondern gesehen.
Siehe auch: Leakage, Benchmark
Ausführlich im ArtikelDas Fenster umfasst Systemanweisung, Verlauf, angehängte Dokumente und die bisherige Antwort. Ein größeres Fenster heißt nicht, dass alles darin gleich gut genutzt wird.
Ausführlich im ArtikelOhne Kontingent bestimmt der aktivste Nutzer die Antwortzeit für alle. Es gehört in die erste Fassung, nicht in die zweite.
Ausführlich im ArtikelKonturen erlauben Zählen, Vermessen und Formprüfung, ganz ohne trainiertes Modell.
Siehe auch: Canny, Morphologie
Ausführlich im ArtikelZwei Texte über dasselbe Thema zeigen in dieselbe Richtung, auch wenn einer zehnmal länger ist.
Siehe auch: Skalarprodukt, Embedding
Ausführlich im ArtikelDie Kreuzentropie enthält die Entropie der wahren Verteilung als konstanten Sockel; nur der Rest hängt vom Modell ab.
Siehe auch: Entropie, KL-Divergenz, Verlustfunktion
Ausführlich im ArtikelBei mehreren Fällen je Person muss nach Gruppen aufgeteilt werden, sonst steht dieselbe Person in Training und Test.
Ausführlich im ArtikelEin Sammelbegriff, kein einzelnes Verfahren. Im heutigen Sprachgebrauch sind fast immer Systeme gemeint, die aus Daten lernen statt nach aufgeschriebenen Regeln zu arbeiten.
Ausführlich im ArtikelDer Cache wächst linear mit Kontextlänge und Anzahl gleichzeitiger Anfragen und überholt bei langem Kontext das Modell selbst.
Siehe auch: Attention, Kontextfenster
Ausführlich im ArtikelDie Qualität der Labels begrenzt die erreichbare Modellgüte nach oben. Fünf Prozent falsche Labels heißen höchstens 95 Prozent Genauigkeit.
Siehe auch: Annotation, Cohens Kappa
Ausführlich im ArtikelÜber zwei Sekunden bis zum ersten Zeichen wird als Hängen empfunden, unabhängig davon wie schnell es danach geht.
Siehe auch: Durchsatz, Batching
Ausführlich im ArtikelAnders als BatchNorm ist LayerNorm unabhängig von der Batch-Größe und funktioniert deshalb auch bei Batch eins.
Siehe auch: Residualverbindung
Ausführlich im ArtikelLeakage erzeugt hervorragende Messwerte und ein wertloses Modell. Ein Ergebnis, das zu gut ist, ist fast immer ein Leck.
Siehe auch: Kreuzvalidierung, Kontamination
Ausführlich im ArtikelZu klein heißt: das Training kriecht. Zu groß heißt: der Verlust explodiert innerhalb weniger Schritte.
Ausführlich im ArtikelDie Temperatur teilt die Logits, bevor daraus Wahrscheinlichkeiten werden. Deshalb wirkt sie auf die Schärfe der Verteilung.
Siehe auch: Softmax, Temperatur
Ausführlich im ArtikelDer Speicherbedarf sinkt um den Faktor fünf bis zehn, und das Ergebnis ist eine Datei von wenigen zehn Megabyte.
Siehe auch: Fine-Tuning, Adam
Ausführlich im ArtikelAufbewahrungspflicht und Löschpflicht kollidieren regelmäßig. Beide gehören je Datenkategorie getrennt festgelegt.
Siehe auch: Zweckbindung, Auftragsverarbeitung
Ausführlich im ArtikelmAP bei 0,5 bis 0,95 ist strenger als mAP bei 0,5 und deshalb der übliche Vergleichswert.
Ausführlich im ArtikelEine 4096 mal 4096 Matrix hat 16,8 Millionen Einträge und belegt in 16-Bit-Darstellung rund 33 Megabyte.
Ausführlich im ArtikelDie Erzeugung eines einzelnen Tokens ist memory-bound. Batching ist der Weg, das zu ändern.
Siehe auch: Speicherbandbreite, Batching
Ausführlich im ArtikelAufsicht ist kein Hinweis in einer Richtlinie. Sie braucht Befugnis, Zeit, Kompetenz und einen Weg, tatsächlich einzugreifen.
Siehe auch: Betreiber, Hochrisiko
Ausführlich im ArtikelDas spart Rechenzeit, nicht Speicher: alle Experten müssen im Speicher liegen. Für Edge-Geräte ist die Bauform deshalb ungeeignet.
Siehe auch: Parameter, Quantisierung
Ausführlich im ArtikelEin Modell ist kein Programm im üblichen Sinn. Es besteht aus einer Architektur und den darin abgelegten Parametern, die im Training entstanden sind.
Siehe auch: Parameter, Training
Ausführlich im ArtikelOhne Register lässt sich weder ein Rollback durchführen noch belegen, welcher Stand eine bestimmte Ausgabe erzeugt hat.
Ausführlich im ArtikelMomentum hilft, flache Plateaus und Sattelpunkte zu verlassen, die in hohen Dimensionen viel häufiger sind als lokale Minima.
Ausführlich im ArtikelMorphologie repariert, was der Schwellwert kaputt gemacht hat: Löcher schließen, Fransen entfernen, Verbindungen trennen.
Siehe auch: Otsu-Schwellwert
Ausführlich im ArtikelBilder werden in Token übersetzt und wie Text in den Kontext gelegt. Ein Bild kann dabei mehr Token kosten als eine Seite Text.
Ausführlich im ArtikelNachweis entsteht nicht rückwirkend. Was nicht im Betrieb protokolliert wurde, lässt sich später nicht belegen.
Siehe auch: Protokollierung, Modellregister
Ausführlich im ArtikelDie NMS-Schwelle entscheidet über die gezählte Anzahl und gehört deshalb in die Betriebsdokumentation.
Siehe auch: IoU
Ausführlich im ArtikelDie Norm herauszurechnen ist der Unterschied zwischen wie ähnlich und wie ähnlich und wie lang.
Siehe auch: Vektor
Ausführlich im ArtikelFehler zeigen sich als Doppelzählung: eine unterbrochene Spur wird zu zwei Objekten.
Siehe auch: Optischer Fluss, Non-Maximum Suppression
Ausführlich im ArtikelBei 98 Prozent Zeichengenauigkeit ist eine 22-stellige IBAN nur in 64 Prozent der Fälle vollständig richtig.
Siehe auch: Entzerrung
Ausführlich im ArtikelOpen Weights ist nicht dasselbe wie Open Source: Trainingsdaten und Trainingscode fehlen meist, und die Lizenz kann die Nutzung einschränken.
Siehe auch: Modell
Ausführlich im ArtikelAus einem einzelnen Punkt lässt sich nur die Bewegung quer zur Kante bestimmen. Das nennt man Aperturproblem.
Siehe auch: Objektverfolgung
Ausführlich im ArtikelOtsu funktioniert gut, wenn das Histogramm zwei erkennbare Berge hat, und wählt sonst einen willkürlichen Punkt.
Siehe auch: Histogramm, Morphologie
Ausführlich im ArtikelErkennbar daran, dass der Trainingsverlust fällt, während der Validierungsverlust steigt.
Siehe auch: Bias und Varianz, Regularisierung
Ausführlich im ArtikelParameter werden im Training angepasst und liegen danach fest. Die Anzahl bestimmt den Speicherbedarf unmittelbar: zwei Byte je Parameter in 16-Bit-Darstellung.
Siehe auch: Modell, Quantisierung
Ausführlich im ArtikelPerplexität 8 heißt: so unsicher wie beim Raten unter acht gleich guten Fortsetzungen. Zwischen Tokenizern ist sie nicht vergleichbar.
Siehe auch: Kreuzentropie, Tokenizer
Ausführlich im ArtikelEin Farbbild ist ein dreidimensionales Zahlenfeld aus Höhe, Breite und Kanälen. Mehr ist es nicht.
Siehe auch: Farbraum, Histogramm
Ausführlich im ArtikelUnter 0,1 gilt als unauffällig, über 0,2 als deutliche Verschiebung, die eine Prüfung auslösen sollte.
Siehe auch: Drift
Ausführlich im ArtikelBei seltenen Ereignissen entscheidet die Präzision über die Brauchbarkeit, nicht die Trefferquote.
Ausführlich im ArtikelPrefill lastet die Karte voll aus und bestimmt die Zeit bis zum ersten Token. Decode danach lastet sie kaum aus.
Ausführlich im ArtikelEin Prompt ist mehr als eine Frage. Er enthält Rolle, Aufgabe, Zusammenhang, Beispiele und Vorgaben zur Form. Die Qualität der Antwort hängt daran stärker als am Modell.
Siehe auch: Kontextfenster, Systemprompt
Ausführlich im ArtikelSobald ein System fremde Inhalte liest, kann darin eine Anweisung an das System stehen. Gelesener Inhalt ist immer Daten und niemals Anweisung.
Siehe auch: Agent, Werkzeugaufruf
Ausführlich im ArtikelOhne Bibliothek erfindet jede Person ihre eigenen Prompts neu, und niemand weiß, welche Fassung wo im Einsatz ist. Sie gehört versioniert wie Code.
Siehe auch: Prompt, Systemprompt
Ausführlich im ArtikelDer unveränderliche Teil muss ganz an den Anfang, sonst greift der Cache nicht. Ersparnis in der Praxis 30 bis 60 Prozent der Eingabekosten.
Siehe auch: KV-Cache, Kontextfenster
Ausführlich im ArtikelEin vollständiges Protokoll aller Eingaben ist verlockend und regelmäßig eine eigene Verarbeitung mit eigener Rechtsgrundlage.
Siehe auch: Nachweis, Löschfrist
Ausführlich im ArtikelEine Pseudonymisierung vor dem Modellaufruf ist der wirksamste einzelne Hebel zur Risikosenkung und meist ohne Nachteil möglich.
Siehe auch: Anonymisierung, Zweckbindung
Ausführlich im ArtikelEin PUE von 1,3 bedeutet 30 Prozent Aufschlag für Kühlung und Verluste. Er gehört in jede Verbrauchsangabe.
Siehe auch: Edge
Ausführlich im Artikelint8 kostet meist unter einem Prozent Qualität, int4 ein bis drei. Bei Rechenaufgaben ist der Verlust überproportional.
Siehe auch: Gleitkomma, VRAM
Ausführlich im ArtikelDer praktische Gewinn ist nicht bessere Sprache, sondern die Möglichkeit, eine Quelle zu nennen und sie nachprüfen zu lassen.
Siehe auch: Grounding, Vektordatenbank, Chunking
Ausführlich im ArtikelOhne RANSAC verdirbt ein einziger Fehltreffer die berechnete Transformation vollständig.
Siehe auch: Homographie, Deskriptor
Ausführlich im ArtikelBei einer Vektorsuche misst Recall, wie viele der wirklich nächsten Nachbarn eine Näherungssuche gefunden hat.
Siehe auch: Präzision, F1-Wert
Ausführlich im ArtikelOhne Rechtsgrundlage ist eine Verarbeitung unzulässig, unabhängig davon wie nützlich sie ist. Einwilligung ist im Beschäftigungsverhältnis angreifbar.
Siehe auch: DSGVO, Zweckbindung
Ausführlich im ArtikelDer wirksamste Regularisierer sind mehr und vielfältigere Daten. Jede algorithmische Maßnahme ist ein Ersatz dafür.
Siehe auch: Overfitting, Dropout
Ausführlich im ArtikelAbweichungen sind normal, unbemerkte Abweichungen sind das Problem. Art. 10 AI Act verlangt für Hochrisikosysteme eine Prüfung.
Siehe auch: Stichprobe, Bias
Ausführlich im ArtikelSobald der Abruf mehr als zehn Kandidaten liefert, hebt ein Cross-Encoder auf 50 Kandidaten die Präzision deutlich.
Ausführlich im ArtikelOhne Residuen muss jede Schicht ihre Ausgabe neu erzeugen. Mit ihnen muss sie nur sagen, was sie ändern will.
Siehe auch: Transformer, Layer Normalization
Ausführlich im ArtikelMenschen wählen zwischen zwei Antworten, daraus entsteht ein Belohnungsmodell, und die Policy wird dagegen optimiert. DPO erreicht Ähnliches ohne diesen Umweg.
Ausführlich im ArtikelBei sehr ungleichen Klassen wirkt ROC-AUC optimistisch; die Precision-Recall-Kurve ist dann aussagekräftiger.
Ausführlich im ArtikelEin ungeprobter Rollback dauert im Ernstfall erfahrungsgemäß dreimal so lange wie geschätzt.
Siehe auch: Modellregister
Ausführlich im ArtikelLiegt die arithmetische Intensität unter dem Verhältnis von Spitzenleistung zu Bandbreite, hilft mehr Rechenleistung nicht.
Siehe auch: Speicherbandbreite
Ausführlich im ArtikelWeil RoPE relative Abstände kodiert, lässt sich der Kontext nachträglich durch Streckung der Frequenzen verlängern.
Siehe auch: Transformer, Kontextfenster
Ausführlich im ArtikelWie oft ein Test anschlägt wenn jemand betroffen ist, hat wenig damit zu tun, wie wahrscheinlich Betroffenheit ist wenn der Test anschlägt.
Siehe auch: Basisrate
Ausführlich im ArtikelDer Schattenbetrieb ist die einzige Möglichkeit, eine neue Version an echtem Verkehr zu messen, bevor sie Wirkung entfaltet.
Siehe auch: Rollback, Modellregister
Ausführlich im ArtikelSegmentierung kostet in der Annotation ein Vielfaches der Objekterkennung und ist meist der Engpass eines Vorhabens.
Siehe auch: Dice-Koeffizient, IoU
Ausführlich im ArtikelDas Skalarprodukt ist der Grund, warum Ähnlichkeitssuche und Attention überhaupt funktionieren.
Siehe auch: Kosinusähnlichkeit, Vektor
Ausführlich im ArtikelEr machte aus einer Forschungsfrage eine Investitionsentscheidung: die Wirkung von zehnfachem Aufwand lässt sich abschätzen, ohne zu bauen.
Siehe auch: Training, Parameter
Ausführlich im ArtikelAus beiden Richtungsableitungen ergeben sich Betrag und Richtung der Kante wie bei einem Vektor.
Ausführlich im ArtikelSoftmax wird nie ohne Abzug des Maximums gerechnet, sonst läuft der Exponent über und das Ergebnis wird NaN.
Siehe auch: Temperatur, Logit
Ausführlich im ArtikelDas Verfahren ist verlustfrei: die Ausgabeverteilung bleibt exakt die des großen Modells.
Siehe auch: Batching, Distillation
Ausführlich im ArtikelBei einer einzelnen Anfrage begrenzt die Bandbreite, nicht die Rechenleistung: das Rechenwerk ist zu über 99 Prozent unbeschäftigt.
Siehe auch: VRAM, Roofline-Modell
Ausführlich im ArtikelUm die Messgenauigkeit zu verdoppeln, braucht man die vierfache Datenmenge. Das ist die betriebswirtschaftlich wichtigste Zahl der Statistik.
Siehe auch: Varianz, Konfidenzintervall
Ausführlich im ArtikelGezielt gesammelte schwierige Fälle verbessern das Training und machen einen Testsatz unbrauchbar.
Siehe auch: Testsatz, Repräsentativität
Ausführlich im ArtikelSie ersetzen keinen Testsatz. Bewertet wird immer gegen echte Daten, und Anonymität ist ohne formale Garantie nicht belegbar.
Siehe auch: Differenzielle Privatheit, Datenkarte
Ausführlich im ArtikelDer Systemprompt legt Verhalten, Ton und Grenzen fest und ist für die nutzende Person meist nicht sichtbar. Er gehört versioniert und dokumentiert.
Siehe auch: Prompt
Ausführlich im ArtikelBei null wird immer der wahrscheinlichste Token gewählt. Eine hohe Temperatur erzeugt keine Kreativität, sondern Streuung.
Ausführlich im ArtikelSie greifen nur bei passenden Formaten und Dimensionen. Eine Breite von 4095 statt 4096 kostet spürbar Leistung.
Siehe auch: GPU, Gleitkomma
Ausführlich im ArtikelSobald der Testsatz mehrfach zur Auswahl zwischen Varianten dient, ist er ein zweiter Validierungssatz und seine Zahl zu optimistisch.
Siehe auch: Kreuzvalidierung, Eval-Set
Ausführlich im ArtikelRechtmäßiger Zugang ist Voraussetzung. Außerhalb der Forschung greift die Schranke nur, wenn kein maschinenlesbarer Vorbehalt erklärt ist.
Siehe auch: Urheberrecht
Ausführlich im ArtikelKosten, Kontextlänge und Perplexität werden in Token gemessen. Deutsch braucht für denselben Inhalt rund 20 bis 40 Prozent mehr Token als Englisch.
Siehe auch: Kontextfenster, Tokenizer
Ausführlich im ArtikelEin Modell ist untrennbar an seinen Tokenizer gebunden. Zwei Modelle mit verschiedenen Vokabularen haben keine vergleichbaren Perplexitätswerte.
Siehe auch: Token
Ausführlich im ArtikelDeutsch braucht für denselben Inhalt rund 20 bis 40 Prozent mehr Token und kostet damit entsprechend mehr.
Siehe auch: Token, Kontingent
Ausführlich im ArtikelTop-p ist Top-k überlegen, weil sich die Kandidatenmenge an die Situation anpasst statt fest zu sein.
Siehe auch: Temperatur
Ausführlich im ArtikelTraining bedeutet: eine Vorhersage machen, den Fehler messen, alle Parameter ein winziges Stück in die Richtung verschieben, die den Fehler senkt, und das millionenfach wiederholen.
Siehe auch: Gradient, Verlustfunktion
Ausführlich im ArtikelDer Durchbruch von 2017 liegt nicht in Intelligenz, sondern in Parallelisierbarkeit: die ganze Sequenz wird gleichzeitig verarbeitet.
Siehe auch: Attention, Residualverbindung
Ausführlich im ArtikelNach Art. 50 AI Act müssen Anbieter maschinenlesbar kennzeichnen und Betreiber Deepfakes offenlegen.
Siehe auch: EU AI Act, Wasserzeichen
Ausführlich im ArtikelTraining stützt sich in der EU auf die Text- und Data-Mining-Schranke; ein rein maschinell erzeugtes Werk genießt regelmäßig keinen eigenen Schutz.
Siehe auch: Text- und Data-Mining
Ausführlich im ArtikelOhne Streuungsangabe ist ein Vergleich zweier Modelle nicht von Rauschen zu unterscheiden.
Siehe auch: Standardfehler, Bias und Varianz
Ausführlich im ArtikelWörter, Sätze und Bilder werden in Vektoren übersetzt, damit Ähnlichkeit zu einer Abstandsfrage wird.
Siehe auch: Skalarprodukt, Embedding
Ausführlich im ArtikelUnter etwa 100.000 Vektoren genügt eine Erweiterung in der vorhandenen Datenbank; ein eigenes System lohnt erst darüber.
Siehe auch: Embedding, HNSW, Recall
Ausführlich im ArtikelDazu gehören soziale Bewertung, Emotionserkennung am Arbeitsplatz und in Bildungseinrichtungen sowie biometrische Kategorisierung nach sensiblen Merkmalen.
Siehe auch: EU AI Act, Biometrisches Merkmal
Ausführlich im ArtikelSie ist der Ort, an dem fachliche Prioritäten in das Modell gelangen. Wer sie nicht bewusst wählt, überlässt das dem Standardwert der Bibliothek.
Siehe auch: Kreuzentropie, Gradient
Ausführlich im ArtikelOhne die eingebauten Annahmen eines CNN braucht ein ViT mehr Daten, skaliert dafür aber besser.
Siehe auch: CNN, Transformer
Ausführlich im ArtikelEin Modell mit sieben Milliarden Parametern braucht 14 Gigabyte in float16, 7 in int8 und 3,5 in int4, plus Kontextspeicher.
Siehe auch: Quantisierung, KV-Cache
Ausführlich im ArtikelJede Ausgabe eines Sprachmodells ist eine Wahrscheinlichkeitsverteilung über das gesamte Vokabular.
Siehe auch: Basisrate, Satz von Bayes
Ausführlich im ArtikelBei Transformern ist ein Warmup über 2 bis 5 Prozent der Schritte faktisch Standard.
Siehe auch: Lernrate
Ausführlich im ArtikelEin Wasserzeichen ist eine Sorgfaltsmaßnahme, kein Schutz: es hilft bei kooperativen Anbietern und nicht gegen absichtlichen Missbrauch.
Siehe auch: Transparenzpflicht
Ausführlich im ArtikelDas Modell erzeugt strukturierten Text, der als Funktionsaufruf gelesen wird. Die Beschreibung eines Werkzeugs ist selbst ein Prompt und entscheidet über die Trefferquote.
Siehe auch: Agent
Ausführlich im ArtikelDer Gegenbegriff ist Few-Shot, bei dem zwei bis fünf Beispiele im Prompt stehen. Wo eine Aufgabe zero-shot misslingt, ist ein Beispiel fast immer billiger als ein Fine-Tuning.
Siehe auch: Prompt, Fine-Tuning
Ausführlich im ArtikelDaten aus der Vertragsabwicklung sind damit nicht automatisch für Modelltraining nutzbar. Ein Zweckwechsel ist zu prüfen und zu begründen.
Siehe auch: Rechtsgrundlage, Löschfrist
Ausführlich im Artikel