KI‑Kompass
Kompass

Lokale und offene Modelle

Was der Eigenbetrieb verlangt, welche Hardware wofür reicht und wann er sich rechnet.

·1 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
1 Abschnitt

Was passt auf welche Karte

KarteSpeicherRealistisch
Consumer-Grafikkarte8 GB7 Mrd. in int4, kurzer Kontext
Consumer-Grafikkarte, groß16 bis 24 GB7 Mrd. in float16, 13 Mrd. in int8
Arbeitsplatzkarte48 GB30 Mrd. in int8, 70 Mrd. in int4
Rechenzentrumskarte80 GB70 Mrd. in int8, mehrere Ströme
Zwei bis vier Karten160 bis 320 GB70 Mrd. in float16, hohe Gleichzeitigkeit

Auf diese Werte kommen 10 bis 20 Prozent für die Laufzeitumgebung und der Kontextspeicher, der mit Kontextlänge und Anzahl gleichzeitiger Anfragen wächst. Siehe Speicher und Bandbreite.

Was der Betrieb tatsächlich verlangt

  • Ein Serving-Stack mit kontinuierlichem Batching, Kontingenten und Gesundheitsprüfung.
  • Ein Warmup nach dem Start, weil die erste Anfrage um Größenordnungen langsamer ist.
  • Überwachung von Auslastung, Latenz und Antwortlänge, nicht nur der Verfügbarkeit.
  • Ein Modellregister mit Version und Prüfsumme.
  • Ein geprobter Rückfallpfad, wenn die Karte ausfällt.

Wann es sich rechnet

  1. 01

    Volumen bestimmen

    Token je Tag, gemessen über zwei Wochen, nicht geschätzt.

  2. 02

    Kosten je Million Token gegenüberstellen

    Eigenbetrieb rund 1,20 EUR bei guter Auslastung gegenüber dem Preis des Dienstes.

  3. 03

    Auslastung ehrlich ansetzen

    Eine Karte, die nachts leer läuft, kostet trotzdem. Unter etwa 40 Prozent Auslastung rechnet sich der Eigenbetrieb selten.

  4. 04

    Betriebsaufwand einrechnen

    Bereitschaft, Aktualisierung, Kompetenz. Dieser Posten ist der, der unterschätzt wird.

Die Lizenzfrage

  • Erlaubt die Lizenz kommerzielle Nutzung, und ab welcher Größe der Organisation?
  • Gibt es Auflagen zur Namensnennung oder zur Weitergabe von Änderungen?
  • Sind Ausgaben des Modells eingeschränkt, etwa für das Training anderer Modelle?
  • Wer haftet für Rechtsverletzungen durch Trainingsdaten? Regelmäßig niemand.

Der letzte Punkt unterscheidet Open Weights von gehosteten Diensten: Mehrere Anbieter gehosteter Modelle übernehmen vertraglich ein Urheberrechtsrisiko, bei offenen Gewichten tut das niemand.

Wo lokale Modelle klar überlegen sind

  • Verarbeitung, bei der Daten das Haus nicht verlassen dürfen.
  • Gleichmäßig hohes Volumen mit einfachen Aufgaben, etwa Klassifikation.
  • Embedding-Modelle für Suche, die ohnehin klein sind und ständig laufen.
  • Verarbeitung auf Edge-Geräten, siehe Edge-KI.
  • Unabhängigkeit als eigener Wert, etwa bei kritischen Prozessen.

Passende Kurse und Quellen

StudieKostenlosDE

BSI zur Sicherheit von KI-Systemen

Technische Leitfäden zum sicheren Betrieb von KI-Systemen, kostenlos und ungewöhnlich konkret.

Für IT-Sicherheit und Betrieb im deutschsprachigen Raum; ungewöhnlich konkret für eine Behördenquelle.

Bundesamt für Sicherheit in der InformationstechnikZum Angebot
KursKostenlos900 Min.EN

Hugging Face LLM Course

Technischer Kurs zu Sprachmodellen, kostenlos. Setzt Python-Kenntnisse voraus.

Für den Übergang von der Anwendung zum eigenen Betrieb offener Modelle.

Hugging FaceZum Angebot
WerkzeugKostenlosEN

Hugging Face Modell-Hub

Hunderttausende offene Modelle mit Lizenz, Modellkarte und Gewichten. Die erste Adresse, wenn geprüft werden soll, ob ein lokales Modell für eine Aufgabe reicht.

Die Lizenz steht auf der Modellkarte und ist nicht bei jedem offenen Modell kommerziell nutzbar.

Hugging FaceZum Angebot
WerkzeugKostenlosEN

llama.cpp

Ausführung quantisierter Modelle auf gewöhnlicher Hardware, bis hinunter zu einzelnen Karten und Kleinrechnern. Die Referenzimplementierung für den Betrieb ohne Rechenzentrum.

Für den Betrieb ohne Rechenzentrum, bis hinunter zu einzelnen Karten und Kleinrechnern.

WerkzeugKostenlosEN

Ollama

Offene Modelle lokal ausführen, mit einem Befehl je Modell. Der einfachste Weg, den Betrieb ohne Anbieter überhaupt einmal auszuprobieren.

Für den ersten Versuch mit einem lokalen Modell, ohne Anbieter und ohne Konto.

War diese Seite hilfreich?
Lokale und offene Modelle