Lokale und offene Modelle
Was der Eigenbetrieb verlangt, welche Hardware wofür reicht und wann er sich rechnet.
Was passt auf welche Karte
| Karte | Speicher | Realistisch |
|---|---|---|
| Consumer-Grafikkarte | 8 GB | 7 Mrd. in int4, kurzer Kontext |
| Consumer-Grafikkarte, groß | 16 bis 24 GB | 7 Mrd. in float16, 13 Mrd. in int8 |
| Arbeitsplatzkarte | 48 GB | 30 Mrd. in int8, 70 Mrd. in int4 |
| Rechenzentrumskarte | 80 GB | 70 Mrd. in int8, mehrere Ströme |
| Zwei bis vier Karten | 160 bis 320 GB | 70 Mrd. in float16, hohe Gleichzeitigkeit |
Auf diese Werte kommen 10 bis 20 Prozent für die Laufzeitumgebung und der Kontextspeicher, der mit Kontextlänge und Anzahl gleichzeitiger Anfragen wächst. Siehe Speicher und Bandbreite.
Was der Betrieb tatsächlich verlangt
- Ein Serving-Stack mit kontinuierlichem Batching, Kontingenten und Gesundheitsprüfung.
- Ein Warmup nach dem Start, weil die erste Anfrage um Größenordnungen langsamer ist.
- Überwachung von Auslastung, Latenz und Antwortlänge, nicht nur der Verfügbarkeit.
- Ein Modellregister mit Version und Prüfsumme.
- Ein geprobter Rückfallpfad, wenn die Karte ausfällt.
Wann es sich rechnet
- 01
Volumen bestimmen
Token je Tag, gemessen über zwei Wochen, nicht geschätzt.
- 02
Kosten je Million Token gegenüberstellen
Eigenbetrieb rund 1,20 EUR bei guter Auslastung gegenüber dem Preis des Dienstes.
- 03
Auslastung ehrlich ansetzen
Eine Karte, die nachts leer läuft, kostet trotzdem. Unter etwa 40 Prozent Auslastung rechnet sich der Eigenbetrieb selten.
- 04
Betriebsaufwand einrechnen
Bereitschaft, Aktualisierung, Kompetenz. Dieser Posten ist der, der unterschätzt wird.
Die Lizenzfrage
- Erlaubt die Lizenz kommerzielle Nutzung, und ab welcher Größe der Organisation?
- Gibt es Auflagen zur Namensnennung oder zur Weitergabe von Änderungen?
- Sind Ausgaben des Modells eingeschränkt, etwa für das Training anderer Modelle?
- Wer haftet für Rechtsverletzungen durch Trainingsdaten? Regelmäßig niemand.
Der letzte Punkt unterscheidet Open Weights von gehosteten Diensten: Mehrere Anbieter gehosteter Modelle übernehmen vertraglich ein Urheberrechtsrisiko, bei offenen Gewichten tut das niemand.
Wo lokale Modelle klar überlegen sind
- Verarbeitung, bei der Daten das Haus nicht verlassen dürfen.
- Gleichmäßig hohes Volumen mit einfachen Aufgaben, etwa Klassifikation.
- Embedding-Modelle für Suche, die ohnehin klein sind und ständig laufen.
- Verarbeitung auf Edge-Geräten, siehe Edge-KI.
- Unabhängigkeit als eigener Wert, etwa bei kritischen Prozessen.
Passende Kurse und Quellen
BSI zur Sicherheit von KI-Systemen
Technische Leitfäden zum sicheren Betrieb von KI-Systemen, kostenlos und ungewöhnlich konkret.
Für IT-Sicherheit und Betrieb im deutschsprachigen Raum; ungewöhnlich konkret für eine Behördenquelle.
Hugging Face LLM Course
Technischer Kurs zu Sprachmodellen, kostenlos. Setzt Python-Kenntnisse voraus.
Für den Übergang von der Anwendung zum eigenen Betrieb offener Modelle.
Hugging Face Modell-Hub
Hunderttausende offene Modelle mit Lizenz, Modellkarte und Gewichten. Die erste Adresse, wenn geprüft werden soll, ob ein lokales Modell für eine Aufgabe reicht.
Die Lizenz steht auf der Modellkarte und ist nicht bei jedem offenen Modell kommerziell nutzbar.
llama.cpp
Ausführung quantisierter Modelle auf gewöhnlicher Hardware, bis hinunter zu einzelnen Karten und Kleinrechnern. Die Referenzimplementierung für den Betrieb ohne Rechenzentrum.
Für den Betrieb ohne Rechenzentrum, bis hinunter zu einzelnen Karten und Kleinrechnern.
Ollama
Offene Modelle lokal ausführen, mit einem Befehl je Modell. Der einfachste Weg, den Betrieb ohne Anbieter überhaupt einmal auszuprobieren.
Für den ersten Versuch mit einem lokalen Modell, ohne Anbieter und ohne Konto.