Modellwahl
Groß oder klein, gehostet oder lokal, offen oder geschlossen: welche Frage welche Antwort erzwingt und was der Wechsel kostet.
Nach Aufgabe
| Aufgabe | Größe |
|---|---|
| Einordnen, Kategorien vergeben | klein |
| Felder aus Dokumenten ziehen | klein bis mittel |
| Zusammenfassen | mittel |
| Kundenschreiben entwerfen | mittel |
| Mehrstufiges Schlussfolgern | groß oder Reasoning-Modell |
| Code entwerfen und prüfen | mittel bis groß |
| Fachliche Frage aus eigenen Quellen | mittel plus guter Abruf |
Die letzte Zeile ist die wichtigste: Bei Fragen aus eigenen Quellen entscheidet die Güte des Abrufs mehr als die Größe des Modells.
Gehostet oder lokal
| Gehostet | Lokal | |
|---|---|---|
| Anlauf | Stunden | Wochen |
| Daten | verlassen das Haus | bleiben |
| Kosten | je Anfrage | je Karte und Betriebsstunde |
| Güte | höchste verfügbare | eine Stufe darunter |
| Abhängigkeit | Anbieter, Preise, Verfügbarkeit | eigene Hardware und Kompetenz |
| Lohnt ab | jeder Menge | hohem, gleichmäßigem Volumen |
Die Rechnung für den Eigenbetrieb
Ein Modell mit sieben Milliarden Parametern in int8 auf einer Karte mit 300 Watt:
| Posten | Annahme | Ergebnis |
|---|---|---|
| Durchsatz | 142 Token je Sekunde, 60 % Auslastung | 7,4 Mio. Token je Tag |
| Strom mit Kühlung | 0,25 EUR je kWh, PUE 1,3 | 1,40 EUR je Tag |
| Abschreibung | 8.000 EUR auf drei Jahre | 7,30 EUR je Tag |
| Kosten | rund 1,18 EUR je Mio. Token |
Diese Zahl ist der Vergleichsmaßstab gegen einen Dienst nach Verbrauch. Nicht enthalten: Betriebsaufwand, Bereitschaft und die Kompetenz, die es braucht. Siehe Warum Grafikkarten, Quantisierung und Training gegen Inferenz: dort steht, warum dieselbe Karte je nach Betriebsart ein völlig anderes Kostenprofil hat.
Was ein Wechsel tatsächlich kostet
- Jeder geprüfte Prompt gilt nur für das Modell, an dem er gemessen wurde.
- Ausgabeformate werden anders eingehalten; strukturierte Ausgaben brauchen erneute Prüfung.
- Schwellwerte für automatische Übernahme verschieben sich.
- Kontextlänge und Preisstruktur ändern die Auslegung von Abruf und Chunking.
- Die Einstufung nach AI Act kann berührt sein, wenn sich Genauigkeit oder Grenzen ändern.
Deshalb gehört das Eval-Set vor den Wechsel, nicht danach.
Das Weiterleitungsverfahren
Wenn 70 Prozent der Anfragen von einem Modell mit einem Zehntel der Kosten
gleich gut beantwortet werden, sinken die Gesamtkosten auf
0,7 × 0,1 + 0,3 × 1,0 = 0,37, also um 63 Prozent. Die Schwierigkeit liegt in
der Klassifikation: Sie muss billig sein und darf schwere Fälle nicht falsch
einordnen. Bewährt hat sich eine konservative Regel, die im Zweifel an das große
Modell weiterleitet.
Passende Kurse und Quellen
Distilling the Knowledge in a Neural Network
Ein großes Modell bringt einem kleinen bei, was es kann. Die Grundlage der kleinen Modelle, die heute im Betrieb laufen.
Für alle, die kleine Modelle im Betrieb einsetzen wollen und die Grundlage dazu suchen.
Hugging Face LLM Course
Technischer Kurs zu Sprachmodellen, kostenlos. Setzt Python-Kenntnisse voraus.
Für den Übergang von der Anwendung zum eigenen Betrieb offener Modelle.
Hugging Face Modell-Hub
Hunderttausende offene Modelle mit Lizenz, Modellkarte und Gewichten. Die erste Adresse, wenn geprüft werden soll, ob ein lokales Modell für eine Aufgabe reicht.
Die Lizenz steht auf der Modellkarte und ist nicht bei jedem offenen Modell kommerziell nutzbar.
Ollama
Offene Modelle lokal ausführen, mit einem Befehl je Modell. Der einfachste Weg, den Betrieb ohne Anbieter überhaupt einmal auszuprobieren.
Für den ersten Versuch mit einem lokalen Modell, ohne Anbieter und ohne Konto.