KI‑Kompass
Kompass

Modellwahl

Groß oder klein, gehostet oder lokal, offen oder geschlossen: welche Frage welche Antwort erzwingt und was der Wechsel kostet.

·1 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
2 Abschnitte

Nach Aufgabe

AufgabeGröße
Einordnen, Kategorien vergebenklein
Felder aus Dokumenten ziehenklein bis mittel
Zusammenfassenmittel
Kundenschreiben entwerfenmittel
Mehrstufiges Schlussfolgerngroß oder Reasoning-Modell
Code entwerfen und prüfenmittel bis groß
Fachliche Frage aus eigenen Quellenmittel plus guter Abruf

Die letzte Zeile ist die wichtigste: Bei Fragen aus eigenen Quellen entscheidet die Güte des Abrufs mehr als die Größe des Modells.

Gehostet oder lokal

GehostetLokal
AnlaufStundenWochen
Datenverlassen das Hausbleiben
Kostenje Anfrageje Karte und Betriebsstunde
Gütehöchste verfügbareeine Stufe darunter
AbhängigkeitAnbieter, Preise, Verfügbarkeiteigene Hardware und Kompetenz
Lohnt abjeder Mengehohem, gleichmäßigem Volumen

Die Rechnung für den Eigenbetrieb

Ein Modell mit sieben Milliarden Parametern in int8 auf einer Karte mit 300 Watt:

PostenAnnahmeErgebnis
Durchsatz142 Token je Sekunde, 60 % Auslastung7,4 Mio. Token je Tag
Strom mit Kühlung0,25 EUR je kWh, PUE 1,31,40 EUR je Tag
Abschreibung8.000 EUR auf drei Jahre7,30 EUR je Tag
Kostenrund 1,18 EUR je Mio. Token

Diese Zahl ist der Vergleichsmaßstab gegen einen Dienst nach Verbrauch. Nicht enthalten: Betriebsaufwand, Bereitschaft und die Kompetenz, die es braucht. Siehe Warum Grafikkarten, Quantisierung und Training gegen Inferenz: dort steht, warum dieselbe Karte je nach Betriebsart ein völlig anderes Kostenprofil hat.

Was ein Wechsel tatsächlich kostet

  • Jeder geprüfte Prompt gilt nur für das Modell, an dem er gemessen wurde.
  • Ausgabeformate werden anders eingehalten; strukturierte Ausgaben brauchen erneute Prüfung.
  • Schwellwerte für automatische Übernahme verschieben sich.
  • Kontextlänge und Preisstruktur ändern die Auslegung von Abruf und Chunking.
  • Die Einstufung nach AI Act kann berührt sein, wenn sich Genauigkeit oder Grenzen ändern.

Deshalb gehört das Eval-Set vor den Wechsel, nicht danach.

Das Weiterleitungsverfahren

Wenn 70 Prozent der Anfragen von einem Modell mit einem Zehntel der Kosten gleich gut beantwortet werden, sinken die Gesamtkosten auf 0,7 × 0,1 + 0,3 × 1,0 = 0,37, also um 63 Prozent. Die Schwierigkeit liegt in der Klassifikation: Sie muss billig sein und darf schwere Fälle nicht falsch einordnen. Bewährt hat sich eine konservative Regel, die im Zweifel an das große Modell weiterleitet.

Passende Kurse und Quellen

StudieKostenlosEN

Distilling the Knowledge in a Neural Network

Ein großes Modell bringt einem kleinen bei, was es kann. Die Grundlage der kleinen Modelle, die heute im Betrieb laufen.

Für alle, die kleine Modelle im Betrieb einsetzen wollen und die Grundlage dazu suchen.

KursKostenlos900 Min.EN

Hugging Face LLM Course

Technischer Kurs zu Sprachmodellen, kostenlos. Setzt Python-Kenntnisse voraus.

Für den Übergang von der Anwendung zum eigenen Betrieb offener Modelle.

Hugging FaceZum Angebot
WerkzeugKostenlosEN

Hugging Face Modell-Hub

Hunderttausende offene Modelle mit Lizenz, Modellkarte und Gewichten. Die erste Adresse, wenn geprüft werden soll, ob ein lokales Modell für eine Aufgabe reicht.

Die Lizenz steht auf der Modellkarte und ist nicht bei jedem offenen Modell kommerziell nutzbar.

Hugging FaceZum Angebot
WerkzeugKostenlosEN

Ollama

Offene Modelle lokal ausführen, mit einem Befehl je Modell. Der einfachste Weg, den Betrieb ohne Anbieter überhaupt einmal auszuprobieren.

Für den ersten Versuch mit einem lokalen Modell, ohne Anbieter und ohne Konto.

War diese Seite hilfreich?
Modellwahl