Was KI kostet
Eine nachrechenbare Kostenrechnung: Token, Anfragen, Prüfaufwand und die Posten, die in den meisten Rechnungen fehlen.
Eine Anfrage, durchgerechnet
Eine typische RAG-Anfrage:
| Posten | Token |
|---|---|
| Systemprompt | 400 |
| Acht Abschnitte à 600 Token | 4.800 |
| Frage und Verlauf | 300 |
| Antwort | 400 |
| Summe | 5.900 |
Bei 3 EUR je Million Eingabetoken und 12 EUR je Million Ausgabetoken:
5.500 × 3 / 1.000.000 + 400 × 12 / 1.000.000 = 0,0165 + 0,0048 = 0,021 EUR.
Bei tausend Anfragen je Tag sind das 21 EUR je Tag oder rund 640 EUR je Monat. Mit Prompt-Caching für Systemprompt und häufige Abschnitte sinkt der Eingabeteil um 30 bis 60 Prozent.
Die vollständige Rechnung
| Posten | Häufig vergessen |
|---|---|
| Anfragekosten | nein |
| Prüfzeit je Vorgang | ja |
| Nacharbeit bei Fehlern, mal Fehlerquote | ja |
| Embeddings und Indexpflege bei RAG | ja |
| Einführung, verteilt über die Nutzungsdauer | ja |
| Laufende Pflege von Vorlagen und Eval-Sets | ja |
| Schulung und Auffrischung | ja |
Die Hebel, nach Wirkung
| Hebel | Größenordnung | Qualitätsverlust |
|---|---|---|
| Prompt-Caching | 30 bis 60 % der Eingabekosten | keiner |
| Kontext kürzen, gezielter abrufen | linear | oft besser statt schlechter |
| Kleineres Modell für einfache Anfragen | Faktor 5 bis 20 auf den Anteil | messbar, muss geprüft werden |
| Weiterleitungsverfahren | 40 bis 70 % gesamt | gering bei konservativer Regel |
| Batching im Eigenbetrieb | Faktor 5 bis 20 Durchsatz | keiner |
| Quantisierung im Eigenbetrieb | Faktor 2 bis 4 | gering bis spürbar |
Die zweite Zeile wird unterschätzt: Zehn passende Abschnitte liefern bessere Antworten als zweihundert beliebige und kosten ein Zwanzigstel.
Eigenbetrieb gegen Dienst
Für ein Modell mit sieben Milliarden Parametern in int8 auf einer Karte mit 300 Watt bei 60 Prozent Auslastung:
| Posten | Wert |
|---|---|
| Durchsatz | 7,4 Mio. Token je Tag |
| Strom mit Kühlung | 1,40 EUR je Tag |
| Abschreibung | 7,30 EUR je Tag |
| Kosten je Mio. Token | rund 1,18 EUR |
Nicht enthalten: Betriebsaufwand, Bereitschaft, Kompetenz. Der Vergleich mit einem Dienst nach Verbrauch fällt erst ab hohem, gleichmäßigem Volumen zugunsten des Eigenbetriebs aus. Siehe Warum Grafikkarten.
Budgetüberraschungen vermeiden
- Kontingente je Nutzer und je Anwendung, ab dem ersten Tag.
- Maximale Prompt- und Antwortlänge begrenzen, technisch und nicht per Richtlinie.
- Warnschwellen bei 50, 80 und 100 Prozent des Monatsbudgets.
- Kosten je erledigtem Vorgang führen, nicht je Anfrage.
- Bei Agenten: harte Schrittgrenze, sonst ist eine Endlosschleife eine Rechnung.
Der letzte Punkt hat schon Budgets in Tagen aufgebraucht. Eine Schrittgrenze ist keine Feinheit.
Der Kostenbogen
KOSTENLOSES KONTO
Kostenbogen mit Rechenweg
Ein Bogen, der Anfragekosten, Prüfaufwand und die vergessenen Posten in eine Zahl je erledigtem Vorgang bringt.
Arbeitsblatt2 Elemente
Passende Kurse und Quellen
AI Index Report
Jährlicher Bericht mit belegten Zahlen zu Modellen, Kosten, Einsatz und Regulierung. Nützlich, wenn eine Aussage eine Quelle braucht statt eines Eindrucks.
Wenn eine Aussage eine Quelle braucht statt eines Eindrucks.