KI‑Kompass
Kompass

Was KI kostet

Eine nachrechenbare Kostenrechnung: Token, Anfragen, Prüfaufwand und die Posten, die in den meisten Rechnungen fehlen.

·1 Min. Lesezeit·Von Redaktion KI-Kompass
DETAILGRAD
3 Abschnitte

Eine Anfrage, durchgerechnet

Eine typische RAG-Anfrage:

PostenToken
Systemprompt400
Acht Abschnitte à 600 Token4.800
Frage und Verlauf300
Antwort400
Summe5.900

Bei 3 EUR je Million Eingabetoken und 12 EUR je Million Ausgabetoken: 5.500 × 3 / 1.000.000 + 400 × 12 / 1.000.000 = 0,0165 + 0,0048 = 0,021 EUR.

Bei tausend Anfragen je Tag sind das 21 EUR je Tag oder rund 640 EUR je Monat. Mit Prompt-Caching für Systemprompt und häufige Abschnitte sinkt der Eingabeteil um 30 bis 60 Prozent.

Die vollständige Rechnung

PostenHäufig vergessen
Anfragekostennein
Prüfzeit je Vorgangja
Nacharbeit bei Fehlern, mal Fehlerquoteja
Embeddings und Indexpflege bei RAGja
Einführung, verteilt über die Nutzungsdauerja
Laufende Pflege von Vorlagen und Eval-Setsja
Schulung und Auffrischungja

Die Hebel, nach Wirkung

HebelGrößenordnungQualitätsverlust
Prompt-Caching30 bis 60 % der Eingabekostenkeiner
Kontext kürzen, gezielter abrufenlinearoft besser statt schlechter
Kleineres Modell für einfache AnfragenFaktor 5 bis 20 auf den Anteilmessbar, muss geprüft werden
Weiterleitungsverfahren40 bis 70 % gesamtgering bei konservativer Regel
Batching im EigenbetriebFaktor 5 bis 20 Durchsatzkeiner
Quantisierung im EigenbetriebFaktor 2 bis 4gering bis spürbar

Die zweite Zeile wird unterschätzt: Zehn passende Abschnitte liefern bessere Antworten als zweihundert beliebige und kosten ein Zwanzigstel.

Eigenbetrieb gegen Dienst

Für ein Modell mit sieben Milliarden Parametern in int8 auf einer Karte mit 300 Watt bei 60 Prozent Auslastung:

PostenWert
Durchsatz7,4 Mio. Token je Tag
Strom mit Kühlung1,40 EUR je Tag
Abschreibung7,30 EUR je Tag
Kosten je Mio. Tokenrund 1,18 EUR

Nicht enthalten: Betriebsaufwand, Bereitschaft, Kompetenz. Der Vergleich mit einem Dienst nach Verbrauch fällt erst ab hohem, gleichmäßigem Volumen zugunsten des Eigenbetriebs aus. Siehe Warum Grafikkarten.

Budgetüberraschungen vermeiden

  • Kontingente je Nutzer und je Anwendung, ab dem ersten Tag.
  • Maximale Prompt- und Antwortlänge begrenzen, technisch und nicht per Richtlinie.
  • Warnschwellen bei 50, 80 und 100 Prozent des Monatsbudgets.
  • Kosten je erledigtem Vorgang führen, nicht je Anfrage.
  • Bei Agenten: harte Schrittgrenze, sonst ist eine Endlosschleife eine Rechnung.

Der letzte Punkt hat schon Budgets in Tagen aufgebraucht. Eine Schrittgrenze ist keine Feinheit.

Der Kostenbogen

KOSTENLOSES KONTO

Kostenbogen mit Rechenweg

Ein Bogen, der Anfragekosten, Prüfaufwand und die vergessenen Posten in eine Zahl je erledigtem Vorgang bringt.

Arbeitsblatt2 Elemente

Kein Passwort nötig. Wir schicken Ihnen einen Anmeldelink. Ein Konto abonniert keinen Newsletter. Den bestellen Sie separat.

Passende Kurse und Quellen

ArtikelKostenlosEN

AI Index Report

Jährlicher Bericht mit belegten Zahlen zu Modellen, Kosten, Einsatz und Regulierung. Nützlich, wenn eine Aussage eine Quelle braucht statt eines Eindrucks.

Wenn eine Aussage eine Quelle braucht statt eines Eindrucks.

Stanford HAIZum Angebot
War diese Seite hilfreich?
Was KI kostet