Die Modellrechnung ist nicht Ihr Kostenrisiko. 1.000 Vorgänge im Monat kosten mit einem schnellen Modell 3,32 Euro, die menschliche Kontrolle derselben Vorgänge rund das Hundertfache.
Der Preis steht pro Million, Ihre Rechnung läuft pro Vorgang
Zwischen beiden liegt eine Division. Anbieter nennen Beträge je Million Token, ein Betrieb denkt in Vorgängen: eine Kundenmail, eine Rechnung, ein Protokoll. Token sind die Häppchen, in die ein Modell Text zerlegt; die Anthropic-Dokumentation rechnet mit etwa vier Zeichen oder 0,75 Wörtern je Token im Englischen, deutscher Text mit seinen langen Komposita liegt darüber.
Genau schätzen muss niemand. Jede API meldet nach dem Aufruf die tatsächlich verbrauchten Eingabe- und Ausgabe-Token zurück, und aus zwanzig echten Vorgängen steht der Mittelwert fest, mit dem sich der Rest dieser Rechnung führen lässt.
Die Formel passt in eine Zeile
Zwei Zahlen mal zwei Preise, geteilt durch den Wechselkurs. Wir rechnen im Folgenden alles mit dem EZB-Referenzkurs vom 18. September 2026 von 1 Euro zu 1,1460 US-Dollar um.
- Kosten je Vorgang in Euro = ((Eingabe-Token / 1.000.000) × Preis Eingabe + (Ausgabe-Token / 1.000.000) × Preis Ausgabe) / 1,1460
- Beispielvorgang: eine Kundenmail einsortieren und einen Antwortentwurf schreiben, gemessen mit 1.800 Eingabe-Token und 400 Ausgabe-Token.
- Mit Claude Haiku 4.5 zu 1,00 und 5,00 US-Dollar: (0,0018 × 1,00 + 0,0004 × 5,00) / 1,1460 = 0,0033 Euro, also 0,33 Cent je Vorgang.
- Monatsmenge 1.000 Vorgänge: 3,32 Euro.
Fünf Modelle, ein Arbeitspaket, Faktor 45
Dieselben 1.000 Vorgänge, fünf Preisschilder. Die Beträge unten sind mit python3 aus den oben genannten Listenpreisen und dem EZB-Kurs gerechnet, jeweils für 1.800 Eingabe- und 400 Ausgabe-Token je Vorgang:
- GPT-5.6 Luna, 0,20 und 1,20 US-Dollar: 0,73 Euro im Monat.
- Gemini 3.5 Flash-Lite, 0,30 und 2,50 US-Dollar: 1,34 Euro.
- Claude Haiku 4.5, 1,00 und 5,00 US-Dollar: 3,32 Euro.
- Claude Sonnet 5, 2,00 und 10,00 US-Dollar: 6,63 Euro.
- GPT-6 Astra, 10,00 und 50,00 US-Dollar: 33,16 Euro.
Der Ausgabe-Token kostet das Fünffache
Das Antworten ist teurer als das Lesen. Bei Claude Haiku 4.5, Claude Sonnet 5 und GPT-6 Astra kostet ein Ausgabe-Token das Fünffache eines Eingabe-Tokens, bei GPT-5.6 Luna das Sechsfache, bei Gemini 3.5 Flash-Lite das 8,3-Fache; deshalb tragen die 400 Ausgabe-Token unseres Arbeitspakets bei Claude Haiku 4.5 52,6 Prozent der Rechnung und bei Flash-Lite 64,9 Prozent, obwohl sie nur 18 Prozent der Token ausmachen.
Daraus folgt ein Hebel, den kein Anbieterwechsel ersetzt. Wer das Modell zwingt, statt eines ausformulierten Entwurfs nur drei Felder zurückzugeben, etwa Kategorie, Dringlichkeit und Textbausteinnummer, kommt mit rund 150 Ausgabe-Token aus; bei Claude Sonnet 5 sinkt die Monatsrechnung damit von 6,63 auf 4,45 Euro, ein Drittel weniger, ohne am Modell etwas zu ändern.
Zwei Schalter dritteln den Rest
Beide liegen in der Dokumentation, nicht im Verhandlungsgespräch. Die Batch-Verarbeitung gibt es bei allen drei Anbietern mit 50 Prozent Nachlass auf Eingabe und Ausgabe, sofern das Ergebnis nicht in Sekunden vorliegen muss; für einen nächtlichen Lauf über die Post des Vortages ist das die richtige Betriebsart.
Der zweite Schalter heißt Prompt-Caching: Ein Cache-Treffer kostet laut Anthropic-Preisliste das 0,1-Fache des Eingabepreises. In unserem Arbeitspaket sind 1.500 der 1.800 Eingabe-Token immer gleich, nämlich Anleitung, Kategorienliste und Beispiele. Mit Caching sinken die 3,32 Euro auf 2,14 Euro, mit Batch auf 1,66 Euro, mit beidem auf 1,07 Euro. Wer bei diesen Beträgen um den Preis je Million Token feilscht, spart im Jahr den Gegenwert eines Bürostuhls.
Teuer wird es erst mit ganzen Dokumenten
Der Kontext ist der Kostentreiber. Eine Dokumentationsseite von 100 kB entspricht laut Anthropic-Dokumentation rund 25.000 Token, ein PDF von 500 kB rund 125.000. Wer also 200 gescannte Rechnungen im Monat vollständig in den Kontext legt, je Rechnung 25.000 Eingabe-Token, und 600 Token Antwort erwartet, zahlt mit Haiku 4.5 4,89 Euro, mit Sonnet 5 9,77 Euro und mit GPT-6 Astra 48,87 Euro.
Zwei Gewohnheiten treiben diese Zahl weiter. Ein Agent, der über zehn Schritte arbeitet, schickt den wachsenden Verlauf bei jedem Schritt erneut mit, und Bildschirmfotos zählen als Bild-Eingabe. Wie ein solcher Ablauf für Rechnungen aussieht, ohne dass jedes Blatt komplett mitfährt, steht in unserer Anleitung zu Eingangsrechnungen mit KI.
Die Kontrolle kostet das Hundertfache
Hier entscheidet sich Ihre Rechnung. 1.000 Vorgänge mit je 30 Sekunden Sichtprüfung ergeben 8,3 Arbeitsstunden; bei 40 Euro Vollkosten je Stunde sind das 333 Euro im Monat, gegenüber 3,32 Euro für das Modell. Der Faktor beträgt 100.
Deshalb ist die richtige Frage nicht, welches Modell die Million Token am günstigsten liefert, sondern wie viele Vorgänge ohne Blick eines Menschen durchlaufen dürfen. Ein Ablauf, der 70 Prozent der Fälle sicher entscheidet und die übrigen 30 Prozent vorlegt, spart mehr als jeder Modellwechsel. Und ein Modell, das schreibend in Ihre Systeme greift, braucht ohnehin die Grenzen aus unserem heutigen Beitrag zu den Rechten eines KI-Agenten.
Für wen sich die Rechnung lohnt und wann nicht
Ab etwa 300 gleichartigen Vorgängen im Monat würden wir rechnen und dann bauen. Unterhalb dieser Menge ist die Modellrechnung ohnehin Kleingeld, und die Einrichtung, das Testen und die Einweisung kosten mehr Arbeitszeit, als der Ablauf im ersten Jahr einspart. Oberhalb lohnt die Reihenfolge: erst die Ausgabe kürzen, dann Caching, dann Batch, und erst zum Schluss das Modell wechseln.
Gegen die eigene API-Anbindung spricht ein Fall klar: Wenn die Vorgänge unterschiedlich sind und jeder Mensch im Haus die KI anders braucht, ist ein bezahlter Arbeitsplatz-Zugang der ruhigere Weg. Die kostenlosen Stufen sind dabei kein Sparmodell für Kundendaten, wie der Beitrag zum Schwärzen von Kundendaten vor dem Prompt an den Nutzungsbedingungen zeigt.
Drei Fragen, dann zählen Sie eine Woche mit
Sind Listenpreise realistisch? Für kleine Mengen ja, weil Nachlässe erst bei hohen Volumen verhandelt werden. Die Preise ändern sich allerdings; die hier genannten wurden am 21. September 2026 auf den Preisseiten gelesen, und Google weist für Gemini 3.8 Flash bereits eine Verdopplung zum 1. Januar 2027 aus.
Wie viele Token hat unser Vorgang? Lassen Sie zwanzig echte Fälle durchlaufen und lesen Sie die Felder für Eingabe- und Ausgabe-Token aus der Antwort der Schnittstelle ab. Das ist eine Viertelstunde Arbeit und ersetzt jede Schätzung.
Rechnet sich ein teures Modell je? Ja, wenn es die Kontrollquote senkt. Kostet das starke Modell 30 Euro mehr im Monat und spart es zwei Stunden Prüfzeit, hat es sich bezahlt.
Der nächste Schritt: Tragen Sie diese Woche für Ihren meistgenutzten KI-Ablauf drei Zahlen in eine Tabelle ein, Vorgänge je Monat, Eingabe-Token und Ausgabe-Token je Vorgang, und setzen Sie sie in die Formel oben ein. Passt das Ergebnis nicht zu Ihrer bisherigen Rechnung, schauen wir im kostenlosen Erstgespräch gemeinsam hinein; der Rahmen dazu steht unter Leistungen rund um interne KI-Abläufe.
Quellen & Stand
Quellen zuletzt geprüft: 21.09.2026. Herstellerangaben und unsere Einordnung werden im Text unterschieden.
- Anthropic: Preise der Claude-Modelle
- OpenAI: Preise der API-Modelle
- Google: Preise der Gemini-API
- Europäische Zentralbank: Euro-Referenzkurse
Korrekturhinweise: [email protected].
Was heißt das für Ihren Betrieb?
Wir besprechen einen konkreten Ablauf und prüfen, ob KI dabei helfen kann.
Kostenloses Erstgespräch buchen →