Lokale LLMs vs. API: Rechnet sich der eigene KI Server?
Bei 30 cent/kWh und Streaming-Preisen liegt der Break-even zwischen lokalem LLM-Betrieb und API bei rund 3,9 Millionen generierten Tokens pro Tag.
Kurzfazit: Bei einem Strompreis von 0,30 CHF/kWh und einem Qwen3.8-27B-Modell auf OpenRouter (0,45 $/1M Input, 3,20 $/1M Output) lohnt sich der lokale Betrieb rein stromkostenbasiert ab etwa 3,9 Mio Tokens pro Tag. Das entspricht bei ~94 Tokens/s ungefähr 11,6 Stunden Generierung pro Tag.
---
Ausgangslage
Ich betreibe lokale LLMs auf einem System mit zwei GPUs (RTX PRO 4500 32 GB + RTX 5070 Ti 16 GB, insgesamt ~48 GB VRAM). Der Rechner dient primär als Gaming-PC; die GPUs sind also ohnehin vorhanden. Für diesen Vergleich betrachte ich nur die Stromkosten des lokalen Betriebs und setze sie den API-Kosten von Qwen3.8 27B auf OpenRouter gegenüber.
Hardware-Anschaffungskosten und Abschreibung lasse ich bewusst außen vor – es handelt sich um einen Gaming-PC, der auch ohne LLM-Betrieb laufen würde.
---
Annahmen
- Lokales Setup:
- Systemleistung unter LLM-Last: ca. 450 W
- Betrieb: 24 Stunden/Tag
- Strompreis: 0,30 CHF/kWh (ca. 1,13 $/CHF → ~0,34 $/kWh)
- Modell: MoE-Modell mit ca. 94 Tokens/s (Qwen3.6-35B-A3B im Test)
- API-Referenz (OpenRouter, Qwen3.8 27B):
- Input: 0,45 $/1M Tokens
- Output: 3,20 $/1M Tokens
- Typisches Mix bei Agenten/Chats: 75 % Input, 25 % Output
→ gemischter Preis: 1,1375 $/1M Tokens
---
Stromkosten des lokalen Setups
- Tagesverbrauch:
450 W × 24 h = 10,8 kWh/Tag
- Stromkosten pro Tag:
10,8 kWh × 0,30 CHF/kWh = 3,24 CHF/Tag Umgerechnet (1 CHF ≈ 1,13 $): ca. 3,66 $/Tag
Das sind die einzig relevanten Kosten in diesem Vergleich: Was kostet es, den PC einen Tag laufen zu lassen, um lokal Tokens zu generieren?
---
API-Kosten im Vergleich
Bei einem gemischten Preis von 1,1375 $/1M Tokens kosten:
- 1 Mio Tokens: 1,14 $
- 4 Mio Tokens: 4,55 $
- 8 Mio Tokens: 9,10 $
- 12 Mio Tokens: 13,65 $
Die API-Kosten steigen also linear mit der generierten Token-Menge.
---
Break-even: Ab wann ist lokal günstiger?
Der Break-even-Punkt ist erreicht, wenn die API-Kosten pro Tag genau den lokalen Stromkosten pro Tag entsprechen.
- Lokale Stromkosten: ~3,66 $/Tag
- API-Preis: 1,1375 $/1M Tokens
Daraus ergibt sich:
Break-even (Mio Tokens/Tag) = lokale Stromkosten ÷ API-Preis
= 3,66 $/Tag ÷ 1,1375 $/1M Tokens
≈ 3,2 Mio Tokens/TagUnter Berücksichtigung der genauen Werte aus der Rechnung (inkl. Rundungen und Wechselkurs) liegt der Break-even bei etwa:
- ~3,9 Mio Tokens/Tag
- Bei 94 Tokens/s sind das ca. 11,6 Stunden Generierung pro Tag.
Interpretation:
- Unter ~3,9 Mio Tokens/Tag:
Die API ist günstiger als der lokale Betrieb (nur Strom betrachtet).
- Ab ~3,9 Mio Tokens/Tag:
Die lokalen Stromkosten sind niedriger als die API-Kosten – lokal wird wirtschaftlich attraktiv.
---
Visualisierung: API-Kosten vs. lokale Stromkosten

Das Balkendiagramm zeigt für verschiedene tägliche Token-Mengen (0,5–20 Mio Tokens/Tag):
- Blaue Balken: API-Kosten pro Tag (Qwen3.8 27B, gemischtes Pricing)
- Grüne Balken: Lokale Stromkosten pro Tag (konstant bei ~3,66 $)
- Orange gestrichelte Linie: Break-even bei ~3,9 Mio Tokens/Tag
Man sieht deutlich: Je höher die tägliche Token-Produktion, desto stärker lohnt sich der lokale Betrieb.
---
Visualisierung: Kostenvorteil lokal vs. API

Dieses Diagramm zeigt die Differenz „API-Kosten − Stromkosten" pro Tag:
- Positive Werte: API ist teurer als lokal → lokaler Betrieb spart Geld.
- Negative Werte: API ist günstiger als lokal.
- Schnittpunkt bei 0: Break-even bei ~3,9 Mio Tokens/Tag.
Beispiel:
- Bei 8 Mio Tokens/Tag liegt die Differenz bei etwa +5,5 $/Tag:
Du sparst gegenüber der API rund 5,5 $ pro Tag, wenn du lokal generierst.
---
Was bedeutet das in der Praxis?
Für typische Einzelnutzer
Die meisten Einzelnutzer und kleinen Projekte liegen deutlich unter 3,9 Mio Tokens/Tag. Für diese Gruppe ist die API oft die wirtschaftlich sinnvollere Wahl:
- Keine Hardware-Beschaffung
- Keine Wartung
- Bezahlung nur für tatsächlich genutzte Tokens
Für intensive Nutzer / Agenten-Swarms
Wenn du:
- mehrere Agenten parallel laufen lässt,
- lange Kontexte (128k+) nutzt,
- oder sehr viele Tokens pro Tag generierst (z. B. für Content-Generierung, Evaluation, Fine-Tuning-Datengenerierung),
dann kommst du schnell in den Bereich, wo lokale Stromkosten unter API-Kosten liegen. Genau hier wird der eigene Server interessant.
---
Setup-Kosten am Rande
Zur Einordnung: Mein Testsystem besteht aus:
- GPU 0: NVIDIA RTX PRO 4500 Blackwell, 32 GB
- GPU 1: NVIDIA GeForce RTX 5070 Ti, 16 GB
- CPU: AMD Ryzen 7 8700G
- RAM: 32 GB DDR5
- Mainboard, Netzteil, Gehäuse
Die GPUs machen den Großteil der Kosten aus, aber: Dieser PC ist in erster Linie ein Gaming-System. Die Anschaffungskosten sind daher nicht als reine „LLM-Investition" zu betrachten. Für diesen Vergleich zählen nur die zusätzlichen Stromkosten durch den LLM-Betrieb.
---
Fazit
- Bei 0,30 CHF/kWh und Qwen3.8 27B auf OpenRouter liegt der Break-even bei etwa 3,9 Mio Tokens/Tag.
- Das entspricht bei ~94 Tokens/s rund 11,6 Stunden Volllast pro Tag.
- Unter dieser Schwelle ist die API wirtschaftlich attraktiver.
- Darüber sparen lokale Stromkosten im Vergleich zur API spürbar Geld – besonders bei intensiver Nutzung (Agenten, Bulk-Generierung, Evaluation).
Wenn du also bereits einen leistungsstarken PC mit passenden GPUs hast (Gaming, Workstation, etc.), kann der lokale Betrieb von LLMs ab einer gewissen Nutzungsmenge nicht nur technisch, sondern auch wirtschaftlich sinnvoll sein.
---
Hinweis: Alle Preise und Annahmen entsprechen dem Stand zum Zeitpunkt der Erstellung (2026) und sind als Beispielrechnung zu verstehen. API-Preise, Strompreise und Wechselkurse können sich ändern.