tooling
Schemas, Error-Bodies und die Ergonomie, die entscheidet, ob ein Modell meine API bedienen kann.
Lokale LLMs vs. API: Rechnet sich der eigene KI Server?
Bei 30 cent/kWh und Streaming-Preisen liegt der Break-even zwischen lokalem LLM-Betrieb und API bei rund 3,9 Millionen generierten Tokens pro Tag.
Lokale LLMs auf 48 GB VRAM: Welche Modelle wirklich schnell laufen
Ein praktischer llama.cpp-Benchmark auf zwei GPUs — mit reproduzierbarer Methodik, Messwerten und einer vorsichtigen Einordnung für lokale KI-Agenten.