
Begleitvideos
Selbst betriebene vs. gehostete Inferenz — Begleitvideos
Der Artikel berechnet den tatsächlichen Break-even-Punkt zwischen API-Anbietern und selbst betriebenen vLLM- beziehungsweise TGI-Systemen: Auslastung, Speicherbedarf des KV-Caches, GPU-Kosten und Bereitschaftsdienst. Damit widerlegt er die unreflektierte Annahme, Selbstbetrieb spare automatisch Geld. Der Vortrag der vLLM-Autoren liefert die klarste technische Grundlage dafür, weshalb eine Serving Engine überhaupt entscheidend ist.
Hauptauswahl
