34 MinutenWie KI Software-Geschäftsmodelle neu erfindet – mit Bret Taylor von Sierra
Preisgestaltung und Spezialisierung eines KI-Produkts anhand messbarer Ergebnisse statt anhand von Sitzplatzzahlen bewerten.
Anyscale. Der Vortrag erklärt, weshalb naives LLM-Serving 60–80% des GPU-Speichers verschwendet, wie PagedAttention dieses Problem mit einem an Betriebssysteme angelehnten Paging-Verfahren löst und warum Continuous Batching den 24× höheren Durchsatz ermöglicht, den der Artikel in seiner Berechnung verwendet. Danach wirkt die Aussage des Artikels, dass bereits 50% Auslastung ein guter Wert wären, nicht mehr abstrakt.
Das Denkmodell von PagedAttention bleibt wichtig, Durchsatzwerte und Standardeinstellungen von Serving-Engines veralten jedoch schnell. Nutzen Sie das Video für die Grundlagen und führen Sie anschließend Benchmarks mit Ihrem eigenen Modell, Ihrer Hardware, Ihrem Batchprofil und Ihren Verfügbarkeitsanforderungen durch, bevor Sie sich für eine Hostingvariante entscheiden.
Verstehen, warum Serving-Engines, Batching und der Speicherbedarf des KV-Caches die Wirtschaftlichkeit selbst betriebener Inferenz bestimmen.
Grundwissen über Transformer-Inferenz, GPU-Speichergrenzen und die Abwägung zwischen APIs und Self-Hosting.
Zuletzt geprüft: 18. Mai 2026
Fahren Sie mit demselben Lernpfad fort und sehen Sie die nächsten kuratierten Begleitvideos.
34 MinutenPreisgestaltung und Spezialisierung eines KI-Produkts anhand messbarer Ergebnisse statt anhand von Sitzplatzzahlen bewerten.
6 MinutenDie Kernarchitektur eines Sprachagenten und die Fehlerpunkte erkennen, die das Kundenvertrauen in realen Anrufen beeinträchtigen.
37 MinutenPrivate KI als Infrastruktur- und Governance-Entscheidung bewerten, statt sich reflexartig für SaaS oder Selbstbetrieb zu entscheiden.