32:07Anyscale
Der Vortrag erklärt, weshalb naives LLM-Serving 60–80% des GPU-Speichers verschwendet, wie PagedAttention dieses Problem mit einem an Betriebssysteme angelehnten Paging-Verfahren löst und warum Continuous Batching den 24× höheren Durchsatz ermöglicht, den der Artikel in seiner Berechnung verwendet. Danach wirkt die Aussage des Artikels, dass bereits 50% Auslastung ein guter Wert wären, nicht mehr abstrakt.
Was Sie aus diesem Video mitnehmen sollten: Verstehen, warum Serving-Engines, Batching und der Speicherbedarf des KV-Caches die Wirtschaftlichkeit selbst betriebener Inferenz bestimmen.
Das sollten Sie zuerst ansehen oder wissen: Grundwissen über Transformer-Inferenz, GPU-Speichergrenzen und die Abwägung zwischen APIs und Self-Hosting.
Hinweis von AI Expert: Das Denkmodell von PagedAttention bleibt wichtig, Durchsatzwerte und Standardeinstellungen von Serving-Engines veralten jedoch schnell. Nutzen Sie das Video für die Grundlagen und führen Sie anschließend Benchmarks mit Ihrem eigenen Modell, Ihrer Hardware, Ihrem Batchprofil und Ihren Verfügbarkeitsanforderungen durch, bevor Sie sich für eine Hostingvariante entscheiden.