32:07Anyscale
Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Vad du bör få ut av detta: Förstå varför serveringsmotorer, batchning och minne för KV-cache dominerar ekonomin för inferens i egen drift.
Titta på eller ha koll på först: Grundläggande kunskaper om inferens i transformermodeller, begränsningar i GPU-minne och avvägningar mellan API:er och egen drift.
Anteckning från AI Expert: Den mentala modellen för PagedAttention är fortfarande viktig, men genomströmningstal och standardvärden i serveringsmotorer åldras snabbt. Använd videon för grunderna och prestandatesta sedan din egen modell, maskinvara, batchutformning och dina krav på tillgänglighet innan du fattar beslut om driftform.