Kompletterande videor

Inferens i egen drift eller som värdtjänst: vLLM, TGI och nollpunktskalkylen – kompletterande videor

Artikeln går igenom den faktiska nollpunktskalkylen mellan API-leverantörer och vLLM/TGI i egen drift – nyttjandegrad, minne för KV-cache, GPU-ekonomi och kostnaden för beredskap – och försöker avliva den slentrianmässiga föreställningen att ”vi sparar pengar genom att köra själva”. vLLM-författarnas eget föredrag ger den tydligaste tekniska grunden till varför en serveringsmotor över huvud taget spelar roll.

Förstahandsval

32:07
Snabb LLM-servering med vLLM och PagedAttention

Anyscale

Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.

Vad du bör få ut av detta: Förstå varför serveringsmotorer, batchning och minne för KV-cache dominerar ekonomin för inferens i egen drift.

Titta på eller ha koll på först: Grundläggande kunskaper om inferens i transformermodeller, begränsningar i GPU-minne och avvägningar mellan API:er och egen drift.

Anteckning från AI Expert: Den mentala modellen för PagedAttention är fortfarande viktig, men genomströmningstal och standardvärden i serveringsmotorer åldras snabbt. Använd videon för grunderna och prestandatesta sedan din egen modell, maskinvara, batchutformning och dina krav på tillgänglighet innan du fattar beslut om driftform.

Öppna videosidan