32:07Anyscale
Præsentationen rapporterer, at en enkel LLM-server i det viste miljø spilder 60–80 % af GPU-hukommelsen, forklarer hvordan PagedAttention bruger en sideinddeling inspireret af operativsystemer, og viser de 24×-tal for gennemløb, som artiklen omtaler. Tallene stammer fra den beskrevne opsætning og udgør ikke et generelt sammenligningsgrundlag. De giver kontekst til artiklens forsigtige antagelse om 50 % udnyttelse.
Hvad du bør få ud af dette: Forstå, hvorfor inferensmotorer, batchbehandling og hukommelse til KV-cache har stor betydning for økonomien i selvhostet inferens.
Forudsætninger: Grundlæggende viden om transformerinferens, grænser for GPU-hukommelse og afvejninger mellem API'er og selvhosting.
Bemærkning fra AI Expert: Den grundlæggende model bag PagedAttention er fortsat relevant, men tal for gennemløb og standardindstillinger i inferensmotorer bliver hurtigt forældede. Brug videoen til at forstå principperne, og mål derefter din egen model, hardware, batchsammensætning og krav til oppetid, før du vælger hostingform.