Hurtig LLM-inferens med vLLM og PagedAttention

32 minutterAvanceretUdviklerAnyscalePrivat / lokal AI

Anyscale. Præsentationen rapporterer, at en enkel LLM-server i det viste miljø spilder 60–80 % af GPU-hukommelsen, forklarer hvordan PagedAttention bruger en sideinddeling inspireret af operativsystemer, og viser de 24×-tal for gennemløb, som artiklen omtaler. Tallene stammer fra den beskrevne opsætning og udgør ikke et generelt sammenligningsgrundlag. De giver kontekst til artiklens forsigtige antagelse om 50 % udnyttelse.

Bemærkning fra AI Expert

Den grundlæggende model bag PagedAttention er fortsat relevant, men tal for gennemløb og standardindstillinger i inferensmotorer bliver hurtigt forældede. Brug videoen til at forstå principperne, og mål derefter din egen model, hardware, batchsammensætning og krav til oppetid, før du vælger hostingform.

Hvad du bør få ud af dette

Forstå, hvorfor inferensmotorer, batchbehandling og hukommelse til KV-cache har stor betydning for økonomien i selvhostet inferens.

Forudsætninger

Grundlæggende viden om transformerinferens, grænser for GPU-hukommelse og afvejninger mellem API'er og selvhosting.

Senest gennemgået: 18. maj 2026

Se næste

Fortsæt ad den samme læringsvej med de næste kuraterede videoer.