Tilhørende videoer

Selvhostet eller administreret inferens — ledsagende videoer

Artiklen opstiller en efterprøvbar nulpunktsberegning mellem API-udbydere og selvhostet vLLM/TGI. Den medregner udnyttelsesgrad, hukommelse til KV-cache, GPU-økonomi og udgifter til vagtberedskab og udfordrer antagelsen om, at selvhosting automatisk er billigere. Præsentationen fra vLLM-forfatterne giver den tekniske baggrund for, hvorfor en inferensmotor påvirker regnestykket.

Primært valg

32:07
Hurtig LLM-inferens med vLLM og PagedAttention

Anyscale

Præsentationen rapporterer, at en enkel LLM-server i det viste miljø spilder 60–80 % af GPU-hukommelsen, forklarer hvordan PagedAttention bruger en sideinddeling inspireret af operativsystemer, og viser de 24×-tal for gennemløb, som artiklen omtaler. Tallene stammer fra den beskrevne opsætning og udgør ikke et generelt sammenligningsgrundlag. De giver kontekst til artiklens forsigtige antagelse om 50 % udnyttelse.

Hvad du bør få ud af dette: Forstå, hvorfor inferensmotorer, batchbehandling og hukommelse til KV-cache har stor betydning for økonomien i selvhostet inferens.

Forudsætninger: Grundlæggende viden om transformerinferens, grænser for GPU-hukommelse og afvejninger mellem API'er og selvhosting.

Bemærkning fra AI Expert: Den grundlæggende model bag PagedAttention er fortsat relevant, men tal for gennemløb og standardindstillinger i inferensmotorer bliver hurtigt forældede. Brug videoen til at forstå principperne, og mål derefter din egen model, hardware, batchsammensætning og krav til oppetid, før du vælger hostingform.

Åbn videoside