34 minutterSådan genopfinder AI software-forretningsmodeller med Bret Taylor fra Sierra
Evaluér AI-produktprissætning og specialisering omkring målbare outcomes frem for antal sæder.
Anyscale. Præsentationen rapporterer, at en enkel LLM-server i det viste miljø spilder 60–80 % af GPU-hukommelsen, forklarer hvordan PagedAttention bruger en sideinddeling inspireret af operativsystemer, og viser de 24×-tal for gennemløb, som artiklen omtaler. Tallene stammer fra den beskrevne opsætning og udgør ikke et generelt sammenligningsgrundlag. De giver kontekst til artiklens forsigtige antagelse om 50 % udnyttelse.
Den grundlæggende model bag PagedAttention er fortsat relevant, men tal for gennemløb og standardindstillinger i inferensmotorer bliver hurtigt forældede. Brug videoen til at forstå principperne, og mål derefter din egen model, hardware, batchsammensætning og krav til oppetid, før du vælger hostingform.
Forstå, hvorfor inferensmotorer, batchbehandling og hukommelse til KV-cache har stor betydning for økonomien i selvhostet inferens.
Grundlæggende viden om transformerinferens, grænser for GPU-hukommelse og afvejninger mellem API'er og selvhosting.
Senest gennemgået: 18. maj 2026
Fortsæt ad den samme læringsvej med de næste kuraterede videoer.
34 minutterEvaluér AI-produktprissætning og specialisering omkring målbare outcomes frem for antal sæder.
6 minutterGenkend kernearkitekturen i en voice-agent og de fejltilstande, der påvirker kundetillid i rigtige opkald.
37 minutterVurdér privat AI som en beslutning om infrastruktur og styring frem for automatisk at vælge enten SaaS eller selvhosting.