34 minuterSå förändrar AI affärsmodellerna för programvara med Bret Taylor från Sierra
Utvärdera prissättning och specialisering av AI-produkter utifrån mätbara resultat i stället för antal användarplatser.
Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Den mentala modellen för PagedAttention är fortfarande viktig, men genomströmningstal och standardvärden i serveringsmotorer åldras snabbt. Använd videon för grunderna och prestandatesta sedan din egen modell, maskinvara, batchutformning och dina krav på tillgänglighet innan du fattar beslut om driftform.
Förstå varför serveringsmotorer, batchning och minne för KV-cache dominerar ekonomin för inferens i egen drift.
Grundläggande kunskaper om inferens i transformermodeller, begränsningar i GPU-minne och avvägningar mellan API:er och egen drift.
Senast granskad: 18 maj 2026
Fortsätt längs samma lärstig med nästa kurerade kompletterande video.
34 minuterUtvärdera prissättning och specialisering av AI-produkter utifrån mätbara resultat i stället för antal användarplatser.
6 minuterKänn igen en röstassistents centrala arkitektur och de felkällor som påverkar kundernas förtroende under verkliga samtal.
37 minuterBedöm privat AI som ett beslut om infrastruktur och styrning i stället för att instinktivt välja antingen SaaS eller egen drift.