Nopea LLM-palvelu vLLM:llä ja PagedAttentionilla

32 minuuttiaEdistynytRakentajaAnyscaleYksityinen / paikallinen tekoäly

Anyscale. Esitys käy läpi vLLM-tutkimuksessa raportoidun muistin hukkakäytön, PagedAttentionin käyttöjärjestelmistä lainaaman sivutusidean ja jatkuvan eräkäsittelyn vaikutuksen läpäisykykyyn. Videon luvut koskevat sen omia vertailuasetelmia, mutta mekanismit auttavat ymmärtämään artikkelin käyttöastelaskelmaa.

AI Expert -huomio

PagedAttentionin perusidea säilyy hyödyllisenä, mutta läpäisyluvut ja mallipalvelinten oletukset vanhenevat nopeasti. Vertaa omaa malliasi, laitteistoasi, eräkäsittelyäsi ja saatavuusvaatimuksiasi ennen isännöintipäätöstä.

Mitä sinun pitäisi oppia tästä

Ymmärrät, miksi mallipalvelin, eräkäsittely ja KV-välimuisti vaikuttavat ratkaisevasti itse isännöidyn päättelyn kustannuksiin.

Katso tai hallitse ensin

Perustiedot transformer-mallien päättelystä, grafiikkasuorittimien muistirajoista sekä rajapintapalvelun ja itse isännöinnin kompromisseista.

Viimeksi tarkistettu: 14.8.2026

Katso seuraava

Jatka samalla oppimisreitillä seuraaviin valikoituihin oheisvideoihin.