Oheisvideot

Itseisännöity vai hallinnoitu päättely: auditoitava kannattavuusmalli – saatevideot

Artikkeli käy läpi API-palvelujen ja itseisännöidyn vLLM- tai TGI-ratkaisun kannattavuuslaskelman: käyttöasteen, KV-välimuistin, grafiikkasuorittimien kustannukset ja päivystyskuorman. Tarkoitus on koetella oletusta, että itseisännöinti säästäisi automaattisesti rahaa. vLLM:n tekijöiden esitys selittää, miksi mallipalvelin vaikuttaa laskelmaan olennaisesti.

Päävalinta

32:07
Nopea LLM-palvelu vLLM:llä ja PagedAttentionilla

Anyscale

Esitys käy läpi vLLM-tutkimuksessa raportoidun muistin hukkakäytön, PagedAttentionin käyttöjärjestelmistä lainaaman sivutusidean ja jatkuvan eräkäsittelyn vaikutuksen läpäisykykyyn. Videon luvut koskevat sen omia vertailuasetelmia, mutta mekanismit auttavat ymmärtämään artikkelin käyttöastelaskelmaa.

Mitä sinun pitäisi oppia tästä: Ymmärrät, miksi mallipalvelin, eräkäsittely ja KV-välimuisti vaikuttavat ratkaisevasti itse isännöidyn päättelyn kustannuksiin.

Katso tai hallitse ensin: Perustiedot transformer-mallien päättelystä, grafiikkasuorittimien muistirajoista sekä rajapintapalvelun ja itse isännöinnin kompromisseista.

AI Expert -huomio: PagedAttentionin perusidea säilyy hyödyllisenä, mutta läpäisyluvut ja mallipalvelinten oletukset vanhenevat nopeasti. Vertaa omaa malliasi, laitteistoasi, eräkäsittelyäsi ja saatavuusvaatimuksiasi ennen isännöintipäätöstä.

Avaa videosivu