Kaasnevad videod

Ise-hostitud vs hostitud inference — kaasnevad videod

Artikkel arvutab API-teenusepakkuja ning ise majutatud vLLM-i või TGI tegelikku tasuvuspunkti, arvestades kasutusastet, KV-vahemälu, GPU-kulu ja valvekoormust. Eesmärk on kummutada tõenditeta uskumus, et ise majutamine säästab alati raha. vLLM-i autorite ettekanne annab hea tehnilise aluse mõistmaks, miks mudeliserveri tarkvara üldse oluline on.

Esmane valik

32:07
Kiire LLM-serveerimine vLLM-i ja PagedAttentioniga

Anyscale

Käib läbi, miks naiivne LLM-serveerimine raiskab 60–80% GPU mälust, kuidas PagedAttention laenab OS-i stiilis pagineerimist seda parandama ja miks pidev batching toodab 24× läbilaskvuse numbreid, mida artikkel oma matemaatikas kasutab. Pärast seda lakkab artikli "õnneks tabad 50% kasutusastet" rida abstraktne olemast.

Mida sellest videost kaasa võtta: Saad tehnilise mustri teemal "Ise-hostitud vs hostitud inference" ning oskad hinnata riske, piire ja järgmist sammu.

Mida enne vaadata või teada: Kasuks tuleb arusaam API-dest, automatsioonidest, RAG-ist või agentide tööpõhimõtetest.

AI Experti märkus: Mudelite nimed, hinnad ja võimekused muutuvad kiiresti. Kasuta videot otsustusmustri mõistmiseks ning kontrolli praegust mudelikäitumist enne kasutuselevõttu.

Ava video leht