
Tilhørende videoer
Selvhostet kontra hostet inferens — ledsagende videoer
Artiklen arbejder sig gennem det faktiske break-even-regnestykke mellem API-udbydere og selvhostet vLLM/TGI — udnyttelsesgrad, KV-cache-hukommelse, GPU-økonomi, on-call-overhead — og forsøger at aflive cargo-cult-udgaven af "vi sparer penge ved at hoste selv." vLLM-forfatternes eget talk er det klareste tekniske fundament for, hvorfor en serving engine overhovedet betyder noget.
Primært valg
