Kostnad och modelldrift
Styr inferenskostnader, välj driftform, dirigera modeller och förstå operativa avvägningar.
13 innehållsposter (6 artiklar · 7 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
10 min läsningOrkestrering av flera modeller: dirigering efter kostnad, latens och kvalitet
Att använda en modell till allt är ett nybörjardrag. AI-system i produktion dirigerar olika förfrågningar till olika modeller – och sparar 60–90 % i kostnad samtidigt som kvaliteten förbättras. Mönstren, dirigeringslogiken och avvägningarna.
Mellannivå
12 min läsningKostnadsoptimera inferens: promptcache, styrning och kontroll av utdata
Med rätt metoder kan kostnaden för LLM-inferens minskas med 60–90 %. Promptcache, modellstyrning, kontroll av utdata, batchning och några mindre kända mönster. Siffrorna, mönstren och den produktionsdisciplin som skiljer välskött inferens från en skenande faktura.
Avancerad
11 min läsningInferens i egen drift eller som värdtjänst: vLLM, TGI och nollpunktskalkylen
Vid vilken skala blir egen drift billigare än API-anrop? Den faktiska kalkylen, den operativa verkligheten och mönstren som skiljer team som bör driva själva från dem som bör fortsätta betala för hanterad inferens.
AvanceradMer i detta ämne
13 min läsningLLM-stacken 2026: modeller, inferens, verktyg och avvägningar
En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.
Avancerad
6 min läsningGratis eller betald ChatGPT: vad uppgraderingen faktiskt ger
En jämförelse utan jargong mellan gratisversionen av ChatGPT, ChatGPT Plus och ChatGPT Pro – vad som förändras när du uppgraderar och hur du avgör om du faktiskt behöver göra det.
Ny inom AI
10 min läsningLokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar
Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.
Mellannivå
211 minuterDjupdykning i LLM:er som ChatGPT
Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.
Avancerad
40 minuterAndrej Karpathy: mjukvara förändras (igen)
Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.
Avancerad
19 minuterÄr det här slutet för RAG? Anthropics NYA promptcachelagring
Prompt Engineering. Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.
Avancerad
56 minuterBuild Hour: promptcachelagring
OpenAI. OpenAI:s egen Build Hour om promptcachelagring – tröskeln på 1024 token, kravet på stabila prefix, stora rabatter för cachelagring av ljud i realtid (kontrollera den aktuella prissidan för den exakta nivån) och påverkan på tiden till första token vid långa indata. Användbart när du bedömer den tekniska insats som faktiskt krävs för att träffa cachen tillförlitligt med dina produktionsprompter.
Avancerad
19 minuterAlla AI-modeller förklarade
Tina Huang. En tydlig rundtur i det aktuella modellandskapet grupperat efter nivå – flaggskeppsmodeller, lätta modeller, mellannivåmodeller och specialiserade modeller – med konkreta rekommendationer för vad varje nivå faktiskt är bra på. Det här är artikelns del om att ”känna till alternativen innan du dirigerar”, och Huang beskriver förhållandet mellan kostnad och kapacitet på samma sätt som artikeln utan att luta sig mot överdrivna påståenden om prestandamätningar.
Mellannivå
9 minuterRouteLLM når 90 % av kvaliteten hos GPT4o OCH är 80 % BILLIGARE
Matthew Berman. Går igenom forskningsrapporten och koden för LMSYS RouteLLM: en liten klassificerare placeras framför ett par med en stark och en svag modell och avgör vilken som ska anropas, vilket ger ungefär 95 % av den starka modellens kvalitet till en bråkdel av kostnaden. Antalet visningar ligger under den vanliga gränsen på 100k, men för den specifika nischen ”visa mig verklig modelldirigering, inte bara modelljämförelser” är det här den tydligaste förklaringen på YouTube, och den ligger helt i linje med artikelns avsnitt om avvägningen mellan kvalitet och kostnad.
Mellannivå
32 minuterSnabb LLM-servering med vLLM och PagedAttention
Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Avancerad