Ämne

Kostnad och modelldrift

Styr inferenskostnader, välj driftform, dirigera modeller och förstå operativa avvägningar.

13 innehållsposter (6 artiklar · 7 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

13 min läsning
Artikel

LLM-stacken 2026: modeller, inferens, verktyg och avvägningar

En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.

Avancerad
6 min läsning
Artikel

Gratis eller betald ChatGPT: vad uppgraderingen faktiskt ger

En jämförelse utan jargong mellan gratisversionen av ChatGPT, ChatGPT Plus och ChatGPT Pro – vad som förändras när du uppgraderar och hur du avgör om du faktiskt behöver göra det.

Ny inom AI
10 min läsning
Artikel

Lokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar

Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.

Mellannivå
211 minuter
Video

Djupdykning i LLM:er som ChatGPT

Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.

Avancerad
40 minuter
Video

Andrej Karpathy: mjukvara förändras (igen)

Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.

Avancerad
19 minuter
Video

Är det här slutet för RAG? Anthropics NYA promptcachelagring

Prompt Engineering. Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.

Avancerad
56 minuter
Video

Build Hour: promptcachelagring

OpenAI. OpenAI:s egen Build Hour om promptcachelagring – tröskeln på 1024 token, kravet på stabila prefix, stora rabatter för cachelagring av ljud i realtid (kontrollera den aktuella prissidan för den exakta nivån) och påverkan på tiden till första token vid långa indata. Användbart när du bedömer den tekniska insats som faktiskt krävs för att träffa cachen tillförlitligt med dina produktionsprompter.

Avancerad
19 minuter
Video

Alla AI-modeller förklarade

Tina Huang. En tydlig rundtur i det aktuella modellandskapet grupperat efter nivå – flaggskeppsmodeller, lätta modeller, mellannivåmodeller och specialiserade modeller – med konkreta rekommendationer för vad varje nivå faktiskt är bra på. Det här är artikelns del om att ”känna till alternativen innan du dirigerar”, och Huang beskriver förhållandet mellan kostnad och kapacitet på samma sätt som artikeln utan att luta sig mot överdrivna påståenden om prestandamätningar.

Mellannivå
9 minuter
Video

RouteLLM når 90 % av kvaliteten hos GPT4o OCH är 80 % BILLIGARE

Matthew Berman. Går igenom forskningsrapporten och koden för LMSYS RouteLLM: en liten klassificerare placeras framför ett par med en stark och en svag modell och avgör vilken som ska anropas, vilket ger ungefär 95 % av den starka modellens kvalitet till en bråkdel av kostnaden. Antalet visningar ligger under den vanliga gränsen på 100k, men för den specifika nischen ”visa mig verklig modelldirigering, inte bara modelljämförelser” är det här den tydligaste förklaringen på YouTube, och den ligger helt i linje med artikelns avsnitt om avvägningen mellan kvalitet och kostnad.

Mellannivå
32 minuter
Video

Snabb LLM-servering med vLLM och PagedAttention

Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.

Avancerad