Modeller och verktygsval
Välj mellan ChatGPT, Claude, Gemini, Copilot, resonemangsmodeller samt molnbaserad eller lokal inferens.
27 innehållsposter (12 artiklar · 15 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
6 min läsningChatGPT, Claude, Gemini eller Copilot – vilken bör en nybörjare välja?
Fyra vanliga AI-assistenter granskade på lättbegriplig svenska. En icke-teknisk guide till hur du väljer din första AI utifrån vad du redan använder och vad du faktiskt vill få ut av den.
Ny inom AI
7 min läsningVälj rätt modell för uppgiften: en snabbguide för 2026
Vilken modell du bör välja för olika typer av uppgifter. GPT, Claude, Gemini, resonemangsmodellerna och alternativen med öppna vikter – sorterade efter vad de faktiskt är bäst på, med enkla beslutsregler.
Nybörjare
10 min läsningOrkestrering av flera modeller: dirigering efter kostnad, latens och kvalitet
Att använda en modell till allt är ett nybörjardrag. AI-system i produktion dirigerar olika förfrågningar till olika modeller – och sparar 60–90 % i kostnad samtidigt som kvaliteten förbättras. Mönstren, dirigeringslogiken och avvägningarna.
MellannivåMer i detta ämne
13 min läsningLLM-stacken 2026: modeller, inferens, verktyg och avvägningar
En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.
Avancerad
10 min läsningTankekedjor, självkritik och tanketräd – när du ska använda vad
Tre resonemangstekniker som verkligen förbättrar AI-resultat för svåra problem – och kostnads-nyttoanalysen för att använda dem. Med konkreta prompter, jämförelser sida vid sida och fallgroparna som moderna resonemangsmodeller medför.
Mellannivå
12 min läsningKostnadsoptimera inferens: promptcache, styrning och kontroll av utdata
Med rätt metoder kan kostnaden för LLM-inferens minskas med 60–90 %. Promptcache, modellstyrning, kontroll av utdata, batchning och några mindre kända mönster. Siffrorna, mönstren och den produktionsdisciplin som skiljer välskött inferens från en skenande faktura.
Avancerad
13 min läsningFinjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster
LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.
Avancerad
6 min läsningGratis eller betald ChatGPT: vad uppgraderingen faktiskt ger
En jämförelse utan jargong mellan gratisversionen av ChatGPT, ChatGPT Plus och ChatGPT Pro – vad som förändras när du uppgraderar och hur du avgör om du faktiskt behöver göra det.
Ny inom AI
10 min läsningLokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar
Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.
Mellannivå
10 min läsningPromptteknik för resonemangsmodeller (o3, R1, Claude extended thinking)
Resonemangsmodeller är inte snabba modeller med några extra steg. De gynnas av andra typer av prompter, ignorerar vissa konventionella mönster och har egna fallgropar. En praktisk guide till att använda dem väl.
Mellannivå
12 min läsningVälj mellan promptning, RAG och finjustering (och när de bör kombineras)
Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.
Avancerad
11 min läsningInferens i egen drift eller som värdtjänst: vLLM, TGI och nollpunktskalkylen
Vid vilken skala blir egen drift billigare än API-anrop? Den faktiska kalkylen, den operativa verkligheten och mönstren som skiljer team som bör driva själva från dem som bör fortsätta betala för hanterad inferens.
Avancerad
211 minuterDjupdykning i LLM:er som ChatGPT
Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.
Avancerad
40 minuterAndrej Karpathy: mjukvara förändras (igen)
Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.
Avancerad
19 minuterÄr det här slutet för RAG? Anthropics NYA promptcachelagring
Prompt Engineering. Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.
Avancerad
56 minuterBuild Hour: promptcachelagring
OpenAI. OpenAI:s egen Build Hour om promptcachelagring – tröskeln på 1024 token, kravet på stabila prefix, stora rabatter för cachelagring av ljud i realtid (kontrollera den aktuella prissidan för den exakta nivån) och påverkan på tiden till första token vid långa indata. Användbart när du bedömer den tekniska insats som faktiskt krävs för att träffa cachen tillförlitligt med dina produktionsprompter.
Avancerad
157 minuterFinjustering av LLM-modeller – kurs i generativ AI
freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.
Avancerad
59 minuterUtveckla en LLM: bygga, träna och finjustera
Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.
Avancerad
15 minuterÄr ChatGPT Plus värt det? Min uppdaterade recension för 2025
Ryan Doser. Ryan går igenom alla funktioner som faktiskt är låsta till nivån för $20 – användningsgränser, avancerat röstläge, gränser för bilder och Sora, anpassade GPT:er samt nivån med resonemangsmodeller – och jämför dem med nuvarande kostnadsfria alternativ som Claude, Gemini och Perplexity. Antalet visningar är relativt lågt eftersom ämnet är smalt, men det här är den tydligaste aktuella jämförelsen sida vid sida som inte urartar i överdrifter. Därför valde vi den framför de mer högljudda videorna om hur ”Plus förändrade mitt liv”.
Ny inom AI
19 minuterAlla AI-modeller förklarade
Tina Huang. En tydlig rundtur i det aktuella modellandskapet grupperat efter nivå – flaggskeppsmodeller, lätta modeller, mellannivåmodeller och specialiserade modeller – med konkreta rekommendationer för vad varje nivå faktiskt är bra på. Det här är artikelns del om att ”känna till alternativen innan du dirigerar”, och Huang beskriver förhållandet mellan kostnad och kapacitet på samma sätt som artikeln utan att luta sig mot överdrivna påståenden om prestandamätningar.
Mellannivå
9 minuterRouteLLM når 90 % av kvaliteten hos GPT4o OCH är 80 % BILLIGARE
Matthew Berman. Går igenom forskningsrapporten och koden för LMSYS RouteLLM: en liten klassificerare placeras framför ett par med en stark och en svag modell och avgör vilken som ska anropas, vilket ger ungefär 95 % av den starka modellens kvalitet till en bråkdel av kostnaden. Antalet visningar ligger under den vanliga gränsen på 100k, men för den specifika nischen ”visa mig verklig modelldirigering, inte bara modelljämförelser” är det här den tydligaste förklaringen på YouTube, och den ligger helt i linje med artikelns avsnitt om avvägningen mellan kvalitet och kostnad.
Mellannivå
9 minuterRAG kontra finjustering
IBM Technology. Ett mer avgränsat fokus på de två tekniker som team oftast blandar ihop. Videon går djupare in på datas aktualitet, källhänvisningar och argumentet att finjustering kan ge snabbare inferens. Den är värd att se om du specifikt försöker argumentera mot ett onödigt finjusteringsprojekt.
Avancerad
13 minuterRAG kontra finjustering kontra promptutformning: optimera AI-modeller
IBM Technology. En tydlig whiteboardgenomgång av alla tre teknikerna och deras respektive kostnader: latens vid informationshämtning, beräkningskostnaden för träning och katastrofal glömska samt begränsningarna med lösningar som enbart bygger på prompter. Den tar också upp de kombinationer som faktiskt är rimliga i produktion. Det avslutande exemplet, där ett juridiskt AI-system använder alla tre teknikerna, motsvarar nästan exakt artikelns argument om när de bör kombineras.
Avancerad
131 minuterSå använder jag LLM:er
Andrej Karpathy. Karpathy ägnar särskilda kapitel åt ”Var medveten om vilken modell du använder och prisnivåerna” och ”Tänkande modeller och när de ska användas”. Under resten av genomgången fortsätter han sedan att växla mellan ChatGPT, Claude, Gemini, Grok och Perplexity. Det är det närmaste du kommer att se artikelns snabbguide tillämpas i realtid av någon med tydliga uppfattningar om när varje nivå är värd sitt pris.
Nybörjare
17 minuterDen nya, smartaste AI:n: Claude 3 – testad mot Gemini 1.5 och GPT-4
AI Explained. Videon är äldre än artikeln (mars 2024), men det är metodiken som är användbar: en och samma noggranna granskare kör samma svåra uppgifter – OCR, mentalisering, instruktionsföljning och matematik – genom tre ledande modeller sida vid sida och visar exakt var var och en brister. Modellnamnen är inaktuella, men ramverket för att jämföra modeller är det inte.
Nybörjare
32 minuterSnabb LLM-servering med vLLM och PagedAttention
Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Avancerad
19 minuterAlla AI-modeller förklarade
Tina Huang. En lugn 19 minuter lång översikt över de stora modellfamiljerna – OpenAI:s GPT-serie, Anthropics Claude, Googles Gemini och dessutom aktörerna inom öppen källkod – samt vilken nivå inom varje familj som är värd din tid. När artikeln har sagt åt dig att ”välja en och hålla dig till den i en månad” förklarar videon vad rullgardinsmenyn i just det verktyget faktiskt erbjuder. Uppriktigt åsiktsdriven utan att vara tillspetsad.
Ny inom AI