Ämne

Modeller och verktygsval

Välj mellan ChatGPT, Claude, Gemini, Copilot, resonemangsmodeller samt molnbaserad eller lokal inferens.

27 innehållsposter (12 artiklar · 15 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

13 min läsning
Artikel

LLM-stacken 2026: modeller, inferens, verktyg och avvägningar

En verksam arkitekts syn på LLM-stacken 2026 – modellnivåerna, inferensleverantörerna, orkestreringslagren, utvärderingsverktygen och de avvägningar som verkligen spelar roll när produktions-AI ska levereras. Allt du önskar att någon hade förklarat innan du började.

Avancerad
10 min läsning
Artikel

Tankekedjor, självkritik och tanketräd – när du ska använda vad

Tre resonemangstekniker som verkligen förbättrar AI-resultat för svåra problem – och kostnads-nyttoanalysen för att använda dem. Med konkreta prompter, jämförelser sida vid sida och fallgroparna som moderna resonemangsmodeller medför.

Mellannivå
12 min läsning
Artikel

Kostnadsoptimera inferens: promptcache, styrning och kontroll av utdata

Med rätt metoder kan kostnaden för LLM-inferens minskas med 60–90 %. Promptcache, modellstyrning, kontroll av utdata, batchning och några mindre kända mönster. Siffrorna, mönstren och den produktionsdisciplin som skiljer välskött inferens från en skenande faktura.

Avancerad
13 min läsning
Artikel

Finjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster

LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.

Avancerad
6 min läsning
Artikel

Gratis eller betald ChatGPT: vad uppgraderingen faktiskt ger

En jämförelse utan jargong mellan gratisversionen av ChatGPT, ChatGPT Plus och ChatGPT Pro – vad som förändras när du uppgraderar och hur du avgör om du faktiskt behöver göra det.

Ny inom AI
10 min läsning
Artikel

Lokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar

Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.

Mellannivå
10 min läsning
Artikel

Promptteknik för resonemangsmodeller (o3, R1, Claude extended thinking)

Resonemangsmodeller är inte snabba modeller med några extra steg. De gynnas av andra typer av prompter, ignorerar vissa konventionella mönster och har egna fallgropar. En praktisk guide till att använda dem väl.

Mellannivå
12 min läsning
Artikel

Välj mellan promptning, RAG och finjustering (och när de bör kombineras)

Promptning, RAG och finjustering är de tre stora verktygen för att anpassa LLM-modeller till ditt problem. Var och en passar vissa problem och är fel för andra. Ett ramverk för valet, de realistiska kostnaderna och de produktionsmönster där kombinationer ger bäst resultat.

Avancerad
11 min läsning
Artikel

Inferens i egen drift eller som värdtjänst: vLLM, TGI och nollpunktskalkylen

Vid vilken skala blir egen drift billigare än API-anrop? Den faktiska kalkylen, den operativa verkligheten och mönstren som skiljer team som bör driva själva från dem som bör fortsätta betala för hanterad inferens.

Avancerad
211 minuter
Video

Djupdykning i LLM:er som ChatGPT

Andrej Karpathy. Det här är YouTubes tydligaste heltäckande förklaring av vad en LLM faktiskt är – förträning, tokenisering, SFT, RLHF, resonemangsträning med förstärkningsinlärning, verktygsanvändning och hallucinationer – på den detaljnivå en ingenjör behöver för att kunna resonera om modellavvägningar. Se den en gång, så slutar artikelns beslut mellan ”modeller i GPT-klassen, modeller med öppna vikter och resonemangsmodeller” att kännas som varumärkesval och börjar kännas som val mellan träningsmetoder.

Avancerad
40 minuter
Video

Andrej Karpathy: mjukvara förändras (igen)

Y Combinator. I sitt huvudanförande på AI Startup School beskriver Karpathy LLM:er som en ny sorts dator – allmännyttig tjänst, fabrik och operativsystem i ett – och argumenterar för produkter med ”partiell autonomi” där människan håller systemet i strama tyglar. Det är den tydligaste formuleringen av den mentala modell på stacknivå som artikeln förutsätter: du väljer inferensleverantörer och verktyg för ett programmerbart fundament, inte för en chattbot.

Avancerad
19 minuter
Video

Är det här slutet för RAG? Anthropics NYA promptcachelagring

Prompt Engineering. Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.

Avancerad
56 minuter
Video

Build Hour: promptcachelagring

OpenAI. OpenAI:s egen Build Hour om promptcachelagring – tröskeln på 1024 token, kravet på stabila prefix, stora rabatter för cachelagring av ljud i realtid (kontrollera den aktuella prissidan för den exakta nivån) och påverkan på tiden till första token vid långa indata. Användbart när du bedömer den tekniska insats som faktiskt krävs för att träffa cachen tillförlitligt med dina produktionsprompter.

Avancerad
157 minuter
Video

Finjustering av LLM-modeller – kurs i generativ AI

freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.

Avancerad
59 minuter
Video

Utveckla en LLM: bygga, träna och finjustera

Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.

Avancerad
15 minuter
Video

Är ChatGPT Plus värt det? Min uppdaterade recension för 2025

Ryan Doser. Ryan går igenom alla funktioner som faktiskt är låsta till nivån för $20 – användningsgränser, avancerat röstläge, gränser för bilder och Sora, anpassade GPT:er samt nivån med resonemangsmodeller – och jämför dem med nuvarande kostnadsfria alternativ som Claude, Gemini och Perplexity. Antalet visningar är relativt lågt eftersom ämnet är smalt, men det här är den tydligaste aktuella jämförelsen sida vid sida som inte urartar i överdrifter. Därför valde vi den framför de mer högljudda videorna om hur ”Plus förändrade mitt liv”.

Ny inom AI
19 minuter
Video

Alla AI-modeller förklarade

Tina Huang. En tydlig rundtur i det aktuella modellandskapet grupperat efter nivå – flaggskeppsmodeller, lätta modeller, mellannivåmodeller och specialiserade modeller – med konkreta rekommendationer för vad varje nivå faktiskt är bra på. Det här är artikelns del om att ”känna till alternativen innan du dirigerar”, och Huang beskriver förhållandet mellan kostnad och kapacitet på samma sätt som artikeln utan att luta sig mot överdrivna påståenden om prestandamätningar.

Mellannivå
9 minuter
Video

RouteLLM når 90 % av kvaliteten hos GPT4o OCH är 80 % BILLIGARE

Matthew Berman. Går igenom forskningsrapporten och koden för LMSYS RouteLLM: en liten klassificerare placeras framför ett par med en stark och en svag modell och avgör vilken som ska anropas, vilket ger ungefär 95 % av den starka modellens kvalitet till en bråkdel av kostnaden. Antalet visningar ligger under den vanliga gränsen på 100k, men för den specifika nischen ”visa mig verklig modelldirigering, inte bara modelljämförelser” är det här den tydligaste förklaringen på YouTube, och den ligger helt i linje med artikelns avsnitt om avvägningen mellan kvalitet och kostnad.

Mellannivå
9 minuter
Video

RAG kontra finjustering

IBM Technology. Ett mer avgränsat fokus på de två tekniker som team oftast blandar ihop. Videon går djupare in på datas aktualitet, källhänvisningar och argumentet att finjustering kan ge snabbare inferens. Den är värd att se om du specifikt försöker argumentera mot ett onödigt finjusteringsprojekt.

Avancerad
13 minuter
Video

RAG kontra finjustering kontra promptutformning: optimera AI-modeller

IBM Technology. En tydlig whiteboardgenomgång av alla tre teknikerna och deras respektive kostnader: latens vid informationshämtning, beräkningskostnaden för träning och katastrofal glömska samt begränsningarna med lösningar som enbart bygger på prompter. Den tar också upp de kombinationer som faktiskt är rimliga i produktion. Det avslutande exemplet, där ett juridiskt AI-system använder alla tre teknikerna, motsvarar nästan exakt artikelns argument om när de bör kombineras.

Avancerad
131 minuter
Video

Så använder jag LLM:er

Andrej Karpathy. Karpathy ägnar särskilda kapitel åt ”Var medveten om vilken modell du använder och prisnivåerna” och ”Tänkande modeller och när de ska användas”. Under resten av genomgången fortsätter han sedan att växla mellan ChatGPT, Claude, Gemini, Grok och Perplexity. Det är det närmaste du kommer att se artikelns snabbguide tillämpas i realtid av någon med tydliga uppfattningar om när varje nivå är värd sitt pris.

Nybörjare
17 minuter
Video

Den nya, smartaste AI:n: Claude 3 – testad mot Gemini 1.5 och GPT-4

AI Explained. Videon är äldre än artikeln (mars 2024), men det är metodiken som är användbar: en och samma noggranna granskare kör samma svåra uppgifter – OCR, mentalisering, instruktionsföljning och matematik – genom tre ledande modeller sida vid sida och visar exakt var var och en brister. Modellnamnen är inaktuella, men ramverket för att jämföra modeller är det inte.

Nybörjare
32 minuter
Video

Snabb LLM-servering med vLLM och PagedAttention

Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.

Avancerad
19 minuter
Video

Alla AI-modeller förklarade

Tina Huang. En lugn 19 minuter lång översikt över de stora modellfamiljerna – OpenAI:s GPT-serie, Anthropics Claude, Googles Gemini och dessutom aktörerna inom öppen källkod – samt vilken nivå inom varje familj som är värd din tid. När artikeln har sagt åt dig att ”välja en och hålla dig till den i en månad” förklarar videon vad rullgardinsmenyn i just det verktyget faktiskt erbjuder. Uppriktigt åsiktsdriven utan att vara tillspetsad.

Ny inom AI