Privat och lokal AI i egen drift
Lokala modeller, mönster för privat driftsättning, inferens i egen drift och hybridarkitekturer.
10 innehållsposter (4 artiklar · 6 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
10 min läsningLokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar
Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.
Mellannivå
10 min läsningMönster för privat AI-driftsättning: lokalt, i VPC, i egen drift och hybrid
Privat AI är inte en enda arkitektur. Här jämförs lokala modeller, SaaS för företag, VPC-driftsättning, inferens i egen drift och hybridmönster för små och medelstora företag som behöver integritet och kontroll.
Avancerad
11 min läsningInferens i egen drift eller som värdtjänst: vLLM, TGI och nollpunktskalkylen
Vid vilken skala blir egen drift billigare än API-anrop? Den faktiska kalkylen, den operativa verkligheten och mönstren som skiljer team som bör driva själva från dem som bör fortsätta betala för hanterad inferens.
AvanceradMer i detta ämne
37 minuterUppdatering om funktionerna i VMware Private AI Foundation från Broadcom
Tech Field Day. Visar privat AI som en infrastruktur i flera lager: kontrollerad beräkningskapacitet, isolerade miljöer, Kubernetes, inferenscontainrar, modellstyrning, självbetjäningsbaserad provisionering, delning av GPU-resurser och övervakning. Det motsvarar direkt artikelns varning om att integritet beror på gränserna för driftsättningen, loggar, åtkomst och drift – inte på ordet ”lokal”.
Avancerad
13 min läsningFinjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster
LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.
Avancerad
157 minuterFinjustering av LLM-modeller – kurs i generativ AI
freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.
Avancerad
59 minuterUtveckla en LLM: bygga, träna och finjustera
Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.
Avancerad
14 minuterLär dig Ollama på 15 minuter – kör LLM-modeller lokalt GRATIS
Tech With Tim. En koncis genomgång av Ollama utan krusiduller – installera, hämta en modell, chatta, prova sedan det lokala HTTP-API:et från Python och skapa en anpassad modell med en Modelfile. Den omfattar precis det arbetsflöde som artikeln beskriver för daglig användning på en Mac, inklusive hur du bör tänka kring modellstorlek i förhållande till datorns RAM-minne.
Mellannivå
6 minuterHandledningen i LM Studio: kör stora språkmodeller (LLM:er) på din bärbara dator
Kevin Stratvert. Samma arbetsflöde som i Ollama, men i ett grafiskt gränssnitt: ladda ner LM Studio, hämta en Llama- eller Gemma-modell, chatta, lägg in en PDF-fil och ställ frågor om den. Bra för läsare som helst slipper arbeta i terminalen – och även användbar för att få en känsla för hur en 1B–3B-modell faktiskt presterar jämfört med en tyngre modell.
Mellannivå
32 minuterSnabb LLM-servering med vLLM och PagedAttention
Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Avancerad