Privat och lokal AI i egen drift
Lokala modeller, mönster för privat driftsättning, inferens i egen drift och hybridarkitekturer.
18 innehållsposter (12 artiklar · 6 videor)
Börja här
Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.
10 min läsningLokal AI på din Mac: Ollama, LM Studio och vad 7B-modeller faktiskt klarar
Att köra AI lokalt har mognat. Med Ollama eller LM Studio och en modern Mac kan du köra kapabla modeller offline, kostnadsfritt och privat. Vad som fungerar, vad som inte gör det och användningsfallen som faktiskt gynnas.
Mellannivå
10 min läsningMönster för privat AI-driftsättning: lokal, VPC, egen drift och hybrid
Privat AI är inte en enda arkitektur. En praktisk jämförelse av lokala modeller, SaaS för företag, drift i VPC, inferens i egen regi och hybridmönster för små och medelstora företag som värdesätter integritet och kontroll.
Avancerad
11 min läsningEgen drift jämfört med hanterad inferens: en granskningsbar brytpunktsmodell
Vid vilken skala blir egen drift billigare än API-anrop? Den faktiska matematiken, de operativa realiteterna och mönstren som skiljer team som bör driva i egen regi från team som bör fortsätta betala för hanterad inferens.
AvanceradMer i detta ämne
8 min läsningKoppla samman två DGX Spark-enheter: QSFP, SSH, RoCE och Cluster Assistant
En praktisk guide till att länka två NVIDIA DGX Spark-enheter med QSFP och ConnectX-7: samma användarnamn, lösenordsfri SSH, RoCE för distribuerade arbetsbelastningar, NVIDIA Sync Cluster Assistant och återställning.
Avancerad
8 min läsningLokal inferens på DGX Spark: minne, programvarustack och när molnet fortfarande vinner
Så tolkar du NVIDIA:s uppgifter om 128 GB koherent minne och cirka 200 miljarder parametrar på en enda nod, väljer en programvarustack och utformar de tester som avgör om lokal inferens passar.
Avancerad
9 min läsningDGX Spark: vad det är, vem det är till för och vad som ändrats för lokala agenter
En saklig genomgång av NVIDIA DGX Spark: Grace Blackwell GB10-specifikationer från NVIDIA, koherent enhetligt minne, ConnectX-7-klustring och när en agentdator för skrivbordet är rätt satsning på privat AI.
Avancerad
7 min läsningHermes Agent: vad det är, vad det inte är och när du ska använda det
En tydlig översikt över Hermes Agent från Nous Research: beständigt minne, färdigheter, verktyg och meddelandegateways, samt hur du avgör när en chattbot räcker och när en agentkörmiljö är rätt verktyg.
Mellannivå
8 min läsningAnropa vLLM och andra OpenAI-kompatibla slutpunkter från n8n
Anropa en lokal OpenAI-kompatibel /v1/chat/completions-slutpunkt från n8n-noden HTTP Request, med tydlig autentisering, väl avvägda tidsgränser, kontroll av bas-URL och en privat nätverksgräns.
Mellannivå
10 min läsningNemoClaw på DGX Spark: plan för driftsättning och säkerhet
Planera och utvärdera OpenClaw, Hermes eller Deep Agents Code i NVIDIA OpenShell på DGX Spark: aktuell introduktion, policylager, dirigerad inferens och det acceptansunderlag som krävs.
Avancerad
9 min läsningKonfigurera en personlig OpenClaw-gateway: installation, introduktion och kontrollpanel
Vad OpenClaw är, hur du installerar och konfigurerar flerkanalsgatewayen i egen drift, öppnar Control UI på port 18789 och vilka Node-versioner som stöds utan att hoppa över säkerhetsbaslinjen.
Mellannivå
10 min läsningExperimentell stack med två DGX Spark-enheter, DeepSeek-V4-Flash, n8n och Hermes
Så utvärderar du en experimentell väg från användargemenskapen för DeepSeek-V4-Flash på två DGX Spark-enheter, med n8n för den deterministiska delen och Hermes för bedömningsuppgifter.
Avancerad
37 minuterUppdatering om funktionerna i VMware Private AI Foundation från Broadcom
Tech Field Day. Visar privat AI som en infrastruktur i flera lager: kontrollerad beräkningskapacitet, isolerade miljöer, Kubernetes, inferenscontainrar, modellstyrning, självbetjäningsbaserad provisionering, delning av GPU-resurser och övervakning. Det motsvarar direkt artikelns varning om att integritet beror på gränserna för driftsättningen, loggar, åtkomst och drift – inte på ordet ”lokal”.
Avancerad
13 min läsningFinjustering 2026: ett evidensbaserat experiment med LoRA och QLoRA
Avgör om parametereffektiv finjustering är motiverad, styr datahanteringen, lås ett reproducerbart experiment, jämför resultat på undanhållna data och säkerhetstester samt mät serveringen före driftsättning.
Avancerad
157 minuterFinjustering av LLM-modeller – kurs i generativ AI
freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.
Avancerad
59 minuterUtveckla en LLM: bygga, träna och finjustera
Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.
Avancerad
14 minuterLär dig Ollama på 15 minuter – kör LLM-modeller lokalt GRATIS
Tech With Tim. En koncis genomgång av Ollama utan krusiduller – installera, hämta en modell, chatta, prova sedan det lokala HTTP-API:et från Python och skapa en anpassad modell med en Modelfile. Den omfattar precis det arbetsflöde som artikeln beskriver för daglig användning på en Mac, inklusive hur du bör tänka kring modellstorlek i förhållande till datorns RAM-minne.
Mellannivå
6 minuterHandledningen i LM Studio: kör stora språkmodeller (LLM:er) på din bärbara dator
Kevin Stratvert. Samma arbetsflöde som i Ollama, men i ett grafiskt gränssnitt: ladda ner LM Studio, hämta en Llama- eller Gemma-modell, chatta, lägg in en PDF-fil och ställ frågor om den. Bra för läsare som helst slipper arbeta i terminalen – och även användbar för att få en känsla för hur en 1B–3B-modell faktiskt presterar jämfört med en tyngre modell.
Mellannivå
32 minuterSnabb LLM-servering med vLLM och PagedAttention
Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.
Avancerad