Ämne

Privat och lokal AI i egen drift

Lokala modeller, mönster för privat driftsättning, inferens i egen drift och hybridarkitekturer.

18 innehållsposter (12 artiklar · 6 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

8 min läsning
Artikel

Koppla samman två DGX Spark-enheter: QSFP, SSH, RoCE och Cluster Assistant

En praktisk guide till att länka två NVIDIA DGX Spark-enheter med QSFP och ConnectX-7: samma användarnamn, lösenordsfri SSH, RoCE för distribuerade arbetsbelastningar, NVIDIA Sync Cluster Assistant och återställning.

Avancerad
8 min läsning
Artikel

Lokal inferens på DGX Spark: minne, programvarustack och när molnet fortfarande vinner

Så tolkar du NVIDIA:s uppgifter om 128 GB koherent minne och cirka 200 miljarder parametrar på en enda nod, väljer en programvarustack och utformar de tester som avgör om lokal inferens passar.

Avancerad
9 min läsning
Artikel

DGX Spark: vad det är, vem det är till för och vad som ändrats för lokala agenter

En saklig genomgång av NVIDIA DGX Spark: Grace Blackwell GB10-specifikationer från NVIDIA, koherent enhetligt minne, ConnectX-7-klustring och när en agentdator för skrivbordet är rätt satsning på privat AI.

Avancerad
7 min läsning
Artikel

Hermes Agent: vad det är, vad det inte är och när du ska använda det

En tydlig översikt över Hermes Agent från Nous Research: beständigt minne, färdigheter, verktyg och meddelandegateways, samt hur du avgör när en chattbot räcker och när en agentkörmiljö är rätt verktyg.

Mellannivå
8 min läsning
Artikel

Anropa vLLM och andra OpenAI-kompatibla slutpunkter från n8n

Anropa en lokal OpenAI-kompatibel /v1/chat/completions-slutpunkt från n8n-noden HTTP Request, med tydlig autentisering, väl avvägda tidsgränser, kontroll av bas-URL och en privat nätverksgräns.

Mellannivå
10 min läsning
Artikel

NemoClaw på DGX Spark: plan för driftsättning och säkerhet

Planera och utvärdera OpenClaw, Hermes eller Deep Agents Code i NVIDIA OpenShell på DGX Spark: aktuell introduktion, policylager, dirigerad inferens och det acceptansunderlag som krävs.

Avancerad
9 min läsning
Artikel

Konfigurera en personlig OpenClaw-gateway: installation, introduktion och kontrollpanel

Vad OpenClaw är, hur du installerar och konfigurerar flerkanalsgatewayen i egen drift, öppnar Control UI på port 18789 och vilka Node-versioner som stöds utan att hoppa över säkerhetsbaslinjen.

Mellannivå
10 min läsning
Artikel

Experimentell stack med två DGX Spark-enheter, DeepSeek-V4-Flash, n8n och Hermes

Så utvärderar du en experimentell väg från användargemenskapen för DeepSeek-V4-Flash på två DGX Spark-enheter, med n8n för den deterministiska delen och Hermes för bedömningsuppgifter.

Avancerad
37 minuter
Video

Uppdatering om funktionerna i VMware Private AI Foundation från Broadcom

Tech Field Day. Visar privat AI som en infrastruktur i flera lager: kontrollerad beräkningskapacitet, isolerade miljöer, Kubernetes, inferenscontainrar, modellstyrning, självbetjäningsbaserad provisionering, delning av GPU-resurser och övervakning. Det motsvarar direkt artikelns varning om att integritet beror på gränserna för driftsättningen, loggar, åtkomst och drift – inte på ordet ”lokal”.

Avancerad
13 min läsning
Artikel

Finjustering 2026: ett evidensbaserat experiment med LoRA och QLoRA

Avgör om parametereffektiv finjustering är motiverad, styr datahanteringen, lås ett reproducerbart experiment, jämför resultat på undanhållna data och säkerhetstester samt mät serveringen före driftsättning.

Avancerad
157 minuter
Video

Finjustering av LLM-modeller – kurs i generativ AI

freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.

Avancerad
59 minuter
Video

Utveckla en LLM: bygga, träna och finjustera

Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.

Avancerad
14 minuter
Video

Lär dig Ollama på 15 minuter – kör LLM-modeller lokalt GRATIS

Tech With Tim. En koncis genomgång av Ollama utan krusiduller – installera, hämta en modell, chatta, prova sedan det lokala HTTP-API:et från Python och skapa en anpassad modell med en Modelfile. Den omfattar precis det arbetsflöde som artikeln beskriver för daglig användning på en Mac, inklusive hur du bör tänka kring modellstorlek i förhållande till datorns RAM-minne.

Mellannivå
6 minuter
Video

Handledningen i LM Studio: kör stora språkmodeller (LLM:er) på din bärbara dator

Kevin Stratvert. Samma arbetsflöde som i Ollama, men i ett grafiskt gränssnitt: ladda ner LM Studio, hämta en Llama- eller Gemma-modell, chatta, lägg in en PDF-fil och ställ frågor om den. Bra för läsare som helst slipper arbeta i terminalen – och även användbar för att få en känsla för hur en 1B–3B-modell faktiskt presterar jämfört med en tyngre modell.

Mellannivå
32 minuter
Video

Snabb LLM-servering med vLLM och PagedAttention

Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.

Avancerad