Ämne

Privat och lokal AI i egen drift

Lokala modeller, mönster för privat driftsättning, inferens i egen drift och hybridarkitekturer.

10 innehållsposter (4 artiklar · 6 videor)

Börja här

Börja med några rekommenderade innehållsposter innan du går igenom hela flödet.

Mer i detta ämne

37 minuter
Video

Uppdatering om funktionerna i VMware Private AI Foundation från Broadcom

Tech Field Day. Visar privat AI som en infrastruktur i flera lager: kontrollerad beräkningskapacitet, isolerade miljöer, Kubernetes, inferenscontainrar, modellstyrning, självbetjäningsbaserad provisionering, delning av GPU-resurser och övervakning. Det motsvarar direkt artikelns varning om att integritet beror på gränserna för driftsättningen, loggar, åtkomst och drift – inte på ordet ”lokal”.

Avancerad
13 min läsning
Artikel

Finjustering 2026: när LoRA slår RAG och hur du gör utan ett kluster

LoRA-finjustering har blivit tillgänglig – du kan göra riktiga finjusteringar på en bärbar dator eller hyra en GPU i en timme. Här är mönstren som fungerar, fallen där finjustering slår RAG och ett praktiskt arbetsflöde från dataförberedelse till driftsättning.

Avancerad
157 minuter
Video

Finjustering av LLM-modeller – kurs i generativ AI

freeCodeCamp.org. En lång kurs som går från teori till kod och omfattar kvantisering, LoRA, QLoRA och fullständig PEFT med Llama 2 och Gemma – på hårdvara som de flesta utvecklare faktiskt har. Det är det närmaste du kommer upplevelsen av att följa någon som redan har gjort detta på YouTube, och kursens konkreta VRAM-budgetar stöder artikelns påstående att du inte behöver ett kluster.

Avancerad
59 minuter
Video

Utveckla en LLM: bygga, träna och finjustera

Sebastian Raschka. Sebastian Raschkas metodiska genomgång av var finjustering hör hemma i den bredare träningsprocessen för stora språkmodeller: instruktionsträning, finjustering för klassificering, parametereffektiva metoder och de avvägningar som artikeln tar upp innan den rekommenderar LoRA. Videon ger en bra kalibrering innan du börjar, särskilt om teamet diskuterar huruvida finjustering ens är rätt steg.

Avancerad
14 minuter
Video

Lär dig Ollama på 15 minuter – kör LLM-modeller lokalt GRATIS

Tech With Tim. En koncis genomgång av Ollama utan krusiduller – installera, hämta en modell, chatta, prova sedan det lokala HTTP-API:et från Python och skapa en anpassad modell med en Modelfile. Den omfattar precis det arbetsflöde som artikeln beskriver för daglig användning på en Mac, inklusive hur du bör tänka kring modellstorlek i förhållande till datorns RAM-minne.

Mellannivå
6 minuter
Video

Handledningen i LM Studio: kör stora språkmodeller (LLM:er) på din bärbara dator

Kevin Stratvert. Samma arbetsflöde som i Ollama, men i ett grafiskt gränssnitt: ladda ner LM Studio, hämta en Llama- eller Gemma-modell, chatta, lägg in en PDF-fil och ställ frågor om den. Bra för läsare som helst slipper arbeta i terminalen – och även användbar för att få en känsla för hur en 1B–3B-modell faktiskt presterar jämfört med en tyngre modell.

Mellannivå
32 minuter
Video

Snabb LLM-servering med vLLM och PagedAttention

Anyscale. Går igenom varför naiv LLM-servering slösar bort 60–80 % av GPU-minnet, hur PagedAttention lånar sidindelning i stil med operativsystem för att lösa det och varför kontinuerlig batchning ger de 24× högre genomströmningstal som artikeln använder i sina beräkningar. Efter detta känns artikelns formulering ”du har tur om du når 50 % nyttjandegrad” inte längre abstrakt.

Avancerad