Privaatne, kohalik ja ise majutatud AI
Kohalikud mudelid, privaatse juurutuse mustrid, ise majutatud käitus ja hübriidarhitektuurid.
18 lugu (12 artiklit · 6 videot)
Alusta siit
Mõned head esimesed materjalid enne kogu voo sirvimist.
10 min lugemistKohalik AI sinu Macis: Ollama, LM Studio ja see, mida 7B mudelid tegelikult suudavad
AI lokaalne käivitamine on küpsenud. Ollama või LM Studio ja moodsa Maciga saad jooksutada võimekaid mudeleid offline'is, tasuta ja privaatselt. Mis töötab, mis mitte ja millised kasutusjuhud sellest tegelikult kasu saavad.
Edasijõudnud
10 min lugemistPrivaatse AI juurutusmustrid: kohalik, VPC, isehostitud ja hübriidne
Privaatne AI ei ole üks arhitektuur. Praktiline võrdlus kohalike mudelite, ettevõtte SaaS-i, VPC-juurutuste, isehostitud inferentsi ja hübriidmustrite vahel privaatsust ja kontrolli vajavatele VKE-dele.
Ekspert
11 min lugemistIse hostitud vs hallatud lahendus: audititav murdepunkt
Millise mastaabi juures võidab ise hostimine API-kõnesid? Tegelik matemaatika, operatiivsed reaalsused ja mustrid, mis eristavad tiime, kes peaksid ise hostima, neist, kes peaksid hallatud inferentsi eest edasi maksma.
EkspertVeel selles teemas
8 min lugemistKahe DGX Sparki ühendamine: QSFP, SSH, RoCE ja Cluster Assistant
Praktiline juhend kahe NVIDIA DGX Sparki ühendamiseks QSFP ja ConnectX-7 kaudu: sama kasutajanimi, SSH-võtmega autentimine, RoCE hajustööde jaoks, NVIDIA Sync Cluster Assistant ja tagasipööramisplaan.
Ekspert
8 min lugemistKohalik inferents DGX Sparkil: mälu, tarkvarapinu ja olukorrad, kus pilv on parem
Kuidas tõlgendada NVIDIA väiteid 128 GB koherentse mälu ja ligikaudu 200 miljardi parameetriga mudeli kohta, valida sobiv mudeliserver ning kavandada katsed, mis näitavad, kas kohalik inferents päriselt sobib.
Ekspert
9 min lugemistDGX Spark: mis see on, kellele see sobib ja mida see kohalike agentide jaoks muudab
Faktipõhine ülevaade NVIDIA DGX Sparkist: Grace Blackwell GB10 tehnilised näitajad, koherentne ühtmälu, ConnectX-7 klasterdamine ja olukorrad, kus lauaarvuti mõõtu agentserver on privaatse AI jaoks õige valik.
Ekspert
7 min lugemistHermes Agent: mis see on, mis see ei ole ja millal seda kasutada
Selge ülevaade Nous Researchi Hermes Agentist: püsiv mälu, oskused, tööriistad ja sõnumiväravad ning otsus, millal piisab vestlusrobotist ja millal on vaja agendi käituskeskkonda.
Edasijõudnud
8 min lugemistKutsu vLLM-i ja teisi OpenAI-ühilduvaid lõpp-punkte n8n-ist
Kutsu n8n-i HTTP Requesti sõlmest kohalikku OpenAI-ga ühilduvat /v1/chat/completions lõpp-punkti koos selge autentimise, ajalõpueelarvete, baas-URL-i kontrollide ja privaatse võrgupiiriga.
Edasijõudnud
10 min lugemistNemoClaw DGX Sparkil: kasutuselevõtu ja turvalisuse kava
Kavanda ja hinda OpenClawi, Hermese või Deep Agents Code’i käitamist NVIDIA OpenShellis DGX Sparkil: praegune kasutuselevõtt, poliitikakihid, marsruuditud inferents ja nõutavad vastuvõtutõendid.
Ekspert
9 min lugemistOpenClawi isikliku värava seadistus: paigaldamine, esmane seadistus ja juhtpaneel
Mis on OpenClaw, kuidas ise majutatud mitmekanalilist väravat paigaldada ja esmaselt seadistada, kuidas avada Control UI pordil 18789 ning millised Node’i versioonid on toetatud, jätmata turvalist lähteseadistust vahele.
Edasijõudnud
10 min lugemistEksperimentaalne kahe DGX Sparki, DeepSeek-V4-Flashi, n8n-i ja Hermese tehnoloogiapinu
Kuidas hinnata kogukonna eksperimentaalset kahe DGX Sparki lahendust DeepSeek-V4-Flashi jaoks, jättes deterministliku automatiseerimise n8n-ile ja hinnangut nõudva töö Hermesele.
Ekspert
37 minutitVMware Private AI Foundationi võimekused ja uuendused Broadcomilt
Tech Field Day. Näitab privaatset AI-d kihilise infrastruktuurina: kontrollitud arvutus, eraldatud keskkonnad, Kubernetes, inferentsikonteinerid, mudelihaldus, iseteenindus, GPU jagamine ja monitooring. See sobib artikli hoiatusega, et privaatsus sõltub piiridest, logidest, ligipääsust ja operatsioonidest, mitte sõnast "lokaalne".
Ekspert
13 min lugemistPeenhäälestus 2026. aastal: tõenditest lähtuv LoRA ja QLoRA katse
Otsusta, kas parameetrisäästlik peenhäälestus on põhjendatud, halda andmeid nõuetekohaselt, fikseeri korratav katse, võrdle eraldatud testandmete ja ohutuse tulemusi ning mõõda enne juurutamist mudeliteenindust.
Ekspert
157 minutitLLM-mudelite fine-tuning – generatiivse AI kursus
freeCodeCamp.org. Pikk, teooria-siis-kood kursus, mis katab kvantiseerimise, LoRA, QLoRA ja täis-PEFTi Llama 2 ja Gemma peal — riistvaral, mis enamikul arendajatel päriselt olemas on. See on YouTube'is kõige lähemal "vaata üle õla kellelegi, kes seda teinud on" kogemusele ja sobib artikli "sul pole vaja klastrit" väitega koos konkreetsete VRAM-eelarvetega.
Ekspert
59 minutitLLM-i arendamine: ehitamine, treenimine, finetuning
Sebastian Raschka. Sebastian Raschka aeglasem läbikäik sellest, kus fine-tuning laiemas LLM-treeningu konveieris istub — instruction tuning, klassifikatsiooni fine-tuning, parameetri-tõhusad meetodid ja kompromissid, mida artikkel välja toob enne LoRA soovitamist. Hea kalibreerimine enne alustamist, eriti kui su tiim arutleb, kas fine-tuning on üldse õige samm.
Ekspert
14 minutitÕpi Ollama selgeks 15 minutiga - käivita LLM mudeleid lokaalselt TASUTA
Tech With Tim. Tihke, asjalik Ollama läbikäik — paigaldus, mudeli tõmbamine, vestlus, siis lokaalse HTTP API torkimine Pythonist ja kohandatud mudeli loomine Modelfile'iga. Katab täpselt selle töövoo, mida artikkel Macis igapäevaseks kasutamiseks kirjeldab, sealhulgas kuidas mõelda mudeli suurusest vs su masina RAM-i kohta.
Edasijõudnud
6 minutitLM Studio õpetus: käivita suuri keelemudeleid (LLM) oma sülearvutil
Kevin Stratvert. Sama töövoog mis Ollama, aga GUI-s: laadi LM Studio alla, tõmba Llama või Gemma mudel, vestle, kukuta PDF sisse ja küsi selle kohta küsimusi. Hea lugejatele, kes pigem terminalis ei elaks — kasulik ka selle jaoks, et saada tunnetus, kuidas 1B–3B mudel raskema vastu päriselt esineb.
Edasijõudnud
32 minutitKiire LLM-serveerimine vLLM-i ja PagedAttentioniga
Anyscale. Käib läbi, miks naiivne LLM-serveerimine raiskab 60–80% GPU mälust, kuidas PagedAttention laenab OS-i stiilis pagineerimist seda parandama ja miks pidev batching toodab 24× läbilaskvuse numbreid, mida artikkel oma matemaatikas kasutab. Pärast seda lakkab artikli "õnneks tabad 50% kasutusastet" rida abstraktne olemast.
Ekspert