Kohalik inferents DGX Sparkil: mälu, tarkvarapinu ja olukorrad, kus pilv on parem
Ekspert8 min lugemistPrivaatne ja lokaalne AI

Kohalik inferents DGX Sparkil: mälu, tarkvarapinu ja olukorrad, kus pilv on parem

Kuidas tõlgendada NVIDIA väiteid 128 GB koherentse mälu ja ligikaudu 200 miljardi parameetriga mudeli kohta, valida sobiv mudeliserver ning kavandada katsed, mis näitavad, kas kohalik inferents päriselt sobib.

Mida oskad pärast teha

Sparki 128 GB koherentne mälu võimaldab käitada suuri kohalikke mudeleid, kuid arvutustäpsus, konteksti pikkus, samaaegsus ja mudeliserveri tarkvara määravad, kas tulemuseks on kasulik tootmisinferents või mälupuudusega lõppev demo.

Salvestatakse ainult selles brauseris.
Selles artiklis

DGX Sparki väärtus ei seisne üksnes selles, et GPU mahub töölauale. Grace Blackwell GB10 pakub 128 GB koherentset ühtmälu ning NVIDIA toetatud tarkvarateed DGX OS-i, konteinerite ja klasterdamise jaoks. See võimaldab kohapeal käitada varasemast suuremaid mudeleid, kuid ei kaota mälupiire, mudeliserveri tõrkeid ega pilveteenuse majanduslikke eeliseid.

Järgnev täiendab praktilise käitusvaatega ülevaadet mis DGX Spark on. Tehnilised näitajad ja tootjaväited pärinevad NVIDIA tootelehelt ja väljalaskemärkmetest; dokumentatsiooni kontrolliti 4. augustil 2026.

Kohalik inferents tarbib endiselt märkimisväärselt elektrit ja eraldab palju soojust. Mõõda toiteahelat ja jahutust pideva koormuse, mitte jõuderežiimis demo järgi. Ära ava OpenAI-ga ühilduvaid porte avalikku internetti ilma autentimise, TLS-i ja võrgupoliitikata.

Ühtne mälu: mida „128 GB koherentne“ praktikas tähendab

Tavapärase eraldiseisva GPU-ga serveris tuleb mudelikaalud ja KV-vahemälu mahutada GPU VRAM-i ning kõik muu süsteemimällu, kusjuures andmete kopeerimine üle PCIe piiri on kulukas.

Sparki arhitektuur pakub koherentset ühtmälu: CPU ja GPU jagavad NVIDIA andmetel üht 128 GB LPDDR5x mäluruumi. Mudeliserveri kavandamisel tähendab see järgmist:

  • Suured mudelikaalud saavad paikneda samas mäluruumis, mida käituskeskkond kasutab aktivatsioonide ja KV-vahemälu jaoks.
  • Füüsiline ülempiir jääb: mudelikaalud, KV-vahemälu, raamistiku lisakulu, operatsioonisüsteem ja muud teenused peavad kõik mällu mahtuma.
  • Ribalaius ja latentsus erinevad suure HBM-mäluga andmekeskuse GPU-dest. NVIDIA avaldatud mäluribalaius on riistvarapiir, mitte lubadus kindla tokenite arvu kohta sekundis.

Ligikaudne mälueelarve (illustratiivne, mitte garantii)

Kasuta seda ligikaudse planeerimisalusena. Täpne mälukasutus sõltub mudeli arhitektuurist, kvantimisest ja serverimootorist.

TarbijaMis see sööb
MudelikaaludSuurim mälukulu; FP4, FP8 ja INT4 muudavad seda oluliselt
KV-cacheKasvab konteksti pikkuse × samaaegsete jadadega
Käituskeskkond, CUDA graafid ja raamistikMärkimisväärne püsiv lisakulu
Operatsioonisüsteem, Docker, agendid ja seireSeda alahinnatakse ka sihtotstarbelises serveris
VaruJäta marginaal piikidele ja uuendustele

Koosta mälueelarve samaaegsete tippkoormuste mõõtmise, mitte ühe vestluse põhjal. KV-vahemälu kasv on üks mälupuuduse põhjustest; tekita see koormustestis uuesti, mitte ära käsitle seda juhusliku kahe seansi tõrkena.

NVIDIA ~200B ühe sõlme väite lugemine

NVIDIA turundab DGX Sparki AI-mudelitele kuni ~200 miljardi parameetrini ühel lauaüksusel suure ühtse mäluga. Loe seda kui:

  • Tootja kirjeldatud võimekuse ülempiiri, mitte mõõdetud teenustaset iga avatud mudeli kohta.
  • Võimekust, mis sõltub tegelikust arvutustäpsusest — NVIDIA toob esile FP4 tippjõudluse kuni 1 PFLOP — ja toetatud mudeliserverist.
  • Väidet, mis ei ütle, kas sinu eelistatud mudel, tokeniseerija, tööriistakutse mall ja hindamiskomplekt sellel suurusel hästi töötavad.

Mida väide ei ütle:

  • Ligikaudu 200 miljardi parameetriga mudeli täistäpsusega käitamist pika konteksti ja suure samaaegsusega.
  • Võrdset kvaliteeti tipptasemel majutatud mudelitega keerukates ülesannetes.
  • Konkreetset tokenite arvu sekundis, mida saaks kliendilepingus lubada.

Suuremate mudelite või tensorparalleelse inferentsi jaoks kirjeldab NVIDIA mitme sõlme, tavaliselt 2–4 Sparki, ühendamist ConnectX-7 kaudu. Vaata klastridokumentatsiooni ja juhendit kahe Sparki ühendamiseks. Kogukonna lahendused, näiteks tensorparalleelne vLLM üle RoCE, kehtivad üksnes konkreetse seadistuse kohta. Nende tokenit/s ja maksimaalse konteksti tulemused tuleb oma riistvaral uuesti mõõta.

Dokumenteeritud mudeliserveri valikud

Kasulik mõttemudel:

DGX OS (Ubuntu-põhine NVIDIA tarkvarapinu)
  → NVIDIA draiverid ja konteinerite käituskeskkond
    → mudeliserveri konteiner (vLLM, TensorRT-LLM, NIM või muu)
      → OpenAI-ga ühilduv HTTP-liides või gRPC
        → agendid, n8n ja kohtvõrgu rakendused

DGX OS ja konteinerid

DGX Spark töötab DGX OS-il. Kavanda uuendused, taaskäivitusaknad ja Dockeri või samaväärse lahenduse õigused nagu iga inferentsiserveri puhul. NVIDIA tegevusjuhendid eeldavad ajakohast DGX OS-i paigaldust ning töötavat nvidia-smi käsku ja konteineri juurdepääsu GPU-le. Kontrolli need enne, kui hakkad viga otsima mudelist.

Mudeliserveri valikud: lähtu kriteeriumidest, mitte moest

TarkvarapinuTüüpiline põhjus validaEttevaatused
vLLMOpenAI-ga ühilduv liides, lai avatud mudelite valik ja mitme sõlme juhendidVersiooni ja kvantimise ühilduvus; samaaegsete jadade ning KV-vahemälu häälestamine
TensorRT-LLM (TRT-LLM)NVIDIA-optimeeritud mootorid toetatud mudeliteleMootori ehituskulu; kitsam „parim tee“ mudeli kohta
NVIDIA NIM / NGC lahendusedNVIDIA pakendatud mikroteenus toetatud mudelileMudelikataloog ja litsentsitingimused; kõiki Hugging Face’i mudeleid ei toetata
llama.cpp või OllamaLihtne kohalik kasutus väiksemate või kvanditud mudelitegaEi pruugi sobida suurimatele Sparki töökoormustele

NVIDIA dgx-spark-playbooks sisaldab vLLM-i, TRT-LLM-i, Ollama ja teiste lahenduste tegevusjuhendeid. Alusta hindamist tootja kehtivast juhendist, fikseeri kõigi artefaktide versioonid ja kohanda seadistust alles pärast seda, kui oled seadmes lähtetaseme korratavalt taastanud.

Agendipoolne lõpp-punkt

Enamik VKEde integratsioonikihte — n8n, Hermes, OpenClaw ja kohandatud rakendused — eeldab kohtvõrgus või VPN-is OpenAI-ga ühilduvat /v1/chat/completions baas-URL-i. Hoia see liides stabiilsena ka siis, kui vahetad selle taga mudeliserverit. Logi iga hindamisega mudeli ID, kvantimine ja serveriversioon, et kvaliteedi halvenemise põhjus oleks tuvastatav.

Mõõtmisprotokoll (miinimum)

Enne kui kutsud kohalikku mudelit „tootmiseks“:

  1. Alusta hindamiskomplektiga, milles on 20–50 tegelikku tööd esindavat prompti, mitte mänguline vestlus. Laienda komplekti uute tõrkeklasside leidmisel; see on suitsutesti maht, mitte statistiline garantii.
  2. Salvesta kuupäev, serverimootori versioon, mudeli ID, arvutustäpsus, maksimaalne kontekst ja samaaegsus.
  3. Mõõda p50- ja p95-latentsust ning mäluületuste ja ajalõppude määra selle samaaegsuse juures.
  4. Hinda kvaliteeti inimrubriigi või automatiseeritud kontrollidega, mida selle ülesande jaoks usaldad.
  5. Käivita sama protokoll uuesti pärast iga mootori või OS-i uuendust.

Ilma sellise korduva mõõtmiseta muutub Sparki jõudlus folklooriks: „teisipäeval tundus see kiire“.

Ebaõnnestumismustrid, mille jaoks peaksid disainima

EbaõnnestumineSümptomLeevendus
Mudelikaalude või KV-vahemälu ületäitumineProtsess lõpetatakse, CUDA teatab mälupuudusest või töötlejad seiskuvadVähenda konteksti, samaaegsust või täpsust; jaota töö sõlmede vahel
Temperatuuri- või toitepiirangLatentsus suureneb kestva koormuse ajalMõõda pideva koormuse all; kontrolli õhuvoolu ja toiteahelat
Aegunud konteiner või draiverite lahknevusPärast OS-i uuendust tekivad raskesti seletatavad krahhidFikseeri versioonid ja tee pärast iga uuendust suitsutest
Ketas saab mudelivahemälu tõttu täisAllalaadimine ebaõnnestub või konteinerikihid riknevadPlaneeri NVMe maht mudelitele ja logidele; puhasta vahemälu
Ühe sõlme katkestusAgendid teatavad tõrkest või vaikivadTervisekontrollid ning dokumenteeritud pilve- või SaaS-varutee
Autentimata APIIga kohtvõrgu kasutaja pääseb privaatsele mudelileSeo teenus privaatliidesega, autendi kasutajad ja rakenda võrgu juurdepääsuloend
Kvantimise kvaliteedilangusKeerukates ülesannetes tekib ladus, kuid vale vastusÜlesandepõhine hindamiskomplekt enne tootmisse laskmist
Agendi tööriistade kuritarvitamineKohalik mudel + käsukest ≠ turvalineLiivakast (vaata NemoClaw); lubatud loendid

Kohalik ei tähenda logimata. Määra promptide, tööriistajälgede ja leitud dokumentide säilitamisreeglid. Ketta krüptimine ja juurdepääsukontroll on sama olulised kui asjaolu, et pilve-API-t ei kasutata.

Millal pilv endiselt võidab

Hoia kirjalikku reeglit, mitte tunnet:

Eelista pilve või hallatud inferentsiteenust, kui:

  • Vajad tipptasemel kvaliteeti, mida kohalik avatud mudel sinu hindamiskomplektis ei saavuta.
  • Koormus esineb harvade tippudena ja suurema osa ajast jõude seisva riistvara kapitalikulu on määrav.
  • Sul puudub DGX OS-i ja konteinerite käitamise võimekus või toimiv valvekorraldus.
  • Vajad mitme piirkonna kõrgkäideldavust või teenusepakkuja SLA-d.
  • Vajalik mudel või modaalsus ei ole Sparki mudeliserveris veel saadaval või stabiilne.

Eelista Sparki (või Spark + teine sõlm), kui:

  • Selle töövoo andmed peavad jääma kohapeale või kontrollitud kohtvõrku.
  • Kohaliku agenditöövoo latentsus on tähtsam kui tipptasemel mudeli absoluutne kvaliteet.
  • Püsiv inferentsikoormus õigustab kapitalikulu.
  • Sul on inimesed, kes saavad hallata juurutust, hindamisi ja intsidente.

Kuluraamistus ilma vale täpsuseta

Ära tuleta tasuvuskuud blogipostitusest. Koosta selgelt märgitud eeldustega lihtne kulumudel:

SisendAllikas
Riistvara + maks + saatmineDateeritud edasimüüja/NVIDIA pakkumine
Toide pideva ja tsüklilise koormuse korralMõõdetud tarbimine või PSU/TDP andmed × kohalik kWh hind; märgi hinnanguna
Inseneritunnid kuusTegelik tööjõukulu
Pilve alternatiivPraegune tokeni või GPU-tunni hind sama kvaliteediriba jaoks

Kui pilvelahendus on odavam ja sobib selle andmeklassi jaoks, on Spark valikuline. Kui andmeklass välistab pilve, on kapitalikulu vastavusnõude täitmise hind, mitte tokenite arvu optimeerimine sekundis.

Hübriidlahendus jääb küpseks mustriks: klassifitseeri päring, suuna piiratud töö kohalikku keskkonda ning saada avalik või keerukat arutlemist nõudev töö pärast tundlike andmete eemaldamist kinnitatud majutatud mudelitele. See on sama raamistik nagu privaatse AI juurutusmustrites.

Ehitaja kontrollnimekiri (üks sõlm)

  1. Kinnita, et DGX OS, draiver ja nvidia-smi vastavad heakskiidetud ajakohasele lähtetasemele.
  2. Vali esimeseks tootmiskandidaadiks üks mudeliserver ja üks mudel.
  3. Mõõda laadimisaega, tokenite arvu sekundis fikseeritud samaaegsuse juures, maksimaalset konteksti enne mäluületust ning kvaliteeti fikseeritud hindamisandmestikul. Lisa mõõtmisele kuupäev.
  4. Tee OpenAI-ga ühilduv HTTP-liides kättesaadavaks ainult autenditud privaatliidesel.
  5. Lisa tervisekontrollid ja dokumenteeritud pilve varuvariant.
  6. Alles siis ühenda agendid, kanalid või n8n.

Ära tee seda veel

  • Ära luba klientidele „200B kohalik“ ilma nimetamata täpsust, konteksti ja mõõdetud latentsust.
  • Ära käita esimest agenti piiramatu käsureajuurdepääsuga samas serveris, kus hoitakse tootmissaladusi.
  • Ära jäta mitme sõlme dokumente vahele ja oota, et QSFP-maagia parandaks ühe sõlme OOM-i.
  • Ära kasuta kogukonna tokenit/s ekraanipilti võimsuse planeerimise alusena.

Kohalik inferents Sparkil on toimiv siis, kui mälueelarve, mudeliserveri tarkvarapinu ja käituskorraldus on tegelikult läbi mõeldud. Riistvara leevendab VRAM-i piiranguid, kuid ei kaota inseneritööd.

Järgmisena loe

Jätka sama õpiteekonda järgmiste praktiliste artiklitega.