Pärast teise DGX Sparki soetamist on see üks võimalik laboriarhitektuur: suure mudeli kohalik inferents, ärisüsteemidega suhtlev automatiseerimine ja agendi käituskeskkond. See ei ole tootja toetatud kasutusvalmis lahendus.
Põhjendatav lahendus on kitsam: hindad nelja kihti, mida peab saama üksteisest eraldi muuta ja kontrollida.
- Kiire andmesidevõrk: kaks Sparki on hajusinferentsi jaoks ühendatud (NVIDIA klastridokumentatsioon, kahe Sparki ühendamise tegevusjuhend).
- Eksperimentaalne mudeliserver: kogukonna loodud OpenAI-ga ühilduv lahendus DeepSeek-V4-Flashi või DSparki spekulatiivse dekodeerimise variandi käitamiseks mõlemas sõlmes.
- Deterministlik automatiseerimine: n8n veebikonksude, ajakavade, CRM-i, e-posti ja Slacki toimingute, valideerimise ning inimese kinnitusetappide jaoks.
- Hinnangut nõudev agent: Hermes Agent triaažiks, mustanditeks, uurimiseks ning mälu ja mitmeastmelist arutlust nõudvaks tööriistakasutuseks (ametlik API-serveri dokumentatsioon, ametlik veebikonksude dokumentatsioon).
Selles artiklis kirjeldatud n8n-i ja Hermese ühendamine on näitlik integratsioon, mitte kummagi tootja dokumenteeritud või toetatud kasutusvalmis lahendus. Kui töövoog vajab agendi tulemust tagasi n8n-i, kasuta Hermese kandjatõendiga autentitud API-serverit. Hermese HMAC-veebikonksu adapter on eraldi sündmuste sisestuspind: see käivitab agendi ja edastab tulemuse määratud sihtkohta, selle asemel et määratleda n8n-i jaoks üldine sünkroonne vastuseleping.
Valikuline viies kiht on OpenClaw vestluskanalite kasutajaliidese jaoks, mille saab soovi korral käivitada NemoClawi ja OpenShelli kaudu, kui vajad liivakastipoliitikaid. NemoClaw on praegu alfaetapis varase eelvaate projekt, mitte tootmisvalmis tarkvara. Allpool kirjeldatud kolme töövoo jaoks ei ole kumbki kiht kohustuslik.
Ära saada agenditöövoost automaatselt kliendikirju, esita õigusdokumente, muuda tootmistaristut ega tee makseid. Suuna pöördumatud toimingud inimese kinnitusetappi, kuni olemas on logid, idempotentsus ja piisav hulk üle vaadatud katseid.
Mida DeepSeek-V4-Flash muudab kahel Sparkil
DeepSeek-V4-Flash on ekspertide segu mudel, millel on ametliku mudelikaardi järgi 284B parameetrit, millest aktiveeritakse 13B, ja 1M-tokenine kontekstiaken. Juhiste järgimiseks häälestatud mudelikaalud kasutavad marsruuditud ekspertides FP4 ja mujal FP8 täpsust. See on Sparkil oluline, sest:
- Aktiveeritud parameetrite arv hoiab dekodeerimiskulu paremini kontrolli all kui sama nimisuurusega tihedas mudelis.
- Pikk kontekst võib olla kasulik agenttöövoogudes, näiteks lähtekoodi lõikude, piletiajaloo ja poliitikadokumentide puhul, kui leitakse õige materjal ja väited kontrollitakse üle.
- DSparki kontrollpunkt on sama mudel koos spekulatiivse dekodeerimise mooduliga. Selle ametliku mudelikaardi näide kasutab üht nelja GPU-ga GB300 sõlme, mitte kaht Sparki; allpool käsitletav kogukonna vLLM-i aruanne kasutab kahel GB10 süsteemil mudeli DSparkita kontrollpunkti.
Käsitle avaldatud tokenit/s tulemusi ja maksimaalse konteksti tulemusi konkreetse seadistuse aruannetena, mitte garantiina oma kaabli, draiveri, konteineri või samaaegsuse kohta. Ametlikud mudelikaardid ei kirjelda valideeritud kahe Sparki juurutust; DSparki näide kasutab üht nelja GPU-ga GB300 sõlme. Viimati kontrollitud 2026-08-10, avatud vLLM-i veateade #40969 kirjeldab ühe fikseeritud vLLM-i järgu puhul kahe GB10 süsteemi hangumist pärast kuuendat või seitsmendat päringut, kui kasutusel olid FULL_AND_PIECEWISE CUDA graafikud, tükeldatud eeltäitmine, Marlin MoE, FP8 KV-vahemälu ja TP=2. See on tõend selle konfiguratsiooni, mitte kõigi juurutuste kohta. Kasuta lahendust üksnes fikseeritud versioonidega eksperimendina, millel on toimiv varumudel.
Viitearhitektuur
┌─────────────────────────────┐
Vormid/CRM/Git ─►│ n8n (kontroll, harud, inimene) │──► Slack / CRM / e-post
└──────────────┬──────────────┘
│ HTTPS + bearer auth
▼
┌─────────────────────────────┐
│ Hermes (mälu, tööriistad, mustand) │
└──────────────┬──────────────┘
│ OpenAI-ga ühilduv /v1
▼
┌────────────────────────────────────────┐
│ Spark A ◄── QSFP / RoCE ──► Spark B │
│ kogukonna eksperimentaalne TP=2 mudel │
└────────────────────────────────────────┘
Prototüübist töökindla lahenduse poole liikumiseks järgi neid arhitektuurireegleid:
| Kiht | Vastutab | Ei tohi vastutada |
|---|---|---|
| n8n | Käivitajad, skeemid, korduskatsed, SaaS-i kirjutustoimingud, kinnitused | Piiramatu käsurida kohtvõrgus |
| Hermes | Klassifikatsioon, mustandid, uurimissammud, tööriistakasutus | Vaikivad tootmise kõrvalmõjud |
| Mudeliserver | Tokenid sisse / tokenid välja | Ärimandaadid |
| OpenClaw (valikuline) | Inimeste vestluskanalid ja lubatud loendid | Liivakastita serveri juurõigused |
Suuna Hermes ja kasutatavad n8n-i AI-sõlmed klastri lõpp-punkti tavalise OpenAI-ga ühilduva baas-URL-i kaudu. Hoia API-võtmed kohtvõrgus või VPN-is ning ära ava vLLM-i porti avalikku internetti.
Kasutuselevõtu kontrollnimekiri: järjekord on oluline
1. Kahe Sparki kiire andmesidevõrk
Järgi NVIDIA tegevusjuhendit, mitte foorumifolkloori:
- Sama kasutajanimi mõlemal sõlmel.
- Üks QSFP-kaabel vastavate ConnectX-7 portide vahel. NVIDIA tegevusjuhendi järgi saab kogu ribalaiust kasutada ühe kaabliga ning teise kaabli läbilaskevõime kasvu samade kahe süsteemi vahel ei ole dokumenteeritud.
- Kiire ühenduse jaoks eraldi L3-aadressid ja netplan-seadistus; kasuta halduseks ning internetiühenduseks 10 GbE või Wi-Fi ühendust.
- SSH-võtmega autentimine sõlmede vahel.
- Kinnita, et liidesed näitavad Up (
ibdev2netdev/ NVIDIA sammud), enne kui jälitad NCCL vigu.
NVIDIA Sync Cluster Assistant saab toetatud topoloogias seadistada ConnectX-7 ja SSH, kuid ei paigalda inferentsi tarkvarapinu.
2. Mudeliserver
- Vali konkreetne kogukonna juhend, mis fikseerib konteineri või tarkvaraversiooni, CUDA tarkvarapinu, vLLM-i paigad, käivituskäsud ja teadaolevad piirangud. Ära koosta tootmiskäsku selle artikli katkenditest.
- Kontrolli, et juhend toetaks sõnaselgelt sinu kaht GB10 sõlme ja täpset
DeepSeek-V4-Flashmudelit. Tensorparalleelsus astmega 2 on siin kontrollitav hüpotees, mitte ametlik tugilubadus. - Tee
/v1/modelsja/v1/chat/completionskättesaadavaks ainult privaatliidesel. - Salvesta tegelik maksimaalne kontekst, samaaegsete jadade ülempiir, KV-vahemälu andmetüüp ja spekulatiivse dekodeerimise olek.
- Hermese praegune dokumentatsioon nõuab vähemalt 64K tokeniga mudelikonteksti. Väiksema kontekstiga serveriprofiil ei tõenda ühilduvust praeguse Hermesega; seadista ja kestvustesti vähemalt 64K profiil enne selle ühendamist.
Tee enne agentide ühendamist suitsutest lühikeste, pikkade, korduvate ja samaaegsete promptidega. Kirjeldatud kahe Sparki tõrge ilmneb pärast mitut päringut, seega ei tõesta üks „tere“ peaaegu midagi. Lahendus ei ole tootmisvalmis enne, kui fikseeritud versioonidega kestvuskatse sinu riistvaral läbib.
3. Hermes
- Paigalda Hermes ametliku kiirjuhendi järgi ja suuna mudelipakkuja privaatsele OpenAI-ga ühilduvale baas-URL-ile.
- Allpool kirjeldatud päring-vastus-töövoogude jaoks luba API-server, määra tugev
API_SERVER_KEY, hoia teenus privaatliidesel ja kontrolliGET /healthlõpp-punkti; dokumenteeritud vaikeport on 8642. Kasuta otsetulemuse jaoks/v1/responsesvõi pika töö puhul/v1/runskoos oleku pärimisega. - Kui vajad sündmuste sisestamist ja tulemuse mujale edastamist, kasuta eraldi veebikonksu adapterit: nimetatud marsruudid, V2 ajatempliga HMAC, päringu ID-d duplikaatide eemaldamiseks ja vaikeport 8644. Ära pea adapteri vastuvõtukinnitust agendi väljundiks.
- Keela lai käsureajuurdepääs, kuni lubatud käskude loend on paigas ja inimene jälgib logisid. API-võti annab ligipääsu agendi tööriistadele, mitte ainult mudeli tekstile.
DGX Sparkil saab NemoClaw käitada Hermest OpenShellis failisüsteemi-, võrgu- ja protsessipoliitikatega. Käsitle seda alfaetapis hindamisteena, mitte tootmisturbe garantiina.
4. n8n
- Majuta ise samal usaldusväärsel võrgul (või VPN-is). Eelista mustreid artiklitest n8n kohalikud OpenAI-ühilduvad lõpp-punktid ja idempotentsus ning inimväravad.
- Allpool kasutatava päring-vastus-üleandmise jaoks seadista n8n-i ametlik HTTP Requesti sõlm kandjatõenditega ja selgete ajalõppudega. Hoia püsivat äriidempotentsuse kirjet n8n-is või ärisüsteemis. Hermese API-server toetab
Idempotency-Keyvastuste vahemällu salvestamist viieks minutiks, kuid see piiratud transporditaseme aken ei asenda töövoo püsivat deduplikeerimist. Kui valid teadlikult eraldi Hermese veebikonksutee, saab n8n-i Crypto sõlm luua HMAC-i, kuid allkirjastatud baidid ja V2 ajatempli päised peavad täpselt järgima Hermese veebikonksulepingut. n8n-i ja Hermese veebikonksu üleandmine on näitlik disain, mitte ametlik tootjaintegratsioon.
Kolm töökoormust lahenduse hindamiseks
Kasutusjuht A: privaatne kasutajatoe triaaž
Probleem: Piletid sisaldavad klienditeksti, mida sa ei taha avalikku mudelipakkujasse. Triaaž vajab endiselt hinnangut: tõsidus, tootepiirkond, duplikaatide tuvastus, vastuse mustand.
Voog:
- Kasutajatoe veebikonks → n8n.
- n8n valideerib skeemi, eemaldab saladused (tokenid, töötlemata kaardinumbrid) ja kõrvaldab pileti ID järgi duplikaadid.
- n8n salvestab töövoo tasemel idempotentsusvõtme ning saadab seejärel minimaalse koormuse kandjatõendiga privaatsele Hermese API-serverile kitsa ja versioonitud
support-triagepromptilepingu alusel. - Hermes kutsub kohalikku DeepSeek-V4-Flashi ja tagastab vastuse. n8n parsib ning valideerib skeemi järgi nõutud
{severity, product, confidence, draft, needs_human}objekti; vigane või mittetäielik väljund läheb inimesele ülevaatamiseks. - n8n haruneb: väikese kindluse või
needs_humanväärtuse korral küsib Slackis kinnitust; suure kindluse ja lubatud toimingu korral uuendab ainult pileti välju. Automaatset vastust ei saadeta enne eraldi heakskiidetud kasutuselevõtuetappi.
Kontrollitav hüpotees: n8n-i ühendused ja Hermese API-kutse võivad seda töövoogu toetada. Mudeli lõpp-punkt jääb privaatvõrku, kuid välised tööriistad ja SaaS-i ühendused ületavad endiselt andmepiiri ning vajavad väljuva liikluse kontrolli. Hinda, kas lisakontekst parandab tulemust, ning kontrolli mustandit igal juhul.
Ära: lase Hermesel avada pileti tekstist suvalisi URL-e ilma proksi lubatud sihtkohtade loendita, sest pilet võib sisaldada promptisüsti.
Kasutusjuht B: pika konteksti sisemine uurimisassistent
Probleem: juristid, käitusmeeskond või tehnilised juhid vajavad struktureeritud ülevaadet 40 PDF-ist või lähtekoodikogu osast, laadimata kogu materjali SaaS-i LLM-i.
Voog:
- Inimene jätab töökausta (või n8n jälgib turvalist postkasti).
- n8n pakendab metaandmed ja leitud tekstilõigud; teine võimalus on lasta Hermese tööriistadel lugeda lubatud teelt või RAG-indeksist.
- Hermes käitab DeepSeek-V4-Flashi abil mitmeastmelise uurimisprompti, millel on selge viitamisvorming.
- n8n valideerib vastuse kuju ja paigutab selle ülevaatusjärjekorda. Iga väide peab olema seotud allikafaili ja täpse tekstikohaga ning inimene kiidab selle heaks või lükkab tagasi.
Miks V4-Flash: 1M-tokenine kontekstiaken ja pika konteksti jaoks optimeeritud tähelepanumehhanism on selle mudeli tugevused, kuid pikk kontekstiaken ei taga täpsust. Leitud materjali kvaliteet ja viidete kontroll on tähtsamad kui maksimaalne tokenite arv.
Ära: Esita automaatselt regulatiivseid aruandeid ega meditsiinilisi kokkuvõtteid. Kasuta süsteemi ainult materjali mõistmiseks ja mustandite koostamiseks; allkirja annab litsentsitud spetsialist.
Kasutusjuht C: pidev käitustõrgete uurimine vestluskanalist
Probleem: valveinsener soovib alarmide ja logide põhjal hüpoteesi ning järgmist käitusjuhendi sammu koos võimalusega küsida Telegramis või Slackis järelküsimusi, andmata mudelile serveripargi juurõigusi.
Voog:
- n8n-i ajastus või PagerDuty veebikonks kogub alarmide tunnused.
- Hermes uurib kirjutamisõiguseta tööriistadega, näiteks logipäringu API ja oleku lõpp-punktidega, kasutades ainult lubatud pääsuandmeid.
- Hermes tagastab: hüpotees, tõendid, soovitatud järgmine käsk (mitte käivitatud).
- Valikuline OpenClaw/NemoClaw kanal, et valveinsener saaks eraldi konfigureeritud agendi käituskeskkonda päringuid saata, kasutades sidumise lubatud loendeid (OpenClaw turva põhialused). Ära eelda, et OpenClaw ja Hermes jagavad seanssi või mälusalvestust.
Kahe Sparki hüpotees: samaaegsed uurimised või suurem mudel ja kontekst võivad teist sõlme õigustada. Võrdle seda ühe Sparki ja hallatud inferentsiga, kasutades mõõdetud järjekorda, kvaliteeti, latentsust, kogukulu ning privaatsusnõudeid.
Ära: paranda tõrget automaatselt. Soovitatud käsud lähevad inimesele või oma autentimisega, rangelt piiritletud käitusjuhendi täiturile.
Ebaõnnestumismustrid, mille jaoks peaksid disainima esimesel päeval
| Ebaõnnestumine | Sümptom | Leevendus |
|---|---|---|
| NCCL-i või RoCE valeseadistus | Töö seiskub või langeb TCP-varuteele ja latentsus kasvab | Seo NCCL RoCE-liidestega; kontrolli andmesidevõrku enne agentide lisamist |
| Liiga pikk kontekst | Üks pikk töö blokeerib teisi | Piira max_model_len väärtust ja samaaegsust; halda järjekorda n8n-is |
| Sisendliidese kuritarvitamine | Ründaja käivitab Hermese | Kandjatõend või HMAC koos ajatempliga; privaatvõrk; päringusageduse piirangud |
| Promptisüst | Pileti tekst kirjutab poliitika üle | Eraldi süsteemimarsruudi promptid, tööriistade lubatud loendid ja töötlemata HTML-i keelamine käsureal |
| Vaikivad SaaS-kirjutused | Duplikaat CRM-uuendused | Idempotentsusvõtmed; inimvärav saatmisel |
| Mudeli triiv | Lahendus puruneb pärast konteineri uuendust | Fikseeri konteineritõmmise räsi ja tee CI-s suitsutestid |
Kuidas „valmis“ välja näeb
Võid väita, et tehnoloogiapinu töötab, kui:
- Fikseeritud versioonidega kahe Sparki tarkvarakomplekt läbib korduvad ja samaaegsed kestvuskatsed, sealhulgas algprojektis kirjeldatud tõrkestsenaariumi; salvesta katsete täpne arv, konteksti suurused ja veamäär.
- n8n → Hermes → mudeli tee on autentitud otsast otsani ja logitud; n8n valideerib tagastatud rakendusskeemi.
- Vähemalt üks nimetatud töövoog nõuab iga välise sõnumi puhul inimese kinnitust ja läbib eelnevalt määratud hindamiskomplekti.
- Olemas on kirjalik tagasipööramisplaan: keela n8n-i kutse Hermesele, kasuta ainult n8n-i malle või suuna Hermes väiksemale kohalikule mudelile.
Harjutus
Vali kasutusjuht A. Rakenda ainult veebikonksu valideerimine n8n-is, üks versioonitud promptileping kandjatõendiga Hermese API-serveri kaudu, töövoo tasemel idempotentsuskirje, kohalik mudelikõne, vastuseskeemi valideerimine ja mustandi eelvaade. Ära ühenda e-kirja saatmist. Kasuta esinduslikku heakskiidetud hindamiskomplekti, mis sisaldab nii tavapäraseid kui ka haruldasi juhtumeid, ning määra ette tõsiduse kooskõla, toetamata väidete, toimetamismahu, latentsuse ja tõrgete kriteeriumid. Otsusta nende tõendite põhjal, kas teine Spark või V4-Flash on põhjendatud.
Edasine lugemine
- DGX Spark: mis see on
- Ühenda kaks DGX Sparki
- NemoClaw’ liivakastis agendid Sparkil
- Hermes vs n8n
- n8n-i ja Hermese veebikonksu üleandmine
- Ametlik: DeepSeek-V4-Flashi mudelikaart, DeepSeek-V4-Flash-DSparki mudelikaart, Hermese API-server, Hermese veebikonksud, n8n-i HTTP Requesti sõlm, NVIDIA Sparki klastrid



