Tämä on mahdollinen laboratorioarkkitehtuuri toisen DGX Sparkin hankinnan jälkeen: suuren mallin paikallinen inferenssi, liiketoimintajärjestelmiin yhdistyvä automaatio ja agentin ajoympäristö. Kyse ei ole tuetusta, valmiista kokonaisuudesta.
Puolustettava versio on kapeampi. Arvioit neljää kerrosta, joiden on pysyttävä erillisinä:
- Tietoliikennekerros: kaksi Sparkia yhdistettynä hajautettua inferenssiä varten (NVIDIAn klusterointidokumentaatio, kahden Sparkin yhdistämisopas).
- Kokeellinen mallipalvelin: yhteisön rakentama OpenAI-yhteensopiva polku DeepSeek-V4-Flashille (tai spekulatiivista dekoodausta käyttävälle DSpark-muunnelmalle) molemmissa solmuissa.
- Deterministinen automaatio: n8n webhookeja, ajastuksia, CRM-, sähköposti- ja Slack-toimia, validointia ja ihmisen hyväksyntävaiheita varten.
- Harkintaa suorittava ajoympäristö: Hermes Agent luokitteluun, luonnosteluun, tutkimiseen ja muistia sekä monivaiheista päättelyä vaativaan työkalujen käyttöön (virallinen API-palvelimen dokumentaatio, virallinen webhook-dokumentaatio).
Tässä artikkelissa kuvattu n8n:n ja Hermeksen yhdistelmä on havainnollistava integraatio, ei kummankaan toimittajan dokumentoima tai tukema valmis ratkaisu. Käytä Hermeksen bearer-todennettua API-palvelinta työnkulkuun, jonka on palautettava agentin tulos n8n:ään. Hermeksen HMAC-webhook-sovitin on erillinen tapahtumien syöttöpinta: se käynnistää agentin ja toimittaa tuloksen määritettyyn kohteeseen, mutta ei määritä n8n:lle yleistä synkronista vastaussopimusta.
Valinnainen viides kerros on OpenClaw keskustelukanavien käyttöliittymää varten (Telegram, Slack ja muut). Sen voi käynnistää NemoClawin ja OpenShellin kautta, kun tarvitset hiekkalaatikkokäytäntöjä. NemoClaw on tällä hetkellä alfa-vaiheen varhaisversio, ei tuotantovalmis ohjelmisto. Kumpaakaan kerrosta ei tarvita alla oleviin kolmeen työnkulkuun.
Älä lähetä automaattisesti asiakassähköpostia, toimita oikeudellisia asiakirjoja viranomaiselle, muuta tuotantoinfrastruktuuria tai maksa rahaa agentin toimintoketjusta. Reititä peruuttamattomat toimet ihmisen hyväksyntäsolmun kautta, kunnes sinulla on lokit, idempotenssi ja riittävästi katselmoituja ajoja polun luotettavuuden arviointiin.
Mitä DeepSeek-V4-Flash muuttaa kahdessa Sparkissa
DeepSeek-V4-Flash on Mixture-of-Experts-malli, jossa on yhteensä 284B parametria ja 13B aktivoitua parametria sekä virallisen mallikortin mukaan 1M tokenin konteksti-ikkuna. Instruct-painot käyttävät reititettävissä asiantuntijaverkoissa FP4-muotoa ja muualla FP8-muotoa. Yhdistelmällä on Sparkissa merkitystä, koska:
- Aktivoitujen parametrien määrä pitää dekoodauksen kustannuksen hallittavampana kuin vastaavan kokonaiskoon tiheissä malleissa.
- Pitkä konteksti on hyödyllinen agenttien työkuormissa, kuten ohjelmistovaraston osien, tikettihistorioiden ja käytäntökokonaisuuksien käsittelyssä, kunhan haet oikean aineiston ja tarkistat väitteet edelleen.
- DSpark-malliversio on sama malli, johon on liitetty spekulatiivisen dekoodauksen moduuli. Sen virallisen mallikortin esimerkissä käytetään yhtä neljän GPU:n GB300-solmua, ei kahta Sparkia. Jäljempänä käsitelty yhteisön vLLM-raportti käyttää kahdessa GB10-järjestelmässä muuta kuin DSpark-malliversiota.
Käsittele julkaistuja tokenimääriä sekunnissa ja enimmäiskontekstin tuloksia tietyn kokoonpanon raportteina, älä takeina, jotka koskevat omaa kaapeliasi, ajuriasi, konttiasi tai rinnakkaisuusasetuksiasi. Viralliset mallikortit eivät dokumentoi validoitua kahden Sparkin käyttöönottoa; DSpark-esimerkissä käytetään yhtä neljän GPU:n GB300-solmua. Kun asia tarkastettiin uudelleen 2026-08-10, avoin vLLM-ongelma #40969 kuvasi jumittumisen kuudennen tai seitsemännen pyynnön jälkeen kahdessa GB10-järjestelmässä, kun käytössä oli tiettyyn versioon sidottu vLLM, FULL_AND_PIECEWISE-CUDA-graafit, ositettu esitäyttö, Marlin MoE, FP8-muotoinen KV-välimuisti ja TP=2. Näyttö koskee tätä kokoonpanoa, ei kaikkia käyttöönottoja. Ota polku käyttöön vain versioon sidottuna kokeena, jolla on palautussuunnitelma.
Viitearkkitehtuuri
┌─────────────────────────────┐
Lomakkeet/CRM/Git ──►│ n8n (tarkistus, haarautuminen, HITL) │──► Slack / CRM / sähköposti
└──────────────┬──────────────┘
│ HTTPS + bearer-todennus
▼
┌─────────────────────────────┐
│ Hermes (muisti, työkalut, luonnos)│
└──────────────┬──────────────┘
│ OpenAI-yhteensopiva /v1
▼
┌────────────────────────────────────────┐
│ Spark A ◄── QSFP / RoCE ──► Spark B │
│ yhteisön kokeellinen TP=2-mallipalvelupolku │
└────────────────────────────────────────┘
Suunnittelusäännöt, jotta kokonaisuus ei jäisi pelkäksi esittelyksi:
| Kerros | Omistaa | Ei saa omistaa |
|---|---|---|
| n8n | Laukaisimet, skeemat, uudelleenyritykset, SaaS-kirjoitukset, hyväksynnät | Rajoittamaton komentotulkki lähiverkossa |
| Hermes | Luokittelu, luonnostelu, tutkimuksen vaiheet, työkalujen käyttö | Tuotantoon vaikuttavat toimet ilman ilmoitusta |
| Mallipalvelin | Mallin syötteet ja tuotokset | Liiketoimintatunnukset |
| OpenClaw (valinnainen) | Keskustelukanavat ihmisille ja sallintalistat | Rajoittamaton pääkäyttäjäoikeus isäntäkoneeseen |
Määritä Hermes ja mahdolliset n8n:n tekoälysolmut käyttämään klusterin päätepistettä tavallisena OpenAI-yhteensopivana perus-URL-osoitteena. Pidä API-avaimet lähiverkossa tai VPN:ssä äläkä avaa vLLM-porttia julkiseen internetiin.
Käyttöönottotarkistuslista (järjestys merkitsee)
1. Kahden Sparkin klusteriverkko
Noudata NVIDIAn toimintaohjetta, älä kuulopuheita:
- Sama käyttäjänimi molemmissa solmuissa.
- Yksi QSFP-kaapeli vastaavien ConnectX-7-porttien välillä. NVIDIAn ohjeen mukaan täysi kaistanleveys voidaan saavuttaa yhdellä kaapelilla, eikä ohjeessa dokumentoida siirtonopeuden lisäystä toisesta kaapelista samojen kahden järjestelmän välillä.
- Oma L3-osoitteistus ja netplan-määritys nopealle yhteydelle; käytä 10 GbE- tai Wi-Fi-yhteyttä hallintaan ja internetiin.
- Salasanaton SSH solmujen välillä.
- Tarkista NVIDIAn ohjeiden ja
ibdev2netdev-komennon avulla, että verkkoliitännät näkyvät tilassa Up, ennen kuin alat jäljittää NCCL-virheitä.
NVIDIA Syncin Cluster Assistant voi määrittää ConnectX-7:n ja SSH:n tuetuille topologioille; se ei asenna inferenssipinoa puolestasi.
2. Mallipalvelin
- Valitse nimetty yhteisöohje, joka sitoo konttikuvan tai ohjelmistokoontiversion, CUDA-pinon, vLLM-korjaukset, käynnistyskomennot ja tunnetut rajoitukset tiettyihin versioihin. Älä kokoa tuotantokomentoa tämän artikkelin irrallisista osista.
- Varmista, että ohje tukee nimenomaisesti kahta GB10-solmuasi ja tarkkaa
DeepSeek-V4-Flash-malliversiota. Tensor parallel size 2 on tässä testattava hypoteesi, ei virallinen tukilupaus. - Avaa
/v1/modelsja/v1/chat/completionsvain yksityisessä rajapinnassa. - Kirjaa todella määrittämäsi enimmäiskonteksti, samanaikaisten sekvenssien enimmäismäärä, KV-välimuistin tietotyyppi ja se, käytetäänkö spekulatiivista dekoodausta.
- Hermeksen nykyinen dokumentaatio edellyttää mallille vähintään 64K tokenin kontekstia. Pienemmän kontekstin mallipalveluprofiili ei osoita yhteensopivuutta nykyisen Hermeksen kanssa. Määritä vähintään 64K:n profiili ja tee sille kuormituskestävyystesti ennen yhdistämistä.
Testaa lyhyitä, pitkiä, toistuvia ja samanaikaisia kehotteita ennen agenttien kytkemistä. Raportoitu kahden Sparkin vika ilmenee useiden pyyntöjen jälkeen, joten yksi ”hei” ei todista juuri mitään. Polku ei ole tuotantovalmis ennen kuin versioon sidottu kuormituskestävyystesti läpäistään omalla laitteistollasi.
3. Hermes
- Asenna virallisen Hermes-pikaoppaan avulla ja määritä mallipalvelun osoitteeksi yksityinen OpenAI-yhteensopiva perus-URL.
- Ota jäljempänä kuvattuja pyyntö-vastaustyönkulkuja varten käyttöön API-palvelin, aseta vahva
API_SERVER_KEY, pidä palvelin yksityisessä verkkoliitännässä ja tarkistaGET /health(dokumentoitu oletusportti on 8642). Käytä suoraan palautettavaan tulokseen reittiä/v1/responsestai pitkään työhön reittiä/v1/runsja tilan kyselyä. - Jos käyttötapauksesi on tapahtuman vastaanotto ja tuloksen toimittaminen muualle, käytä erillistä webhook-sovitinta: nimetyt reitit, aikaleimattu V2 HMAC, pyyntötunnukset kaksoispyyntöjen poistamiseen ja oletusportti 8644. Älä erehdy pitämään vastaanottokuittausta agentin tuloksena.
- Estä komentotulkin laajat oikeudet, kunnes sinulla on sallintalista ja ihminen seuraamassa lokeja. API-avain antaa pääsyn agentin työkaluihin, ei ainoastaan mallin tuottamaan tekstiin.
DGX Sparkissa NemoClaw voi ajaa Hermeksen OpenShellissä tiedostojärjestelmä-, verkko- ja prosessikäytännöillä. Käsittele sitä alfa-vaiheen arviointipolkuna, ei tuotantotietoturvan takeena.
4. n8n
- Isännöi n8n itse samassa luotetussa verkossa tai VPN:ssä. Noudata artikkeleissa n8n ja paikalliset OpenAI-yhteensopivat päätepisteet sekä idempotenssi ja ihmisen hyväksyntävaiheet kuvattuja malleja.
- Määritä jäljempänä käytettävää pyyntö-vastausyhteyttä varten n8n:n virallinen HTTP Request -solmu käyttämään bearer-todennusta ja nimenomaisia aikakatkaisuja. Säilytä liiketoimintaprosessin pysyvä idempotenssitietue n8n:ssä tai liiketoimintajärjestelmässä. Hermeksen API-palvelin tallentaa
Idempotency-Key-avaimeen liittyvän vastauksen välimuistiin viideksi minuutiksi, mutta tämä rajattu siirtotason aikaikkuna ei korvaa työnkulun pysyvää kaksoiskäsittelyn estoa. Jos valitset tarkoituksella erillisen Hermes-webhook-polun, n8n:n Crypto-solmu voi tuottaa HMAC-allekirjoituksen, mutta allekirjoitettujen tavujen ja V2-aikaleimaotsakkeiden on noudatettava täsmällisesti Hermeksen webhook-sopimusta. n8n:n ja Hermeksen webhook-siirto on havainnollistava suunnitelma, ei toimittajien virallinen integraatio.
Kolme arvioitavaa käyttötapausta
Käyttötapaus A: Yksityinen tukipyyntöjen luokittelu
Ongelma: Tukipyynnöt sisältävät asiakkaiden tekstiä, jota et halua lähettää julkiselle mallipalvelun tarjoajalle. Luokittelu vaatii silti harkintaa: vakavuus, tuotealue, kaksoiskappaleiden tunnistus ja vastausluonnos.
Kulku:
- Tukijärjestelmän webhook → n8n.
- n8n validoi skeeman, poistaa salaisuudet (tunnukset ja suojaamattomat korttinumerot) ja estää saman tukipyynnön käsittelyn kahdesti tunnisteen perusteella.
- n8n tallentaa työnkulun idempotenssiavaimen ja lähettää sen jälkeen vain välttämättömät tiedot Hermeksen yksityiselle API-palvelimelle rajatulla, versioidulla
support-triage-kehotesopimuksella ja bearer-todennuksella. - Hermes kutsuu paikallista DeepSeek-V4-Flashia ja palauttaa vastauksen. n8n jäsentää pyydetyn
{severity, product, confidence, draft, needs_human}-objektin ja validoi sen skeeman. Virheellinen tai puutteellinen tulos siirretään ihmisen tarkastettavaksi. - n8n haarautuu: alhainen luottamustaso tai
needs_human→ Slack-hyväksyntä; korkea luottamustaso + sallintalistalla olevat toimet → päivitä vain tikettikentät (ei vieläkään automaattista lähetystä, ennen kuin polku on ansainnut luottamuksen).
Testattava hypoteesi: n8n-liittimet ja Hermes-API-kutsu voivat tukea tätä työnkulkua. Mallipäätepiste pysyy yksityisessä verkossa, mutta lähtevät työkalut ja SaaS-liittimet ylittävät silti rajan ja tarvitsevat lähtevän liikenteen hallintaa. Arvioi, parantaako lisäkonteksti tulosta, ja tarkista luonnos edelleen.
Älä tee näin: Älä anna Hermeksen avata tukipyynnön tekstissä olevia mielivaltaisia URL-osoitteita ilman välityspalvelimen sallintalistaa (kehoteinjektion riski).
Käyttötapaus B: Pitkän kontekstin sisäinen tutkimusavustaja
Ongelma: Juristien sekä operatiivisen toiminnan ja tekniikan vastuuhenkilöiden täytyy voida pyytää järjestelmää lukemaan nämä 40 PDF-tiedostoa tai tämä moniosaisen ohjelmistovaraston osa ja tuottamaan jäsennelty katsaus ilman aineiston lataamista SaaS-kielimalliin.
Kulku:
- Ihminen tallentaa työkansion (tai n8n seuraa turvallista postilaatikkoa).
- n8n kokoaa metatiedot ja hakutulokset (tai Hermeksen työkalut lukevat sallintalistalla olevaa polkua tai RAG-indeksiä).
- Hermes suorittaa DeepSeek-V4-Flashilla monivaiheisen tutkimuskehotteen, jossa on täsmällinen viittausskeema.
- n8n validoi vastauksen rakenteen ja siirtää sen tarkastusjonoon. Vaadi jokaiselle väitteelle lähdepolku ja tekstikohta; ihmiset hyväksyvät tai hylkäävät väitteet.
Miksi V4-Flash: Virallinen 1M-konteksti ja tehokas pitkän kontekstin käsittely ovat ratkaisun peruste, mutta konteksti-ikkuna ≠ tarkkuus. Haun laatu ja viittausten tarkistukset merkitsevät enemmän kuin tokenien enimmäismäärä.
Älä: Toimita viranomaisraportteja tai lääketieteellisiä yhteenvetoja automaattisesti. Käytä järjestelmää vain lukemisen tukena ja luonnosteluun; pätevät ammattilaiset allekirjoittavat asiakirjat.
Käyttötapaus C: Jatkuva tuotantoympäristön tutkinta keskustelukanavan kautta
Ongelma: Päivystäjä haluaa järjestelmän seuraavan hälytyksiä, tutkivan lokeja ja ehdottavan ajo-ohjeen seuraavaa vaihetta. Lisäksi hän tarvitsee Telegram- tai Slack-kanavan jatkokysymyksille ilman, että mallille annetaan pääkäyttäjän oikeuksia palvelimiin.
Kulku:
- n8n-ajastus tai PagerDuty-webhook kerää hälytysten yksilöivät tunnisteet.
- Hermes tutkii sallintalistalla olevilla tunnuksilla ja vain luku -oikeuksin toimivilla työkaluilla (lokikysely-API, tilapäätepisteet).
- Hermes palauttaa hypoteesin, näytön ja ehdotetun seuraavan komennon, jota ei suoriteta.
- Valinnainen OpenClaw- tai NemoClaw-kanava, jossa päivystäjä voi esittää jatkokysymyksiä erikseen määritetylle agentille ja jossa laiteparin muodostamiseen käytetään sallintalistoja (OpenClawin tietoturvan perusteet). Älä oleta, että OpenClaw ja Hermes jakavat istunnon tai muistivaraston.
Kahden Sparkin hypoteesi: samanaikaiset tutkimukset tai suurempi malli ja konteksti voivat perustella toisen solmun. Vertaa ratkaisua yhteen Sparkiin ja hallittuun inferenssiin mitattujen jonojen, laadun, viiveen, kokonaiskustannusten ja tietosuojavaatimusten perusteella.
Älä tee näin: Älä korjaa järjestelmää automaattisesti. Ehdotetut komennot annetaan ihmiselle tai tarkasti rajatulle automaatiolle, joka suorittaa vain hyväksytyn toimintaohjeen ja käyttää omaa todennusta.
Vikatilat, joihin on varauduttava ensimmäisenä päivänä
| Vika | Oire | Lievennys |
|---|---|---|
| Virheellinen NCCL/RoCE-määritys | Jumittuminen tai siirtyminen TCP:hen, erittäin pitkä viive | Kohdista NCCL RoCE-verkkoliitäntöihin; tarkista klusteriverkko ennen agentteja |
| Liian suuri konteksti | Yksi pitkä työ vie resurssit muilta | Rajaa max_model_len ja rinnakkaisuus; käytä n8n-jonoa |
| Syötteen väärinkäyttö | Hyökkääjä käynnistää Hermeksen | Bearer-todennus tai HMAC ja aikaleima; yksityinen verkko; kutsurajoitukset |
| Kehoteinjektio | Tukipyynnön teksti ohittaa käytännön | Erota luotetut reittikohtaiset ohjeet; työkalujen sallintalistat; älä välitä raakaa HTML:ää komentotulkille |
| SaaS-kirjaukset ilman näkyvää vahvistusta | Kaksois-CRM-päivitykset | Idempotenssiavaimet; ihmisen hyväksyntä ennen lähetystä |
| Mallipalvelun muuttuminen | Ohje rikkoutuu kontin päivityksen jälkeen | Kiinnitä levykuvien tiivisteet; suorita regressiotestit CI:ssä |
Miltä valmis kokonaisuus näyttää
Voit perustellusti sanoa testatun kokonaisuuden toimivan, kun:
- Versioon sidottu kahden Sparkin kokoonpano läpäisee toistuvat ja samanaikaiset kuormituskestävyystestit, mukaan lukien alkuperäisessä projektissa raportoitu vikamuoto; kirjaa tarkka ajojen määrä, kontekstikoot ja virheaste.
- n8n → Hermes → malli -polun tunnistautuminen toimii päästä päähän, polku on lokitettu ja n8n validoi palautetun sovellusskeeman.
- Vähintään yksi nimetty työnkulku suoritetaan niin, että jokainen ulkoinen viesti saa ihmisen hyväksynnän, ja työnkulku läpäisee ennalta määritetyn arviointiaineiston.
- Sinulla on kirjallinen palautussuunnitelma: poista n8n:n Hermes-kutsu käytöstä, palaa n8n:n omiin malleihin tai määritä Hermes käyttämään pienempää paikallista mallia.
Harjoitus
Valitse käyttötapaus A. Toteuta vain webhookin validointi n8n:ssä, yksi versioitu kehotesopimus bearer-todennusta käyttävän Hermes-API-palvelimen kautta, työnkulun idempotenssitietue, paikallinen mallikutsu, vastausskeeman validointi ja luonnoksen esikatselu. Älä yhdistä sähköpostin lähetystä. Käytä edustavaa ja hyväksyttyä arviointiaineistoa, joka kattaa tavanomaiset ja harvinaiset tapaukset. Määritä etukäteen vakavuusluokan yhtäpitävyyttä, perusteettomia väitteitä, muokkaustarvetta, viivettä ja virheitä koskevat kriteerit. Päätä näytön perusteella, onko toinen Spark tai V4-Flash perusteltu.
Lisälukemista
- DGX Spark: mitä se on
- Yhdistä kaksi DGX Sparkia
- NemoClaw-hiekkalaatikkoagentit Sparkissa
- Hermes vs n8n
- n8n ↔ Hermes webhook-siirto
- Viralliset lähteet: DeepSeek-V4-Flash-mallikortti, DeepSeek-V4-Flash-DSpark-mallikortti, Hermes-API-palvelin, Hermes-webhookit, n8n:n HTTP Request -solmu, NVIDIA Spark -klusterointi



