Kokeellinen kahden DGX Sparkin, DeepSeek-V4-Flashin, n8n:n ja Hermeksen kokonaisuus
Edistynyt10 min lukemistaYksityinen / paikallinen tekoäly

Kokeellinen kahden DGX Sparkin, DeepSeek-V4-Flashin, n8n:n ja Hermeksen kokonaisuus

Näin arvioit yhteisön kokeellista kahden DGX Sparkin DeepSeek-V4-Flash-ratkaisua, jossa n8n hoitaa deterministiset vaiheet ja Hermes harkintaa vaativat tehtävät.

Mitä sinun pitäisi osata

DeepSeek-V4-Flashin palvelu kahdella Sparkilla on yhteisön kokeellinen ratkaisu, ei NVIDIAn tai vLLM:n tuotanto-ohje. Vahvista täsmällinen koontiversio ennen n8n:n ja Hermeksen lisäämistä ja edellytä ihmisen hyväksyntää jokaiselle peruuttamattomalle toimelle.

Tallennettu vain tällä selaimella.
Tässä artikkelissa

Tämä on mahdollinen laboratorioarkkitehtuuri toisen DGX Sparkin hankinnan jälkeen: suuren mallin paikallinen inferenssi, liiketoimintajärjestelmiin yhdistyvä automaatio ja agentin ajoympäristö. Kyse ei ole tuetusta, valmiista kokonaisuudesta.

Puolustettava versio on kapeampi. Arvioit neljää kerrosta, joiden on pysyttävä erillisinä:

  1. Tietoliikennekerros: kaksi Sparkia yhdistettynä hajautettua inferenssiä varten (NVIDIAn klusterointidokumentaatio, kahden Sparkin yhdistämisopas).
  2. Kokeellinen mallipalvelin: yhteisön rakentama OpenAI-yhteensopiva polku DeepSeek-V4-Flashille (tai spekulatiivista dekoodausta käyttävälle DSpark-muunnelmalle) molemmissa solmuissa.
  3. Deterministinen automaatio: n8n webhookeja, ajastuksia, CRM-, sähköposti- ja Slack-toimia, validointia ja ihmisen hyväksyntävaiheita varten.
  4. Harkintaa suorittava ajoympäristö: Hermes Agent luokitteluun, luonnosteluun, tutkimiseen ja muistia sekä monivaiheista päättelyä vaativaan työkalujen käyttöön (virallinen API-palvelimen dokumentaatio, virallinen webhook-dokumentaatio).

Tässä artikkelissa kuvattu n8n:n ja Hermeksen yhdistelmä on havainnollistava integraatio, ei kummankaan toimittajan dokumentoima tai tukema valmis ratkaisu. Käytä Hermeksen bearer-todennettua API-palvelinta työnkulkuun, jonka on palautettava agentin tulos n8n:ään. Hermeksen HMAC-webhook-sovitin on erillinen tapahtumien syöttöpinta: se käynnistää agentin ja toimittaa tuloksen määritettyyn kohteeseen, mutta ei määritä n8n:lle yleistä synkronista vastaussopimusta.

Valinnainen viides kerros on OpenClaw keskustelukanavien käyttöliittymää varten (Telegram, Slack ja muut). Sen voi käynnistää NemoClawin ja OpenShellin kautta, kun tarvitset hiekkalaatikkokäytäntöjä. NemoClaw on tällä hetkellä alfa-vaiheen varhaisversio, ei tuotantovalmis ohjelmisto. Kumpaakaan kerrosta ei tarvita alla oleviin kolmeen työnkulkuun.

Älä lähetä automaattisesti asiakassähköpostia, toimita oikeudellisia asiakirjoja viranomaiselle, muuta tuotantoinfrastruktuuria tai maksa rahaa agentin toimintoketjusta. Reititä peruuttamattomat toimet ihmisen hyväksyntäsolmun kautta, kunnes sinulla on lokit, idempotenssi ja riittävästi katselmoituja ajoja polun luotettavuuden arviointiin.

Mitä DeepSeek-V4-Flash muuttaa kahdessa Sparkissa

DeepSeek-V4-Flash on Mixture-of-Experts-malli, jossa on yhteensä 284B parametria ja 13B aktivoitua parametria sekä virallisen mallikortin mukaan 1M tokenin konteksti-ikkuna. Instruct-painot käyttävät reititettävissä asiantuntijaverkoissa FP4-muotoa ja muualla FP8-muotoa. Yhdistelmällä on Sparkissa merkitystä, koska:

  • Aktivoitujen parametrien määrä pitää dekoodauksen kustannuksen hallittavampana kuin vastaavan kokonaiskoon tiheissä malleissa.
  • Pitkä konteksti on hyödyllinen agenttien työkuormissa, kuten ohjelmistovaraston osien, tikettihistorioiden ja käytäntökokonaisuuksien käsittelyssä, kunhan haet oikean aineiston ja tarkistat väitteet edelleen.
  • DSpark-malliversio on sama malli, johon on liitetty spekulatiivisen dekoodauksen moduuli. Sen virallisen mallikortin esimerkissä käytetään yhtä neljän GPU:n GB300-solmua, ei kahta Sparkia. Jäljempänä käsitelty yhteisön vLLM-raportti käyttää kahdessa GB10-järjestelmässä muuta kuin DSpark-malliversiota.

Käsittele julkaistuja tokenimääriä sekunnissa ja enimmäiskontekstin tuloksia tietyn kokoonpanon raportteina, älä takeina, jotka koskevat omaa kaapeliasi, ajuriasi, konttiasi tai rinnakkaisuusasetuksiasi. Viralliset mallikortit eivät dokumentoi validoitua kahden Sparkin käyttöönottoa; DSpark-esimerkissä käytetään yhtä neljän GPU:n GB300-solmua. Kun asia tarkastettiin uudelleen 2026-08-10, avoin vLLM-ongelma #40969 kuvasi jumittumisen kuudennen tai seitsemännen pyynnön jälkeen kahdessa GB10-järjestelmässä, kun käytössä oli tiettyyn versioon sidottu vLLM, FULL_AND_PIECEWISE-CUDA-graafit, ositettu esitäyttö, Marlin MoE, FP8-muotoinen KV-välimuisti ja TP=2. Näyttö koskee tätä kokoonpanoa, ei kaikkia käyttöönottoja. Ota polku käyttöön vain versioon sidottuna kokeena, jolla on palautussuunnitelma.

Viitearkkitehtuuri

                    ┌─────────────────────────────┐
   Lomakkeet/CRM/Git ──►│ n8n (tarkistus, haarautuminen, HITL) │──► Slack / CRM / sähköposti
                    └──────────────┬──────────────┘
                                   │ HTTPS + bearer-todennus
                                   ▼
                    ┌─────────────────────────────┐
                    │ Hermes (muisti, työkalut, luonnos)│
                    └──────────────┬──────────────┘
                                   │ OpenAI-yhteensopiva /v1
                                   ▼
              ┌────────────────────────────────────────┐
              │ Spark A ◄── QSFP / RoCE ──► Spark B    │
              │ yhteisön kokeellinen TP=2-mallipalvelupolku │
              └────────────────────────────────────────┘

Suunnittelusäännöt, jotta kokonaisuus ei jäisi pelkäksi esittelyksi:

KerrosOmistaaEi saa omistaa
n8nLaukaisimet, skeemat, uudelleenyritykset, SaaS-kirjoitukset, hyväksynnätRajoittamaton komentotulkki lähiverkossa
HermesLuokittelu, luonnostelu, tutkimuksen vaiheet, työkalujen käyttöTuotantoon vaikuttavat toimet ilman ilmoitusta
MallipalvelinMallin syötteet ja tuotoksetLiiketoimintatunnukset
OpenClaw (valinnainen)Keskustelukanavat ihmisille ja sallintalistatRajoittamaton pääkäyttäjäoikeus isäntäkoneeseen

Määritä Hermes ja mahdolliset n8n:n tekoälysolmut käyttämään klusterin päätepistettä tavallisena OpenAI-yhteensopivana perus-URL-osoitteena. Pidä API-avaimet lähiverkossa tai VPN:ssä äläkä avaa vLLM-porttia julkiseen internetiin.

Käyttöönottotarkistuslista (järjestys merkitsee)

1. Kahden Sparkin klusteriverkko

Noudata NVIDIAn toimintaohjetta, älä kuulopuheita:

  • Sama käyttäjänimi molemmissa solmuissa.
  • Yksi QSFP-kaapeli vastaavien ConnectX-7-porttien välillä. NVIDIAn ohjeen mukaan täysi kaistanleveys voidaan saavuttaa yhdellä kaapelilla, eikä ohjeessa dokumentoida siirtonopeuden lisäystä toisesta kaapelista samojen kahden järjestelmän välillä.
  • Oma L3-osoitteistus ja netplan-määritys nopealle yhteydelle; käytä 10 GbE- tai Wi-Fi-yhteyttä hallintaan ja internetiin.
  • Salasanaton SSH solmujen välillä.
  • Tarkista NVIDIAn ohjeiden ja ibdev2netdev-komennon avulla, että verkkoliitännät näkyvät tilassa Up, ennen kuin alat jäljittää NCCL-virheitä.

NVIDIA Syncin Cluster Assistant voi määrittää ConnectX-7:n ja SSH:n tuetuille topologioille; se ei asenna inferenssipinoa puolestasi.

2. Mallipalvelin

  • Valitse nimetty yhteisöohje, joka sitoo konttikuvan tai ohjelmistokoontiversion, CUDA-pinon, vLLM-korjaukset, käynnistyskomennot ja tunnetut rajoitukset tiettyihin versioihin. Älä kokoa tuotantokomentoa tämän artikkelin irrallisista osista.
  • Varmista, että ohje tukee nimenomaisesti kahta GB10-solmuasi ja tarkkaa DeepSeek-V4-Flash-malliversiota. Tensor parallel size 2 on tässä testattava hypoteesi, ei virallinen tukilupaus.
  • Avaa /v1/models ja /v1/chat/completions vain yksityisessä rajapinnassa.
  • Kirjaa todella määrittämäsi enimmäiskonteksti, samanaikaisten sekvenssien enimmäismäärä, KV-välimuistin tietotyyppi ja se, käytetäänkö spekulatiivista dekoodausta.
  • Hermeksen nykyinen dokumentaatio edellyttää mallille vähintään 64K tokenin kontekstia. Pienemmän kontekstin mallipalveluprofiili ei osoita yhteensopivuutta nykyisen Hermeksen kanssa. Määritä vähintään 64K:n profiili ja tee sille kuormituskestävyystesti ennen yhdistämistä.

Testaa lyhyitä, pitkiä, toistuvia ja samanaikaisia kehotteita ennen agenttien kytkemistä. Raportoitu kahden Sparkin vika ilmenee useiden pyyntöjen jälkeen, joten yksi ”hei” ei todista juuri mitään. Polku ei ole tuotantovalmis ennen kuin versioon sidottu kuormituskestävyystesti läpäistään omalla laitteistollasi.

3. Hermes

  • Asenna virallisen Hermes-pikaoppaan avulla ja määritä mallipalvelun osoitteeksi yksityinen OpenAI-yhteensopiva perus-URL.
  • Ota jäljempänä kuvattuja pyyntö-vastaustyönkulkuja varten käyttöön API-palvelin, aseta vahva API_SERVER_KEY, pidä palvelin yksityisessä verkkoliitännässä ja tarkista GET /health (dokumentoitu oletusportti on 8642). Käytä suoraan palautettavaan tulokseen reittiä /v1/responses tai pitkään työhön reittiä /v1/runs ja tilan kyselyä.
  • Jos käyttötapauksesi on tapahtuman vastaanotto ja tuloksen toimittaminen muualle, käytä erillistä webhook-sovitinta: nimetyt reitit, aikaleimattu V2 HMAC, pyyntötunnukset kaksoispyyntöjen poistamiseen ja oletusportti 8644. Älä erehdy pitämään vastaanottokuittausta agentin tuloksena.
  • Estä komentotulkin laajat oikeudet, kunnes sinulla on sallintalista ja ihminen seuraamassa lokeja. API-avain antaa pääsyn agentin työkaluihin, ei ainoastaan mallin tuottamaan tekstiin.

DGX Sparkissa NemoClaw voi ajaa Hermeksen OpenShellissä tiedostojärjestelmä-, verkko- ja prosessikäytännöillä. Käsittele sitä alfa-vaiheen arviointipolkuna, ei tuotantotietoturvan takeena.

4. n8n

  • Isännöi n8n itse samassa luotetussa verkossa tai VPN:ssä. Noudata artikkeleissa n8n ja paikalliset OpenAI-yhteensopivat päätepisteet sekä idempotenssi ja ihmisen hyväksyntävaiheet kuvattuja malleja.
  • Määritä jäljempänä käytettävää pyyntö-vastausyhteyttä varten n8n:n virallinen HTTP Request -solmu käyttämään bearer-todennusta ja nimenomaisia aikakatkaisuja. Säilytä liiketoimintaprosessin pysyvä idempotenssitietue n8n:ssä tai liiketoimintajärjestelmässä. Hermeksen API-palvelin tallentaa Idempotency-Key-avaimeen liittyvän vastauksen välimuistiin viideksi minuutiksi, mutta tämä rajattu siirtotason aikaikkuna ei korvaa työnkulun pysyvää kaksoiskäsittelyn estoa. Jos valitset tarkoituksella erillisen Hermes-webhook-polun, n8n:n Crypto-solmu voi tuottaa HMAC-allekirjoituksen, mutta allekirjoitettujen tavujen ja V2-aikaleimaotsakkeiden on noudatettava täsmällisesti Hermeksen webhook-sopimusta. n8n:n ja Hermeksen webhook-siirto on havainnollistava suunnitelma, ei toimittajien virallinen integraatio.

Kolme arvioitavaa käyttötapausta

Käyttötapaus A: Yksityinen tukipyyntöjen luokittelu

Ongelma: Tukipyynnöt sisältävät asiakkaiden tekstiä, jota et halua lähettää julkiselle mallipalvelun tarjoajalle. Luokittelu vaatii silti harkintaa: vakavuus, tuotealue, kaksoiskappaleiden tunnistus ja vastausluonnos.

Kulku:

  1. Tukijärjestelmän webhook → n8n.
  2. n8n validoi skeeman, poistaa salaisuudet (tunnukset ja suojaamattomat korttinumerot) ja estää saman tukipyynnön käsittelyn kahdesti tunnisteen perusteella.
  3. n8n tallentaa työnkulun idempotenssiavaimen ja lähettää sen jälkeen vain välttämättömät tiedot Hermeksen yksityiselle API-palvelimelle rajatulla, versioidulla support-triage-kehotesopimuksella ja bearer-todennuksella.
  4. Hermes kutsuu paikallista DeepSeek-V4-Flashia ja palauttaa vastauksen. n8n jäsentää pyydetyn {severity, product, confidence, draft, needs_human}-objektin ja validoi sen skeeman. Virheellinen tai puutteellinen tulos siirretään ihmisen tarkastettavaksi.
  5. n8n haarautuu: alhainen luottamustaso tai needs_human → Slack-hyväksyntä; korkea luottamustaso + sallintalistalla olevat toimet → päivitä vain tikettikentät (ei vieläkään automaattista lähetystä, ennen kuin polku on ansainnut luottamuksen).

Testattava hypoteesi: n8n-liittimet ja Hermes-API-kutsu voivat tukea tätä työnkulkua. Mallipäätepiste pysyy yksityisessä verkossa, mutta lähtevät työkalut ja SaaS-liittimet ylittävät silti rajan ja tarvitsevat lähtevän liikenteen hallintaa. Arvioi, parantaako lisäkonteksti tulosta, ja tarkista luonnos edelleen.

Älä tee näin: Älä anna Hermeksen avata tukipyynnön tekstissä olevia mielivaltaisia URL-osoitteita ilman välityspalvelimen sallintalistaa (kehoteinjektion riski).

Käyttötapaus B: Pitkän kontekstin sisäinen tutkimusavustaja

Ongelma: Juristien sekä operatiivisen toiminnan ja tekniikan vastuuhenkilöiden täytyy voida pyytää järjestelmää lukemaan nämä 40 PDF-tiedostoa tai tämä moniosaisen ohjelmistovaraston osa ja tuottamaan jäsennelty katsaus ilman aineiston lataamista SaaS-kielimalliin.

Kulku:

  1. Ihminen tallentaa työkansion (tai n8n seuraa turvallista postilaatikkoa).
  2. n8n kokoaa metatiedot ja hakutulokset (tai Hermeksen työkalut lukevat sallintalistalla olevaa polkua tai RAG-indeksiä).
  3. Hermes suorittaa DeepSeek-V4-Flashilla monivaiheisen tutkimuskehotteen, jossa on täsmällinen viittausskeema.
  4. n8n validoi vastauksen rakenteen ja siirtää sen tarkastusjonoon. Vaadi jokaiselle väitteelle lähdepolku ja tekstikohta; ihmiset hyväksyvät tai hylkäävät väitteet.

Miksi V4-Flash: Virallinen 1M-konteksti ja tehokas pitkän kontekstin käsittely ovat ratkaisun peruste, mutta konteksti-ikkuna ≠ tarkkuus. Haun laatu ja viittausten tarkistukset merkitsevät enemmän kuin tokenien enimmäismäärä.

Älä: Toimita viranomaisraportteja tai lääketieteellisiä yhteenvetoja automaattisesti. Käytä järjestelmää vain lukemisen tukena ja luonnosteluun; pätevät ammattilaiset allekirjoittavat asiakirjat.

Käyttötapaus C: Jatkuva tuotantoympäristön tutkinta keskustelukanavan kautta

Ongelma: Päivystäjä haluaa järjestelmän seuraavan hälytyksiä, tutkivan lokeja ja ehdottavan ajo-ohjeen seuraavaa vaihetta. Lisäksi hän tarvitsee Telegram- tai Slack-kanavan jatkokysymyksille ilman, että mallille annetaan pääkäyttäjän oikeuksia palvelimiin.

Kulku:

  1. n8n-ajastus tai PagerDuty-webhook kerää hälytysten yksilöivät tunnisteet.
  2. Hermes tutkii sallintalistalla olevilla tunnuksilla ja vain luku -oikeuksin toimivilla työkaluilla (lokikysely-API, tilapäätepisteet).
  3. Hermes palauttaa hypoteesin, näytön ja ehdotetun seuraavan komennon, jota ei suoriteta.
  4. Valinnainen OpenClaw- tai NemoClaw-kanava, jossa päivystäjä voi esittää jatkokysymyksiä erikseen määritetylle agentille ja jossa laiteparin muodostamiseen käytetään sallintalistoja (OpenClawin tietoturvan perusteet). Älä oleta, että OpenClaw ja Hermes jakavat istunnon tai muistivaraston.

Kahden Sparkin hypoteesi: samanaikaiset tutkimukset tai suurempi malli ja konteksti voivat perustella toisen solmun. Vertaa ratkaisua yhteen Sparkiin ja hallittuun inferenssiin mitattujen jonojen, laadun, viiveen, kokonaiskustannusten ja tietosuojavaatimusten perusteella.

Älä tee näin: Älä korjaa järjestelmää automaattisesti. Ehdotetut komennot annetaan ihmiselle tai tarkasti rajatulle automaatiolle, joka suorittaa vain hyväksytyn toimintaohjeen ja käyttää omaa todennusta.

Vikatilat, joihin on varauduttava ensimmäisenä päivänä

VikaOireLievennys
Virheellinen NCCL/RoCE-määritysJumittuminen tai siirtyminen TCP:hen, erittäin pitkä viiveKohdista NCCL RoCE-verkkoliitäntöihin; tarkista klusteriverkko ennen agentteja
Liian suuri kontekstiYksi pitkä työ vie resurssit muiltaRajaa max_model_len ja rinnakkaisuus; käytä n8n-jonoa
Syötteen väärinkäyttöHyökkääjä käynnistää HermeksenBearer-todennus tai HMAC ja aikaleima; yksityinen verkko; kutsurajoitukset
KehoteinjektioTukipyynnön teksti ohittaa käytännönErota luotetut reittikohtaiset ohjeet; työkalujen sallintalistat; älä välitä raakaa HTML:ää komentotulkille
SaaS-kirjaukset ilman näkyvää vahvistustaKaksois-CRM-päivityksetIdempotenssiavaimet; ihmisen hyväksyntä ennen lähetystä
Mallipalvelun muuttuminenOhje rikkoutuu kontin päivityksen jälkeenKiinnitä levykuvien tiivisteet; suorita regressiotestit CI:ssä

Miltä valmis kokonaisuus näyttää

Voit perustellusti sanoa testatun kokonaisuuden toimivan, kun:

  1. Versioon sidottu kahden Sparkin kokoonpano läpäisee toistuvat ja samanaikaiset kuormituskestävyystestit, mukaan lukien alkuperäisessä projektissa raportoitu vikamuoto; kirjaa tarkka ajojen määrä, kontekstikoot ja virheaste.
  2. n8n → Hermes → malli -polun tunnistautuminen toimii päästä päähän, polku on lokitettu ja n8n validoi palautetun sovellusskeeman.
  3. Vähintään yksi nimetty työnkulku suoritetaan niin, että jokainen ulkoinen viesti saa ihmisen hyväksynnän, ja työnkulku läpäisee ennalta määritetyn arviointiaineiston.
  4. Sinulla on kirjallinen palautussuunnitelma: poista n8n:n Hermes-kutsu käytöstä, palaa n8n:n omiin malleihin tai määritä Hermes käyttämään pienempää paikallista mallia.

Harjoitus

Valitse käyttötapaus A. Toteuta vain webhookin validointi n8n:ssä, yksi versioitu kehotesopimus bearer-todennusta käyttävän Hermes-API-palvelimen kautta, työnkulun idempotenssitietue, paikallinen mallikutsu, vastausskeeman validointi ja luonnoksen esikatselu. Älä yhdistä sähköpostin lähetystä. Käytä edustavaa ja hyväksyttyä arviointiaineistoa, joka kattaa tavanomaiset ja harvinaiset tapaukset. Määritä etukäteen vakavuusluokan yhtäpitävyyttä, perusteettomia väitteitä, muokkaustarvetta, viivettä ja virheitä koskevat kriteerit. Päätä näytön perusteella, onko toinen Spark tai V4-Flash perusteltu.

Lisälukemista

Lue seuraava

Jatka samaa oppimisreittiä seuraavilla käytännön artikkeleilla.