Dette er en plausibel laboratoriearkitektur, når du har købt endnu en DGX Spark: lokal inferens til en stor model, automatisering, der arbejder med forretningssystemer, og et kørselsmiljø til agenter. Det er ikke en understøttet nøglefærdig stak.
Den forsvarlige version er mere afgrænset. Du evaluerer fire lag, som fortsat skal kunne adskilles:
- Netværk: to Sparks, der er forbundet til distribueret inferens (NVIDIAs dokumentation om klyngedannelse, vejledning til at forbinde to Sparks).
- Eksperimentel modelserver: en OpenAI-kompatibel løsning, som fællesskabet har udviklet til DeepSeek-V4-Flash, eller DSpark-varianten med spekulativ afkodning, på tværs af begge noder.
- Deterministisk automatisering: n8n til webhooks, tidsplaner, skrivninger i CRM, e-mail og Slack, validering og menneskelige godkendelsestrin.
- Kørselsmiljø til vurderingsopgaver: Hermes Agent til triage, udkast, undersøgelser og brug af værktøjer, der kræver hukommelse og ræsonnement i flere trin (officiel dokumentation til API-serveren, officiel dokumentation til webhooks).
Sammensætningen af n8n og Hermes i denne artikel er et illustrativt integrationsmønster, ikke en færdig løsning, som nogen af leverandørerne dokumenterer eller understøtter. Når en arbejdsgang skal have agentens resultat tilbage i n8n, skal du bruge Hermes’ API-server med bearer-token. Hermes’ HMAC-webhookadapter er en særskilt indgang til hændelser: Den starter en agent og leverer resultatet til et konfigureret mål i stedet for at definere en generel synkron svarkontrakt for n8n.
Et valgfrit femte lag er OpenClaw til brugeroplevelsen i chatkanaler som Telegram og Slack, eventuelt startet gennem NemoClaw og OpenShell, når du ønsker politikker for sandkassen. NemoClaw er aktuelt et alfaprojekt i tidlig prøveversion, ikke produktionsklar software. Ingen af lagene er nødvendige for de tre arbejdsgange nedenfor.
Lad ikke en agentløkke automatisk sende kundemails, indgive juridiske dokumenter, ændre produktionsinfrastruktur eller gennemføre betalinger. Send uigenkaldelige handlinger gennem et menneskeligt godkendelsestrin, indtil du har logfiler, idempotens og tilstrækkeligt mange gennemgåede kørsler til at have tillid til forløbet.
Hvad DeepSeek-V4-Flash ændrer på to Sparks
DeepSeek-V4-Flash er en Mixture-of-Experts-model med 284B parametre i alt og 13B aktiverede samt et kontekstvindue på 1M tokens ifølge det officielle modelkort. Instruktionsmodellens vægte bruger FP4 til de styrede eksperter og ellers FP8. Denne kombination er relevant på Spark, fordi:
- Antallet af aktiverede parametre holder omkostningen ved afkodning håndterbar sammenlignet med tætte modeller af tilsvarende samlet størrelse.
- Lang kontekst er nyttig til agentarbejde som udsnit af repositories, tickethistorik og politiksamlinger, forudsat at du henter det rigtige materiale og stadig verificerer påstandene.
- DSpark-checkpointet er den samme model med et modul til spekulativ afkodning. Eksemplet på det officielle modelkort bruger én GB300-node med fire GPU’er, ikke to Sparks. Communityrapporten om vLLM nedenfor bruger checkpointet uden DSpark på to GB10-systemer.
Behandl offentliggjorte resultater for tokens pr. sekund og maksimal kontekst som opskriftsspecifikke rapporter, ikke som garantier for dit kabel, din driver, container eller indstillinger for samtidighed. De officielle modelkort dokumenterer ikke en valideret implementering med to Sparks. DSpark-eksemplet bruger én GB300-node med fire GPU’er. Ved kontrollen 2026-08-10, hvor status blev gennemgået på ny, beskrev den åbne vLLM-fejlrapport #40969, at en opsætning med to GB10-systemer hang efter den sjette eller syvende anmodning med én fastlåst vLLM-version, FULL_AND_PIECEWISE-CUDA-grafer, opdelt prefill, Marlin MoE, FP8-KV-cache og TP=2. Det er dokumentation for denne konfiguration, ikke for alle implementeringer. Brug kun denne vej som et versionslåst eksperiment med en tilbagerulningsmodel.
Referencearkitektur
┌─────────────────────────────┐
Formularer/CRM/Git ─►│ n8n (validering, valg, HITL) │──► Slack / CRM / e-mail
└──────────────┬──────────────┘
│ HTTPS + bearer-token
▼
┌─────────────────────────────┐
│ Hermes (hukommelse, værktøjer, udkast)│
└──────────────┬──────────────┘
│ OpenAI-kompatibel /v1
▼
┌────────────────────────────────────────┐
│ Spark A ◄── QSFP / RoCE ──► Spark B │
│ fællesskabsudviklet modelvej med TP=2 │
└────────────────────────────────────────┘
Designregler, der gør løsningen mere end en demonstration:
| Lag | Ejer | Må ikke eje |
|---|---|---|
| n8n | Udløsere, skemaer, gentagne forsøg, SaaS-skrivninger, godkendelser | Ubegrænset shelladgang på LAN |
| Hermes | Klassifikation, udkast, undersøgelsestrin, brug af værktøjer | Skjulte sideeffekter i produktionen |
| Modelserver | Tokens ind og tokens ud | Forretningsadgangsoplysninger |
| OpenClaw (valgfri) | Chatkanaler til mennesker og tilladelseslister | Rootadgang til værten uden sandkasse |
Ret Hermes og eventuelle AI-noder i n8n mod klyngeendepunktet som en almindelig OpenAI-kompatibel basis-URL. Behold API-nøgler på LAN eller VPN, og eksponér ikke vLLM-porten på det offentlige internet.
Tjekliste til opstart, hvor rækkefølgen er vigtig
1. Netværket mellem de to Sparks
Følg NVIDIAs vejledning, ikke uformelle råd:
- Samme brugernavn på begge noder.
- Ét QSFP-kabel mellem de tilsvarende ConnectX-7-porte. NVIDIAs vejledning angiver, at fuld båndbredde kan opnås med ét kabel, og dokumenterer ingen gevinst i gennemstrømning fra et ekstra kabel mellem de samme to systemer.
- Dedikeret L3-adressering og netplan til højhastighedsforbindelsen; behold 10 GbE eller Wi-Fi til administration og internet.
- SSH uden adgangskode mellem noderne.
- Bekræft, at grænsefladerne viser Up (
ibdev2netdev/ NVIDIA-trin), før du fejlsøger NCCL.
Cluster Assistant i NVIDIA Sync kan konfigurere ConnectX-7 og SSH til understøttede topologier, men installerer ikke din inferensstak.
2. Modelserver
- Vælg en navngiven fællesskabsudviklet opskrift, som låser container eller softwareversion, CUDA-stak, vLLM-rettelser, startkommandoer og kendte begrænsninger. Sammensæt ikke en produktionskommando af fragmenter fra denne artikel.
- Kontrollér, at opskriften udtrykkeligt understøtter dine to GB10-noder og det præcise
DeepSeek-V4-Flash-checkpoint. Tensorparallel størrelse 2 er en hypotese, der skal testes her, ikke et officielt løfte om understøttelse. - Eksponér kun
/v1/modelsog/v1/chat/completionspå en privat netværksgrænseflade. - Registrér den maksimale kontekst, du faktisk konfigurerer, det maksimale antal samtidige sekvenser, KV-datatypen, og om spekulativ afkodning er aktiveret.
- Den aktuelle Hermes-dokumentation kræver, at modellens konfigurerede kontekst er mindst 64K tokens. En serverprofil med mindre kontekst dokumenterer ikke kompatibilitet med den aktuelle Hermes. Konfigurér og belastningstest derfor en profil på mindst 64K, før du forbinder den.
Test korte, lange, gentagne og samtidige prompter, før du forbinder agenter. Den rapporterede fejl med to Sparks viser sig efter flere anmodninger, så et enkelt »hello« dokumenterer næsten intet. Denne vej er ikke produktionsklar, før en versionslåst belastningstest består på din hardware.
3. Hermes
- Installér fra den officielle startvejledning til Hermes, og konfigurér modeludbyderen med den private OpenAI-kompatible basis-URL.
- Aktivér API-serveren til arbejdsgangene med forespørgsel og svar nedenfor. Angiv en stærk
API_SERVER_KEY, hold serveren på en privat netværksgrænseflade, og kontrollérGET /healthpå den dokumenterede standardport 8642. Brug/v1/responsestil et direkte resultat eller/v1/runsmed statusforespørgsler til en langvarig opgave. - Hvis dit brugsscenarie modtager hændelser og leverer resultater et andet sted, skal du bruge den separate webhookadapter: navngivne ruter, tidsstemplet V2-HMAC, anmodnings-id’er til deduplikering og standardporten 8644. Forveksl ikke dens kvittering med agentens resultat.
- Afvis bred adgang til shell, indtil du har en tilladelsesliste og et menneske, der følger logfilerne. API-nøglen giver adgang til agentens værktøjer, ikke kun til modeltekst.
På DGX Spark kan NemoClaw køre Hermes i OpenShell med politikker for filsystem, netværk og processer. Behandl det som en alfaløsning til evaluering, ikke som en sikkerhedsgaranti for produktion.
4. n8n
- Kør n8n i egen drift på det samme betroede netværk eller via VPN. Følg helst mønstrene i lokale OpenAI-kompatible endepunkter i n8n og idempotens og menneskelige godkendelsestrin.
- Til forespørgsel-svar-overdragelsen til Hermes nedenfor skal du konfigurere n8n’s officielle HTTP Request-node med bearer-adgangsoplysninger og eksplicitte tidsgrænser. Gem den varige forretningsmæssige idempotensregistrering i n8n eller forretningssystemet. Hermes’ API-server understøtter caching af svar med
Idempotency-Keyi fem minutter, men dette begrænsede vindue på transportlaget erstatter ikke varig deduplikering i arbejdsgangen. Hvis du bevidst vælger den separate webhookvej til Hermes, kan n8n’s Crypto-node oprette HMAC-signaturen, men de signerede bytes og V2-headerne med tidsstempel skal nøjagtigt følge Hermes’ webhookkontrakt. Overdragelsen mellem n8n og Hermes via webhook er et illustrativt design, ikke en officiel leverandørintegration.
Tre mulige arbejdsbelastninger til evalueringen
Brugsscenarie A: Privat supporttriage
Problem: Tickets indeholder kundetekst, som du ikke vil sende til en offentlig modeludbyder. Triage kræver stadig vurdering af alvorsgrad, produktområde og mulige dubletter samt et udkast til svar.
Forløb:
- Webhook fra helpdesk → n8n.
- n8n validerer skemaet, fjerner hemmeligheder som tokens og rå kortnumre og deduplikerer efter sags-id.
- n8n registrerer en idempotensnøgle på arbejdsgangsniveau og sender derefter en minimal nyttelast til den private Hermes-API-server med et bearer-token og en afgrænset, versionsstyret promptkontrakt til
support-triage. - Hermes kalder den lokale DeepSeek-V4-Flash og returnerer et svar. n8n fortolker og skemavaliderer det ønskede objekt
{severity, product, confidence, draft, needs_human}. Ugyldigt eller ufuldstændigt output sendes til menneskelig gennemgang. - n8n forgrener forløbet: Lav sikkerhed eller
needs_human→ godkendelse i Slack; høj sikkerhed og handlinger på tilladelseslisten → opdatér kun sagsfelter. Send stadig ikke automatisk, før løsningen er klar til det.
Hypotese, der skal testes: n8n-integrationer og et Hermes-API-kald kan muligvis understøtte dette forløb. Modelendepunktet forbliver på det private netværk, men udgående værktøjer og SaaS-integrationer krydser stadig grænsen og kræver kontrol med udgående trafik. Evaluér, om ekstra kontekst forbedrer resultatet, men kontrollér stadig udkastet.
Gør ikke: Lad Hermes åbne vilkårlige URL’er fra sagstekst uden en tilladelsesliste i en proxy, da teksten kan indeholde promptinjektion.
Brugsscenarie B: Intern researchassistent med lang kontekst
Problem: Jurister, driftsansvarlige eller tekniske ledere har brug for at »læse disse 40 PDF’er eller dette udsnit af et monorepo og udarbejde et struktureret notat« uden at uploade materialet til en SaaS-LLM.
Forløb:
- Et menneske placerer en opgavemappe, eller n8n overvåger en sikker indbakke.
- n8n samler metadata og relevante søgeresultater, eller Hermes-værktøjer læser fra en tilladt sti eller et RAG-indeks.
- Hermes kører en undersøgelsesprompt i flere trin mod DeepSeek-V4-Flash med et eksplicit citationsskema.
- n8n validerer svarets form og placerer det i en kø til gennemgang. Kræv en kildesti og et tekstudsnit til hver påstand. Mennesker accepterer eller afviser det.
Hvorfor V4-Flash: Den officielle kontekst på 1M tokens og effektiv behandling af lang kontekst er pointen, men kontekstvindue ≠ nøjagtighed. Kvaliteten af informationssøgningen og kontrollen af kildehenvisninger betyder mere end det maksimale antal tokens.
Gør ikke: Indsend ikke automatisk regulatoriske rapporter eller medicinske resuméer. Brug kun løsningen til læsearbejde og udkast; autoriserede fagpersoner skal godkende.
Brugsscenarie C: Kontinuerlig driftsanalyse med chat som indgang
Problem: Den vagthavende vil kunne sige »overvåg disse alarmer, undersøg dem med logfiler, og foreslå et trin i driftsvejledningen« samt stille opfølgende spørgsmål via Telegram eller Slack uden at give modellen rootadgang til systemflåden.
Forløb:
- En tidsplan i n8n eller en PagerDuty-webhook indsamler alarmfingeraftryk.
- Hermes undersøger med skrivebeskyttede værktøjer som API’er til logforespørgsler og statusendepunkter via adgangsoplysninger på tilladelseslisten.
- Hermes returnerer en hypotese, dokumentation og den foreslåede næste kommando uden at køre den.
- En valgfri OpenClaw- eller NemoClaw-kanal giver den vagthavende adgang til et separat konfigureret agentmiljø med tilladelseslister til parring (grundlæggende sikkerhed i OpenClaw). Antag ikke, at OpenClaw og Hermes deler session eller hukommelseslager.
Hypotesen om to Sparks: Samtidige undersøgelser eller en større model eller kontekst kan retfærdiggøre den anden node. Sammenlign med én Spark og administreret inferens ved hjælp af målte køer, kvalitet, svartid, samlede ejeromkostninger og krav til databeskyttelse.
Gør ikke: Afhjælp ikke automatisk. Foreslåede kommandoer skal gå til et menneske eller en snævert afgrænset udfører af driftsvejledninger med egen godkendelse.
Fejltilstande, du bør designe for på dag ét
| Fejl | Symptom | Afhjælpning |
|---|---|---|
| Fejlkonfiguration af NCCL/RoCE | Systemet hænger eller falder tilbage til TCP med meget høj svartid | Lås NCCL til RoCE-interfaces; validér netværket før agenter |
| For stor kontekst | Ét langt job blokerer de andre | Begræns max_model_len og samtidigheden; brug kø i n8n |
| Misbrug af indgangen | Angriber udløser Hermes | Bearer-godkendelse eller HMAC + tidsstempel; privat netværk; hastighedsbegrænsning |
| Promptinjektion | Sagstekst tilsidesætter politikken | Adskilte systemprompter til hver rute; tilladelseslister til værktøjer; ingen rå HTML til shell |
| Tavse SaaS-skrivninger | Dublerede CRM-opdateringer | Idempotensnøgler; menneskelig godkendelse før afsendelse |
| Modelændring | Opskriften bryder efter containeropdatering | Lås image-kontrolsummer; kør indledende test i CI |
Hvad »færdig« ser ud som
Du kan kun hævde, at det testede omfang fungerer, når:
- En versionslåst softwarebygning til to Sparks består gentagne og samtidige belastningstest, herunder den fejlform, der er rapporteret af opstrømsprojektet. Registrér det præcise antal kørsler, kontekststørrelser og fejlrate.
- Vejen n8n → Hermes → model er godkendt fra ende til anden og logget, og n8n validerer det returnerede applikationsskema.
- Mindst én navngiven arbejdsgang kører med menneskelig godkendelse af hver ekstern besked og består sit foruddefinerede evalueringssæt.
- Du har en skriftlig tilbagerulningsplan: Deaktivér kaldet fra n8n til Hermes, gå tilbage til skabeloner alene i n8n, eller peg Hermes på en mindre lokal model.
Øvelse
Vælg brugsscenarie A. Implementér kun webhookvalidering i n8n, én versionsstyret promptkontrakt gennem Hermes-API-serveren med et bearer-token, en idempotensregistrering på arbejdsgangsniveau, et lokalt modelkald, validering af svarskemaet og en forhåndsvisning af udkastet. Tilslut ikke funktionen til at sende e-mail. Brug et repræsentativt, godkendt evalueringssæt, der er stort nok til at omfatte normale og sjældne tilfælde. Fastlæg på forhånd kriterier for enighed om alvorsgrad, udokumenterede påstande, redigeringsbehov, svartid og fejl. Afgør ud fra denne dokumentation, om en anden Spark eller V4-Flash er berettiget.



