Experimenteller Stack aus zwei DGX Sparks, DeepSeek-V4-Flash, n8n und Hermes
Fortgeschritten10 Min. LesezeitPrivate / lokale KI

Experimenteller Stack aus zwei DGX Sparks, DeepSeek-V4-Flash, n8n und Hermes

So bewerten Sie einen experimentellen Community-Pfad für DeepSeek-V4-Flash auf zwei DGX-Spark-Systemen, mit n8n für die deterministische Automatisierung und Hermes für Urteilsaufgaben.

Das sollten Sie danach können

Die Bereitstellung von DeepSeek-V4-Flash auf zwei Sparks ist ein experimenteller Community-Pfad, kein Produktivrezept von NVIDIA oder vLLM. Validieren Sie den genauen Build, bevor Sie n8n und Hermes ergänzen, und verlangen Sie für jede irreversible Aktion eine menschliche Freigabe.

Nur in diesem Browser gespeichert.
In diesem Artikel

Dies ist nach dem Kauf eines zweiten DGX Spark eine plausible Laborarchitektur: lokale Inferenz für ein großes Modell, Automatisierung für Geschäftssysteme und eine Agenten-Runtime. Es handelt sich nicht um einen schlüsselfertigen Stack mit Herstellerunterstützung.

Die belastbare Variante ist enger gefasst. Sie bewerten vier Schichten, die voneinander trennbar bleiben müssen:

  1. Clusternetz: zwei für verteilte Inferenz verbundene Sparks (NVIDIA-Dokumentation zum Clustering, Playbook zum Verbinden zweier Sparks).
  2. Experimenteller Modellserver: ein von der Community entwickelter OpenAI-kompatibler Pfad für DeepSeek-V4-Flash oder die DSpark-Variante mit spekulativer Decodierung über beide Knoten.
  3. Deterministische Automatisierung: n8n für Webhooks, Zeitpläne, Schreibvorgänge in CRM, E-Mail und Slack, Validierung und menschliche Freigabeschritte.
  4. Runtime für Ermessensaufgaben: Hermes Agent für Triage, Entwürfe, Untersuchungen und Tool-Nutzung, die Gedächtnis und mehrstufiges Schlussfolgern erfordert (offizielle Dokumentation des API-Servers, offizielle Webhook-Dokumentation).

Die in diesem Artikel beschriebene Verknüpfung von n8n und Hermes ist ein illustratives Integrationsmuster, kein von einem der beiden Anbieter dokumentierter oder unterstützter schlüsselfertiger Pfad. Wenn ein Workflow das Agentenergebnis zurück in n8n benötigt, verwenden Sie den mit Bearer-Token authentifizierten API-Server von Hermes. Der HMAC-Webhook-Adapter von Hermes ist eine andere Eingangsfläche für Ereignisse: Er startet einen Agenten und liefert das Ergebnis an ein konfiguriertes Ziel, statt einen allgemeinen synchronen Rückgabevertrag für n8n zu definieren.

Optionale fünfte Schicht: OpenClaw für die Bedienung über Chatkanäle wie Telegram oder Slack, optional über NemoClaw und OpenShell gestartet, wenn Sie Sandbox-Policies benötigen. NemoClaw ist derzeit ein Alpha-Projekt in einer frühen Vorschauphase und keine produktionsreife Software. Keine der beiden Schichten ist für die drei Workflows unten erforderlich.

Lassen Sie eine Agentenschleife nicht automatisch Kunden-E-Mails senden, Rechtsdokumente einreichen, Produktivinfrastruktur ändern oder Zahlungen ausführen. Leiten Sie irreversible Aktionen über einen menschlichen Freigabeschritt, bis Protokolle, Idempotenz und genügend geprüfte Läufe vorliegen, um dem Pfad zu vertrauen.

Was DeepSeek-V4-Flash auf zwei Sparks ändert

DeepSeek-V4-Flash ist ein Mixture-of-Experts-Modell mit insgesamt 284B Parametern, davon 13B aktiviert, und einem Kontextfenster von 1M Tokens laut offizieller Model Card. Die Gewichte des Instruct-Modells verwenden FP4 für geroutete Experten und sonst FP8. Diese Kombination ist auf Spark relevant, weil:

  • Die Zahl der aktivierten Parameter hält die Decodierungskosten gegenüber dichten Modellen ähnlicher Gesamtgröße beherrschbar.
  • Langer Kontext für Agenten-Workloads wie Repository-Ausschnitte, Ticketverläufe und Policy-Sammlungen nützlich ist, sofern Sie das richtige Material abrufen und Behauptungen weiterhin prüfen.
  • Der DSpark-Checkpoint dasselbe Modell mit einem Modul für spekulative Decodierung ist. Das offizielle Beispiel der Model Card verwendet einen GB300-Knoten mit vier GPUs, nicht zwei Sparks; der unten behandelte Community-Bericht zu vLLM verwendet den Checkpoint ohne DSpark auf zwei GB10-Systemen.

Behandeln Sie veröffentlichte Ergebnisse zu Tokens pro Sekunde und zum maximalen Kontext als rezeptspezifische Berichte, nicht als Garantie für Ihre Kabel-, Treiber-, Container- oder Nebenläufigkeitseinstellungen. Die offiziellen Model Cards dokumentieren kein validiertes Dual-Spark-Deployment; das DSpark-Beispiel nutzt einen GB300-Knoten mit vier GPUs. Bei der erneuten Prüfung am 2026-08-10 meldete das offene vLLM-Issue #40969 nach der sechsten oder siebten Anfrage einen Stillstand auf zwei GB10-Systemen, und zwar für einen bestimmten vLLM-Build mit FULL_AND_PIECEWISE-CUDA-Graphen, Chunked Prefill, Marlin MoE, FP8-KV-Cache und TP=2. Das ist ein Beleg für diese Konfiguration, nicht für jedes Deployment. Übernehmen Sie diesen Pfad nur als Experiment mit festgeschriebenen Versionen und einem Rollback-Modell.

Referenzarchitektur

                    ┌─────────────────────────────────────┐
   Form./CRM/Git ──►│ n8n (validieren, verzweigen, HITL)  │──► Slack / CRM / E-Mail
                    └──────────────────┬──────────────────┘
                                       │ HTTPS + Bearer-Authentifizierung
                                       ▼
                    ┌─────────────────────────────────────┐
                    │ Hermes (Gedächtnis, Tools, Entwurf) │
                    └──────────────────┬──────────────────┘
                                       │ OpenAI-kompatibel /v1
                                       ▼
              ┌───────────────────────────────────────────┐
              │ Spark A ◄── QSFP / RoCE ──► Spark B       │
              │ experimenteller Community-TP=2-Modellpfad │
              └───────────────────────────────────────────┘

Designregeln, die aus der Demonstration eine belastbare Lösung machen:

SchichtBesitztDarf nicht besitzen
n8nAuslöser, Schemata, Wiederholungen, SaaS-Schreibvorgänge, FreigabenUneingeschränkter Shell-Zugriff im LAN
HermesKlassifikation, Entwürfe, Rechercheschritte, Tool-NutzungStille Produktiv-Seiteneffekte
ModellserverTokens hinein und hinausGeschäftszugangsdaten
OpenClaw (optional)Chatkanäle für Menschen und AllowlistsRoot-Zugriff auf den Host ohne Sandbox

Konfigurieren Sie den Cluster-Endpunkt für Hermes und gegebenenfalls für die KI-Nodes in n8n als gewöhnliche OpenAI-kompatible Basis-URL. Halten Sie API-Schlüssel im LAN oder VPN und stellen Sie den vLLM-Port nicht ins öffentliche Internet.

Checkliste für die Inbetriebnahme, bei der die Reihenfolge zählt

1. Netzwerk zwischen den beiden Sparks

Folgen Sie NVIDIAs Playbook, nicht inoffiziellen Ratschlägen:

  • Gleicher Benutzername auf beiden Knoten.
  • Ein QSFP-Kabel zwischen passenden ConnectX-7-Ports. Das Playbook von NVIDIA gibt an, dass die volle Bandbreite mit einem Kabel erreichbar ist, und dokumentiert keinen Durchsatzgewinn durch ein zweites Kabel zwischen denselben beiden Systemen.
  • Dedizierte L3-Adressierung und Netplan für den Hochgeschwindigkeitspfad; 10 GbE oder WLAN für Verwaltung und Internet beibehalten.
  • Passwortloses SSH zwischen den Knoten.
  • Prüfen Sie, ob die Schnittstellen Up anzeigen (ibdev2netdev / NVIDIA-Schritte), bevor Sie NCCL-Fehler untersuchen.

NVIDIA Syncs Cluster Assistant kann ConnectX-7 und SSH für unterstützte Topologien konfigurieren; es installiert Ihren Inferenz-Stack nicht für Sie.

2. Modellserver

  • Wählen Sie ein benanntes Community-Rezept, das Container oder Build, CUDA-Stack, vLLM-Patches, Startbefehle und bekannte Grenzen festschreibt. Setzen Sie keinen Produktivbefehl aus Fragmenten dieses Artikels zusammen.
  • Prüfen Sie, ob das Rezept Ihre beiden GB10-Knoten und den genauen Checkpoint DeepSeek-V4-Flash ausdrücklich unterstützt. Tensor-Parallelität mit Grad 2 ist hier eine zu prüfende Hypothese, kein offizielles Supportversprechen.
  • Stellen Sie /v1/models und /v1/chat/completions nur auf einer privaten Schnittstelle bereit.
  • Halten Sie den tatsächlich konfigurierten Maximalkontext, die maximale Zahl gleichzeitiger Sequenzen, den KV-Datentyp und die Aktivierung spekulativer Decodierung fest.
  • Die aktuelle Hermes-Dokumentation verlangt einen konfigurierten Modellkontext von mindestens 64K Tokens. Ein Serving-Profil mit geringerem Kontext belegt keine Kompatibilität mit dem aktuellen Hermes. Konfigurieren und testen Sie daher vor dem Anschluss ein Profil mit mindestens 64K in einem Dauertest.

Testen Sie kurze, lange, wiederholte und gleichzeitige Prompts, bevor Sie Agenten anbinden. Der gemeldete Dual-Spark-Fehler tritt erst nach mehreren Anfragen auf, daher beweist ein einzelnes „hello“ fast nichts. Dieser Pfad ist erst dann produktionsreif, wenn ein versionsgebundener Dauertest auf Ihrer Hardware besteht.

3. Hermes

  • Installieren Sie Hermes über den offiziellen Hermes-Quickstart und konfigurieren Sie den Modellanbieter mit der privaten OpenAI-kompatiblen Basis-URL.
  • Aktivieren Sie für die unten beschriebenen Anfrage-Antwort-Workflows den API-Server, setzen Sie einen starken API_SERVER_KEY, halten Sie ihn auf einer privaten Schnittstelle und prüfen Sie GET /health am dokumentierten Standardport 8642. Verwenden Sie /v1/responses für ein direktes Ergebnis oder /v1/runs mit Statusabfrage für einen lang laufenden Auftrag.
  • Wenn Ihr Anwendungsfall Ereignisse empfangen und die Ausgabe an anderer Stelle zustellen soll, verwenden Sie den getrennten Webhook-Adapter: benannte Routen, zeitgestempeltes V2-HMAC, Anfrage-IDs zur Deduplizierung und den Standardport 8644. Verwechseln Sie dessen Bestätigung nicht mit der Ausgabe des Agenten.
  • Verweigern Sie breiten Shell-Zugriff, bis eine Allowlist besteht und ein Mensch die Logs überwacht. Der API-Schlüssel autorisiert den Zugriff auf die Tools des Agenten, nicht nur auf Modelltext.

Auf DGX Spark kann NemoClaw Hermes in OpenShell mit Dateisystem-, Netzwerk- und Prozess-Policies ausführen. Behandeln Sie dies als Alpha-Evaluierungspfad, nicht als Sicherheitsgarantie für den Produktivbetrieb.

4. n8n

  • Betreiben Sie n8n selbst im selben vertrauenswürdigen Netz oder über VPN. Nutzen Sie vorzugsweise die Muster aus Lokale OpenAI-kompatible Endpunkte aus n8n aufrufen und Idempotenz und menschliche Freigabeschritte.
  • Konfigurieren Sie für die unten verwendete Anfrage-Antwort-Übergabe an Hermes den offiziellen HTTP Request-Node von n8n mit Bearer-Zugangsdaten und expliziten Zeitüberschreitungen. Halten Sie den dauerhaften geschäftlichen Idempotenzdatensatz in n8n oder im Geschäftssystem. Der API-Server von Hermes unterstützt das Zwischenspeichern von Antworten anhand von Idempotency-Key für fünf Minuten; dieses begrenzte Fenster auf Transportebene ersetzt keine dauerhafte Deduplizierung im Workflow. Wenn Sie bewusst den getrennten Hermes-Webhook-Pfad wählen, kann der Crypto-Node von n8n das HMAC erzeugen, doch die signierten Bytes und die V2-Zeitstempel-Header müssen exakt dem Hermes-Webhook-Vertrag entsprechen. Die n8n ↔ Hermes-Webhook-Übergabe ist ein illustratives Design, keine offizielle Anbieterintegration.

Drei Kandidaten-Workloads für die Evaluierung

Anwendungsfall A: Private Support-Triage

Problem: Tickets enthalten Kundentext, den Sie nicht an einen öffentlichen Modellanbieter senden möchten. Die Triage erfordert weiterhin die Bewertung von Schweregrad, Produktbereich und möglichen Duplikaten sowie einen Antwortentwurf.

Ablauf:

  1. Helpdesk-Webhook → n8n.
  2. n8n validiert das Schema, entfernt Geheimnisse wie Tokens und rohe Kartennummern und dedupliziert anhand der Ticket-ID.
  3. n8n erfasst einen Idempotenzschlüssel auf Workflow-Ebene und sendet dann eine minimale Nutzlast mit Bearer-Authentifizierung an den privaten Hermes-API-Server. Dabei gilt ein enger, versionierter support-triage-Prompt-Vertrag.
  4. Hermes ruft das lokale DeepSeek-V4-Flash auf und gibt eine Antwort zurück. n8n parst das angeforderte Objekt {severity, product, confidence, draft, needs_human} und validiert es gegen das Schema; fehlerhafte oder unvollständige Ausgaben gehen an einen Menschen zur Prüfung.
  5. n8n verzweigt: geringe Konfidenz oder needs_human → Freigabe in Slack; hohe Konfidenz und zugelassene Aktionen → nur Ticketfelder aktualisieren. Senden Sie weiterhin nichts automatisch, bis der Pfad dafür freigegeben ist.

Zu prüfende Hypothese: n8n-Connectoren und ein Hermes-API-Aufruf könnten diesen Ablauf unterstützen. Der Modellendpunkt bleibt im privaten Netz, doch ausgehende Tools und SaaS-Connectoren überschreiten diese Grenze weiterhin und benötigen Egress-Kontrollen. Prüfen Sie, ob zusätzlicher Kontext das Ergebnis verbessert, und kontrollieren Sie den Entwurf weiterhin.

Nicht: Lassen Sie Hermes keine beliebigen URLs aus Tickettext ohne Proxy-Allowlist öffnen, da der Text Prompt-Injection enthalten kann.

Anwendungsfall B: Interner Rechercheassistent mit langem Kontext

Problem: Juristen, Betriebsverantwortliche oder technische Leiter benötigen „Lesen Sie diese 40 PDFs oder diesen Ausschnitt aus dem Monorepo und erstellen Sie eine strukturierte Zusammenfassung“, ohne den Korpus zu einem SaaS-LLM hochzuladen.

Ablauf:

  1. Ein Mensch legt einen Auftragsordner ab, oder n8n überwacht einen sicheren Posteingang.
  2. n8n bündelt Metadaten und relevante Suchtreffer, oder Hermes-Tools lesen von einem zugelassenen Pfad oder RAG-Index.
  3. Hermes führt einen mehrstufigen Recherche-Prompt mit DeepSeek-V4-Flash und einem ausdrücklichen Zitationsschema aus.
  4. n8n validiert die Form der Antwort und legt sie in eine Prüfwarteschlange. Fordern Sie für jede Behauptung einen Quellpfad und eine Textspanne; Menschen nehmen sie an oder lehnen sie ab.

Warum V4-Flash: Der offizielle Kontext von 1M Tokens und die effiziente Verarbeitung langer Kontexte sind der entscheidende Punkt, aber Kontextfenster ≠ Genauigkeit. Die Qualität der abgerufenen Informationen und die Zitationsprüfungen zählen mehr als die maximale Tokenzahl.

Nicht: Reichen Sie regulatorische Berichte oder medizinische Zusammenfassungen nicht automatisch ein. Nutzen Sie die Lösung nur für Lese- und Entwurfsarbeit; qualifizierte Fachleute müssen freigeben.

Anwendungsfall C: Ständige Betriebsanalyse mit Chat-Zugang

Problem: Der Bereitschaftsdienst möchte „diese Warnmeldungen beobachten, anhand von Logs untersuchen und einen Runbook-Schritt vorschlagen“ sowie Rückfragen über Telegram oder Slack stellen, ohne dem Modell Root-Zugriff auf die Systeme zu geben.

Ablauf:

  1. Ein n8n-Zeitplan oder PagerDuty-Webhook sammelt Fingerabdrücke der Warnmeldungen.
  2. Hermes untersucht mit schreibgeschützten Tools wie einer API für Logabfragen und Status-Endpunkten über Zugangsdaten auf einer Allowlist.
  3. Hermes liefert eine Hypothese, Belege und den vorgeschlagenen nächsten Befehl, ohne ihn auszuführen.
  4. Ein optionaler OpenClaw- oder NemoClaw-Kanal ermöglicht dem Bereitschaftsdienst, eine separat konfigurierte Agenten-Runtime abzufragen, abgesichert durch Pairing-Allowlists (Grundlagen der OpenClaw-Sicherheit). Gehen Sie nicht davon aus, dass OpenClaw und Hermes eine Sitzung oder einen Gedächtnisspeicher teilen.

Zwei-Spark-Hypothese: Gleichzeitige Untersuchungen oder ein größeres Modell bzw. größerer Kontext können den zweiten Node rechtfertigen. Vergleichen Sie mit einem Spark und verwalteter Inferenz anhand gemessener Queue, Qualität, Latenz, Gesamtkosten und Datenschutzanforderungen.

Nicht: Führen Sie keine automatische Fehlerbehebung durch. Vorgeschlagene Befehle gehen an einen Menschen oder eine eng begrenzte Runbook-Ausführung mit eigener Authentifizierung.

Fehlermodi, die Sie von Anfang an berücksichtigen sollten

FehlerSymptomGegenmaßnahme
NCCL-/RoCE-FehlkonfigurationStillstand oder TCP-Fallback mit hoher LatenzNCCL an RoCE-Schnittstellen binden; Netzwerk vor Agenten validieren
Zu großer KontextEin langer Auftrag blockiert anderemax_model_len und Parallelität begrenzen; in n8n einreihen
Missbrauch des EingangsAngreifer löst Hermes ausBearer-Authentifizierung oder HMAC + Zeitstempel; privates Netz; Ratenbegrenzung
Prompt-InjectionTickettext überschreibt die PolicySeparate System-Prompts für jede Route; Tool-Allowlists; kein rohes HTML an die Shell
Stille SaaS-SchreibvorgängeDoppelte CRM-AktualisierungenIdempotenzschlüssel; menschliche Freigabe vor dem Senden
ModelldriftRezept bricht nach Container-UpdateImage-Digests festschreiben; Kurztests in CI

Was „fertig“ aussieht

Sie können nur beanspruchen, dass der getestete Umfang funktioniert, wenn:

  1. Ein versionsgebundener Dual-Spark-Build wiederholte und gleichzeitige Dauertests besteht, einschließlich des upstream gemeldeten Fehlers. Zeichnen Sie die genaue Anzahl der Läufe, die Kontextgrößen und die Fehlerrate auf.
  2. Der Pfad n8n → Hermes → Modell durchgängig authentifiziert und protokolliert ist; n8n validiert das zurückgegebene Anwendungsschema.
  3. Mindestens ein benannter Workflow mit menschlicher Freigabe bei jeder externen Nachricht läuft und sein vordefiniertes Evaluierungsset besteht.
  4. Sie einen schriftlichen Rollback haben: den Aufruf von n8n an Hermes deaktivieren, auf reine n8n-Vorlagen zurückfallen oder Hermes auf ein kleineres lokales Modell umstellen.

Übung

Wählen Sie Anwendungsfall A. Implementieren Sie nur: Webhook-Validierung in n8n, einen versionierten Prompt-Vertrag über den mit Bearer-Token authentifizierten Hermes-API-Server, einen Idempotenzdatensatz auf Workflow-Ebene, einen lokalen Modellaufruf, die Validierung des Antwortschemas und eine Entwurfsvorschau. Verbinden Sie keine E-Mail-Sendefunktion. Verwenden Sie ein repräsentatives, freigegebenes Evaluierungsset, das groß genug ist, um normale und seltene Fälle abzudecken. Legen Sie Kriterien für Übereinstimmung beim Schweregrad, unbelegte Behauptungen, Bearbeitungsaufwand, Latenz und Fehler vorab fest. Entscheiden Sie anhand dieser Nachweise, ob ein zweiter Spark oder V4-Flash gerechtfertigt ist.

Weiterführende Lektüre

Weiterlesen

Fahren Sie mit demselben Lernpfad fort und lesen Sie die nächsten praktischen Artikel.