Pila experimental con dos DGX Spark, DeepSeek-V4-Flash, n8n y Hermes
Avanzado10 min de lecturaIA privada/local

Pila experimental con dos DGX Spark, DeepSeek-V4-Flash, n8n y Hermes

Cómo evaluar una ruta experimental de la comunidad con dos DGX Spark para DeepSeek-V4-Flash, con n8n en el borde determinista y Hermes en la ruta de juicio.

Lo que deberías poder hacer

El servicio de DeepSeek-V4-Flash en dos Sparks es una ruta experimental de la comunidad, no una receta de producción de NVIDIA ni de vLLM. Valida la compilación exacta antes de añadir n8n y Hermes, y exige aprobación humana para cada acción irreversible.

Guardado solo en este navegador.
En este artículo

Esta es una arquitectura de laboratorio plausible tras comprar un segundo DGX Spark: inferencia local para un modelo grande, automatización conectada a los sistemas de negocio y un entorno de ejecución para agentes. No es una pila llave en mano con soporte oficial.

La versión defendible es más acotada. Estás evaluando cuatro capas que deben permanecer separables:

  1. Fabric: dos Sparks enlazados para inferencia distribuida (documentación de NVIDIA sobre clústeres, guía para conectar dos Sparks).
  2. Servidor de modelos experimental: una ruta compatible con OpenAI creada por la comunidad para DeepSeek-V4-Flash (o la variante DSpark con decodificación especulativa) en ambos nodos.
  3. Automatización determinista: n8n para webhooks, programaciones, efectos secundarios en CRM, correo o Slack, validación y controles humanos.
  4. Entorno de ejecución para tareas de criterio: Hermes Agent para clasificación, redacción, investigación y uso de herramientas que requieren memoria y razonamiento en varios pasos (documentación oficial del servidor API, documentación oficial de webhooks).

La composición entre n8n y Hermes de este artículo es un ejemplo de integración, no una ruta llave en mano documentada ni respaldada por ninguno de los proveedores. Si el flujo de trabajo necesita recuperar el resultado del agente en n8n, usa el servidor API de Hermes con autenticación mediante token de portador. El adaptador de webhooks HMAC de Hermes es una superficie distinta para la entrada de eventos: activa un agente y entrega el resultado a un destino configurado, en lugar de definir un contrato general de respuesta síncrona para n8n.

Quinta capa opcional: OpenClaw para la experiencia de usuario en canales de chat (Telegram, Slack, etc.), que puede iniciarse mediante NemoClaw y OpenShell cuando necesites políticas de sandbox. NemoClaw es actualmente un proyecto alfa en versión preliminar, no software listo para producción. Ninguna de estas capas es necesaria para los tres flujos de trabajo siguientes.

No envíes automáticamente correo a clientes, presentes documentos legales, cambies infraestructura de producción ni pagues dinero desde un bucle de agente. Enruta acciones irreversibles por un nodo de aprobación humana hasta que tengas logs, idempotencia y suficientes ejecuciones revisadas para confiar en la ruta.

Qué cambia DeepSeek-V4-Flash en dos Sparks

DeepSeek-V4-Flash es un modelo Mixture-of-Experts con 284B parámetros totales y 13B activados, y una ventana de contexto de 1M tokens según la ficha oficial del modelo. Los pesos Instruct usan FP4 para los expertos enrutados y FP8 en el resto. Esa combinación importa en Spark porque:

  • El recuento de parámetros activados se mantiene manejable para el coste de decodificación en comparación con modelos densos de tamaño «titular» similar.
  • El contexto largo es útil para cargas de agentes como fragmentos de repositorios, historiales de tickets y conjuntos de políticas, siempre que recuperes el material adecuado y sigas verificando las afirmaciones.
  • El punto de control DSpark es el mismo modelo con un módulo de decodificación especulativa acoplado. El ejemplo de su ficha oficial usa un nodo GB300 con cuatro GPU, no dos Sparks; el informe de la comunidad de vLLM que se comenta a continuación usa el punto de control que no es DSpark en dos sistemas GB10.

Trata los resultados publicados de tokens por segundo y contexto máximo como informes específicos de una receta, no como garantías para tu cable, controlador, contenedor o configuración de concurrencia. Las fichas oficiales de los modelos no documentan un despliegue dual-Spark validado; el ejemplo de DSpark usa un nodo GB300 con cuatro GPU. Según una nueva comprobación realizada el 2026-08-10, la incidencia abierta de vLLM #40969 informa de un bloqueo después de la sexta o séptima petición en dos sistemas GB10 para una compilación fijada de vLLM con grafos CUDA FULL_AND_PIECEWISE, prellenado por fragmentos, Marlin MoE, caché KV FP8 y TP=2. Es evidencia sobre esa configuración, no sobre todos los despliegues. Adopta esta ruta solo como un experimento con versiones fijadas y un modelo de reversión.

Arquitectura de referencia

                          ┌──────────────────────────────────────────┐
   Formularios/CRM/Git ──►│ n8n (valida, ramifica, HITL)             │──► Slack / CRM / correo
                          └─────────────────────┬────────────────────┘
                                                │ HTTPS + autenticación de portador
                                                ▼
                          ┌──────────────────────────────────────────┐
                          │ Hermes (memoria, herramientas, borrador) │
                          └─────────────────────┬────────────────────┘
                                                │ /v1 compatible con OpenAI
                                                ▼
                      ┌──────────────────────────────────────────────────┐
                      │ Spark A ◄── QSFP / RoCE ──► Spark B              │
                      │ ruta de modelo TP=2 experimental de la comunidad │
                      └──────────────────────────────────────────────────┘

Reglas de diseño que evitan que esto se convierta en una demo:

CapaPoseeNo debe poseer
n8nDesencadenantes, esquemas, reintentos, escrituras SaaS, aprobacionesAcceso general al shell en la LAN
HermesClasificación, redacción, pasos de investigación, uso de herramientasEfectos secundarios silenciosos en producción
Servidor de modeloTokens de entrada y de salidaCredenciales de negocio
OpenClaw (opcional)Canales de chat para personas + listas de permitidosAcceso root al host sin aislamiento

Apunta Hermes, y los nodos de IA de n8n si los usas, al endpoint del clúster como una URL base compatible con OpenAI. Mantén las claves de API en la LAN o la VPN; no expongas el puerto de vLLM en la internet pública.

Lista de comprobación de arranque (el orden importa)

1. Fabric dual-Spark

Sigue la guía de NVIDIA, no las explicaciones de oídas:

  • Mismo nombre de usuario en ambos nodos.
  • Un cable QSFP entre puertos ConnectX-7 coincidentes. El manual de NVIDIA indica que el ancho de banda completo se alcanza con un solo cable, y no documenta ninguna mejora de rendimiento por añadir un segundo cable entre los mismos dos sistemas.
  • Direccionamiento L3 dedicado / netplan para la ruta de alta velocidad; mantén 10 GbE o Wi-Fi para gestión e internet.
  • SSH sin contraseña entre nodos.
  • Confirma que las interfaces muestran Up (ibdev2netdev / pasos de NVIDIA) antes de perseguir errores NCCL.

Cluster Assistant de NVIDIA Sync puede configurar ConnectX-7 y SSH para topologías compatibles; no instala la pila de inferencia por ti.

2. Servidor de modelo

  • Selecciona una receta de la comunidad claramente identificada que fije el contenedor o la compilación, la pila CUDA, los parches de vLLM, los comandos de lanzamiento y las limitaciones conocidas. No construyas un comando de producción a partir de fragmentos de este artículo.
  • Verifica que la receta soporte explícitamente tus dos nodos GB10 y el punto de control exacto de DeepSeek-V4-Flash. Un tamaño de tensor parallel de 2 es una hipótesis que probar aquí, no una promesa oficial de soporte.
  • Expón /v1/models y /v1/chat/completions solo en una interfaz privada.
  • Registra el contexto máximo que configures realmente, el máximo de secuencias simultáneas, el tipo de datos de KV y si la decodificación especulativa está habilitada.
  • La documentación actual de Hermes exige configurar un contexto de modelo de al menos 64K tokens. Un perfil de servicio con un contexto menor no demuestra compatibilidad con la versión actual de Hermes; configura y somete a una prueba prolongada un perfil de 64K o más antes de conectarlo.

Haz pruebas de humo con prompts cortos, largos, repetidos y concurrentes antes de cablear agentes. El fallo dual-Spark reportado aparece tras múltiples peticiones, así que un solo «hola» casi no demuestra nada. Esta ruta no está lista para producción hasta que una prueba prolongada fijada pase en tu hardware.

3. Hermes

  • Instala desde la guía oficial de inicio rápido de Hermes y configura su proveedor de modelos para que use la URL base privada compatible con OpenAI.
  • Para los flujos de petición-respuesta que siguen, activa el servidor API, define una API_SERVER_KEY robusta, mantenlo en una interfaz privada y verifica GET /health (puerto predeterminado documentado: 8642). Usa /v1/responses para obtener un resultado directo o /v1/runs con consultas de estado para un trabajo largo.
  • Si tu caso de uso requiere la entrada de eventos y la entrega del resultado en otro lugar, usa el adaptador de webhooks independiente: rutas con nombre, HMAC V2 con marca de tiempo, identificadores de petición para deduplicar y el puerto predeterminado 8644. No confundas su acuse de recibo con el resultado del agente.
  • Deniega el acceso general al shell hasta que tengas una lista de permitidos y una persona vigilando los registros. La clave de API autoriza el acceso a las herramientas del agente, no solo al texto del modelo.

En DGX Spark, NemoClaw puede ejecutar Hermes dentro de OpenShell con políticas de sistema de archivos, red y procesos. Trátalo como una ruta de evaluación alfa, no como una garantía de seguridad para producción.

4. n8n

  • Aloja n8n en infraestructura propia dentro de la misma red de confianza o VPN. Prefiere los patrones de endpoints locales compatibles con OpenAI desde n8n e idempotencia y controles humanos.
  • Para la transferencia de petición-respuesta a Hermes utilizada a continuación, configura el nodo HTTP Request oficial de n8n con credenciales de portador y tiempos de espera explícitos. Conserva el registro duradero de idempotencia del proceso de negocio en n8n o en el sistema de negocio. El servidor API de Hermes almacena en caché durante cinco minutos las respuestas asociadas a una Idempotency-Key, pero esa ventana acotada de transporte no sustituye la deduplicación duradera del flujo de trabajo. Si eliges deliberadamente la ruta independiente de webhooks de Hermes, el nodo Crypto de n8n puede generar el HMAC, pero los bytes firmados y las cabeceras de marca de tiempo V2 deben seguir exactamente el contrato de webhooks de Hermes. La transferencia mediante webhook entre n8n y Hermes es un diseño ilustrativo, no una integración oficial de los proveedores.

Tres cargas de trabajo candidatas para la evaluación

Caso de uso A: Triaje de soporte privado

Problema: Los tickets contienen texto de clientes que no quieres en un proveedor de modelos público. El triaje sigue necesitando juicio: severidad, área de producto, detección de duplicados, borrador de respuesta.

Flujo:

  1. Webhook del helpdesk → n8n.
  2. n8n valida el esquema, elimina secretos (tokens, números de tarjeta en bruto), deduplica por id de ticket.
  3. n8n registra una clave de idempotencia en el flujo de trabajo y después envía una carga útil mínima al servidor API privado de Hermes mediante un contrato de prompt support-triage acotado y versionado, con autenticación mediante token de portador.
  4. Hermes llama a DeepSeek-V4-Flash local y devuelve una respuesta. n8n analiza y valida frente al esquema el objeto solicitado {severity, product, confidence, draft, needs_human}; una salida incorrecta o incompleta se deriva a revisión humana.
  5. n8n ramifica: baja confianza o needs_human → aprobación en Slack; alta confianza + acciones en lista de permitidos → actualiza solo campos del ticket (aún sin auto-envío hasta que superes esa fase).

Hipótesis a probar: los conectores de n8n y una llamada a la API de Hermes podrían admitir este flujo. El endpoint del modelo permanece en la red privada, pero las herramientas salientes y los conectores SaaS siguen cruzando ese límite y necesitan controles de salida. Evalúa si el contexto añadido mejora el resultado y sigue verificando el borrador.

No hagas: Dejar que Hermes abra URLs arbitrarias del texto del ticket sin una lista de permitidos de proxy (inyección de prompts).

Caso de uso B: Asistente de investigación interna de contexto largo

Problema: Abogados, ops o responsables de ingeniería necesitan «lee estos 40 PDFs / este fragmento del monorepo y produce un informe estructurado» sin subir el corpus a un LLM SaaS.

Flujo:

  1. Un humano deja una carpeta de trabajo (o n8n vigila un buzón seguro).
  2. n8n empaqueta metadatos + hits de recuperación (o las herramientas de Hermes leen desde una ruta / índice RAG en lista de permitidos).
  3. Hermes ejecuta un prompt de investigación de varios pasos contra DeepSeek-V4-Flash con un esquema explícito de citas.
  4. n8n valida la estructura de la respuesta y la coloca en una cola de revisión. Exige una ruta de origen y un intervalo para cada afirmación; las personas aceptan o rechazan.

Por qué V4-Flash: El contexto oficial de 1M y la atención eficiente de contexto largo son la razón para usarlo, pero ventana de contexto ≠ exactitud. La calidad de la recuperación y las comprobaciones de citas importan más que el máximo de tokens.

No hagas: Auto-presentar informes regulatorios o resúmenes médicos. Solo apoyo a la lectura y a la redacción; firman profesionales colegiados.

Caso de uso C: Investigación operativa continua con acceso por chat

Problema: El personal de guardia quiere «vigila estas alertas, investiga con registros, propón un paso del manual operativo» y una forma de hacer preguntas de seguimiento mediante Telegram o Slack sin dar acceso root al modelo en la flota.

Flujo:

  1. Una programación de n8n / un webhook de PagerDuty recoge huellas de alerta.
  2. Hermes investiga mediante herramientas de solo lectura (API de consulta de registros y endpoints de estado) con credenciales incluidas en una lista de permitidos.
  3. Hermes devuelve: hipótesis, evidencia, siguiente comando sugerido (no ejecutado).
  4. Canal OpenClaw/NemoClaw opcional para que una persona de guardia consulte un entorno de ejecución de agente configurado por separado, con listas de permitidos para el emparejamiento (seguridad básica de OpenClaw). No asumas que OpenClaw y Hermes comparten una sesión o un almacén de memoria.

Hipótesis de los dos Sparks: las investigaciones concurrentes o un modelo/contexto mayor podrían justificar el segundo nodo. Compáralo con un solo Spark y con inferencia gestionada usando cola, calidad, latencia, coste total y requisitos de privacidad medidos.

No hagas: Corregir el sistema de forma automática. Los comandos sugeridos se entregan a una persona o a un ejecutor de manuales operativos estrictamente acotado y con autenticación propia.

Modos de fallo para los que debes diseñar el día uno

FalloSíntomaMitigación
Configuración incorrecta de NCCL/RoCEBloqueo o fallback a TCP, latencia terribleFija NCCL a las interfaces RoCE; valida el fabric antes de los agentes
Acaparamiento de contextoUn trabajo largo deja sin recursos a otrosLimita max_model_len / concurrencia; cola en n8n
Abuso de la entradaUn atacante activa HermesAutenticación mediante portador o HMAC + marca de tiempo; red privada; límites de solicitudes
Inyección de promptsEl texto del ticket anula la políticaSepara los prompts de sistema de cada ruta; listas de permitidos de herramientas; no envíes HTML sin procesar al shell
Escrituras SaaS silenciosasActualizaciones CRM duplicadasClaves de idempotencia; puerta humana en el envío
Deriva del modeloLa receta se rompe tras actualizar el contenedorFija los digests de las imágenes; pruebas de humo en CI

Qué significa «hecho»

Solo puedes afirmar que funciona el alcance probado cuando:

  1. Una compilación dual-Spark fijada supera pruebas prolongadas repetidas y concurrentes, incluida la forma de fallo notificada en el proyecto original; registra el recuento exacto de ejecuciones, los tamaños de contexto y la tasa de error.
  2. La ruta n8n → Hermes → modelo está autenticada de extremo a extremo y registrada; n8n valida el esquema de aplicación devuelto.
  3. Al menos un flujo de trabajo con nombre se ejecuta con aprobación humana en cada mensaje externo y supera su conjunto de evaluación predefinido.
  4. Tienes una reversión documentada: deshabilitar la llamada de n8n a Hermes, volver a plantillas que solo usen n8n o apuntar Hermes a un modelo local más pequeño.

Ejercicio

Elige el caso de uso A. Implementa solo la validación del webhook en n8n, un contrato de prompt versionado mediante el servidor API de Hermes con autenticación de portador, un registro de idempotencia en el flujo de trabajo, una llamada al modelo local, la validación del esquema de respuesta y una vista previa del borrador. No conectes el envío de correo. Usa un conjunto de evaluación representativo y aprobado, lo bastante grande como para incluir casos normales y raros; define de antemano los criterios de acuerdo sobre la severidad, afirmaciones sin respaldo, edición, latencia y fallo. Decide a partir de esa evidencia si se justifica un segundo Spark o V4-Flash.

Lectura adicional

Leer a continuación

Continúa por el mismo itinerario de aprendizaje con los siguientes artículos prácticos.