Tema

IA privada, local y alojada en infraestructura propia

Modelos locales, patrones de despliegue privado, inferencia alojada en infraestructura propia y arquitecturas híbridas.

18 contenidos (12 artículos · 6 vídeos)

Comienza aquí

Una selección inicial antes de explorar todo el contenido.

Más sobre este tema

8 min de lectura
Artículo

Conectar dos DGX Spark: QSFP, SSH, RoCE y Cluster Assistant

Una guía práctica para enlazar dos unidades NVIDIA DGX Spark con QSFP y ConnectX-7: mismo nombre de usuario, SSH sin contraseña, RoCE para cargas distribuidas, NVIDIA Sync Cluster Assistant y rollback.

Avanzado
8 min de lectura
Artículo

Realidad de la inferencia local en DGX Spark: memoria, stack y cuándo la nube sigue ganando

Cómo interpretar las afirmaciones de NVIDIA sobre la memoria coherente de 128 GB y los ~200B en un solo nodo, cómo preseleccionar stacks de serving y cómo diseñar las pruebas de hardware que deciden si la inferencia local encaja.

Avanzado
9 min de lectura
Artículo

DGX Spark: qué es, para quién es y qué cambió para los agentes locales

Una lectura fundamentada de NVIDIA DGX Spark: especificaciones Grace Blackwell GB10 de NVIDIA, memoria unificada coherente, clustering ConnectX-7 y cuándo un ordenador de agentes en el escritorio es la apuesta correcta de IA privada.

Avanzado
7 min de lectura
Artículo

Hermes Agent: qué es, qué no es y cuándo usarlo

Una guía clara de Hermes Agent de Nous Research: memoria persistente, skills, herramientas y pasarelas de mensajería, además de criterios para decidir cuándo basta un chatbot y cuándo conviene un entorno de ejecución de agentes.

Intermedio
8 min de lectura
Artículo

Llama a vLLM y otros endpoints compatibles con OpenAI desde n8n

Llama a un endpoint local /v1/chat/completions compatible con OpenAI desde el nodo HTTP Request de n8n, con autenticación explícita, presupuestos de tiempo de espera, comprobaciones de la URL base y un límite de red privada.

Intermedio
10 min de lectura
Artículo

NemoClaw en DGX Spark: plan de despliegue y seguridad

Planifica y evalúa OpenClaw, Hermes o Deep Agents Code dentro de NVIDIA OpenShell en DGX Spark: puesta en marcha actual, capas de políticas, inferencia enrutada y evidencia de aceptación necesaria.

Avanzado
9 min de lectura
Artículo

Configuración del gateway personal de OpenClaw: instalación, onboarding y panel de control

Qué es OpenClaw, cómo instalar y configurar la pasarela multicanal autoalojada, abrir la UI de control en el puerto 18789 y qué versiones de Node son compatibles sin omitir las bases de seguridad.

Intermedio
10 min de lectura
Artículo

Pila experimental con dos DGX Spark, DeepSeek-V4-Flash, n8n y Hermes

Cómo evaluar una ruta experimental de la comunidad con dos DGX Spark para DeepSeek-V4-Flash, con n8n en el borde determinista y Hermes en la ruta de juicio.

Avanzado
37 minutos
Vídeo

Actualización de capacidades y características de la infraestructura de IA privada de VMware de Broadcom

Tech Field Day. Presenta la IA privada como infraestructura por capas: cómputo controlado, entornos aislados, Kubernetes, contenedores de inferencia, gobernanza de modelos, aprovisionamiento de autoservicio, uso compartido de GPU y monitorización. Se corresponde directamente con la advertencia del artículo: la privacidad depende de los límites del despliegue, los registros, el acceso y las operaciones, no de la palabra «local».

Avanzado
13 min de lectura
Artículo

Ajuste fino en 2026: un experimento de LoRA y QLoRA basado en evidencia

Decide si el ajuste eficiente en parámetros está justificado, gobierna los datos, fija un experimento reproducible, compara resultados en conjuntos retenidos y pruebas de seguridad, y realiza benchmarks del servicio antes del despliegue.

Avanzado
157 minutos
Vídeo

Fine-tuning de modelos LLM: curso de IA generativa

freeCodeCamp.org. Es un curso extenso que presenta primero la teoría y después el código, y cubre cuantización, LoRA, QLoRA y PEFT completo con Llama 2 y Gemma en hardware al alcance de la mayoría de los desarrolladores. Es lo más parecido en YouTube a acompañar a alguien con experiencia durante el proceso y respalda con presupuestos concretos de VRAM la afirmación del artículo de que «no necesitas un clúster».

Avanzado
59 minutos
Vídeo

Desarrollo de un LLM: creación, entrenamiento y fine-tuning

Sebastian Raschka. Sebastian Raschka explica con calma el lugar que ocupa el fine-tuning dentro del pipeline general de entrenamiento de un LLM: ajuste de instrucciones, fine-tuning para clasificación, métodos eficientes en parámetros y las contrapartidas señaladas por el artículo antes de recomendar LoRA. Ofrece una buena calibración inicial, sobre todo si el equipo aún debate si el fine-tuning es el paso adecuado.

Avanzado
14 minutos
Vídeo

Aprende Ollama en 15 minutos: ejecuta grandes modelos de lenguaje en local y gratis

Tech With Tim. Es una explicación breve y directa de Ollama: instalarlo, descargar un modelo, conversar con él, probar la API HTTP local desde Python y crear un modelo personalizado mediante un Modelfile. Cubre exactamente el flujo de trabajo diario descrito por el artículo para un Mac, incluida la relación entre el tamaño del modelo y la RAM del equipo.

Intermedio
6 minutos
Vídeo

Tutorial de LM Studio: ejecuta grandes modelos de lenguaje (LLM) en tu portátil

Kevin Stratvert. Presenta el mismo flujo de trabajo que Ollama, pero mediante una interfaz gráfica: descargar LM Studio, obtener un modelo Llama o Gemma, conversar, cargar un PDF y formular preguntas sobre él. Resulta adecuado para quienes prefieren evitar el terminal y también permite hacerse una idea del rendimiento real de un modelo 1B–3B frente a otro más pesado.

Intermedio
32 minutos
Vídeo

Serving rápido de LLM con vLLM y PagedAttention

Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.

Avanzado