IA privada, local y alojada en infraestructura propia
Modelos locales, patrones de despliegue privado, inferencia alojada en infraestructura propia y arquitecturas híbridas.
18 contenidos (12 artículos · 6 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
10 min de lecturaIA local en tu Mac: Ollama, LM Studio y lo que pueden hacer realmente los modelos 7B
La ejecución local de IA ha madurado. Con Ollama o LM Studio y un Mac moderno, puedes utilizar modelos capaces sin conexión, sin coste y de forma privada. Conoce qué funciona, qué no y qué casos de uso se benefician realmente.
Intermedio
10 min de lecturaPatrones de despliegue de IA privada: local, VPC, en infraestructura propia e híbrido
La IA privada no es una única arquitectura. Una comparación práctica de modelos locales, SaaS empresarial, despliegues en VPC, inferencia alojada en infraestructura propia y patrones híbridos para pymes que priorizan la privacidad y el control.
Avanzado
11 min de lecturaInferencia en infraestructura propia frente a gestionada: un modelo de punto de equilibrio auditable
¿A partir de qué escala sale más rentable operar infraestructura propia que usar API? El cálculo real, las condiciones operativas y los patrones que distinguen a los equipos que deberían gestionar sus modelos de los que deberían seguir pagando por inferencia gestionada.
AvanzadoMás sobre este tema
8 min de lecturaConectar dos DGX Spark: QSFP, SSH, RoCE y Cluster Assistant
Una guía práctica para enlazar dos unidades NVIDIA DGX Spark con QSFP y ConnectX-7: mismo nombre de usuario, SSH sin contraseña, RoCE para cargas distribuidas, NVIDIA Sync Cluster Assistant y rollback.
Avanzado
8 min de lecturaRealidad de la inferencia local en DGX Spark: memoria, stack y cuándo la nube sigue ganando
Cómo interpretar las afirmaciones de NVIDIA sobre la memoria coherente de 128 GB y los ~200B en un solo nodo, cómo preseleccionar stacks de serving y cómo diseñar las pruebas de hardware que deciden si la inferencia local encaja.
Avanzado
9 min de lecturaDGX Spark: qué es, para quién es y qué cambió para los agentes locales
Una lectura fundamentada de NVIDIA DGX Spark: especificaciones Grace Blackwell GB10 de NVIDIA, memoria unificada coherente, clustering ConnectX-7 y cuándo un ordenador de agentes en el escritorio es la apuesta correcta de IA privada.
Avanzado
7 min de lecturaHermes Agent: qué es, qué no es y cuándo usarlo
Una guía clara de Hermes Agent de Nous Research: memoria persistente, skills, herramientas y pasarelas de mensajería, además de criterios para decidir cuándo basta un chatbot y cuándo conviene un entorno de ejecución de agentes.
Intermedio
8 min de lecturaLlama a vLLM y otros endpoints compatibles con OpenAI desde n8n
Llama a un endpoint local /v1/chat/completions compatible con OpenAI desde el nodo HTTP Request de n8n, con autenticación explícita, presupuestos de tiempo de espera, comprobaciones de la URL base y un límite de red privada.
Intermedio
10 min de lecturaNemoClaw en DGX Spark: plan de despliegue y seguridad
Planifica y evalúa OpenClaw, Hermes o Deep Agents Code dentro de NVIDIA OpenShell en DGX Spark: puesta en marcha actual, capas de políticas, inferencia enrutada y evidencia de aceptación necesaria.
Avanzado
9 min de lecturaConfiguración del gateway personal de OpenClaw: instalación, onboarding y panel de control
Qué es OpenClaw, cómo instalar y configurar la pasarela multicanal autoalojada, abrir la UI de control en el puerto 18789 y qué versiones de Node son compatibles sin omitir las bases de seguridad.
Intermedio
10 min de lecturaPila experimental con dos DGX Spark, DeepSeek-V4-Flash, n8n y Hermes
Cómo evaluar una ruta experimental de la comunidad con dos DGX Spark para DeepSeek-V4-Flash, con n8n en el borde determinista y Hermes en la ruta de juicio.
Avanzado
37 minutosActualización de capacidades y características de la infraestructura de IA privada de VMware de Broadcom
Tech Field Day. Presenta la IA privada como infraestructura por capas: cómputo controlado, entornos aislados, Kubernetes, contenedores de inferencia, gobernanza de modelos, aprovisionamiento de autoservicio, uso compartido de GPU y monitorización. Se corresponde directamente con la advertencia del artículo: la privacidad depende de los límites del despliegue, los registros, el acceso y las operaciones, no de la palabra «local».
Avanzado
13 min de lecturaAjuste fino en 2026: un experimento de LoRA y QLoRA basado en evidencia
Decide si el ajuste eficiente en parámetros está justificado, gobierna los datos, fija un experimento reproducible, compara resultados en conjuntos retenidos y pruebas de seguridad, y realiza benchmarks del servicio antes del despliegue.
Avanzado
157 minutosFine-tuning de modelos LLM: curso de IA generativa
freeCodeCamp.org. Es un curso extenso que presenta primero la teoría y después el código, y cubre cuantización, LoRA, QLoRA y PEFT completo con Llama 2 y Gemma en hardware al alcance de la mayoría de los desarrolladores. Es lo más parecido en YouTube a acompañar a alguien con experiencia durante el proceso y respalda con presupuestos concretos de VRAM la afirmación del artículo de que «no necesitas un clúster».
Avanzado
59 minutosDesarrollo de un LLM: creación, entrenamiento y fine-tuning
Sebastian Raschka. Sebastian Raschka explica con calma el lugar que ocupa el fine-tuning dentro del pipeline general de entrenamiento de un LLM: ajuste de instrucciones, fine-tuning para clasificación, métodos eficientes en parámetros y las contrapartidas señaladas por el artículo antes de recomendar LoRA. Ofrece una buena calibración inicial, sobre todo si el equipo aún debate si el fine-tuning es el paso adecuado.
Avanzado
14 minutosAprende Ollama en 15 minutos: ejecuta grandes modelos de lenguaje en local y gratis
Tech With Tim. Es una explicación breve y directa de Ollama: instalarlo, descargar un modelo, conversar con él, probar la API HTTP local desde Python y crear un modelo personalizado mediante un Modelfile. Cubre exactamente el flujo de trabajo diario descrito por el artículo para un Mac, incluida la relación entre el tamaño del modelo y la RAM del equipo.
Intermedio
6 minutosTutorial de LM Studio: ejecuta grandes modelos de lenguaje (LLM) en tu portátil
Kevin Stratvert. Presenta el mismo flujo de trabajo que Ollama, pero mediante una interfaz gráfica: descargar LM Studio, obtener un modelo Llama o Gemma, conversar, cargar un PDF y formular preguntas sobre él. Resulta adecuado para quienes prefieren evitar el terminal y también permite hacerse una idea del rendimiento real de un modelo 1B–3B frente a otro más pesado.
Intermedio
32 minutosServing rápido de LLM con vLLM y PagedAttention
Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.
Avanzado