Tema

Modelos y elección de herramientas

Elige entre ChatGPT, Claude, Gemini, Copilot, modelos de razonamiento y inferencia alojada o local.

27 contenidos (12 artículos · 15 vídeos)

Comienza aquí

Una selección inicial antes de explorar todo el contenido.

Más sobre este tema

13 min de lectura
Artículo

El stack de LLM en 2026: modelos, inferencia, herramientas y decisiones

La perspectiva práctica de un arquitecto sobre el stack de LLM en 2026: gamas de modelos, proveedores de inferencia, capas de orquestación, herramientas de evaluación y las decisiones que realmente importan al implantar IA en producción. Todo lo que te habría gustado saber antes de empezar.

Avanzado
10 min de lectura
Artículo

Cadena de pensamiento, autocrítica y árbol de pensamientos: cuándo usar cada técnica

Tres técnicas de razonamiento que pueden mejorar los resultados de la IA en problemas complejos y el balance entre costes y beneficios de utilizarlas. Con prompts concretos, comparaciones directas y las particularidades de los modelos de razonamiento modernos.

Intermedio
12 min de lectura
Artículo

Optimización de costes en inferencia: almacenamiento en caché de prompts, enrutamiento y control de salida

Construye un modelo de costes de inferencia basado en trazas, optimiza los mayores contribuyentes medidos y demuestra que cada cambio preserva la calidad de la tarea.

Avanzado
13 min de lectura
Artículo

Ajuste fino en 2026: un experimento de LoRA y QLoRA basado en evidencia

Decide si el ajuste eficiente en parámetros está justificado, gobierna los datos, fija un experimento reproducible, compara resultados en conjuntos retenidos y pruebas de seguridad, y realiza benchmarks del servicio antes del despliegue.

Avanzado
6 min de lectura
Artículo

Versión gratuita vs. de pago de ChatGPT: qué incluye realmente la actualización

Comparación sin jerga de la versión gratuita de ChatGPT, ChatGPT Plus y ChatGPT Pro — qué cambia al actualizar y cómo saber si realmente necesitas hacerlo.

Primeros pasos con IA
10 min de lectura
Artículo

IA local en tu Mac: Ollama, LM Studio y lo que pueden hacer realmente los modelos 7B

La ejecución local de IA ha madurado. Con Ollama o LM Studio y un Mac moderno, puedes utilizar modelos capaces sin conexión, sin coste y de forma privada. Conoce qué funciona, qué no y qué casos de uso se benefician realmente.

Intermedio
10 min de lectura
Artículo

Cómo elegir y usar prompts con modelos de razonamiento

Los ajustes de razonamiento cambian la calidad, la latencia, el coste y, en ocasiones, el comportamiento ante los prompts. Una guía práctica para elegirlos mediante evaluaciones, no por creencias populares.

Intermedio
12 min de lectura
Artículo

Elegir entre prompting, RAG y fine-tuning (y cuándo combinarlos)

El prompting, RAG y el fine-tuning son las tres grandes palancas para adaptar los LLM a un problema. Cada una resulta adecuada en situaciones diferentes. Este marco ayuda a elegir, explica sus costes reales y muestra los patrones de producción en los que conviene combinarlas.

Avanzado
11 min de lectura
Artículo

Inferencia en infraestructura propia frente a gestionada: un modelo de punto de equilibrio auditable

¿A partir de qué escala sale más rentable operar infraestructura propia que usar API? El cálculo real, las condiciones operativas y los patrones que distinguen a los equipos que deberían gestionar sus modelos de los que deberían seguir pagando por inferencia gestionada.

Avanzado
211 minutos
Vídeo

Análisis a fondo de los LLM como ChatGPT

Andrej Karpathy. Es la explicación integral más clara de YouTube sobre qué es realmente un LLM: preentrenamiento, tokenización, SFT, RLHF, aprendizaje por refuerzo para razonamiento, uso de herramientas y alucinaciones, con el nivel de detalle necesario para que un ingeniero valore las contrapartidas entre modelos. Después de verlo, las decisiones del artículo entre modelos de clase GPT, de pesos abiertos y de razonamiento dejan de parecer elecciones de marca y pasan a entenderse como elecciones de recetas de entrenamiento.

Avanzado
40 minutos
Vídeo

Andrej Karpathy: El software está cambiando (de nuevo)

Y Combinator. En su ponencia de AI Startup School, Karpathy presenta los LLM como un nuevo tipo de ordenador —servicio público, fábrica de chips y sistema operativo a la vez— y defiende productos con «autonomía parcial» sujetos a una correa controlada por personas. Es la formulación más clara del modelo mental para el stack que presupone el artículo: eliges proveedores de inferencia y herramientas para un sustrato programable, no para un chatbot.

Avanzado
19 minutos
Vídeo

¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic

Prompt Engineering. Compara la caché de prompts de Anthropic con la caché de contexto de Gemini mediante reducciones concretas de latencia y coste para chat con documentos largos, *few-shot* y conversaciones de varios turnos. El desglose entre el recargo por escribir en caché y el descuento por leer de ella es exactamente lo que presupone el artículo al explicar cuándo compensa.

Avanzado
56 minutos
Vídeo

Build Hour: Almacenamiento en caché de prompts

OpenAI. Es la Build Hour oficial de OpenAI sobre caché de prompts: el umbral de 1024 tokens, el requisito de estabilidad del prefijo, los grandes descuentos de caché de audio en tiempo real —consulta la tarifa exacta vigente— y el impacto sobre el tiempo hasta el primer token con entradas largas. Resulta útil para dimensionar el esfuerzo de ingeniería necesario para utilizar la caché de forma fiable con prompts de producción.

Avanzado
157 minutos
Vídeo

Fine-tuning de modelos LLM: curso de IA generativa

freeCodeCamp.org. Es un curso extenso que presenta primero la teoría y después el código, y cubre cuantización, LoRA, QLoRA y PEFT completo con Llama 2 y Gemma en hardware al alcance de la mayoría de los desarrolladores. Es lo más parecido en YouTube a acompañar a alguien con experiencia durante el proceso y respalda con presupuestos concretos de VRAM la afirmación del artículo de que «no necesitas un clúster».

Avanzado
59 minutos
Vídeo

Desarrollo de un LLM: creación, entrenamiento y fine-tuning

Sebastian Raschka. Sebastian Raschka explica con calma el lugar que ocupa el fine-tuning dentro del pipeline general de entrenamiento de un LLM: ajuste de instrucciones, fine-tuning para clasificación, métodos eficientes en parámetros y las contrapartidas señaladas por el artículo antes de recomendar LoRA. Ofrece una buena calibración inicial, sobre todo si el equipo aún debate si el fine-tuning es el paso adecuado.

Avanzado
15 minutos
Vídeo

¿Merece la pena ChatGPT Plus? Mi análisis actualizado para 2025

Ryan Doser. Ryan repasa todas las funciones reservadas al plan de $20 —límites de uso, modo de voz avanzado, límites para imágenes y Sora, GPTs personalizados y acceso a los modelos de razonamiento— y las compara con alternativas gratuitas actuales como Claude, Gemini y Perplexity. El número de visualizaciones es algo menor porque el tema es específico, pero esta es la comparación directa más clara y actual que evita las exageraciones; por eso la elegimos frente a los vídeos más estridentes que afirman que "Plus me cambió la vida".

Primeros pasos con IA
19 minutos
Vídeo

Todos los modelos de IA, explicados

Tina Huang. Es un recorrido claro por el panorama actual de modelos, agrupados por gama —modelos de gama alta, ligeros, de gama media y especializados—, con recomendaciones concretas para las tareas que mejor encajan en cada una. Cubre la mitad del artículo dedicada a «conocer las opciones antes de enrutar» y Huang plantea la relación entre coste y capacidad del mismo modo que el artículo, sin apoyarse en el sensacionalismo de los benchmarks.

Intermedio
9 minutos
Vídeo

RouteLLM alcanza el 90% de la calidad de GPT4o y cuesta un 80% menos

Matthew Berman. Recorre el artículo académico y el código de RouteLLM de LMSYS: un pequeño clasificador se sitúa delante de un par formado por un modelo potente y otro básico, y decide a cuál llamar. De este modo alcanza aproximadamente el 95% de la calidad del modelo potente por una fracción del coste. Las visualizaciones quedan por debajo del umbral habitual de 100k, pero, para la necesidad específica de «mostrar enrutamiento real, no solo comparar modelos», es la explicación más clara de YouTube y coincide directamente con la sección del artículo sobre la contrapartida entre calidad y coste.

Intermedio
9 minutos
Vídeo

RAG frente a ajuste fino

IBM Technology. Se centra en las dos técnicas que los equipos confunden con mayor frecuencia. Profundiza en la vigencia de los datos, la atribución de fuentes y la ventaja de velocidad durante la inferencia que puede aportar el fine-tuning. Merece la pena verlo si necesitas argumentar contra un proyecto de fine-tuning innecesario.

Avanzado
13 minutos
Vídeo

RAG vs Fine-Tuning vs Prompt Engineering: Optimizando modelos de IA

IBM Technology. Es un repaso claro en la pizarra de las tres técnicas y sus costes respectivos —latencia de recuperación, cómputo de entrenamiento, olvido catastrófico y límites de las soluciones basadas únicamente en prompts—, además de las combinaciones que tienen sentido en producción. El ejemplo final de un sistema de IA jurídica que utiliza las tres técnicas coincide casi exactamente con el argumento del artículo sobre cuándo combinarlas.

Avanzado
131 minutos
Vídeo

Cómo utilizo los modelos de lenguaje de gran tamaño (LLM)

Andrej Karpathy. Karpathy dedica capítulos específicos a "Be aware of the model you're using, pricing tiers" (ten en cuenta el modelo y el nivel de precios) y "Thinking models and when to use them" (modelos de razonamiento y cuándo utilizarlos). Después alterna continuamente entre ChatGPT, Claude, Gemini, Grok y Perplexity durante el resto del recorrido. Es lo más parecido a ver la guía del artículo aplicada en directo por alguien con criterios firmes sobre cuándo cada nivel justifica su coste.

Principiante
17 minutos
Vídeo

La nueva IA más inteligente: Claude 3 – probado frente a Gemini 1.5 + GPT-4

AI Explained. Es anterior al artículo (marzo de 2024), pero lo útil es la metodología: un analista riguroso ejecuta las mismas tareas difíciles —OCR, teoría de la mente, seguimiento de instrucciones y matemáticas— en tres modelos de frontera, los compara directamente y muestra exactamente dónde falla cada uno. Los nombres de los modelos han quedado anticuados; el marco de comparación, no.

Principiante
32 minutos
Vídeo

Serving rápido de LLM con vLLM y PagedAttention

Anyscale. Explica por qué un serving ingenuo desperdicia el 60–80% de la memoria de la GPU, cómo PagedAttention adopta la paginación de los sistemas operativos para corregirlo y por qué el procesamiento continuo por lotes produce las cifras de rendimiento de 24× utilizadas por el artículo. Después de verlo, la afirmación «tendrás suerte si alcanzas un 50% de utilización» deja de ser abstracta.

Avanzado
19 minutos
Vídeo

Explicación de cada modelo de IA

Tina Huang. Un panorama claro, explicado en 19 minutos, de las principales familias de modelos: la línea GPT de OpenAI, Claude de Anthropic, Gemini de Google y las alternativas de código abierto. También aclara qué nivel de cada familia merece tu atención. Después de que el artículo recomiende "elige uno y úsalo durante un mes", este vídeo explica qué ofrece realmente el menú desplegable de ese producto. Expresa criterios claros sin caer en opiniones provocadoras.

Primeros pasos con IA