Tema

Costes y operaciones de modelos

Controla el coste de inferencia, elige patrones de alojamiento, dirige las solicitudes entre modelos y comprende los compromisos operativos.

13 contenidos (6 artículos · 7 vídeos)

Comienza aquí

Una selección inicial antes de explorar todo el contenido.

Más sobre este tema

13 min de lectura
Artículo

El stack de LLM en 2026: modelos, inferencia, herramientas y decisiones

La perspectiva práctica de un arquitecto sobre el stack de LLM en 2026: gamas de modelos, proveedores de inferencia, capas de orquestación, herramientas de evaluación y las decisiones que realmente importan al implantar IA en producción. Todo lo que te habría gustado saber antes de empezar.

Avanzado
6 min de lectura
Artículo

Versión gratuita vs. de pago de ChatGPT: qué incluye realmente la actualización

Comparación sin jerga de la versión gratuita de ChatGPT, ChatGPT Plus y ChatGPT Pro — qué cambia al actualizar y cómo saber si realmente necesitas hacerlo.

Primeros pasos con IA
10 min de lectura
Artículo

IA local en tu Mac: Ollama, LM Studio y lo que pueden hacer realmente los modelos 7B

La ejecución local de IA ha madurado. Con Ollama o LM Studio y un Mac moderno, puedes utilizar modelos capaces sin conexión, sin coste y de forma privada. Conoce qué funciona, qué no y qué casos de uso se benefician realmente.

Intermedio
Vídeo

Análisis a fondo de los LLM como ChatGPT

Análisis a fondo de los LLM como ChatGPT

Avanzado
Vídeo

Andrej Karpathy: El software está cambiando (de nuevo)

Andrej Karpathy: El software está cambiando (de nuevo)

Avanzado
Vídeo

¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic

¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic

Avanzado
Vídeo

Build Hour: Almacenamiento en caché de prompts

Build Hour: Almacenamiento en caché de prompts

Avanzado
Vídeo

Todos los modelos de IA, explicados

Todos los modelos de IA, explicados

Intermedio
Vídeo

RouteLLM alcanza el 90% de la calidad de GPT4o y cuesta un 80% menos

RouteLLM alcanza el 90% de la calidad de GPT4o y cuesta un 80% menos

Intermedio
Vídeo

Serving rápido de LLM con vLLM y PagedAttention

Serving rápido de LLM con vLLM y PagedAttention

Avanzado