Vídeos complementarios

Optimización del coste de inferencia — vídeos complementarios

El artículo aborda el pequeño conjunto de técnicas que reducen realmente las facturas de LLM —caché de prompts, enrutamiento de modelos, control de la longitud de salida y procesamiento por lotes— y cómo combinarlas sin degradar la calidad inadvertidamente. La mayoría de las charlas de YouTube son demostraciones de producto; estas dos explican el mecanismo principal, la caché de prompts, con suficiente profundidad técnica para una revisión de producción.

Selección principal

18:50
¿Es el fin del RAG? El nuevo almacenamiento en caché de prompts de Anthropic

Prompt Engineering

Compara la caché de prompts de Anthropic con la caché de contexto de Gemini mediante reducciones concretas de latencia y coste para chat con documentos largos, *few-shot* y conversaciones de varios turnos. El desglose entre el recargo por escribir en caché y el descuento por leer de ella es exactamente lo que presupone el artículo al explicar cuándo compensa.

Qué aprenderás: Podrás estimar cuándo compensa la caché de prompts comparando el recargo de escritura con el ahorro de lectura para tus cargas reales.

Qué ver o saber antes: Conocimiento operativo sobre el precio de las API de LLM y las cargas de trabajo con prompts largos.

Nota de AI Expert: Grabado en agosto de 2024, por lo que los nombres de los modelos y los precios por token están desactualizados. El mecanismo de recargo por escritura en caché contra descuento por lectura en caché sigue vigente; verifica las páginas de precios actuales de los proveedores antes de realizar los cálculos para tu carga de trabajo.

Abrir página del vídeo

También merece la pena

56:03
Build Hour: Almacenamiento en caché de prompts

OpenAI

Es la Build Hour oficial de OpenAI sobre caché de prompts: el umbral de 1024 tokens, el requisito de estabilidad del prefijo, los grandes descuentos de caché de audio en tiempo real —consulta la tarifa exacta vigente— y el impacto sobre el tiempo hasta el primer token con entradas largas. Resulta útil para dimensionar el esfuerzo de ingeniería necesario para utilizar la caché de forma fiable con prompts de producción.

Qué aprenderás: Utilizarás la caché de prompts solo cuando los prefijos estables y el comportamiento de latencia y coste encajen con la carga.

Qué ver o saber antes: Ya deberías estar enviando prompts a través de la API de OpenAI — la sesión trata sobre acceder al caché de forma confiable en producción.

Nota de AI Expert: Está muy por debajo del umbral de visualizaciones, pero es la explicación oficial en profundidad. El umbral de 1024 tokens y la estabilidad del prefijo determinan si la caché funciona; las tarifas vigentes se encuentran en la página de precios.

Abrir página del vídeo