Vídeos complementarios

Optimización del coste de inferencia — vídeos complementarios

El artículo aborda el pequeño conjunto de técnicas que reducen realmente las facturas de LLM —caché de prompts, enrutamiento de modelos, control de la longitud de salida y procesamiento por lotes— y cómo combinarlas sin degradar la calidad inadvertidamente. La mayoría de las charlas de YouTube son demostraciones de producto; estas dos explican el mecanismo principal, la caché de prompts, con suficiente profundidad técnica para una revisión de producción.

Selección principal

También merece la pena