Vidéos complémentaires

Inférence auto-hébergée ou gérée — vidéos complémentaires

L'article calcule le véritable seuil de rentabilité entre les API de fournisseurs et une infrastructure vLLM ou TGI auto-hébergée : taux d'utilisation, mémoire du cache KV, coût des GPU et charge d'astreinte. Il déconstruit ainsi l'idée reçue selon laquelle « l'auto-hébergement nous fera forcément économiser de l'argent ». La présentation des créateurs de vLLM offre la meilleure base technique pour comprendre pourquoi le moteur d'inférence est déterminant.

Choix principal

32:07
Servir rapidement des LLM avec vLLM et PagedAttention

Anyscale

Elle explique pourquoi une implémentation naïve gaspille 60 à 80 % de la mémoire GPU, comment PagedAttention reprend le principe de pagination des systèmes d'exploitation pour y remédier et pourquoi le traitement continu par lots permet d'atteindre les gains de débit de 24× utilisés dans les calculs de l'article. L'affirmation selon laquelle « vous aurez de la chance si vous atteignez 50 % d'utilisation » devient alors concrète.

Ce que vous en retirerez: Comprendre pourquoi le moteur d'inférence, le traitement par lots et la mémoire du cache KV dominent l'économie d'une infrastructure auto-hébergée.

À voir ou à connaître au préalable: Connaissance de base de l'inférence des transformateurs, des limites de mémoire GPU et des compromis entre API et auto-hébergement.

Note d’AI Expert: Le modèle mental de PagedAttention reste pertinent, mais les débits et les réglages par défaut des moteurs évoluent vite. Utilisez cette vidéo pour les fondamentaux, puis mesurez votre propre modèle, votre matériel, la forme de vos lots et vos exigences de disponibilité avant de choisir un mode d'hébergement.

Ouvrir la page vidéo