34 minutesComment l'IA réinvente les modèles économiques logiciels ft. Bret Taylor de Sierra
Évaluer la tarification d'un produit IA et la spécialisation autour de résultats mesurables plutôt que du nombre d'utilisateurs.
Anyscale. Elle explique pourquoi une implémentation naïve gaspille 60 à 80 % de la mémoire GPU, comment PagedAttention reprend le principe de pagination des systèmes d'exploitation pour y remédier et pourquoi le traitement continu par lots permet d'atteindre les gains de débit de 24× utilisés dans les calculs de l'article. L'affirmation selon laquelle « vous aurez de la chance si vous atteignez 50 % d'utilisation » devient alors concrète.
Le modèle mental de PagedAttention reste pertinent, mais les débits et les réglages par défaut des moteurs évoluent vite. Utilisez cette vidéo pour les fondamentaux, puis mesurez votre propre modèle, votre matériel, la forme de vos lots et vos exigences de disponibilité avant de choisir un mode d'hébergement.
Comprendre pourquoi le moteur d'inférence, le traitement par lots et la mémoire du cache KV dominent l'économie d'une infrastructure auto-hébergée.
Connaissance de base de l'inférence des transformateurs, des limites de mémoire GPU et des compromis entre API et auto-hébergement.
Dernière révision : 18 mai 2026
Continuez dans le même parcours d’apprentissage avec les prochaines vidéos d’accompagnement sélectionnées.
34 minutesÉvaluer la tarification d'un produit IA et la spécialisation autour de résultats mesurables plutôt que du nombre d'utilisateurs.
6 minutesIdentifier l'architecture centrale d'un agent vocal et les points de défaillance qui affectent la confiance des clients lors d'appels réels.
37 minutesÉvaluer une IA privée comme une décision d'infrastructure et de gouvernance, sans choisir par réflexe le SaaS ou l'auto-hébergement.