32 minutesServir rapidement des LLM avec vLLM et PagedAttention
Comprendre pourquoi le moteur d'inférence, le traitement par lots et la mémoire du cache KV dominent l'économie d'une infrastructure auto-hébergée.
Prompt Engineering. Elle compare la mise en cache des prompts d'Anthropic à celle du contexte chez Gemini, en chiffrant les gains de latence et de coût selon le cas d'usage : conversation sur de longs documents, apprentissage à partir de quelques exemples et échanges en plusieurs tours. La comparaison entre le surcoût d'écriture du cache et l'économie réalisée à la lecture correspond exactement au calcul de rentabilité présenté dans l'article.
Enregistrée en août 2024, donc les noms de modèles et les prix par token sont obsolètes. Le mécanisme de surcoût de mise en cache en écriture par rapport aux réductions en lecture reste valable ; vérifiez les pages de tarifs actuelles des fournisseurs avant de calculer les chiffres pour votre charge de travail.
Vous pouvez estimer quand la mise en cache des prompts est rentable en pesant les surcoûts de mise en cache en écriture par rapport aux économies en lecture pour vos charges de travail réelles.
Connaissance de base des tarifs des API LLM et des charges de travail avec des prompts longs.
Dernière révision : 18 mai 2026
Continuez dans le même parcours d’apprentissage avec les prochaines vidéos d’accompagnement sélectionnées.
32 minutesComprendre pourquoi le moteur d'inférence, le traitement par lots et la mémoire du cache KV dominent l'économie d'une infrastructure auto-hébergée.
34 minutesÉvaluer la tarification d'un produit IA et la spécialisation autour de résultats mesurables plutôt que du nombre d'utilisateurs.
6 minutesIdentifier l'architecture centrale d'un agent vocal et les points de défaillance qui affectent la confiance des clients lors d'appels réels.
Des cours externes sélectionnés pour approfondir ce sujet.
Emory University Goizueta Business School faculty
The deeper, university-level counterpart to our beginner HubSpot marketing pick — Emory's business-school treatment goes past 'how to prompt' into training generative models for brand-specific output, the purchase-funnel economics of AI-generated content, and a full module of genuine skepticism about when generative AI is and isn't worth using in marketing.
IBM AI Academy
Une réponse adaptée à l'ère de l'IA générative aux questions stratégiques des dirigeants. Trois cours courts, sans prérequis technique, expliquent où l'IA générative crée de la valeur, comment la gouverner de façon responsable et comment transformer une vague intention d'« utiliser l'IA » en un cas d'usage concret et défendable. Note de 4,6 sur environ 700 avis. À suivre avant la prochaine décision budgétaire liée à l'IA.