Est-ce la fin de la RAG ? La nouvelle mise en cache des prompts d'Anthropic

19 minutesAvancéConcepteurPrompt EngineeringIA pour les entreprises

Prompt Engineering. Elle compare la mise en cache des prompts d'Anthropic à celle du contexte chez Gemini, en chiffrant les gains de latence et de coût selon le cas d'usage : conversation sur de longs documents, apprentissage à partir de quelques exemples et échanges en plusieurs tours. La comparaison entre le surcoût d'écriture du cache et l'économie réalisée à la lecture correspond exactement au calcul de rentabilité présenté dans l'article.

Note d’AI Expert

Enregistrée en août 2024, donc les noms de modèles et les prix par token sont obsolètes. Le mécanisme de surcoût de mise en cache en écriture par rapport aux réductions en lecture reste valable ; vérifiez les pages de tarifs actuelles des fournisseurs avant de calculer les chiffres pour votre charge de travail.

Ce que vous en retirerez

Vous pouvez estimer quand la mise en cache des prompts est rentable en pesant les surcoûts de mise en cache en écriture par rapport aux économies en lecture pour vos charges de travail réelles.

À voir ou à connaître au préalable

Connaissance de base des tarifs des API LLM et des charges de travail avec des prompts longs.

Dernière révision : 18 mai 2026

À regarder ensuite

Continuez dans le même parcours d’apprentissage avec les prochaines vidéos d’accompagnement sélectionnées.