18:50Prompt Engineering
Elle compare la mise en cache des prompts d'Anthropic à celle du contexte chez Gemini, en chiffrant les gains de latence et de coût selon le cas d'usage : conversation sur de longs documents, apprentissage à partir de quelques exemples et échanges en plusieurs tours. La comparaison entre le surcoût d'écriture du cache et l'économie réalisée à la lecture correspond exactement au calcul de rentabilité présenté dans l'article.
Ce que vous en retirerez: Vous pouvez estimer quand la mise en cache des prompts est rentable en pesant les surcoûts de mise en cache en écriture par rapport aux économies en lecture pour vos charges de travail réelles.
À voir ou à connaître au préalable: Connaissance de base des tarifs des API LLM et des charges de travail avec des prompts longs.
Note d’AI Expert: Enregistrée en août 2024, donc les noms de modèles et les prix par token sont obsolètes. Le mécanisme de surcoût de mise en cache en écriture par rapport aux réductions en lecture reste valable ; vérifiez les pages de tarifs actuelles des fournisseurs avant de calculer les chiffres pour votre charge de travail.
