18:50Prompt Engineering
Das Video vergleicht Anthropics Prompt-Caching mit Geminis Context Caching und zeigt konkrete Latenz- und Kostensenkungen für Chats mit langen Dokumenten, Few-Shot- und Multi-Turn-Anwendungen. Die Gegenüberstellung des Aufpreises für Cache-Schreibvorgänge und des Rabatts für Cache-Lesevorgänge entspricht genau der Annahme des Artikels dazu, wann sich Caching auszahlt.
Was Sie aus diesem Video mitnehmen sollten: Abschätzen, wann sich Prompt-Caching für reale Workloads lohnt, indem Schreibaufschläge und Einsparungen beim Lesen gegeneinander abgewogen werden.
Das sollten Sie zuerst ansehen oder wissen: Grundlegendes Wissen über die Preise der LLM-API und Workloads mit langen Prompts.
Hinweis von AI Expert: Das Video wurde im August 2024, also mit inzwischen veralteten Modellnamen und Tokenpreisen, aufgezeichnet. Der Mechanismus aus Schreibaufschlag und Leserabatt gilt weiterhin. Prüfen Sie die aktuellen Preisseiten der Anbieter, bevor Sie Ihre Workloads kalkulieren.
