18:50Prompt Engineering
Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.
Vad du bör få ut av detta: Du kan uppskatta när promptcachelagring lönar sig genom att väga pristillägget för cacheskrivningar mot besparingen vid läsning för dina verkliga arbetsbelastningar.
Titta på eller ha koll på först: Praktisk kunskap om prissättning av LLM-API:er och arbetsbelastningar med långa prompter.
Anteckning från AI Expert: Videon spelades in i augusti 2024, så modellnamnen och priserna per token är inaktuella. Mekanismen med pristillägg för cacheskrivning kontra rabatt för cacheläsning gäller fortfarande. Kontrollera leverantörernas aktuella prissidor innan du räknar på din arbetsbelastning.
