Kompletterande videor

Kostnadsoptimera inferens: promptcache, styrning och kontroll av utdata – kompletterande videor

Artikeln handlar om den lilla uppsättning tekniker som faktiskt påverkar LLM-kostnaderna – promptcachelagring, modelldirigering, kontroll av utdatalängd och batchning – och hur de kan kombineras utan att kvaliteten försämras i det tysta. Föredrag om kostnadsoptimering på YouTube är oftast produktdemonstrationer, men de här två tar upp den centrala mekanismen (promptcachelagring) och hela uppsättningen reglage med tillräckligt tekniskt djup för att vara användbara vid en produktionsgranskning.

Förstahandsval

18:50
Är det här slutet för RAG? Anthropics NYA promptcachelagring

Prompt Engineering

Jämför Anthropics promptcachelagring med Geminis kontextcachelagring och visar konkreta minskningar av latens och kostnader per användningsfall (chatt med långa dokument, few-shot och konversationer i flera turer). Genomgången av pristillägget för att skriva till cachen jämfört med rabatten för att läsa från den är precis vad artikeln förutsätter när den beskriver när cachelagring lönar sig.

Vad du bör få ut av detta: Du kan uppskatta när promptcachelagring lönar sig genom att väga pristillägget för cacheskrivningar mot besparingen vid läsning för dina verkliga arbetsbelastningar.

Titta på eller ha koll på först: Praktisk kunskap om prissättning av LLM-API:er och arbetsbelastningar med långa prompter.

Anteckning från AI Expert: Videon spelades in i augusti 2024, så modellnamnen och priserna per token är inaktuella. Mekanismen med pristillägg för cacheskrivning kontra rabatt för cacheläsning gäller fortfarande. Kontrollera leverantörernas aktuella prissidor innan du räknar på din arbetsbelastning.

Öppna videosidan

Värt att titta på

56:03
Build Hour: promptcachelagring

OpenAI

OpenAI:s egen Build Hour om promptcachelagring – tröskeln på 1024 token, kravet på stabila prefix, stora rabatter för cachelagring av ljud i realtid (kontrollera den aktuella prissidan för den exakta nivån) och påverkan på tiden till första token vid långa indata. Användbart när du bedömer den tekniska insats som faktiskt krävs för att träffa cachen tillförlitligt med dina produktionsprompter.

Vad du bör få ut av detta: Använd promptcachelagring endast när stabila prefix, latens och kostnadsbeteende passar arbetsbelastningen.

Titta på eller ha koll på först: Du bör redan leverera prompter via OpenAI:s API – sessionen handlar om att träffa cachen tillförlitligt i produktion.

Anteckning från AI Expert: Videon ligger långt under vår visningsgräns men är den officiella djupdykningen. Tröskeln på 1024 token och reglerna för stabila prefix avgör om cachelagringen alls fungerar för dig, och de aktuella priserna finns på prissidan.

Öppna videosidan