18:50Prompt Engineering
Gennemgår Anthropics promptcaching op mod Geminis context caching med konkrete latenstid- og omkostningsreduktioner pr. use case (long-document chat, few-shot, multi-turn). Nedbrydningen af cache-write-tillæg kontra cache-read-rabat er præcis det, artiklen antager, når den taler om, hvornår caching betaler sig.
Hvad du bør få ud af dette: Du kan estimere, hvornår promptcaching betaler sig, ved at veje cache-write-tillæg op mod read-besparelser for dine reelle workloads.
Forudsætninger: Arbejdskendskab til LLM-API-prissætning og workloads med lange prompts.
Bemærkning fra AI Expert: Optaget i august 2024, så modelnavne og priser pr. token er forældede. Mekanikken cache-write-tillæg kontra cache-read-rabat holder stadig; tjek aktuelle provider-prissider, før du kører tallene for din workload.
