Tilhørende videoer

Omkostningsoptimering af inferens — ledsagende videoer

Artiklen handler om det lille sæt teknikker, der faktisk flytter LLM-regninger — promptcaching, modelrouting, kontrol af outputlængde, batching — og hvordan du kombinerer dem uden stille at ødelægge kvaliteten. Omkostningsoptimeringstalks på YouTube er mest produktdemoer, men disse to dækker kernemekanikken (promptcaching) og det fulde sæt greb med nok teknisk dybde til at være nyttige i en produktionsreview.

Primært valg

18:50
Er det slutningen på RAG? Anthropics NYE prompt-caching

Prompt Engineering

Gennemgår Anthropics promptcaching op mod Geminis context caching med konkrete latenstid- og omkostningsreduktioner pr. use case (long-document chat, few-shot, multi-turn). Nedbrydningen af cache-write-tillæg kontra cache-read-rabat er præcis det, artiklen antager, når den taler om, hvornår caching betaler sig.

Hvad du bør få ud af dette: Du kan estimere, hvornår promptcaching betaler sig, ved at veje cache-write-tillæg op mod read-besparelser for dine reelle workloads.

Forudsætninger: Arbejdskendskab til LLM-API-prissætning og workloads med lange prompts.

Bemærkning fra AI Expert: Optaget i august 2024, så modelnavne og priser pr. token er forældede. Mekanikken cache-write-tillæg kontra cache-read-rabat holder stadig; tjek aktuelle provider-prissider, før du kører tallene for din workload.

Åbn videoside

Også værd at se

56:03
Build Hour: prompt-caching

OpenAI

OpenAIs egen Build Hour om promptcaching — 1024-token-tærsklen, kravet om prefix-stabilitet, stejle audio-caching-rabatter for realtime (tjek den aktuelle prisside for den præcise sats), time-to-first-token-effekter ved lange inputs. Nyttig, når du dimensionerer engineering-indsatsen for faktisk at ramme cachen pålideligt på dine produktionsprompts.

Hvad du bør få ud af dette: Brug kun promptcaching, når stabile præfikser, latenstid og omkostningsadfærd matcher workloaden.

Forudsætninger: Du bør allerede sende prompts mod OpenAI API — sessionen handler om at ramme cachen pålideligt i produktion.

Bemærkning fra AI Expert: Godt under vores visningsgrænse, men det er det officielle dyk; 1024-token-tærsklen og reglerne for prefix-stabilitet afgør, om caching overhovedet virker for dig, og aktuelle satser ligger på prissiden.

Åbn videoside