Kaasnevad videod

Inference'i kulu-optimeerimine — kaasnevad videod

Artikkel on väikese tehnikate komplekti kohta, mis LLM-arveid päriselt liigutavad — prompti caching, mudeli marsruutimine, väljundi pikkuse kontroll, batching — ja kuidas neid kombineerida ilma kvaliteeti vaikselt katki tegemata. Kulu-optimeerimise ettekanded YouTube'is on enamasti toote-demod, aga need kaks katavad põhimehaaniku (prompti caching) ja kogu hoob-komplekti piisava tehnilise sügavusega, et produktsiooni-ülevaatusel kasulik olla.

Esmane valik

18:50
Kas see on RAG-i lõpp? Anthropicu UUS prompti caching

Prompt Engineering

Käib läbi Anthropicu prompti caching'u vs Gemini konteksti-caching'u koos konkreetsete latentsuse ja kulu vähenemistega kasutusjuhtumi kohta (pikkade dokumentide chat, few-shot, multi-turn). Cache-write lisatasu vs cache-read soodustuse lahtimõtestamine on täpselt see, mida artikkel eeldab, kui ta räägib sellest, millal caching ennast ära tasub.

Mida sellest videost kaasa võtta: Saad tehnilise mustri teemal "Inference'i kulu-optimeerimine" ning oskad hinnata riske, piire ja järgmist sammu.

Ava video leht

Tasub samuti vaadata

56:03
Build Hour: Prompt Caching

OpenAI

OpenAI enda Build Hour prompti caching'ust — 1024-tokeni künnis, eesliite-stabiilsuse nõue, audio caching 99% soodustusega realtime'i jaoks, time-to-first-token mõjud pikkade sisendite korral. Kasulik, kui mõõdad inseneri-pingutust, mida nõuab cache'i päriselt usaldusväärselt tabamine oma produktsiooni-promptidel.

Mida sellest videost kaasa võtta: Saad tehnilise mustri teemal "Inference'i kulu-optimeerimine" ning oskad hinnata riske, piire ja järgmist sammu.

Ava video leht