Oheisvideot

Päättelyn kustannusoptimointi — saatevideot

Artikkeli käsittelee pientä joukkoa tekniikoita, jotka todella liikuttavat LLM-laskuja — kehotteiden välimuisti, mallireititys, tuotoksen pituuden hallinta, batchaus — ja miten yhdistää ne heikentämättä laatua hiljaa. Kustannusoptimointipuheita YouTubessa on enimmäkseen tuotedemoja, mutta nämä kaksi kattavat ydinmekaniikan (kehotteiden välimuisti) ja koko vipujoukon tarpeeksi teknisellä syvyydellä ollakseen hyödyllisiä tuotantokatselmuksessa.

Päävalinta

18:50
Onko tämä RAG:n loppu? Anthropicin UUSI prompt caching

Prompt Engineering

Käy läpi Anthropicin prompt cachingin Geminiin context cachingiin verrattuna konkreettisilla viive- ja kustannusvähennyksillä käyttötapauksittain (pitkän asiakirjan chat, few-shot, monivuoro). Cache-write-lisämaksun vs. cache-read-alennuksen erittely on tasan se, mitä artikkeli olettaa puhuessaan, milloin välimuisti maksaa itsensä takaisin.

Mitä sinun pitäisi oppia tästä: Osaat arvioida, milloin kehotteiden välimuisti maksaa itsensä takaisin punnitsemalla cache-write-lisämaksuja luku säästöjä vasten oikeilla työkuormillasi.

Katso tai hallitse ensin: Työtuntemus LLM-API-hinnoittelusta ja pitkien kehotteiden työkuormista.

AI Expert -huomio: Nauhoitettu elokuussa 2024, joten mallinimet ja token-kohtaiset hinnat ovat vanhentuneita. Cache-write-lisämaksu vs. cache-read-alennus -mekaniikka pitää edelleen; tarkista nykyiset toimittajien hinnoittelusivut ennen lukujen ajamista työkuormallesi.

Avaa videosivu

Kannattaa katsoa myös

56:03
Build Hour: kehotteiden välimuisti (prompt caching)

OpenAI

OpenAI:n oma Build Hour kehotteiden välimuistista — 1024 tokenin kynnys, etuliitteen vakauden vaatimus, jyrkät audio-välimuistialennukset realtimelle (tarkista tarkka hinta nykyiseltä hinnoittelusivulta), time-to-first-token -vaikutukset pitkillä syötteillä. Hyödyllinen, kun mitoitat suunnittelutyötä osuaksesi välimuistiin luotettavasti tuotantokehotteillasi.

Mitä sinun pitäisi oppia tästä: Käytä kehotteiden välimuistia vain, kun vakaat etuliitteet, viive ja kustannuskäyttäytyminen vastaavat työkuormaa.

Katso tai hallitse ensin: Sinun pitäisi jo toimittaa kehotteita OpenAI API:a vasten — sessio koskee välimuistiin osumista luotettavasti tuotannossa.

AI Expert -huomio: Hyvin alle katselukynnyksemme, mutta se on virallinen syväsukellus; 1024 tokenin kynnys ja etuliitteen vakaussäännöt ratkaisevat, toimiiko välimuisti sinulle lainkaan, ja nykyiset hinnat elävät hinnoittelusivulla.

Avaa videosivu