Teema

Kulud ja mudelite käitamine

Hoia käitamiskulu kontrolli all, vali majutusmustrid, suuna mudelikasutust ja mõista käitusvalikuid.

13 lugu (6 artiklit · 7 videot)

Alusta siit

Mõned head esimesed materjalid enne kogu voo sirvimist.

Veel selles teemas

13 min lugemist
Artikkel

2026. aasta LLM-i tehnoloogiapinu: mudelid, inferents, tööriistad ja kompromissid

Praktiseeriva arhitekti vaade 2026. aasta LLM-i tehnoloogiapinule: mudelitasemed, inferentsiteenuse pakkujad, orkestreerimiskihid, hindamistööriistad ja kompromissid, mis päriselt loevad, kui viid AI-rakenduse tootmisse. Kõik see, mida oleksid soovinud enne alustamist teada.

Ekspert
6 min lugemist
Artikkel

Tasuta vs tasuline ChatGPT: mida tasuline plaan tegelikult juurde annab

Žargoonivaba võrdlus tasuta ChatGPT-st, ChatGPT Plusist, Pro-st ja tööplaanidest — mis muutub uuendamisel ja kuidas aru saada, kas sul on seda päriselt vaja.

AI-ga alustaja
10 min lugemist
Artikkel

Kohalik AI sinu Macis: Ollama, LM Studio ja see, mida 7B mudelid tegelikult suudavad

AI lokaalne käivitamine on küpsenud. Ollama või LM Studio ja moodsa Maciga saad jooksutada võimekaid mudeleid offline'is, tasuta ja privaatselt. Mis töötab, mis mitte ja millised kasutusjuhud sellest tegelikult kasu saavad.

Edasijõudnud
211 minutit
Video

Sügav sukeldumine LLM-idesse nagu ChatGPT

Andrej Karpathy. See on üks selgemaid terviklikke selgitusi selle kohta, mis LLM tegelikult on — eelõpe, tokeniseerimine, SFT, RLHF, arutluse tugevdamisõpe, tööriistakasutus ja hallutsinatsioonid. Video annab insenerile vajaliku tausta, et käsitleda GPT-klassi, avatud kaaludega ja arutlevate mudelite valikut treeningu ning võimekuse, mitte ainult kaubamärgi küsimusena.

Ekspert
40 minutit
Video

Andrej Karpathy: tarkvara on (jälle) muutumas

Y Combinator. Karpathy AI Startup Schooli peaettekanne käsitleb LLM-e uut tüüpi arvutitena — ühtaegu teenuse, kiibitehase ja operatsioonisüsteemina — ning pooldab osalise autonoomiaga tooteid, kus suure mõjuga otsused jäävad inimese kontrolli alla. See toetab artikli mõttemudelit: inferentsipakkujaid ja tööriistu valitakse programmeeritava platvormi, mitte pelgalt vestlusroboti jaoks.

Ekspert
19 minutit
Video

Kas see on RAG-i lõpp? Anthropicu UUS prompti caching

Prompt Engineering. Käib läbi Anthropicu prompti caching'u vs Gemini konteksti-caching'u koos konkreetsete latentsuse ja kulu vähenemistega kasutusjuhtumi kohta (pikkade dokumentide chat, few-shot, multi-turn). Cache-write lisatasu vs cache-read soodustuse lahtimõtestamine on täpselt see, mida artikkel eeldab, kui ta räägib sellest, millal caching ennast ära tasub.

Ekspert
56 minutit
Video

Build Hour: Prompt Caching

OpenAI. OpenAI enda Build Hour prompti caching'ust — 1024-tokeni künnis, eesliite-stabiilsuse nõue, audio caching 99% soodustusega realtime'i jaoks, time-to-first-token mõjud pikkade sisendite korral. Kasulik, kui mõõdad inseneri-pingutust, mida nõuab cache'i päriselt usaldusväärselt tabamine oma produktsiooni-promptidel.

Ekspert
19 minutit
Video

Iga AI mudel seletatud

Tina Huang. Puhas tuur praegusest mudelimaastikust, grupeeritud tasandi järgi — lipulaevad, lite-mudelid, keskklass, spetsialiseeritud — koos konkreetsete valikutega selle kohta, milles iga tasand päriselt hea on. See on artikli "tunne enne marsruutimist oma võimalusi" pool ja Huang raamib kulu-vs-võimekuse samamoodi nagu artikkel, ilma võrdlustabelite haibile toetumata.

Edasijõudnud
9 minutit
Video

RouteLLM saavutab 90% GPT4o kvaliteedi JA on 80% odavam

Matthew Berman. Käib läbi LMSYSi RouteLLM-i artikli ja koodi: väike klassifikaator istub tugeva/nõrga mudeli paari ees ja otsustab, kumba kutsuda, tabades umbes 95% tugeva mudeli kvaliteedist murdosaga kulust. Vaatamiste arv on alla tavalise 100k piiri, aga konkreetse "näita mulle päris mudeli-marsruutimist, mitte ainult mudelivõrdlusi" niši jaoks on see puhtaim selgitus YouTube'is ja sobib otse artikli kvaliteedi/kulu kompromissi sektsiooniga.

Edasijõudnud
32 minutit
Video

Kiire LLM-serveerimine vLLM-i ja PagedAttentioniga

Anyscale. Käib läbi, miks naiivne LLM-serveerimine raiskab 60–80% GPU mälust, kuidas PagedAttention laenab OS-i stiilis pagineerimist seda parandama ja miks pidev batching toodab 24× läbilaskvuse numbreid, mida artikkel oma matemaatikas kasutab. Pärast seda lakkab artikli "õnneks tabad 50% kasutusastet" rida abstraktne olemast.

Ekspert