Kulud ja mudelite käitamine
Hoia käitamiskulu kontrolli all, vali majutusmustrid, suuna mudelikasutust ja mõista käitusvalikuid.
13 lugu (6 artiklit · 7 videot)
Alusta siit
Mõned head esimesed materjalid enne kogu voo sirvimist.
10 min lugemistMitme mudeli orkestreerimine: marsruutimine hinna, latentsi ja kvaliteedi järgi
Erinevate ülesannete suunamine erinevatesse mudelitesse võib vähendada kulusid või latentsust, kuid ainult töökoormuspõhine hindamine näitab, kas lisatud keerukus tasub end ära. Mustrid, mõõtmised ja ebaõnnestumise juhtumid.
Edasijõudnud
12 min lugemistInferentsi kulude optimeerimine: prompti vahemälu, marsruutimine ja väljundi kontroll
Koosta jälitusandmetel põhinev tehisintellekti väljundkulu mudel, optimeeri suurimad mõõdetud panustajad ja tõesta, et iga muudatus säilitab ülesande kvaliteedi.
Ekspert
11 min lugemistIse hostitud vs hallatud lahendus: audititav murdepunkt
Millise mastaabi juures võidab ise hostimine API-kõnesid? Tegelik matemaatika, operatiivsed reaalsused ja mustrid, mis eristavad tiime, kes peaksid ise hostima, neist, kes peaksid hallatud inferentsi eest edasi maksma.
EkspertVeel selles teemas
13 min lugemist2026. aasta LLM-i tehnoloogiapinu: mudelid, inferents, tööriistad ja kompromissid
Praktiseeriva arhitekti vaade 2026. aasta LLM-i tehnoloogiapinule: mudelitasemed, inferentsiteenuse pakkujad, orkestreerimiskihid, hindamistööriistad ja kompromissid, mis päriselt loevad, kui viid AI-rakenduse tootmisse. Kõik see, mida oleksid soovinud enne alustamist teada.
Ekspert
6 min lugemistTasuta vs tasuline ChatGPT: mida tasuline plaan tegelikult juurde annab
Žargoonivaba võrdlus tasuta ChatGPT-st, ChatGPT Plusist, Pro-st ja tööplaanidest — mis muutub uuendamisel ja kuidas aru saada, kas sul on seda päriselt vaja.
AI-ga alustaja
10 min lugemistKohalik AI sinu Macis: Ollama, LM Studio ja see, mida 7B mudelid tegelikult suudavad
AI lokaalne käivitamine on küpsenud. Ollama või LM Studio ja moodsa Maciga saad jooksutada võimekaid mudeleid offline'is, tasuta ja privaatselt. Mis töötab, mis mitte ja millised kasutusjuhud sellest tegelikult kasu saavad.
Edasijõudnud
211 minutitSügav sukeldumine LLM-idesse nagu ChatGPT
Andrej Karpathy. See on üks selgemaid terviklikke selgitusi selle kohta, mis LLM tegelikult on — eelõpe, tokeniseerimine, SFT, RLHF, arutluse tugevdamisõpe, tööriistakasutus ja hallutsinatsioonid. Video annab insenerile vajaliku tausta, et käsitleda GPT-klassi, avatud kaaludega ja arutlevate mudelite valikut treeningu ning võimekuse, mitte ainult kaubamärgi küsimusena.
Ekspert
40 minutitAndrej Karpathy: tarkvara on (jälle) muutumas
Y Combinator. Karpathy AI Startup Schooli peaettekanne käsitleb LLM-e uut tüüpi arvutitena — ühtaegu teenuse, kiibitehase ja operatsioonisüsteemina — ning pooldab osalise autonoomiaga tooteid, kus suure mõjuga otsused jäävad inimese kontrolli alla. See toetab artikli mõttemudelit: inferentsipakkujaid ja tööriistu valitakse programmeeritava platvormi, mitte pelgalt vestlusroboti jaoks.
Ekspert
19 minutitKas see on RAG-i lõpp? Anthropicu UUS prompti caching
Prompt Engineering. Käib läbi Anthropicu prompti caching'u vs Gemini konteksti-caching'u koos konkreetsete latentsuse ja kulu vähenemistega kasutusjuhtumi kohta (pikkade dokumentide chat, few-shot, multi-turn). Cache-write lisatasu vs cache-read soodustuse lahtimõtestamine on täpselt see, mida artikkel eeldab, kui ta räägib sellest, millal caching ennast ära tasub.
Ekspert
56 minutitBuild Hour: Prompt Caching
OpenAI. OpenAI enda Build Hour prompti caching'ust — 1024-tokeni künnis, eesliite-stabiilsuse nõue, audio caching 99% soodustusega realtime'i jaoks, time-to-first-token mõjud pikkade sisendite korral. Kasulik, kui mõõdad inseneri-pingutust, mida nõuab cache'i päriselt usaldusväärselt tabamine oma produktsiooni-promptidel.
Ekspert
19 minutitIga AI mudel seletatud
Tina Huang. Puhas tuur praegusest mudelimaastikust, grupeeritud tasandi järgi — lipulaevad, lite-mudelid, keskklass, spetsialiseeritud — koos konkreetsete valikutega selle kohta, milles iga tasand päriselt hea on. See on artikli "tunne enne marsruutimist oma võimalusi" pool ja Huang raamib kulu-vs-võimekuse samamoodi nagu artikkel, ilma võrdlustabelite haibile toetumata.
Edasijõudnud
9 minutitRouteLLM saavutab 90% GPT4o kvaliteedi JA on 80% odavam
Matthew Berman. Käib läbi LMSYSi RouteLLM-i artikli ja koodi: väike klassifikaator istub tugeva/nõrga mudeli paari ees ja otsustab, kumba kutsuda, tabades umbes 95% tugeva mudeli kvaliteedist murdosaga kulust. Vaatamiste arv on alla tavalise 100k piiri, aga konkreetse "näita mulle päris mudeli-marsruutimist, mitte ainult mudelivõrdlusi" niši jaoks on see puhtaim selgitus YouTube'is ja sobib otse artikli kvaliteedi/kulu kompromissi sektsiooniga.
Edasijõudnud
32 minutitKiire LLM-serveerimine vLLM-i ja PagedAttentioniga
Anyscale. Käib läbi, miks naiivne LLM-serveerimine raiskab 60–80% GPU mälust, kuidas PagedAttention laenab OS-i stiilis pagineerimist seda parandama ja miks pidev batching toodab 24× läbilaskvuse numbreid, mida artikkel oma matemaatikas kasutab. Pärast seda lakkab artikli "õnneks tabad 50% kasutusastet" rida abstraktne olemast.
Ekspert