Aihe

Kustannukset ja mallien operointi

Hallitse inferenssin kustannuksia, valitse käyttöympäristöt, reititä malleja ja ymmärrä operatiiviset kompromissit.

13 sisältöä (6 artikkelia · 7 videota)

Aloita tästä

Muutama hyvä aloitussisältö ennen koko sisältövirran selaamista.

Lisää tässä aiheessa

13 min lukemista
Artikkeli

Vuoden 2026 LLM-pino: mallit, inferenssi, työkalut ja kompromissit

Työskentelevän arkkitehdin näkemys vuoden 2026 LLM-pinosta: mallitasot, inferenssipalveluntarjoajat, orkestrointikerrokset, arviointityökalut ja kompromissit, joilla on todella merkitystä tuotantotasoista tekoälyä julkaistaessa. Kaikki se, minkä olisit toivonut jonkun selittävän ennen aloittamista.

Edistynyt
6 min lukemista
Artikkeli

Maksuton vai maksullinen ChatGPT: mitä päivityksellä oikeasti saa

Selkokielinen vertailu maksuttomasta ChatGPT:stä, ChatGPT Plusista ja ChatGPT Prosta — mikä päivityksessä muuttuu ja mistä tiedät, tarvitsetko sitä.

Uusi tekoälyn maailmassa
10 min lukemista
Artikkeli

Paikallinen tekoäly Macissa: Ollama, LM Studio ja mihin 7B-mallit todella pystyvät

Tekoälyn paikallinen käyttö on kypsynyt. Ollaman tai LM Studion ja modernin Macin avulla voit käyttää kyvykkäitä malleja ilman verkkoyhteyttä, ilmaiseksi ja yksityisesti. Mikä toimii, mikä ei ja mitkä käyttötapaukset todella hyötyvät.

Keskitaso
211 minuuttia
Video

Syväsukellus LLM:iin kuten ChatGPT

Andrej Karpathy. Selkein alusta loppuun -selitys YouTubessa siitä, mikä LLM oikeastaan on — esikoulutus, tokenisointi, SFT, RLHF, päättelyn RL, työkalujen käyttö, hallusinaatiot — sillä yksityiskohtaisuudella, jota insinööri tarvitsee mallikompromissien päättelyyn. Katso kerran, niin artikkelin ”GPT-luokka vs. avoimet painot vs. päättelymalli” -päätökset lakkaavat tuntumasta brändivalinnoilta ja alkavat tuntua koulutusreseptivalinnoilta.

Edistynyt
40 minuuttia
Video

Andrej Karpathy: ohjelmistot muuttuvat (taas)

Y Combinator. Karpathyn AI Startup School -avainpuhe kehystää LLM:t uutena tietokonelajina — utility, fab ja OS yhdessä — ja puolustaa ”osittaisen autonomian” tuotteita ihmisen ohjaamalla talutushihnalla. Selkein artikulaatio artikkelin olettamasta pino-tason ajattelumallista: valitset inferenssitoimittajia ja työkaluja ohjelmoitavalle alustalle, et chatbotille.

Edistynyt
19 minuuttia
Video

Onko tämä RAG:n loppu? Anthropicin UUSI prompt caching

Prompt Engineering. Käy läpi Anthropicin prompt cachingin Geminiin context cachingiin verrattuna konkreettisilla viive- ja kustannusvähennyksillä käyttötapauksittain (pitkän asiakirjan chat, few-shot, monivuoro). Cache-write-lisämaksun vs. cache-read-alennuksen erittely on tasan se, mitä artikkeli olettaa puhuessaan, milloin välimuisti maksaa itsensä takaisin.

Edistynyt
56 minuuttia
Video

Build Hour: kehotteiden välimuisti (prompt caching)

OpenAI. OpenAI:n oma Build Hour kehotteiden välimuistista — 1024 tokenin kynnys, etuliitteen vakauden vaatimus, jyrkät audio-välimuistialennukset realtimelle (tarkista tarkka hinta nykyiseltä hinnoittelusivulta), time-to-first-token -vaikutukset pitkillä syötteillä. Hyödyllinen, kun mitoitat suunnittelutyötä osuaksesi välimuistiin luotettavasti tuotantokehotteillasi.

Edistynyt
19 minuuttia
Video

Jokainen tekoälymalli selitettynä

Tina Huang. Video jäsentää mallimaisemaa tasoittain: lippulaivamalleihin, kevyisiin malleihin, keskitason malleihin ja erikoistuneisiin malleihin. Konkreettiset esimerkit auttavat arvioimaan, mihin kukin taso sopii. Huang käsittelee kustannuksen ja kyvykkyyden suhdetta ilman, että päätös perustuu vain vertailutulosten hypetykseen.

Keskitaso
9 minuuttia
Video

RouteLLM saavuttaa 90 % GPT-4o:n laadusta JA on 80 % HALVEMPI

Matthew Berman. Video käy läpi LMSYS RouteLLM -artikkelin ja koodin. Pieni luokittelija valitsee vahvan ja heikomman mallin välillä. Videolla käsitellyssä tutkimusasetelmassa reititin saavutti noin 95 % vahvan mallin laadusta selvästi pienemmin kustannuksin. Katselumäärä jää tavanomaisen 100 000 katselukerran kynnyksen alle, mutta video näyttää konkreettisen mallireitityksen pelkän mallivertailun sijasta.

Keskitaso
32 minuuttia
Video

Nopea LLM-palvelu vLLM:llä ja PagedAttentionilla

Anyscale. Esitys käy läpi vLLM-tutkimuksessa raportoidun muistin hukkakäytön, PagedAttentionin käyttöjärjestelmistä lainaaman sivutusidean ja jatkuvan eräkäsittelyn vaikutuksen läpäisykykyyn. Videon luvut koskevat sen omia vertailuasetelmia, mutta mekanismit auttavat ymmärtämään artikkelin käyttöastelaskelmaa.

Edistynyt