Arviointi, havainnoitavuus ja laatu
Mittaa tekoälyn toimintaa, havaitse regressiot, seuraa kustannuksia ja viivettä sekä kehitä työnkulkuja jatkuvasti.
12 sisältöä (5 artikkelia · 7 videota)
Aloita tästä
Muutama hyvä aloitussisältö ennen koko sisältövirran selaamista.
10 min lukemistaEval-arvioinnit muille kuin kehittäjille: tiedä, paraneeko vai heikkeneekö tekoälytyönkulkusi
Käytännön johdatus tekoälytyönkulun arviointiin edustavien esimerkkien, täsmällisten arviointiperusteiden, pätevien luokitusten ja julkaisusääntöjen avulla. Taulukkolaskenta riittää, kun työ voidaan suorittaa toistettavasti käsin.
Keskitaso
13 min lukemistaRegressioita todella havaitsevien arviointien rakentaminen
Useimmat arviointikokonaisuudet näyttävät vakuuttavilta mutta eivät havaitse todellisia regressioita. Olennaiset ongelmat havaitsevat arvioinnit edellyttävät huolellisesti rakennettua aineistoa, herkkiä mittareita, arvioijien kalibrointia ja luottamuksen kulttuuria. Näin onnistuneet tiimit toimivat.
Edistynyt
12 min lukemistaLLM-sovellusten havainnoitavuus: jäljitys, kustannukset, viive ja laadun ajautuminen
Täydennä tavallista havainnoitavuutta monivaiheisilla jäljityksillä, kohdistettavilla kustannuksilla, kehote- ja malliversioilla, arvioiduilla laatusignaaleilla, tietosuojatoimilla sekä työkuormasta johdetuilla hälytyksillä.
EdistynytLisää tässä aiheessa
69 minuuttiaAgenttien kenttä – oppeja agenttien viemisestä tuotantoon
MLOps.community. Prosuksen tekoälyn VP ja tekoälyinsinööri raportoivat, mikä todella rikkoutui, kun he ottivat agentteja käyttöön ryhmän portfolioyrityksissä: kehoteinjektion pen-testaus ennen julkaisua, turvaton kirjoitus kun Jira-agentti tukehtui ihmisen lyhennelmiin, vanhentunut konteksti käsiteltynä siten, että agentit tuovat oletuksensa esiin, sekä varamenettelyn suunnittelu, joka yhdisti tai tappoi agentteja, kun ne lisäsivät kognitiivista kuormaa. Se lukee kuin artikkelin epäonnistumistaparekisteri toistettuna live-postmortemina.
Edistynyt
10 min lukemistaTekoälyjärjestelmän vikatavat tuotannossa: mikä hajoaa demon jälkeen
Laadi vikataparekisteri hallusinaatioille, vanhentuneelle kontekstille, kehote-injektiolle, turvattomalle työkalujen käytölle, skeeman ajautumiselle, heikoille varamenettelyille ja havainnoitavuuden puutteille.
Edistynyt
11 min lukemistaPilkkominen, uudelleenjärjestäminen ja hybridihaku: tee RAG:stä toimiva
Useimmat RAG-toteutukset toimivat huonosti, koska niissä tehdään kolme asiaa väärin. Käytännön opas asiakirjojen pilkkomiseen, tulosten uudelleenjärjestämiseen sekä avainsana- ja semanttisen haun yhdistämiseen ilman hakutekniikan asiantuntijuutta.
Keskitaso
107 minuuttiaMiksi tekoälyn evaluoinnit ovat kuumin uusi taito tuoterakentajille | Hamel Husain & Shreya Shankar
Lenny's Podcast. Hamel Husain ja Shreya Shankar käyvät läpi koko arviointityönkulun oikealla kiinteistönhallinnan tekoälyavustajalla — jälkien tarkastelu, virheiden avoin ja aksiaalinen koodaus, päätös milloin lopettaa, LLM-as-judge -rakentaminen ja validointi ihmisarviota vasten. Harvinainen pitkämuotoinen keskustelu, joka on aidosti suunnattu PM:ille ja tiiminvetäjille ML-insinöörien sijaan, ja se kattaa saman ”30 minuuttia viikossa asetuksen jälkeen” -rytmin, jota artikkeli suosittelee.
Keskitaso
3 minuuttiaEvaluoi kehotteita Anthropic Consolessa
Anthropic. Kolmen minuutin Anthropic-läpikäynti oikean arvioinnin ajamisesta Workbenchissä — realististen testitapausten automaattinen generointi, tuotosten arviointi, kehotteen säätäminen ja saman suiteen uudelleenajo rinnakkain. Katselumäärä jää alle tavallisen kynnyksen, mutta ”miten teen tämän ilman koodia” -kysymykseen tämä on selkein virallinen demo ja asettuu siististi strategisemman Husain/Shankar-keskustelun alle.
Keskitaso
55 minuuttiaNäin asetat LLM-evaluoinnit järjestelmällisesti (mittarit, yksikkötestit, LLM-as-a-Judge)
Dave Ebbelaar. Työtä tekevä tekoälyinsinööri käy läpi todellisen arviointitikapuunsa — assert-tyyliset yksikkötestit, referenssivapaat mittarit, LLM-as-judge -yhdenmukaisuus ihmisten kanssa sekä analyze/measure/improve -silmukka. Rakenne on lähin videovastine artikkelin argumenttiin, että arvioinnit ovat regressioita havaitseva järjestelmä, ei leaderboard.
Edistynyt
19 minuuttiaNäin rakennat domain-kohtaisia LLM-evaluointijärjestelmiä: Hamel Husain ja Emil Sedgh
AI Engineer. Hamel Husain ja Rechatin CTO käyvät läpi oikean tekoälytuotteen taustalla olevan arviointijärjestelmän: miksi geneeriset valmiit arvioinnit epäonnistuvat, kerroksellinen asetelma assertioneista, lokitetuista jäljistä ihmistarkistuksella ja LLM-tuomareista pidettyinä linjassa domain-asiantuntijan kanssa, sekä miten toimiva arviointijärjestelmä avaa datan kuratoinnin ja hienosäädön. Se on tuotantotapausesimerkki artikkelin argumentille, että arvioinnit ovat regressioita havaitsevaa koneistoa, ei leaderboardia.
Edistynyt
9 minuuttiaLangSmith 10 minuutissa
LangChain. LangChainin toinen perustaja esittelee LLM-jäljen, projektin ja aineiston sekä tokenkustannukset, viiveen, virheosuuden, palautteen koostamisen ja yksittäisen hakuvaiheen tarkastelun. Video havainnollistaa artikkelin ajatusta siitä, että jokainen kutsu on yksi jäljen osa ja rakenteinen jäljitys on tulostuslokeja hyödyllisempi.
Edistynyt
154 minuuttiaLLM:ien instrumentointi ja evaluointi
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase ja Shreya Shankar käsittelevät jäljitystä, lokianalyysiä, kielimallin käyttöä arvioijana sekä todelliseen tuotantodataan perustuvaa työnkulkua. Varaa videolle aikaa kuten pitkälle podcastille. Se syventää artikkelin kehotusta tarkastella todellisia jälkiä.
Edistynyt