Aihe

Arviointi, havainnoitavuus ja laatu

Mittaa tekoälyn toimintaa, havaitse regressiot, seuraa kustannuksia ja viivettä sekä kehitä työnkulkuja jatkuvasti.

12 sisältöä (5 artikkelia · 7 videota)

Aloita tästä

Muutama hyvä aloitussisältö ennen koko sisältövirran selaamista.

Lisää tässä aiheessa

69 minuuttia
Video

Agenttien kenttä – oppeja agenttien viemisestä tuotantoon

MLOps.community. Prosuksen tekoälyn VP ja tekoälyinsinööri raportoivat, mikä todella rikkoutui, kun he ottivat agentteja käyttöön ryhmän portfolioyrityksissä: kehoteinjektion pen-testaus ennen julkaisua, turvaton kirjoitus kun Jira-agentti tukehtui ihmisen lyhennelmiin, vanhentunut konteksti käsiteltynä siten, että agentit tuovat oletuksensa esiin, sekä varamenettelyn suunnittelu, joka yhdisti tai tappoi agentteja, kun ne lisäsivät kognitiivista kuormaa. Se lukee kuin artikkelin epäonnistumistaparekisteri toistettuna live-postmortemina.

Edistynyt
10 min lukemista
Artikkeli

Tekoälyjärjestelmän vikatavat tuotannossa: mikä hajoaa demon jälkeen

Laadi vikataparekisteri hallusinaatioille, vanhentuneelle kontekstille, kehote-injektiolle, turvattomalle työkalujen käytölle, skeeman ajautumiselle, heikoille varamenettelyille ja havainnoitavuuden puutteille.

Edistynyt
11 min lukemista
Artikkeli

Pilkkominen, uudelleenjärjestäminen ja hybridihaku: tee RAG:stä toimiva

Useimmat RAG-toteutukset toimivat huonosti, koska niissä tehdään kolme asiaa väärin. Käytännön opas asiakirjojen pilkkomiseen, tulosten uudelleenjärjestämiseen sekä avainsana- ja semanttisen haun yhdistämiseen ilman hakutekniikan asiantuntijuutta.

Keskitaso
107 minuuttia
Video

Miksi tekoälyn evaluoinnit ovat kuumin uusi taito tuoterakentajille | Hamel Husain & Shreya Shankar

Lenny's Podcast. Hamel Husain ja Shreya Shankar käyvät läpi koko arviointityönkulun oikealla kiinteistönhallinnan tekoälyavustajalla — jälkien tarkastelu, virheiden avoin ja aksiaalinen koodaus, päätös milloin lopettaa, LLM-as-judge -rakentaminen ja validointi ihmisarviota vasten. Harvinainen pitkämuotoinen keskustelu, joka on aidosti suunnattu PM:ille ja tiiminvetäjille ML-insinöörien sijaan, ja se kattaa saman ”30 minuuttia viikossa asetuksen jälkeen” -rytmin, jota artikkeli suosittelee.

Keskitaso
3 minuuttia
Video

Evaluoi kehotteita Anthropic Consolessa

Anthropic. Kolmen minuutin Anthropic-läpikäynti oikean arvioinnin ajamisesta Workbenchissä — realististen testitapausten automaattinen generointi, tuotosten arviointi, kehotteen säätäminen ja saman suiteen uudelleenajo rinnakkain. Katselumäärä jää alle tavallisen kynnyksen, mutta ”miten teen tämän ilman koodia” -kysymykseen tämä on selkein virallinen demo ja asettuu siististi strategisemman Husain/Shankar-keskustelun alle.

Keskitaso
55 minuuttia
Video

Näin asetat LLM-evaluoinnit järjestelmällisesti (mittarit, yksikkötestit, LLM-as-a-Judge)

Dave Ebbelaar. Työtä tekevä tekoälyinsinööri käy läpi todellisen arviointitikapuunsa — assert-tyyliset yksikkötestit, referenssivapaat mittarit, LLM-as-judge -yhdenmukaisuus ihmisten kanssa sekä analyze/measure/improve -silmukka. Rakenne on lähin videovastine artikkelin argumenttiin, että arvioinnit ovat regressioita havaitseva järjestelmä, ei leaderboard.

Edistynyt
19 minuuttia
Video

Näin rakennat domain-kohtaisia LLM-evaluointijärjestelmiä: Hamel Husain ja Emil Sedgh

AI Engineer. Hamel Husain ja Rechatin CTO käyvät läpi oikean tekoälytuotteen taustalla olevan arviointijärjestelmän: miksi geneeriset valmiit arvioinnit epäonnistuvat, kerroksellinen asetelma assertioneista, lokitetuista jäljistä ihmistarkistuksella ja LLM-tuomareista pidettyinä linjassa domain-asiantuntijan kanssa, sekä miten toimiva arviointijärjestelmä avaa datan kuratoinnin ja hienosäädön. Se on tuotantotapausesimerkki artikkelin argumentille, että arvioinnit ovat regressioita havaitsevaa koneistoa, ei leaderboardia.

Edistynyt
9 minuuttia
Video

LangSmith 10 minuutissa

LangChain. LangChainin toinen perustaja esittelee LLM-jäljen, projektin ja aineiston sekä tokenkustannukset, viiveen, virheosuuden, palautteen koostamisen ja yksittäisen hakuvaiheen tarkastelun. Video havainnollistaa artikkelin ajatusta siitä, että jokainen kutsu on yksi jäljen osa ja rakenteinen jäljitys on tulostuslokeja hyödyllisempi.

Edistynyt
154 minuuttia
Video

LLM:ien instrumentointi ja evaluointi

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase ja Shreya Shankar käsittelevät jäljitystä, lokianalyysiä, kielimallin käyttöä arvioijana sekä todelliseen tuotantodataan perustuvaa työnkulkua. Varaa videolle aikaa kuten pitkälle podcastille. Se syventää artikkelin kehotusta tarkastella todellisia jälkiä.

Edistynyt