Arviointi, havainnoitavuus ja laatu
Mittaa tekoälyn toimintaa, havaitse regressiot, seuraa kustannuksia ja viivettä sekä kehitä työnkulkuja jatkuvasti.
12 sisältöä (5 artikkelia · 7 videota)
Aloita tästä
Muutama hyvä aloitussisältö ennen koko sisältövirran selaamista.
10 min lukemistaEval-arvioinnit muille kuin kehittäjille: tiedä, paraneeko vai heikkeneekö tekoälytyönkulkusi
Eval-arviointeja eli tekoälytulosten laadun järjestelmällistä mittaamista pidetään tavallisesti insinöörien asiana. Jokainen tekoälytyönkulkuja käyttävä tiimi tarvitsee niitä, ja perusteet onnistuvat ilman koodia. Käytännön opas.
Keskitaso
13 min lukemistaRegressioita todella havaitsevien arviointien rakentaminen
Useimmat arviointikokonaisuudet näyttävät vakuuttavilta mutta eivät havaitse todellisia regressioita. Olennaiset ongelmat havaitsevat arvioinnit edellyttävät huolellisesti rakennettua aineistoa, herkkiä mittareita, arvioijien kalibrointia ja luottamuksen kulttuuria. Näin onnistuneet tiimit toimivat.
Edistynyt
12 min lukemistaLLM-sovellusten havainnoitavuus: jäljitys, kustannukset, viive ja laadun ajautuminen
LLM-sovellukset epäonnistuvat tavoilla, joita perinteinen havainnoitavuus ei havaitse. Toimintamallit monivaiheisten työnkulkujen jäljittämiseen, kutsukohtaisesti 100x vaihtelevien kustannusten seurantaan, laadun ajautumisen valvontaan ja hallusinaatioiden selvittämiseen tuotannon mittakaavassa.
EdistynytLisää tässä aiheessa

The Agent Landscape - Lessons Learned Putting Agents Into Production
The Agent Landscape - Lessons Learned Putting Agents Into Production
Edistynyt
10 min lukemistaTuotantotason tekoälyn epäonnistumistavat: mikä rikkoutuu demon jälkeen
Tekoälyjärjestelmät epäonnistuvat yleensä ennustettavilla tavoilla: hallusinaatio, vanhentunut konteksti, mielistely, kehoteinjektio, turvaton työkalujen käyttö, skeeman ajautuminen ja heikot varamenettelyt. Tuotannon epäonnistumisrekisteri tiimeille, jotka julkaisevat oikeita työnkulkuja.
Edistynyt
11 min lukemistaPilkkominen, uudelleenjärjestäminen ja hybridihaku: tee RAG:stä toimiva
Useimmat RAG-toteutukset toimivat huonosti, koska niissä tehdään kolme asiaa väärin. Käytännön opas asiakirjojen pilkkomiseen, tulosten uudelleenjärjestämiseen sekä avainsana- ja semanttisen haun yhdistämiseen ilman hakutekniikan asiantuntijuutta.
Keskitaso
Why AI evals are the hottest new skill for product builders | Hamel Husain & Shreya Shankar
Why AI evals are the hottest new skill for product builders | Hamel Husain & Shreya Shankar
Keskitaso
Evaluate prompts in the Anthropic Console
Evaluate prompts in the Anthropic Console
Keskitaso
How to Systematically Setup LLM Evals (Metrics, Unit Tests, LLM-as-a-Judge)
How to Systematically Setup LLM Evals (Metrics, Unit Tests, LLM-as-a-Judge)
Edistynyt
How to Construct Domain Specific LLM Evaluation Systems: Hamel Husain and Emil Sedgh
How to Construct Domain Specific LLM Evaluation Systems: Hamel Husain and Emil Sedgh
Edistynyt
LangSmith in 10 Minutes
LangSmith in 10 Minutes
Edistynyt
Instrumenting & Evaluating LLMs
Instrumenting & Evaluating LLMs
Edistynyt