Oheisvideot

Regressioita todella havaitsevien arviointien rakentaminen — saatevideot

Arviointisuunnittelu on se LLM-työn osa, jossa YouTube-kanoni on ohut — suurin osa suositusta sisällöstä on ”mikä on paras vertailu” eikä ”miten estän tuotettani heikkenemästä hiljaa”. Molemmat valinnat jäävät alle tavallisen katselukynnyksemme, koska näin tämä alan kulma todella näyttää; ne ovat selkeimmät saatavilla olevat käsittelyt — toinen käytännön soolorakennus, toinen tuotantotapausesimerkki — paritettuna niin, että näet saman ongelman kahdesta kulmasta.

Päävalinta

55:02
Näin asetat LLM-evaluoinnit järjestelmällisesti (mittarit, yksikkötestit, LLM-as-a-Judge)

Dave Ebbelaar

Työtä tekevä tekoälyinsinööri käy läpi todellisen arviointitikapuunsa — assert-tyyliset yksikkötestit, referenssivapaat mittarit, LLM-as-judge -yhdenmukaisuus ihmisten kanssa sekä analyze/measure/improve -silmukka. Rakenne on lähin videovastine artikkelin argumenttiin, että arvioinnit ovat regressioita havaitseva järjestelmä, ei leaderboard.

Mitä sinun pitäisi oppia tästä: Suunnittele arviointitikapuu, joka nappaa regressiot ennen kuin kehotteen tai mallin muutokset saavuttavat käyttäjät.

Katso tai hallitse ensin: Kokemusta tekoälytyönkulun toimittamisesta tai ylläpidosta tunnetuilla epäonnistumisesimerkeillä.

AI Expert -huomio: Jotkin työkaluvalinnat vanhenevat, mutta tikapuu on terve: deterministiset tarkistukset ensin, sitten malliarvioidut tarkistukset validoituna ihmisiä vasten. Älä ohita kalibrointia vain siksi, että LLM-tuomari on helppo lisätä.

Avaa videosivu

Kannattaa katsoa myös

18:44
Näin rakennat domain-kohtaisia LLM-evaluointijärjestelmiä: Hamel Husain ja Emil Sedgh

AI Engineer

Hamel Husain ja Rechatin CTO käyvät läpi oikean tekoälytuotteen taustalla olevan arviointijärjestelmän: miksi geneeriset valmiit arvioinnit epäonnistuvat, kerroksellinen asetelma assertioneista, lokitetuista jäljistä ihmistarkistuksella ja LLM-tuomareista pidettyinä linjassa domain-asiantuntijan kanssa, sekä miten toimiva arviointijärjestelmä avaa datan kuratoinnin ja hienosäädön. Se on tuotantotapausesimerkki artikkelin argumentille, että arvioinnit ovat regressioita havaitsevaa koneistoa, ei leaderboardia.

Mitä sinun pitäisi oppia tästä: Näe, miten tuotantotiimi kerrostaa assertiot, ihmistarkistuksen ja LLM-tuomarit niin, että regressiot nousevat esiin ennen julkaisua.

Katso tai hallitse ensin: Perus LLM-arviointiterminologia ja artikkelin arviointitikapuun kehys sujuvat.

AI Expert -huomio: Nauhoitettu puolivälissä 2024; tarkat työkalut ovat edenneet mutta järjestelmäsuunnittelu ei. Käsittele arkkitehtuuriviitteenä, ei toimittajaoppaana, ja pidä domain-asiantuntija silmukassa kuten puhe vaatii.

Avaa videosivu