Kaasnevad videod

Evaluatsioonide ehitamine, mis regressioone päriselt püüavad — kaasnevad videod

Evaluatsioonide disain on see osa LLM-tööst, kus YouTube'i kaanon on õhuke — enamik populaarset sisu on "mis on parim benchmark", mitte "kuidas ma takistan oma toote vaikselt halvemaks minekut". Mõlemad valikud jäävad meie tavalise vaatamiste piiri alla, sest selles valdkonna nurgas see päriselt nii välja näeb; need on selgeimad saadaolevad käsitlused — üks samm-sammuline oma kätega ehitus, teine päris toote juhtumianalüüs — paaritatud nii, et näeksid sama probleemi kahest nurgast.

Esmane valik

55:02
Kuidas süsteemselt seadistada LLM evaluatsioone (mõõdikud, ühiktestid, LLM-as-a-Judge)

Dave Ebbelaar

Töötav AI-insener käib läbi oma tegelikku evaluatsiooni-redelit — assert-stiili ühiktestid, referentsi-vabad mõõdikud, LLM-as-judge inimestega joondamine ja analüüsi/mõõtmise/parandamise silmus. Struktuur on videos lähim vaste artikli argumendile, et evaluatsioonid on regressioone püüdev süsteem, mitte edetabel.

Mida sellest videost kaasa võtta: Saad tehnilise mustri teemal "Evaluatsioonide ehitamine, mis regressioone päriselt püüavad" ning oskad hinnata riske, piire ja järgmist sammu.

Mida enne vaadata või teada: Kasuks tuleb arusaam API-dest, automatsioonidest, RAG-ist või agentide tööpõhimõtetest.

AI Experti märkus: Kontseptsioon on endiselt kasulik, kuid kontrolli näiteid praeguste tööriistadega enne päristöös kasutamist.

Ava video leht

Tasub samuti vaadata

18:44
Kuidas ehitada valdkonnaspetsiifilisi LLM-i hindamissüsteeme: Hamel Husain ja Emil Sedgh

AI Engineer

Hamel Husain ja Rechati CTO käivad läbi päris AI-toote taga oleva hindamissüsteemi: miks üldised valmis-evalid läbi kukuvad, kihiline ülesehitus assertidest, logitud jälgedest inimülevaatusega ja domeeneksperdiga joondatud LLM-kohtunikest ning kuidas töötav hindamissüsteem avab andmekureerimise ja peenhäälestuse. See on tootmise juhtumianalüüs artikli argumendile, et evalid on regressioone püüdev masinavärk, mitte edetabel.

Mida sellest videost kaasa võtta: Näed, kuidas tootmistiim kihistab asserte, inimülevaatust ja LLM-kohtunikke, et regressioonid tuleksid välja enne väljalaset.

Mida enne vaadata või teada: Mugavustunne LLM-i hindamise põhiterminitega ja artikli evaluatsiooniredeli raamiga.

AI Experti märkus: Salvestatud 2024. aasta keskel; konkreetsed tööriistad on edasi liikunud, aga süsteemidisain mitte. Võta seda arhitektuuriviitena, mitte tarnija juhendina, ja hoia domeenekspert ringis, nagu ettekanne nõuab.

Ava video leht