55:02Dave Ebbelaar
Töötav AI-insener käib läbi oma tegelikku evaluatsiooni-redelit — assert-stiili ühiktestid, referentsi-vabad mõõdikud, LLM-as-judge inimestega joondamine ja analüüsi/mõõtmise/parandamise silmus. Struktuur on videos lähim vaste artikli argumendile, et evaluatsioonid on regressioone püüdev süsteem, mitte edetabel.
Mida sellest videost kaasa võtta: Saad tehnilise mustri teemal "Evaluatsioonide ehitamine, mis regressioone päriselt püüavad" ning oskad hinnata riske, piire ja järgmist sammu.
Mida enne vaadata või teada: Kasuks tuleb arusaam API-dest, automatsioonidest, RAG-ist või agentide tööpõhimõtetest.
AI Experti märkus: Kontseptsioon on endiselt kasulik, kuid kontrolli näiteid praeguste tööriistadega enne päristöös kasutamist.
