Kuidas ehitada valdkonnaspetsiifilisi LLM-i hindamissüsteeme: Hamel Husain ja Emil Sedgh

19 minutitEkspertLahenduste loojaAI EngineerAI ettevõttes

AI Engineer. Hamel Husain ja Rechati CTO käivad läbi päris AI-toote taga oleva hindamissüsteemi: miks üldised valmis-evalid läbi kukuvad, kihiline ülesehitus assertidest, logitud jälgedest inimülevaatusega ja domeeneksperdiga joondatud LLM-kohtunikest ning kuidas töötav hindamissüsteem avab andmekureerimise ja peenhäälestuse. See on tootmise juhtumianalüüs artikli argumendile, et evalid on regressioone püüdev masinavärk, mitte edetabel.

AI Experti märkus

Salvestatud 2024. aasta keskel; konkreetsed tööriistad on edasi liikunud, aga süsteemidisain mitte. Võta seda arhitektuuriviitena, mitte tarnija juhendina, ja hoia domeenekspert ringis, nagu ettekanne nõuab.

Mida sellest videost kaasa võtta

Näed, kuidas tootmistiim kihistab asserte, inimülevaatust ja LLM-kohtunikke, et regressioonid tuleksid välja enne väljalaset.

Mida enne vaadata või teada

Mugavustunne LLM-i hindamise põhiterminitega ja artikli evaluatsiooniredeli raamiga.

Viimati üle vaadatud: 15. juuli 2026

Järgmisena vaata

Jätka sama õpiteekonda järgmiste hoolikalt valitud kaasvideotega.