Teema

Kvaliteedihindamine, jälgitavus ja töökindlus

Mõõda AI käitumist, püüa tagasilangused kinni, jälgi kulu ja latentsust ning paranda töövooge.

12 lugu (5 artiklit · 7 videot)

Alusta siit

Mõned head esimesed materjalid enne kogu voo sirvimist.

Veel selles teemas

69 minutit
Video

Agentide maastik - õppetunnid agentide tootmisse viimisest

MLOps.community. Prosuse AI asepresident ja AI-insener räägivad, mis päriselt katki läks, kui nad agente kontserni portfelliettevõtetes juurutasid: prompt injectioni pen-testid enne käikulaskmist, ohtlik kirjutamine, kui Jira agent inimliku lühistiili otsa komistas, aegunud kontekst, mille vastu agendid õpetati oma eeldusi välja näitama, ning varulahenduste disain, kus agendid liideti või suleti, kui need kognitiivset koormust lisasid. See on nagu artikli vearegister, mis mängitakse läbi elava postmortem'ina.

Ekspert
10 min lugemist
Artikkel

Tootmiskeskkonna AI veamustrid: mis pärast demot katki läheb

AI-süsteemid ebaõnnestuvad tavaliselt etteaimatavatel viisidel: hallutsinatsioon, aegunud kontekst, liigne nõustumine, prompt injection, ohtlik tööriistakasutus, skeemitriiv ja nõrgad varuplaanid. Tootmise veamustrite register tiimidele, kes päris töövooge käitavad.

Ekspert
11 min lugemist
Artikkel

Tükeldamine, ümberreastamine ja hübriidotsing: pane RAG päriselt tööle

Enamik RAG-rakendusi töötab halvasti, sest kolm põhiasja on valesti tehtud. Praktiline juhend dokumentide tükeldamiseks, tulemuste ümberreastamiseks ning märksõna- ja semantilise otsingu ühendamiseks — ilma et peaksid saama otsinguinseneriks.

Edasijõudnud
107 minutit
Video

Miks AI evaluatsioonid on toote-ehitajatele kuumim uus oskus | Hamel Husain ja Shreya Shankar

Lenny's Podcast. Hamel Husain ja Shreya Shankar käivad läbi terve evaluatsiooni-töövoo päris kinnisvarahalduse AI-assistendi peal — jälgede vaatamine, vigade avatud ja teljeline kodeerimine, otsustamine, millal lõpetada, LLM-as-judge ehitamine ja selle valideerimine inimese hinnangu vastu. See on haruldane pikem vestlus, mis on tõeliselt suunatud PM-idele ja tiimijuhtidele, mitte ML-inseneridele, ja katab sama "30 minutit nädalas pärast seadistust" rütmi, mida artikkel soovitab.

Edasijõudnud
3 minutit
Video

Hinda AI-juhiseid Anthropic Console'is

Anthropic. Kolmeminutiline Anthropicu läbikäik päris evaluatsiooni jooksutamisest Workbenchi sees — realistlike testjuhtumite auto-genereerimine, väljundite hindamine, juhise muutmine ja sama komplekti uuesti kõrvuti jooksutamine. Vaatamiste arv jääb tavalisest piirist allapoole, aga "kuidas ma seda päriselt ilma koodi kirjutamata teen" jaoks on see puhtaim ametlik demo ja istub kenasti strateegilisema Husaini/Shankari vestluse alla.

Edasijõudnud
55 minutit
Video

Kuidas süsteemselt seadistada LLM evaluatsioone (mõõdikud, ühiktestid, LLM-as-a-Judge)

Dave Ebbelaar. Töötav AI-insener käib läbi oma tegelikku evaluatsiooni-redelit — assert-stiili ühiktestid, referentsi-vabad mõõdikud, LLM-as-judge inimestega joondamine ja analüüsi/mõõtmise/parandamise silmus. Struktuur on videos lähim vaste artikli argumendile, et evaluatsioonid on regressioone püüdev süsteem, mitte edetabel.

Ekspert
19 minutit
Video

Kuidas ehitada valdkonnaspetsiifilisi LLM-i hindamissüsteeme: Hamel Husain ja Emil Sedgh

AI Engineer. Hamel Husain ja Rechati CTO käivad läbi päris AI-toote taga oleva hindamissüsteemi: miks üldised valmis-evalid läbi kukuvad, kihiline ülesehitus assertidest, logitud jälgedest inimülevaatusega ja domeeneksperdiga joondatud LLM-kohtunikest ning kuidas töötav hindamissüsteem avab andmekureerimise ja peenhäälestuse. See on tootmise juhtumianalüüs artikli argumendile, et evalid on regressioone püüdev masinavärk, mitte edetabel.

Ekspert
9 minutit
Video

LangSmith 10 minutiga

LangChain. LangChaini kaasasutaja tutvustab LLM-i päringujälgi, projekte ja andmestikke: tokenikulu, latentsust, veamäära, tagasiside koondamist ning ühe otsinguetapi detailvaadet. Video näitab visuaalselt, miks struktureeritud päringujäljed annavad rohkem teavet kui lihtne konsoolilogimine.

Ekspert
154 minutit
Video

LLM-ide instrumenteerimine ja hindamine

Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase ja Shreya Shankar käsitlevad päringujälgi, logianalüüsi, mudelipõhist hindamist ning päris tootmisandmete ülevaatamise töökorraldust. Pikk loeng seob artikli jälgitavuse põhimõtted praktiliseks hindamis- ja tagasisidetsükliks.

Ekspert