Kvaliteedihindamine, jälgitavus ja töökindlus
Mõõda AI käitumist, püüa tagasilangused kinni, jälgi kulu ja latentsust ning paranda töövooge.
12 lugu (5 artiklit · 7 videot)
Alusta siit
Mõned head esimesed materjalid enne kogu voo sirvimist.
10 min lugemistHindamised mitte-inseneridele: tea, kas sinu AI-töövoog läheb paremaks või halvemaks
Hindamisi — AI-väljundi kvaliteedi süsteemset mõõtmist — käsitletakse tavaliselt inseneride mureks. Aga iga AI-töövooge jooksutav tiim vajab neid, ja põhitõed on koodita kättesaadavad. Kuidas-juhend.
Edasijõudnud
13 min lugemistRegressioone tuvastavate hindamiste koostamine
Enamik hindamiskomplekte näeb muljetavaldav välja, kuid jätab päris regressioonid vahele. Hindamiste ehitamine, mis püüab kinni seda, mis loeb, nõuab hoolikat andmestiku ehitamist, tundlikke mõõdikuid, kohtuniku kalibreerimist ja usaldusekultuuri. Mustrid meeskondadelt, kes seda õigesti teevad.
Ekspert
12 min lugemistLLM-rakenduste vaadeldavus: päringujäljed, kulud, latentsus ja kvaliteeditriiv
Laienda tavalist jälgitavust mitmesammuliste jälgimisvoogude, atribuutitava kulu, prompti ja mudeli versioonide, hinnatud kvaliteedisignaalide, privaatsuskontrollide ja töökoormusest tulenevate hoiatustega.
EkspertVeel selles teemas
69 minutitAgentide maastik - õppetunnid agentide tootmisse viimisest
MLOps.community. Prosuse AI asepresident ja AI-insener räägivad, mis päriselt katki läks, kui nad agente kontserni portfelliettevõtetes juurutasid: prompt injectioni pen-testid enne käikulaskmist, ohtlik kirjutamine, kui Jira agent inimliku lühistiili otsa komistas, aegunud kontekst, mille vastu agendid õpetati oma eeldusi välja näitama, ning varulahenduste disain, kus agendid liideti või suleti, kui need kognitiivset koormust lisasid. See on nagu artikli vearegister, mis mängitakse läbi elava postmortem'ina.
Ekspert
10 min lugemistTootmiskeskkonna AI veamustrid: mis pärast demot katki läheb
AI-süsteemid ebaõnnestuvad tavaliselt etteaimatavatel viisidel: hallutsinatsioon, aegunud kontekst, liigne nõustumine, prompt injection, ohtlik tööriistakasutus, skeemitriiv ja nõrgad varuplaanid. Tootmise veamustrite register tiimidele, kes päris töövooge käitavad.
Ekspert
11 min lugemistTükeldamine, ümberreastamine ja hübriidotsing: pane RAG päriselt tööle
Enamik RAG-rakendusi töötab halvasti, sest kolm põhiasja on valesti tehtud. Praktiline juhend dokumentide tükeldamiseks, tulemuste ümberreastamiseks ning märksõna- ja semantilise otsingu ühendamiseks — ilma et peaksid saama otsinguinseneriks.
Edasijõudnud
107 minutitMiks AI evaluatsioonid on toote-ehitajatele kuumim uus oskus | Hamel Husain ja Shreya Shankar
Lenny's Podcast. Hamel Husain ja Shreya Shankar käivad läbi terve evaluatsiooni-töövoo päris kinnisvarahalduse AI-assistendi peal — jälgede vaatamine, vigade avatud ja teljeline kodeerimine, otsustamine, millal lõpetada, LLM-as-judge ehitamine ja selle valideerimine inimese hinnangu vastu. See on haruldane pikem vestlus, mis on tõeliselt suunatud PM-idele ja tiimijuhtidele, mitte ML-inseneridele, ja katab sama "30 minutit nädalas pärast seadistust" rütmi, mida artikkel soovitab.
Edasijõudnud
3 minutitHinda AI-juhiseid Anthropic Console'is
Anthropic. Kolmeminutiline Anthropicu läbikäik päris evaluatsiooni jooksutamisest Workbenchi sees — realistlike testjuhtumite auto-genereerimine, väljundite hindamine, juhise muutmine ja sama komplekti uuesti kõrvuti jooksutamine. Vaatamiste arv jääb tavalisest piirist allapoole, aga "kuidas ma seda päriselt ilma koodi kirjutamata teen" jaoks on see puhtaim ametlik demo ja istub kenasti strateegilisema Husaini/Shankari vestluse alla.
Edasijõudnud
55 minutitKuidas süsteemselt seadistada LLM evaluatsioone (mõõdikud, ühiktestid, LLM-as-a-Judge)
Dave Ebbelaar. Töötav AI-insener käib läbi oma tegelikku evaluatsiooni-redelit — assert-stiili ühiktestid, referentsi-vabad mõõdikud, LLM-as-judge inimestega joondamine ja analüüsi/mõõtmise/parandamise silmus. Struktuur on videos lähim vaste artikli argumendile, et evaluatsioonid on regressioone püüdev süsteem, mitte edetabel.
Ekspert
19 minutitKuidas ehitada valdkonnaspetsiifilisi LLM-i hindamissüsteeme: Hamel Husain ja Emil Sedgh
AI Engineer. Hamel Husain ja Rechati CTO käivad läbi päris AI-toote taga oleva hindamissüsteemi: miks üldised valmis-evalid läbi kukuvad, kihiline ülesehitus assertidest, logitud jälgedest inimülevaatusega ja domeeneksperdiga joondatud LLM-kohtunikest ning kuidas töötav hindamissüsteem avab andmekureerimise ja peenhäälestuse. See on tootmise juhtumianalüüs artikli argumendile, et evalid on regressioone püüdev masinavärk, mitte edetabel.
Ekspert
9 minutitLangSmith 10 minutiga
LangChain. LangChaini kaasasutaja tutvustab LLM-i päringujälgi, projekte ja andmestikke: tokenikulu, latentsust, veamäära, tagasiside koondamist ning ühe otsinguetapi detailvaadet. Video näitab visuaalselt, miks struktureeritud päringujäljed annavad rohkem teavet kui lihtne konsoolilogimine.
Ekspert
154 minutitLLM-ide instrumenteerimine ja hindamine
Hamel Husain. Hamel Husain, Eugene Yan, Brian Bischof, Harrison Chase ja Shreya Shankar käsitlevad päringujälgi, logianalüüsi, mudelipõhist hindamist ning päris tootmisandmete ülevaatamise töökorraldust. Pikk loeng seob artikli jälgitavuse põhimõtted praktiliseks hindamis- ja tagasisidetsükliks.
Ekspert