55:02Dave Ebbelaar
Työtä tekevä tekoälyinsinööri käy läpi todellisen arviointitikapuunsa — assert-tyyliset yksikkötestit, referenssivapaat mittarit, LLM-as-judge -yhdenmukaisuus ihmisten kanssa sekä analyze/measure/improve -silmukka. Rakenne on lähin videovastine artikkelin argumenttiin, että arvioinnit ovat regressioita havaitseva järjestelmä, ei leaderboard.
Mitä sinun pitäisi oppia tästä: Suunnittele arviointitikapuu, joka nappaa regressiot ennen kuin kehotteen tai mallin muutokset saavuttavat käyttäjät.
Katso tai hallitse ensin: Kokemusta tekoälytyönkulun toimittamisesta tai ylläpidosta tunnetuilla epäonnistumisesimerkeillä.
AI Expert -huomio: Jotkin työkaluvalinnat vanhenevat, mutta tikapuu on terve: deterministiset tarkistukset ensin, sitten malliarvioidut tarkistukset validoituna ihmisiä vasten. Älä ohita kalibrointia vain siksi, että LLM-tuomari on helppo lisätä.
