Видео к статье

Сборка оценок, которые реально ловят регрессии — видео к статье

Проектирование оценок (evals) — это та часть работы с LLM, где качественных материалов на YouTube мало: большая часть популярного контента — это «какой бенчмарк лучше», а не «как не дать продукту незаметно деградировать». Обе рекомендации находятся ниже нашей обычной планки по просмотрам, потому что именно так на самом деле и устроена эта ниша; это самые понятные разборы из доступных — один — пошаговая практическая сборка, другой — производственный кейс — и подобраны в пару так, чтобы вы могли взглянуть на одну и ту же задачу с двух сторон.

Основная рекомендация

55:02
How to Systematically Setup LLM Evals (Metrics, Unit Tests, LLM-as-a-Judge)

Dave Ebbelaar

Действующий ИИ-инженер проходит по своей реальной лестнице оценок — юнит-тесты в стиле assert, метрики без эталонов, согласование LLM-as-judge с людьми и цикл «анализируй–измеряй–улучшай». Такая структура — самое близкое из доступного на видео к тезису статьи, что оценки — это система для отлова регрессий, а не таблица лидеров.

Что вынести из этого видео: Спроектировать лестницу оценок, которая ловит регрессии до того, как изменения промпта или модели дойдут до пользователей.

Что посмотреть или знать заранее: Полезно понимать API, автоматизации, RAG или базовую архитектуру агентов.

Заметка AI Expert: Концепция остаётся полезной, но проверьте примеры на актуальных инструментах перед применением в реальной работе.

Открыть страницу видео

Также стоит посмотреть

18:44
How to Construct Domain Specific LLM Evaluation Systems: Hamel Husain and Emil Sedgh

AI Engineer

Хамель Хусейн и технический директор Rechat разбирают систему оценки за реальным ИИ-продуктом: почему универсальные готовые оценки не работают, слоёная схема из assert-проверок, логов с проверкой человеком и LLM-судей, согласованных с профильным экспертом, и как рабочая система оценки открывает путь к курированию данных и дообучению. Это производственный кейс для тезиса статьи, что оценки — это механизм для отлова регрессий, а не таблица лидеров.

Что вынести из этого видео: Увидеть, как продуктовая команда слоями выстраивает assert-проверки, проверку человеком и LLM-судей, чтобы регрессии всплывали до релиза.

Что посмотреть или знать заранее: Уверенное владение базовой терминологией оценки LLM и схемой «лестницы оценок» из статьи.

Заметка AI Expert: Записано в середине 2024 года; конкретные инструменты ушли вперёд, но дизайн системы — нет. Используйте как архитектурный ориентир, а не как справочник по поставщикам, и держите профильного эксперта в контуре, как настаивает доклад.

Открыть страницу видео