Тема

Оценка качества, наблюдаемость и надежность

Измерять поведение ИИ, ловить регрессии, отслеживать стоимость и задержки, улучшать процессы.

12 материалов (5 статей · 7 видео)

Начните здесь

Несколько хороших первых материалов перед полной лентой.

10 мин чтения
Статья

Оценки для не-инженеров: как понять, становится ли ваш ИИ-процесс лучше или хуже

Оценки — систематическое измерение качества выводов ИИ — обычно считают инженерной темой. Но они нужны любой команде, у которой есть ИИ-процессы, и базовый уровень доступен без кода. Как это делать.

Уверенный
13 мин чтения
Статья

Строим оценки, которые реально ловят регрессии

Большинство оценочных наборов выглядят внушительно, но пропускают реальные регрессии. Чтобы построить оценки, которые ловят важное, нужны аккуратно собранный датасет, чувствительные метрики, калиброванные судьи и культура доверия. Паттерны команд, у которых это получается.

Продвинутый
12 мин чтения
Статья

Наблюдаемость LLM-приложений: трассировка, стоимость, задержка, дрейф качества

Расширьте стандартную наблюдаемость многошаговыми трассировками, атрибутированной стоимостью, версиями промптов и моделей, оценёнными сигналами качества, механизмами конфиденциальности и оповещениями, формируемыми на основе рабочей нагрузки.

Продвинутый

Еще по этой теме

69 мин
Видео

Ландшафт агентов — уроки внедрения агентов в рабочую среду

MLOps.community. Вице-президент по ИИ в Prosus и ИИ-инженер рассказывают, что реально ломалось при внедрении агентов в портфельных компаниях группы: пентесты на промпт-инъекции перед запуском, опасная запись, когда Jira-агент споткнулся о человеческие сокращения, устаревший контекст, против которого агентов научили показывать свои допущения, и проектирование запасных сценариев, где агентов объединяли или отключали, как только они добавляли когнитивную нагрузку. Это реестр отказов из статьи, проигранный как живой постмортем.

Продвинутый
10 мин чтения
Статья

Сбои ИИ-систем в эксплуатации: что ломается после демонстрации

ИИ-системы обычно ломаются предсказуемо: галлюцинации, устаревший контекст, подхалимство, инъекция в промпт, небезопасное использование инструментов, дрейф схемы и слабые запасные сценарии. Реестр режимов сбоя в продакшне для команд, которые запускают реальные рабочие процессы.

Продвинутый
11 мин чтения
Статья

Чанкинг, переранжирование и гибридный поиск: как заставить RAG реально работать

Большинство RAG-реализаций работают плохо, потому что неправильно делают три вещи. Практический гид по чанкингу документов, переранжированию результатов и сочетанию ключевого поиска с семантическим — без необходимости становиться поисковым инженером.

Уверенный
107 мин
Видео

Почему оценка качества ИИ — самый востребованный новый навык продуктовых команд | Hamel Husain и Shreya Shankar

Lenny's Podcast. Хамел Хусейн и Шрея Шанкар проходят весь процесс оценки качества на реальном ИИ-ассистенте для управления недвижимостью: разбирают трассировки, ведут открытое и осевое кодирование ошибок, решают, когда остановиться, строят модель-судью (LLM-as-judge) и сверяют её с человеческим суждением. Это редкий обстоятельный разговор, действительно рассчитанный на продакт-менеджеров и руководителей команд, а не на ML-инженеров, и он выдерживает тот же ритм «30 минут в неделю после настройки», который рекомендует статья.

Уверенный
3 мин
Видео

Оценивайте промпты в Anthropic Console

Anthropic. Трёхминутный разбор от Anthropic о том, как запустить настоящую оценку внутри Workbench: автогенерация реалистичных тест-кейсов, оценка результатов, правка промпта и повторный параллельный прогон того же набора для сравнения. Просмотров меньше обычной планки, но для запроса «как мне реально сделать это без кода» это самое чистое официальное демо, и оно аккуратно встаёт под более стратегический разговор Хусейн/Шанкар.

Уверенный
55 мин
Видео

Как системно выстроить оценку LLM (метрики, юнит-тесты, LLM-as-a-Judge)

Dave Ebbelaar. Действующий ИИ-инженер проходит по своей реальной лестнице оценок — юнит-тесты в стиле assert, метрики без эталонов, согласование LLM-as-judge с людьми и цикл «анализируй–измеряй–улучшай». Такая структура — самое близкое из доступного на видео к тезису статьи, что оценки — это система для отлова регрессий, а не таблица лидеров.

Продвинутый
19 мин
Видео

Как строить доменно-специфичные системы оценки LLM: Hamel Husain и Emil Sedgh

AI Engineer. Хамель Хусейн и технический директор Rechat разбирают систему оценки за реальным ИИ-продуктом: почему универсальные готовые оценки не работают, слоёная схема из assert-проверок, логов с проверкой человеком и LLM-судей, согласованных с профильным экспертом, и как рабочая система оценки открывает путь к курированию данных и дообучению. Это производственный кейс для тезиса статьи, что оценки — это механизм для отлова регрессий, а не таблица лидеров.

Продвинутый
9 мин
Видео

LangSmith за 10 минут

LangChain. Наглядный разбор LLM-трассы, проекта и датасета от сооснователя LangChain — стоимость по токенам, латентность, частота ошибок, агрегация обратной связи, погружение в отдельный спан шага извлечения. Это самый близкий визуальный аналог тому, что статья описывает фразой «каждый вызов — это спан», и объяснению, почему структурированные трассировки лучше логирования через print.

Продвинутый
154 мин
Видео

Инструментирование и оценка LLM

Hamel Husain. Хамел Хусейн, Юджин Ян, Брайан Бишоф, Харрисон Чейз и Шрея Шанкар разбирают трассировку, анализ логов, подход «LLM как судья» и рабочий процесс вокруг изучения реальных продакшн-данных. Отнеситесь к записи как к длинному подкасту — это лучший на YouTube глубокий разбор тезиса статьи «смотрите на свои трассировки».

Продвинутый