Тема

Рабочие LLM-приложения

Проектировать, запускать, отслеживать и сопровождать LLM-приложения после демонстрационного этапа.

34 материала (23 статьи · 11 видео)

Начните здесь

Несколько хороших первых материалов перед полной лентой.

13 мин чтения
Статья

Стек LLM в 2026 году: модели, инференс, инструменты и компромиссы

Взгляд практикующего архитектора на стек LLM в 2026 году — уровни моделей, провайдеры инференса, слои оркестрации, инструменты для оценки и компромиссы, которые действительно имеют значение, когда вы запускаете ИИ в продакшен. Всё, что вы хотели бы услышать до того, как начали.

Продвинутый
12 мин чтения
Статья

Проектирование промптов для продакшена: системный слой, слой разработчика и пользовательский слой

Схема управления для разделения доверенных инструкций, данных времени выполнения и пользовательского ввода, а затем версионирования, оценки, выпуска и наблюдения промптов соразмерно риску.

Продвинутый
10 мин чтения
Статья

Сбои ИИ-систем в эксплуатации: что ломается после демонстрации

ИИ-системы обычно ломаются предсказуемо: галлюцинации, устаревший контекст, подхалимство, инъекция в промпт, небезопасное использование инструментов, дрейф схемы и слабые запасные сценарии. Реестр режимов сбоя в продакшне для команд, которые запускают реальные рабочие процессы.

Продвинутый

Еще по этой теме

8 мин чтения
Статья

Hermes vs n8n: выбирайте по задаче (и когда использовать оба)

Критерии выбора между Hermes Agent и n8n: детерминированная интеграция остаётся в n8n, а ограниченная агентская работа выполняется через шаг с API Hermes и bearer-аутентификацией либо по отдельному пути событийного вебхука.

Уверенный
8 мин чтения
Статья

OpenClaw vs Hermes: выбирайте по задаче, а не по бренду

OpenClaw и Hermes — это пересекающиеся системы самохостинговых агентов с разными операционными преимуществами. Сравните маршрутизацию каналов, вебхуки, инструменты и границы автоматизации перед выбором одного или обоих.

Уверенный
10 мин чтения
Статья

Экспериментальный стек из двух DGX Spark, DeepSeek-V4-Flash, n8n и Hermes

Как оценить экспериментальную конфигурацию сообщества для DeepSeek-V4-Flash на двух DGX Spark, где n8n отвечает за детерминированную автоматизацию, а Hermes выполняет задачи, требующие суждения.

Продвинутый
69 мин
Видео

Ландшафт агентов — уроки внедрения агентов в рабочую среду

MLOps.community. Вице-президент по ИИ в Prosus и ИИ-инженер рассказывают, что реально ломалось при внедрении агентов в портфельных компаниях группы: пентесты на промпт-инъекции перед запуском, опасная запись, когда Jira-агент споткнулся о человеческие сокращения, устаревший контекст, против которого агентов научили показывать свои допущения, и проектирование запасных сценариев, где агентов объединяли или отключали, как только они добавляли когнитивную нагрузку. Это реестр отказов из статьи, проигранный как живой постмортем.

Продвинутый
11 мин чтения
Статья

LangGraph, CrewAI или прямой API: выбираем архитектуру агента в 2026 году

Ландшафт агентских фреймворков в 2026 году стал зрелее, но яснее не стал. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK и прямой API — каждый подходит для каких-то команд и проектов, ни один не подходит всем. Честное сравнение и каркас для решения.

Продвинутый
13 мин чтения
Статья

Проектируем агентов, которые не уходят в бесконечный цикл

Самая частая форма провала продакшен-агента — бесконечные или псевдобесконечные циклы: агенты повторяют попытки, ветвятся и жгут токены, не продвигаясь вперёд. Какие архитектурные паттерны это предотвращают и дают агентов, которые доходят до конца даже на сложных задачах.

Продвинутый
12 мин чтения
Статья

Computer use и браузерные агенты в продакшене

У computer use и браузерных агентов есть демо, которые расходятся вирусно. Продакшен-развёртывания в масштабе выглядят иначе — узкие рамки, тяжёлые ограждения, аккуратный UX. Паттерны, которые работают, повторяющиеся сбои и честная экономика.

Продвинутый
12 мин чтения
Статья

Инженерия контекста: как работать с окнами на 1M токенов без деградации

Контекстные окна на 1M токенов существуют, но качество просаживается задолго до этого предела. Инженерия контекста — дисциплина эффективного использования контекстного окна: что включать, что суммировать, что подгружать на лету и какие паттерны удерживают качество, пока контекст растёт.

Продвинутый
12 мин чтения
Статья

Оптимизация стоимости инференса: кэширование промптов, маршрутизация и объём генерации

Постройте модель затрат на результат на основе трассировки, оптимизируйте крупнейших измеренных участников и докажите, что каждое изменение сохраняет качество задачи.

Продвинутый
13 мин чтения
Статья

Строим оценки, которые реально ловят регрессии

Большинство оценочных наборов выглядят внушительно, но пропускают реальные регрессии. Чтобы построить оценки, которые ловят важное, нужны аккуратно собранный датасет, чувствительные метрики, калиброванные судьи и культура доверия. Паттерны команд, у которых это получается.

Продвинутый
13 мин чтения
Статья

Дообучение в 2026 году: эксперимент с LoRA и QLoRA и измеримыми результатами

Решите, оправдано ли параметрически эффективное дообучение, управляйте данными, зафиксируйте воспроизводимый эксперимент, сравните результаты на отложенных выборках и тестах безопасности, а также проведите бенчмарки обслуживания перед развертыванием.

Продвинутый
14 мин чтения
Статья

Проектирование MCP-сервера на TypeScript: от минимального примера до проверки перед эксплуатацией

Создайте минимальный сервер Model Context Protocol, а перед эксплуатацией проверьте схемы, авторизацию, идемпотентность, наблюдаемость, развёртывание и безопасность.

Продвинутый
12 мин чтения
Статья

Проектируем MCP-инструменты, которыми LLM реально пользуются правильно

Большинство MCP-инструментов, которые мы видим, технически корректны и практически бесполезны. LLM их игнорируют, неправильно применяют или вызывают так, что толку нет. Принципы проектирования инструментов, которые LLM подхватывают естественно, с примерами типичных провалов и их исправлений.

Продвинутый
12 мин чтения
Статья

Как устроить память для долго работающих агентов

Долгоживущим агентам требуется собственный дизайн персистентности: прослеживаемость, подтверждение, изоляция арендаторов, тесты поиска, хранение, исправление и верифицируемое удаление.

Продвинутый
10 мин чтения
Статья

Оркестрация нескольких моделей: маршрутизация по стоимости, задержке и качеству

Маршрутизация различных задач на разные модели может снизить затраты или задержки, но только оценка, специфичная для рабочей нагрузки, покажет, окупается ли добавленная сложность. Паттерны, измерения и режимы сбоев.

Уверенный
12 мин чтения
Статья

Наблюдаемость LLM-приложений: трассировка, стоимость, задержка, дрейф качества

Расширьте стандартную наблюдаемость многошаговыми трассировками, атрибутированной стоимостью, версиями промптов и моделей, оценёнными сигналами качества, механизмами конфиденциальности и оповещениями, формируемыми на основе рабочей нагрузки.

Продвинутый
12 мин чтения
Статья

Проектирование RAG-системы для эксплуатации: приём данных, поиск, переранжирование и оценка

RAG-система для эксплуатации состоит из шести стадий, и каждая влияет на качество. Разбираем архитектуру, решения на каждом этапе и итеративную оценку, которая отличает надёжную систему от неудачной.

Продвинутый
14 мин чтения
Статья

Prompt injection и безопасность LLM: модели угроз и многоуровневая защита

Prompt injection — постоянный класс рисков безопасности LLM, а не ошибка написания промпта. Продакшен-руководство по моделям угроз, границам данных, правам инструментов, регрессионным тестам, мониторингу и реагированию на инциденты.

Продвинутый
12 мин чтения
Статья

Выбор между промптингом, RAG и файнтюнингом (и когда их сочетать)

Промптинг, RAG и дообучение — три основных способа адаптировать LLM к задаче. Каждый решает свой тип проблем. В статье — схема выбора, полная стоимость и условия, при которых сочетание методов оправдано.

Продвинутый
13 мин чтения
Статья

Юнит-экономика LLM-продукта: таблица ценообразования с проверяемыми допущениями

Распределение использования модели, маржинальная прибыль, обработка сбоев, поддержка и удержание клиентов до выбора цены. Этот шаблон заменяет неподтвержденные рыночные диапазоны проверяемыми входными данными.

Продвинутый
13 мин чтения
Статья

Структурированный вывод и вызов функций: надёжные схемы для эксплуатации

Структурированный вывод и вызов функций переводят систему от генерации текста к выполнению задач. В эксплуатации важны схемы, обработка ошибок, идемпотентность и корректная деградация, а не только режим JSON.

Продвинутый
211 мин
Видео

Глубокое погружение в LLM вроде ChatGPT

Andrej Karpathy. Самое понятное исчерпывающее объяснение на YouTube того, чем на самом деле является LLM — предобучение, токенизация, SFT, RLHF, reasoning RL, использование инструментов, галлюцинации — на уровне детализации, который нужен инженеру, чтобы рассуждать о компромиссах между моделями. Посмотрите его один раз — и выбор из статьи «модель GPT-класса против модели с открытыми весами против рассуждающей модели» перестанет казаться выбором бренда и начнёт выглядеть как выбор рецептов обучения.

Продвинутый
40 мин
Видео

Andrej Karpathy: программное обеспечение меняется (снова)

Y Combinator. Программное выступление Карпатого на AI Startup School описывает LLM как новый класс компьютеров — коммунальная услуга, чип-фабрика и операционная система в одном лице — и обосновывает «частично автономные» продукты с поводком под контролем человека. Это самая чёткая формулировка той ментальной модели стека, которую предполагает статья: вы выбираете поставщиков инференса и инструменты под программируемую основу, а не под чат-бота.

Продвинутый
9 мин
Видео

LangSmith за 10 минут

LangChain. Наглядный разбор LLM-трассы, проекта и датасета от сооснователя LangChain — стоимость по токенам, латентность, частота ошибок, агрегация обратной связи, погружение в отдельный спан шага извлечения. Это самый близкий визуальный аналог тому, что статья описывает фразой «каждый вызов — это спан», и объяснению, почему структурированные трассировки лучше логирования через print.

Продвинутый
154 мин
Видео

Инструментирование и оценка LLM

Hamel Husain. Хамел Хусейн, Юджин Ян, Брайан Бишоф, Харрисон Чейз и Шрея Шанкар разбирают трассировку, анализ логов, подход «LLM как судья» и рабочий процесс вокруг изучения реальных продакшн-данных. Отнеситесь к записи как к длинному подкасту — это лучший на YouTube глубокий разбор тезиса статьи «смотрите на свои трассировки».

Продвинутый
77 мин
Видео

Промпт-инжиниринг для ИИ: глубокое погружение

Anthropic. Четыре промпт-инженера Anthropic (research, alignment, applied, developer relations) подробно говорят о том, что они реально делают изо дня в день: как редактируют промпты под давлением, как думают о «честности» в инструкциях, когда помогают XML-каркасы, а когда нет. Слоистая модель статьи аккуратно ложится на то, как они описывают работу; это лучший способ услышать эту ментальную модель вслух.

Продвинутый
25 мин
Видео

Основы промптинга | Code w/ Claude

Anthropic. Живая сессия сборки промпта для страховых заявок от команды Applied AI в Anthropic — они начинают с расплывчатой инструкции и итеративно доводят её до состояния, которое разработчик реально отправил бы в продакшен, демонстрируя ровно те правки, которые описывает статья для слоёв system и developer. Посмотрите её перед перечитыванием чек-листа статьи про примеры, структуру вывода и обработку отказов.

Продвинутый
42 мин
Видео

Вертикальные ИИ-агенты могут стать в 10 раз больше SaaS

Y Combinator. Ведущие Lightcone разбирают, почему специализированные отраслевые ИИ-агенты могут дать прикладной компании более устойчивое преимущество, чем универсальная оболочка над моделью. Они приводят конкретные примеры и трезво оценивают, какие категории способны поглотить сами поставщики моделей. Это практическая сторона предупреждения статьи о продукте без устойчивого преимущества.

Продвинутый
34 мин
Видео

Как ИИ переизобретает бизнес-модели ПО — с Bret Taylor из Sierra

Sequoia Capital. Брет Тейлор проходит по сдвигу от per-seat SaaS к ценообразованию по результату — за что цепляться (resolution, CSAT, NPS), почему инкумбентам трудно следовать и как вертикальная специализация создаёт ценовую власть. Напрямую отзеркаливает разделы статьи про ценообразование и маржу.

Продвинутый
41 мин
Видео

OpenAI DevDay 2024 | Структурированный вывод для надёжных приложений

OpenAI. Проходит по `strict: true`, отличиям от старого JSON-режима, обработке отказов и тому, как сочетаются вызов функций и схемы response-format. Полезно ровно тем, что описывает контракт, который вам даёт API, — а именно на нём построены продакшн-паттерны статьи.

Продвинутый
18 мин
Видео

Pydantic — всё, что вам нужно: Jason Liu

AI Engineer. Выступление, кристаллизовавшее современный паттерн «опиши модель Pydantic, отдай её LLM, пусть валидация делает остальное», с конкретными примерами вложенных объектов, валидаторов, ловящих галлюцинированные URL, и Chain-of-Thought как типизированного поля. Посмотрите его перед перечитыванием раздела статьи про валидаторы — и узнаете, откуда взялись её правила повторных попыток и отказов.

Продвинутый