Рабочие LLM-приложения
Проектировать, запускать, отслеживать и сопровождать LLM-приложения после демонстрационного этапа.
34 материала (23 статьи · 11 видео)
Начните здесь
Несколько хороших первых материалов перед полной лентой.
13 мин чтенияСтек LLM в 2026 году: модели, инференс, инструменты и компромиссы
Взгляд практикующего архитектора на стек LLM в 2026 году — уровни моделей, провайдеры инференса, слои оркестрации, инструменты для оценки и компромиссы, которые действительно имеют значение, когда вы запускаете ИИ в продакшен. Всё, что вы хотели бы услышать до того, как начали.
Продвинутый
12 мин чтенияПроектирование промптов для продакшена: системный слой, слой разработчика и пользовательский слой
Схема управления для разделения доверенных инструкций, данных времени выполнения и пользовательского ввода, а затем версионирования, оценки, выпуска и наблюдения промптов соразмерно риску.
Продвинутый
10 мин чтенияСбои ИИ-систем в эксплуатации: что ломается после демонстрации
ИИ-системы обычно ломаются предсказуемо: галлюцинации, устаревший контекст, подхалимство, инъекция в промпт, небезопасное использование инструментов, дрейф схемы и слабые запасные сценарии. Реестр режимов сбоя в продакшне для команд, которые запускают реальные рабочие процессы.
ПродвинутыйЕще по этой теме
8 мин чтенияHermes vs n8n: выбирайте по задаче (и когда использовать оба)
Критерии выбора между Hermes Agent и n8n: детерминированная интеграция остаётся в n8n, а ограниченная агентская работа выполняется через шаг с API Hermes и bearer-аутентификацией либо по отдельному пути событийного вебхука.
Уверенный
8 мин чтенияOpenClaw vs Hermes: выбирайте по задаче, а не по бренду
OpenClaw и Hermes — это пересекающиеся системы самохостинговых агентов с разными операционными преимуществами. Сравните маршрутизацию каналов, вебхуки, инструменты и границы автоматизации перед выбором одного или обоих.
Уверенный
10 мин чтенияЭкспериментальный стек из двух DGX Spark, DeepSeek-V4-Flash, n8n и Hermes
Как оценить экспериментальную конфигурацию сообщества для DeepSeek-V4-Flash на двух DGX Spark, где n8n отвечает за детерминированную автоматизацию, а Hermes выполняет задачи, требующие суждения.
Продвинутый
69 минЛандшафт агентов — уроки внедрения агентов в рабочую среду
MLOps.community. Вице-президент по ИИ в Prosus и ИИ-инженер рассказывают, что реально ломалось при внедрении агентов в портфельных компаниях группы: пентесты на промпт-инъекции перед запуском, опасная запись, когда Jira-агент споткнулся о человеческие сокращения, устаревший контекст, против которого агентов научили показывать свои допущения, и проектирование запасных сценариев, где агентов объединяли или отключали, как только они добавляли когнитивную нагрузку. Это реестр отказов из статьи, проигранный как живой постмортем.
Продвинутый
11 мин чтенияLangGraph, CrewAI или прямой API: выбираем архитектуру агента в 2026 году
Ландшафт агентских фреймворков в 2026 году стал зрелее, но яснее не стал. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK и прямой API — каждый подходит для каких-то команд и проектов, ни один не подходит всем. Честное сравнение и каркас для решения.
Продвинутый
13 мин чтенияПроектируем агентов, которые не уходят в бесконечный цикл
Самая частая форма провала продакшен-агента — бесконечные или псевдобесконечные циклы: агенты повторяют попытки, ветвятся и жгут токены, не продвигаясь вперёд. Какие архитектурные паттерны это предотвращают и дают агентов, которые доходят до конца даже на сложных задачах.
Продвинутый
12 мин чтенияComputer use и браузерные агенты в продакшене
У computer use и браузерных агентов есть демо, которые расходятся вирусно. Продакшен-развёртывания в масштабе выглядят иначе — узкие рамки, тяжёлые ограждения, аккуратный UX. Паттерны, которые работают, повторяющиеся сбои и честная экономика.
Продвинутый
12 мин чтенияИнженерия контекста: как работать с окнами на 1M токенов без деградации
Контекстные окна на 1M токенов существуют, но качество просаживается задолго до этого предела. Инженерия контекста — дисциплина эффективного использования контекстного окна: что включать, что суммировать, что подгружать на лету и какие паттерны удерживают качество, пока контекст растёт.
Продвинутый
12 мин чтенияОптимизация стоимости инференса: кэширование промптов, маршрутизация и объём генерации
Постройте модель затрат на результат на основе трассировки, оптимизируйте крупнейших измеренных участников и докажите, что каждое изменение сохраняет качество задачи.
Продвинутый
13 мин чтенияСтроим оценки, которые реально ловят регрессии
Большинство оценочных наборов выглядят внушительно, но пропускают реальные регрессии. Чтобы построить оценки, которые ловят важное, нужны аккуратно собранный датасет, чувствительные метрики, калиброванные судьи и культура доверия. Паттерны команд, у которых это получается.
Продвинутый
13 мин чтенияДообучение в 2026 году: эксперимент с LoRA и QLoRA и измеримыми результатами
Решите, оправдано ли параметрически эффективное дообучение, управляйте данными, зафиксируйте воспроизводимый эксперимент, сравните результаты на отложенных выборках и тестах безопасности, а также проведите бенчмарки обслуживания перед развертыванием.
Продвинутый
14 мин чтенияПроектирование MCP-сервера на TypeScript: от минимального примера до проверки перед эксплуатацией
Создайте минимальный сервер Model Context Protocol, а перед эксплуатацией проверьте схемы, авторизацию, идемпотентность, наблюдаемость, развёртывание и безопасность.
Продвинутый
12 мин чтенияПроектируем MCP-инструменты, которыми LLM реально пользуются правильно
Большинство MCP-инструментов, которые мы видим, технически корректны и практически бесполезны. LLM их игнорируют, неправильно применяют или вызывают так, что толку нет. Принципы проектирования инструментов, которые LLM подхватывают естественно, с примерами типичных провалов и их исправлений.
Продвинутый
12 мин чтенияКак устроить память для долго работающих агентов
Долгоживущим агентам требуется собственный дизайн персистентности: прослеживаемость, подтверждение, изоляция арендаторов, тесты поиска, хранение, исправление и верифицируемое удаление.
Продвинутый
10 мин чтенияОркестрация нескольких моделей: маршрутизация по стоимости, задержке и качеству
Маршрутизация различных задач на разные модели может снизить затраты или задержки, но только оценка, специфичная для рабочей нагрузки, покажет, окупается ли добавленная сложность. Паттерны, измерения и режимы сбоев.
Уверенный
12 мин чтенияНаблюдаемость LLM-приложений: трассировка, стоимость, задержка, дрейф качества
Расширьте стандартную наблюдаемость многошаговыми трассировками, атрибутированной стоимостью, версиями промптов и моделей, оценёнными сигналами качества, механизмами конфиденциальности и оповещениями, формируемыми на основе рабочей нагрузки.
Продвинутый
12 мин чтенияПроектирование RAG-системы для эксплуатации: приём данных, поиск, переранжирование и оценка
RAG-система для эксплуатации состоит из шести стадий, и каждая влияет на качество. Разбираем архитектуру, решения на каждом этапе и итеративную оценку, которая отличает надёжную систему от неудачной.
Продвинутый
14 мин чтенияPrompt injection и безопасность LLM: модели угроз и многоуровневая защита
Prompt injection — постоянный класс рисков безопасности LLM, а не ошибка написания промпта. Продакшен-руководство по моделям угроз, границам данных, правам инструментов, регрессионным тестам, мониторингу и реагированию на инциденты.
Продвинутый
12 мин чтенияВыбор между промптингом, RAG и файнтюнингом (и когда их сочетать)
Промптинг, RAG и дообучение — три основных способа адаптировать LLM к задаче. Каждый решает свой тип проблем. В статье — схема выбора, полная стоимость и условия, при которых сочетание методов оправдано.
Продвинутый
13 мин чтенияЮнит-экономика LLM-продукта: таблица ценообразования с проверяемыми допущениями
Распределение использования модели, маржинальная прибыль, обработка сбоев, поддержка и удержание клиентов до выбора цены. Этот шаблон заменяет неподтвержденные рыночные диапазоны проверяемыми входными данными.
Продвинутый
13 мин чтенияСтруктурированный вывод и вызов функций: надёжные схемы для эксплуатации
Структурированный вывод и вызов функций переводят систему от генерации текста к выполнению задач. В эксплуатации важны схемы, обработка ошибок, идемпотентность и корректная деградация, а не только режим JSON.
Продвинутый
211 минГлубокое погружение в LLM вроде ChatGPT
Andrej Karpathy. Самое понятное исчерпывающее объяснение на YouTube того, чем на самом деле является LLM — предобучение, токенизация, SFT, RLHF, reasoning RL, использование инструментов, галлюцинации — на уровне детализации, который нужен инженеру, чтобы рассуждать о компромиссах между моделями. Посмотрите его один раз — и выбор из статьи «модель GPT-класса против модели с открытыми весами против рассуждающей модели» перестанет казаться выбором бренда и начнёт выглядеть как выбор рецептов обучения.
Продвинутый
40 минAndrej Karpathy: программное обеспечение меняется (снова)
Y Combinator. Программное выступление Карпатого на AI Startup School описывает LLM как новый класс компьютеров — коммунальная услуга, чип-фабрика и операционная система в одном лице — и обосновывает «частично автономные» продукты с поводком под контролем человека. Это самая чёткая формулировка той ментальной модели стека, которую предполагает статья: вы выбираете поставщиков инференса и инструменты под программируемую основу, а не под чат-бота.
Продвинутый
9 минLangSmith за 10 минут
LangChain. Наглядный разбор LLM-трассы, проекта и датасета от сооснователя LangChain — стоимость по токенам, латентность, частота ошибок, агрегация обратной связи, погружение в отдельный спан шага извлечения. Это самый близкий визуальный аналог тому, что статья описывает фразой «каждый вызов — это спан», и объяснению, почему структурированные трассировки лучше логирования через print.
Продвинутый
154 минИнструментирование и оценка LLM
Hamel Husain. Хамел Хусейн, Юджин Ян, Брайан Бишоф, Харрисон Чейз и Шрея Шанкар разбирают трассировку, анализ логов, подход «LLM как судья» и рабочий процесс вокруг изучения реальных продакшн-данных. Отнеситесь к записи как к длинному подкасту — это лучший на YouTube глубокий разбор тезиса статьи «смотрите на свои трассировки».
Продвинутый
77 минПромпт-инжиниринг для ИИ: глубокое погружение
Anthropic. Четыре промпт-инженера Anthropic (research, alignment, applied, developer relations) подробно говорят о том, что они реально делают изо дня в день: как редактируют промпты под давлением, как думают о «честности» в инструкциях, когда помогают XML-каркасы, а когда нет. Слоистая модель статьи аккуратно ложится на то, как они описывают работу; это лучший способ услышать эту ментальную модель вслух.
Продвинутый
25 минОсновы промптинга | Code w/ Claude
Anthropic. Живая сессия сборки промпта для страховых заявок от команды Applied AI в Anthropic — они начинают с расплывчатой инструкции и итеративно доводят её до состояния, которое разработчик реально отправил бы в продакшен, демонстрируя ровно те правки, которые описывает статья для слоёв system и developer. Посмотрите её перед перечитыванием чек-листа статьи про примеры, структуру вывода и обработку отказов.
Продвинутый
42 минВертикальные ИИ-агенты могут стать в 10 раз больше SaaS
Y Combinator. Ведущие Lightcone разбирают, почему специализированные отраслевые ИИ-агенты могут дать прикладной компании более устойчивое преимущество, чем универсальная оболочка над моделью. Они приводят конкретные примеры и трезво оценивают, какие категории способны поглотить сами поставщики моделей. Это практическая сторона предупреждения статьи о продукте без устойчивого преимущества.
Продвинутый
34 минКак ИИ переизобретает бизнес-модели ПО — с Bret Taylor из Sierra
Sequoia Capital. Брет Тейлор проходит по сдвигу от per-seat SaaS к ценообразованию по результату — за что цепляться (resolution, CSAT, NPS), почему инкумбентам трудно следовать и как вертикальная специализация создаёт ценовую власть. Напрямую отзеркаливает разделы статьи про ценообразование и маржу.
Продвинутый
41 минOpenAI DevDay 2024 | Структурированный вывод для надёжных приложений
OpenAI. Проходит по `strict: true`, отличиям от старого JSON-режима, обработке отказов и тому, как сочетаются вызов функций и схемы response-format. Полезно ровно тем, что описывает контракт, который вам даёт API, — а именно на нём построены продакшн-паттерны статьи.
Продвинутый
18 минPydantic — всё, что вам нужно: Jason Liu
AI Engineer. Выступление, кристаллизовавшее современный паттерн «опиши модель Pydantic, отдай её LLM, пусть валидация делает остальное», с конкретными примерами вложенных объектов, валидаторов, ловящих галлюцинированные URL, и Chain-of-Thought как типизированного поля. Посмотрите его перед перечитыванием раздела статьи про валидаторы — и узнаете, откуда взялись её правила повторных попыток и отказов.
Продвинутый