Стоимость и эксплуатация моделей
Контролировать стоимость инференса, выбирать способ размещения, маршрутизировать запросы между моделями и понимать эксплуатационные компромиссы.
13 материалов (6 статей · 7 видео)
Начните здесь
Несколько хороших первых материалов перед полной лентой.
10 мин чтенияОркестрация нескольких моделей: маршрутизация по стоимости, задержке и качеству
Маршрутизация различных задач на разные модели может снизить затраты или задержки, но только оценка, специфичная для рабочей нагрузки, покажет, окупается ли добавленная сложность. Паттерны, измерения и режимы сбоев.
Уверенный
12 мин чтенияОптимизация стоимости инференса: кэширование промптов, маршрутизация и объём генерации
Постройте модель затрат на результат на основе трассировки, оптимизируйте крупнейших измеренных участников и докажите, что каждое изменение сохраняет качество задачи.
Продвинутый
11 мин чтенияСамостоятельное размещение или управляемый инференс: модель точки безубыточности
При каком масштабе самостоятельное размещение становится выгоднее API? Расчёты, эксплуатационные затраты и признаки, по которым можно выбрать между своей инфраструктурой и управляемым инференсом.
ПродвинутыйЕще по этой теме
13 мин чтенияСтек LLM в 2026 году: модели, инференс, инструменты и компромиссы
Взгляд практикующего архитектора на стек LLM в 2026 году — уровни моделей, провайдеры инференса, слои оркестрации, инструменты для оценки и компромиссы, которые действительно имеют значение, когда вы запускаете ИИ в продакшен. Всё, что вы хотели бы услышать до того, как начали.
Продвинутый
6 мин чтенияБесплатный или платный ChatGPT: что меняется после перехода на платный тариф
Сравнение бесплатного ChatGPT, ChatGPT Plus и ChatGPT Pro без жаргона: что меняется при переходе на платный тариф и как понять, действительно ли он вам нужен.
Новичок в ИИ
10 мин чтенияЛокальный ИИ на вашем Mac: Ollama, LM Studio и что реально умеют 7B-модели
Локальный ИИ повзрослел. С Ollama или LM Studio и современным Mac можно запускать способные модели офлайн, бесплатно и приватно. Что работает, что нет и в каких сценариях это действительно даёт выигрыш.
Уверенный
211 минГлубокое погружение в LLM вроде ChatGPT
Andrej Karpathy. Самое понятное исчерпывающее объяснение на YouTube того, чем на самом деле является LLM — предобучение, токенизация, SFT, RLHF, reasoning RL, использование инструментов, галлюцинации — на уровне детализации, который нужен инженеру, чтобы рассуждать о компромиссах между моделями. Посмотрите его один раз — и выбор из статьи «модель GPT-класса против модели с открытыми весами против рассуждающей модели» перестанет казаться выбором бренда и начнёт выглядеть как выбор рецептов обучения.
Продвинутый
40 минAndrej Karpathy: программное обеспечение меняется (снова)
Y Combinator. Программное выступление Карпатого на AI Startup School описывает LLM как новый класс компьютеров — коммунальная услуга, чип-фабрика и операционная система в одном лице — и обосновывает «частично автономные» продукты с поводком под контролем человека. Это самая чёткая формулировка той ментальной модели стека, которую предполагает статья: вы выбираете поставщиков инференса и инструменты под программируемую основу, а не под чат-бота.
Продвинутый
19 минЭто конец RAG? Новое кеширование промптов от Anthropic
Prompt Engineering. Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против скидки за чтение из кеша — ровно то, что предполагает статья, говоря, когда кеширование окупается.
Продвинутый
56 минBuild Hour: кеширование промптов
OpenAI. Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы оцениваете инженерные усилия для надёжного попадания в кеш на ваших продакшен-промптах.
Продвинутый
19 минВсе модели ИИ: разбор
Tina Huang. Чистый тур по текущему ландшафту моделей, разбитому по тирам — флагманы, lite-модели, средний тир, специализированные — с конкретными подсказками, на что хорош каждый тир. Это половина статьи «знай свои варианты, прежде чем маршрутизировать», и Хуанг подаёт связку стоимость-vs-возможности так же, как и статья, не опираясь на хайп вокруг бенчмарков.
Уверенный
9 минRouteLLM достигает 90% качества GPT4o и на 80% дешевле
Matthew Berman. Проходится по статье и коду LMSYS RouteLLM: маленький классификатор сидит перед парой «сильная/слабая модель» и решает, какую вызвать, попадая примерно в 95% качества сильной модели за долю цены. Просмотры под обычным порогом в 100K, но для конкретной ниши «покажи мне реальную маршрутизацию моделей, а не просто сравнения моделей» это самое ясное объяснение на YouTube, и оно напрямую совпадает с секцией статьи про компромисс качество/стоимость.
Уверенный
32 минБыстрый сервинг LLM с vLLM и PagedAttention
Anyscale. Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые опирается арифметика статьи. После этого фраза статьи «вам повезёт попасть в 50% утилизации» перестаёт казаться абстрактной.
Продвинутый