Выбор моделей и инструментов
Как выбирать между ChatGPT, Claude, Gemini, Copilot, моделями с углублённым рассуждением, облачным и локальным запуском.
27 материалов (12 статей · 15 видео)
Начните здесь
Несколько хороших первых материалов перед полной лентой.
6 мин чтенияChatGPT, Claude, Gemini, Copilot — что выбрать новичку?
Четыре мейнстримных ИИ-ассистента, разобранные простым языком. Нетехническое руководство по выбору первого ИИ — исходя из того, чем вы уже пользуетесь и чего на самом деле хотите.
Новичок в ИИ
7 мин чтенияВыбор модели под задачу: шпаргалка на 2026 год
Какую модель выбирать для разных типов задач. GPT, Claude, Gemini, режимы рассуждения и модели с открытыми весами: правила выбора и примеры середины 2026 года вместо вечного рейтинга.
Начинающий
10 мин чтенияОркестрация нескольких моделей: маршрутизация по стоимости, задержке и качеству
Маршрутизация различных задач на разные модели может снизить затраты или задержки, но только оценка, специфичная для рабочей нагрузки, покажет, окупается ли добавленная сложность. Паттерны, измерения и режимы сбоев.
УверенныйЕще по этой теме
13 мин чтенияСтек LLM в 2026 году: модели, инференс, инструменты и компромиссы
Взгляд практикующего архитектора на стек LLM в 2026 году — уровни моделей, провайдеры инференса, слои оркестрации, инструменты для оценки и компромиссы, которые действительно имеют значение, когда вы запускаете ИИ в продакшен. Всё, что вы хотели бы услышать до того, как начали.
Продвинутый
10 мин чтенияChain-of-thought, self-critique, tree-of-thoughts — когда что использовать
Три способа организовать рассуждение модели на сложных задачах и компромиссы между качеством, стоимостью и задержкой. Конкретные промпты, сравнения и ограничения современных моделей с углублённым рассуждением.
Уверенный
12 мин чтенияОптимизация стоимости инференса: кэширование промптов, маршрутизация и объём генерации
Постройте модель затрат на результат на основе трассировки, оптимизируйте крупнейших измеренных участников и докажите, что каждое изменение сохраняет качество задачи.
Продвинутый
13 мин чтенияДообучение в 2026 году: эксперимент с LoRA и QLoRA и измеримыми результатами
Решите, оправдано ли параметрически эффективное дообучение, управляйте данными, зафиксируйте воспроизводимый эксперимент, сравните результаты на отложенных выборках и тестах безопасности, а также проведите бенчмарки обслуживания перед развертыванием.
Продвинутый
6 мин чтенияБесплатный или платный ChatGPT: что меняется после перехода на платный тариф
Сравнение бесплатного ChatGPT, ChatGPT Plus и ChatGPT Pro без жаргона: что меняется при переходе на платный тариф и как понять, действительно ли он вам нужен.
Новичок в ИИ
10 мин чтенияЛокальный ИИ на вашем Mac: Ollama, LM Studio и что реально умеют 7B-модели
Локальный ИИ повзрослел. С Ollama или LM Studio и современным Mac можно запускать способные модели офлайн, бесплатно и приватно. Что работает, что нет и в каких сценариях это действительно даёт выигрыш.
Уверенный
10 мин чтенияВыбор и промптинг рассуждающих моделей
Настройки рассуждений влияют на качество, задержку, стоимость и иногда на подход к промптингу. Практическое руководство по их выбору на основе оценок, а не общепринятых представлений.
Уверенный
12 мин чтенияВыбор между промптингом, RAG и файнтюнингом (и когда их сочетать)
Промптинг, RAG и дообучение — три основных способа адаптировать LLM к задаче. Каждый решает свой тип проблем. В статье — схема выбора, полная стоимость и условия, при которых сочетание методов оправдано.
Продвинутый
11 мин чтенияСамостоятельное размещение или управляемый инференс: модель точки безубыточности
При каком масштабе самостоятельное размещение становится выгоднее API? Расчёты, эксплуатационные затраты и признаки, по которым можно выбрать между своей инфраструктурой и управляемым инференсом.
Продвинутый
211 минГлубокое погружение в LLM вроде ChatGPT
Andrej Karpathy. Самое понятное исчерпывающее объяснение на YouTube того, чем на самом деле является LLM — предобучение, токенизация, SFT, RLHF, reasoning RL, использование инструментов, галлюцинации — на уровне детализации, который нужен инженеру, чтобы рассуждать о компромиссах между моделями. Посмотрите его один раз — и выбор из статьи «модель GPT-класса против модели с открытыми весами против рассуждающей модели» перестанет казаться выбором бренда и начнёт выглядеть как выбор рецептов обучения.
Продвинутый
40 минAndrej Karpathy: программное обеспечение меняется (снова)
Y Combinator. Программное выступление Карпатого на AI Startup School описывает LLM как новый класс компьютеров — коммунальная услуга, чип-фабрика и операционная система в одном лице — и обосновывает «частично автономные» продукты с поводком под контролем человека. Это самая чёткая формулировка той ментальной модели стека, которую предполагает статья: вы выбираете поставщиков инференса и инструменты под программируемую основу, а не под чат-бота.
Продвинутый
19 минЭто конец RAG? Новое кеширование промптов от Anthropic
Prompt Engineering. Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против скидки за чтение из кеша — ровно то, что предполагает статья, говоря, когда кеширование окупается.
Продвинутый
56 минBuild Hour: кеширование промптов
OpenAI. Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы оцениваете инженерные усилия для надёжного попадания в кеш на ваших продакшен-промптах.
Продвинутый
157 минFine-tuning LLM-моделей — курс по генеративному ИИ
freeCodeCamp.org. Длинный курс «сначала теория, потом код», покрывающий квантизацию, LoRA, QLoRA и полный PEFT на Llama 2 и Gemma — на железе, которое реально есть у большинства разработчиков. Это самое близкое к опыту «постой рядом с тем, кто это уже делал» на YouTube, и оно совпадает с тезисом статьи «кластер вам не нужен» с конкретными бюджетами по VRAM.
Продвинутый
59 минРазработка LLM: сборка, обучение, fine-tuning
Sebastian Raschka. Более медленное прохождение Себастьяна Рашки о том, где fine-tuning сидит в более широком пайплайне обучения LLM — instruction-тюнинг, classification fine-tuning, методы экономии параметров и компромиссы, которые статья перечисляет, прежде чем рекомендовать LoRA. Хорошая калибровка перед стартом, особенно если ваша команда обсуждает, является ли fine-tuning вообще правильным шагом.
Продвинутый
15 минСтоит ли ChatGPT Plus своих денег? Обновлённый обзор на 2025 год
Ryan Doser. Райан проходит по каждой функции, которая реально ограничена тарифом за $20: лимиты использования, продвинутый голосовой режим, ограничения по изображениям и Sora, кастомные GPT, семейство o1 — и сравнивает их с текущими бесплатными альтернативами вроде Claude, Gemini и Perplexity. Просмотров поменьше, потому что тема узкая, но это самое аккуратное актуальное сравнение бок о бок, которое не растворяется в хайпе, — поэтому мы выбрали его, а не более шумные ролики из серии «Plus изменил мою жизнь».
Новичок в ИИ
19 минВсе модели ИИ: разбор
Tina Huang. Чистый тур по текущему ландшафту моделей, разбитому по тирам — флагманы, lite-модели, средний тир, специализированные — с конкретными подсказками, на что хорош каждый тир. Это половина статьи «знай свои варианты, прежде чем маршрутизировать», и Хуанг подаёт связку стоимость-vs-возможности так же, как и статья, не опираясь на хайп вокруг бенчмарков.
Уверенный
9 минRouteLLM достигает 90% качества GPT4o и на 80% дешевле
Matthew Berman. Проходится по статье и коду LMSYS RouteLLM: маленький классификатор сидит перед парой «сильная/слабая модель» и решает, какую вызвать, попадая примерно в 95% качества сильной модели за долю цены. Просмотры под обычным порогом в 100K, но для конкретной ниши «покажи мне реальную маршрутизацию моделей, а не просто сравнения моделей» это самое ясное объяснение на YouTube, и оно напрямую совпадает с секцией статьи про компромисс качество/стоимость.
Уверенный
9 минRAG или fine-tuning
IBM Technology. Более плотный фокус на тех двух техниках, которые команды чаще всего путают. Глубже заходит в свежесть данных, атрибуцию источников и аргумент про скорость на инференсе в пользу дообучения. Стоит посмотреть, если вы именно пытаетесь привести доводы против ненужного проекта по дообучению.
Продвинутый
13 минRAG, fine-tuning или промпт-инжиниринг: оптимизация ИИ-моделей
IBM Technology. Ясный проход по всем трём техникам на доске с соответствующими издержками — латентность извлечения, вычислительные ресурсы на обучение и катастрофическое забывание, ограничения решений только на промптах — и с комбинациями, которые действительно имеют смысл в продакшене. Заключительный пример с юридической ИИ-системой, использующей все три, — это почти в точности аргумент статьи про «когда сочетать».
Продвинутый
131 минКак я использую LLM
Andrej Karpathy. Карпати отводит отдельные главы «помните, какой моделью вы пользуетесь, тарифные уровни» и «рассуждающие модели и когда ими пользоваться», а потом весь оставшийся обзор переключается между ChatGPT, Claude, Gemini, Grok и Perplexity. Это самое близкое к тому, чтобы посмотреть, как шпаргалка из статьи применяется вживую человеком с твёрдыми мнениями о том, когда каждый тариф отрабатывает свои деньги.
Начинающий
17 минНовый самый умный ИИ: тест Claude 3 против Gemini 1.5 и GPT-4
AI Explained. Видео старше статьи (март 2024 года), но полезно своей методикой. Один внимательный рецензент выполняет одни и те же сложные задачи по OCR, теории сознания, следованию инструкциям и математике в трёх передовых моделях и показывает слабые места каждой. Названия моделей устарели, но схема сравнения по-прежнему полезна.
Начинающий
32 минБыстрый сервинг LLM с vLLM и PagedAttention
Anyscale. Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые опирается арифметика статьи. После этого фраза статьи «вам повезёт попасть в 50% утилизации» перестаёт казаться абстрактной.
Продвинутый
19 минВсе модели ИИ: разбор
Tina Huang. Спокойная 19-минутная карта основных семейств моделей — линейка GPT от OpenAI, Claude от Anthropic, Gemini от Google плюс игроки из мира open source — и того, какой тариф внутри каждого семейства заслуживает вашего времени. После того как статья говорит вам «выбери одну и держись её месяц», это видео объясняет, что на самом деле предлагает выпадающее меню внутри этой одной. Честно высказанное мнение без перегиба в горячий тейк.
Новичок в ИИ