Тема

Выбор моделей и инструментов

Как выбирать между ChatGPT, Claude, Gemini, Copilot, моделями с углублённым рассуждением, облачным и локальным запуском.

27 материалов (12 статей · 15 видео)

Начните здесь

Несколько хороших первых материалов перед полной лентой.

6 мин чтения
Статья

ChatGPT, Claude, Gemini, Copilot — что выбрать новичку?

Четыре мейнстримных ИИ-ассистента, разобранные простым языком. Нетехническое руководство по выбору первого ИИ — исходя из того, чем вы уже пользуетесь и чего на самом деле хотите.

Новичок в ИИ
7 мин чтения
Статья

Выбор модели под задачу: шпаргалка на 2026 год

Какую модель выбирать для разных типов задач. GPT, Claude, Gemini, режимы рассуждения и модели с открытыми весами: правила выбора и примеры середины 2026 года вместо вечного рейтинга.

Начинающий
10 мин чтения
Статья

Оркестрация нескольких моделей: маршрутизация по стоимости, задержке и качеству

Маршрутизация различных задач на разные модели может снизить затраты или задержки, но только оценка, специфичная для рабочей нагрузки, покажет, окупается ли добавленная сложность. Паттерны, измерения и режимы сбоев.

Уверенный

Еще по этой теме

13 мин чтения
Статья

Стек LLM в 2026 году: модели, инференс, инструменты и компромиссы

Взгляд практикующего архитектора на стек LLM в 2026 году — уровни моделей, провайдеры инференса, слои оркестрации, инструменты для оценки и компромиссы, которые действительно имеют значение, когда вы запускаете ИИ в продакшен. Всё, что вы хотели бы услышать до того, как начали.

Продвинутый
10 мин чтения
Статья

Chain-of-thought, self-critique, tree-of-thoughts — когда что использовать

Три способа организовать рассуждение модели на сложных задачах и компромиссы между качеством, стоимостью и задержкой. Конкретные промпты, сравнения и ограничения современных моделей с углублённым рассуждением.

Уверенный
12 мин чтения
Статья

Оптимизация стоимости инференса: кэширование промптов, маршрутизация и объём генерации

Постройте модель затрат на результат на основе трассировки, оптимизируйте крупнейших измеренных участников и докажите, что каждое изменение сохраняет качество задачи.

Продвинутый
13 мин чтения
Статья

Дообучение в 2026 году: эксперимент с LoRA и QLoRA и измеримыми результатами

Решите, оправдано ли параметрически эффективное дообучение, управляйте данными, зафиксируйте воспроизводимый эксперимент, сравните результаты на отложенных выборках и тестах безопасности, а также проведите бенчмарки обслуживания перед развертыванием.

Продвинутый
6 мин чтения
Статья

Бесплатный или платный ChatGPT: что меняется после перехода на платный тариф

Сравнение бесплатного ChatGPT, ChatGPT Plus и ChatGPT Pro без жаргона: что меняется при переходе на платный тариф и как понять, действительно ли он вам нужен.

Новичок в ИИ
10 мин чтения
Статья

Локальный ИИ на вашем Mac: Ollama, LM Studio и что реально умеют 7B-модели

Локальный ИИ повзрослел. С Ollama или LM Studio и современным Mac можно запускать способные модели офлайн, бесплатно и приватно. Что работает, что нет и в каких сценариях это действительно даёт выигрыш.

Уверенный
10 мин чтения
Статья

Выбор и промптинг рассуждающих моделей

Настройки рассуждений влияют на качество, задержку, стоимость и иногда на подход к промптингу. Практическое руководство по их выбору на основе оценок, а не общепринятых представлений.

Уверенный
12 мин чтения
Статья

Выбор между промптингом, RAG и файнтюнингом (и когда их сочетать)

Промптинг, RAG и дообучение — три основных способа адаптировать LLM к задаче. Каждый решает свой тип проблем. В статье — схема выбора, полная стоимость и условия, при которых сочетание методов оправдано.

Продвинутый
11 мин чтения
Статья

Самостоятельное размещение или управляемый инференс: модель точки безубыточности

При каком масштабе самостоятельное размещение становится выгоднее API? Расчёты, эксплуатационные затраты и признаки, по которым можно выбрать между своей инфраструктурой и управляемым инференсом.

Продвинутый
211 мин
Видео

Глубокое погружение в LLM вроде ChatGPT

Andrej Karpathy. Самое понятное исчерпывающее объяснение на YouTube того, чем на самом деле является LLM — предобучение, токенизация, SFT, RLHF, reasoning RL, использование инструментов, галлюцинации — на уровне детализации, который нужен инженеру, чтобы рассуждать о компромиссах между моделями. Посмотрите его один раз — и выбор из статьи «модель GPT-класса против модели с открытыми весами против рассуждающей модели» перестанет казаться выбором бренда и начнёт выглядеть как выбор рецептов обучения.

Продвинутый
40 мин
Видео

Andrej Karpathy: программное обеспечение меняется (снова)

Y Combinator. Программное выступление Карпатого на AI Startup School описывает LLM как новый класс компьютеров — коммунальная услуга, чип-фабрика и операционная система в одном лице — и обосновывает «частично автономные» продукты с поводком под контролем человека. Это самая чёткая формулировка той ментальной модели стека, которую предполагает статья: вы выбираете поставщиков инференса и инструменты под программируемую основу, а не под чат-бота.

Продвинутый
19 мин
Видео

Это конец RAG? Новое кеширование промптов от Anthropic

Prompt Engineering. Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против скидки за чтение из кеша — ровно то, что предполагает статья, говоря, когда кеширование окупается.

Продвинутый
56 мин
Видео

Build Hour: кеширование промптов

OpenAI. Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы оцениваете инженерные усилия для надёжного попадания в кеш на ваших продакшен-промптах.

Продвинутый
157 мин
Видео

Fine-tuning LLM-моделей — курс по генеративному ИИ

freeCodeCamp.org. Длинный курс «сначала теория, потом код», покрывающий квантизацию, LoRA, QLoRA и полный PEFT на Llama 2 и Gemma — на железе, которое реально есть у большинства разработчиков. Это самое близкое к опыту «постой рядом с тем, кто это уже делал» на YouTube, и оно совпадает с тезисом статьи «кластер вам не нужен» с конкретными бюджетами по VRAM.

Продвинутый
59 мин
Видео

Разработка LLM: сборка, обучение, fine-tuning

Sebastian Raschka. Более медленное прохождение Себастьяна Рашки о том, где fine-tuning сидит в более широком пайплайне обучения LLM — instruction-тюнинг, classification fine-tuning, методы экономии параметров и компромиссы, которые статья перечисляет, прежде чем рекомендовать LoRA. Хорошая калибровка перед стартом, особенно если ваша команда обсуждает, является ли fine-tuning вообще правильным шагом.

Продвинутый
15 мин
Видео

Стоит ли ChatGPT Plus своих денег? Обновлённый обзор на 2025 год

Ryan Doser. Райан проходит по каждой функции, которая реально ограничена тарифом за $20: лимиты использования, продвинутый голосовой режим, ограничения по изображениям и Sora, кастомные GPT, семейство o1 — и сравнивает их с текущими бесплатными альтернативами вроде Claude, Gemini и Perplexity. Просмотров поменьше, потому что тема узкая, но это самое аккуратное актуальное сравнение бок о бок, которое не растворяется в хайпе, — поэтому мы выбрали его, а не более шумные ролики из серии «Plus изменил мою жизнь».

Новичок в ИИ
19 мин
Видео

Все модели ИИ: разбор

Tina Huang. Чистый тур по текущему ландшафту моделей, разбитому по тирам — флагманы, lite-модели, средний тир, специализированные — с конкретными подсказками, на что хорош каждый тир. Это половина статьи «знай свои варианты, прежде чем маршрутизировать», и Хуанг подаёт связку стоимость-vs-возможности так же, как и статья, не опираясь на хайп вокруг бенчмарков.

Уверенный
9 мин
Видео

RouteLLM достигает 90% качества GPT4o и на 80% дешевле

Matthew Berman. Проходится по статье и коду LMSYS RouteLLM: маленький классификатор сидит перед парой «сильная/слабая модель» и решает, какую вызвать, попадая примерно в 95% качества сильной модели за долю цены. Просмотры под обычным порогом в 100K, но для конкретной ниши «покажи мне реальную маршрутизацию моделей, а не просто сравнения моделей» это самое ясное объяснение на YouTube, и оно напрямую совпадает с секцией статьи про компромисс качество/стоимость.

Уверенный
9 мин
Видео

RAG или fine-tuning

IBM Technology. Более плотный фокус на тех двух техниках, которые команды чаще всего путают. Глубже заходит в свежесть данных, атрибуцию источников и аргумент про скорость на инференсе в пользу дообучения. Стоит посмотреть, если вы именно пытаетесь привести доводы против ненужного проекта по дообучению.

Продвинутый
13 мин
Видео

RAG, fine-tuning или промпт-инжиниринг: оптимизация ИИ-моделей

IBM Technology. Ясный проход по всем трём техникам на доске с соответствующими издержками — латентность извлечения, вычислительные ресурсы на обучение и катастрофическое забывание, ограничения решений только на промптах — и с комбинациями, которые действительно имеют смысл в продакшене. Заключительный пример с юридической ИИ-системой, использующей все три, — это почти в точности аргумент статьи про «когда сочетать».

Продвинутый
131 мин
Видео

Как я использую LLM

Andrej Karpathy. Карпати отводит отдельные главы «помните, какой моделью вы пользуетесь, тарифные уровни» и «рассуждающие модели и когда ими пользоваться», а потом весь оставшийся обзор переключается между ChatGPT, Claude, Gemini, Grok и Perplexity. Это самое близкое к тому, чтобы посмотреть, как шпаргалка из статьи применяется вживую человеком с твёрдыми мнениями о том, когда каждый тариф отрабатывает свои деньги.

Начинающий
17 мин
Видео

Новый самый умный ИИ: тест Claude 3 против Gemini 1.5 и GPT-4

AI Explained. Видео старше статьи (март 2024 года), но полезно своей методикой. Один внимательный рецензент выполняет одни и те же сложные задачи по OCR, теории сознания, следованию инструкциям и математике в трёх передовых моделях и показывает слабые места каждой. Названия моделей устарели, но схема сравнения по-прежнему полезна.

Начинающий
32 мин
Видео

Быстрый сервинг LLM с vLLM и PagedAttention

Anyscale. Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые опирается арифметика статьи. После этого фраза статьи «вам повезёт попасть в 50% утилизации» перестаёт казаться абстрактной.

Продвинутый
19 мин
Видео

Все модели ИИ: разбор

Tina Huang. Спокойная 19-минутная карта основных семейств моделей — линейка GPT от OpenAI, Claude от Anthropic, Gemini от Google плюс игроки из мира open source — и того, какой тариф внутри каждого семейства заслуживает вашего времени. После того как статья говорит вам «выбери одну и держись её месяц», это видео объясняет, что на самом деле предлагает выпадающее меню внутри этой одной. Честно высказанное мнение без перегиба в горячий тейк.

Новичок в ИИ