Видео к статье

Self-hosted vs hosted инференс — видео к статье

Статья прорабатывает реальную арифметику точки безубыточности между API-провайдерами и self-hosted vLLM/TGI — утилизация, память KV-кеша, экономика GPU, оверхед on-call — и пытается убить карго-культовую версию «мы сэкономим, если будем хостить сами». Собственное выступление авторов vLLM — самый чистый технический фундамент под то, почему serving-движок вообще имеет значение.

Основная рекомендация

32:07
Fast LLM Serving with vLLM and PagedAttention

Anyscale

Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые опирается арифметика статьи. После этого фраза статьи «вам повезёт попасть в 50% утилизации» перестаёт казаться абстрактной.

Что вынести из этого видео: Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые…

Что посмотреть или знать заранее: Полезно понимать API, автоматизации, RAG или базовую архитектуру агентов.

Заметка AI Expert: Названия моделей, цены и возможности быстро меняются. Используйте видео для понимания принципа выбора, затем проверьте актуальное поведение модели перед внедрением.

Открыть страницу видео