Видео к статье

Самостоятельное размещение или управляемый инференс — видео к статье

Статья разбирает расчёт точки безубыточности между API-провайдером и самостоятельно размещёнными vLLM или TGI: загрузку оборудования, память KV-кэша, стоимость GPU и эксплуатационные расходы. Выступление авторов vLLM объясняет, почему производительность сервера инференса существенно влияет на эту модель.

Основная рекомендация

32:07
Быстрый сервинг LLM с vLLM и PagedAttention

Anyscale

Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые опирается арифметика статьи. После этого фраза статьи «вам повезёт попасть в 50% утилизации» перестаёт казаться абстрактной.

Что вынести из этого видео: Проходит, почему наивный LLM-serving тратит впустую 60–80% памяти GPU, как PagedAttention заимствует пейджинг в стиле OS, чтобы это починить, и почему continuous batching даёт те самые 24× по throughput, на которые…

Что посмотреть или знать заранее: Полезно понимать API, автоматизации, RAG или базовую архитектуру агентов.

Заметка AI Expert: Названия моделей, цены и возможности быстро меняются. Используйте видео для понимания принципа выбора, затем проверьте актуальное поведение модели перед внедрением.

Открыть страницу видео