Видео к статье

Оптимизация стоимости инференса — видео к статье

Статья рассматривает методы, которые действительно влияют на стоимость работы LLM: кэширование промптов, маршрутизацию моделей, ограничение объёма генерации и пакетную обработку. Два видео объясняют основной механизм кэширования и более широкий набор способов оптимизации с достаточной технической глубиной для анализа рабочей системы.

Основная рекомендация

18:50
Это конец RAG? Новое кеширование промптов от Anthropic

Prompt Engineering

Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против скидки за чтение из кеша — ровно то, что предполагает статья, говоря, когда кеширование окупается.

Что вынести из этого видео: Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против…

Открыть страницу видео

Также стоит посмотреть

56:03
Build Hour: кеширование промптов

OpenAI

Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы оцениваете инженерные усилия для надёжного попадания в кеш на ваших продакшен-промптах.

Что вынести из этого видео: Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы…

Открыть страницу видео