Видео к статье

Оптимизация стоимости инференса — видео к статье

Статья — о небольшом наборе техник, реально двигающих счета за LLM, — prompt caching, маршрутизация моделей, контроль длины вывода, батчинг — и о том, как их сочетать, не сломав по-тихому качество. Выступлений по cost-optimization на YouTube в основном продуктовые демо, но эти два покрывают основной механизм (prompt caching) и полный набор рычагов с достаточной технической глубиной, чтобы быть полезными на продакшен-ревью.

Основная рекомендация

18:50
Is This the End of RAG? Anthropic's NEW Prompt Caching

Prompt Engineering

Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против скидки за чтение из кеша — ровно то, что предполагает статья, говоря, когда кеширование окупается.

Что вынести из этого видео: Проходит prompt caching от Anthropic против context caching от Gemini с конкретными сокращениями латентности и стоимости по сценариям (long-document чат, few-shot, multi-turn). Разбивка надбавки за запись в кеш против…

Открыть страницу видео

Также стоит посмотреть

56:03
Build Hour: Prompt Caching

OpenAI

Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы оцениваете инженерные усилия для надёжного попадания в кеш на ваших продакшен-промптах.

Что вынести из этого видео: Собственный Build Hour OpenAI по prompt caching — порог в 1024 токена, требование стабильности префикса, кеширование аудио с 99% скидкой для realtime, влияние на time-to-first-token на длинных вводах. Полезно, когда вы…

Открыть страницу видео