Begleitvideos

Kostenoptimierung bei der Inferenz (Begleitvideos)

Der Artikel behandelt die wenigen Maßnahmen, die LLM-Kosten tatsächlich spürbar verändern: Prompt-Caching, Modell-Routing, Begrenzung der Ausgabelänge und Batchverarbeitung. Er zeigt außerdem, wie sie sich kombinieren lassen, ohne die Qualität unbemerkt zu verschlechtern. Die meisten YouTube-Vorträge zur Kostenoptimierung sind Produktdemos. Diese beiden Videos erklären jedoch sowohl den zentralen Mechanismus des Prompt-Cachings als auch das vollständige Instrumentarium mit ausreichender technischer Tiefe für eine Produktionsprüfung.

Hauptauswahl

18:50
Ist das das Ende von RAG? Anthropics NEUES Prompt-Caching

Prompt Engineering

Das Video vergleicht Anthropics Prompt-Caching mit Geminis Context Caching und zeigt konkrete Latenz- und Kostensenkungen für Chats mit langen Dokumenten, Few-Shot- und Multi-Turn-Anwendungen. Die Gegenüberstellung des Aufpreises für Cache-Schreibvorgänge und des Rabatts für Cache-Lesevorgänge entspricht genau der Annahme des Artikels dazu, wann sich Caching auszahlt.

Was Sie aus diesem Video mitnehmen sollten: Abschätzen, wann sich Prompt-Caching für reale Workloads lohnt, indem Schreibaufschläge und Einsparungen beim Lesen gegeneinander abgewogen werden.

Das sollten Sie zuerst ansehen oder wissen: Grundlegendes Wissen über die Preise der LLM-API und Workloads mit langen Prompts.

Hinweis von AI Expert: Das Video wurde im August 2024, also mit inzwischen veralteten Modellnamen und Tokenpreisen, aufgezeichnet. Der Mechanismus aus Schreibaufschlag und Leserabatt gilt weiterhin. Prüfen Sie die aktuellen Preisseiten der Anbieter, bevor Sie Ihre Workloads kalkulieren.

Videoseite öffnen

Auch sehenswert

56:03
Build Hour: Prompt-Caching

OpenAI

OpenAIs eigene Build Hour zum Prompt-Caching behandelt die Schwelle von 1024 Tokens, die erforderliche Stabilität des Präfixes, hohe Rabatte für Echtzeit-Audio-Caching, deren genauen Satz Sie auf der aktuellen Preisseite finden, und die Auswirkung langer Eingaben auf die Zeit bis zum ersten Token. Das ist nützlich, wenn Sie den technischen Aufwand abschätzen, um den Cache mit produktiven Prompts zuverlässig zu treffen.

Was Sie aus diesem Video mitnehmen sollten: Prompt-Caching nur einsetzen, wenn stabile Präfixe sowie Latenz- und Kostenverhalten zum Workload passen.

Das sollten Sie zuerst ansehen oder wissen: Sie sollten bereits Prompts über die OpenAI-API bereitstellen. Die Sitzung dreht sich darum, den Cache in der Produktion zuverlässig zu treffen.

Hinweis von AI Expert: Das Video liegt deutlich unter unserer Aufrufschwelle, ist aber die offizielle ausführliche Darstellung. Die Schwelle von 1024 Tokens und die Regeln zur Präfixstabilität entscheiden, ob Caching überhaupt funktioniert; aktuelle Preise stehen auf der Preisseite.

Videoseite öffnen