Thema

LLM-Anwendungen im Produktivbetrieb

Konzipieren, veröffentlichen, überwachen und betreiben Sie LLM-Anwendungen über die Demophase hinaus.

31 Beiträge (20 Artikel · 11 Videos)

Hier beginnen

Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.

Weitere in diesem Thema

Video

Die Agentenlandschaft – Erkenntnisse aus dem Produktiveinsatz von Agenten

MLOps.community.

Fortgeschritten
11 Min. Lesezeit
Artikel

LangGraph vs. CrewAI vs. direkte API: Das richtige Agenten-Framework im Jahr 2026

Die Landschaft der Agenten-Frameworks ist im Jahr 2026 reifer, aber nicht übersichtlicher. LangGraph, CrewAI, Pydantic AI, OpenAI Agents SDK und direkte APIs eignen sich jeweils für bestimmte Teams und Projekte, jedoch nie für alle. Ein ehrlicher Vergleich und ein Entscheidungsrahmen.

Fortgeschritten
13 Min. Lesezeit
Artikel

Agenten entwickeln, die nicht endlos in Schleifen laufen

Der häufigste Agentenfehler im Produktivbetrieb sind unendliche oder scheinbar unendliche Schleifen — Agenten wiederholen Aktionen, verzweigen sich und verbrauchen Tokens, ohne Fortschritte zu erzielen. Diese Architekturmuster sorgen dafür, dass Agenten selbst schwierige Aufgaben abschließen.

Fortgeschritten
12 Min. Lesezeit
Artikel

Computer-Use- und Browser-Agenten im Produktiveinsatz

Demos von Computer-Use- und Browser-Agenten gehen viral. Produktiveinsätze in großem Maßstab sehen jedoch anders aus: eng begrenzter Umfang, umfassende Schutzmechanismen und sorgfältig gestaltete UX. Dieser Artikel zeigt funktionierende Muster, wiederkehrende Fehler und die tatsächliche Wirtschaftlichkeit.

Fortgeschritten
12 Min. Lesezeit
Artikel

Context Engineering: Kontextfenster mit 1 Mio. Tokens ohne Qualitätsverlust nutzen

Kontextfenster mit 1 Mio. Tokens sind verfügbar, doch die Qualität sinkt lange vor diesem Grenzwert. Context Engineering ist die Disziplin, Kontextfenster wirksam zu nutzen: was aufgenommen, zusammengefasst oder aktuell abgerufen wird und welche Muster die Qualität bei wachsendem Kontext erhalten.

Fortgeschritten
12 Min. Lesezeit
Artikel

Kostenoptimierung bei der Inferenz: Prompt-Caching, Routing und Ausgabesteuerung

Die Kosten für LLM-Inferenz lassen sich mit den richtigen Techniken um 60–90 % reduzieren: durch Prompt-Caching, Modell-Routing, Ausgabesteuerung, Batching und einige weniger bekannte Muster. Entscheidend sind die Zahlen, die Muster und die betriebliche Disziplin, die eine gut geführte Inferenz von ausufernden Rechnungen unterscheiden.

Fortgeschritten
13 Min. Lesezeit
Artikel

Evals erstellen, die tatsächlich Regressionen erkennen

Die meisten Eval-Suites wirken beeindruckend, übersehen aber reale Regressionen. Evals, die relevante Fehler erkennen, erfordern sorgfältig aufgebaute Datensätze, empfindliche Metriken, kalibrierte Judges und eine Kultur des Vertrauens. Diese Muster nutzen Teams, die es richtig machen.

Fortgeschritten
13 Min. Lesezeit
Artikel

Fine-Tuning im Jahr 2026: Wann LoRA RAG übertrifft und wie es ohne Cluster gelingt

LoRA-Fine-Tuning ist inzwischen leicht zugänglich — Sie können ein echtes Fine-Tuning auf einem Laptop durchführen oder stundenweise eine GPU mieten. Bewährte Muster, Anwendungsfälle, in denen Fine-Tuning RAG übertrifft, und ein praktischer End-to-End-Ablauf von der Datenvorbereitung bis zur Bereitstellung.

Fortgeschritten
14 Min. Lesezeit
Artikel

MCP von Grund auf: Einen produktionsreifen Server in TypeScript entwickeln

Ein produktionsreifer Model-Context-Protocol-Server erfordert mehr als die Anbindung einiger Tools. Entscheidend sind Schemadesign, Authentifizierung, Fehlerbehandlung, Streaming, Observability und die betrieblichen Anforderungen, durch die MCP-Server im großen Maßstab zuverlässig nutzbar werden.

Fortgeschritten
12 Min. Lesezeit
Artikel

MCP-Tools so entwerfen, dass LLMs sie zuverlässig verwenden

Die meisten MCP-Tools, die wir sehen, sind technisch korrekt, aber praktisch unbrauchbar. LLMs ignorieren sie, verwenden sie falsch oder rufen sie auf ungeeignete Weise auf. Diese Designprinzipien sorgen dafür, dass LLMs Tools zuverlässig einsetzen – mit konkreten Fehlerbildern und Korrekturen.

Fortgeschritten
12 Min. Lesezeit
Artikel

Langzeitgedächtnis für lang laufende Agenten entwickeln

Agenten benötigen ein Gedächtnis über das Kontextfenster hinaus. Die Langzeitgedächtnis-Architektur — was gespeichert, wann abgerufen und wie vergessen wird — bestimmt, ob ein Agent Sie zu kennen scheint oder jedes Gespräch von vorn beginnt. Die Muster und Kompromisse für den Produktivbetrieb.

Fortgeschritten
10 Min. Lesezeit
Artikel

Multi-Modell-Orchestrierung: Routing nach Kosten, Latenz und Qualität

Ein einziges Modell für alles zu verwenden, ist ein Anfängerfehler. KI-Systeme im Produktivbetrieb leiten unterschiedliche Anfragen an unterschiedliche Modelle weiter und sparen dadurch 60–90 % der Kosten, während sich die Qualität verbessert. Die Muster, die Routing-Logik und die Zielkonflikte.

Mittelstufe
12 Min. Lesezeit
Artikel

Observability für LLM-Anwendungen: Tracing, Kosten, Latenz und Qualitätsdrift

LLM-Anwendungen scheitern auf Arten, die traditionelle Observability übersieht. Entscheidend sind Tracing für mehrstufige Abläufe, die Zuordnung von Kosten, die je Aufruf um den Faktor 100 variieren, das Monitoring von Qualitätsdrift und das Debugging von Halluzinationen im Produktivmaßstab.

Fortgeschritten
12 Min. Lesezeit
Artikel

Produktionsreifes RAG entwickeln: Ingestion, Embedding, Retrieval, Reranking und Evals

Eine produktionsreife RAG-Pipeline umfasst sechs Stufen, deren spezifische Muster die Qualität bestimmen. Architektur, Entscheidungen je Stufe und konsequente iterative Evaluation unterscheiden ein funktionierendes RAG-System von einem enttäuschenden.

Fortgeschritten
14 Min. Lesezeit
Artikel

Prompt Injection und LLM-Sicherheit: Bedrohungsmodelle und mehrschichtige Abwehr

Prompt Injection ist eine dauerhafte Klasse von LLM-Sicherheitsrisiken und kein Fehler beim Formulieren von Prompts. Ein Praxisleitfaden zu Bedrohungsmodellen, Datengrenzen, Werkzeugberechtigungen, Regressionstests, Überwachung und Reaktion auf Sicherheitsvorfälle.

Fortgeschritten
12 Min. Lesezeit
Artikel

Prompting, RAG oder Fine-Tuning wählen — und wann Sie sie kombinieren sollten

Prompting, RAG und Fine-Tuning sind die drei großen Hebel, um große Sprachmodelle an Ihr Problem anzupassen. Jeder eignet sich für bestimmte Probleme und für andere nicht. Ein Entscheidungsrahmen, die realistischen Kosten jedes Ansatzes und erfolgreiche Kombinationsmuster für den Produktivbetrieb.

Fortgeschritten
13 Min. Lesezeit
Artikel

Ein LLM-Produkt auf den Markt bringen: Preisgestaltung, Margen und die Anti-Moat-Falle

LLM-basierte Produkte sind wirtschaftlich anspruchsvoller als traditionelle SaaS-Produkte: variable, mit der Nutzung steigende Kosten, durch Inferenz belastete Margen, Kommoditisierungsrisiken und Wettbewerber mit denselben Basismodellen. So bauen Sie ein tatsächlich verteidigbares Produkt – und vermeiden die Muster, an denen LLM-Start-ups verschwinden.

Fortgeschritten
13 Min. Lesezeit
Artikel

Strukturierte Ausgaben und Function Calling: Muster für den Produktivbetrieb

Strukturierte Ausgaben und Function Calling bilden die Brücke vom „LLM, das Text generiert“ zum „System, das Aufgaben ausführt“. Im Produktivbetrieb zählen robuste Schemata, Fehlerbehandlung, Idempotenz und kontrollierte Degradation – nicht nur der JSON-Modus.

Fortgeschritten
Video

Tiefeneinblick in LLMs wie ChatGPT

Andrej Karpathy.

Fortgeschritten
Video

Andrej Karpathy: Software verändert sich (wieder)

Y Combinator.

Fortgeschritten
Video

LangSmith in 10 Minuten

LangChain.

Fortgeschritten
Video

LLMs instrumentieren und evaluieren

Hamel Husain.

Fortgeschritten
Video

KI-Prompt-Engineering: ein Tiefeneinblick

Anthropic.

Fortgeschritten
Video

Prompting 101 | Programmieren mit Claude

Anthropic.

Fortgeschritten
Video

Vertikale KI-Agenten könnten zehnmal größer werden als SaaS

Y Combinator.

Fortgeschritten
Video

Wie KI Software-Geschäftsmodelle neu erfindet – mit Bret Taylor von Sierra

Sequoia Capital.

Fortgeschritten
Video

OpenAI DevDay 2024 | Strukturierte Ausgaben für zuverlässige Anwendungen

OpenAI.

Fortgeschritten
Video

Pydantic ist alles, was Sie brauchen: Jason Liu

AI Engineer.

Fortgeschritten