Gedächtnis für lang laufende Agenten entwickeln
Fortgeschritten12 Min. LesezeitAutomatisierungen

Gedächtnis für lang laufende Agenten entwickeln

Lang laufende Agenten benötigen ein eigenes Persistenzkonzept: Herkunft, Bestätigung, Mandantenisolierung, Abruftests, Aufbewahrungsdauer, Korrektur und nachweisbare Löschung.

Das sollten Sie danach können

Behandeln Sie das Gedächtnis eines Agenten als Nutzerdaten, nicht als Intuition des Modells. Jeder gespeicherte Eintrag benötigt eine dokumentierte Herkunft, einen Geltungsbereich, Regeln für den Lebenszyklus, Korrekturmöglichkeiten und eine nachweislich vollständige Löschung.

Nur in diesem Browser gespeichert.
In diesem Artikel

Ein Agent ohne sitzungsübergreifende Persistenz beginnt jede Sitzung mit dem Kontext, der ihm bereitgestellt wird. Persistenz kann wiederholte Einweisungen vermeiden, bringt aber auch Pflichten in Bezug auf Datenschutz, Genauigkeit, Trennung und Löschung mit sich.

Das ist die Herausforderung des Agentengedächtnisses. Das Kontextfenster verarbeitet die aktuelle Unterhaltung. Ein Langzeitgedächtnis über Sitzungen, Tage oder Monate hinweg erfordert eine eigene Architektur und ist anspruchsvoller, als es zunächst wirkt.

Dieser Artikel beschreibt ein Referenzdesign zum Testen, keine zertifizierte Implementierung. Produktteams müssen Zugriffskontrollen, Korrektur, Aufbewahrungsdauer, Löschung, Wiederherstellung und Abrufqualität im eigenen System prüfen.

Was „Gedächtnis“ bedeutet

Vereinfacht gesagt bedeutet Gedächtnis: „Das Modell erinnert sich über mehrere Unterhaltungen hinweg an Dinge.“ In der Praxis ist es differenzierter. Die Kognitionswissenschaft unterscheidet verschiedene Gedächtnistypen, und auch die Gedächtnisarchitektur von KI-Agenten profitiert von einer solchen Trennung:

Arbeitsgedächtnis. Die aktuelle Unterhaltung. Sie befindet sich im Kontextfenster und geht verloren, wenn die Unterhaltung endet, sofern sie nicht dauerhaft gespeichert wird.

Episodisches Gedächtnis. Spezifische vergangene Ereignisse. „Am letzten Dienstag haben wir über X gesprochen.“ „Vor drei Monaten haben Sie Y entschieden.“

Semantisches Gedächtnis. Allgemeine Fakten. „Ihr Name ist Alice.“ „Sie bevorzugen knappe Antworten.“ „Ihr Unternehmen hat seinen Sitz in Tallinn.“

Prozedurales Gedächtnis. Wie man Dinge tut. „Wenn der Nutzer nach einem Meeting fragt, verwenden Sie diese Vorlage.“ „Wenn sich der Kunde in Stufe X befindet, folgen Sie Prozess Y.“

Die Gedächtnistypen erfüllen unterschiedliche Funktionen. Nutzen Sie nur die Ebenen, die sich für das Produkt begründen und zuverlässig betreiben lassen. Mehr zu speichern ist nicht automatisch besser.

Was das Gedächtnis leisten sollte

Vor der Architektur stehen die Ziele:

Kontinuität. Der Agent setzt dort fort, wo er aufgehört hat. Sie müssen sich nicht in jeder Sitzung neu vorstellen.

Personalisierung. Der Agent berücksichtigt Ihre Präferenzen, ohne dass Sie jedes Mal darum bitten müssen. Er schreibt in Ihrem Stil, nutzt Ihre Tools und bezieht Ihr Team ein.

Kontextbewahrung. Entscheidungen aus früheren Unterhaltungen fließen in aktuelle ein. Das System sollte sich beispielsweise daran erinnern können, dass „wir letzten Monat X entschieden haben“.

Wiederverwendung bestätigter Präferenzen. Das System kann eine explizite oder verifizierte Präferenz in den Geltungsbereichen, für die sie gültig ist, erneut anwenden. Wiederholung allein beweist nicht, dass ein Tool, eine Sprache oder ein Verhalten zum Standard werden sollte.

Datenschutz und Vergessen. Was gespeichert wird, was nicht und was gelöscht wird. Das ist sowohl für das Vertrauen der Nutzer als auch für die Einhaltung rechtlicher Vorgaben relevant.

Diese Ziele können miteinander in Konflikt stehen. Kontinuität kann von gezielter Persistenz profitieren, während Datenschutz und Genauigkeit für Datenminimierung, Zweckbindung, Korrektur und Löschung sprechen. Die Architektur muss diese Abwägungen ausdrücklich abbilden.

Die Architektur

Eine typische Architektur mit mehreren Ebenen:

┌───────────────────────────────────────┐
│ Arbeitsgedächtnis (im Kontext)        │  Aktuelle Konversation
├───────────────────────────────────────┤
│ Sitzungsgedächtnis (aktuell)          │  Letzte N Konversationen
├───────────────────────────────────────┤
│ Episodisches Gedächtnis (langfristig) │  Spezifische vergangene Ereignisse
├───────────────────────────────────────┤
│ Semantisches Gedächtnis (Fakten)      │  Stabile Nutzerfakten
├───────────────────────────────────────┤
│ Prozedurales Gedächtnis (Präferenzen) │  Verhalten für diesen Nutzer
└───────────────────────────────────────┘

Für jede Ebene müssen Speicherung, Abruf, Zugriff, Herkunft, Korrektur, Aufbewahrungsdauer und Löschverhalten ausdrücklich festgelegt sein. Mehrere logische Ebenen können denselben physischen Speicher nutzen.

Im Folgenden betrachten wir jede Ebene im Detail.

Ebene 1: Arbeitsgedächtnis

Das Arbeitsgedächtnis wurde bereits in Kontext-Engineering behandelt: die aktuelle Unterhaltung im Kontextfenster. Bei Unterhaltungen über mehrere Runden bietet sich ein gestaffelter Kontext an, der die jüngsten Beiträge wörtlich und ältere Beiträge zusammengefasst enthält.

Die Übergabe an das Langzeitgedächtnis kann an einem ausdrücklichen Checkpoint, bei einem dauerhaften Ereignis oder am Sitzungsende erfolgen. Da Sitzungen abrupt enden können, sollten Sie nur freigegebene Kandidaten dauerhaft speichern und den Schreibstatus sichtbar machen. Verlassen Sie sich nicht darauf, dass ein Hook am Sitzungsende immer ausgeführt wird.

Ebene 2: Sitzungsgedächtnis

Zusammenfassungen kürzlich abgeschlossener Sitzungen können in begrenzter Detailtiefe gespeichert werden, wenn das Produkt dafür einen begründeten Zweck hat. Eine Angabe wie „die letzten zehn Unterhaltungen“ ist lediglich ein Beispiel für eine Richtlinienvorgabe, kein Standardwert.

Implementierung: Speichern Sie je Sitzung eine Zusammenfassung mit Zeitstempel und Thema. Kehrt der Nutzer zurück, kann der Agent schnell nachvollziehen, was zuletzt geschehen ist.

{
  "session_id": "abc-123",
  "user_id": "alice",
  "started": "2026-05-14T10:30:00Z",
  "ended": "2026-05-14T10:45:00Z",
  "topic": "Drafting proposal for Acme Corp",
  "summary": "Drafted v1 of the Acme proposal. Decided to lead with the cost-savings angle. Alice will review and send Friday.",
  "facts_learned": ["Acme is a current customer", "Alice's deadline is Friday"],
  "open_items": ["Alice to review v1 by Thursday"]
}

Bei einer neuen Sitzung kann nach Tests zu Abrufqualität, Relevanz, Token-Budget und Datenschutz eine autorisierte Auswahl der jüngsten Zusammenfassungen geladen werden. Laden Sie nicht standardmäßig eine feste Anzahl automatisch in jeden Kontext.

Dies ist eine vergleichsweise einfache Form des sitzungsübergreifenden Gedächtnisses. Sie erfordert dennoch Trennung, Herkunftsnachweis, Korrektur, Lebenszyklusmanagement und Abruftests.

Ebene 3: Episodisches Gedächtnis

Bestimmte vergangene Ereignisse, die längerfristig relevant bleiben: Entscheidungen, Meilensteine und wichtige Unterhaltungen.

Solche Ereignisse werden aus Sitzungen extrahiert, wenn sie bedeutsam sind, und mit aussagekräftigen Metadaten gespeichert.

{
  "event_id": "ev-456",
  "user_id": "alice",
  "date": "2026-04-22",
  "type": "decision",
  "description": "Alice decided to migrate from Postgres to ClickHouse for the analytics workload, citing query performance.",
  "context_summary": "After 3 weeks of evaluation including performance tests and cost analysis.",
  "related_topics": ["infrastructure", "analytics", "database"],
  "importance": "high"
}

Abruf: Sind frühere Ereignisse für die aktuelle Unterhaltung relevant, ruft der Agent sie über semantische Suche, Themenabgleich oder zeitliche Abfragen wie „Was ist letzten Monat passiert?“ ab. Bei der semantischen Suche wird die aktuelle Anfrage eingebettet und mit passenden Episoden verglichen.

Die Herausforderung besteht darin, zu entscheiden, was als speicherwürdige Episode gilt. Ein mögliches Muster: An einem freigegebenen Checkpoint schlägt ein Modell Entscheidungen, Zusagen oder Meilensteine vor und nennt dazu die Quellpassagen und Bestätigungsregeln. Eine vom Modell vergebene Wichtigkeitsstufe ist keine Berechtigung, personenbezogene Daten zu speichern.

Ebene 4: Semantisches Gedächtnis

Stabile Fakten über den Nutzer, die jederzeit verfügbar sein sollen. Beispiele: „Alice ist CEO von Acme. Sie bevorzugt einen knappen Kommunikationsstil. Ihre Zeitzone ist Europe/Tallinn.“

Solche Fakten sind weniger umfangreich als episodische Erinnerungen, werden aber häufiger abgerufen. Sie bilden das „Modell des Nutzers“ innerhalb des Agenten.

Implementierung: Ein strukturiertes Profil.

{
  "user_id": "alice",
  "profile": {
    "name": "Alice Tamm",
    "role": "CEO at Acme Corp",
    "location": "Tallinn, Estonia",
    "timezone": "Europe/Tallinn",
    "preferred_language": "English",
    "communication_style": "concise, direct, no preamble",
    "expertise_areas": ["product strategy", "go-to-market"],
    "tools_used": ["Notion", "Slack", "Linear"]
  }
}

Aktualisierungen erfolgen, wenn der Agent neue Fakten erfasst. Nach einer Sitzung kann ein LLM neue stabile Fakten erkennen und vorschlagen. Sie werden entweder automatisch zusammengeführt oder zur Prüfung vorgemerkt.

Semantische Fakten sollten mit hoher Sicherheit zutreffen und stabil sein. Ein beiläufiger Kommentar wie „Ich könnte Python ausprobieren“ darf nicht zum semantischen Fakt „Alice bevorzugt Python“ werden. Dafür muss die Schwelle höher liegen.

Ein rein beispielhafter Workflow für Vertrauensstufen, der weiterhin Herkunftsnachweis und Kalibrierung erfordert:

  • Einmal abgeleitet: nur ein Kandidat, mit Quellpassage und ohne automatische Wirkung auf das Verhalten.
  • Explizit angegeben: Kandidat für den angegebenen Geltungsbereich; vor folgenreicher Wiederverwendung bestätigen.
  • Explizit bestätigt: Gespeichert mit Herkunftsnachweis, Geltungsbereich, Überprüfungsdatum und Nutzerkontrollen.

Dies verhindert, dass der Agent falsche Fakten aus beiläufigen Kommentaren „lernt“.

Ebene 5: Prozedurales Gedächtnis

Wie sich der Agent für diesen Nutzer verhalten sollte. Workflows, Vorlagen, Präferenzen für spezifische Aktionen.

Beispiele:

{
  "user_id": "alice",
  "procedural": {
    "email_signature": "...",
    "meeting_preferences": "always offer 3 time slots, never schedule before 9am",
    "code_style": "Python, type hints required, dataclasses over dicts",
    "tone_for_clients": "warm, direct, with explicit next steps",
    "approval_process": "all customer-facing communications need Alice's review before sending"
  }
}

Dies sind Muster, die der Agent befolgt, wenn relevante Aufgaben auftreten.

Updates können von einer expliziten Anweisung oder einem wiederholten Muster ausgehen. Wiederholtes Verhalten kann eine Bestätigungsanfrage auslösen, sollte jedoch nicht stillschweigend ein dauerhaftes Verfahren erstellen.

Wahl des Speichers

Wo liegt das Gedächtnis?

SQL-Datenbank. Zuverlässig, abfragbar und allgemein gut verstanden. Jeder Gedächtnistyp erhält eine Tabelle; Verknüpfungen unterstützen den Abruf. Das eignet sich für strukturierte Zugriffsmuster.

Vektordatenbank. Für den semantischen Abruf von Episoden, etwa „Erinnerungen zu diesem Thema finden“. Die Episoden werden eingebettet und nach Ähnlichkeit abgerufen.

Kombination. SQL mit einem Vektorindex kommt infrage, wenn sowohl strukturierter als auch semantischer Zugriff erforderlich ist. Die doppelte Repräsentation erhöht den Aufwand für Synchronisierung und Löschung. Vergleichen Sie sie in einem Benchmark mit einem einfacheren Speicher.

Spezialisierte Gedächtnis-Tools. Mem0, Letta (ehemals MemGPT) und Zep sind speziell für Agenten entwickelte Gedächtnisschichten. Sie sind eine Überlegung wert, wenn Sie eine höhere Abstraktionsebene benötigen.

Beginnen Sie mit dem kleinsten Speicher, der die Anforderungen an strukturierten Zugriff, semantischen Abruf, Mandantenisolierung, Herkunftsnachweis, Korrektur, Aufbewahrungsdauer, Löschung, Backups und Wiederherstellungstests erfüllt. SQL, ein Vektorindex, eine Kombination oder eine spezialisierte Schicht können geeignet sein. Vergleichen Sie den Betriebs- und Migrationsaufwand, statt von einem vermeintlichen Teamstandard auszugehen.

Abrufmuster

Wie bringt der Agent Gedächtnisinhalte in den Kontext?

Muster 1: Automatisches Laden beim Sitzungsstart

Wenn eine neue Sitzung beginnt, automatisch Folgendes laden:

  • Das semantische Profil des Nutzers.
  • Die letzten N Sitzungszusammenfassungen.
  • Offene Verpflichtungen oder Follow-ups.

Dies ist der Grundkontext, der dem Agenten beim Start der Nutzersitzung zur Verfügung steht.

Muster 2: Abfragegesteuerter Abruf

Wenn die Nachricht des Nutzers auf frühere Themen hindeutet, ruft das System relevante Episoden ab.

Beispiel: Der Nutzer fragt „Was war das Ergebnis unserer Datenbankdiskussion?“ Der Agent sucht in den Episoden nach „Datenbank“ und ruft die relevante ab.

Implementierung: Betten Sie die Nachricht des Nutzers ein, suchen Sie ähnliche Episoden und nehmen Sie sie in den Kontext auf.

Muster 3: Explizite Gedächtnis-Tools

Der Agent verfügt über Tools zum Abfragen des Gedächtnisses:

  • search_episodes(query): Spezifische vergangene Ereignisse finden.
  • get_user_profile(): Das semantische Profil abrufen.
  • list_open_items(): Ausstehende Verpflichtungen.

Der Agent entscheidet anhand der Unterhaltung, wann er diese Tools aufruft.

Muster 4: Gedächtnispflege im Hintergrund

Ein Hintergrundprozess prüft regelmäßig das Gedächtnis und:

  • Konsolidiert verwandte Episoden zu Themen.
  • Aktualisiert die Vertrauenswerte von Fakten.
  • Verringert das Gewicht alter Erinnerungen, auf die nicht zugegriffen wurde.

Diese „Gedächtnispflege“ soll den Speicher langfristig nutzbar halten.

Schreiben ins Gedächtnis

Wann wird ins Gedächtnis geschrieben?

Extraktion am Checkpoint oder Sitzungsende

Dieses Batch-Muster setzt Tests für zuverlässige Zustellung und abrupte Beendigung voraus. An einem freigegebenen Checkpoint oder am Sitzungsende:

  1. Ein LLM analysiert die Unterhaltung.
  2. Extrahiert:
    • Sitzungszusammenfassung.
    • Bemerkenswerte Ereignisse (für das episodische Gedächtnis).
    • Neue Fakten (für das semantische Gedächtnis).
    • Präferenzsignale (für das prozedurale Gedächtnis).
  3. Aktualisiert und speichert.

Batch-Verarbeitung kann die Arbeit während der Sitzung verringern. Sie kann jedoch Aktualisierungen verlieren, wenn eine Sitzung unerwartet endet, und Korrekturen verzögern. Messen Sie beide Effekte und verwenden Sie einen dauerhaften Job, wenn die Speicherung zuverlässig erfolgen muss.

Prompt für die Extraktion:

Analysieren Sie dieses Gespräch. Geben Sie JSON mit folgenden Feldern aus:

1. summary: Zusammenfassung in 2–3 Sätzen, was geschehen ist.
2. notable_events: Array signifikanter Ereignisse, die es wert sind, erinnert zu werden (getroffene Entscheidungen, Meilensteine, wichtiger Kontext).
3. new_facts: Array stabiler Fakten über den Nutzer, die gelernt wurden (nur aufnehmen, wenn Sie sich sehr sicher sind).
4. preference_signals: Array beobachteter Präferenzen (nur falls klar ausgedrückt oder wiederholt).
5. open_items: Array offener Punkte, die der Nutzer möglicherweise erneut bearbeiten möchte.

Seien Sie zurückhaltend. Nehmen Sie nur Elemente auf, bei denen Sie sich sehr sicher sind. Es ist besser, etwas zu übersehen, als etwas zu erfinden.

Echtzeit-Updates für wertvolle Fakten

Bei einigen Fakten ist es falsch, bis zum Sitzungsende zu warten. Wenn ein Nutzer sagt: „Eigentlich heiße ich Alex, nicht Alice“, sollte die Korrektur sofort übernommen werden.

Ein Muster: Den Agenten explizite Korrekturen oder wichtige neue Fakten in Echtzeit erkennen zu lassen und das Gedächtnis inline zu aktualisieren.

Dies erfordert ein sorgfältiges Design, denn das LLM könnte falsche Fakten „lernen“. Einige Teams verlangen eine Bestätigung durch den Nutzer, bevor Aktualisierungen in Echtzeit übernommen werden.

Vom Nutzer initiierte Updates

Der Nutzer kann dem Agenten explizit mitteilen, was er sich merken soll:

  • „Bitte merken Sie sich, dass ich X bevorzuge.“
  • „Vergessen Sie, was ich über Y gesagt habe.“
  • „Machen Sie immer Z.“

Diese Funktionen sollten vollwertige Bedienelemente sein. Starten Sie die angeforderte Aktion sofort, zeigen Sie ihren Geltungsbereich und Status an und erklären Sie gesetzliche Aufbewahrungspflichten oder Ablaufzeiten von Backups, die eine sofortige vollständige Löschung verhindern. Eine ausdrückliche Aussage ist ein starker Herkunftsnachweis, aber kein Beleg dafür, dass jeder daraus abgeleitete Geltungsbereich stimmt.

Ein spezifisches Tool, das der Agent anbieten kann:

remember(content: string, type: "fact" | "preference" | "procedure")
forget(content: string)
list_what_you_remember()

Solche Kontrollmöglichkeiten stärken das Vertrauen der Nutzer.

Vergessen und Verfall

Ein unbegrenztes Gedächtnis erzeugt Risiken für Abruf, Kosten, Datenschutz und Genauigkeit. Ein dokumentierter Lebenszyklus ist unerlässlich; zeitbasierter Verfall ist eine Option, kein Ersatz für erforderliche Aufbewahrung oder Löschung.

Zeitbasierter Verfall

Ältere Erinnerungen werden mit geringerer Wahrscheinlichkeit abgerufen. Implementierung:

  • Bewertung des Abrufs nach relevance * recency_decay.
  • Alte Erinnerungen werden praktisch nicht mehr berücksichtigt, sofern niemand ausdrücklich auf sie verweist.

Wichtigkeitsbasierte Aufbewahrung

Wichtige Episoden werden länger beibehalten; triviale verfallen schneller.

  • Markieren Sie Episoden mit Wichtigkeit beim Schreiben.
  • Wichtige Ereignisse: eine zweckgebundene Aufbewahrungsfrist mit verantwortlicher Person und Überprüfungsdatum; keine unbegrenzte Aufbewahrung als Standard.
  • Routinemäßige Ereignisse: schrittweiser Verfall über mehrere Monate.

Vom Nutzer initiiertes Vergessen

Der Nutzer kann spezifische Erinnerungen löschen lassen.

  • Spezifische Fakten.
  • Bestimmte Zeiträume.
  • Bestimmte Themen.

Implementierung: Ein Löschworkflow entfernt den primären Datensatz sowie alle abgeleiteten Abschnitte, Embeddings, Zusammenfassungen, Indizes, Caches, Exporte und Jobs in Warteschlangen. Ein Tombstone-Datensatz kann die erneute Aufnahme verhindern, doch bloßes Ausblenden ist keine Löschung. Legen Sie fest, wann Backups ablaufen, und testen Sie, dass gelöschte Daten nach einer Wiederherstellung nicht erneut erscheinen.

Rechtlich vorgeschriebene Löschung

Gesetzliche Vorgaben können die Löschung oder Aufbewahrung verlangen. Artikel 17 der DSGVO regelt ein Recht auf Löschung mit Ausnahmen. Qualifizierte Rechtsberatung sollte diese und andere anwendbare Regeln für das Produkt, den Rechtsraum und die Datenrolle einordnen.

  • Antrag auf Löschung des Nutzerkontos → Den geprüften Workflow für Löschung oder Einschränkung in allen betroffenen Speichern ausführen und Ausnahmen oder Ablaufzeiten von Backups offenlegen.
  • Datenlöschung pro Anfrage → Die betroffenen Datensätze und Derivate lokalisieren, dann das Ergebnis verifizieren.
  • Aufbewahrungsgrenzen → Betroffene Datensätze automatisch gemäß dem genehmigten Zeitplan verfallen lassen.

Diese müssen von Anfang an eingebaut sein. Nachträgliche Anpassungen sind schmerzhaft.

Datenschutzaspekte

Das Gedächtnis ist sensibel. Der Speicher enthält viel über den Nutzer. Überlegungen:

Verschlüsselung ruhender Daten

Verschlüsseln Sie die gespeicherten Gedächtnisdaten. Das gehört zur üblichen Sicherheitspraxis.

Zugriffskontrollen

Wer darf das Gedächtnis eines Nutzers sehen: nur die betroffene Person, nur das System oder unter bestimmten Bedingungen auch Supportmitarbeiter? Legen Sie dies eindeutig fest und protokollieren Sie die Zugriffe.

Umgang mit personenbezogenen Daten

Personenbezogene Informationen wie echte Namen, Adressen und Finanzdaten sollten gekennzeichnet und besonders sorgfältig behandelt werden. Dafür sind eigene Zugriffskontrollen und Löschverfahren erforderlich.

Nutzertransparenz

Wo das Produkt und anwendbare Rechte es verlangen, sollten Nutzer Gedächtnisdatensätze einsehen, korrigieren, in ihrem Geltungsbereich ändern und löschen können. Ein Gedächtnis-Dashboard ist eine mögliche Umsetzung. Testen Sie, ob es verständlich ist, und schützen Sie es wie jede andere Oberfläche für sensible Daten.

Was der Agent sich über Sie merkt:

Profil:
- Name: Alice Tamm
- Rolle: CEO bei Acme Corp
- Kommunikationsstil: knapp, direkt

Letzte Sitzungen:
- 2026-05-14: Entwurf für Acme erstellt
- 2026-05-12: Q1-Ergebnisse geprüft
- ...

Präferenzen:
- Bevorzugt knappe Antworten
- Nutzt Notion, Slack, Linear

[Bearbeiten] [Bestimmte Elemente löschen] [Alle löschen]

Diese Transparenz baut Vertrauen auf. Ein undurchsichtiges Gedächtnis ohne Nutzertransparenz tut dies nicht.

Kontextübergreifende Freigabe

Wenn ein Nutzer mehrere „Modi“ verwendet, etwa einen Arbeitsagenten und einen persönlichen Agenten, sollen die Erinnerungen möglicherweise getrennt bleiben. Teilen Sie sie nicht automatisch zwischen den Modi, sofern der Nutzer dies nicht verlangt.

Häufige Fehlermuster

Einige Muster:

Fehler 1: Halluzinierte Erinnerungen

Der Agent behauptet, sich an Dinge zu erinnern, die nicht passiert sind. „Letzte Woche haben wir uns auf X geeinigt.“ Tatsächlich wurde X nie besprochen.

Ursache: Das LLM ergänzt während der Extraktion oder des Abrufs plausibel klingende Erinnerungen.

Lösung: Verankern Sie Gedächtnisoperationen in echten Gesprächsdaten. Das LLM extrahiert, doch die Prüfung erfolgt anhand des tatsächlichen Transkripts. Halluzinierte Fakten müssen gekennzeichnet werden.

Fehler 2: Falsch gelernte Fakten

Der Agent gibt mit Sicherheit falsche Fakten an. „Sie haben gesagt, dass Sie Python bevorzugen“, als Sie eigentlich sagten, dass Sie gezwungen waren, Python bei der Arbeit zu verwenden.

Ursache: Fehlinterpretation während der Extraktion.

Lösung: Verwenden Sie Vertrauensschwellen. Lernen Sie nur aus ausdrücklichen, wiederholten oder bestätigten Aussagen und ermöglichen Sie dem Nutzer Korrekturen.

Fehler 3: Datenschutzlecks

Gedächtnisinhalte eines Nutzers erscheinen in der Unterhaltung eines anderen. Das ist ein schwerwiegender Vorfall.

Ursache: Fehler in der Logik zur Nutzertrennung.

Lösung: Erzwingen Sie die Nutzertrennung sowohl bei der Speicherung als auch beim Abruf. Prüfen Sie diese Kontrollen und verlassen Sie sich beim Filtern niemals auf das LLM.

Fehler 4: Aufblähung des Gedächtnisses

Nach einem Jahr umfasst das Gedächtnis Megabyte pro Nutzer. Der Abruf verlangsamt sich. Die Kosten steigen.

Ursache: Es gibt weder Verfall noch Bereinigung.

Lösung: Lassen Sie Erinnerungen konsequent verfallen. Die meisten erhalten nach einigen Monaten eine so niedrige Abrufpriorität, dass sie praktisch nicht mehr zugänglich sind. Führen Sie außerdem regelmäßig eine Kompaktierung durch.

Fehler 5: Veraltete Fakten

Der Nutzer hat vor 6 Monaten die Rolle gewechselt. Der Agent verweist immer noch auf die frühere Rolle.

Ursache: Fakten wurden nicht aktualisiert, als sie ersetzt wurden.

Lösung: Erkennen Sie Widersprüche, bewahren Sie Herkunftsnachweis und Gültigkeitsdaten auf und fragen Sie nach einer Bestätigung, wenn der maßgebliche Wert unklar ist. „Der neueste Wert gewinnt“ ist bei verzögerten, zitierten oder böswilligen Eingaben unsicher.

Fehler 6: Desorientierende Konsolidierung

Die Hintergrundkonsolidierung des Gedächtnisses schreibt Erinnerungen gelegentlich so um, dass Informationen verloren gehen.

Ursache: Aggressive Zusammenfassung, bei der Schlüsselfakten nicht erhalten bleiben.

Lösung: Die Konsolidierung muss Fakten explizit erhalten. Testen Sie die Konsolidierung an echten Gedächtnistranskripten.

Eine Implementierungsskizze: persönlicher Assistent mit Gedächtnis

Ein illustratives Referenzdesign: Ein persönlicher KI-Assistent für einzelne Nutzer.

Gedächtnisschichten:

  1. Arbeitsgedächtnis: Aktuelle Unterhaltung.
  2. Sitzungsgedächtnis: Letzte 7 Sitzungen in zusammengefasster Form.
  3. Episodisch: 100 jüngste bemerkenswerte Ereignisse, mit semantischer Suche.
  4. Semantisch: Nutzerprofil (Name, Rolle, Präferenzen, Tools).
  5. Prozedural: Explizite Workflows, die der Nutzer eingerichtet hat.

Speicher:

  • SQL (Postgres): Strukturiertes Profil, Sitzungen, Episoden, Verfahren.
  • Vektordatenbank (pgvector): Semantische Suche für Episoden.

Abläufe:

  • Sitzungsstart: Automatisches Laden des semantischen Profils + der letzten 3 Sitzungen + offener Punkte.
  • Während der Sitzung: Abruf von Episoden ausgelöst durch Themenrelevanz.
  • Ende der Sitzung: LLM-basierte Extraktion; der Nutzer kann überprüfen, was gelernt wurde.
  • Hintergrund: wöchentliche Konsolidierung (verwandte Episoden zusammenführen, das Gewicht veralteter Erinnerungen verringern).

Nutzerkontrollen:

  • Gedächtnis-Dashboard, das zeigt, was gespeichert ist.
  • Bearbeiten/Löschen einzelner Elemente.
  • „Die letzte Stunde vergessen“-Schaltfläche.
  • Vollständiger Workflow zur Kontolöschung mit nachgewiesener Abdeckung, dokumentierten Ausnahmen und festgelegtem Ablaufverhalten für Backups.

Erforderliche Nachweise, bevor das Design als erfolgreich gilt:

  • Aufgabenerledigung mit und ohne abgerufene Gedächtnisinhalte auf einem festen Evaluierungssatz,
  • Präzision gespeicherter Fakten und abgerufener Erinnerungen, einschließlich Umgang mit Widersprüchen,
  • Tests zur Mandanten- und Nutzertrennung,
  • Korrektur- und Löschweitergabe durch Datensätze, Embeddings, Caches, Exporte, Jobs und Backup-Ablauf,
  • Token-, Speicher-, Latenz- und Betriebskosten aus tatsächlichen Traces,
  • Tests zu Verständnis und Kontrolle durch die Nutzer statt nur angenommener Verlässlichkeit.

Berücksichtigte Fehlermuster:

  • Fälle mit halluziniertem Gedächtnis sind in Extraktions- und Abruftests enthalten.
  • Vertrauenswerte werden kalibriert; sie machen eine Aussage nicht automatisch wahr.
  • Die Autorisierung wird vor dem Abruf und erneut vor der Präsentation erzwungen.
  • Aufbewahrungs- und Konsolidierungsjobs haben Audit-Protokolle, Fehlerbehandlung und Löschtests.

Dies ist eine Design-Checkliste, kein Beweis für die Produktionsreife. Der Produktionsstatus erfordert Implementierungsnachweise und Sicherheits-/Datenschutzüberprüfung.

Spezialisierte Tools

Ein Hinweis zu Memory-as-a-Service-Angeboten:

Mem0. Eine Open-Source-Gedächtnisschicht. Prüfen Sie die aktuelle Dokumentation und den Code anhand Ihrer Anforderungen an Persistenz, Trennung und Löschung.

Letta (MemGPT). Ein toolorientiertes Gedächtniskonzept. Prüfen Sie die aktuelle Dokumentation und die betrieblichen Grenzen.

Zep. Ein gehosteter Gedächtnis- und Kontextdienst. Validieren Sie die aktuelle Dokumentation, die Datengrenze und den Löschvertrag.

Cognee. Eine auf Wissensgraphen ausgerichtete Option. Prüfen Sie vor der Einführung anhand der aktuellen Dokumentation und des Repositorys, ob sie ausgereift ist und zu Ihren Anforderungen passt.

Diese Tools können den Implementierungsaufwand verringern, schaffen aber zusätzliche Abhängigkeiten bei Anbieter, Sicherheit, Migration und Datenlebenszyklus. Vergleichen Sie sie anhand derselben Akzeptanztests mit einem internen Design.

Bauen Sie nur das minimal gerechtfertigte Gedächtnis auf

Ein Langzeitgedächtnis ermöglicht Agenten Kontinuität über mehrere Sitzungen hinweg, sodass sie nicht jedes Mal von vorn beginnen. Es gehört zugleich zu den anspruchsvolleren Funktionen, die zuverlässig umgesetzt werden müssen.

Die Architektur ist geschichtet:

  • Arbeitsgedächtnis (im Kontext).
  • Sitzungsgedächtnis (letzte Sitzungen).
  • Episodisches Gedächtnis (spezifische Ereignisse).
  • Semantisches Gedächtnis (stabile Fakten).
  • Prozedurales Gedächtnis (Präferenzen und Workflows).

Jede Ebene hat eine eigene Logik für Speicherung, Abruf und Verfall. Gemeinsam machen sie den Agenten über längere Zeit nutzbar.

Die relevanten Muster:

  • Konservative Extraktion (keine Fakten erfinden).
  • Lernen anhand von Vertrauensstufen (nicht aus beiläufigen Kommentaren lernen).
  • Aktives Vergessen (Verfall und Bereinigung).
  • Nutzerkontrolle (Transparenz und Bearbeitbarkeit).
  • Durchsetzung des Datenschutzes (auf jeder Schicht).

Wenn das System die Evaluierungs- und Lebenszyklustests besteht, kann das Gedächtnis wiederholte Einweisungen vermeiden und bestätigte Präferenzen sitzungsübergreifend verfügbar machen.

Für Agenten, die sitzungsübergreifende Kontinuität erfordern, ist Persistenz eine ausdrückliche Produktentscheidung. Entwickeln Sie nur das minimal gerechtfertigte Gedächtnis, mit Herkunftsnachweis, Autorisierung, Nutzerkontrolle und einem getesteten Pfad für das Ende des Datenlebenszyklus.

Weiterlesen

Fahren Sie mit demselben Lernpfad fort und lesen Sie die nächsten praktischen Artikel.

Thema vertiefen

Sorgfältig ausgewählte externe Kurse, die dieses Thema vertiefen.

Microsoft (open-source, via GitHub Pages)

Copilot Studio Agent Academy

Microsoft Copilot Studio team

The deeper, production-minded counterpart to our beginner no-code pick: a free, open-source, rank-based curriculum that takes you from zero Copilot Studio experience through MCP integrations and multi-agent orchestration, all without writing traditional code. It's the no-code answer to 'now I want to go further than a quick-start,' which our catalog didn't have.

FortgeschrittenSelf-paced, multi-phase (hours vary by rank)
Anthropic Academy

Einführung in das Model Context Protocol

Anthropic Academy

MCP ist das Protokoll, das im gesamten Ökosystem der KI-Tools zunehmend individuelle Einzellösungen für Tool-Integrationen ersetzt. Lernen Sie es direkt von den Urhebern. Am Ende haben Sie einen eigenen MCP-Server erstellt und bereitgestellt, einen LLM-Client damit verbunden und verstanden, warum dieser Standard einem USB-C für die KI-Branche am nächsten kommt.

MittelstufeIm eigenen Tempo (kurz)
DeepLearning.AI

Practical Multi AI Agents and Advanced Use Cases with crewAI

João Moura (Founder, CrewAI)

Doubles as our sales and customer-support vertical pick and a genuinely practical agent-building course: you build an agentic sales pipeline (lead scoring, personalized outreach) and a customer-support data-insights pipeline as two of the five hands-on projects, taught by CrewAI's own founder. Requires basic Python, so it sits with our other builder-track courses rather than the no-code picks.

Mittelstufe~2h 49m · self-paced (15 lessons)

Alle Kurse für Automatisierungen ansehen