Stellen Sie einem KI-Agenten im Unternehmen an zwei Tagen hintereinander dieselbe Frage, und beim zweiten Mal antwortet er bei null. Er erinnert sich nicht an das Konto, das Sie markiert haben, nicht an die Ausnahme, die Sie freigegeben haben, nicht an die Präferenz, die Sie gestern genannt haben. Das Kontextfenster wird zurückgesetzt, und der Agent ist wieder ein Fremder. Das ist der eigentliche Fehlermodus hinter den meisten Klagen über „unser KI-Agent wirkte dumm“, und er liegt im Gedächtnis, nicht im Modell.

Das Kontextfenster war nie die Lösung

Frühe Agenten-Deployments hielten ein größeres Kontextfenster für die Antwort: mehr Gesprächsverlauf hineinstopfen, dann erinnert sich der Agent schon. Im Produktivbetrieb trägt das nicht. Reale Kontextfenster liegen 2026 zwischen 128K und 2M Token, einzelne Anbieter werben mit bis zu 10M, aber ein breiteres Fenster löst das Problem des Abrufs nicht. Irrelevanter Verlauf, der das Fenster füllt, verschlechtert Latenz und Ausgabequalität zugleich, und nichts in einem rohen Fenster überlebt die Sitzung, die es erzeugt hat. Ein Fenster ist ein Zwischenspeicher, kein Gedächtnis.

Die Forschung hinter dem LoCoMo-Benchmark, dem Standard für das Testen sitzungsübergreifender Erinnerung über 1.540 Fragen, behandelt das als gelöstes Architekturproblem und nicht als offene Frage: Das Gedächtnis muss außerhalb des Fensters liegen, in einem Speicher, den der Agent bei Bedarf abfragt.

Wie ein funktionierender Gedächtnis-Stack aussieht

Das Muster, das sich 2026 stabilisiert hat, teilt das Gedächtnis in Schichten statt in einen einzigen Behälter:

  • Gedächtnis im Kontext: der laufende Gesprächspuffer. Sofort verfügbar, mit dem Ende der Sitzung verschwunden.
  • Semantisches Gedächtnis: Fakten und Wissen in einem Vektorspeicher, bei Bedarf über Ähnlichkeit abgerufen statt vollständig hineingekippt. Auf dieser Schicht arbeitet agentisches RAG.
  • Episodisches Gedächtnis: ein dauerhaftes Protokoll früherer Interaktionen, begrenzt auf einen Nutzer, einen Agenten oder eine Sitzung, damit der Agent wieder hervorholen kann, was am Dienstag vereinbart wurde.
  • Prozedurales Gedächtnis: das Wie statt des Was, also Workflows, Gewohnheiten im Umgang mit Werkzeugen und Prozesskonventionen, die der Agent konsistent anwenden soll. Diese Schicht steckt in den meisten Werkzeugen noch in den Anfängen.

Der Benchmark-Bericht von Mem0 für 2026, aufgebaut auf dem begutachteten ECAI-2025-Paper, das zehn Gedächtnisansätze auf LoCoMo verglichen hat, verortet den eigenen Algorithmus zum selektiven Abruf bei 92,5 auf LoCoMo und 94,4 auf LongMemEval, im Mittel mit weniger als 7.000 Token pro Anfrage. Der Ausgangswert von 2025, den vollständigen Gesprächsverlauf in den Kontext zu stopfen, lag bei vergleichbarer Genauigkeit nahe 26.000 Token pro Anfrage. Das ist rund das 3,7-Fache der Token-Kosten, bei schlechterer Erinnerung an zeitliche und mehrstufige Fragen. Selektiver Abruf ist kein Komfortmerkmal. Er entscheidet, ob ein Agent im großen Maßstab bezahlbar bleibt oder nicht.

Balkendiagramm, das die durchschnittlichen Token pro Anfrage zwischen einem Gedächtnis-Ausgangswert mit vollem Kontext im Jahr 2025 und selektivem Gedächtnisabruf im Jahr 2026 vergleicht

AnsatzDurchschn. Token pro Anfrage
Ausgangswert mit vollem Kontext (2025)~26.000
Selektiver Abruf (2026, LoCoMo)~6.956

Quelle: Benchmark-Bericht von Mem0 für 2026, auf Basis des ECAI-2025-Papers, das zehn Gedächtnisansätze auf dem LoCoMo-Benchmark verglichen hat.

Der Abruf ist der schwierige Teil, nicht die Speicherung

Erinnerungen in einer Vektordatenbank abzulegen ist die leichte Hälfte. Zu entscheiden, was für eine bestimmte Anfrage abgerufen wird, und es korrekt zusammenzuführen, dort steckt der Großteil der Entwicklungsarbeit von 2026. Der aktuelle Ansatz lässt drei Bewertungsdurchläufe parallel laufen, semantische Ähnlichkeit, Keyword-Treffer und Entitäten-Treffer, und führt die Ergebnisse zusammen, weil kein Signal für sich allein verlässlich ist: Rein semantische Suche verfehlt exakte Namen und Daten, rein keywordbasierte Suche verfehlt umformulierte Fragen.

Zwanzig Vektorspeicher-Backends sind heute in den großen Open-Source-Frameworks für Gedächtnis angebunden, von Qdrant und Weaviate bis zu verwalteten Optionen wie Azure AI Search und Amazon S3 Vectors. Das zeigt: Hier ist Grundausstattung entstanden, kein Forschungsprototyp. Was sich noch nicht gefestigt hat, ist die Herkunft einer Information. In Multi-Agenten-Systemen bleibt ein gespeicherter Satz wie „der Kunde braucht eine Rückerstattung“ mehrdeutig, solange die Gedächtnisschicht nicht festhält, wer ihn gesagt hat: der Nutzer, ein überwachender Agent oder die Schlussfolgerung eines planenden Agenten. Wird das falsch gemacht, behandelt der Agent seine eigenen Vermutungen als vom Nutzer bestätigte Fakten.

Wo Unternehmen das tatsächlich spüren

Die betriebswirtschaftlichen Kosten des fehlenden Gedächtnisses zeigen sich an drei Stellen, die uns in Kundenprojekten immer wieder begegnen:

  1. Kontext in jeder Sitzung neu erklären. Agenten in Support und Betrieb, die die Historie eines Kunden nicht abrufen können, schieben die Last der Kontinuität zurück auf den Menschen. Damit ist der Zweck der automatisierten Interaktion dahin.
  2. Keine Personalisierung im großen Maßstab. Ein Agent, der eine genannte Präferenz, die Coding-Konventionen eines Teams oder die Sonderregelungen eines Kundenkontos nicht behält, kann über die Zeit nicht besser werden. Er startet bei jedem Lauf von einer generischen Grundlage.
  3. Compliance-Risiko. Ein Gedächtnis, das unbegrenzt fortbesteht, ohne Abgrenzung und ohne Löschpfad, schafft eine Haftung bei der Datenaufbewahrung. Hier gilt dieselbe Governance-Disziplin, die wir beim Context Engineering anwenden: Gedächtnis braucht einen Eigentümer, einen Geltungsbereich und einen Weg zum Recht auf Löschung, sonst wird es zu dem Punkt, den ein Audit anmerkt.

Nichts davon ist exotisch. Es ist dieselbe Disziplin, an der ERP-Einführungen lange vor den Agenten gelungen oder gescheitert sind: Legen Sie fest, welche Daten bestehen bleiben, wem sie gehören und wie sie abgerufen werden, bevor Sie das System skalieren.

Was Sie bauen sollten, bevor Sie einen Agenten skalieren

Wenn Sie die Pilotphase hinter sich haben, entscheiden drei Fragen darüber, ob Gedächtnis hilft oder zur Last wird:

  • Was ist tatsächlich erinnerungswürdig? Nicht jede Nachricht ist eine Erinnerung. Bestätigte Fakten und Entscheidungen sind es, Small Talk nicht. Behandeln Sie Schreibzugriffe auf das Gedächtnis als kuratiert, nicht als automatisch.
  • Wie weit reicht der Geltungsbereich? Entscheiden Sie von Anfang an, ob eine Erinnerung zu einem Nutzer, einem Agenten, einer Sitzung oder zur ganzen Organisation gehört. Vermischte Geltungsbereiche sind der Weg, auf dem Agenten die Daten eines Kunden einem anderen zeigen.
  • Wie sieht der Löschpfad aus? Wenn ein Gedächtnisspeicher eine Löschanfrage nicht so bedienen kann wie Ihre übrigen Systeme, ist er keine Funktion, sondern eine Governance-Lücke, die im Audit gefunden wird.

Wir bauen das in die agentischen KI-Deployments ein, die wir für Kunden umsetzen, und verdrahten persistentes Gedächtnis mit denselben Plattformen, die bereits Cloud-Infrastruktur und Daten tragen, statt einen separaten Gedächtnisanbieter auf einen Agenten-Stack zu schrauben, der nie dafür ausgelegt war. Wenn Ihre Agenten technisch laufen, Kunden aber immer wieder bitten müssen, sich zu wiederholen, ist das eine Lücke in der Gedächtnisarchitektur und keine Grenze des Modells. Sie verdient eine Prüfung, bevor Sie weitere Automatisierung darauf stapeln. Unser Ansatz beginnt genau dort. Sprechen Sie uns an, um zu klären, woran sich Ihre Agenten wirklich erinnern sollten.