RELC-Bench (RELC-Bench: Abruf im Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines model zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten in seinem Kontext zu finden und zu extrahieren. Es wird getestet, ob das model sich an eine bestimmte Tatsache erinnern und sie abrufen kann, die es gerade in der Eingabe gesehen hat.
Ergebnisse
claude-fable-5 erreicht 97,0 % bei den 100 Direktabruf-Items, unverändert über alle Haystack-Positionen hinweg (97,0 % Anfang, 97,1 % Mitte, 97,0 % Ende).
Methodik
Question format
Eine natürlichsprachliche Frage, die nach einer numerischen Kennzahl fragt. Beispiel:
F: Wie hoch war der Umsatz für Q1 2026 von Adobe (ADBE)?
Erwartet: $6,40 Milliarden
Datenquelle
Das Skript analysiert den Takeaways-Abschnitt jedes Motley-Fool-Gewinntranskripts und extrahiert alle numerischen Kennzahlen. Für jede Kennzahl überprüft das Skript, ob die Zahl wortwörtlich im Transkriptteil nach den Takeaways (dem eigentlichen Text der Telefonkonferenz) vorkommt, sodass das model die echte Konversation lesen muss und nicht die Zusammenfassungspunkte. Zusammenfassungspunkte werden aus den Texten entfernt.
Bewertungsregel
- Jedes Item hat eine Liste von Zielwerten; der erste ist das Primärziel (die Hauptantwort auf die Frage)
- Punktzahl = 1.0, wenn das Primärziel mit einer beliebigen Zahl in der Vorhersage übereinstimmt
- Punktzahl = 0.0 andernfalls
- Verweigerungen („Ich weiß nicht“) ergeben 0.0
- claude-fable-5 wird über Claude Code getestet: Der Haystack wird als Datei bereitgestellt, und das model ruft mit Suchwerkzeugen daraus ab, anstatt ihn aus seinem Kontextfenster zu lesen. Seine Punktzahlen messen das model zusammen mit dem Claude Code-Harness, und in diesem Setup wird Positionsinvarianz erwartet, da die Zieltiefe bei der Dateisuche nicht gilt.
Wie gute Leistung aussieht
Phase 1 ≥ 85 % (model findet Kennzahlen zuverlässig in einem einzelnen Dokument).
Phase 2 ≥ 90 % (model navigiert ohne Ablenkung zum Ziel in einem Haystack).
Positionsinvariante Punktzahlen weisen auf echte Langkontextfähigkeit hin; mit der Tiefe abnehmende Punktzahlen weisen auf „Lost in the Middle“ hin.
Anzahl der Items
100 Direktabruf-Items verteilt über 14 Transkripte.
Was ist KI-Gedächtnis?
KI-Gedächtnis ist die Fähigkeit eines KI-Systems, vergangene Erfahrungen zu speichern und abzurufen, um Entscheidungsfindung, Wahrnehmung und Gesamtleistung zu verbessern.1 Anders als das menschliche Gedächtnis, das subjektiv und selektiv ist, ist KI-Gedächtnis eine technische Architektur, ein strukturierter Informationsspeicher in neuronalen Netzen oder externen Datenbanken.
Das Konzept unterscheidet sich vom Kontextfenster eines model, einem endlichen, sitzungsgebundenen Token-Puffer, der während der inference als Arbeitsgedächtnis dient.2 Während das Kontextfenster zwischen Sitzungen zurückgesetzt wird und Informationen verliert, wenn Tokens abgeschnitten werden, bleibt KI-Gedächtnis über Sitzungen hinweg durch externe Speicherung bestehen.3 Es unterscheidet sich auch von Retrieval-Augmented Generation (RAG), die schreibgeschützt ist und Relevanz als Eigenschaft des Inhalts statt des Benutzers behandelt; KI-Gedächtnis erfordert einen Schreibpfad, der Fakten aus Konversationen extrahiert und den Speicher aktualisiert, wenn sich Informationen ändern.4
Das Feld erkennt zwei primäre Stufen. Das Kurzzeitgedächtnis oder Arbeitsgedächtnis verfolgt laufende Konversationen innerhalb einer Sitzung, während das Langzeitgedächtnis benutzerspezifische oder anwendungsebene Daten über Sitzungen hinweg speichert.5 Einige Frameworks fügen eine dritte Kategorie hinzu, das episodische Gedächtnis, das es Agenten ermöglicht, sich an bestimmte frühere Erfahrungen zu erinnern, ähnlich wie Menschen sich an einzelne Ereignisse erinnern.
In Verbraucherprodukten bezieht sich „Chat-Gedächtnis“ speziell auf Benutzerpräferenzen und automatisch angezeigte Konversationskernpunkte, was architektonisch enger gefasst ist als „Agenten-Gedächtnis“, wie es in Entwickler-Frameworks verwendet wird; letzteres umfasst Aufgabenstatus, Tool-Call-Verlauf und erlernte Prozeduren.6
Wie funktioniert KI-Gedächtnis?
KI-Gedächtnissysteme laufen auf einer gemeinsamen Schreib-/Abruf-/Konsolidierungs-Pipeline hinaus, die sich von statischem Abruf unterscheidet. Neue Informationen gelangen durch eine Extraktionsphase, die Nachrichtenpaare verarbeitet, um Kandidatenfakten zu identifizieren, durchlaufen eine Aktualisierungsphase, in der ein LLM entscheidet, jede Tatsache hinzuzufügen, zu aktualisieren, zu löschen oder zu ignorieren, und verlassen das System durch eine Abrufphase, die zur Abfragezeit eine semantische Suche durchführt.7
Reale Anwendungen von KI-Gedächtnis
Persönliche KI-Assistenten
OpenAIs ChatGPT-Gedächtnisfunktion erstellt persistente Profile aus Benutzerkonversationen, Dateien und verbundenen Apps. Ein „Dreaming“-Update von 2026 führte eine Hintergrundsynthese über viele Konversationen hinweg ein, wodurch Erinnerungen sich im Laufe der Zeit selbst aktualisieren können; zum Beispiel schreibt sich eine gespeicherte Erinnerung mit dem Inhalt „Der Benutzer fliegt im Juli nach Singapur“ automatisch um zu „Der Benutzer war im Juli 2026 in Singapur“, sobald die Reise vorbei ist.8 Benutzer verwalten den Speicher über Einstellungen > Personalisierung > Speicher, obwohl OpenAI anmerkt, dass die sichtbare Zusammenfassung nicht alles erfasst, was gespeichert wurde.
Anthropics Claude-Gedächtnis wurde für Nutzer des Team-Tarifs am 11. September 2025 eingeführt, am 18. September 2025 auf Enterprise ausgeweitet und erreichte am 2. März 2026 alle Nutzer einschließlich der free-Stufe.9 Am 10. Juli 2026 gestaltete Anthropic die Funktion in kategorisierte Einträge um, die Claude während Gesprächen liest und aktualisiert, und ersetzte damit die frühere einzelne Tageszusammenfassung.
Googles Gemini speichert Informationen, die Nutzer zu merken bitten, sowie Details aus früheren Gesprächen, wenn der persönliche Kontext aktiviert ist.10 Das separate „Personal Intelligence“-Upgrade, wenn aktiviert, verbindet sich mit Gmail und Fotos, ohne models auf diese Inhalte zu trainieren.11
Enterprise-Agenten und Kundensupport
Decagons Einsatz bei Rippling verband den KI-Agenten mit internen APIs, sodass der Agent individuelle Mitarbeiterkontodaten abrufen konnte, statt allgemein zu antworten, und erhöhte die Chat-Ablenkung von 38 % auf über 50 %, eine relative Verbesserung von 32 %.12 Decagons Arbeit mit Chime automatisierte aufwändige Aufgaben wie Kartenaustausch und Statusprüfungen von Einzahlungen und senkte die Kundensupportkosten um 60 %, während sich die Zufriedenheitswerte der Mitglieder verdoppelten.13
Robotik, Gesundheitswesen und verkörperte KI
Diligent Robotics’ Krankenhauslogistikroboter Moxi ist in mehr als 25 US-amerikanischen Einrichtungen im Einsatz und hat bis 2026 über 1.25 Millionen autonome Lieferungen absolviert, wobei er jede Krankenhausumgebung mit bordeigenen Sensoren kartiert und dynamische Hindernisse einschließlich Türen mit Ausweis-Zugangskontrolle bewältigt.14 Moxi 2.0 läuft auf NVIDIA IGX Thor Compute mit der 10-fachen Verarbeitungskapazität des Originals und wurde mit drei Jahren realen Krankenhauslieferdaten trainiert.
NVIDIAs ReMEmbR-Framework verleiht mobilen Robotern ein langfristiges raum-zeitliches Gedächtnis, um laufende Aufzeichnungen des Geschehenen für Navigationsaufgaben aufzubauen und darüber zu schlussfolgern.15 ASPIRE, veröffentlicht am 29. Juni 2026, speichert jede validierte Debugging-Korrektur als benanntes, wiederverwendbares Code-Muster und erhöht die Erfolgsraten allein durch iteratives Debugging von 20 % auf 92 % beim bimanuellen Objektübergabe-Benchmark von Robosuite.16
Im Gesundheitswesen ist die Ambient-KI-Dokumentationsplattform von Abridge bei Northwell Health in 28 Krankenhäusern im Einsatz, um die klinische Dokumentationsbelastung zu reduzieren.17 Riverside Health pilotierte zwei Monate lang Ambient-Dokumentationstools, bevor es sich für einen erweiterten Einsatz von Abridge entschied.18
Vorteile von KI-Gedächtnis
Gedächtnissysteme reduzieren Token-Kosten und Latenz in langfristigen Benchmarks im Vergleich zum vollständigen Kontext-Replay. Beim LoCoMo-Benchmark, der Konversationen mit durchschnittlich 300 Runden über bis zu 35 Sitzungen testet, berichtet Mem0, mehr als 90 % der Token-Kosten im Vergleich zum Wiedergeben des vollständigen Konversationsverlaufs zu sparen, die p95-Latenz um 91 % zu senken (1.44s gegenüber 17.12s) und eine relative Verbesserung von 26 % beim LLM-as-a-Judge-Score gegenüber der Gedächtnis-Baseline von OpenAI zu erzielen.7
Zep meldet 94,8 % Genauigkeit beim Deep Memory Retrieval Benchmark gegenüber 93,4 % für MemGPT, bis zu 18,5 % Gesamtgenauigkeitsgewinne bei LongMemEval in Kombination mit GPT-4o und eine Reduzierung der Antwortlatenz um 90 % im Vergleich zu Vollkontext-Baselines, wobei die mediane Antwortzeit von 28,9 Sekunden auf 2,58 Sekunden sank, während die Kontext-Tokens von etwa 115.000 auf 1.600 fielen.1920
Der BEAM-Benchmark, der bis zu 10 Millionen Tokens testet, stellte fest, dass sein LIGHT-Gedächtnis-Framework die Leistung im Durchschnitt um 3.5 bis 12.69 Prozentpunkte gegenüber den stärksten bestehenden Baselines verbesserte und dass selbst LLMs mit Kontextfenstern von 1 Million Tokens mit zunehmender Gesprächslänge erheblich nachlassen.21
Die Dreaming-Architektur von OpenAI für ChatGPT verbesserte die Genauigkeit des zeitkritischen Gedächtnisses von 9,4 % auf 75,1 %, mit einer faktischen Erinnerungsrate von 82,8 % und einer Präferenzbefolgung von 71,3 %, während die Rechenkosten um etwa 5x gesenkt wurden.8
Herausforderungen und Risiken von KI-Gedächtnis
Gedächtnisvergiftung und Sicherheit
Gedächtnisvergiftung wird als ASI06, „Memory and Context Poisoning“, in der OWASP Top 10 für agentische Anwendungen eingestuft und definiert als Korruption des persistenten Agentengedächtnisses, die über Sitzungen hinweg zu Fehlausrichtung und bösartigem Verhalten führt.2223 Im Februar 2025 demonstrierte der Forscher Johann Rehberger einen Angriff mit „verzögerter Tool-Invocation“ gegen Google Gemini, der das System dazu brachte, falsche Fakten als Langzeiterinnerungen zu speichern, einschließlich falscher Altersangaben.24
MINJA (Memory INJection Attack), angenommen bei NeurIPS 2025, zeigt, dass Angreifer mit lediglich gewöhnlicher Frage-und-Antwort-Interaktion das Langzeitgedächtnis vergiften können, und erreicht eine Injektionserfolgsrate von 98,2 % und eine Angriffserfolgsrate von 76,8 % im Durchschnitt über die getesteten Agenten.25 AgentPoison, veröffentlicht bei NeurIPS 2024, erreicht eine Angriffserfolgsrate von über 80 %, während weniger als 0,1 % der Speicheraufzeichnungen vergiftet werden und die Leistung bei gutartigen Aufgaben um weniger als 1 % sinkt.26
Datenschutz und Daten-Governance
MEXTRA, ein Black-Box-Memory-EXTRaction-Angriff, erstellt Abfragen, um gespeicherte private Daten zu extrahieren, und erreicht vollständige Extraktionsraten von 83 % gegen EHRAgent und 87 % gegen Webshopping-Agenten mit 30 Angriffs-Prompts.27 Sowohl eine Erhöhung der Abruftiefe als auch eine Vergrößerung des Gesamtspeichers erhöhen die Leckageraten.27
Die italienische Datenschutzbehörde verhängte im Dezember 2024 gegen OpenAI eine Geldstrafe von €15 Millionen, weil personenbezogene Daten zum Trainieren von ChatGPT ohne angemessene Rechtsgrundlage verarbeitet wurden; das Gericht von Rom hob die Geldstrafe im März 2026 jedoch mit der Begründung auf, dass die irische Datenschutzkommission als federführende EU-Aufsichtsbehörde zuständig sei.2829
Die Dokumentation von OpenAI besagt, dass das Ausschalten des Gedächtnisses zuvor gespeicherte Erinnerungen nicht automatisch löscht; ein vollständiges Zurücksetzen erfordert sowohl das Deaktivieren des Gedächtnisses als auch das separate Leeren vorhandener Einträge.
Technische Einschränkungen
Über zehn evaluierte Gedächtnisansätze im LoCoMo-Benchmark hinweg schneiden die meisten Methoden bei zeitlichen Schlussfolgerungsfragen schlechter ab als bei einstufigem faktischem Abruf, obwohl mindestens ein Ansatz dieses Muster umkehrt.7
Die Veralterung von Erinnerungen stellt ein weiteres ungelöstes Problem dar: Wenn gespeicherte Fakten durch neue Informationen widerlegt werden, fällt es Systemen schwer, aktuelle von veralteten Daten zu unterscheiden. Der MemConflict-Benchmark bewertet Szenarien, in denen gespeicherte Fakten veralten oder direkt in Konflikt geraten, und stellt fest, dass bestehende Systeme diese Konflikte nicht zuverlässig auflösen können.30
Darüber hinaus lässt sich die Leistung in standardisierten Benchmarks nicht zuverlässig auf Produktionszuverlässigkeit übertragen, da synthetische Umgebungen die reale Nutzung zu stark vereinfachen.31
Weiterführende Literatur
- 5 Open-Source-Agentic-KI-Frameworks
- Code-Ausführung mit MCP: Ein neuer Ansatz für die Effizienz von KI-Agenten
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Alper, Şevval},
title = {{RELC-Bench: Abruf im Langkontext-Benchmark}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Abgerufen am 15. September 2026}
}Ergebnisse und Zeitstempel von 0 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 0 CSV-Dateien enthält.
Möchten Sie die granularen Daten dahinter? Premium beitreten
Änderungsprotokoll
10 AktualisierungenErgebnisse von claude-fable-5 zum Abschnitt Methodik hinzugefügt.
Ersetzte den KI-Speicher-Benchmark mit 26 Modellen durch RELC-Bench-Ergebnisse und Methodikabschnitte zum Long-Context-Retrieval.
Die Daten zum „GPT-5-Ausschluss“ in der Einleitung wurden aktualisiert.
Der Abschnitt „Warum große Modelle mit dem Gedächtnis kämpfen?“ wurde um architektonische Lösungen erweitert.
Die Methodik des KI-Speicherbenchmarks wurde durch Fragetypen ersetzt.
Referenzlinks
Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]
Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.
Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.
Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.