Premium
Dienstleistungen
Premium

RELC-Bench: Abruf im Langkontext-Benchmark

Cem Dilmegani
Cem Dilmegani
aktualisiert am 15. Sept. 2026

RELC-Bench (RELC-Bench: Abruf im Langkontext-Benchmark) zielt darauf ab, die Fähigkeit eines model zu messen, einen bestimmten numerischen Wert aus einem oder mehreren Dokumenten in seinem Kontext zu finden und zu extrahieren. Es wird getestet, ob das model sich an eine bestimmte Tatsache erinnern und sie abrufen kann, die es gerade in der Eingabe gesehen hat.

Ergebnisse

Diagramm wird geladen

claude-fable-5 erreicht 97,0 % bei den 100 Direktabruf-Items, unverändert über alle Haystack-Positionen hinweg (97,0 % Anfang, 97,1 % Mitte, 97,0 % Ende).

Methodik

Question format

Eine natürlichsprachliche Frage, die nach einer numerischen Kennzahl fragt. Beispiel:

F: Wie hoch war der Umsatz für Q1 2026 von Adobe (ADBE)?
Erwartet: $6,40 Milliarden

Datenquelle

Das Skript analysiert den Takeaways-Abschnitt jedes Motley-Fool-Gewinntranskripts und extrahiert alle numerischen Kennzahlen. Für jede Kennzahl überprüft das Skript, ob die Zahl wortwörtlich im Transkriptteil nach den Takeaways (dem eigentlichen Text der Telefonkonferenz) vorkommt, sodass das model die echte Konversation lesen muss und nicht die Zusammenfassungspunkte. Zusammenfassungspunkte werden aus den Texten entfernt.

Bewertungsregel

  • Jedes Item hat eine Liste von Zielwerten; der erste ist das Primärziel (die Hauptantwort auf die Frage)
  • Punktzahl = 1.0, wenn das Primärziel mit einer beliebigen Zahl in der Vorhersage übereinstimmt
  • Punktzahl = 0.0 andernfalls
  • Verweigerungen („Ich weiß nicht“) ergeben 0.0
  • claude-fable-5 wird über Claude Code getestet: Der Haystack wird als Datei bereitgestellt, und das model ruft mit Suchwerkzeugen daraus ab, anstatt ihn aus seinem Kontextfenster zu lesen. Seine Punktzahlen messen das model zusammen mit dem Claude Code-Harness, und in diesem Setup wird Positionsinvarianz erwartet, da die Zieltiefe bei der Dateisuche nicht gilt.

Wie gute Leistung aussieht

Phase 1 ≥ 85 % (model findet Kennzahlen zuverlässig in einem einzelnen Dokument).
Phase 2 ≥ 90 % (model navigiert ohne Ablenkung zum Ziel in einem Haystack).
Positionsinvariante Punktzahlen weisen auf echte Langkontextfähigkeit hin; mit der Tiefe abnehmende Punktzahlen weisen auf „Lost in the Middle“ hin.

Anzahl der Items

100 Direktabruf-Items verteilt über 14 Transkripte.

Was ist KI-Gedächtnis?

KI-Gedächtnis ist die Fähigkeit eines KI-Systems, vergangene Erfahrungen zu speichern und abzurufen, um Entscheidungsfindung, Wahrnehmung und Gesamtleistung zu verbessern.1 Anders als das menschliche Gedächtnis, das subjektiv und selektiv ist, ist KI-Gedächtnis eine technische Architektur, ein strukturierter Informationsspeicher in neuronalen Netzen oder externen Datenbanken.

Das Konzept unterscheidet sich vom Kontextfenster eines model, einem endlichen, sitzungsgebundenen Token-Puffer, der während der inference als Arbeitsgedächtnis dient.2 Während das Kontextfenster zwischen Sitzungen zurückgesetzt wird und Informationen verliert, wenn Tokens abgeschnitten werden, bleibt KI-Gedächtnis über Sitzungen hinweg durch externe Speicherung bestehen.3 Es unterscheidet sich auch von Retrieval-Augmented Generation (RAG), die schreibgeschützt ist und Relevanz als Eigenschaft des Inhalts statt des Benutzers behandelt; KI-Gedächtnis erfordert einen Schreibpfad, der Fakten aus Konversationen extrahiert und den Speicher aktualisiert, wenn sich Informationen ändern.4

Das Feld erkennt zwei primäre Stufen. Das Kurzzeitgedächtnis oder Arbeitsgedächtnis verfolgt laufende Konversationen innerhalb einer Sitzung, während das Langzeitgedächtnis benutzerspezifische oder anwendungsebene Daten über Sitzungen hinweg speichert.5 Einige Frameworks fügen eine dritte Kategorie hinzu, das episodische Gedächtnis, das es Agenten ermöglicht, sich an bestimmte frühere Erfahrungen zu erinnern, ähnlich wie Menschen sich an einzelne Ereignisse erinnern.

In Verbraucherprodukten bezieht sich „Chat-Gedächtnis“ speziell auf Benutzerpräferenzen und automatisch angezeigte Konversationskernpunkte, was architektonisch enger gefasst ist als „Agenten-Gedächtnis“, wie es in Entwickler-Frameworks verwendet wird; letzteres umfasst Aufgabenstatus, Tool-Call-Verlauf und erlernte Prozeduren.6

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Wie funktioniert KI-Gedächtnis?

KI-Gedächtnissysteme laufen auf einer gemeinsamen Schreib-/Abruf-/Konsolidierungs-Pipeline hinaus, die sich von statischem Abruf unterscheidet. Neue Informationen gelangen durch eine Extraktionsphase, die Nachrichtenpaare verarbeitet, um Kandidatenfakten zu identifizieren, durchlaufen eine Aktualisierungsphase, in der ein LLM entscheidet, jede Tatsache hinzuzufügen, zu aktualisieren, zu löschen oder zu ignorieren, und verlassen das System durch eine Abrufphase, die zur Abfragezeit eine semantische Suche durchführt.7

Reale Anwendungen von KI-Gedächtnis

Persönliche KI-Assistenten

OpenAIs ChatGPT-Gedächtnisfunktion erstellt persistente Profile aus Benutzerkonversationen, Dateien und verbundenen Apps. Ein „Dreaming“-Update von 2026 führte eine Hintergrundsynthese über viele Konversationen hinweg ein, wodurch Erinnerungen sich im Laufe der Zeit selbst aktualisieren können; zum Beispiel schreibt sich eine gespeicherte Erinnerung mit dem Inhalt „Der Benutzer fliegt im Juli nach Singapur“ automatisch um zu „Der Benutzer war im Juli 2026 in Singapur“, sobald die Reise vorbei ist.8 Benutzer verwalten den Speicher über Einstellungen > Personalisierung > Speicher, obwohl OpenAI anmerkt, dass die sichtbare Zusammenfassung nicht alles erfasst, was gespeichert wurde.

Anthropics Claude-Gedächtnis wurde für Nutzer des Team-Tarifs am 11. September 2025 eingeführt, am 18. September 2025 auf Enterprise ausgeweitet und erreichte am 2. März 2026 alle Nutzer einschließlich der free-Stufe.9 Am 10. Juli 2026 gestaltete Anthropic die Funktion in kategorisierte Einträge um, die Claude während Gesprächen liest und aktualisiert, und ersetzte damit die frühere einzelne Tageszusammenfassung.

Googles Gemini speichert Informationen, die Nutzer zu merken bitten, sowie Details aus früheren Gesprächen, wenn der persönliche Kontext aktiviert ist.10 Das separate „Personal Intelligence“-Upgrade, wenn aktiviert, verbindet sich mit Gmail und Fotos, ohne models auf diese Inhalte zu trainieren.11

Enterprise-Agenten und Kundensupport

Decagons Einsatz bei Rippling verband den KI-Agenten mit internen APIs, sodass der Agent individuelle Mitarbeiterkontodaten abrufen konnte, statt allgemein zu antworten, und erhöhte die Chat-Ablenkung von 38 % auf über 50 %, eine relative Verbesserung von 32 %.12 Decagons Arbeit mit Chime automatisierte aufwändige Aufgaben wie Kartenaustausch und Statusprüfungen von Einzahlungen und senkte die Kundensupportkosten um 60 %, während sich die Zufriedenheitswerte der Mitglieder verdoppelten.13

Robotik, Gesundheitswesen und verkörperte KI

Diligent Robotics’ Krankenhauslogistikroboter Moxi ist in mehr als 25 US-amerikanischen Einrichtungen im Einsatz und hat bis 2026 über 1.25 Millionen autonome Lieferungen absolviert, wobei er jede Krankenhausumgebung mit bordeigenen Sensoren kartiert und dynamische Hindernisse einschließlich Türen mit Ausweis-Zugangskontrolle bewältigt.14 Moxi 2.0 läuft auf NVIDIA IGX Thor Compute mit der 10-fachen Verarbeitungskapazität des Originals und wurde mit drei Jahren realen Krankenhauslieferdaten trainiert.

NVIDIAs ReMEmbR-Framework verleiht mobilen Robotern ein langfristiges raum-zeitliches Gedächtnis, um laufende Aufzeichnungen des Geschehenen für Navigationsaufgaben aufzubauen und darüber zu schlussfolgern.15 ASPIRE, veröffentlicht am 29. Juni 2026, speichert jede validierte Debugging-Korrektur als benanntes, wiederverwendbares Code-Muster und erhöht die Erfolgsraten allein durch iteratives Debugging von 20 % auf 92 % beim bimanuellen Objektübergabe-Benchmark von Robosuite.16

Im Gesundheitswesen ist die Ambient-KI-Dokumentationsplattform von Abridge bei Northwell Health in 28 Krankenhäusern im Einsatz, um die klinische Dokumentationsbelastung zu reduzieren.17 Riverside Health pilotierte zwei Monate lang Ambient-Dokumentationstools, bevor es sich für einen erweiterten Einsatz von Abridge entschied.18

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Vorteile von KI-Gedächtnis

Gedächtnissysteme reduzieren Token-Kosten und Latenz in langfristigen Benchmarks im Vergleich zum vollständigen Kontext-Replay. Beim LoCoMo-Benchmark, der Konversationen mit durchschnittlich 300 Runden über bis zu 35 Sitzungen testet, berichtet Mem0, mehr als 90 % der Token-Kosten im Vergleich zum Wiedergeben des vollständigen Konversationsverlaufs zu sparen, die p95-Latenz um 91 % zu senken (1.44s gegenüber 17.12s) und eine relative Verbesserung von 26 % beim LLM-as-a-Judge-Score gegenüber der Gedächtnis-Baseline von OpenAI zu erzielen.7

Zep meldet 94,8 % Genauigkeit beim Deep Memory Retrieval Benchmark gegenüber 93,4 % für MemGPT, bis zu 18,5 % Gesamtgenauigkeitsgewinne bei LongMemEval in Kombination mit GPT-4o und eine Reduzierung der Antwortlatenz um 90 % im Vergleich zu Vollkontext-Baselines, wobei die mediane Antwortzeit von 28,9 Sekunden auf 2,58 Sekunden sank, während die Kontext-Tokens von etwa 115.000 auf 1.600 fielen.1920

Der BEAM-Benchmark, der bis zu 10 Millionen Tokens testet, stellte fest, dass sein LIGHT-Gedächtnis-Framework die Leistung im Durchschnitt um 3.5 bis 12.69 Prozentpunkte gegenüber den stärksten bestehenden Baselines verbesserte und dass selbst LLMs mit Kontextfenstern von 1 Million Tokens mit zunehmender Gesprächslänge erheblich nachlassen.21

Die Dreaming-Architektur von OpenAI für ChatGPT verbesserte die Genauigkeit des zeitkritischen Gedächtnisses von 9,4 % auf 75,1 %, mit einer faktischen Erinnerungsrate von 82,8 % und einer Präferenzbefolgung von 71,3 %, während die Rechenkosten um etwa 5x gesenkt wurden.8

Herausforderungen und Risiken von KI-Gedächtnis

Gedächtnisvergiftung und Sicherheit

Gedächtnisvergiftung wird als ASI06, „Memory and Context Poisoning“, in der OWASP Top 10 für agentische Anwendungen eingestuft und definiert als Korruption des persistenten Agentengedächtnisses, die über Sitzungen hinweg zu Fehlausrichtung und bösartigem Verhalten führt.2223 Im Februar 2025 demonstrierte der Forscher Johann Rehberger einen Angriff mit „verzögerter Tool-Invocation“ gegen Google Gemini, der das System dazu brachte, falsche Fakten als Langzeiterinnerungen zu speichern, einschließlich falscher Altersangaben.24

MINJA (Memory INJection Attack), angenommen bei NeurIPS 2025, zeigt, dass Angreifer mit lediglich gewöhnlicher Frage-und-Antwort-Interaktion das Langzeitgedächtnis vergiften können, und erreicht eine Injektionserfolgsrate von 98,2 % und eine Angriffserfolgsrate von 76,8 % im Durchschnitt über die getesteten Agenten.25 AgentPoison, veröffentlicht bei NeurIPS 2024, erreicht eine Angriffserfolgsrate von über 80 %, während weniger als 0,1 % der Speicheraufzeichnungen vergiftet werden und die Leistung bei gutartigen Aufgaben um weniger als 1 % sinkt.26

Datenschutz und Daten-Governance

MEXTRA, ein Black-Box-Memory-EXTRaction-Angriff, erstellt Abfragen, um gespeicherte private Daten zu extrahieren, und erreicht vollständige Extraktionsraten von 83 % gegen EHRAgent und 87 % gegen Webshopping-Agenten mit 30 Angriffs-Prompts.27 Sowohl eine Erhöhung der Abruftiefe als auch eine Vergrößerung des Gesamtspeichers erhöhen die Leckageraten.27

Die italienische Datenschutzbehörde verhängte im Dezember 2024 gegen OpenAI eine Geldstrafe von €15 Millionen, weil personenbezogene Daten zum Trainieren von ChatGPT ohne angemessene Rechtsgrundlage verarbeitet wurden; das Gericht von Rom hob die Geldstrafe im März 2026 jedoch mit der Begründung auf, dass die irische Datenschutzkommission als federführende EU-Aufsichtsbehörde zuständig sei.2829

Die Dokumentation von OpenAI besagt, dass das Ausschalten des Gedächtnisses zuvor gespeicherte Erinnerungen nicht automatisch löscht; ein vollständiges Zurücksetzen erfordert sowohl das Deaktivieren des Gedächtnisses als auch das separate Leeren vorhandener Einträge.

Technische Einschränkungen

Über zehn evaluierte Gedächtnisansätze im LoCoMo-Benchmark hinweg schneiden die meisten Methoden bei zeitlichen Schlussfolgerungsfragen schlechter ab als bei einstufigem faktischem Abruf, obwohl mindestens ein Ansatz dieses Muster umkehrt.7

Die Veralterung von Erinnerungen stellt ein weiteres ungelöstes Problem dar: Wenn gespeicherte Fakten durch neue Informationen widerlegt werden, fällt es Systemen schwer, aktuelle von veralteten Daten zu unterscheiden. Der MemConflict-Benchmark bewertet Szenarien, in denen gespeicherte Fakten veralten oder direkt in Konflikt geraten, und stellt fest, dass bestehende Systeme diese Konflikte nicht zuverlässig auflösen können.30

Darüber hinaus lässt sich die Leistung in standardisierten Benchmarks nicht zuverlässig auf Produktionszuverlässigkeit übertragen, da synthetische Umgebungen die reale Nutzung zu stark vereinfachen.31

Weiterführende Literatur

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Cem Dilmegani and Şevval Alper (2026) - "RELC-Bench: Abruf im Langkontext-Benchmark". Online veröffentlicht auf AIMultiple.com. Abgerufen am 15. September 2026, von: https://aimultiple.com/ai-memory [Online-Ressource]

Dilmegani, C., & Alper, Ş. (2026, 15. September). RELC-Bench: Abruf im Langkontext-Benchmark. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{RELC-Bench: Abruf im Langkontext-Benchmark}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Abgerufen am 15. September 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 0 Datenpunkten. Laden Sie die Zusammenfassungsdaten aus den Diagrammen und Tabellen dieses Artikels als ZIP-Datei herunter, die 0 CSV-Dateien enthält.

Zuletzt aktualisiert: 26. September 2026
Herunterladen

Möchten Sie die granularen Daten dahinter? Premium beitreten

Änderungsprotokoll

10 Aktualisierungen
  1. Ergebnisse von claude-fable-5 zum Abschnitt Methodik hinzugefügt.

  2. Ersetzte den KI-Speicher-Benchmark mit 26 Modellen durch RELC-Bench-Ergebnisse und Methodikabschnitte zum Long-Context-Retrieval.

  3. Die Daten zum „GPT-5-Ausschluss“ in der Einleitung wurden aktualisiert.

  4. Der Abschnitt „Warum große Modelle mit dem Gedächtnis kämpfen?“ wurde um architektonische Lösungen erweitert.

  5. Die Methodik des KI-Speicherbenchmarks wurde durch Fragetypen ersetzt.

Referenzlinks

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory in ChatGPT | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Rippling Customer Success Story | Decagon AI
Decagon AI
13.
Chime Customer Success Story | Decagon AI
Decagon AI
14.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments
15.
ResearchGate - Temporarily Unavailable
16.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
17.
Northwell Leverages Abridge to Drive Digital Transformation
18.
Riverside Health Case Study | Abridge
19.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
20.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
21.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
22.
OWASP Agent Memory Guard
23.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
24.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
25.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
26.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
27.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
28.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
29.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
30.
MemConflict: Evaluating Long-Term Memory Systems UnderMemory Conflicts
31.
A Survey of Agent Memory in the Second Half: TowardsSelf-Evolving and Long-Horizon Agents
Cem Dilmegani
Cem Dilmegani
Leitender Analyst
Cem ist seit 2017 leitender Analyst bei AIMultiple.

Cems Arbeit bei AIMultiple wurde von führenden globalen Publikationen wie Business Insider, Forbes, Morning Brew und Washington Post, von globalen Unternehmen wie Deloitte und HPE, von NGOs wie dem World Economic Forum und von supranationalen Organisationen wie der European Commission zitiert. [1], [2], [3], [4], [5]

Im Laufe seiner Karriere war Cem als Tech-Berater, Tech-Einkäufer und Tech-Unternehmer tätig. Er beriet Unternehmen bei ihren Technologieentscheidungen bei McKinsey & Company und Altman Solon über mehr als ein Jahrzehnt. Er veröffentlichte außerdem einen McKinsey-Bericht zur Digitalisierung.

Er leitete Technologiestrategie und -beschaffung eines Telekommunikationsunternehmens und berichtete dabei direkt an den CEO. Außerdem verantwortete er das kommerzielle Wachstum des Deep-Tech-Unternehmens Hypatos, das innerhalb von zwei Jahren von 0 einen siebenstelligen jährlich wiederkehrenden Umsatz und eine neunstellige Bewertung erreichte. Cems Arbeit bei Hypatos wurde von führenden Technologiepublikationen wie TechCrunch und Business Insider aufgegriffen.

Cem spricht regelmäßig auf internationalen Technologiekonferenzen. Er absolvierte die Bogazici University als Computeringenieur und hat einen MBA von der Columbia Business School.
Vollständiges Profil anzeigen
Technisch geprüft von
Şevval Alper
Şevval Alper
KI-Forscherin
Şevval ist KI-Forscherin bei AIMultiple. Sie hat bereits Forschungserfahrung in der Erzeugung von Pseudozufallszahlen mithilfe chaotischer Systeme.
Şevval konzentriert sich auf KI-Programmierwerkzeuge, KI-Agenten und Quantentechnologien.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450