Services
Contactez-nous

RELC-Bench: Benchmark de récupération en contexte long

Cem Dilmegani
Cem Dilmegani
mis à jour le 4 août 2026

RELC-Bench (RELC-Bench : Benchmark de récupération en contexte long) vise à mesurer la capacité d'un modèle à trouver et extraire une valeur numérique spécifique d'un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu'il vient de voir dans l'entrée.

Résultats

Loading Chart

claude-fable-5 obtient 97,0 % sur les 100 éléments à rappel direct, stable quelle que soit la position dans la meule de foin (97,0 % début, 97,1 % milieu, 97,0 % fin).

Méthodologie

Question format

Une question en langage naturel demandant une métrique numérique. Exemple :

Q : Quel était le chiffre d'affaires du premier trimestre 2026 d'Adobe (ADBE) ?
Attendu : $6.40 milliards

Source des données

Le script analyse la section Points à retenir de chaque transcription de résultats Motley Fool et extrait toutes les métriques numériques. Pour chaque métrique, le script vérifie que le nombre apparaît textuellement dans le corps de la transcription après les Points à retenir (le texte réel de la conférence téléphonique), afin que le modèle doive lire la conversation réelle, pas les puces de résumé. Les puces de résumé sont supprimées des textes.

Règle de notation

  • Chaque élément dispose d'une liste de valeurs cibles ; la première est la cible principale (la réponse principale à la question)
  • Score = 1.0 si la cible principale correspond à un nombre quelconque dans la prédiction
  • Score = 0.0 sinon
  • Les refus (« Je ne sais pas ») valent 0.0
  • claude-fable-5 est testé via Claude Code : la meule de foin est fournie sous forme de fichier et le modèle y récupère les informations avec des outils de recherche au lieu de les lire depuis sa fenêtre de contexte. Ses scores mesurent le modèle avec le harnais Claude Code, et l'invariance de position est attendue dans cette configuration car la profondeur de la cible ne s'applique pas à la recherche de fichiers.

À quoi ressemble une bonne performance

Phase 1 ≥ 85 % (le modèle trouve les métriques de manière fiable dans un seul document).
Phase 2 ≥ 90 % (le modèle navigue jusqu'à la cible dans une meule de foin sans distraction).
Des scores invariants selon la position indiquent une véritable capacité de contexte long ; des scores déclinant avec la profondeur indiquent un « perdu au milieu ».

Nombre d'éléments

100 éléments à rappel direct répartis sur 14 transcriptions.

Qu'est-ce que la mémoire IA ?

La mémoire IA est la capacité d'un système d'intelligence artificielle à stocker et à rappeler des expériences passées pour améliorer la prise de décision, la perception et les performances globales.1 Contrairement à la mémoire humaine, qui est subjective et sélective, la mémoire IA est une architecture technique, un stockage structuré d'informations au sein de réseaux neuronaux ou de bases de données externes.

Le concept se distingue de la fenêtre de contexte d'un modèle, qui est le tampon de tokens fini lié à la session servant de mémoire de travail lors de l'inférence.2 Alors que la fenêtre de contexte se réinitialise entre les sessions et perd des informations lorsque les tokens sont tronqués, la mémoire IA persiste d'une session à l'autre grâce à un stockage externe.3 Elle se distingue également de la génération augmentée par récupération (RAG), qui est en lecture seule et traite la pertinence comme une propriété du contenu plutôt que de l'utilisateur ; la mémoire IA nécessite un chemin d'écriture qui extrait les faits des conversations et met à jour le stockage lorsque les informations changent.4

Le domaine reconnaît deux niveaux principaux. La mémoire à court terme, ou mémoire de travail, suit la conversation en cours au sein d'une session, tandis que la mémoire à long terme stocke des données spécifiques à l'utilisateur ou au niveau de l'application d'une session à l'autre.5 Certains frameworks ajoutent une troisième catégorie, la mémoire épisodique, qui permet aux agents de se rappeler des expériences passées spécifiques de manière similaire à la façon dont les humains se souviennent d'événements individuels.

Dans les produits grand public, la « mémoire de chat » fait référence spécifiquement aux préférences de l'utilisateur et à l'essentiel de la conversation remontés automatiquement, ce qui est architecturalement plus restreint que la « mémoire d'agent » telle qu'utilisée dans les frameworks de développement, cette dernière englobant l'état des tâches, l'historique des appels d'outils et les procédures apprises.6

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Comment fonctionne la mémoire IA ?

Les systèmes de mémoire IA convergent vers un pipeline commun d'écriture/récupération/consolidation qui diffère de la récupération statique. Les nouvelles informations entrent par une phase d'extraction qui traite les paires de messages pour identifier les faits candidats, passent par une phase de mise à jour où un LLM décide d'ajouter, de mettre à jour, de supprimer ou d'ignorer chaque fait, et sortent par une phase de récupération qui effectue une recherche sémantique au moment de la requête.7

Applications concrètes de la mémoire IA

Assistants IA personnels

La fonction de mémoire de ChatGPT d'OpenAI construit des profils persistants à partir des conversations, des fichiers et des applications connectées de l'utilisateur. Une mise à jour « Dreaming » de 2026 a introduit une synthèse en arrière-plan à travers de nombreuses conversations, permettant aux souvenirs de se mettre à jour automatiquement au fil du temps ; par exemple, un souvenir enregistré indiquant « l'utilisateur se rend à Singapour en juillet » se réécrit automatiquement en « l'utilisateur s'est rendu à Singapour en juillet 2026 » une fois le voyage passé.8 Les utilisateurs gèrent la mémoire via Paramètres > Personnalisation > Mémoire, bien qu'OpenAI note que le résumé visible ne capture pas tout ce qui est stocké.

La mémoire de Claude d'Anthropic a été lancée pour les utilisateurs du plan Team le 11 septembre 2025, étendue à Enterprise le 18 septembre 2025, et a atteint tous les utilisateurs, y compris le niveau gratuit, le 2 mars 2026.9 Le 10 juillet 2026, Anthropic a repensé la fonctionnalité en entrées catégorisées que Claude lit et met à jour pendant les conversations, remplaçant le précédent résumé quotidien unique.

Le Gemini de Google stocke les informations que les utilisateurs lui demandent de retenir ainsi que les détails déduits des conversations passées lorsque le contexte personnel est activé.10 La mise à niveau distincte « Intelligence personnelle », lorsqu'elle est activée, se connecte à Gmail et Photos sans entraîner de modèles sur ce contenu.11

Agents d'entreprise et support client

Fastweb et Vodafone Italie ont déployé un système multi-agents construit avec LangGraph et LangSmith, servant 9,5 millions de clients, injectant automatiquement les données CRM au début de chaque interaction pour identifier les clients et personnaliser les réponses. Le système affiche un taux de justesse de 90 %, un taux de résolution de 82 % et un score d'effort client de 5,2 sur 7.12

Le déploiement de Decagon avec Rippling a connecté l'agent IA aux APIs internes afin que l'agent puisse extraire les données de compte de chaque employé plutôt que de répondre de manière générique, augmentant le taux de déviation du chat de 38 % à plus de 50 %, soit une amélioration relative de 32 %.13 Le travail de Decagon avec Chime a automatisé les tâches à forte friction, notamment le remplacement de carte et les vérifications de statut de dépôt, réduisant les coûts de support client de 60 % tout en doublant les scores de satisfaction des membres.14

Robotique, santé et IA incarnée

Le robot logistique hospitalier Moxi de Diligent Robotics opère dans plus de 25 établissements américains et a réalisé plus de 1,25 million de livraisons autonomes en 2026, cartographiant chaque environnement hospitalier à l'aide de capteurs embarqués et naviguant parmi des obstacles dynamiques, y compris les portes à badge d'accès.15 Moxi 2.0 fonctionne sur le calcul NVIDIA IGX Thor avec 10 fois la capacité de traitement de l'original, entraîné sur trois années de données réelles de livraison hospitalière.

Le framework ReMEmbR de NVIDIA offre aux robots mobiles une mémoire spatio-temporelle à long horizon pour construire et raisonner sur des enregistrements continus de ce qu'ils ont vu pour les tâches de navigation.16 ASPIRE, publié le 29 juin 2026, stocke chaque correction de débogage validée comme un modèle de code nommé et réutilisable, augmentant les taux de réussite de 20 % à 92 % sur le benchmark de passation d'objets bimanuels de Robosuite grâce au débogage itératif seul.17

Dans le domaine de la santé, la plateforme de documentation IA ambiante d'Abridge est déployée par Northwell Health dans 28 hôpitaux pour réduire la charge de documentation clinique.18 Riverside Health a testé des outils de documentation ambiante pendant deux mois avant de choisir Abridge pour un déploiement élargi.19

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Avantages de la mémoire IA

Les systèmes de mémoire réduisent les coûts en tokens et la latence dans les benchmarks à horizon long par rapport à la relecture du contexte complet. Sur le benchmark LoCoMo, qui teste des conversations d'en moyenne 300 tours sur jusqu'à 35 sessions, Mem0 rapporte une économie de plus de 90 % du coût en tokens par rapport à la relecture de l'historique complet des conversations, une réduction de la latence p95 de 91 % (1,44s contre 17,12s), et une amélioration relative de 26 % du score LLM-as-a-Judge par rapport à la mémoire de base d'OpenAI.7

Zep rapporte une précision de 94,8 % sur le benchmark Deep Memory Retrieval contre 93,4 % pour MemGPT, jusqu'à 18,5 % de gains de précision globaux sur LongMemEval associé à GPT-4o, et une réduction de 90 % de la latence de réponse par rapport aux lignes de base en contexte complet, le temps de réponse médian passant de 28,9 secondes à 2,58 secondes tandis que les tokens de contexte sont passés d'environ 115 000 à 1 600.20 21

Le benchmark BEAM, testant jusqu'à 10 millions de tokens, a constaté que son framework de mémoire LIGHT améliorait les performances de 3,5 à 12,69 points de pourcentage en moyenne par rapport aux meilleures lignes de base existantes, et que même les LLMs dotés de fenêtres de contexte d'un million de tokens se dégradent considérablement à mesure que la longueur de la conversation augmente.22

L'architecture Dreaming d'OpenAI pour ChatGPT a amélioré la précision de la mémoire sensible au temps de 9,4 % à 75,1 %, avec un rappel factuel de 82,8 % et une adhésion aux préférences de 71,3 %, tout en réduisant le coût de calcul d'environ 5x.8

Défis et risques de la mémoire IA

Empoisonnement de la mémoire et sécurité

L'empoisonnement de la mémoire est classé ASI06, « Empoisonnement de la mémoire et du contexte », dans le Top 10 OWASP pour les applications agentiques, défini comme la corruption de la mémoire persistante de l'agent entraînant un désalignement et un comportement malveillant d'une session à l'autre.23 24 En février 2025, le chercheur Johann Rehberger a démontré une attaque d'« invocation d'outil différée » contre Google Gemini qui a amené le système à stocker de faux faits en tant que souvenirs à long terme, y compris des informations d'âge incorrectes.25

MINJA (Memory INJection Attack), accepté à NeurIPS 2025, montre que des attaquants avec une simple interaction requête-réponse peuvent empoisonner la mémoire à long terme, atteignant un taux de succès d'injection de 98,2 % et un taux de succès d'attaque de 76,8 % en moyenne sur les agents testés.26 AgentPoison, publié à NeurIPS 2024, atteint un taux de succès d'attaque de plus de 80 % tout en empoisonnant moins de 0,1 % des enregistrements de mémoire, dégradant les performances des tâches bénignes de moins de 1 %.27

Confidentialité et gouvernance des données

MEXTRA, une attaque d'extraction de mémoire en boîte noire, élabore des requêtes pour extraire des données privées stockées, atteignant des taux d'extraction complète de 83 % contre EHRAgent et de 87 % contre les agents d'achat en ligne en utilisant 30 invites d'attaque.28 L'augmentation de la profondeur de récupération ou de la taille totale de la mémoire augmente les taux de fuite.28

L'autorité italienne de protection des données a infligé une amende de €15 millions à OpenAI en décembre 2024 pour avoir traité des données personnelles afin d'entraîner ChatGPT sans base juridique adéquate, bien que le tribunal de Rome ait annulé l'amende en mars 2026 en jugeant que la Commission irlandaise de protection des données avait compétence en tant qu'autorité de contrôle européenne principale.29 30

La documentation d'OpenAI indique que la désactivation de la mémoire ne supprime pas automatiquement les souvenirs précédemment stockés ; une réinitialisation complète nécessite à la fois de désactiver la mémoire et de supprimer séparément les entrées existantes.

Limites techniques

Parmi les dix approches de mémoire évaluées sur le benchmark LoCoMo, la plupart des méthodes obtiennent des scores plus faibles sur les questions de raisonnement temporel que sur la récupération factuelle en une seule étape, bien qu'au moins une approche inverse ce schéma.7

L'obsolescence de la mémoire présente un autre problème non résolu : lorsque des faits stockés sont contredits par de nouvelles informations, les systèmes peinent à distinguer les données actuelles des données obsolètes. Le benchmark MemConflict évalue des scénarios où les faits stockés deviennent obsolètes ou entrent en conflit direct, constatant que les systèmes existants ne parviennent pas à résoudre ces conflits de manière fiable.31

De plus, les performances sur les benchmarks standardisés ne se traduisent pas de manière fiable en fiabilité en production, car les environnements synthétiques simplifient à outrance l'utilisation réelle.32

Lectures complémentaires

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "RELC-Bench: Benchmark de récupération en contexte long". Publié en ligne sur AIMultiple.com. Consulté le 4 Août 2026, à : https://aimultiple.com/ai-memory [Ressource en ligne]

Dilmegani, C. (2026, 4 Août). RELC-Bench: Benchmark de récupération en contexte long. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Benchmark de récupération en contexte long}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Consulté le 4 Août 2026}
}

Liens de référence

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory FAQ | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Fastweb + Vodafone: Transforming Customer Experience with AI Agents using LangGraph and LangSmith
LangChain Blog
13.
Rippling Customer Success Story | Decagon AI
Decagon AI
14.
Chime Customer Success Story | Decagon AI
Decagon AI
15.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments — Diligent Robotics
16.
ResearchGate - Temporarily Unavailable
17.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
18.
Northwell Leverages Abridge to Drive Digital Transformation
19.
Riverside Health Case Study | Abridge
20.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
21.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
22.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
23.
OWASP Agent Memory Guard | OWASP Foundation
24.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
25.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
26.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
27.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
28.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
29.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
30.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
31.
https://arxiv.org/pdf/2605.20926
32.
https://arxiv.org/pdf/2602.06052
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe des centaines de milliers d'entreprises (selon SimilarWeb) dont 60 % du Fortune 500 chaque mois.

Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes, Washington Post, des entreprises mondiales comme Deloitte, HPE et des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne.

Tout au long de sa carrière, Cem a exercé en tant que consultant tech, acheteur tech et entrepreneur tech. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus d'une décennie. Il a également publié un rapport McKinsey sur la numérisation.

Il a dirigé la stratégie technologique et les achats d'un opérateur télécom tout en rendant compte au PDG. Il a également mené la croissance commerciale de l'entreprise deep tech Hypatos qui a atteint un chiffre d'affaires récurrent annuel à 7 chiffres et une valorisation à 9 chiffres à partir de 0 en 2 ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.

Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de la Bogazici University en tant qu'ingénieur informatique et détient un MBA de la Columbia Business School.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450