Services
Contactez-nous

RELC-Bench: Benchmark de recherche sur le contexte long

Cem Dilmegani
Cem Dilmegani
mis à jour le 7 juil. 2026

RELC-Bench (RELC-Bench: Benchmark de recherche sur le contexte long) vise à mesurer la capacité d’un modèle à trouver et extraire une valeur numérique spécifique à partir d’un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu’il vient de voir dans l’entrée.

Résultats

Loading Chart

claude-fable-5 obtient 97.0% sur les 100 éléments de rappel direct, et ce, quel que soit l’emplacement dans la pile de documents (97.0% début, 97.1% milieu, 97.0% fin).

Méthodologie

Question format

Une question en langage naturel demandant une mesure quantitative. Exemple :

Q : Quel était le chiffre d’affaires pour le Q1 2026 d’Adobe (ADBE) ?
Attendu : $6.40 milliards

Source des données

Le script analyse la section Points à retenir de chaque transcription de résultats de Motley Fool et extrait toutes les métriques numériques. Pour chaque métrique, le script vérifie que le nombre figure textuellement dans le corps de la transcription après la section Points à retenir (le texte réel de la conférence téléphonique), de sorte que le modèle doit lire la conversation réelle, et non les puces de résumé. Les puces de résumé sont supprimées des textes.

Règle de notation

  • Chaque élément possède une liste de valeurs cibles ; la première est la cible principale (la réponse principale à la question).
  • Score = 1.0 si la cible principale correspond à un nombre quelconque dans la prédiction.
  • Score = 0.0 sinon.
  • Les refus (« Je ne sais pas ») obtiennent 0.0.
  • claude-fable-5 est testé via Claude Code : la pile de documents est fournie sous forme de fichier et le modèle y récupère les informations à l’aide d’outils de recherche au lieu de les lire depuis sa fenêtre de contexte. Ses scores mesurent le modèle conjointement avec le harnais Claude Code, et l’invariance de position est attendue dans cette configuration car la profondeur de la cible ne s’applique pas à la recherche de fichiers.

À quoi ressemble une bonne performance

Phase 1 ≥ 85% (le modèle trouve les métriques de manière fiable dans un seul document).
Phase 2 ≥ 90% (le modèle accède à la cible dans une pile de documents sans distraction).
Des scores invariants selon la position indiquent une véritable capacité de contexte long ; des scores qui déclinent avec la profondeur indiquent un « perdu au milieu ».

Nombre d’éléments

100 éléments de rappel direct répartis sur 14 transcriptions.

Pour aller plus loin

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "RELC-Bench: Benchmark de recherche sur le contexte long". Publié en ligne sur AIMultiple.com. Consulté le 7 Juillet 2026, à : https://aimultiple.com/ai-memory [Ressource en ligne]

Dilmegani, C. (2026, 7 Juillet). RELC-Bench: Benchmark de recherche sur le contexte long. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Benchmark de recherche sur le contexte long}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Consulté le 7 Juillet 2026}
}
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe chaque mois des centaines de milliers d'entreprises (selon similarWeb), dont 55 % des entreprises du classement Fortune 500. Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes et le Washington Post, ainsi que par des entreprises mondiales comme Deloitte et HPE, des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne. Vous trouverez d'autres entreprises et ressources réputées ayant fait référence à AIMultiple. Tout au long de sa carrière, Cem a exercé les fonctions de consultant, d'acheteur et d'entrepreneur dans le secteur des technologies. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la numérisation. Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité directe du PDG. Il a également piloté la croissance commerciale de la société de deep tech Hypatos, qui a atteint un chiffre d'affaires annuel récurrent à sept chiffres et une valorisation à neuf chiffres en seulement deux ans. Les travaux de Cem chez Hypatos ont été présentés dans des publications technologiques de référence telles que TechCrunch et Business Insider. Cem intervient régulièrement lors de conférences internationales sur les technologies. Diplômé en génie informatique de l'université de Bogazici, il est également titulaire d'un MBA de la Columbia Business School.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450