RELC-Bench (RELC-Bench: Benchmark de recherche sur le contexte long) vise à mesurer la capacité d’un modèle à trouver et extraire une valeur numérique spécifique à partir d’un ou plusieurs documents dans son contexte. Il teste si le modèle peut se souvenir et récupérer un fait spécifique qu’il vient de voir dans l’entrée.
Résultats
claude-fable-5 obtient 97.0% sur les 100 éléments de rappel direct, et ce, quel que soit l’emplacement dans la pile de documents (97.0% début, 97.1% milieu, 97.0% fin).
Méthodologie
Question format
Une question en langage naturel demandant une mesure quantitative. Exemple :
Q : Quel était le chiffre d’affaires pour le Q1 2026 d’Adobe (ADBE) ?
Attendu : $6.40 milliards
Source des données
Le script analyse la section Points à retenir de chaque transcription de résultats de Motley Fool et extrait toutes les métriques numériques. Pour chaque métrique, le script vérifie que le nombre figure textuellement dans le corps de la transcription après la section Points à retenir (le texte réel de la conférence téléphonique), de sorte que le modèle doit lire la conversation réelle, et non les puces de résumé. Les puces de résumé sont supprimées des textes.
Règle de notation
- Chaque élément possède une liste de valeurs cibles ; la première est la cible principale (la réponse principale à la question).
- Score = 1.0 si la cible principale correspond à un nombre quelconque dans la prédiction.
- Score = 0.0 sinon.
- Les refus (« Je ne sais pas ») obtiennent 0.0.
- claude-fable-5 est testé via Claude Code : la pile de documents est fournie sous forme de fichier et le modèle y récupère les informations à l’aide d’outils de recherche au lieu de les lire depuis sa fenêtre de contexte. Ses scores mesurent le modèle conjointement avec le harnais Claude Code, et l’invariance de position est attendue dans cette configuration car la profondeur de la cible ne s’applique pas à la recherche de fichiers.
À quoi ressemble une bonne performance
Phase 1 ≥ 85% (le modèle trouve les métriques de manière fiable dans un seul document).
Phase 2 ≥ 90% (le modèle accède à la cible dans une pile de documents sans distraction).
Des scores invariants selon la position indiquent une véritable capacité de contexte long ; des scores qui déclinent avec la profondeur indiquent un « perdu au milieu ».
Nombre d’éléments
100 éléments de rappel direct répartis sur 14 transcriptions.
Pour aller plus loin
- Agents cognitifs : Créer un esprit avec LangChain
- 5 frameworks d’IA agentique open source
- Applications d’IA avec MCP : benchmark de mémoire et tutoriel
- Exécution de code avec MCP : une nouvelle approche de l’efficacité des agents d’IA
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{RELC-Bench: Benchmark de recherche sur le contexte long}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Consulté le 7 Juillet 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.