Premium
Servicios
Premium

RELC-Bench: benchmark de recuperación en contexto largo

Cem Dilmegani
Cem Dilmegani
actualizado el 15 de sept. de 2026

RELC-Bench (RELC-Bench: benchmark de recuperación en contexto largo) tiene como objetivo medir la capacidad de un model para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el model puede recordar y recuperar un dato concreto que acaba de ver en la entrada.

Resultados

Cargando gráfico

claude-fable-5 obtiene 97,0 % en los 100 elementos de recuerdo directo, sin variación en las posiciones del pajar (97,0 % al inicio, 97,1 % en el medio, 97,0 % al final).

Metodología

Question format

Una pregunta en lenguaje natural que pide una métrica numérica. Ejemplo:

P: ¿Cuáles fueron los ingresos del primer trimestre de 2026 de Adobe (ADBE)?
Esperado: $6,40 mil millones

Fuente de datos

El script analiza la sección Takeaways de cada transcripción de resultados de Motley Fool y extrae todas las métricas numéricas. Para cada métrica, el script verifica que el número aparezca literalmente en el cuerpo de la transcripción posterior a Takeaways (el texto real de la conferencia), de modo que el model tiene que leer la conversación real, no el resumen con viñetas. Las viñetas de resumen se eliminan de los textos.

Regla de puntuación

  • Cada elemento tiene una lista de valores objetivo; el primero es el objetivo principal (la respuesta principal a la pregunta)
  • Puntuación = 1.0 si el objetivo principal coincide con cualquier número de la predicción
  • Puntuación = 0.0 en caso contrario
  • Las negativas («No lo sé») puntúan 0.0
  • claude-fable-5 se prueba a través de Claude Code: el pajar se proporciona como archivo y el model recupera información de él con herramientas de búsqueda en lugar de leerlo desde su ventana de contexto. Sus puntuaciones miden el model junto con el entorno de Claude Code, y se espera invarianza de posición en esta configuración porque la profundidad del objetivo no se aplica a la búsqueda en archivos.

Cómo es un buen rendimiento

Fase 1 ≥ 85 % (el model encuentra métricas de forma fiable en un solo documento).
Fase 2 ≥ 90 % (el model navega hasta el objetivo en un pajar sin distracciones).
Las puntuaciones invariantes a la posición indican una verdadera capacidad de contexto largo; las puntuaciones decrecientes según la profundidad indican «perderse en el medio».

Número de elementos

100 elementos de recuerdo directo repartidos en 14 transcripciones.

¿Qué es la memoria de IA?

La memoria de IA es la capacidad de un sistema de inteligencia artificial para almacenar y recordar experiencias pasadas con el fin de mejorar la toma de decisiones, la percepción y el rendimiento general.1 A diferencia de la memoria humana, que es subjetiva y selectiva, la memoria de IA es una arquitectura técnica, un almacén estructurado de información dentro de redes neuronales o bases de datos externas.

El concepto se distingue de la ventana de contexto de un model, que es el búfer de tokens finito y ligado a la sesión que sirve como memoria de trabajo durante inference.2 Mientras que la ventana de contexto se restablece entre sesiones y pierde información cuando se truncan los tokens, la memoria de IA persiste entre sesiones mediante almacenamiento externo.3 También es distinta de la generación aumentada por recuperación (RAG), que es de solo lectura y trata la relevancia como una propiedad del contenido y no del usuario; la memoria de IA requiere una ruta de escritura que extrae hechos de las conversaciones y actualiza el almacenamiento cuando cambia la información.4

El campo reconoce dos niveles principales. La memoria a corto plazo, o memoria de trabajo, realiza un seguimiento de la conversación en curso dentro de una sesión, mientras que la memoria a largo plazo almacena datos específicos del usuario o a nivel de aplicación entre sesiones.5 Algunos frameworks añaden una tercera categoría, la memoria episódica, que permite a los agentes recordar experiencias pasadas concretas de forma similar a cómo los humanos recuerdan acontecimientos individuales.

En los productos de consumo, la «memoria de chat» se refiere específicamente a las preferencias del usuario y al resumen de la conversación que aparece automáticamente, lo cual es arquitectónicamente más limitado que la «memoria de agente» tal como se usa en los frameworks para desarrolladores; esta última abarca el estado de las tareas, el historial de llamadas a herramientas y los procedimientos aprendidos.6

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Cómo funciona la memoria de IA?

Los sistemas de memoria de IA convergen en un pipeline común de escritura, recuperación y consolidación que difiere de la recuperación estática. La información nueva entra a través de una fase de extracción que procesa pares de mensajes para identificar hechos candidatos, pasa por una fase de actualización donde un LLM decide añadir, actualizar, eliminar o ignorar cada hecho, y sale a través de una fase de recuperación que realiza una búsqueda semántica en el momento de la consulta.7

Aplicaciones reales de la memoria de IA

Asistentes personales de IA

La función de memoria de ChatGPT de OpenAI crea perfiles persistentes a partir de conversaciones de usuarios, archivos y aplicaciones conectadas. Una actualización de 2026 denominada «Dreaming» introdujo una síntesis en segundo plano entre muchas conversaciones, lo que permite que los recuerdos se actualicen solos con el tiempo; por ejemplo, un recuerdo guardado que dice «el usuario viajará a Singapur en julio» se reescribe automáticamente como «el usuario viajó a Singapur en julio de 2026» una vez que pasa el viaje.8 Los usuarios gestionan la memoria a través de Configuración > Personalización > Memoria, aunque OpenAI señala que el resumen visible no captura todo lo almacenado.

La memoria de Claude de Anthropic se lanzó para los usuarios del plan Team el 11 de septiembre de 2025, se amplió a Enterprise el 18 de septiembre de 2025 y llegó a todos los usuarios, incluido el plan gratis, el 2 de marzo de 2026.9 El 10 de julio de 2026, Anthropic rediseñó la función en entradas categorizadas que Claude lee y actualiza durante las conversaciones, sustituyendo el anterior resumen diario único.

El Gemini de Google almacena la información que los usuarios le piden que recuerde, además de los detalles inferidos de conversaciones pasadas, cuando el contexto personal está activado.10 La mejora independiente «Personal Intelligence», cuando se activa voluntariamente, se conecta a Gmail y Fotos sin entrenar models con ese contenido.11

Agentes empresariales y atención al cliente

La implementación de Decagon con Rippling conectó al agente de IA a las APIs internas para que el agente pudiera extraer datos de cuentas de empleados individuales en lugar de responder de forma genérica, lo que aumentó la desviación de chats del 38 % a más del 50 %, una mejora relativa del 32 %.12 El trabajo de Decagon con Chime automatizó tareas de alta fricción, como la sustitución de tarjetas y las comprobaciones del estado de depósitos, reduciendo los costes de atención al cliente en un 60 % al tiempo que duplicó las puntuaciones de satisfacción de los miembros.13

Robótica, atención sanitaria e IA encarnada

El robot de logística hospitalaria Moxi de Diligent Robotics opera en más de 25 centros de EE. UU. y ha completado más de 1.25 millones de entregas autónomas a fecha de 2026, mapeando el entorno de cada hospital mediante sensores a bordo y sorteando obstáculos dinámicos, incluidas puertas con acceso por credencial.14 Moxi 2.0 funciona con la computación IGX Thor de NVIDIA, con 10 veces la capacidad de procesamiento del original, entrenado con tres años de datos reales de reparto hospitalario.

El framework ReMEmbR de NVIDIA proporciona a los robots móviles memoria espaciotemporal de horizonte largo para construir y razonar sobre registros continuos de lo que han visto en tareas de navegación.15 ASPIRE, lanzado el 29 de junio de 2026, almacena cada corrección de depuración validada como un patrón de código reutilizable con nombre, lo que eleva las tasas de éxito del 20 % al 92 % en el benchmark de transferencia bimanual de objetos de Robosuite solo mediante depuración iterativa.16

En el ámbito sanitario, la plataforma de documentación ambiental con IA de Abridge está desplegada por Northwell Health en 28 hospitales para reducir la carga de documentación clínica.17 Riverside Health probó herramientas de documentación ambiental durante dos meses antes de seleccionar a Abridge para una implementación ampliada.18

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Beneficios de la memoria de IA

Los sistemas de memoria reducen los costes de token y la latencia en benchmarks de horizonte largo en comparación con la reproducción del contexto completo. En el benchmark LoCoMo, que evalúa conversaciones con una media de 300 turnos en hasta 35 sesiones, Mem0 afirma ahorrar más del 90 % en coste de token frente a reproducir todo el historial de la conversación, reduciendo la latencia p95 en un 91 % (1.44s frente a 17.12s) y logrando una mejora relativa del 26 % en la puntuación de LLM-as-a-Judge sobre la memoria de referencia de OpenAI.7

Zep informa de una precisión del 94,8 % en el benchmark Deep Memory Retrieval frente al 93,4 % de MemGPT, de ganancias de precisión agregadas de hasta el 18,5 % en LongMemEval combinado con GPT-4o, y de una reducción del 90 % en la latencia de respuesta en comparación con las líneas de base de contexto completo, con una caída del tiempo de respuesta medio de 28,9 segundos a 2,58 segundos, mientras que los tokens de contexto cayeron de aproximadamente 115.000 a 1.600.1920

El benchmark BEAM, que evalúa hasta 10 millones de tokens, descubrió que su framework de memoria LIGHT mejoró el rendimiento entre 3.5 y 12.69 puntos porcentuales de media sobre las líneas de base existentes más sólidas, y que incluso los LLMs con ventanas de contexto de 1 millón de tokens se degradan sustancialmente a medida que crece la duración de la conversación.21

La arquitectura Dreaming de OpenAI para ChatGPT mejoró la precisión de la memoria sensible al tiempo del 9,4 % al 75,1 %, con una recuperación factual del 82,8 % y una adherencia a las preferencias del 71,3 %, al tiempo que redujo el coste de computación en aproximadamente 5x.8

Desafíos y riesgos de la memoria de IA

Envenenamiento de memoria y seguridad

El envenenamiento de memoria se clasifica como ASI06, «Envenenamiento de memoria y contexto», en el OWASP Top 10 para aplicaciones agénticas, definido como la corrupción de la memoria persistente del agente que provoca desalineación y comportamiento malicioso entre sesiones.2223 En febrero de 2025, el investigador Johann Rehberger demostró un ataque de «invocación diferida de herramientas» contra Google Gemini que provocó que el sistema almacenara hechos falsos como recuerdos a largo plazo, incluida información incorrecta sobre la edad.24

MINJA (Memory INJection Attack), aceptado en NeurIPS 2025, demuestra que los atacantes que solo tienen interacción ordinaria de consulta y respuesta pueden envenenar la memoria a largo plazo, alcanzando una tasa de éxito de inyección del 98,2 % y una tasa de éxito de ataque del 76,8 % promediadas entre los agentes evaluados.25 AgentPoison, publicado en NeurIPS 2024, logra una tasa de éxito de ataque superior al 80 % envenenando menos del 0,1 % de los registros de memoria, degradando el rendimiento de tareas benignas en menos del 1 %.26

Privacidad y gobernanza de datos

MEXTRA, un ataque de caja negra de extracción de memoria, elabora consultas para extraer datos privados almacenados, logrando tasas de extracción completa del 83 % contra EHRAgent y del 87 % contra agentes de compras web utilizando 30 prompts de ataque.27 Aumentar la profundidad de recuperación o el tamaño total de la memoria incrementa las tasas de fuga.27

La autoridad italiana de protección de datos multó a OpenAI con €15 millones en diciembre de 2024 por procesar datos personales para entrenar a ChatGPT sin una base jurídica adecuada, aunque el Tribunal de Roma anuló la multa en marzo de 2026 al dictaminar que la Comisión de Protección de Datos de Irlanda tenía jurisdicción como autoridad de control principal de la UE.2829

La documentación de OpenAI afirma que desactivar la memoria no elimina automáticamente los recuerdos almacenados previamente; un restablecimiento completo requiere desactivar la memoria y borrar por separado las entradas existentes.

Limitaciones técnicas

En los diez enfoques de memoria evaluados en el benchmark LoCoMo, la mayoría de los métodos obtienen puntuaciones más bajas en preguntas de razonamiento temporal que en la recuperación factual de un solo salto, aunque al menos un enfoque invierte este patrón.7

La obsolescencia de la memoria presenta otro problema sin resolver: cuando hechos almacenados son contradichos por información nueva, los sistemas tienen dificultades para distinguir los datos actuales de los obsoletos. El benchmark MemConflict evalúa escenarios en los que los hechos almacenados quedan obsoletos o entran en conflicto directo, y concluye que los sistemas existentes no logran resolver estos conflictos de forma fiable.30

Además, el rendimiento en benchmarks estandarizados no se traduce de forma fiable en fiabilidad en producción, porque los entornos sintéticos simplifican en exceso el uso real.31

Lecturas adicionales

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Şevval Alper (2026) - "RELC-Bench: benchmark de recuperación en contexto largo". Publicado en línea en AIMultiple.com. Recuperado el 15 de septiembre de 2026, de: https://aimultiple.com/ai-memory [Recurso en línea]

Dilmegani, C., & Alper, Ş. (2026, 15 de septiembre). RELC-Bench: benchmark de recuperación en contexto largo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{RELC-Bench: benchmark de recuperación en contexto largo}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Recuperado el 15 de septiembre de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 0 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 0 archivos CSV.

Última actualización: 26 de septiembre de 2026
Descargar

¿Quieres los datos granulares que hay detrás? Únete a Premium

Registro de cambios

10 actualizaciones
  1. Se añadieron resultados de claude-fable-5 a la sección de Metodología.

  2. Sustituida la prueba de memoria de IA con 26 modelos por las secciones de resultados y metodología de RELC-Bench.

  3. Actualizados los datos de "exclusión de GPT-5" en la introducción.

  4. Se amplió la sección "¿Por qué los modelos grandes tienen problemas con la memoria?" con soluciones arquitectónicas.

  5. Se reemplazó la metodología de evaluación de memoria de IA con tipos de preguntas.

Enlaces de referencia

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory in ChatGPT | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Rippling Customer Success Story | Decagon AI
Decagon AI
13.
Chime Customer Success Story | Decagon AI
Decagon AI
14.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments
15.
ResearchGate - Temporarily Unavailable
16.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
17.
Northwell Leverages Abridge to Drive Digital Transformation
18.
Riverside Health Case Study | Abridge
19.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
20.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
21.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
22.
OWASP Agent Memory Guard
23.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
24.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
25.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
26.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
27.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
28.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
29.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
30.
MemConflict: Evaluating Long-Term Memory Systems UnderMemory Conflicts
31.
A Survey of Agent Memory in the Second Half: TowardsSelf-Evolving and Long-Horizon Agents
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Revisado técnicamente por
Şevval Alper
Şevval Alper
Investigadora de IA
Şevval es investigadora de IA en AIMultiple. Tiene experiencia previa en investigación sobre la generación de números pseudoaleatorios mediante sistemas caóticos.
Şevval se centra en herramientas de codificación con IA, agentes de IA y tecnologías cuánticas.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450