Servicios
Contáctanos

RELC-Bench: Evaluación de Recuperación en Contexto Largo

Cem Dilmegani
Cem Dilmegani
actualizado el 4 de ago. de 2026

RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada.

Resultados

Loading Chart

claude-fable-5 obtiene 97.0 % en los 100 elementos de recuerdo directo, de manera uniforme en todas las posiciones del pajar (97.0 % al inicio, 97.1 % en el medio, 97.0 % al final).

Metodología

Question format

Una pregunta en lenguaje natural que solicita una métrica numérica. Ejemplo:

P: ¿Cuáles fueron los ingresos del T1 2026 de Adobe (ADBE)?
Esperado: $6.40 mil millones

Fuente de datos

El script analiza la sección de Conclusiones de cada transcripción de resultados de Motley Fool y extrae todas las métricas numéricas. Para cada métrica, el script verifica que el número aparezca textualmente en el cuerpo de la transcripción posterior a las Conclusiones (el texto real de la llamada de conferencia), por lo que el modelo tiene que leer la conversación real, no el resumen. Las viñetas de resumen se eliminan de los textos.

Regla de puntuación

  • Cada elemento tiene una lista de valores objetivo; el primero es el objetivo principal (la respuesta principal a la pregunta)
  • Puntuación = 1.0 si el objetivo principal coincide con cualquier número en la predicción
  • Puntuación = 0.0 en caso contrario
  • Los rechazos (“No lo sé”) obtienen 0.0
  • claude-fable-5 se prueba mediante Claude Code: el pajar se proporciona como un archivo y el modelo recupera de él con herramientas de búsqueda en lugar de leerlo desde su ventana de contexto. Sus puntuaciones miden el modelo junto con el arnés de Claude Code, y se espera invarianza de posición en esta configuración porque la profundidad del objetivo no se aplica a la búsqueda de archivos.

Cómo es un buen rendimiento

Fase 1 ≥ 85 % (el modelo encuentra métricas de forma fiable en un solo documento).
Fase 2 ≥ 90 % (el modelo navega hasta el objetivo en un pajar sin distracciones).
Las puntuaciones invariantes a la posición indican una verdadera capacidad de contexto largo; las puntuaciones decrecientes por profundidad indican “perdido en el medio”.

Cantidad de elementos

100 elementos de recuerdo directo repartidos en 14 transcripciones.

¿Qué es la memoria de IA?

La memoria de IA es la capacidad de un sistema de inteligencia artificial para almacenar y recordar experiencias pasadas con el fin de mejorar la toma de decisiones, la percepción y el rendimiento general.1 A diferencia de la memoria humana, que es subjetiva y selectiva, la memoria de IA es una arquitectura técnica, un almacén estructurado de información dentro de redes neuronales o bases de datos externas.

El concepto se distingue de la ventana de contexto de un modelo, que es el búfer finito de tokens limitado a la sesión que sirve como memoria de trabajo durante la inferencia.2 Mientras que la ventana de contexto se restablece entre sesiones y pierde información cuando los tokens se truncan, la memoria de IA persiste entre sesiones a través de almacenamiento externo.3 También se distingue de la generación aumentada por recuperación (RAG), que es de solo lectura y trata la relevancia como una propiedad del contenido en lugar del usuario; la memoria de IA requiere una ruta de escritura que extrae hechos de las conversaciones y actualiza el almacenamiento cuando la información cambia.4

El campo reconoce dos niveles principales. La memoria a corto plazo, o memoria de trabajo, rastrea la conversación en curso dentro de una sesión, mientras que la memoria a largo plazo almacena datos específicos del usuario o a nivel de aplicación entre sesiones.5 Algunos frameworks añaden una tercera categoría, la memoria episódica, que permite a los agentes recordar experiencias pasadas específicas de forma similar a como los humanos recuerdan eventos individuales.

En los productos de consumo, la “memoria de chat” se refiere específicamente a las preferencias del usuario y al resumen de la conversación que se muestran automáticamente, lo que es arquitectónicamente más limitado que la “memoria de agente” tal como se usa en los frameworks de desarrollo, esta última abarca el estado de la tarea, el historial de llamadas a herramientas y los procedimientos aprendidos.6

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

¿Cómo funciona la memoria de IA?

Los sistemas de memoria de IA convergen en un pipeline común de escritura/recuperación/consolidación que difiere de la recuperación estática. La nueva información entra a través de una fase de extracción que procesa pares de mensajes para identificar hechos candidatos, pasa por una fase de actualización donde un LLM decide agregar, actualizar, eliminar o ignorar cada hecho, y sale a través de una fase de recuperación que realiza una búsqueda semántica en el momento de la consulta.7

Aplicaciones reales de la memoria de IA

Asistentes personales de IA

La función de memoria de ChatGPT de OpenAI construye perfiles persistentes a partir de las conversaciones de los usuarios, archivos y aplicaciones conectadas. Una actualización “Dreaming” de 2026 introdujo la síntesis en segundo plano a través de muchas conversaciones, permitiendo que los recuerdos se actualicen automáticamente con el tiempo; por ejemplo, un recuerdo guardado que dice “el usuario va a Singapur en julio” se reescribe automáticamente como “el usuario fue a Singapur en julio de 2026” una vez que pasa el viaje.8 Los usuarios administran la memoria a través de Configuración > Personalización > Memoria, aunque OpenAI señala que el resumen visible no captura todo lo almacenado.

La memoria de Claude de Anthropic se lanzó para los usuarios del plan Team el 11 de septiembre de 2025, se extendió a Enterprise el 18 de septiembre de 2025, y llegó a todos los usuarios, incluido el nivel gratuito, el 2 de marzo de 2026.9 El 10 de julio de 2026, Anthropic rediseñó la función en entradas categorizadas que Claude lee y actualiza durante las conversaciones, reemplazando el anterior resumen diario único.

Gemini de Google almacena información que los usuarios le piden que recuerde más detalles inferidos de conversaciones pasadas cuando el contexto personal está habilitado.10 La actualización separada “Inteligencia Personal”, cuando se opta por ella, se conecta a Gmail y Fotos sin entrenar modelos con ese contenido.11

Agentes empresariales y atención al cliente

Fastweb y Vodafone Italia implementaron un sistema multiagente construido con LangGraph y LangSmith que atiende a 9.5 millones de clientes, inyectando automáticamente datos de CRM al inicio de cada interacción para identificar a los clientes y personalizar las respuestas. El sistema reporta una tasa de corrección del 90 %, una tasa de resolución del 82 %, y una puntuación de Esfuerzo del Cliente de 5.2 sobre 7.12

El despliegue de Decagon con Rippling conectó al agente de IA a APIs internas para que el agente pudiera extraer datos de cuentas de empleados individuales en lugar de responder de forma genérica, aumentando la desviación de chats del 38 % a más del 50 %, una mejora relativa del 32 %.13 El trabajo de Decagon con Chime automatizó tareas de alta fricción, incluyendo el reemplazo de tarjetas y la verificación del estado de depósitos, reduciendo los costes de atención al cliente en un 60 % mientras duplicaba las puntuaciones de satisfacción de los miembros.14

Robótica, atención médica e IA encarnada

El robot de logística hospitalaria Moxi de Diligent Robotics opera en más de 25 instalaciones de EE. UU. y ha completado más de 1.25 millones de entregas autónomas hasta 2026, mapeando cada entorno hospitalario utilizando sensores a bordo y navegando por obstáculos dinámicos, incluidas puertas con acceso por tarjeta.15 Moxi 2.0 funciona con computación NVIDIA IGX Thor con 10 veces la capacidad de procesamiento del original, entrenado con tres años de datos reales de entregas hospitalarias.

El framework ReMEmbR de NVIDIA proporciona a los robots móviles memoria espacio-temporal de largo horizonte para construir y razonar sobre registros en curso de lo que han visto para tareas de navegación.16 ASPIRE, lanzado el 29 de junio de 2026, almacena cada corrección de depuración validada como un patrón de código reutilizable con nombre, aumentando las tasas de éxito del 20 % al 92 % en el benchmark de transferencia de objetos bimanual de Robosuite solo mediante depuración iterativa.17

En el sector sanitario, la plataforma de documentación de IA ambiental de Abridge está implementada por Northwell Health en 28 hospitales para reducir la carga de documentación clínica.18 Riverside Health realizó una prueba piloto de herramientas de documentación ambiental durante dos meses antes de seleccionar a Abridge para un despliegue ampliado.19

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Beneficios de la memoria de IA

Los sistemas de memoria reducen los costes de tokens y la latencia en benchmarks de horizonte largo en comparación con la reproducción de contexto completo. En el benchmark LoCoMo, que prueba conversaciones con un promedio de 300 turnos en hasta 35 sesiones, Mem0 informa un ahorro de más del 90 % en costo de tokens en comparación con la reproducción del historial completo de la conversación, reduciendo la latencia p95 en un 91 % (1.44s vs. 17.12s), y logrando una mejora relativa del 26 % en la puntuación de LLM como juez sobre la línea base de memoria de OpenAI.7

Zep informa una precisión del 94.8 % en el benchmark Deep Memory Retrieval frente al 93.4 % de MemGPT, hasta un 18.5 % de ganancias de precisión agregadas en LongMemEval junto con GPT-4o, y una reducción del 90 % en la latencia de respuesta en comparación con las líneas base de contexto completo, con el tiempo de respuesta medio cayendo de 28.9 segundos a 2.58 segundos mientras que los tokens de contexto cayeron de aproximadamente 115.000 a 1.600.20 21

El benchmark BEAM, que prueba hasta 10 millones de tokens, encontró que su framework de memoria LIGHT mejoró el rendimiento en 3.5 a 12.69 puntos porcentuales en promedio sobre las líneas base existentes más sólidas, y que incluso los LLMs con ventanas de contexto de 1 millón de tokens se degradan sustancialmente a medida que crece la longitud de la conversación.22

La arquitectura Dreaming de OpenAI para ChatGPT mejoró la precisión de la memoria sensible al tiempo del 9.4 % al 75.1 %, con un recuerdo factual del 82.8 % y una adherencia a preferencias del 71.3 %, al tiempo que redujo el costo de cómputo en aproximadamente 5x.8

Retos y riesgos de la memoria de IA

Envenenamiento de memoria y seguridad

El envenenamiento de memoria se clasifica como ASI06, “Envenenamiento de Memoria y Contexto”, en el OWASP Top 10 para Aplicaciones Agentivas, definido como la corrupción de la memoria persistente del agente que conduce a desalineación y comportamiento malicioso entre sesiones.23 24 En febrero de 2025, el investigador Johann Rehberger demostró un ataque de “invocación de herramienta retrasada” contra Gemini de Google que causó que el sistema almacenara hechos falsos como recuerdos a largo plazo, incluyendo información de edad incorrecta.25

MINJA (Ataque de INyección de Memoria), aceptado en NeurIPS 2025, muestra que los atacantes con solo una interacción ordinaria de consulta y respuesta pueden envenenar la memoria a largo plazo, alcanzando una tasa de éxito de inyección del 98.2 % y una tasa de éxito de ataque del 76.8 % en promedio entre los agentes probados.26 AgentPoison, publicado en NeurIPS 2024, logra más del 80 % de tasa de éxito de ataque mientras envenena menos del 0.1 % de los registros de memoria, degradando el rendimiento de tareas benignas en menos del 1 %.27

Privacidad y gobernanza de datos

MEXTRA, un ataque de caja negra de EXTRacción de Memoria, elabora consultas para extraer datos privados almacenados, logrando tasas de extracción completa del 83 % contra EHRAgent y del 87 % contra agentes de compras web utilizando 30 indicaciones de ataque.28 Aumentar la profundidad de recuperación o el tamaño total de la memoria aumenta las tasas de fuga.28

La autoridad de protección de datos de Italia multó a OpenAI con €15 millones en diciembre de 2024 por procesar datos personales para entrenar ChatGPT sin una base legal adecuada, aunque el Tribunal de Roma anuló la multa en marzo de 2026 dictaminando que la Comisión de Protección de Datos de Irlanda tenía jurisdicción como autoridad de supervisión principal de la UE.29 30

La documentación de OpenAI indica que desactivar la memoria no elimina automáticamente los recuerdos almacenados previamente; un restablecimiento completo requiere tanto deshabilitar la memoria como borrar por separado las entradas existentes.

Limitaciones técnicas

En diez enfoques de memoria evaluados en el benchmark LoCoMo, la mayoría de los métodos obtienen puntuaciones más bajas en preguntas de razonamiento temporal que en la recuperación factual de un solo salto, aunque al menos un enfoque invierte este patrón.7

La obsolescencia de la memoria presenta otro problema sin resolver: cuando los hechos almacenados son contradichos por nueva información, los sistemas luchan por distinguir los datos actuales de los obsoletos. El benchmark MemConflict evalúa escenarios donde los hechos almacenados se vuelven obsoletos o entran en conflicto directo, encontrando que los sistemas existentes no logran resolver estos conflictos de manera confiable.31

Además, el rendimiento en benchmarks estandarizados no se traduce de manera confiable en fiabilidad de producción porque los entornos sintéticos simplifican en exceso el uso real.32

Lecturas adicionales

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani (2026) - "RELC-Bench: Evaluación de Recuperación en Contexto Largo". Publicado en línea en AIMultiple.com. Recuperado el 4 de Agosto de 2026, de: https://aimultiple.com/ai-memory [Recurso en línea]

Dilmegani, C. (2026, 4 de Agosto). RELC-Bench: Evaluación de Recuperación en Contexto Largo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Evaluación de Recuperación en Contexto Largo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Recuperado el 4 de Agosto de 2026}
}

Enlaces de referencia

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory FAQ | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Fastweb + Vodafone: Transforming Customer Experience with AI Agents using LangGraph and LangSmith
LangChain Blog
13.
Rippling Customer Success Story | Decagon AI
Decagon AI
14.
Chime Customer Success Story | Decagon AI
Decagon AI
15.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments — Diligent Robotics
16.
ResearchGate - Temporarily Unavailable
17.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
18.
Northwell Leverages Abridge to Drive Digital Transformation
19.
Riverside Health Case Study | Abridge
20.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
21.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
22.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
23.
OWASP Agent Memory Guard | OWASP Foundation
24.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
25.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
26.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
27.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
28.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
29.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
30.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
31.
https://arxiv.org/pdf/2605.20926
32.
https://arxiv.org/pdf/2602.06052
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluido el 60% de Fortune 500 cada mes.

El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.

A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450