RELC-Bench (RELC-Bench: Evaluación de Recuperación en Contexto Largo) tiene como objetivo medir la capacidad de un modelo para encontrar y extraer un valor numérico específico de uno o más documentos dentro de su contexto. Comprueba si el modelo puede recordar y recuperar un hecho específico que acaba de ver en la entrada.
Resultados
claude-fable-5 obtiene 97.0 % en los 100 elementos de recuerdo directo, de manera uniforme en todas las posiciones del pajar (97.0 % al inicio, 97.1 % en el medio, 97.0 % al final).
Metodología
Question format
Una pregunta en lenguaje natural que solicita una métrica numérica. Ejemplo:
P: ¿Cuáles fueron los ingresos del T1 2026 de Adobe (ADBE)?
Esperado: $6.40 mil millones
Fuente de datos
El script analiza la sección de Conclusiones de cada transcripción de resultados de Motley Fool y extrae todas las métricas numéricas. Para cada métrica, el script verifica que el número aparezca textualmente en el cuerpo de la transcripción posterior a las Conclusiones (el texto real de la llamada de conferencia), por lo que el modelo tiene que leer la conversación real, no el resumen. Las viñetas de resumen se eliminan de los textos.
Regla de puntuación
- Cada elemento tiene una lista de valores objetivo; el primero es el objetivo principal (la respuesta principal a la pregunta)
- Puntuación = 1.0 si el objetivo principal coincide con cualquier número en la predicción
- Puntuación = 0.0 en caso contrario
- Los rechazos (“No lo sé”) obtienen 0.0
- claude-fable-5 se prueba mediante Claude Code: el pajar se proporciona como un archivo y el modelo recupera de él con herramientas de búsqueda en lugar de leerlo desde su ventana de contexto. Sus puntuaciones miden el modelo junto con el arnés de Claude Code, y se espera invarianza de posición en esta configuración porque la profundidad del objetivo no se aplica a la búsqueda de archivos.
Cómo es un buen rendimiento
Fase 1 ≥ 85 % (el modelo encuentra métricas de forma fiable en un solo documento).
Fase 2 ≥ 90 % (el modelo navega hasta el objetivo en un pajar sin distracciones).
Las puntuaciones invariantes a la posición indican una verdadera capacidad de contexto largo; las puntuaciones decrecientes por profundidad indican “perdido en el medio”.
Cantidad de elementos
100 elementos de recuerdo directo repartidos en 14 transcripciones.
¿Qué es la memoria de IA?
La memoria de IA es la capacidad de un sistema de inteligencia artificial para almacenar y recordar experiencias pasadas con el fin de mejorar la toma de decisiones, la percepción y el rendimiento general.1 A diferencia de la memoria humana, que es subjetiva y selectiva, la memoria de IA es una arquitectura técnica, un almacén estructurado de información dentro de redes neuronales o bases de datos externas.
El concepto se distingue de la ventana de contexto de un modelo, que es el búfer finito de tokens limitado a la sesión que sirve como memoria de trabajo durante la inferencia.2 Mientras que la ventana de contexto se restablece entre sesiones y pierde información cuando los tokens se truncan, la memoria de IA persiste entre sesiones a través de almacenamiento externo.3 También se distingue de la generación aumentada por recuperación (RAG), que es de solo lectura y trata la relevancia como una propiedad del contenido en lugar del usuario; la memoria de IA requiere una ruta de escritura que extrae hechos de las conversaciones y actualiza el almacenamiento cuando la información cambia.4
El campo reconoce dos niveles principales. La memoria a corto plazo, o memoria de trabajo, rastrea la conversación en curso dentro de una sesión, mientras que la memoria a largo plazo almacena datos específicos del usuario o a nivel de aplicación entre sesiones.5 Algunos frameworks añaden una tercera categoría, la memoria episódica, que permite a los agentes recordar experiencias pasadas específicas de forma similar a como los humanos recuerdan eventos individuales.
En los productos de consumo, la “memoria de chat” se refiere específicamente a las preferencias del usuario y al resumen de la conversación que se muestran automáticamente, lo que es arquitectónicamente más limitado que la “memoria de agente” tal como se usa en los frameworks de desarrollo, esta última abarca el estado de la tarea, el historial de llamadas a herramientas y los procedimientos aprendidos.6
¿Cómo funciona la memoria de IA?
Los sistemas de memoria de IA convergen en un pipeline común de escritura/recuperación/consolidación que difiere de la recuperación estática. La nueva información entra a través de una fase de extracción que procesa pares de mensajes para identificar hechos candidatos, pasa por una fase de actualización donde un LLM decide agregar, actualizar, eliminar o ignorar cada hecho, y sale a través de una fase de recuperación que realiza una búsqueda semántica en el momento de la consulta.7
Aplicaciones reales de la memoria de IA
Asistentes personales de IA
La función de memoria de ChatGPT de OpenAI construye perfiles persistentes a partir de las conversaciones de los usuarios, archivos y aplicaciones conectadas. Una actualización “Dreaming” de 2026 introdujo la síntesis en segundo plano a través de muchas conversaciones, permitiendo que los recuerdos se actualicen automáticamente con el tiempo; por ejemplo, un recuerdo guardado que dice “el usuario va a Singapur en julio” se reescribe automáticamente como “el usuario fue a Singapur en julio de 2026” una vez que pasa el viaje.8 Los usuarios administran la memoria a través de Configuración > Personalización > Memoria, aunque OpenAI señala que el resumen visible no captura todo lo almacenado.
La memoria de Claude de Anthropic se lanzó para los usuarios del plan Team el 11 de septiembre de 2025, se extendió a Enterprise el 18 de septiembre de 2025, y llegó a todos los usuarios, incluido el nivel gratuito, el 2 de marzo de 2026.9 El 10 de julio de 2026, Anthropic rediseñó la función en entradas categorizadas que Claude lee y actualiza durante las conversaciones, reemplazando el anterior resumen diario único.
Gemini de Google almacena información que los usuarios le piden que recuerde más detalles inferidos de conversaciones pasadas cuando el contexto personal está habilitado.10 La actualización separada “Inteligencia Personal”, cuando se opta por ella, se conecta a Gmail y Fotos sin entrenar modelos con ese contenido.11
Agentes empresariales y atención al cliente
Fastweb y Vodafone Italia implementaron un sistema multiagente construido con LangGraph y LangSmith que atiende a 9.5 millones de clientes, inyectando automáticamente datos de CRM al inicio de cada interacción para identificar a los clientes y personalizar las respuestas. El sistema reporta una tasa de corrección del 90 %, una tasa de resolución del 82 %, y una puntuación de Esfuerzo del Cliente de 5.2 sobre 7.12
El despliegue de Decagon con Rippling conectó al agente de IA a APIs internas para que el agente pudiera extraer datos de cuentas de empleados individuales en lugar de responder de forma genérica, aumentando la desviación de chats del 38 % a más del 50 %, una mejora relativa del 32 %.13 El trabajo de Decagon con Chime automatizó tareas de alta fricción, incluyendo el reemplazo de tarjetas y la verificación del estado de depósitos, reduciendo los costes de atención al cliente en un 60 % mientras duplicaba las puntuaciones de satisfacción de los miembros.14
Robótica, atención médica e IA encarnada
El robot de logística hospitalaria Moxi de Diligent Robotics opera en más de 25 instalaciones de EE. UU. y ha completado más de 1.25 millones de entregas autónomas hasta 2026, mapeando cada entorno hospitalario utilizando sensores a bordo y navegando por obstáculos dinámicos, incluidas puertas con acceso por tarjeta.15 Moxi 2.0 funciona con computación NVIDIA IGX Thor con 10 veces la capacidad de procesamiento del original, entrenado con tres años de datos reales de entregas hospitalarias.
El framework ReMEmbR de NVIDIA proporciona a los robots móviles memoria espacio-temporal de largo horizonte para construir y razonar sobre registros en curso de lo que han visto para tareas de navegación.16 ASPIRE, lanzado el 29 de junio de 2026, almacena cada corrección de depuración validada como un patrón de código reutilizable con nombre, aumentando las tasas de éxito del 20 % al 92 % en el benchmark de transferencia de objetos bimanual de Robosuite solo mediante depuración iterativa.17
En el sector sanitario, la plataforma de documentación de IA ambiental de Abridge está implementada por Northwell Health en 28 hospitales para reducir la carga de documentación clínica.18 Riverside Health realizó una prueba piloto de herramientas de documentación ambiental durante dos meses antes de seleccionar a Abridge para un despliegue ampliado.19
Beneficios de la memoria de IA
Los sistemas de memoria reducen los costes de tokens y la latencia en benchmarks de horizonte largo en comparación con la reproducción de contexto completo. En el benchmark LoCoMo, que prueba conversaciones con un promedio de 300 turnos en hasta 35 sesiones, Mem0 informa un ahorro de más del 90 % en costo de tokens en comparación con la reproducción del historial completo de la conversación, reduciendo la latencia p95 en un 91 % (1.44s vs. 17.12s), y logrando una mejora relativa del 26 % en la puntuación de LLM como juez sobre la línea base de memoria de OpenAI.7
Zep informa una precisión del 94.8 % en el benchmark Deep Memory Retrieval frente al 93.4 % de MemGPT, hasta un 18.5 % de ganancias de precisión agregadas en LongMemEval junto con GPT-4o, y una reducción del 90 % en la latencia de respuesta en comparación con las líneas base de contexto completo, con el tiempo de respuesta medio cayendo de 28.9 segundos a 2.58 segundos mientras que los tokens de contexto cayeron de aproximadamente 115.000 a 1.600.20 21
El benchmark BEAM, que prueba hasta 10 millones de tokens, encontró que su framework de memoria LIGHT mejoró el rendimiento en 3.5 a 12.69 puntos porcentuales en promedio sobre las líneas base existentes más sólidas, y que incluso los LLMs con ventanas de contexto de 1 millón de tokens se degradan sustancialmente a medida que crece la longitud de la conversación.22
La arquitectura Dreaming de OpenAI para ChatGPT mejoró la precisión de la memoria sensible al tiempo del 9.4 % al 75.1 %, con un recuerdo factual del 82.8 % y una adherencia a preferencias del 71.3 %, al tiempo que redujo el costo de cómputo en aproximadamente 5x.8
Retos y riesgos de la memoria de IA
Envenenamiento de memoria y seguridad
El envenenamiento de memoria se clasifica como ASI06, “Envenenamiento de Memoria y Contexto”, en el OWASP Top 10 para Aplicaciones Agentivas, definido como la corrupción de la memoria persistente del agente que conduce a desalineación y comportamiento malicioso entre sesiones.23 24 En febrero de 2025, el investigador Johann Rehberger demostró un ataque de “invocación de herramienta retrasada” contra Gemini de Google que causó que el sistema almacenara hechos falsos como recuerdos a largo plazo, incluyendo información de edad incorrecta.25
MINJA (Ataque de INyección de Memoria), aceptado en NeurIPS 2025, muestra que los atacantes con solo una interacción ordinaria de consulta y respuesta pueden envenenar la memoria a largo plazo, alcanzando una tasa de éxito de inyección del 98.2 % y una tasa de éxito de ataque del 76.8 % en promedio entre los agentes probados.26 AgentPoison, publicado en NeurIPS 2024, logra más del 80 % de tasa de éxito de ataque mientras envenena menos del 0.1 % de los registros de memoria, degradando el rendimiento de tareas benignas en menos del 1 %.27
Privacidad y gobernanza de datos
MEXTRA, un ataque de caja negra de EXTRacción de Memoria, elabora consultas para extraer datos privados almacenados, logrando tasas de extracción completa del 83 % contra EHRAgent y del 87 % contra agentes de compras web utilizando 30 indicaciones de ataque.28 Aumentar la profundidad de recuperación o el tamaño total de la memoria aumenta las tasas de fuga.28
La autoridad de protección de datos de Italia multó a OpenAI con €15 millones en diciembre de 2024 por procesar datos personales para entrenar ChatGPT sin una base legal adecuada, aunque el Tribunal de Roma anuló la multa en marzo de 2026 dictaminando que la Comisión de Protección de Datos de Irlanda tenía jurisdicción como autoridad de supervisión principal de la UE.29 30
La documentación de OpenAI indica que desactivar la memoria no elimina automáticamente los recuerdos almacenados previamente; un restablecimiento completo requiere tanto deshabilitar la memoria como borrar por separado las entradas existentes.
Limitaciones técnicas
En diez enfoques de memoria evaluados en el benchmark LoCoMo, la mayoría de los métodos obtienen puntuaciones más bajas en preguntas de razonamiento temporal que en la recuperación factual de un solo salto, aunque al menos un enfoque invierte este patrón.7
La obsolescencia de la memoria presenta otro problema sin resolver: cuando los hechos almacenados son contradichos por nueva información, los sistemas luchan por distinguir los datos actuales de los obsoletos. El benchmark MemConflict evalúa escenarios donde los hechos almacenados se vuelven obsoletos o entran en conflicto directo, encontrando que los sistemas existentes no logran resolver estos conflictos de manera confiable.31
Además, el rendimiento en benchmarks estandarizados no se traduce de manera confiable en fiabilidad de producción porque los entornos sintéticos simplifican en exceso el uso real.32
Lecturas adicionales
- Agentes Cognitivos: Creando una Mente con LangChain
- 5 Frameworks de IA Agentiva de Código Abierto
- Aplicaciones de IA con MCP Benchmark de Memoria y Tutorial
- Ejecución de Código con MCP: Un Nuevo Enfoque para la Eficiencia de los Agentes de IA
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{RELC-Bench: Evaluación de Recuperación en Contexto Largo}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Recuperado el 4 de Agosto de 2026}
}Enlaces de referencia
El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea.
A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.
Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.
Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.