Premium
Serviços
Premium

RELC-Bench: Benchmark de Recuperação em Contexto Longo

Cem Dilmegani
Cem Dilmegani
atualizado em 15 set. 2026

O RELC-Bench (RELC-Bench: Benchmark de Recuperação em Contexto Longo) visa medir a capacidade de um model de encontrar e extrair um valor numérico específico de um ou mais documentos dentro de seu contexto. Ele testa se o model consegue lembrar e recuperar um fato específico que acabou de ver na entrada.

Resultados

Carregando gráfico

claude-fable-5 pontua 97,0% nos 100 itens de recordação direta, estável em todas as posições do haystack (97,0% início, 97,1% meio, 97,0% fim).

Metodologia

Question format

Uma pergunta em linguagem natural solicitando uma métrica numérica. Exemplo:

P: Qual foi a Receita do Q1 de 2026 da Adobe (ADBE)?
Esperado: $6,40 bilhões

Fonte de dados

O script analisa a seção Takeaways de cada transcrição de resultados da Motley Fool e extrai todas as métricas numéricas. Para cada métrica, o script verifica se o número aparece literalmente no corpo da transcrição pós-Takeaways (o texto real da teleconferência), para que o model precise ler a conversa real, e não o resumo em tópicos. Os resumos em tópicos são removidos dos textos.

Regra de pontuação

  • Cada item tem uma lista de valores alvo; o primeiro é o alvo primário (a resposta principal à pergunta)
  • Pontuação = 1.0 se o alvo primário corresponder a qualquer número na previsão
  • Pontuação = 0.0 caso contrário
  • Recusas (“não sei”) pontuam 0.0
  • claude-fable-5 é testado por meio do Claude Code: o haystack é fornecido como um arquivo e o model recupera informações dele com ferramentas de busca em vez de lê-lo em sua janela de contexto. Suas pontuações medem o model em conjunto com o harness do Claude Code, e a invariância de posição é esperada nessa configuração porque a profundidade do alvo não se aplica à busca em arquivos.

Como é um bom desempenho

Fase 1 ≥ 85% (o model encontra métricas de forma confiável em um único documento).
Fase 2 ≥ 90% (o model navega até o alvo em um haystack sem distração).
Pontuações invariantes à posição indicam capacidade real de contexto longo; pontuações decrescentes por profundidade indicam “perdido no meio”.

Número de itens

100 itens de recordação direta distribuídos em 14 transcrições.

O que é memória de IA?

A memória de IA é a capacidade de um sistema de inteligência artificial de armazenar e recordar experiências passadas para melhorar a tomada de decisão, a percepção e o desempenho geral.1 Diferentemente da memória humana, que é subjetiva e seletiva, a memória de IA é uma arquitetura técnica, um armazenamento estruturado de informações dentro de redes neurais ou bancos de dados externos.

O conceito é distinto da janela de contexto de um model, que é o buffer de tokens finito e limitado à sessão que serve como memória de trabalho durante a inference.2 Enquanto a janela de contexto é redefinida entre sessões e perde informações quando os tokens são truncados, a memória de IA persiste entre sessões por meio de armazenamento externo.3 Também é distinta da geração aumentada por recuperação (RAG), que é somente leitura e trata a relevância como uma propriedade do conteúdo em vez do usuário; a memória de IA exige um caminho de escrita que extrai fatos das conversas e atualiza o armazenamento quando as informações mudam.4

O campo reconhece dois níveis principais. A memória de curto prazo, ou memória de trabalho, acompanha a conversa em andamento dentro de uma sessão, enquanto a memória de longo prazo armazena dados específicos do usuário ou de nível de aplicação entre sessões.5 Alguns frameworks adicionam uma terceira categoria, a memória episódica, que permite que os agentes recordem experiências passadas específicas, de forma semelhante a como os humanos se lembram de eventos individuais.

Em produtos de consumo, “memória de chat” refere-se especificamente às preferências do usuário e ao resumo da conversa exibidos automaticamente, o que é arquiteturalmente mais restrito do que a “memória de agente” usada em frameworks de desenvolvimento, esta última abrangendo estado de tarefas, histórico de chamadas de ferramentas e procedimentos aprendidos.6

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Como funciona a memória de IA?

Os sistemas de memória de IA convergem para um pipeline comum de escrita/recuperação/consolidação que difere da recuperação estática. Novas informações entram por uma fase de extração que processa pares de mensagens para identificar fatos candidatos, passam por uma fase de atualização em que um LLM decide adicionar, atualizar, excluir ou ignorar cada fato e saem por uma fase de recuperação que realiza busca semântica no momento da consulta.7

Aplicações reais da memória de IA

Assistentes pessoais de IA

A funcionalidade de memória do ChatGPT da OpenAI cria perfis persistentes a partir de conversas, arquivos e aplicativos conectados do usuário. Uma atualização “Dreaming” de 2026 introduziu síntese em segundo plano entre muitas conversas, permitindo que as memórias se autoatualizassem ao longo do tempo; por exemplo, uma memória salva afirmando “o usuário irá para Singapura em julho” se reescreve automaticamente para “o usuário foi para Singapura em julho de 2026” quando a viagem termina.8 Os usuários gerenciam a memória por meio de Configurações > Personalização > Memória, embora a OpenAI observe que o resumo visível não captura tudo o que está armazenado.

A memória do Claude da Anthropic foi lançada para usuários do plano Team em 11 de setembro de 2025, estendida ao Enterprise em 18 de setembro de 2025 e chegou a todos os usuários, incluindo o plano gratuito, em 2 de março de 2026.9 Em 10 de julho de 2026, a Anthropic redesenhou a funcionalidade em entradas categorizadas que o Claude lê e atualiza durante as conversas, substituindo o antigo resumo diário único.

O Gemini do Google armazena informações que os usuários pedem para ele lembrar, além de detalhes inferidos de conversas anteriores, quando o contexto pessoal está ativado.10 A atualização separada “Personal Intelligence”, quando aceita, conecta-se ao Gmail e ao Fotos sem treinar models com esse conteúdo.11

Agentes empresariais e suporte ao cliente

A implementação da Decagon com a Rippling conectou o agente de IA a APIs internas para que o agente pudesse extrair dados individuais de contas de funcionários em vez de responder de forma genérica, aumentando o desvio de chat de 38% para mais de 50%, uma melhoria relativa de 32%.12 O trabalho da Decagon com a Chime automatizou tarefas de alto atrito, incluindo substituição de cartão e verificação de status de depósito, reduzindo os custos de suporte ao cliente em 60% e dobrando as pontuações de satisfação dos membros.13

Robótica, saúde e IA incorporada

O robô de logística hospitalar Moxi da Diligent Robotics opera em mais de 25 instalações nos EUA e concluiu mais de 1.25 milhão de entregas autônomas até 2026, mapeando cada ambiente hospitalar com sensores integrados e navegando por obstáculos dinâmicos, incluindo portas com acesso por crachá.14 O Moxi 2.0 roda na computação NVIDIA IGX Thor com 10 vezes a capacidade de processamento do original, treinado com três anos de dados reais de entregas hospitalares.

O framework ReMEmbR da NVIDIA oferece aos robôs móveis memória espaço-temporal de longo horizonte para construir e raciocinar sobre registros contínuos do que viram em tarefas de navegação.15 O ASPIRE, lançado em 29 de junho de 2026, armazena cada correção de depuração validada como um padrão de código nomeado e reutilizável, elevando as taxas de sucesso de 20% para 92% no benchmark de transferência bimanual de objetos do Robosuite apenas com depuração iterativa.16

Na área da saúde, a plataforma de documentação de IA ambiente da Abridge é implementada pela Northwell Health em 28 hospitais para reduzir a carga de documentação clínica.17 A Riverside Health testou ferramentas de documentação ambiente por dois meses antes de selecionar a Abridge para uma implementação ampliada.18

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Benefícios da memória de IA

Os sistemas de memória reduzem custos de tokens e latência em benchmarks de longo horizonte em comparação com a repetição de contexto completo. No benchmark LoCoMo, que testa conversas com média de 300 turnos em até 35 sessões, a Mem0 relata economia de mais de 90% no custo de tokens em comparação com repetir todo o histórico da conversa, reduzindo a latência p95 em 91% (1.44s vs. 17.12s) e alcançando uma melhoria relativa de 26% na pontuação LLM-as-a-Judge em relação à linha de base de memória da OpenAI.7

A Zep relata 94,8% de precisão no benchmark Deep Memory Retrieval, contra 93,4% do MemGPT, ganhos de precisão agregados de até 18,5% no LongMemEval em conjunto com o GPT-4o e uma redução de 90% na latência de resposta em comparação com linhas de base de contexto completo, com o tempo de resposta mediano caindo de 28,9 segundos para 2,58 segundos enquanto os tokens de contexto caíram de aproximadamente 115.000 para 1.600.1920

O benchmark BEAM, que testa até 10 milhões de tokens, descobriu que seu framework de memória LIGHT melhorou o desempenho em 3.5 a 12.69 pontos percentuais em média em relação às linhas de base existentes mais fortes, e que mesmo LLMs com janelas de contexto de 1 milhão de tokens se degradam substancialmente à medida que a conversa cresce.21

A arquitetura Dreaming da OpenAI para o ChatGPT melhorou a precisão da memória sensível ao tempo de 9,4% para 75,1%, com recordação factual de 82,8% e adesão a preferências de 71,3%, ao mesmo tempo em que reduziu o custo computacional em cerca de 5x.8

Desafios e riscos da memória de IA

Envenenamento de memória e segurança

O envenenamento de memória é classificado como ASI06, “Envenenamento de Memória e Contexto”, no OWASP Top 10 para Aplicações Agênticas, definido como a corrupção da memória persistente do agente que leva ao desalinhamento e a comportamentos maliciosos entre sessões.2223 Em fevereiro de 2025, o pesquisador Johann Rehberger demonstrou um ataque de “invocação de ferramenta adiada” contra o Gemini do Google que fez o sistema armazenar fatos falsos como memórias de longo prazo, incluindo informações de idade incorretas.24

O MINJA (Memory INJection Attack), aceito no NeurIPS 2025, mostra que atacantes com apenas interação comum de consulta e resposta podem envenenar a memória de longo prazo, alcançando 98,2% de taxa de sucesso de injeção e 76,8% de taxa de sucesso de ataque, em média, entre os agentes testados.25 O AgentPoison, publicado no NeurIPS 2024, alcança mais de 80% de taxa de sucesso de ataque enquanto envenena menos de 0,1% dos registros de memória, degradando o desempenho em tarefas benignas em menos de 1%.26

Privacidade e governança de dados

O MEXTRA, um ataque de caixa-preta de extração de memória (Memory EXTRaction Attack), cria consultas para extrair dados privados armazenados, alcançando taxas de extração completa de 83% contra o EHRAgent e 87% contra agentes de compras na web usando 30 prompts de ataque.27 Aumentar a profundidade de recuperação ou o tamanho total da memória aumenta as taxas de vazamento.27

A autoridade de proteção de dados da Itália multou a OpenAI em €15 milhões em dezembro de 2024 por processar dados pessoais para treinar o ChatGPT sem base legal adequada, embora o Tribunal de Roma tenha anulado a multa em março de 2026, decidindo que a Comissão de Proteção de Dados da Irlanda tinha jurisdição como autoridade supervisora principal da UE.2829

A documentação da OpenAI afirma que desativar a memória não exclui automaticamente as memórias armazenadas anteriormente; uma redefinição completa exige tanto desativar a memória quanto limpar separadamente as entradas existentes.

Limitações técnicas

Entre dez abordagens de memória avaliadas no benchmark LoCoMo, a maioria dos métodos pontua menos em questões de raciocínio temporal do que em recuperação factual de salto único, embora pelo menos uma abordagem inverta esse padrão.7

A desatualização da memória apresenta outro problema não resolvido: quando fatos armazenados são contraditos por novas informações, os sistemas têm dificuldade em distinguir dados atuais de dados desatualizados. O benchmark MemConflict avalia cenários em que fatos armazenados se tornam desatualizados ou entram em conflito direto, constatando que os sistemas existentes não conseguem resolver esses conflitos de forma confiável.30

Além disso, o desempenho em benchmarks padronizados não se traduz de forma confiável em confiabilidade de produção, porque ambientes sintéticos simplificam demais o uso real.31

Leitura adicional

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Şevval Alper (2026) - "RELC-Bench: Benchmark de Recuperação em Contexto Longo". Publicado on-line em AIMultiple.com. Acessado em 15 setembro 2026, em: https://aimultiple.com/ai-memory [Recurso on-line]

Dilmegani, C., & Alper, Ş. (2026, 15 setembro). RELC-Bench: Benchmark de Recuperação em Contexto Longo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Alper, Şevval},
  title  = {{RELC-Bench: Benchmark de Recuperação em Contexto Longo}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Acessado em 15 setembro 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 0 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 0 arquivos CSV.

Última atualização: 27 setembro 2026
Baixar

Quer os dados granulares por trás disso? Assine o Premium

Registro de alterações

10 atualizações
  1. Adicionados resultados do claude-fable-5 à seção de Metodologia.

  2. Substituído o benchmark de memória de IA com 26 modelos pelas seções de resultados e metodologia do RELC-Bench.

  3. Atualizados os dados de "exclusão do GPT-5" na introdução.

  4. Expandida a seção "Por que modelos grandes lutam com a memória?" com soluções arquitetônicas.

  5. Substituída a metodologia de benchmark de memória de IA por tipos de perguntas.

Links de referência

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory in ChatGPT | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Rippling Customer Success Story | Decagon AI
Decagon AI
13.
Chime Customer Success Story | Decagon AI
Decagon AI
14.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments
15.
ResearchGate - Temporarily Unavailable
16.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
17.
Northwell Leverages Abridge to Drive Digital Transformation
18.
Riverside Health Case Study | Abridge
19.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
20.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
21.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
22.
OWASP Agent Memory Guard | OWASP Foundation
23.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
24.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
25.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
26.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
27.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
28.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
29.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
30.
MemConflict: Evaluating Long-Term Memory Systems UnderMemory Conflicts
31.
A Survey of Agent Memory in the Second Half: TowardsSelf-Evolving and Long-Horizon Agents
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017.

O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.
Ver perfil completo
Revisado tecnicamente por
Şevval Alper
Şevval Alper
Pesquisadora de IA
Şevval é pesquisadora de IA na AIMultiple. Ela tem experiência anterior de pesquisa em geração de números pseudoaleatórios usando sistemas caóticos.
Şevval se concentra em ferramentas de codificação de IA, agentes de IA e tecnologias quânticas.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450