Serviços
Contate-nos

RELC-Bench: Benchmark de Recuperação em Contexto Longo

Cem Dilmegani
Cem Dilmegani
atualizado em 4 ago. 2026

O RELC-Bench (RELC-Bench: Benchmark de Recuperação em Contexto Longo) visa medir a capacidade de um modelo de encontrar e extrair um valor numérico específico de um ou mais documentos dentro do seu contexto. Testa se o modelo consegue lembrar e recuperar um facto específico que acabou de ver na entrada.

Resultados

Loading Chart

claude-fable-5 obtém 97.0% nos 100 itens de recordação direta, consistente em todas as posições do palheiro (97.0% início, 97.1% meio, 97.0% fim).

Metodologia

Question format

Uma pergunta em linguagem natural solicitando uma métrica numérica. Exemplo:

P: Qual foi a Receita do primeiro trimestre de 2026 da Adobe (ADBE)?
Esperado: $6,40 mil milhões

Fonte de dados

O script analisa a secção Takeaways de cada transcrição de resultados do Motley Fool e extrai todas as métricas numéricas. Para cada métrica, o script verifica se o número aparece literalmente no corpo da transcrição pós-Takeaways (o texto real da conferência), para que o modelo tenha de ler a conversa real, não os tópicos do resumo. Os tópicos do resumo são removidos dos textos.

Regra de pontuação

  • Cada item tem uma lista de valores-alvo; o primeiro é o alvo primário (a resposta principal à pergunta)
  • Pontuação = 1.0 se o alvo primário corresponder a qualquer número na previsão
  • Pontuação = 0.0 caso contrário
  • Recusas ("Não sei") pontuam 0.0
  • claude-fable-5 é testado através do Claude Code: o palheiro é fornecido como um ficheiro e o modelo recupera dele com ferramentas de pesquisa em vez de o ler da sua janela de contexto. As suas pontuações medem o modelo em conjunto com o sistema Claude Code, e a invariância de posição é esperada nesta configuração porque a profundidade do alvo não se aplica à pesquisa em ficheiros.

Como é um bom desempenho

Fase 1 ≥ 85% (modelo encontra métricas de forma fiável num único documento).
Fase 2 ≥ 90% (modelo navega até ao alvo num palheiro sem distrações).
Pontuações invariantes à posição indicam verdadeira capacidade de contexto longo; pontuações decrescentes por profundidade indicam "perdido no meio".

Contagem de itens

100 itens de recordação direta distribuídos por 14 transcrições.

O que é a memória de IA?

A memória de IA é a capacidade de um sistema de inteligência artificial de armazenar e recordar experiências passadas para melhorar a tomada de decisões, a perceção e o desempenho geral.1 Ao contrário da memória humana, que é subjetiva e seletiva, a memória de IA é uma arquitetura técnica, um armazenamento estruturado de informações em redes neurais ou bases de dados externas.

O conceito é distinto da janela de contexto de um modelo, que é o buffer finito de tokens vinculado à sessão que serve como memória de trabalho durante a inferência.2 Enquanto a janela de contexto é reiniciada entre sessões e perde informações quando os tokens são truncados, a memória de IA persiste entre sessões através de armazenamento externo.3 É também distinta da geração aumentada por recuperação (RAG), que é apenas de leitura e trata a relevância como uma propriedade do conteúdo e não do utilizador; a memória de IA requer um caminho de escrita que extrai factos das conversas e atualiza o armazenamento quando as informações mudam.4

A área reconhece dois níveis principais. A memória de curto prazo, ou memória de trabalho, acompanha a conversa em curso dentro de uma sessão, enquanto a memória de longo prazo armazena dados específicos do utilizador ou ao nível da aplicação entre sessões.5 Algumas frameworks adicionam uma terceira categoria, a memória episódica, que permite aos agentes recordar experiências passadas específicas, semelhante à forma como os humanos se lembram de eventos individuais.

Em produtos de consumo, "memória de chat" refere-se especificamente às preferências do utilizador e ao resumo da conversa apresentados automaticamente, o que é arquitetonicamente mais restrito do que a "memória de agente" usada em frameworks de desenvolvimento, esta última abrangendo o estado da tarefa, o histórico de chamadas de ferramentas e os procedimentos aprendidos.6

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Como funciona a memória de IA?

Os sistemas de memória de IA convergem num pipeline comum de escrita/recuperação/consolidação que difere da recuperação estática. As novas informações entram através de uma fase de extração que processa pares de mensagens para identificar factos candidatos, passam por uma fase de atualização onde um LLM decide adicionar, atualizar, eliminar ou ignorar cada facto, e saem através de uma fase de recuperação que realiza pesquisa semântica no momento da consulta.7

Aplicações reais da memória de IA

Assistentes de IA pessoais

A funcionalidade de memória do ChatGPT da OpenAI constrói perfis persistentes a partir de conversas, ficheiros e aplicações conectadas do utilizador. Uma atualização "Dreaming" de 2026 introduziu a síntese em segundo plano entre muitas conversas, permitindo que as memórias se autoatualizassem ao longo do tempo; por exemplo, uma memória guardada que diz "o utilizador vai a Singapura em julho" reescreve-se automaticamente para "o utilizador foi a Singapura em julho de 2026" assim que a viagem passa.8 Os utilizadores gerem a memória através de Definições > Personalização > Memória, embora a OpenAI note que o resumo visível não capta tudo o que está armazenado.

A memória do Claude da Anthropic foi lançada para utilizadores do plano Team a 11 de setembro de 2025, alargada ao Enterprise a 18 de setembro de 2025, e chegou a todos os utilizadores, incluindo o plano gratuito, a 2 de março de 2026.9 A 10 de julho de 2026, a Anthropic redesenhou a funcionalidade em entradas categorizadas que o Claude lê e atualiza durante as conversas, substituindo o anterior resumo diário único.

O Gemini da Google armazena informações que os utilizadores pedem para lembrar, além de detalhes inferidos de conversas passadas quando o contexto Pessoal está ativado.10 A atualização separada "Personal Intelligence", quando aceite, conecta-se ao Gmail e ao Fotos sem treinar modelos com esse conteúdo.11

Agentes empresariais e suporte ao cliente

A Fastweb e a Vodafone Itália implementaram um sistema multiagente construído com LangGraph e LangSmith que serve 9.5 milhões de clientes, injetando automaticamente dados de CRM no início de cada interação para identificar clientes e personalizar respostas. O sistema reporta uma taxa de correção de 90%, taxa de resolução de 82% e uma Pontuação de Esforço do Cliente de 5.2 em 7.12

A implementação da Decagon com a Rippling conectou o agente de IA a APIs internas para que o agente pudesse obter dados individuais da conta do funcionário em vez de responder genericamente, aumentando o desvio de chat de 38% para mais de 50%, uma melhoria relativa de 32%.13 O trabalho da Decagon com a Chime automatizou tarefas de alta fricção, incluindo substituição de cartões e verificação de estado de depósitos, reduzindo os custos de suporte ao cliente em 60% enquanto duplicava as pontuações de satisfação dos membros.14

Robótica, saúde e IA incorporada

O robô de logística hospitalar Moxi da Diligent Robotics opera em mais de 25 instalações nos EUA e completou mais de 1.25 milhões de entregas autónomas até 2026, mapeando cada ambiente hospitalar usando sensores a bordo e navegando por obstáculos dinâmicos, incluindo portas com acesso por crachá.15 O Moxi 2.0 funciona com computação NVIDIA IGX Thor com 10 vezes a capacidade de processamento do original, treinado com três anos de dados reais de entregas hospitalares.

A framework ReMEmbR da NVIDIA dá aos robôs móveis memória espácio-temporal de longo horizonte para construir e raciocinar sobre registos contínuos do que viram para tarefas de navegação.16 O ASPIRE, lançado a 29 de junho de 2026, armazena cada correção de depuração validada como um padrão de código nomeado e reutilizável, aumentando as taxas de sucesso de 20% para 92% no benchmark bimanual de transferência de objetos do Robosuite apenas através de depuração iterativa.17

Na área da saúde, a plataforma de documentação de IA ambiente da Abridge é implementada pela Northwell Health em 28 hospitais para reduzir a carga de documentação clínica.18 A Riverside Health testou ferramentas de documentação ambiente durante dois meses antes de selecionar a Abridge para implementação alargada.19

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Benefícios da memória de IA

Os sistemas de memória reduzem os custos de tokens e a latência em benchmarks de longo horizonte em comparação com a repetição completa do contexto. No benchmark LoCoMo, que testa conversas com uma média de 300 turnos ao longo de até 35 sessões, a Mem0 relata uma poupança de mais de 90% no custo de tokens em comparação com a repetição do histórico completo da conversa, reduzindo a latência p95 em 91% (1.44s vs. 17.12s), e alcançando uma melhoria relativa de 26% na pontuação de LLM-como-Juiz em relação à linha de base de memória da OpenAI.7

A Zep reporta 94.8% de precisão no benchmark Deep Memory Retrieval contra 93.4% do MemGPT, ganhos de precisão agregada de até 18.5% no LongMemEval emparelhado com o GPT-4o, e uma redução de 90% na latência de resposta em comparação com linhas de base de contexto completo, com o tempo de resposta mediano a cair de 28.9 segundos para 2.58 segundos enquanto os tokens de contexto caíram de aproximadamente 115.000 para 1.600.20 21

O benchmark BEAM, testando até 10 milhões de tokens, descobriu que a sua framework de memória LIGHT melhorou o desempenho entre 3.5 a 12.69 pontos percentuais em média em relação às linhas de base existentes mais fortes, e que mesmo LLMs com janelas de contexto de 1 milhão de tokens se degradam substancialmente à medida que o comprimento da conversa aumenta.22

A arquitetura Dreaming da OpenAI para o ChatGPT melhorou a precisão da memória sensível ao tempo de 9.4% para 75.1%, com recordação factual de 82.8% e adesão a preferências de 71.3%, enquanto reduziu o custo computacional em cerca de 5x.8

Desafios e riscos da memória de IA

Envenenamento de memória e segurança

O envenenamento de memória é classificado como ASI06, "Envenenamento de Memória e Contexto", no Top 10 da OWASP para Aplicações Agentivas, definido como a corrupção da memória persistente do agente levando a desalinhamento e comportamento malicioso entre sessões.23 24 Em fevereiro de 2025, o investigador Johann Rehberger demonstrou um ataque de "invocação retardada de ferramenta" contra o Gemini da Google que fez com que o sistema armazenasse factos falsos como memórias de longo prazo, incluindo informações de idade incorretas.25

O MINJA (Memory INJection Attack), aceite na NeurIPS 2025, mostra que atacantes apenas com interação comum de consulta e resposta podem envenenar a memória de longo prazo, atingindo uma taxa de sucesso de injeção de 98.2% e uma taxa de sucesso de ataque de 76.8% em média entre os agentes testados.26 O AgentPoison, publicado na NeurIPS 2024, alcança mais de 80% de taxa de sucesso de ataque enquanto envenena menos de 0.1% dos registos de memória, degradando o desempenho em tarefas benignas em menos de 1%.27

Privacidade e governação de dados

O MEXTRA, um ataque de Extração de Memória em caixa negra, cria consultas para extrair dados privados armazenados, alcançando taxas de extração completa de 83% contra o EHRAgent e 87% contra agentes de compras web usando 30 prompts de ataque.28 Aumentar a profundidade de recuperação ou o tamanho total da memória aumenta as taxas de fuga.28

A autoridade de proteção de dados italiana multou a OpenAI em €15 milhões em dezembro de 2024 por processar dados pessoais para treinar o ChatGPT sem base legal adequada, embora o Tribunal de Roma tenha anulado a multa em março de 2026, decidindo que a Comissão de Proteção de Dados da Irlanda tinha jurisdição como autoridade supervisora principal da UE.29 30

A documentação da OpenAI afirma que desativar a memória não elimina automaticamente as memórias armazenadas anteriormente; uma reinicialização completa requer tanto desativar a memória como limpar separadamente as entradas existentes.

Limitações técnicas

Em dez abordagens de memória avaliadas no benchmark LoCoMo, a maioria dos métodos pontua mais baixo em perguntas de raciocínio temporal do que na recuperação factual de etapa única, embora pelo menos uma abordagem inverta este padrão.7

A desatualização da memória apresenta outro problema por resolver: quando factos armazenados são contraditos por novas informações, os sistemas têm dificuldade em distinguir dados atuais de desatualizados. O benchmark MemConflict avalia cenários onde factos armazenados se tornam desatualizados ou entram em conflito direto, descobrindo que os sistemas existentes não conseguem resolver estes conflitos de forma fiável.31

Além disso, o desempenho em benchmarks padronizados não se traduz de forma fiável em fiabilidade de produção porque os ambientes sintéticos simplificam excessivamente a utilização real.32

Leitura adicional

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "RELC-Bench: Benchmark de Recuperação em Contexto Longo". Publicado on-line em AIMultiple.com. Acessado em 4 Agosto 2026, em: https://aimultiple.com/ai-memory [Recurso on-line]

Dilmegani, C. (2026, 4 Agosto). RELC-Bench: Benchmark de Recuperação em Contexto Longo. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Benchmark de Recuperação em Contexto Longo}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Acessado em 4 Agosto 2026}
}

Links de referência

1.
What Is AI Agent Memory? | IBM
2.
Context windows - Claude Platform Docs
3.
What Is Agent Memory? A Guide to Enhancing AI Learning and Recall | MongoDB
MongoDB
4.
RAG vs. Memory: What AI Agent Developers Need to Know
Mem0
5.
Memory overview - Docs by LangChain
Docs by LangChain
6.
Memory FAQ | OpenAI Help Center
7.
[2504.19413] Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory
8.
Dreaming: Better memory for a more helpful ChatGPT | OpenAI
9.
Release notes | Claude Help Center
10.
Get personalization with memory of your past Gemini chats - Computer - Gemini Apps Help
11.
Gemini gets personal as Google rolls out a big memory upgrade- Android Authority
Authority Media
12.
Fastweb + Vodafone: Transforming Customer Experience with AI Agents using LangGraph and LangSmith
LangChain Blog
13.
Rippling Customer Success Story | Decagon AI
Decagon AI
14.
Chime Customer Success Story | Decagon AI
Decagon AI
15.
Diligent Robotics Unveils Moxi 2.0, Advancing The Largest Fleet of Deployed AI-Powered Mobile Manipulation Robots Operating in Unstructured, Human-Centric Work Environments — Diligent Robotics
16.
ResearchGate - Temporarily Unavailable
17.
Robot Skill Library ASPIRE Gives Robots Memory: Handover Climbs to 92%
Tech Times
18.
Northwell Leverages Abridge to Drive Digital Transformation
19.
Riverside Health Case Study | Abridge
20.
[2501.13956] Zep: A Temporal Knowledge Graph Architecture for Agent Memory
21.
Zep Is The New State of the Art In Agent Memory
Zep - Agent memory at enterprise scale
22.
[2510.27246] Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs
23.
OWASP Agent Memory Guard | OWASP Foundation
24.
OWASP Top 10 for Agentic Applications - The Benchmark for Agentic Security in the Age of Autonomous AI - OWASP Gen AI Security Project
OWASP Top 10 for LLM & Generative AI Security
25.
Google Gemini's Long-term Memory Vulnerable to a Kind of Phishing Attack - InfoQ
InfoQ
26.
[2503.03704] Memory Injection Attacks on LLM Agents via Query-Only Interaction
27.
[2407.12784] AgentPoison: Red-teaming LLM Agents via Poisoning Memory or Knowledge Bases
28.
[2502.13172] Unveiling Privacy Risks in LLM Agent Memory
29.
Italy fines OpenAI over ChatGPT privacy rules breach By Reuters
Investing.com
30.
Italian court scraps 15-million-euro privacy watchdog fine on ChatGPT-maker OpenAI
Yahoo! Finance
31.
https://arxiv.org/pdf/2605.20926
32.
https://arxiv.org/pdf/2602.06052
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450