O RELC-Bench (RELC-Bench: Benchmark de Recuperação em Contexto Longo) visa medir a capacidade de um modelo de encontrar e extrair um valor numérico específico de um ou mais documentos dentro do seu contexto. Testa se o modelo consegue lembrar e recuperar um facto específico que acabou de ver na entrada.
Resultados
claude-fable-5 obtém 97.0% nos 100 itens de recordação direta, consistente em todas as posições do palheiro (97.0% início, 97.1% meio, 97.0% fim).
Metodologia
Question format
Uma pergunta em linguagem natural solicitando uma métrica numérica. Exemplo:
P: Qual foi a Receita do primeiro trimestre de 2026 da Adobe (ADBE)?
Esperado: $6,40 mil milhões
Fonte de dados
O script analisa a secção Takeaways de cada transcrição de resultados do Motley Fool e extrai todas as métricas numéricas. Para cada métrica, o script verifica se o número aparece literalmente no corpo da transcrição pós-Takeaways (o texto real da conferência), para que o modelo tenha de ler a conversa real, não os tópicos do resumo. Os tópicos do resumo são removidos dos textos.
Regra de pontuação
- Cada item tem uma lista de valores-alvo; o primeiro é o alvo primário (a resposta principal à pergunta)
- Pontuação = 1.0 se o alvo primário corresponder a qualquer número na previsão
- Pontuação = 0.0 caso contrário
- Recusas ("Não sei") pontuam 0.0
- claude-fable-5 é testado através do Claude Code: o palheiro é fornecido como um ficheiro e o modelo recupera dele com ferramentas de pesquisa em vez de o ler da sua janela de contexto. As suas pontuações medem o modelo em conjunto com o sistema Claude Code, e a invariância de posição é esperada nesta configuração porque a profundidade do alvo não se aplica à pesquisa em ficheiros.
Como é um bom desempenho
Fase 1 ≥ 85% (modelo encontra métricas de forma fiável num único documento).
Fase 2 ≥ 90% (modelo navega até ao alvo num palheiro sem distrações).
Pontuações invariantes à posição indicam verdadeira capacidade de contexto longo; pontuações decrescentes por profundidade indicam "perdido no meio".
Contagem de itens
100 itens de recordação direta distribuídos por 14 transcrições.
O que é a memória de IA?
A memória de IA é a capacidade de um sistema de inteligência artificial de armazenar e recordar experiências passadas para melhorar a tomada de decisões, a perceção e o desempenho geral.1 Ao contrário da memória humana, que é subjetiva e seletiva, a memória de IA é uma arquitetura técnica, um armazenamento estruturado de informações em redes neurais ou bases de dados externas.
O conceito é distinto da janela de contexto de um modelo, que é o buffer finito de tokens vinculado à sessão que serve como memória de trabalho durante a inferência.2 Enquanto a janela de contexto é reiniciada entre sessões e perde informações quando os tokens são truncados, a memória de IA persiste entre sessões através de armazenamento externo.3 É também distinta da geração aumentada por recuperação (RAG), que é apenas de leitura e trata a relevância como uma propriedade do conteúdo e não do utilizador; a memória de IA requer um caminho de escrita que extrai factos das conversas e atualiza o armazenamento quando as informações mudam.4
A área reconhece dois níveis principais. A memória de curto prazo, ou memória de trabalho, acompanha a conversa em curso dentro de uma sessão, enquanto a memória de longo prazo armazena dados específicos do utilizador ou ao nível da aplicação entre sessões.5 Algumas frameworks adicionam uma terceira categoria, a memória episódica, que permite aos agentes recordar experiências passadas específicas, semelhante à forma como os humanos se lembram de eventos individuais.
Em produtos de consumo, "memória de chat" refere-se especificamente às preferências do utilizador e ao resumo da conversa apresentados automaticamente, o que é arquitetonicamente mais restrito do que a "memória de agente" usada em frameworks de desenvolvimento, esta última abrangendo o estado da tarefa, o histórico de chamadas de ferramentas e os procedimentos aprendidos.6
Como funciona a memória de IA?
Os sistemas de memória de IA convergem num pipeline comum de escrita/recuperação/consolidação que difere da recuperação estática. As novas informações entram através de uma fase de extração que processa pares de mensagens para identificar factos candidatos, passam por uma fase de atualização onde um LLM decide adicionar, atualizar, eliminar ou ignorar cada facto, e saem através de uma fase de recuperação que realiza pesquisa semântica no momento da consulta.7
Aplicações reais da memória de IA
Assistentes de IA pessoais
A funcionalidade de memória do ChatGPT da OpenAI constrói perfis persistentes a partir de conversas, ficheiros e aplicações conectadas do utilizador. Uma atualização "Dreaming" de 2026 introduziu a síntese em segundo plano entre muitas conversas, permitindo que as memórias se autoatualizassem ao longo do tempo; por exemplo, uma memória guardada que diz "o utilizador vai a Singapura em julho" reescreve-se automaticamente para "o utilizador foi a Singapura em julho de 2026" assim que a viagem passa.8 Os utilizadores gerem a memória através de Definições > Personalização > Memória, embora a OpenAI note que o resumo visível não capta tudo o que está armazenado.
A memória do Claude da Anthropic foi lançada para utilizadores do plano Team a 11 de setembro de 2025, alargada ao Enterprise a 18 de setembro de 2025, e chegou a todos os utilizadores, incluindo o plano gratuito, a 2 de março de 2026.9 A 10 de julho de 2026, a Anthropic redesenhou a funcionalidade em entradas categorizadas que o Claude lê e atualiza durante as conversas, substituindo o anterior resumo diário único.
O Gemini da Google armazena informações que os utilizadores pedem para lembrar, além de detalhes inferidos de conversas passadas quando o contexto Pessoal está ativado.10 A atualização separada "Personal Intelligence", quando aceite, conecta-se ao Gmail e ao Fotos sem treinar modelos com esse conteúdo.11
Agentes empresariais e suporte ao cliente
A Fastweb e a Vodafone Itália implementaram um sistema multiagente construído com LangGraph e LangSmith que serve 9.5 milhões de clientes, injetando automaticamente dados de CRM no início de cada interação para identificar clientes e personalizar respostas. O sistema reporta uma taxa de correção de 90%, taxa de resolução de 82% e uma Pontuação de Esforço do Cliente de 5.2 em 7.12
A implementação da Decagon com a Rippling conectou o agente de IA a APIs internas para que o agente pudesse obter dados individuais da conta do funcionário em vez de responder genericamente, aumentando o desvio de chat de 38% para mais de 50%, uma melhoria relativa de 32%.13 O trabalho da Decagon com a Chime automatizou tarefas de alta fricção, incluindo substituição de cartões e verificação de estado de depósitos, reduzindo os custos de suporte ao cliente em 60% enquanto duplicava as pontuações de satisfação dos membros.14
Robótica, saúde e IA incorporada
O robô de logística hospitalar Moxi da Diligent Robotics opera em mais de 25 instalações nos EUA e completou mais de 1.25 milhões de entregas autónomas até 2026, mapeando cada ambiente hospitalar usando sensores a bordo e navegando por obstáculos dinâmicos, incluindo portas com acesso por crachá.15 O Moxi 2.0 funciona com computação NVIDIA IGX Thor com 10 vezes a capacidade de processamento do original, treinado com três anos de dados reais de entregas hospitalares.
A framework ReMEmbR da NVIDIA dá aos robôs móveis memória espácio-temporal de longo horizonte para construir e raciocinar sobre registos contínuos do que viram para tarefas de navegação.16 O ASPIRE, lançado a 29 de junho de 2026, armazena cada correção de depuração validada como um padrão de código nomeado e reutilizável, aumentando as taxas de sucesso de 20% para 92% no benchmark bimanual de transferência de objetos do Robosuite apenas através de depuração iterativa.17
Na área da saúde, a plataforma de documentação de IA ambiente da Abridge é implementada pela Northwell Health em 28 hospitais para reduzir a carga de documentação clínica.18 A Riverside Health testou ferramentas de documentação ambiente durante dois meses antes de selecionar a Abridge para implementação alargada.19
Benefícios da memória de IA
Os sistemas de memória reduzem os custos de tokens e a latência em benchmarks de longo horizonte em comparação com a repetição completa do contexto. No benchmark LoCoMo, que testa conversas com uma média de 300 turnos ao longo de até 35 sessões, a Mem0 relata uma poupança de mais de 90% no custo de tokens em comparação com a repetição do histórico completo da conversa, reduzindo a latência p95 em 91% (1.44s vs. 17.12s), e alcançando uma melhoria relativa de 26% na pontuação de LLM-como-Juiz em relação à linha de base de memória da OpenAI.7
A Zep reporta 94.8% de precisão no benchmark Deep Memory Retrieval contra 93.4% do MemGPT, ganhos de precisão agregada de até 18.5% no LongMemEval emparelhado com o GPT-4o, e uma redução de 90% na latência de resposta em comparação com linhas de base de contexto completo, com o tempo de resposta mediano a cair de 28.9 segundos para 2.58 segundos enquanto os tokens de contexto caíram de aproximadamente 115.000 para 1.600.20 21
O benchmark BEAM, testando até 10 milhões de tokens, descobriu que a sua framework de memória LIGHT melhorou o desempenho entre 3.5 a 12.69 pontos percentuais em média em relação às linhas de base existentes mais fortes, e que mesmo LLMs com janelas de contexto de 1 milhão de tokens se degradam substancialmente à medida que o comprimento da conversa aumenta.22
A arquitetura Dreaming da OpenAI para o ChatGPT melhorou a precisão da memória sensível ao tempo de 9.4% para 75.1%, com recordação factual de 82.8% e adesão a preferências de 71.3%, enquanto reduziu o custo computacional em cerca de 5x.8
Desafios e riscos da memória de IA
Envenenamento de memória e segurança
O envenenamento de memória é classificado como ASI06, "Envenenamento de Memória e Contexto", no Top 10 da OWASP para Aplicações Agentivas, definido como a corrupção da memória persistente do agente levando a desalinhamento e comportamento malicioso entre sessões.23 24 Em fevereiro de 2025, o investigador Johann Rehberger demonstrou um ataque de "invocação retardada de ferramenta" contra o Gemini da Google que fez com que o sistema armazenasse factos falsos como memórias de longo prazo, incluindo informações de idade incorretas.25
O MINJA (Memory INJection Attack), aceite na NeurIPS 2025, mostra que atacantes apenas com interação comum de consulta e resposta podem envenenar a memória de longo prazo, atingindo uma taxa de sucesso de injeção de 98.2% e uma taxa de sucesso de ataque de 76.8% em média entre os agentes testados.26 O AgentPoison, publicado na NeurIPS 2024, alcança mais de 80% de taxa de sucesso de ataque enquanto envenena menos de 0.1% dos registos de memória, degradando o desempenho em tarefas benignas em menos de 1%.27
Privacidade e governação de dados
O MEXTRA, um ataque de Extração de Memória em caixa negra, cria consultas para extrair dados privados armazenados, alcançando taxas de extração completa de 83% contra o EHRAgent e 87% contra agentes de compras web usando 30 prompts de ataque.28 Aumentar a profundidade de recuperação ou o tamanho total da memória aumenta as taxas de fuga.28
A autoridade de proteção de dados italiana multou a OpenAI em €15 milhões em dezembro de 2024 por processar dados pessoais para treinar o ChatGPT sem base legal adequada, embora o Tribunal de Roma tenha anulado a multa em março de 2026, decidindo que a Comissão de Proteção de Dados da Irlanda tinha jurisdição como autoridade supervisora principal da UE.29 30
A documentação da OpenAI afirma que desativar a memória não elimina automaticamente as memórias armazenadas anteriormente; uma reinicialização completa requer tanto desativar a memória como limpar separadamente as entradas existentes.
Limitações técnicas
Em dez abordagens de memória avaliadas no benchmark LoCoMo, a maioria dos métodos pontua mais baixo em perguntas de raciocínio temporal do que na recuperação factual de etapa única, embora pelo menos uma abordagem inverta este padrão.7
A desatualização da memória apresenta outro problema por resolver: quando factos armazenados são contraditos por novas informações, os sistemas têm dificuldade em distinguir dados atuais de desatualizados. O benchmark MemConflict avalia cenários onde factos armazenados se tornam desatualizados ou entram em conflito direto, descobrindo que os sistemas existentes não conseguem resolver estes conflitos de forma fiável.31
Além disso, o desempenho em benchmarks padronizados não se traduz de forma fiável em fiabilidade de produção porque os ambientes sintéticos simplificam excessivamente a utilização real.32
Leitura adicional
- Agentes Cognitivos: Criando uma Mente com LangChain
- 5 Frameworks de IA Agentiva de Código Aberto
- Aplicações de IA com Benchmark e Tutorial de Memória MCP
- Execução de Código com MCP: Uma Nova Abordagem à Eficiência dos Agentes de IA
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{RELC-Bench: Benchmark de Recuperação em Contexto Longo}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-memory}},
note = {AIMultiple. Acessado em 4 Agosto 2026}
}Links de referência
O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.