Serviços
Contate-nos

RELC-Bench: Referência de Recuperação em Contextos Longos

Cem Dilmegani
Cem Dilmegani
atualizado em 7 jul. 2026

RELC-Bench (RELC-Bench: Referência de Recuperação em Contextos Longos) tem como objetivo medir a capacidade de um modelo de encontrar e extrair um valor numérico específico de um ou mais documentos dentro do seu contexto. Ele testa se o modelo consegue lembrar e recuperar um fato específico que acabou de ver na entrada.

Resultados

Loading Chart

claude-fable-5 atinge 97.0% nos 100 itens de recuperação direta, estável em todas as posições do haystack (97.0% início, 97.1% meio, 97.0% fim).

Metodologia

Question format

Uma pergunta em linguagem natural solicitando uma métrica numérica. Exemplo:

Pergunta: Qual foi a receita do Q1 de 2026 da Adobe (ADBE)?
Esperado: $6.40 bilhões

Fonte dos dados

O script analisa a seção Takeaways de cada transcrição de resultados do Motley Fool e extrai todas as métricas numéricas. Para cada métrica, o script verifica se o número aparece literalmente no corpo da transcrição pós-Takeaways (o texto real da teleconferência), de modo que o modelo precise ler a conversa real, não o resumo. Os itens de resumo são removidos dos textos.

Regra de pontuação

  • Cada item tem uma lista de valores alvo; o primeiro é o alvo principal (a resposta principal para a pergunta)
  • Pontuação = 1.0 se o alvo principal corresponder a qualquer número na previsão
  • Pontuação = 0.0 caso contrário
  • Recusas (“Não sei”) pontuam 0.0
  • claude-fable-5 é testado através do Claude Code: o haystack é fornecido como um arquivo e o modelo recupera informações dele com ferramentas de busca, em vez de lê-lo da sua janela de contexto. Suas pontuações medem o modelo juntamente com o sistema Claude Code, e a invariância de posição é esperada nessa configuração porque a profundidade do alvo não se aplica à busca em arquivos.

O que é um bom desempenho

Fase 1 ≥ 85% (o modelo encontra métricas de forma confiável em um único documento).
Fase 2 ≥ 90% (o modelo navega até o alvo em um haystack sem distrações).
Pontuações invariantes à posição indicam capacidade real de contexto longo; pontuações decrescentes com a profundidade indicam “perdido no meio”.

Quantidade de itens

100 itens de recuperação direta espalhados por 14 transcrições.

Leitura adicional

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "RELC-Bench: Referência de Recuperação em Contextos Longos". Publicado on-line em AIMultiple.com. Acessado em 7 Julho 2026, em: https://aimultiple.com/ai-memory [Recurso on-line]

Dilmegani, C. (2026, 7 Julho). RELC-Bench: Referência de Recuperação em Contextos Longos. AIMultiple. https://aimultiple.com/ai-memory

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{RELC-Bench: Referência de Recuperação em Contextos Longos}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-memory}},
  note   = {AIMultiple. Acessado em 7 Julho 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses. O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia. Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização. Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider. Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450