Serviços
Contate-nos

Benchmark de Reranker: Comparação dos 8 Principais Modelos

Ekrem Sarı
Ekrem Sarı
atualizado em 26 fev. 2026

Avaliamos 8 modelos de reranker em ~145k avaliações da Amazon em inglês para medir o quanto uma etapa de reranking melhora a recuperação densa. Recuperamos os top-100 candidatos com multilingual-e5-base, reordenamos com cada modelo e avaliamos os top-10 resultados em relação a 300 consultas, cada uma referenciando detalhes concretos da avaliação de origem. O melhor reranker elevou o Hit@1 de 62.67% para 83.00% (+20.33pp).

Resultados do benchmark de reranker

Loading Chart

Métricas explicadas:

ΔHit@1 / ΔHit@10 mostra a melhoria em relação à linha de base (sem reranker) em pontos percentuais (pp). Por exemplo, +20.33pp significa que o reranker melhorou o Hit@1 em 20.33 pontos percentuais em comparação com os 62.67% da linha de base.

Hit@K mede se alguma avaliação com o product_id correto aparece nos primeiros K resultados. O gabarito é o product_id da avaliação que gerou a consulta. Se uma avaliação diferente do mesmo produto aparecer no top-K, isso conta como um acerto. O Hit@1 é o teste mais rigoroso: o primeiro resultado é do produto certo? O Hit@10 é mais flexível: o produto certo está em algum lugar entre os primeiros 10 resultados?

MRR@10 (Mean Reciprocal Rank) calcula a média de 1/classificação do primeiro resultado correto em todas as consultas. Se o primeiro product_id correspondente estiver na posição 1, a pontuação é 1.0. Na posição 2, é 0.5. Na posição 10, é 0.1. Isso recompensa modelos que colocam o produto correto o mais alto possível.

nDCG@10 (Ganho Cumulativo Descontado Normalizado) avalia as posições de todas as avaliações correspondentes no top-10, não apenas a primeira. Se o mesmo produto tiver várias avaliações no conjunto de candidatos e várias aparecerem no top-10, o nDCG credita cada uma com base em sua posição. Na prática, a maioria dos produtos tem apenas 1 a 2 avaliações entre os top-100 candidatos, então nDCG e MRR ficam muito próximos.

Recall@10 mede a fração de avaliações correspondentes (mesmo product_id) no top-10 entre todas as avaliações correspondentes no conjunto completo de candidatos (top-100). Se um produto tem 3 avaliações no top-100 e o reranker coloca 2 delas no top-10, a Recall@10 é 2/3 para essa consulta. Como a maioria dos produtos tem poucas avaliações duplicadas no conjunto de candidatos, Recall@10 e Hit@10 são quase idênticos neste benchmark.

Detalhamento da latência

A latência de reranking mede o tempo de cada cross-encoder para pontuar 100 documentos candidatos em relação à consulta. O tempo da busca vetorial (~20ms) é excluído, pois permanece constante em todas as execuções e é independente do reranker.

Métricas de latência explicadas:

Rerank é o tempo para o cross-encoder pontuar todos os 100 documentos candidatos em relação à consulta. É aqui que os modelos diferem: uma única passagem direta é rápida, enquanto a decodificação autorregressiva é lenta.

P95 é o percentil 95 da latência total. Algumas consultas têm textos de avaliação mais longos, o que aumenta o tempo de tokenização e pontuação. O P95 mostra o pior caso esperado para 95% das consultas.

Principais descobertas

Um modelo de 149M se equipara a um modelo de 1.2B

gte-reranker-modernbert-base tem 149M parâmetros, nemotron-rerank-1b tem 1.2B. Ambos alcançam 83.00% de Hit@1 em inglês. A arquitetura ModernBERT é 8x menor e oferece a mesma acurácia de primeira linha.

Isso não significa que o tamanho do modelo seja irrelevante. O nemotron fica ligeiramente à frente em MRR@10 (0.8514 vs 0.8483) e Hit@10 (88.33% vs 88.00%), o que significa que ele classifica documentos relevantes um pouco melhor em todo o top-10. Mas, para a maioria das aplicações em que acertar o primeiro resultado é o que importa, o modelo de 149M é suficiente.

O maior modelo não é o melhor

qwen3_reranker_4b tem 4B parâmetros e leva mais de um segundo por consulta. Ele alcança 77.67% de Hit@1, ficando em quarto lugar, atrás do nemotron (1.2B), gte_modernbert (149M) e jina (560M). Você paga 4.5x a latência do nemotron por 5.3 pontos percentuais a menos de acurácia.

A arquitetura do qwen3 usa modelagem de linguagem causal com uma abordagem de logit sim/não. O modelo lê o par consulta-documento e produz a probabilidade de “sim, isto é relevante”. Conceitualmente, isso é limpo, mas a inference é cara devido à sobrecarga da decodificação autorregressiva. Os modelos SequenceClassification (gte_modernbert, bge) e a abordagem de template de prompt do nemotron processam o par em uma única passagem direta, o que é fundamentalmente mais rápido.

Jina oferece o melhor equilíbrio entre velocidade e acurácia

jina_reranker_v3 alcança 81.33% de Hit@1 a 188ms. O nemotron alcança 83.00% a 243ms. Se você precisa de latência total inferior a 200ms por consulta, Jina é o único modelo do primeiro escalão que oferece isso. A diferença de 1.67 ponto percentual pode não justificar os 55ms extras em um sistema de produção que atende milhares de requisições por segundo.

Um reranker piora os resultados

mxbai_rerank_xsmall (70M parâmetros) pontua 64.67% de Hit@1. A linha de base sem nenhum reranker pontua 62.67%. A melhoria é de apenas 2 pontos percentuais, o que está dentro do ruído para 300 consultas. Com 70M parâmetros, o modelo não tem capacidade para julgar com confiabilidade a relevância consulta-documento em textos mais longos ou com mais nuances.

Um reranker não é automaticamente benéfico. Teste-o nos seus dados reais antes de implantar.

O retriever define o teto

Todos os principais rerankers convergem em torno de 87-88% de Hit@10. Esse teto vem do retriever. Se o multilingual-e5-base não colocar o documento correto entre os top-100 candidatos, nenhum reranker poderá recuperá-lo. Os 12% restantes de consultas em que todos os rerankers falham representam casos em que o retriever denso simplesmente não encontrou o documento relevante.

Melhorar além desse teto exige um retriever melhor, um conjunto maior de candidatos ou ambos. Testamos os top-250 candidatos e encontramos quase nenhuma melhoria em relação aos top-100, o que significa que o e5_base esgota seus candidatos úteis bem antes da posição 250.

Como os rerankers funcionam

Um retriever denso (bi-encoder) codifica consultas e documentos independentemente em vetores. A recuperação é uma busca por vizinhos mais próximos sobre esses vetores. Isso é rápido porque você só codifica a consulta no momento da busca, mas o modelo nunca vê a consulta e o documento juntos, então pode perder sinais sutis de relevância.

Um reranker (cross-encoder) recebe um par consulta-documento como uma única entrada. O modelo atenta para os dois textos em conjunto, capturando relações que a codificação independente perde. O custo é que você precisa executar o modelo uma vez por candidato, então só é viável pontuar um conjunto pequeno.

Arquiteturas neste benchmark

Testamos quatro arquiteturas diferentes de cross-encoder:

Modelos SequenceClassification (bge_base, bge_v2_m3, mxbai_xsmall, gte_modernbert) recebem um par [query, document] como entrada e produzem uma única pontuação logit. Essa é a abordagem mais simples e comum.

O Nemotron usa um formato de template de prompt: “question:{q} passage:{p}”. A entrada parece texto simples em vez de um par estruturado, mas o modelo ainda produz uma única pontuação de relevância por meio da SequenceClassification. O pré-treinamento LLM (baseado no Llama) confere a ele forte compreensão de linguagem.

Os rerankers Qwen3 usam modelagem de linguagem causal. O modelo lê o par e gera um julgamento sim/não. A pontuação é log P(yes) / (P(yes) + P(no)). Isso exige todo o maquinário autorregressivo, o que explica a latência mais alta.

O Jina v3 usa uma API personalizada (model.rerank()) que cuida da tokenização e da pontuação internamente. A arquitetura subjacente usa atenção cruzada, mas a interface abstrai os detalhes.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Metodologia do benchmark de reranker

  • GPU: NVIDIA H100 PCIe 80GB via Runpod
  • Banco de dados vetorial: Qdrant 1.12.0 (binário local), distância cosseno
  • Retriever: multilingual-e5-base (768-dimensões). Prefixo da consulta: "query: ", prefixo do documento: "passage: "
  • Software: transformers 5.2.0, PyTorch 2.8.0, CUDA 12.8.1
  • Dataset: Subconjunto em inglês do Amazon Reviews Multi (Kaggle).1 ~145k avaliações após filtrar por no mínimo 100 caracteres. Cada avaliação tem um product_id, texto da avaliação e classificação por estrelas.
  • Geração de consultas: Claude Sonnet 4.6 via OpenRouter. 300 consultas em inglês (5 tipos: factual, opinião, uso, resolução de problemas, comparação de recursos). Cada consulta deve referenciar detalhes específicos da avaliação de origem; perguntas genéricas (pontuação de especificidade < 4/5) são filtradas.
  • Formato do documento: "Review Title: {title}\nReview: {body}"
  • Pipeline: Recupere os top-100 candidatos com multilingual-e5-base, reordene com cross-encoder e retorne os top-10. A linha de base pula o reranking e retorna diretamente os top-10 do retriever.
  • Gabarito: correspondência exata apenas de product_id. Sem fallback de similaridade cosseno. Sem crédito parcial para produtos semanticamente semelhantes.
  • Variável controlada: Apenas o modelo de reranker muda entre os experimentos. Retriever, número de candidatos, conjunto de consultas e critérios de avaliação são idênticos em todas as execuções.
  • Sem fine-tuning: Todos os modelos avaliados zero-shot com os pesos padrão do HuggingFace.
  • Latência: Reranking (pontuação do cross-encoder de 100 candidatos). Medida por consulta na GPU.

Modelos testados

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Limitações

Este benchmark usa um único retriever (multilingual-e5-base). Um retriever diferente produziria conjuntos de candidatos diferentes e poderia alterar as classificações dos rerankers. Os resultados refletem o quão bem cada reranker funciona com esse retriever específico, não a qualidade do reranker isoladamente.

Testamos em avaliações de produtos em inglês da Amazon. O desempenho em outros domínios (artigos científicos, documentos jurídicos, código) ou em outros idiomas será diferente.

O número de candidatos é fixado em 100. Alguns rerankers podem classificar de forma diferente com 20 ou 200 candidatos. Testamos 250 candidatos e encontramos melhoria insignificante, sugerindo que 100 é suficiente para o e5_base, mas outros retrievers podem se comportar de forma diferente.

300 consultas é um tamanho de amostra moderado. Os três primeiros modelos (nemotron, gte_modernbert, jina) estão separados por menos de 2 pontos percentuais. Com um conjunto maior de consultas, essas classificações podem mudar. A diferença entre o nível superior e o nível inferior (20+ pontos percentuais) é robusta.

Conclusão

Rerankers funcionam. O melhor modelo neste benchmark eleva o Hit@1 de 62.67% para 83.00% (+20.33pp), ou seja, 20 em cada 100 consultas que antes retornavam o documento errado primeiro agora retornam o correto. Esse é um ganho significativo para um componente que adiciona menos de 250ms de latência.

A descoberta mais útil é que o tamanho do modelo não determina a qualidade do reranker. O gte-reranker-modernbert-base com 149M parâmetros se iguala ao nemotron-rerank-1b com 1.2B no Hit@1. O modelo Qwen3 de 4B parâmetros termina em quarto lugar. Se você está escolhendo um reranker para um sistema de produção, comece pelos modelos menores. Talvez você nunca precise dos maiores.

Para aplicações sensíveis à latência, o jina-reranker-v3 é a opção mais forte abaixo de 200ms. Para máxima acurácia sem restrição de latência, nemotron-rerank-1b e gte-reranker-modernbert-base dividem o primeiro lugar. Para equipes com orçamento de GPU, o gte-modernbert é o vencedor claro: mesma acurácia do modelo de 1.2B com uma fração da pegada de memória.

Um padrão se manteve em todos os experimentos: o retriever define o teto. Nenhum reranker elevou o Hit@10 acima de 88%, porque os 12% restantes dos documentos corretos nunca apareceram entre os top-100 candidatos. Investir em um retriever melhor provavelmente trará ganhos maiores do que alternar entre os três principais rerankers.

Leitura adicional

Explore outros benchmarks de RAG, como:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ekrem Sarı (2026) - "Benchmark de Reranker: Comparação dos 8 Principais Modelos". Publicado on-line em AIMultiple.com. Acessado em 26 Fevereiro 2026, em: https://aimultiple.com/rerankers [Recurso on-line]

Sarı, E. (2026, 26 Fevereiro). Benchmark de Reranker: Comparação dos 8 Principais Modelos. AIMultiple. https://aimultiple.com/rerankers

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Benchmark de Reranker: Comparação dos 8 Principais Modelos}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/rerankers}},
  note   = {AIMultiple. Acessado em 26 Fevereiro 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 17 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 2 arquivos CSV e um README.

Última atualização: 17 Agosto 2026
Baixar
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é Pesquisador de IA e Cientista de Dados na AIMultiple. Ele projeta e executa benchmarks práticos para sistemas de IA e LLM.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450