Serviços
Contate-nos

RAG Ferramentas de Avaliação: Weights & Biases vs Ragas vs DeepEval

Cem Dilmegani
Cem Dilmegani
atualizado em 23 mar. 2026

Quando um pipeline de RAG recupera o contexto errado, o LLM gera confiantemente a resposta errada. Os avaliadores de relevância de contexto são a principal defesa.

Comparamos cinco ferramentas em 1,460 perguntas e mais de 14,600 contextos pontuados sob condições idênticas: mesmo modelo juiz (GPT-4o), configurações padrão e sem prompts personalizados. Em condições padrão, WandB, TruLens e Ragas emergiram como os melhores desempenhos. Sob pressão adversarial (negativos difíceis com entidades trocadas), o WandB teve o melhor desempenho.

RAG resultados do benchmark das ferramentas de avaliação

Loading Chart


Os três primeiros (WandB, TruLens, Ragas) estão estatisticamente empatados na Precisão Top-1 (IC de 95% sobreposto entre 94.0% e 98.0%).

Para entender nossa avaliação e métricas em detalhes, veja nossa metodologia de benchmark para as ferramentas de avaliação de RAG.

Métricas explicadas

Precisão Top-1: A ferramenta consegue atribuir a maior pontuação de relevância ao contexto dourado? Isso mede a segurança contra recuperação adversarial, um modo de falha comum em produção.

NDCG@5 (ganho acumulado descontado normalizado): Dados cinco contextos em diferentes níveis de relevância (4, 3, 2, 1, 0), a ferramenta os classifica na ordem correta? Ao contrário da precisão binária, o NDCG recompensa ferramentas que atribuem pontuações proporcionalmente mais altas a contextos mais relevantes.

Spearman ρ (correlação de postos): Quão bem a classificação das pontuações de uma ferramenta se correlaciona com a ordenação de relevância de referência? Uma ferramenta perfeita produziria ρ = 1.0.

MRR (ranking recíproco médio): Média de 1/posição para o contexto dourado. Se uma ferramenta classifica o contexto dourado em primeiro, MRR = 1.0; em segundo, MRR = 0.5; em terceiro, MRR = 0.33. Penaliza ferramentas que enterram o contexto correto abaixo de outros menos relevantes.

Principais conclusões

  1. WandB lidera na identificação, TruLens lidera na classificação: O WandB tem a maior precisão Top-1 (94.5%), mas o menor NDCG@5 (0.910) e Spearman ρ (0.669). O TruLens lidera no NDCG@5 (0.932), Spearman ρ (0.750) e MRR (0.594). A diferença se resume ao design da pontuação: a pontuação binária do WandB é simples, mas grosseira; a escala de 4 pontos do TruLens tem mais resolução, mas é mais propensa a inversões.
  2. TruLens tem a maior taxa de discriminação: Ao distinguir um contexto correto de uma versão quase idêntica com entidades trocadas, o TruLens acerta a direção 35.5% das vezes com apenas 8.4% de inversões (razão 4.2:1). Nenhuma outra ferramenta iguala isso.
  3. Nenhuma ferramenta distingue contextos factualmente errados de contextos factualmente corretos: Todas as cinco ferramentas pontuam negativos difíceis mais alto que contextos parciais, invertendo a ordem correta de relevância. Uma passagem com as entidades certas e a resposta errada consistentemente supera uma passagem com o tópico certo, mas sem resposta. Isso é consistente com a medição de relevância de contexto avaliando adequação tópica, não precisão factual.
  4. DeepEval sub-pontua contextos dourados: A decomposição de declarações do DeepEval produz classificações competitivas (NDCG@5 = 0.923), mas pontua contextos dourados em média 0.46 vs 0.82–0.91 para outras ferramentas. Isso o torna não confiável para identificar o melhor contexto único.
  5. A escala ternária do UpTrain limita a discriminação: Três valores de saída (0, 0.5, 1.0) não podem representar cinco níveis de relevância. O UpTrain mostra a pior razão de discriminação (1.4:1) e a menor precisão de classificação (27.6% de ordenação perfeita).

Discriminação: contexto dourado vs. negativo difícil

Com que frequência a ferramenta atribui uma pontuação mais alta ao contexto dourado do que ao negativo difícil com entidades trocadas?

Vitória = pontuação do dourado estritamente maior. Empate = pontuações iguais. Derrota = negativo difícil pontua mais alto.

O WandB tem o menor número de derrotas (4.8%), mas também o menor número de vitórias (15.5%): sua pontuação binária produz empates 80% das vezes. Quando diferencia, quase sempre acerta a direção. A precisão Top-1 estrita do WandB (o dourado é o máximo único) é de apenas 8.3%, comparado a 25.3% para o TruLens; sua precisão Top-1 argmax é alta porque o contexto dourado está no índice 0 e se beneficia do desempate.

Qualidade da classificação

Precisão Pareada = % de todos os 10 pares de contextos por amostra classificados corretamente. Precisão Top-2 = o contexto com maior pontuação é dourado ou parcial. Precisão 5-Vias = classificação monotônica perfeita em todos os 5 níveis.

O WandB lidera nas três métricas porque sua pontuação binária cria uma divisão natural de dois níveis (relevante vs. irrelevante) que elimina erros de ordenação dentro do nível. Nota: a precisão pareada conta empates como corretos (s[i] >= s[j]), o que beneficia ferramentas binárias. NDCG@5 e Spearman ρ (mostrados no gráfico acima) penalizam empates e classificam o TruLens em primeiro.

Pontuações médias por nível de relevância

Nenhuma ferramenta ordena corretamente Parcial > Negativo Difícil.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Como cada ferramenta avalia a relevância do contexto

Todas as cinco ferramentas usam GPT-4o como seu juiz subjacente, mas empregam estratégias de avaliação diferentes.

WandB Weave: Prompt binário de LLM

O WandB envia um único prompt ao LLM solicitando que avalie a relevância “em uma escala de 0 a 1”. No entanto, seu esquema de resposta interna define a pontuação como um inteiro, portanto, o modelo só pode retornar 0 ou 1.

Uma chamada de LLM, uma decisão binária. O WandB responde “este é o contexto certo?” de forma limpa (maior precisão Top-1), mas não pode expressar graus de relevância: um contexto parcial e um negativo difícil recebem a mesma pontuação.

Valores de saída: 0, 1

TruLens: Escala Likert de 4 pontos

O TruLens instrui o LLM como um “avaliador de RELEVÂNCIA” com critérios explícitos para uma escala de 0 a 3:

  • 0: Irrelevante para a consulta
  • 1: Relevante para parte da consulta
  • 2: Relevante para a maior parte da consulta
  • 3: Relevante para a totalidade da consulta

A pontuação bruta é normalizada para 0.0–1.0 dividindo por 3. Isso dá ao TruLens quatro níveis de saída distintos, fornecendo granularidade suficiente para distinguir contextos parciais de negativos difíceis, mantendo o prompt simples.

Valores de saída: 0.0, 0.33, 0.67, 1.0

Ragas: Média de dois juízes

O Ragas executa dois prompts de juiz independentes em cada avaliação, cada um com uma formulação diferente dos mesmos critérios (0 = irrelevante, 1 = parcialmente relevante, 2 = totalmente relevante). A pontuação final é a média de ambos os juízes, normalizada para 0.0–1.0.

Como duas escalas de 3 pontos são calculadas em média, o Ragas produz cinco valores possíveis, mais valores de saída do que qualquer outra ferramenta testada. O design de dois juízes também oferece resistência interna à sensibilidade do prompt.

Valores de saída: 0.0, 0.25, 0.5, 0.75, 1.0

UpTrain: Classificação ternária (A/B/C)

O UpTrain enquadra a relevância como uma classificação de múltipla escolha:

  • A (1.0): O contexto pode responder completamente à consulta
  • B (0.5): O contexto pode fornecer alguma resposta relevante, mas não pode responder completamente
  • C (0.0): O contexto não contém nenhuma informação para responder à consulta

O design ternário pode distinguir “parcialmente relevante” de “irrelevante”, mas não pode separar “enganoso” de “tangencialmente relacionado”; ambos podem cair na mesma categoria.

Valores de saída: 0.0, 0.5, 1.0

DeepEval: Decomposição de declarações (G-Eval)

Em vez de pedir uma única pontuação de relevância, o DeepEval decompõe o contexto em declarações individuais e, em seguida, solicita ao LLM que julgue cada declaração como “sim” (relevante) ou “não” (irrelevante) para a consulta. A pontuação final é a proporção de declarações relevantes em relação ao total de declarações.

O resultado é uma pontuação contínua (por exemplo, 7 de 10 declarações relevantes = 0.70). No entanto, a abordagem é rigorosa: mesmo um contexto altamente relevante é penalizado se contiver frases fora do tópico. Contextos dourados às vezes incluem detalhes contextuais que a decomposição marca como “irrelevantes”, reduzindo a pontuação abaixo da de um negativo difícil mais curto e focado. Isso explica a precisão Top-1 de 78.1% do DeepEval.

Valores de saída: Contínuo (0.0–1.0)

RAG metodologia do benchmark das ferramentas de avaliação

Design do conjunto de dados adversarial

Cada consulta tem cinco contextos em um nível de relevância distinto:

Conjunto de dados

Combinamos duas fontes:

HaluEval (480 amostras): Perguntas de conhecimento geral abrangendo música, cinema, esportes, história, geografia e mais. Negativos difíceis, contextos parciais e negativos suaves são gerados pelo Claude.

HotPotQA (530 amostras): Perguntas de raciocínio multi-hop que exigem síntese de informações em vários documentos.

Total: 1,010 amostras, cada uma com 5 contextos = 5,050 avaliações de contexto por ferramenta. Todas as amostras passaram por filtragem automática de vazamento (489 amostras removidas durante a geração por vazamento de resposta).

Protocolo entre modelos

Para eliminar o viés de autopreferência (onde um avaliador LLM prefere texto gerado por si mesmo), usamos Claude Sonnet 4.5 para geração de contexto adversarial e GPT-4o como juiz para todas as ferramentas. Ambos foram chamados via OpenRouter com temperatura=0.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

As armadilhas adversariais

A armadilha multi-hop (Confusão de relação)

Perguntas geralmente exigem rastrear uma cadeia de relacionamento (por exemplo, A está relacionado a B, que está relacionado a C). Negativos difíceis respondem a uma versão mais simples da pergunta, quebrando a cadeia.

ID da pergunta 89: “Quem publica a série de jogos da qual Retro City Rampage é uma paródia?” Resposta alvo: Rockstar Games

A armadilha do distrator de entidade

Recuperadores frequentemente encontram o local ou assunto correto, mas retornam metadados sobre o evento ou atributo errado.

ID da pergunta 90: “…The Bridge Inn é o local de qual competição anual de mentiras, realizada em Cumbria, Inglaterra?” Resposta alvo: World’s Biggest Liar

A armadilha da relevância parcial

Um contexto com o tópico e entidades certas, mas sem resposta.

ID da pergunta 9: “Quem escreveu as letras de Portofino com um colaborador em ‘Fiddler on the Roof’?” Resposta alvo: Richard Ney

TruLens e DeepEval pontuam corretamente contextos parciais mais altos do que negativos difíceis especificamente nessas amostras, embora esse padrão não se mantenha em todo o conjunto de dados.

Qual ferramenta você deve usar?

Conclusão

A granularidade da pontuação é o principal tradeoff. Ferramentas binárias (WandB) vencem na identificação porque cada empate é favorecido a elas; ferramentas de múltiplos pontos (TruLens, Ragas) vencem na classificação porque podem expressar graus de relevância.

A relevância de contexto funciona como um filtro de primeira passagem: todas as ferramentas separam contextos relevantes de irrelevantes mais de 91% das vezes (precisão pareada). Mas nenhuma delas verifica a precisão factual. Uma passagem com as entidades certas e a resposta errada pontua alto em todas as ferramentas testadas. Para correção factual, combine com métricas de fidelidade da resposta.

Limitações

  1. Modelo de juiz único: Todas as avaliações usam GPT-4o como juiz. Os resultados podem diferir com outros modelos.
  2. Apenas relevância de contexto: Este benchmark avalia apenas a pontuação de relevância de contexto, não a fidelidade da resposta ou outras métricas de RAG.
  3. Configurações padrão: As ferramentas foram avaliadas com as configurações padrão. O desempenho pode melhorar com engenharia de prompt personalizada.
  4. Execução única com convenção de desempate: O benchmark foi executado uma vez com temperatura=0. A precisão Top-1 usa argmax (primeiro índice ganha empates), o que beneficia ferramentas com altas taxas de empate (WandB: 86%). Relatamos o Top-1 estrito juntamente com o argmax quando relevante.
  5. Conjunto de dados apenas adversarial: Todos os negativos difíceis usam troca de entidades. Os resultados refletem o desempenho sob condições adversariais; as ferramentas podem ter desempenho diferente em contextos recuperados naturalmente.

Leitura adicional

Explore outros benchmarks de RAG, como:

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani and Ekrem Sarı (2026) - "RAG Ferramentas de Avaliação: Weights & Biases vs Ragas vs DeepEval". Publicado on-line em AIMultiple.com. Acessado em 23 Março 2026, em: https://aimultiple.com/rag-evaluation-tools [Recurso on-line]

Dilmegani, C., & Sarı, E. (2026, 23 Março). RAG Ferramentas de Avaliação: Weights & Biases vs Ragas vs DeepEval. AIMultiple. https://aimultiple.com/rag-evaluation-tools

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{RAG Ferramentas de Avaliação: Weights & Biases vs Ragas vs DeepEval}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/rag-evaluation-tools}},
  note   = {AIMultiple. Acessado em 23 Março 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem é o analista principal da AIMultiple desde 2017. A AIMultiple fornece informações para centenas de milhares de empresas (segundo o SimilarWeb), incluindo 55% das empresas da Fortune 500, todos os meses. O trabalho de Cem foi citado por importantes publicações globais, como Business Insider, Forbes e Washington Post, além de empresas globais como Deloitte e HPE, ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia. Você pode ver mais empresas e recursos renomados que mencionaram a AIMultiple. Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor na área. Ele assessorou empresas em suas decisões tecnológicas na McKinsey & Company e na Altman Solon por mais de uma década. Também publicou um relatório da McKinsey sobre digitalização. Liderou a estratégia de tecnologia e a área de compras de uma empresa de telecomunicações, reportando-se diretamente ao CEO. Além disso, liderou o crescimento comercial da empresa de tecnologia avançada Hypatos, que atingiu uma receita recorrente anual de sete dígitos e uma avaliação de nove dígitos, partindo de zero, em apenas dois anos. O trabalho de Cem no Hypatos foi noticiado por importantes publicações de tecnologia, como TechCrunch e Business Insider. Cem participa regularmente como palestrante em conferências internacionais de tecnologia. Ele se formou em engenharia da computação pela Universidade Bogazici e possui um MBA pela Columbia Business School.
Ver perfil completo
Pesquisado por
Ekrem Sarı
Ekrem Sarı
Pesquisador de IA
Ekrem é pesquisador de IA na AIMultiple, com foco em automação inteligente, GPUs, agentes de IA e frameworks RAG.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450