Servicios
Contáctanos

RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval

Cem Dilmegani
Cem Dilmegani
actualizado el 23 de mar. de 2026

Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta incorrecta. Los evaluadores de relevancia del contexto son la principal defensa.

Comparamos cinco herramientas en 1.460 preguntas y 14.600+ contextos evaluados bajo condiciones idénticas: el mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB, TruLens y Ragas emergieron como los de mejor rendimiento. Bajo presión adversaria (negativos duros con entidades intercambiadas), WandB obtuvo el mejor desempeño.

RAG resultados del benchmark de herramientas de evaluación

Loading Chart


Los tres primeros (WandB, TruLens, Ragas) están estadísticamente empatados en la precisión Top-1 (IC del 95 % se superpone entre 94.0 % y 98.0 %).

Para comprender en detalle nuestra evaluación y métricas, consulte nuestra metodología del benchmark para las herramientas de evaluación de RAG.

Métricas explicadas

Precisión Top-1: ¿Puede la herramienta asignar la puntuación de relevancia más alta al contexto dorado? Esto mide la seguridad frente a la recuperación adversaria, un modo de fallo común en producción.

NDCG@5 (ganancia acumulada descontada normalizada): Dados cinco contextos en diferentes niveles de relevancia (4, 3, 2, 1, 0), ¿clasifica la herramienta en el orden correcto? A diferencia de la precisión binaria, NDCG premia a las herramientas que asignan puntuaciones proporcionalmente más altas a contextos más relevantes.

Spearman ρ (correlación de rangos): ¿Qué tan bien se correlaciona la clasificación de puntuaciones de una herramienta con el orden de relevancia de referencia? Una herramienta perfecta produciría ρ = 1.0.

MRR (rango recíproco medio): Promedio de 1/rango para el contexto dorado. Si una herramienta clasifica el contexto dorado primero, MRR = 1.0; segundo, MRR = 0.5; tercero, MRR = 0.33. Penaliza a las herramientas que entierran el contexto correcto por debajo de otros menos relevantes.

Hallazgos clave

  1. WandB lidera en identificación, TruLens lidera en clasificación: WandB tiene la mayor precisión Top-1 (94.5 %) pero el NDCG@5 más bajo (0.910) y el Spearman ρ más bajo (0.669). TruLens lidera en NDCG@5 (0.932), Spearman ρ (0.750) y MRR (0.594). La diferencia se reduce al diseño de puntuación: la puntuación binaria de WandB es simple pero gruesa; la escala de 4 puntos de TruLens tiene más resolución, pero es más propensa a inversiones.
  2. TruLens tiene el mayor ratio de discriminación: Al distinguir un contexto correcto de una versión casi idéntica con entidades intercambiadas, TruLens acierta la dirección el 35.5 % de las veces con solo un 8.4 % de inversiones (ratio 4.2:1). Ninguna otra herramienta iguala esto.
  3. Ninguna herramienta distingue entre contextos factualmente incorrectos y factualmente correctos: Las cinco herramientas puntúan los negativos duros por encima de los contextos parciales, invirtiendo el orden de relevancia correcto. Un pasaje con las entidades correctas y la respuesta incorrecta supera de manera consistente a un pasaje con el tema correcto pero sin respuesta. Esto es coherente con que la relevancia del contexto mida el ajuste temático, no la exactitud factual.
  4. DeepEval infravalora los contextos dorados: La descomposición de enunciados de DeepEval produce clasificaciones competitivas (NDCG@5 = 0.923) pero puntúa los contextos dorados con una media de 0.46 frente a 0.82–0.91 para otras herramientas. Esto lo hace poco fiable para identificar el mejor contexto único.
  5. La escala ternaria de UpTrain limita la discriminación: Tres valores de salida (0, 0.5, 1.0) no pueden representar cinco niveles de relevancia. UpTrain muestra la peor ratio de discriminación (1.4:1) y la menor precisión de clasificación (27.6 % de orden perfecto).

Discriminación: contexto dorado vs. negativo duro

¿Con qué frecuencia asigna la herramienta una puntuación más alta al contexto dorado que al negativo duro con entidades intercambiadas?

Victoria = el contexto dorado obtiene una puntuación estrictamente superior. Empate = puntuaciones iguales. Derrota = el negativo duro obtiene una puntuación superior.

WandB tiene la menor cantidad de derrotas (4.8 %) pero también la menor cantidad de victorias (15.5 %): su puntuación binaria produce empates el 80 % de las veces. Cuando sí diferencia, casi siempre acierta la dirección. La precisión Top-1 estricta de WandB (el contexto dorado es el máximo único) es solo del 8.3 %, en comparación con el 25.3 % de TruLens; su Top-1 por argmax es alto porque el contexto dorado está en el índice 0 y se beneficia del desempate.

Calidad de la clasificación

Precisión por pares = % de los 10 pares de contextos por muestra clasificados correctamente. Precisión Top-2 = el contexto con mayor puntuación es dorado o parcial. Precisión de 5 niveles = clasificación monótona perfecta en los 5 niveles.

WandB lidera en las tres métricas porque su puntuación binaria crea una división natural en dos niveles (relevante vs. irrelevante) que elimina los errores de orden dentro del nivel. Nota: la precisión por pares cuenta los empates como correctos (s[i] >= s[j]), lo que beneficia a las herramientas binarias. NDCG@5 y Spearman ρ (mostrados en el gráfico anterior) penalizan los empates y sitúan a TruLens primero.

Puntuaciones promedio por nivel de relevancia

Ninguna herramienta ordena correctamente Parcial > Negativo duro.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Cómo evalúa cada herramienta la relevancia del contexto

Las cinco herramientas utilizan GPT-4o como juez subyacente, pero emplean diferentes estrategias de evaluación.

WandB Weave: prompt binario de LLM

WandB envía un único prompt al LLM pidiéndole que califique la relevancia «en una escala de 0 a 1». Sin embargo, su esquema de respuesta interno define la puntuación como un entero, por lo que el modelo solo puede devolver 0 o 1.

Una llamada al LLM, una decisión binaria. WandB responde «¿es este el contexto correcto?» de forma limpia (la mayor precisión Top-1) pero no puede expresar grados de relevancia: un contexto parcial y un negativo duro obtienen la misma puntuación.

Valores de salida: 0, 1

TruLens: escala Likert de 4 puntos

TruLens solicita al LLM como «evaluador de RELEVANCIA» con criterios explícitos para una escala de 0 a 3:

  • 0: Irrelevante para la consulta
  • 1: Relevante para parte de la consulta
  • 2: Relevante para la mayor parte de la consulta
  • 3: Relevante para la totalidad de la consulta

La puntuación bruta se normaliza a 0.0–1.0 dividiendo por 3. Esto da a TruLens cuatro niveles de salida distintos, proporcionando suficiente granularidad para distinguir los contextos parciales de los negativos duros mientras mantiene el prompt simple.

Valores de salida: 0.0, 0.33, 0.67, 1.0

Ragas: promedio de doble juez

Ragas ejecuta dos prompts de juez independientes en cada evaluación, cada uno con una formulación diferente de los mismos criterios (0 = irrelevante, 1 = parcialmente relevante, 2 = totalmente relevante). La puntuación final es el promedio de ambos jueces, normalizado a 0.0–1.0.

Debido a que se promedian dos escalas de 3 puntos, Ragas produce cinco valores posibles, más valores de salida que cualquier otra herramienta probada. El diseño de doble juez también proporciona resistencia integrada a la sensibilidad del prompt.

Valores de salida: 0.0, 0.25, 0.5, 0.75, 1.0

UpTrain: clasificación ternaria (A/B/C)

UpTrain plantea la relevancia como una clasificación de opción múltiple:

  • A (1.0): El contexto puede responder completamente a la consulta
  • B (0.5): El contexto puede dar alguna respuesta relevante, pero no puede responder completamente
  • C (0.0): El contexto no contiene información para responder la consulta

El diseño ternario puede distinguir «parcialmente relevante» de «irrelevante», pero no puede separar «engañoso» de «relacionado tangencialmente»; ambos pueden caer en el mismo grupo.

Valores de salida: 0.0, 0.5, 1.0

DeepEval: descomposición de enunciados (G-Eval)

En lugar de pedir una única puntuación de relevancia, DeepEval descompone el contexto en enunciados individuales y luego pide al LLM que dictamine cada enunciado como «sí» (relevante) o «no» (irrelevante) para la consulta. La puntuación final es la proporción de enunciados relevantes respecto al total de enunciados.

El resultado es una puntuación continua (por ejemplo, 7 de cada 10 enunciados relevantes = 0.70). Sin embargo, el enfoque es estricto: incluso un contexto muy relevante se penaliza si contiene oraciones fuera de tema. Los contextos dorados a veces incluyen detalles contextuales que la descomposición marca como «irrelevantes», arrastrando la puntuación por debajo de la de un negativo duro más corto y más centrado. Esto explica la precisión Top-1 del 78.1 % de DeepEval.

Valores de salida: Continua (0.0–1.0)

RAG metodología del benchmark de herramientas de evaluación

Diseño del dataset adversario

Cada consulta tiene cinco contextos en un nivel de relevancia distinto:

Dataset

Combinamos dos fuentes:

HaluEval (480 muestras): Preguntas de conocimiento general que abarcan música, cine, deportes, historia, geografía y más. Los negativos duros, los contextos parciales y los negativos suaves son generados por Claude.

HotPotQA (530 muestras): Preguntas de razonamiento multisalto que requieren síntesis de información en múltiples documentos.

Total: 1.010 muestras, cada una con 5 contextos = 5.050 evaluaciones de contexto por herramienta. Todas las muestras pasaron el filtrado automático de fugas (489 muestras eliminadas durante la generación por fuga de respuestas).

Protocolo entre modelos

Para eliminar el sesgo de autopreferencia (cuando un evaluador LLM prefiere texto generado por sí mismo), utilizamos Claude Sonnet 4.5 para la generación de contextos adversarios y GPT-4o como juez para todas las herramientas. Ambos se llamaron a través de OpenRouter con temperature=0.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Las trampas adversarias

La trampa multisalto (confusión de relaciones)

Las preguntas a menudo requieren rastrear una cadena de relaciones (por ejemplo, A está relacionado con B, quien está relacionado con C). Los negativos duros responden una versión más simple de la pregunta, rompiendo la cadena.

Pregunta ID 89: «¿Quién publica la serie de juegos de la que Retro City Rampage es una parodia?» Respuesta objetivo: Rockstar Games

La trampa del distractor de entidades

Los recuperadores a menudo encuentran la ubicación o el tema correctos, pero devuelven metadatos sobre el evento o atributo incorrecto.

Pregunta ID 90: «¿…The Bridge Inn es la sede de qué competencia anual de contar mentiras, celebrada en Cumbria, Inglaterra?» Respuesta objetivo: World’s Biggest Liar

La trampa de relevancia parcial

Un contexto con el tema y las entidades correctos, pero sin respuesta.

Pregunta ID 9: «¿Quién escribió la letra de Portofino con un colaborador en ‘Fiddler on the Roof’?» Respuesta objetivo: Richard Ney

TruLens y DeepEval puntúan correctamente los contextos parciales por encima de los negativos duros específicamente en estas muestras, aunque este patrón no se mantiene en todo el dataset.

¿Qué herramienta debería usar?

Conclusión

La granularidad de la puntuación es la principal compensación. Las herramientas binarias (WandB) ganan en identificación porque cada empate se resuelve a su favor; las herramientas multipunto (TruLens, Ragas) ganan en clasificación porque pueden expresar grados de relevancia.

La relevancia del contexto funciona como un filtro de primera pasada: todas las herramientas separan los contextos relevantes de los irrelevantes más del 91 % de las veces (precisión por pares). Pero ninguna verifica la exactitud factual. Un pasaje con las entidades correctas y la respuesta incorrecta obtiene una puntuación alta en todas las herramientas evaluadas. Para la corrección factual, combínela con métricas de fidelidad de la respuesta.

Limitaciones

  1. Modelo de juez único: Todas las evaluaciones utilizan GPT-4o como juez. Los resultados pueden variar con otros modelos.
  2. Solo relevancia del contexto: Este benchmark evalúa únicamente la puntuación de relevancia del contexto, no la fidelidad de la respuesta ni otras métricas de RAG.
  3. Configuraciones predeterminadas: Las herramientas se evaluaron tal como vienen. El rendimiento puede mejorar con ingeniería de prompts personalizada.
  4. Ejecución única con convención de desempate: El benchmark se ejecutó una vez con temperature=0. La precisión Top-1 utiliza argmax (el primer índice gana los empates), lo que beneficia a las herramientas con altas tasas de empates (WandB: 86 %). Informamos del Top-1 estricto junto con argmax cuando corresponde.
  5. Dataset exclusivamente adversario: Todos los negativos duros utilizan intercambio de entidades. Los resultados reflejan el rendimiento en condiciones adversarias; las herramientas pueden comportarse de manera diferente en contextos recuperados de forma natural.

Lecturas adicionales

Explore otros benchmarks de RAG, como:

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Ekrem Sarı (2026) - "RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval". Publicado en línea en AIMultiple.com. Recuperado el 23 de Marzo de 2026, de: https://aimultiple.com/rag-evaluation-tools [Recurso en línea]

Dilmegani, C., & Sarı, E. (2026, 23 de Marzo). RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval. AIMultiple. https://aimultiple.com/rag-evaluation-tools

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/rag-evaluation-tools}},
  note   = {AIMultiple. Recuperado el 23 de Marzo de 2026}
}

Registro de cambios

2 actualizaciones
  1. 2026

    Actualizados los resultados del benchmark en la sección de resultados del benchmark de herramientas de evaluación RAG.

  2. Actualizada la sección "Resultados de la evaluación comparativa de herramientas RAG" con nuevos resultados y métricas de la evaluación comparativa.

Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017.

El trabajo de Cem en AIMultiple ha sido citado por publicaciones líderes mundiales como Business Insider, Forbes, Morning Brew y Washington Post, empresas globales como Deloitte y HPE, ONG como World Economic Forum y organizaciones supranacionales como European Commission. [1], [2], [3], [4], [5]

A lo largo de su carrera, Cem trabajó como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización.

Dirigió la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando al CEO. También lideró el crecimiento comercial de la empresa de deep tech Hypatos, que alcanzó unos ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider.

Cem participa habitualmente en conferencias internacionales de tecnología. Se graduó en Bogazici University como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Investigado por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA y científico de datos en AIMultiple. Diseña y ejecuta benchmarks prácticos para sistemas de IA y LLM.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450