Servicios
Contáctanos

RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval

Cem Dilmegani
Cem Dilmegani
actualizado el 23 de mar. de 2026

Cuando un pipeline de RAG recupera el contexto incorrecto, el LLM genera con confianza la respuesta equivocada. Los evaluadores de relevancia contextual son la defensa principal.

Evaluamos cinco herramientas en 1,460 preguntas y más de 14,600 contextos puntuados bajo condiciones idénticas: mismo modelo juez (GPT-4o), configuraciones predeterminadas y sin prompts personalizados. En condiciones estándar, WandB, TruLens y Ragas emergieron como los de mejor rendimiento. Bajo presión adversarial (negativos difíciles con entidades intercambiadas), WandB tuvo el mejor desempeño.

Resultados del benchmark de herramientas de evaluación de RAG

Loading Chart


Los tres mejores (WandB, TruLens, Ragas) están estadísticamente empatados en precisión Top-1 (IC del 95% superpuesto entre 94.0% y 98.0%).

Para entender nuestra evaluación y métricas en detalle, consulta nuestra metodología de benchmark para las herramientas de evaluación de RAG.

Métricas explicadas

Precisión Top-1: ¿Puede la herramienta asignar la puntuación de relevancia más alta al contexto dorado? Esto mide la seguridad contra la recuperación adversarial, un modo de fallo común en producción.

NDCG@5 (ganancia acumulada descontada normalizada): Dados cinco contextos con diferentes niveles de relevancia (4, 3, 2, 1, 0), ¿ordena la herramienta correctamente? A diferencia de la precisión binaria, NDCG recompensa a las herramientas que asignan puntuaciones proporcionalmente más altas a los contextos más relevantes.

Spearman ρ (correlación de rangos): ¿Qué tan bien se correlaciona el ranking de puntuaciones de una herramienta con el orden de relevancia real? Una herramienta perfecta produciría ρ = 1.0.

MRR (rango recíproco medio): Promedio de 1/rango para el contexto dorado. Si una herramienta clasifica el contexto dorado primero, MRR = 1.0; segundo, MRR = 0.5; tercero, MRR = 0.33. Penaliza a las herramientas que entierran el contexto correcto por debajo de otros menos relevantes.

Hallazgos clave

  1. WandB lidera en identificación, TruLens lidera en ranking: WandB tiene la mayor precisión Top-1 (94.5%) pero el NDCG@5 más bajo (0.910) y Spearman ρ (0.669). TruLens lidera en NDCG@5 (0.932), Spearman ρ (0.750) y MRR (0.594). La diferencia se reduce al diseño de puntuación: la puntuación binaria de WandB es simple pero burda; la escala de 4 puntos de TruLens tiene más resolución pero es más propensa a inversiones.
  2. TruLens tiene la mayor ratio de discriminación: Al distinguir un contexto correcto de una versión casi idéntica con entidades intercambiadas, TruLens acierta la dirección el 35.5% de las veces con solo 8.4% de inversiones (ratio 4.2:1). Ninguna otra herramienta iguala esto.
  3. Ninguna herramienta distingue contextos factualmente incorrectos de los correctos: Las cinco herramientas puntúan los negativos difíciles más alto que los contextos parciales, invirtiendo el orden de relevancia correcto. Un pasaje con las entidades correctas y la respuesta equivocada obtiene consistentemente una puntuación más alta que un pasaje con el tema correcto pero sin respuesta. Esto es consistente con que la relevancia contextual mide el ajuste temático, no la precisión factual.
  4. DeepEval sub-puntúa los contextos dorados: La descomposición de declaraciones de DeepEval produce rankings competitivos (NDCG@5 = 0.923) pero puntúa los contextos dorados con una media de 0.46 frente a 0.82–0.91 para otras herramientas. Esto lo hace poco fiable para identificar el mejor contexto único.
  5. La escala ternaria de UpTrain limita la discriminación: Tres valores de salida (0, 0.5, 1.0) no pueden representar cinco niveles de relevancia. UpTrain muestra la peor ratio de discriminación (1.4:1) y la menor precisión de ranking (27.6% de ordenación perfecta).

Discriminación: dorado vs. negativo difícil

¿Con qué frecuencia asigna la herramienta una puntuación más alta al contexto dorado que al negativo difícil con entidades intercambiadas?

Victoria = el dorado puntúa estrictamente más alto. Empate = puntuaciones iguales. Derrota = el negativo difícil puntúa más alto.

WandB tiene la menor cantidad de derrotas (4.8%) pero también la menor cantidad de victorias (15.5%): su puntuación binaria produce empates el 80% de las veces. Cuando sí diferencia, casi siempre acierta la dirección. La precisión Top-1 estricta de WandB (el dorado es el máximo único) es solo del 8.3%, en comparación con el 25.3% de TruLens; su Top-1 argmax es alto porque el contexto dorado está en el índice 0 y se beneficia del desempate.

Calidad de ranking

Prec. por pares = % de los 10 pares de contexto por muestra clasificados correctamente. Prec. Top-2 = el contexto con mayor puntuación es dorado o parcial. Prec. 5 vías = ranking monótono perfecto en los 5 niveles.

WandB lidera en las tres métricas porque su puntuación binaria crea una división natural de dos niveles (relevante vs. irrelevante) que elimina errores de ordenación dentro del mismo nivel. Nota: la precisión por pares cuenta los empates como correctos (s[i] >= s[j]), lo que beneficia a las herramientas binarias. NDCG@5 y Spearman ρ (mostrados en el gráfico anterior) penalizan los empates y sitúan a TruLens en primer lugar.

Puntuaciones medias por nivel de relevancia

Ninguna herramienta ordena correctamente Parcial > Negativo Difícil.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Cómo evalúa cada herramienta la relevancia contextual

Las cinco herramientas usan GPT-4o como su juez subyacente, pero emplean diferentes estrategias de evaluación.

WandB Weave: Prompt binario para LLM

WandB envía un único prompt al LLM pidiéndole que califique la relevancia "en una escala de 0 a 1". Sin embargo, su esquema interno de respuesta define la puntuación como un entero, por lo que el modelo solo puede devolver 0 o 1.

Una llamada al LLM, una decisión binaria. WandB responde "¿es este el contexto correcto?" de forma limpia (mayor precisión Top-1) pero no puede expresar grados de relevancia: un contexto parcial y un negativo difícil reciben la misma puntuación.

Valores de salida: 0, 1

TruLens: Escala Likert de 4 puntos

TruLens solicita al LLM como un "calificador de RELEVANCIA" con criterios explícitos para una escala de 0-3:

  • 0: Irrelevante para la consulta
  • 1: Relevante para parte de la consulta
  • 2: Relevante para la mayoría de la consulta
  • 3: Relevante para la totalidad de la consulta

La puntuación bruta se normaliza a 0.0–1.0 dividiendo por 3. Esto le da a TruLens cuatro niveles de salida distintos, proporcionando suficiente granularidad para distinguir contextos parciales de negativos difíciles mientras mantiene el prompt simple.

Valores de salida: 0.0, 0.33, 0.67, 1.0

Ragas: Promedio de doble juez

Ragas ejecuta dos prompts de juez independientes en cada evaluación, cada uno con una redacción diferente de los mismos criterios (0 = irrelevante, 1 = parcialmente relevante, 2 = completamente relevante). La puntuación final es el promedio de ambos jueces, normalizado a 0.0–1.0.

Dado que se promedian dos escalas de 3 puntos, Ragas produce cinco valores posibles, más valores de salida que cualquier otra herramienta probada. El diseño de doble juez también proporciona resistencia incorporada a la sensibilidad al prompt.

Valores de salida: 0.0, 0.25, 0.5, 0.75, 1.0

UpTrain: Clasificación ternaria (A/B/C)

UpTrain plantea la relevancia como una clasificación de opción múltiple:

  • A (1.0): El contexto puede responder la consulta completamente
  • B (0.5): El contexto puede dar alguna respuesta relevante pero no puede responder completamente
  • C (0.0): El contexto no contiene información para responder la consulta

El diseño ternario puede distinguir "parcialmente relevante" de "irrelevante" pero no puede separar "engañoso" de "tangencialmente relacionado"; ambos pueden caer en el mismo grupo.

Valores de salida: 0.0, 0.5, 1.0

DeepEval: Descomposición de declaraciones (G-Eval)

En lugar de pedir una única puntuación de relevancia, DeepEval descompone el contexto en declaraciones individuales y luego pide al LLM que califique cada declaración como "sí" (relevante) o "no" (irrelevante) para la consulta. La puntuación final es la proporción de declaraciones relevantes sobre el total de declaraciones.

El resultado es una puntuación continua (por ejemplo, 7 de 10 declaraciones relevantes = 0.70). Sin embargo, el enfoque es estricto: incluso un contexto altamente relevante es penalizado si contiene alguna oración fuera del tema. Los contextos dorados a veces incluyen detalles contextuales que la descomposición marca como "irrelevantes", arrastrando la puntuación por debajo de la de un negativo difícil más corto y enfocado. Esto explica la precisión Top-1 del 78.1% de DeepEval.

Valores de salida: Continuo (0.0–1.0)

Metodología del benchmark de herramientas de evaluación de RAG

Diseño del dataset adversarial

Cada consulta tiene cinco contextos en un nivel de relevancia distinto:

Dataset

Combinamos dos fuentes:

HaluEval (480 muestras): Preguntas de conocimiento general que abarcan música, cine, deportes, historia, geografía y más. Los negativos difíciles, contextos parciales y negativos suaves son generados por Claude.

HotPotQA (530 muestras): Preguntas de razonamiento multi-salto que requieren síntesis de información a través de múltiples documentos.

Total: 1,010 muestras, cada una con 5 contextos = 5,050 evaluaciones de contexto por herramienta. Todas las muestras pasaron el filtrado automatizado de fugas (489 muestras eliminadas durante la generación por fuga de respuestas).

Protocolo entre modelos

Para eliminar el sesgo de autopreferencia (donde un LLM evaluador prefiere texto generado por sí mismo), usamos Claude Sonnet 4.5 para la generación de contextos adversariales y GPT-4o como juez para todas las herramientas. Ambos fueron llamados a través de OpenRouter con temperatura=0.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Las trampas adversariales

La trampa multi-salto (Confusión de relaciones)

Las preguntas a menudo requieren trazar una cadena de relaciones (por ejemplo, A está relacionado con B, quien está relacionado con C). Los negativos difíciles responden una versión más simple de la pregunta, rompiendo la cadena.

ID de pregunta 89: "¿Quién publica la serie de juegos de la cual Retro City Rampage es una parodia?" Respuesta objetivo: Rockstar Games

La trampa del distractor de entidad

Los recuperadores a menudo encuentran la ubicación o el sujeto correcto, pero devuelven metadatos sobre el evento o atributo equivocado.

ID de pregunta 90: "…The Bridge Inn es el lugar de qué competencia anual de contar mentiras, celebrada en Cumbria, Inglaterra?" Respuesta objetivo: World's Biggest Liar

La trampa de relevancia parcial

Un contexto con el tema y las entidades correctas pero sin respuesta.

ID de pregunta 9: "¿Quién escribió las letras de Portofino con un colaborador en 'Fiddler on the Roof'?" Respuesta objetivo: Richard Ney

TruLens y DeepEval puntúan correctamente los contextos parciales más alto que los negativos difíciles en estas muestras específicamente, aunque este patrón no se mantiene en todo el dataset.

¿Qué herramienta deberías usar?

Conclusión

La granularidad de puntuación es la principal compensación. Las herramientas binarias (WandB) ganan en identificación porque cada empate predetermina a su favor; las herramientas multipunto (TruLens, Ragas) ganan en ranking porque pueden expresar grados de relevancia.

La relevancia contextual funciona como un filtro de primera pasada: todas las herramientas separan contextos relevantes de irrelevantes más del 91% de las veces (precisión por pares). Pero ninguna verifica la precisión factual. Un pasaje con las entidades correctas y la respuesta equivocada obtiene una puntuación alta en todas las herramientas probadas. Para la corrección factual, combínalas con métricas de fidelidad de respuesta.

Limitaciones

  1. Modelo juez único: Todas las evaluaciones usan GPT-4o como juez. Los resultados pueden diferir con otros modelos.
  2. Solo relevancia contextual: Este benchmark evalúa únicamente la puntuación de relevancia contextual, no la fidelidad de respuesta u otras métricas de RAG.
  3. Configuraciones predeterminadas: Las herramientas se evaluaron tal cual. El rendimiento puede mejorar con ingeniería de prompts personalizada.
  4. Ejecución única con convención de desempate: El benchmark se ejecutó una vez con temperatura=0. La precisión Top-1 usa argmax (el primer índice gana los empates), lo que beneficia a las herramientas con altas tasas de empate (WandB: 86%). Reportamos Top-1 estricta junto con argmax cuando es relevante.
  5. Dataset solo adversarial: Todos los negativos difíciles usan intercambio de entidades. Los resultados reflejan el rendimiento bajo condiciones adversariales; las herramientas pueden comportarse diferente en contextos recuperados naturalmente.

Lecturas adicionales

Explora otros benchmarks de RAG, como:

Cita esta investigación

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Ekrem Sarı (2026) - "RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval". Publicado en línea en AIMultiple.com. Recuperado el 23 de Marzo de 2026, de: https://aimultiple.com/rag-evaluation-tools [Recurso en línea]

Dilmegani, C., & Sarı, E. (2026, 23 de Marzo). RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval. AIMultiple. https://aimultiple.com/rag-evaluation-tools

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Sarı, Ekrem},
  title  = {{RAG Herramientas de evaluación: Weights & Biases vs Ragas vs DeepEval}},
  year   = {2026},
  month  = mar,
  howpublished    = {\url{https://aimultiple.com/rag-evaluation-tools}},
  note   = {AIMultiple. Recuperado el 23 de Marzo de 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista principal
Cem ha sido el analista principal de AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluyendo el 55% de las empresas Fortune 500 cada mes. El trabajo de Cem ha sido citado por importantes publicaciones globales como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea. Puede consultar más empresas y recursos de renombre que citan a AIMultiple. A lo largo de su carrera, Cem se desempeñó como consultor, comprador y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización. Lideró la estrategia y adquisición de tecnología de una empresa de telecomunicaciones, reportando directamente al CEO. Asimismo, lideró el crecimiento comercial de la empresa de tecnología avanzada Hypatos, que alcanzó ingresos recurrentes anuales de siete cifras y una valoración de nueve cifras partiendo de cero en tan solo dos años. El trabajo de Cem en Hypatos fue reseñado por importantes publicaciones tecnológicas como TechCrunch y Business Insider. Cem participa regularmente como ponente en conferencias internacionales de tecnología. Se graduó en ingeniería informática por la Universidad de Bogazici y posee un MBA de la Columbia Business School.
Ver perfil completo
Investigado por
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA en AIMultiple, donde se centra en la automatización inteligente, las GPU, los agentes de IA y los marcos de trabajo RAG.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450