RAG Outils d'évaluation: Weights & Biases vs Ragas vs DeepEval
Lorsqu'un pipeline RAG récupère le mauvais contexte, le LLM génère avec assurance la mauvaise réponse. Les évaluateurs de pertinence du contexte constituent la première défense.
Nous avons évalué cinq outils sur 1 460 questions et plus de 14 600 contextes notés dans des conditions identiques : même modèle juge (GPT-4o), configurations par défaut et aucun prompt personnalisé. Dans des conditions standard, WandB, TruLens et Ragas se sont révélés les plus performants. Sous pression adversariale (négatifs durs avec entités échangées), WandB a obtenu les meilleurs résultats.
RAG : résultats du benchmark des outils d'évaluation
Les trois premiers (WandB, TruLens, Ragas) sont statistiquement à égalité sur l'exactitude Top-1 (intervalle de confiance à 95 % se chevauchant entre 94.0 % et 98.0 %).
Pour comprendre notre évaluation et nos métriques en détail, consultez notre méthodologie de benchmark pour les outils d'évaluation RAG.
Métriques expliquées
Exactitude Top-1 : L'outil peut-il attribuer le score de pertinence le plus élevé au contexte doré ? Cela mesure la sécurité contre la récupération adversariale, un mode de défaillance courant en production.
NDCG@5 (gain cumulé actualisé normalisé) : Étant donné cinq contextes à différents niveaux de pertinence (4, 3, 2, 1, 0), l'outil les classe-t-il dans le bon ordre ? Contrairement à l'exactitude binaire, le NDCG récompense les outils qui attribuent des scores proportionnellement plus élevés aux contextes plus pertinents.
Spearman ρ (corrélation de rang) : Dans quelle mesure le classement des scores d'un outil est-il corrélé avec l'ordre de pertinence de référence ? Un outil parfait produirait ρ = 1.0.
MRR (rang réciproque moyen) : Moyenne de 1/rang pour le contexte doré. Si un outil classe le contexte doré en premier, MRR = 1.0 ; deuxième, MRR = 0.5 ; troisième, MRR = 0.33. Pénalise les outils qui enterrent le contexte correct sous des contextes moins pertinents.
Principales conclusions
- WandB domine sur l'identification, TruLens domine sur le classement : WandB a l'exactitude Top-1 la plus élevée (94.5 %) mais le NDCG@5 le plus bas (0.910) et le ρ de Spearman le plus bas (0.669). TruLens domine sur NDCG@5 (0.932), Spearman ρ (0.750) et MRR (0.594). La différence tient à la conception de la notation : le scoring binaire de WandB est simple mais grossier ; l'échelle à 4 points de TruLens a plus de résolution mais est plus sujette aux inversions.
- TruLens a le ratio de discrimination le plus élevé : Lorsqu'il s'agit de distinguer un contexte correct d'une version quasi identique avec entité échangée, TruLens obtient la bonne direction 35.5 % du temps avec seulement 8.4 % d'inversions (ratio 4.2:1). Aucun autre outil ne rivalise.
- Aucun outil ne distingue les contextes factuellement faux des contextes factuellement corrects : Les cinq outils attribuent des scores plus élevés aux négatifs durs qu'aux contextes partiels, inversant l'ordre de pertinence correct. Un passage avec les bonnes entités mais la mauvaise réponse obtient systématiquement un score plus élevé qu'un passage avec le bon sujet mais sans réponse. Cela est cohérent avec le fait que la pertinence contextuelle mesure l'adéquation thématique, pas l'exactitude factuelle.
- DeepEval sous-évalue les contextes dorés : La décomposition en énoncés de DeepEval produit des classements compétitifs (NDCG@5 = 0.923) mais attribue aux contextes dorés une moyenne de 0.46 contre 0.82–0.91 pour les autres outils. Cela le rend peu fiable pour identifier le meilleur contexte unique.
- L'échelle ternaire d'UpTrain limite la discrimination : Trois valeurs de sortie (0, 0.5, 1.0) ne peuvent pas représenter cinq niveaux de pertinence. UpTrain présente le pire ratio de discrimination (1.4:1) et la précision de classement la plus faible (27.6 % d'ordre parfait).
Discrimination : contexte doré vs négatif dur
À quelle fréquence l'outil attribue-t-il un score plus élevé au contexte doré qu'au négatif dur avec entité échangée ?
Victoire = le score doré est strictement plus élevé. Égalité = scores égaux. Défaite = le négatif dur obtient un score plus élevé.
WandB a le moins de défaites (4.8 %) mais aussi le moins de victoires (15.5 %) : sa notation binaire produit des égalités 80 % du temps. Lorsqu'il différencie, il obtient presque toujours la bonne direction. L'exactitude Top-1 stricte de WandB (le contexte doré est le maximum unique) n'est que de 8.3 %, contre 25.3 % pour TruLens ; son Top-1 argmax est élevé car le contexte doré est à l'indice 0 et bénéficie du départage des égalités.
Qualité du classement
Précision par paires = % de toutes les 10 paires de contextes par échantillon classées correctement. Précision Top-2 = le contexte le mieux noté est doré ou partiel. Précision à 5 niveaux = classement monotone parfait sur les 5 niveaux.
WandB domine sur les trois métriques car sa notation binaire crée une séparation naturelle en deux niveaux (pertinent vs non pertinent) qui élimine les erreurs d'ordre intra-niveau. Remarque : la précision par paires compte les égalités comme correctes (s[i] >= s[j]), ce qui avantage les outils binaires. NDCG@5 et Spearman ρ (présentés dans le graphique ci-dessus) pénalisent les égalités et classent TruLens premier.
Scores moyens par niveau de pertinence
Aucun outil ne classe correctement Partiel > Négatif dur.
Comment chaque outil évalue la pertinence contextuelle
Les cinq outils utilisent GPT-4o comme juge sous-jacent, mais ils emploient des stratégies d'évaluation différentes.
WandB Weave : Binaire LLM prompt
WandB envoie un seul prompt au LLM lui demandant d'évaluer la pertinence « sur une échelle de 0 à 1 ». Cependant, son schéma de réponse interne définit le score comme un entier, de sorte que le modèle ne peut renvoyer que 0 ou 1.
Un appel LLM, une décision binaire. WandB répond clairement à « est-ce le bon contexte ? » (exactitude Top-1 la plus élevée) mais ne peut pas exprimer des degrés de pertinence : un contexte partiel et un négatif dur obtiennent le même score.
Valeurs de sortie : 0, 1
TruLens : échelle de Likert à 4 points
TruLens sollicite le LLM en tant que « évaluateur de PERTINENCE » avec des critères explicites pour une échelle de 0 à 3 :
- 0 : Non pertinent pour la requête
- 1 : Pertinent pour une partie de la requête
- 2 : Pertinent pour la majeure partie de la requête
- 3 : Pertinent pour l'intégralité de la requête
Le score brut est normalisé à 0.0–1.0 en divisant par 3. Cela donne à TruLens quatre niveaux de sortie distincts, offrant une granularité suffisante pour distinguer les contextes partiels des négatifs durs tout en gardant le prompt simple.
Valeurs de sortie : 0.0, 0.33, 0.67, 1.0
Ragas : moyenne de deux juges
Ragas exécute deux prompts de juge indépendants pour chaque évaluation, chacun avec une formulation différente des mêmes critères (0 = non pertinent, 1 = partiellement pertinent, 2 = pleinement pertinent). Le score final est la moyenne des deux juges, normalisée à 0.0–1.0.
Parce que deux échelles à 3 points sont moyennées, Ragas produit cinq valeurs possibles, soit plus de valeurs de sortie que tout autre outil testé. La conception à deux juges offre également une résistance intégrée à la sensibilité aux prompts.
Valeurs de sortie : 0.0, 0.25, 0.5, 0.75, 1.0
UpTrain : classification ternaire (A/B/C)
UpTrain conçoit la pertinence comme une classification à choix multiple :
- A (1.0) : Le contexte peut répondre complètement à la requête
- B (0.5) : Le contexte peut fournir une réponse partiellement pertinente mais ne peut pas répondre complètement
- C (0.0) : Le contexte ne contient aucune information pour répondre à la requête
La conception ternaire peut distinguer « partiellement pertinent » de « non pertinent » mais ne peut pas séparer « trompeur » de « tangentiellement lié » ; les deux peuvent tomber dans le même seau.
Valeurs de sortie : 0.0, 0.5, 1.0
DeepEval : décomposition en énoncés (G-Eval)
Au lieu de demander un score de pertinence unique, DeepEval décompose le contexte en énoncés individuels, puis demande au LLM de juger chaque énoncé comme « oui » (pertinent) ou « non » (non pertinent) pour la requête. Le score final est le ratio d'énoncés pertinents sur le total des énoncés.
Le résultat est un score continu (par exemple, 7 énoncés pertinents sur 10 = 0.70). Cependant, l'approche est stricte : même un contexte très pertinent est pénalisé s'il contient des phrases hors sujet. Les contextes dorés incluent parfois des détails contextuels que la décomposition marque comme « non pertinents », faisant chuter le score en dessous de celui d'un négatif dur plus court et plus ciblé. Cela explique l'exactitude Top-1 de DeepEval de 78.1 %.
Valeurs de sortie : Continu (0.0–1.0)
RAG : méthodologie du benchmark des outils d'évaluation
Conception du jeu de données adversariale
Chaque requête a cinq contextes à un niveau de pertinence distinct :
Jeu de données
Nous combinons deux sources :
HaluEval (480 échantillons) : questions de culture générale couvrant la musique, le cinéma, le sport, l'histoire, la géographie, etc. Les négatifs durs, les contextes partiels et les négatifs doux sont générés par Claude.
HotPotQA (530 échantillons) : questions de raisonnement multi-sauts nécessitant une synthèse d'informations à travers plusieurs documents.
Total : 1 010 échantillons, chacun avec 5 contextes = 5 050 évaluations de contexte par outil. Tous les échantillons ont passé le filtrage automatique des fuites (489 échantillons supprimés pendant la génération pour fuite de réponse).
Protocole inter-modèles
Pour éliminer le biais d'auto-préférence (où un évaluateur LLM préfère le texte généré par lui-même), nous avons utilisé Claude Sonnet 4.5 pour la génération de contextes adversariaux et GPT-4o comme juge pour tous les outils. Les deux ont été appelés via OpenRouter avec temperature=0.
Les pièges adversariaux
Le piège multi-sauts (confusion de relation)
Les questions nécessitent souvent de tracer une chaîne de relations (par exemple, A est lié à B, qui est lié à C). Les négatifs durs répondent à une version plus simple de la question, brisant la chaîne.
Question ID 89 : « Qui publie la série de jeux dont Retro City Rampage est une parodie ? » Réponse cible : Rockstar Games
Le piège du distracteur d'entité
Les systèmes de récupération trouvent souvent le bon emplacement ou sujet, mais renvoient des métadonnées sur le mauvais événement ou attribut.
Question ID 90 : « …The Bridge Inn est le lieu de quelle compétition annuelle de mensonges, tenue à Cumbria, en Angleterre ? » Réponse cible : World’s Biggest Liar
Le piège de la pertinence partielle
Un contexte avec le bon sujet et les bonnes entités mais sans réponse.
Question ID 9 : « Qui a écrit les paroles de Portofino avec un collaborateur sur « Fiddler on the Roof » ? » Réponse cible : Richard Ney
TruLens et DeepEval notent correctement les contextes partiels plus haut que les négatifs durs sur ces échantillons spécifiquement, bien que ce schéma ne tienne pas sur l'ensemble du jeu de données.
Quel outil devriez-vous utiliser ?
Conclusion
La granularité du scoring est le principal compromis. Les outils binaires (WandB) gagnent sur l'identification car chaque égalité joue en leur faveur ; les outils multi-points (TruLens, Ragas) gagnent sur le classement car ils peuvent exprimer des degrés de pertinence.
La pertinence contextuelle fonctionne comme un filtre de premier passage : tous les outils séparent les contextes pertinents des non pertinents plus de 91 % du temps (précision par paires). Mais aucun d'entre eux ne vérifie l'exactitude factuelle. Un passage avec les bonnes entités et la mauvaise réponse obtient un score élevé sur tous les outils testés. Pour la correction factuelle, associez des métriques de fidélité de réponse.
Limites
- Modèle juge unique : Toutes les évaluations utilisent GPT-4o comme juge. Les résultats peuvent différer avec d'autres modèles.
- Pertinence contextuelle uniquement : Ce benchmark évalue uniquement la notation de la pertinence contextuelle, pas la fidélité des réponses ou d'autres métriques RAG.
- Configurations par défaut : Les outils ont été évalués tels quels. Les performances peuvent s'améliorer avec une ingénierie de prompt personnalisée.
- Exécution unique avec convention de départage des égalités : Le benchmark a été exécuté une fois avec temperature=0. L'exactitude Top-1 utilise
argmax(le premier index gagne les égalités), ce qui avantage les outils avec des taux d'égalité élevés (WandB : 86 %). Nous rapportons le Top-1 strict parallèlement à l'argmax lorsque pertinent. - Jeu de données uniquement adversariale : Tous les négatifs durs utilisent l'échange d'entités. Les résultats reflètent les performances dans des conditions adverses ; les outils peuvent se comporter différemment sur des contextes récupérés naturellement.
Pour en savoir plus
Explorez d'autres benchmarks RAG, tels que :
- Embedding Models : OpenAI vs Gemini vs Cohere
- Top 16 Open Source Embedding Models pour RAG
- Top Vector Database pour RAG : Qdrant vs Weaviate vs Pinecone
- Benchmark des rerankers : Top 8 Models comparés
- Multimodal Embedding Models : Apple vs Meta vs OpenAI
- Top 10 Multilingual Embedding Models pour RAG
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{RAG Outils d'évaluation: Weights & Biases vs Ragas vs DeepEval}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/rag-evaluation-tools}},
note = {AIMultiple. Consulté le 23 Mars 2026}
}Journal des modifications
2 mises à jour- 2026
Mise à jour des résultats de référence dans la section des résultats de référence des outils d'évaluation RAG.
Mise à jour de la section « Résultats de l'évaluation comparative des outils RAG » avec de nouveaux résultats et métriques de référence.
Le travail de Cem chez AIMultiple a été cité par des publications mondiales de premier plan, notamment Business Insider, Forbes, Morning Brew et Washington Post, par des entreprises mondiales comme Deloitte et HPE, par des ONG comme World Economic Forum et par des organisations supranationales comme European Commission. [1], [2], [3], [4], [5]
Tout au long de sa carrière, Cem a été consultant en technologies, acheteur de technologies et entrepreneur technologique. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la digitalisation.
Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité du PDG. Il a également dirigé la croissance commerciale de l'entreprise de technologie profonde Hypatos, qui a atteint un revenu récurrent annuel à 7 chiffres et une valorisation à 9 chiffres, passant de 0 à ce résultat en deux ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.
Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de Bogazici University en tant qu'ingénieur informatique et titulaire d'un MBA de la Columbia Business School.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.