Strumenti di valutazione RAG: Weights & Biases vs Ragas vs DeepEval
Quando una pipeline RAG recupera il contesto sbagliato, il LLM genera con sicurezza la risposta sbagliata. I valutatori di rilevanza contestuale sono la principale difesa.
Abbiamo confrontato cinque strumenti su 1.460 domande e oltre 14.600 contesti valutati in condizioni identiche: stesso modello giudice (GPT-4o), configurazioni predefinite e nessun prompt personalizzato. In condizioni standard, WandB, TruLens e Ragas sono emersi come i migliori. Sotto pressione avversaria (negativi difficili con entità sostituite), WandB ha ottenuto i risultati migliori.
Risultati del benchmark degli strumenti di valutazione RAG
I primi tre (WandB, TruLens, Ragas) sono statisticamente a pari merito sull'accuratezza Top-1 (l'intervallo di confidenza al 95% si sovrappone tra il 94.0% e il 98.0%).
Per comprendere la nostra valutazione e le metriche in dettaglio, consulta la metodologia del benchmark per gli strumenti di valutazione RAG.
Metriche spiegate
Accuratezza Top-1: lo strumento può assegnare il punteggio di rilevanza più alto al contesto gold? Questo misura la sicurezza contro il retrieval avversariale, una modalità di errore comune in produzione.
NDCG@5 (normalized discounted cumulative gain): dati cinque contesti a diversi livelli di rilevanza (4, 3, 2, 1, 0), lo strumento li classifica nell'ordine corretto? A differenza dell'accuratezza binaria, l'NDCG premia gli strumenti che assegnano punteggi proporzionalmente più alti ai contesti più rilevanti.
Spearman ρ (correlazione di rango): quanto bene la classifica dei punteggi di uno strumento è correlata con l'ordinamento di rilevanza di riferimento? Uno strumento perfetto produrrebbe ρ = 1.0.
MRR (rango reciproco medio): media di 1/rango per il contesto gold. Se uno strumento classifica il contesto gold al primo posto, MRR = 1.0; al secondo, MRR = 0.5; al terzo, MRR = 0.33. Penalizza gli strumenti che seppelliscono il contesto corretto sotto contesti meno rilevanti.
Risultati principali
- WandB guida sull'identificazione, TruLens guida sul ranking: WandB ha la più alta accuratezza Top-1 (94.5%) ma il più basso NDCG@5 (0.910) e Spearman ρ (0.669). TruLens guida su NDCG@5 (0.932), Spearman ρ (0.750) e MRR (0.594). La differenza dipende dal design del punteggio: il punteggio binario di WandB è semplice ma grossolano; la scala a 4 punti di TruLens ha più risoluzione ma è più soggetta a inversioni.
- TruLens ha il più alto rapporto di discriminazione: nel distinguere un contesto corretto da una versione quasi identica con entità sostituita, TruLens indica la direzione corretta il 35.5% delle volte con solo il 8.4% di inversioni (rapporto 4.2:1). Nessun altro strumento lo eguaglia.
- Nessuno strumento distingue i contesti fattualmente errati da quelli fattualmente corretti: tutti e cinque gli strumenti assegnano ai negativi hard punteggi più alti che ai contesti parziali, invertendo l'ordine di rilevanza corretto. Un passaggio con le entità giuste e la risposta sbagliata ottiene costantemente un punteggio più alto di un passaggio con l'argomento giusto ma senza risposta. Ciò è coerente con una rilevanza contestuale che misura l'attinenza topica, non l'accuratezza fattuale.
- DeepEval assegna punteggi insufficienti ai contesti gold: la scomposizione in affermazioni di DeepEval produce classifiche competitive (NDCG@5 = 0.923) ma assegna ai contesti gold un punteggio medio di 0.46 contro 0.82–0.91 per gli altri strumenti. Ciò lo rende inaffidabile per identificare il singolo contesto migliore.
- La scala ternaria di UpTrain limita la discriminazione: tre valori di output (0, 0.5, 1.0) non possono rappresentare cinque livelli di rilevanza. UpTrain mostra il peggior rapporto di discriminazione (1.4:1) e la più bassa accuratezza di classificazione (27.6% di ordinamento perfetto).
Discriminazione: contesto gold vs. negativo hard
Con quale frequenza lo strumento assegna un punteggio più alto al contesto gold rispetto al negativo hard con entità sostituita?
Vittoria = il contesto gold ottiene un punteggio strettamente più alto. Pareggio = punteggi uguali. Sconfitta = il negativo hard ottiene un punteggio più alto.
WandB ha il minor numero di sconfitte (4.8%) ma anche il minor numero di vittorie (15.5%): il suo punteggio binario produce pareggi circa l'80% delle volte. Quando distingue, azzecca quasi sempre la direzione. L'accuratezza Top-1 rigorosa di WandB (il contesto gold è il massimo unico) è solo dell'8.3%, rispetto al 25.3% di TruLens; la sua Top-1 con argmax è alta perché il contesto gold è all'indice 0 e beneficia dello scioglimento dei pareggi.
Qualità del ranking
Accuratezza a coppie = % di tutte le 10 coppie di contesti per campione classificate correttamente. Accuratezza Top-2 = il contesto con il punteggio più alto è gold o parziale. Accuratezza a 5 vie = ranking monotonico perfetto su tutti i 5 livelli.
WandB guida su tutte e tre le metriche perché il suo punteggio binario crea una naturale divisione a due livelli (rilevante vs. irrilevante) che elimina gli errori di ordinamento all'interno dello stesso livello. Nota: l'accuratezza a coppie conta i pareggi come corretti (s[i] >= s[j]), il che avvantaggia gli strumenti binari. NDCG@5 e Spearman ρ (mostrati nel grafico sopra) penalizzano i pareggi e collocano TruLens al primo posto.
Punteggi medi per livello di rilevanza
Nessuno strumento ordina correttamente Parziale > Negativo hard.
Come ogni strumento valuta la rilevanza contestuale
Tutti e cinque gli strumenti usano GPT-4o come giudice sottostante, ma adottano strategie di valutazione diverse.
WandB Weave: prompt binario per LLM
WandB invia un singolo prompt al LLM chiedendogli di valutare la rilevanza “su una scala da 0 a 1”. Tuttavia, il suo schema di risposta interno definisce il punteggio come un intero, quindi il modello può restituire solo 0 o 1.
Una chiamata al LLM, una decisione binaria. WandB risponde in modo netto alla domanda “è questo il contesto giusto?” (la più alta accuratezza Top-1) ma non può esprimere gradi di rilevanza: un contesto parziale e un negativo hard ricevono lo stesso punteggio.
Valori di output: 0, 1
TruLens: scala Likert a 4 punti
TruLens interroga il LLM come “valutatore di RELEVANCE” con criteri espliciti per una scala 0-3:
- 0: Irrilevante rispetto alla query
- 1: Rilevante per parte della query
- 2: Rilevante per la maggior parte della query
- 3: Rilevante per l'intera query
Il punteggio grezzo viene normalizzato a 0.0–1.0 dividendolo per 3. Questo dà a TruLens quattro livelli di output distinti, offrendo una granularità sufficiente per distinguere i contesti parziali dai negativi hard mantenendo il prompt semplice.
Valori di output: 0.0, 0.33, 0.67, 1.0
Ragas: media di due giudici
Ragas esegue due prompt giudice indipendenti per ogni valutazione, ciascuno con una diversa formulazione degli stessi criteri (0 = irrilevante, 1 = parzialmente rilevante, 2 = completamente rilevante). Il punteggio finale è la media dei due giudici, normalizzata a 0.0–1.0.
Poiché vengono mediate due scale a 3 punti, Ragas produce cinque valori possibili, più valori di output di qualsiasi altro strumento testato. Il design a doppio giudice offre anche una resistenza integrata alla sensibilità ai prompt.
Valori di output: 0.0, 0.25, 0.5, 0.75, 1.0
UpTrain: classificazione ternaria (A/B/C)
UpTrain inquadra la rilevanza come classificazione a scelta multipla:
- A (1.0): il contesto può rispondere completamente alla query
- B (0.5): il contesto può fornire qualche risposta pertinente ma non può rispondere completamente
- C (0.0): il contesto non contiene informazioni per rispondere alla query
Il design ternario può distinguere “parzialmente rilevante” da “irrilevante” ma non può separare “ingannevole” da “tangenzialmente correlato”; entrambi possono finire nello stesso gruppo.
Valori di output: 0.0, 0.5, 1.0
DeepEval: scomposizione in affermazioni (G-Eval)
Invece di chiedere un singolo punteggio di rilevanza, DeepEval scompone il contesto in singole affermazioni, quindi chiede al LLM di giudicare ogni affermazione come “sì” (rilevante) o “no” (irrilevante) rispetto alla query. Il punteggio finale è il rapporto tra affermazioni rilevanti e affermazioni totali.
Il risultato è un punteggio continuo (ad es., 7 affermazioni rilevanti su 10 = 0.70). Tuttavia, l'approccio è severo: anche un contesto altamente rilevante viene penalizzato se contiene frasi fuori tema. I contesti gold a volte includono dettagli contestuali che la scomposizione contrassegna come “irrilevanti”, trascinando il punteggio al di sotto di quello di un negativo hard più breve e più focalizzato. Questo spiega l'accuratezza Top-1 di DeepEval pari a 78.1%.
Valori di output: continuo (0.0–1.0)
Metodologia del benchmark degli strumenti di valutazione RAG
Design del dataset avversariale
Ogni query ha cinque contesti a livelli di rilevanza distinti:
Dataset
Combiniamo due fonti:
HaluEval (480 campioni): domande di conoscenza generale che spaziano tra musica, cinema, sport, storia, geografia e altro. I negativi hard, i contesti parziali e i negativi soft sono generati da Claude.
HotPotQA (530 campioni): domande di ragionamento multi-hop che richiedono la sintesi di informazioni tra più documenti.
Totale: 1.010 campioni, ciascuno con 5 contesti = 5.050 valutazioni di contesto per strumento. Tutti i campioni hanno superato il filtro automatico anti-fuga di risposta (489 campioni rimossi durante la generazione per perdita di risposta).
Protocollo cross-model
Per eliminare il bias di auto-preferenza (quando un valutatore LLM preferisce il testo generato da se stesso), abbiamo usato Claude Sonnet 4.5 per la generazione dei contesti avversariali e GPT-4o come giudice per tutti gli strumenti. Entrambi sono stati chiamati tramite OpenRouter con temperature=0.
Le trappole avversariali
La trappola multi-hop (confusione di relazioni)
Le domande spesso richiedono di tracciare una catena di relazioni (ad es., A è collegato a B, che è collegato a C). I negativi hard rispondono a una versione più semplice della domanda, spezzando la catena.
ID domanda 89: “Chi pubblica la serie di giochi di cui Retro City Rampage è una parodia?” Risposta target: Rockstar Games
La trappola del distrattore di entità
I retriever spesso trovano la posizione o il soggetto corretto, ma restituiscono metadati sull'evento o sull'attributo sbagliato.
ID domanda 90: “…The Bridge Inn è la sede di quale competizione annuale di racconto di bugie, tenuta in Cumbria, Inghilterra?” Risposta target: World's Biggest Liar
La trappola della rilevanza parziale
Un contesto con l'argomento e le entità giuste ma senza risposta.
ID domanda 9: “Chi ha scritto il testo di Portofino insieme a un collaboratore di ‘Fiddler on the Roof’?” Risposta target: Richard Ney
TruLens e DeepEval assegnano correttamente un punteggio più alto ai contesti parziali rispetto ai negativi hard su questi campioni specifici, sebbene questo schema non si mantenga sull'intero dataset.
Quale strumento dovresti usare?
Conclusione
La granularità del punteggio è il principale compromesso. Gli strumenti binari (WandB) vincono sull'identificazione perché ogni pareggio va a loro favore; gli strumenti multi-punto (TruLens, Ragas) vincono sul ranking perché possono esprimere gradi di rilevanza.
La rilevanza contestuale funziona come filtro di primo passaggio: tutti gli strumenti separano i contesti rilevanti da quelli irrilevanti più del 91% delle volte (accuratezza a coppie). Ma nessuno di essi verifica l'accuratezza fattuale. Un passaggio con le entità giuste e la risposta sbagliata ottiene un punteggio alto in tutti gli strumenti testati. Per la correttezza fattuale, abbina le metriche di fedeltà della risposta.
Limitazioni
- Modello giudice singolo: tutte le valutazioni usano GPT-4o come giudice. I risultati potrebbero differire con altri modelli.
- Solo rilevanza contestuale: questo benchmark valuta solo il punteggio di rilevanza contestuale, non la fedeltà della risposta o altre metriche RAG.
- Configurazioni predefinite: gli strumenti sono stati valutati con le impostazioni predefinite. Le prestazioni potrebbero migliorare con una progettazione personalizzata dei prompt.
- Singola esecuzione con convenzione di scioglimento dei pareggi: il benchmark è stato eseguito una volta con temperature=0. L'accuratezza Top-1 usa
argmax(il primo indice vince i pareggi), il che avvantaggia gli strumenti con alti tassi di pareggio (WandB: 86%). Riportiamo l'accuratezza Top-1 rigorosa insieme all'argmax dove pertinente. - Dataset solo avversariale: tutti i negativi hard usano lo scambio di entità. I risultati riflettono le prestazioni in condizioni avversariali; gli strumenti potrebbero comportarsi diversamente su contesti recuperati naturalmente.
Per approfondire
Esplora altri benchmark RAG, come:
- Modelli di embedding: OpenAI vs Gemini vs Cohere
- I migliori 16 modelli di embedding open source per RAG
- Migliori database vettoriali per RAG: Qdrant vs Weaviate vs Pinecone
- Benchmark dei reranker: i migliori 8 modelli a confronto
- Modelli di embedding multimodali: Apple vs Meta vs OpenAI
- I migliori 10 modelli di embedding multilingue per RAG
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{Strumenti di valutazione RAG: Weights & Biases vs Ragas vs DeepEval}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/rag-evaluation-tools}},
note = {AIMultiple. Consultato il 23 Marzo 2026}
}Registro delle modifiche
2 aggiornamenti- 2026
Aggiornati i risultati del benchmark nella sezione dei risultati del benchmark degli strumenti di valutazione RAG.
Aggiornata la sezione "Risultati del benchmark degli strumenti di valutazione RAG" con nuovi risultati e metriche del benchmark.
Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]
Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.
Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.
Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.