Bir RAG pipeline'ı yanlış bağlamı getirdiğinde, LLM kendinden emin şekilde yanlış cevabı üretir. Bağlam ilgililik puanlayıcıları birincil savunmadır.
Beş aracı aynı koşullar altında 1.460 soru ve 14.600+ puanlanmış bağlam üzerinde kıyasladık: aynı jüri modeli (GPT-4o), varsayılan yapılandırmalar ve özel prompt yok. Standart koşullar altında WandB, TruLens ve Ragas en iyi performans gösterenler oldu. Çekişmeli baskı altında (varlık-değiştirilmiş zor negatifler) en iyi performansı WandB gösterdi.
RAG değerlendirme araçları kıyaslama sonuçları
İlk üç araç (WandB, TruLens, Ragas) Top-1 Doğruluğunda istatistiksel olarak başa baş durumda (%95 güven aralığı %94,0 ile %98,0 arasında örtüşüyor).
Değerlendirmemizi ve metriklerimizi ayrıntılı olarak anlamak için RAG değerlendirme araçlarına yönelik kıyaslama metodolojimize bakın.
Metrikler açıklandı
Top-1 doğruluğu: Araç, altın bağlama en yüksek ilgililik puanını atayabiliyor mu? Bu, üretimde yaygın bir hata modu olan çekişmeli geri getirmeye karşı güvenliği ölçer.
NDCG@5 (normalize edilmiş indirimli kümülatif kazanç): Farklı ilgililik düzeylerinde (4, 3, 2, 1, 0) verilen beş bağlamı araç doğru sırada sıralıyor mu? İkili doğruluğun aksine NDCG, daha ilgili bağlamlara orantılı olarak daha yüksek puanlar atayan araçları ödüllendirir.
Spearman ρ (sıra korelasyonu): Bir aracın puan sıralaması, referans ilgililik sıralamasıyla ne kadar iyi korelasyon gösterir? Mükemmel bir araç ρ = 1.0 üretir.
MRR (ortalama ters sıra): Altın bağlam için 1/sıranın ortalamasıdır. Bir araç altın bağlamı birinci sıraya koyarsa MRR = 1.0; ikinci sıraya koyarsa MRR = 0.5; üçüncü sıraya koyarsa MRR = 0.33. Doğru bağlamı daha az ilgili olanların altına gömen araçları cezalandırır.
Temel bulgular
- WandB tespitte önde, TruLens sıralamada önde: WandB en yüksek Top-1 doğruluğuna (%94,5) ancak en düşük NDCG@5 (0.910) ve Spearman ρ (0.669) değerlerine sahip. TruLens NDCG@5 (0.932), Spearman ρ (0.750) ve MRR (0.594) alanlarında önde. Fark puanlama tasarımından kaynaklanıyor: WandB'nin ikili puanlaması basit ancak kaba; TruLens'in 4 noktalı ölçeği daha yüksek çözünürlüğe sahip ancak ters çevirmelere daha yatkın.
- TruLens en yüksek ayrım oranına sahip: Doğru bir bağlamı neredeyse aynı olan varlık-değiştirilmiş versiyondan ayırırken TruLens, %35,5 oranında yönü doğru buluyor ve yalnızca %8,4 oranında ters çevirme yapıyor (4.2:1 oran). Başka hiçbir araç bunu yakalayamıyor.
- Hiçbir araç olgusal olarak yanlış bağlamları olgusal olarak doğru bağlamlardan ayırt edemiyor: Beş aracın tümü zor negatifleri kısmi bağlamlardan daha yüksek puanlıyor ve doğru ilgililik sırasını tersine çeviriyor. Doğru varlıklar ve yanlış cevap içeren bir pasaj, doğru konuya sahip ancak cevap içermeyen bir pasajdan sürekli olarak daha yüksek puan alıyor. Bu, bağlam ilgililiğinin olgusal doğruluğu değil konu uyumunu ölçtüğüyle tutarlıdır.
- DeepEval altın bağlamlara düşük puan veriyor: DeepEval'in ifade ayrıştırması rekabetçi sıralamalar üretiyor (NDCG@5 = 0.923) ancak altın bağlamları ortalama 0.46 ile puanlarken diğer araçlar için 0.82–0.91 arasında puanlıyor. Bu, tek en iyi bağlamı belirlemede onu güvenilmez kılıyor.
- UpTrain'in üçlü ölçeği ayrımı sınırlıyor: Üç çıktı değeri (0, 0.5, 1.0) beş ilgililik düzeyini temsil edemez. UpTrain en kötü ayrım oranını (1.4:1) ve en düşük sıralama doğruluğunu (%27,6 mükemmel sıralama) gösteriyor.
Ayrım: altın vs. zor negatif
Araç, altın bağlama varlık-değiştirilmiş zor negatiften ne sıklıkla daha yüksek puan veriyor?
Kazanma = altın bağlamın puanı kesin olarak daha yüksek. Eşitlik = puanlar eşit. Kayıp = zor negatifin puanı daha yüksek.
WandB en az kayba (%4,8) ancak aynı zamanda en az kazanmaya (%15,5) sahip: ikili puanlaması %80 oranında eşitlik üretiyor. Farklılaştırdığında neredeyse her zaman yönü doğru buluyor. WandB'nin katı Top-1 doğruluğu (altın bağlam tek maksimumdur) yalnızca %8,3 iken TruLens için %25,3'tir; argmax Top-1 değeri yüksektir çünkü altın bağlam 0. indekstedir ve eşitlik bozma avantajından yararlanır.
Sıralama kalitesi
İkili Karşılaştırma Doğruluğu = örnek başına tüm 10 bağlam çiftinin doğru sıralanma yüzdesi. Top-2 Doğruluğu = en yüksek puan alan bağlam altın veya kısmi bağlamdır. 5'li Doğruluk = 5 düzeyin tamamında mükemmel monotonik sıralama.
WandB üç metriğin hepsinde önde çünkü ikili puanlaması, kademe içi sıralama hatalarını ortadan kaldıran doğal iki katmanlı bir ayrım (ilgili vs. ilgisiz) yaratır. Not: ikili karşılaştırma doğruluğu, eşitlikleri doğru sayar (s[i] >= s[j]), bu da ikili araçlara yarar sağlar. NDCG@5 ve Spearman ρ (yukarıdaki grafikte gösterilmiştir) eşitlikleri cezalandırır ve TruLens'i birinci sıraya koyar.
İlgililik düzeyine göre ortalama puanlar
Hiçbir araç Kısmi > Zor Negatif sıralamasını doğru yapamıyor.
Her aracın bağlam ilgililiğini nasıl değerlendirdiği
Beş aracın tümü temel jüri olarak GPT-4o kullanır ancak farklı değerlendirme stratejileri uygular.
WandB Weave: İkili LLM prompt
WandB, LLM'e ilgililiği “0 ile 1 arasında bir ölçekte” puanlamasını isteyen tek bir prompt gönderir. Ancak dahili yanıt şeması puanı bir tamsayı olarak tanımlar, bu nedenle model yalnızca 0 veya 1 döndürebilir.
Tek LLM çağrısı, tek ikili karar. WandB “doğru bağlam bu mu?” sorusunu net şekilde yanıtlar (en yüksek Top-1 doğruluğu) ancak ilgililik derecelerini ifade edemez: kısmi bağlam ve zor negatif aynı puanı alır.
Çıktı değerleri: 0, 1
TruLens: 4 noktalı Likert ölçeği
TruLens, LLM'e açık kriterlere sahip bir 0-3 ölçeği için “İLGİLİLİK puanlayıcısı” olarak prompt verir:
- 0: Sorguyla ilgisiz
- 1: Sorgunun bir kısmıyla ilgili
- 2: Sorgunun çoğuyla ilgili
- 3: Sorgunun tamamıyla ilgili
Ham puan 3'e bölünerek 0.0–1.0 aralığına normalize edilir. Bu, TruLens'e dört farklı çıktı düzeyi verir; promptu basit tutarken kısmi bağlamları zor negatiflerden ayırt etmek için yeterli ayrıntıyı sağlar.
Çıktı değerleri: 0.0, 0.33, 0.67, 1.0
Ragas: Çift jürili ortalama
Ragas her değerlendirmede iki bağımsız jüri promptu çalıştırır; her biri aynı kriterlerin farklı bir ifadesine sahiptir (0 = ilgisiz, 1 = kısmen ilgili, 2 = tamamen ilgili). Nihai puan, her iki jürinin ortalamasıdır ve 0.0–1.0 aralığına normalize edilir.
İki 3 noktalı ölçeğin ortalaması alındığından Ragas beş olası değer üretir; bu, test edilen diğer tüm araçlardan daha fazla çıktı değeridir. Çift jürili tasarım ayrıca prompt hassasiyetine karşı yerleşik direnç sağlar.
Çıktı değerleri: 0.0, 0.25, 0.5, 0.75, 1.0
UpTrain: Üçlü sınıflandırma (A/B/C)
UpTrain, ilgililiği bir çoktan seçmeli sınıflandırma olarak ele alır:
- A (1.0): Bağlam sorguyu tamamen yanıtlayabilir
- B (0.5): Bağlam kısmen ilgili bir yanıt verebilir ancak tamamen yanıtlayamaz
- C (0.0): Bağlam, sorguyu yanıtlamak için hiçbir bilgi içermez
Üçlü tasarım “kısmen ilgili” ile “ilgisiz”i ayırt edebilir ancak “yanıltıcı” ile “teğetsel olarak ilgili”yi ayıramaz; her ikisi de aynı kovaya düşebilir.
Çıktı değerleri: 0.0, 0.5, 1.0
DeepEval: İfade ayrıştırma (G-Eval)
DeepEval tek bir ilgililik puanı istemek yerine bağlamı tek ifadelere ayrıştırır, ardından LLM'den her ifadeyi sorguya göre “evet” (ilgili) veya “hayır” (ilgisiz) olarak değerlendirmesini ister. Nihai puan, ilgili ifadelerin toplam ifadelere oranıdır.
Sonuç sürekli bir puandır (örn. 10 ifadeden 7'si ilgili = 0.70). Ancak yaklaşım katıdır: çok ilgili bir bağlam bile konu dışı cümleler içeriyorsa cezalandırılır. Altın bağlamlar bazen ayrıştırmanın “ilgisiz” olarak işaretlediği bağlamsal ayrıntılar içerir; bu da puanı daha kısa ve daha odaklı bir zor negatifin puanının altına çeker. Bu, DeepEval'in %78,1 Top-1 doğruluğunu açıklar.
Çıktı değerleri: Sürekli (0.0–1.0)
RAG değerlendirme araçları kıyaslama metodolojisi
Çekişmeli dataset tasarımı
Her sorgunun farklı bir ilgililik düzeyinde beş bağlamı vardır:
Dataset
İki kaynağı birleştiriyoruz:
HaluEval (480 örnek): Müzik, film, spor, tarih, coğrafya ve daha fazlasını kapsayan genel kültür soruları. Zor negatifler, kısmi bağlamlar ve yumuşak negatifler Claude tarafından üretilmiştir.
HotPotQA (530 örnek): Birden çok belge arasında bilgi sentezi gerektiren çok adımlı akıl yürütme soruları.
Toplam: 1.010 örnek, her biri 5 bağlam içerir = araç başına 5.050 bağlam değerlendirmesi. Tüm örnekler otomatik sızıntı filtrelemesinden geçmiştir (cevap sızıntısı nedeniyle üretim sırasında 489 örnek çıkarılmıştır).
Çapraz model protokolü
Öz-tercih yanlılığını ortadan kaldırmak için (bir LLM değerlendiricinin kendi ürettiği metni tercih etmesi durumu), çekişmeli bağlam üretimi için Claude Sonnet 4.5 ve tüm araçlar için jüri olarak GPT-4o kullandık. Her ikisi de OpenRouter üzerinden temperature=0 ile çağrıldı.
Çekişmeli tuzaklar
Çok adımlı tuzak (İlişki karışıklığı)
Sorular genellikle bir ilişki zincirini izlemeyi gerektirir (örn. A, B ile ilişkilidir; B de C ile ilişkilidir). Zor negatifler sorunun daha basit bir versiyonunu yanıtlayarak zinciri kırar.
Soru ID 89: “Retro City Rampage'in parodisi olduğu oyun serisini kim yayımlıyor?” Hedef Cevap: Rockstar Games
Varlık çeldirici tuzağı
Geri getiriciler genellikle doğru konumu veya konuyu bulur, ancak yanlış olay veya öznitelik hakkında meta veri döndürür.
Soru ID 90: “…The Bridge Inn, İngiltere'nin Cumbria bölgesinde düzenlenen hangi yıllık yalan söyleme yarışmasının mekânıdır?” Hedef Cevap: World’s Biggest Liar
Kısmi ilgililik tuzağı
Doğru konu ve varlıklara sahip olan ancak cevap içermeyen bir bağlam.
Soru ID 9: “‘Fiddler on the Roof’ üzerinde bir işbirlikçiyle Portofino'nun sözlerini kim yazdı?” Hedef Cevap: Richard Ney
TruLens ve DeepEval, özellikle bu örneklerde kısmi bağlamları zor negatiflerden daha yüksek puanlar; ancak bu örüntü tüm dataset genelinde geçerli değildir.
Hangi aracı kullanmalısınız?
Sonuç
Puanlama ayrıntı düzeyi ana ödünleşimdir. İkili araçlar (WandB) tespitte kazanır çünkü her eşitlik varsayılan olarak onların lehine sonuçlanır; çok noktalı araçlar (TruLens, Ragas) ilgililik derecelerini ifade edebildikleri için sıralamada kazanır.
Bağlam ilgililiği bir ilk geçiş filtresi olarak iş görür: tüm araçlar ilgili bağlamları ilgisiz bağlamlardan zamanın %91'inden fazlasında ayırır (ikili karşılaştırma doğruluğu). Ancak hiçbiri olgusal doğruluğu doğrulamaz. Doğru varlıklar ve yanlış cevap içeren bir pasaj, test edilen her araçta yüksek puan alır. Olgusal doğruluk için cevap sadakati metrikleriyle eşleştirin.
Sınırlamalar
- Tek jüri modeli: Tüm değerlendirmeler jüri olarak GPT-4o kullanır. Sonuçlar diğer modellerle farklılık gösterebilir.
- Yalnızca bağlam ilgililiği: Bu kıyaslama yalnızca bağlam ilgililiği puanlamasını değerlendirir; cevap sadakati veya diğer RAG metriklerini değil.
- Varsayılan yapılandırmalar: Araçlar kutudan çıktığı haliyle değerlendirildi. Özel prompt mühendisliğiyle performans artabilir.
- Eşitlik bozma kuralıyla tek çalıştırma: Kıyaslama temperature=0 ile bir kez çalıştırıldı. Top-1 doğruluğu
argmaxkullanır (ilk indeks eşitlikleri kazanır), bu da yüksek eşitlik oranına sahip araçlara yarar sağlar (WandB: %86). İlgili yerlerde katı Top-1'i argmax ile birlikte raporluyoruz. - Yalnızca çekişmeli dataset: Tüm zor negatifler varlık değişimi kullanır. Sonuçlar çekişmeli koşullar altındaki performansı yansıtır; araçlar doğal olarak geri getirilen bağlamlarda farklı performans gösterebilir.
İleri okuma
Aşağıdakiler gibi diğer RAG kıyaslamalarını inceleyin:
- Embedding Modelleri: OpenAI vs Gemini vs Cohere
- En İyi 16 Açık Kaynak Embedding Modeli RAG için
- En İyi Vektör Veritabanı RAG için: Qdrant vs Weaviate vs Pinecone
- Reranker Kıyaslaması: Karşılaştırılan En İyi 8 Model
- Multimodal Embedding Modelleri: Apple vs Meta vs OpenAI
- En İyi 10 Çok Dilli Embedding Modeli RAG için
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{dilmegani2026,
author = {Dilmegani, Cem and Sarı, Ekrem},
title = {{RAG Değerlendirme Araçları: Weights & Biases vs Ragas vs DeepEval}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/rag-evaluation-tools}},
note = {AIMultiple. Erişim tarihi: 23 Mart 2026}
}Değişiklik günlüğü
2 güncelleme- 2026
RAG değerlendirme araçları karşılaştırma sonuçları bölümündeki karşılaştırma sonuçları güncellendi.
Güncellendi "RAG değerlendirme araçları karşılaştırma sonuçları" bölümü, yeni karşılaştırma sonuçları ve metriklerle.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.