8 reranker modelini ~145k İngilizce Amazon yorumu üzerinde değerlendirerek yeniden sıralama aşamasının yoğun getirmeyi ne kadar iyileştirdiğini ölçtük. multilingual-e5-base ile ilk 100 adayı getirdik, her modelle yeniden sıraladık ve ilk 10 sonucu, her biri kaynak yorumundaki somut ayrıntılara atıfta bulunan 300 sorguya göre değerlendirdik. En iyi reranker Hit@1'i %62,67'ten %83,00'e yükseltti (+20.33pp).
Reranker benchmark sonuçları
Metrikler açıklandı:
ΔHit@1 / ΔHit@10, temel düzeye (reranker'sız) göre iyileşmeyi yüzde puanı (pp) cinsinden gösterir. Örneğin +20.33pp, reranker'ın Hit@1'i temel düzeydeki %62,67'ye kıyasla 20.33 yüzde puanı artırdığı anlamına gelir.
Hit@K, doğru product_id'ye sahip herhangi bir yorumun ilk K sonuçta görünüp görünmediğini ölçer. Referans doğru yanıt, sorguyu üreten yorumun product_id'sidir. Aynı ürünün farklı bir yorumu ilk K'ya girerse bu bir isabet sayılır. Hit@1 en katı testtir: ilk sonuç doğru üründen mi? Hit@10 daha esnektir: doğru ürün ilk 10 sonuç içinde bir yerde mi?
MRR@10 (Mean Reciprocal Rank), tüm sorgularda ilk doğru sonucun 1/sıra değerinin ortalamasını alır. İlk eşleşen product_id 1. sıradaysa puan 1.0 olur. 2. sıradaysa 0.5 olur. 10. sıradaysa 0.1 olur. Bu, doğru ürünü mümkün olduğunca üste koyan modelleri ödüllendirir.
nDCG@10 (Normalize Edilmiş İndirimli Kümülatif Kazanç), yalnızca ilk sonucu değil, ilk 10 içindeki tüm eşleşen yorumların konumlarını değerlendirir. Aynı ürünün aday kümesinde birden fazla yorumu varsa ve bunların birkaçı ilk 10'a giriyorsa nDCG her birine konumuna göre puan verir. Pratikte çoğu ürünün ilk 100 adayda yalnızca 1-2 yorumu vardır; bu nedenle nDCG ile MRR yakın seyreder.
Recall@10, tam aday kümesindeki (ilk 100) tüm eşleşen yorumlar içinden ilk 10'daki eşleşen yorumların (aynı product_id) oranını ölçer. Bir ürünün ilk 100'de 3 yorumu varsa ve reranker bunlardan 2'sini ilk 10'a koyuyorsa o sorgu için Recall@10 2/3 olur. Aday kümesinde çoğu ürünün az sayıda yinelenen yorumu olduğundan bu benchmark'ta Recall@10 ile Hit@10 neredeyse aynıdır.
Gecikme dökümü
Yeniden sıralama gecikmesi, her cross-encoder'ın sorguya karşı 100 aday belgeyi puanlama süresini ölçer. Vektör arama süresi (~20ms) tüm çalıştırmalarda sabit kaldığı ve reranker'dan bağımsız olduğu için kapsam dışıdır.
Gecikme metrikleri açıklandı:
Rerank, cross-encoder'ın tüm 100 aday belgeyi sorguya karşı puanlama süresidir. Modellerin ayrıştığı yer burasıdır: tek bir ileri geçiş hızlıdır, otoregresif kod çözme ise yavaştır.
P95, toplam gecikmenin 95th yüzdelik dilimidir. Bazı sorguların yorum metinleri daha uzundur; bu da tokenization ve puanlama süresini artırır. P95, sorguların %95'i için beklemeniz gereken en kötü durumu gösterir.
Temel bulgular
Bir 149M model, bir 1.2B modele yetişiyor
gte-reranker-modernbert-base 149M parametreye sahiptir, nemotron-rerank-1b ise 1.2B parametreye sahiptir. Her ikisi de İngilizcede %83,00 Hit@1 elde etti. ModernBERT mimarisi 8x daha küçüktür ve aynı üst düzey doğruluğu sunar.
Bu, model boyutunun önemsiz olduğu anlamına gelmez. nemotron, MRR@10 (0.8514 vs 0.8483) ve Hit@10 (%88,33 vs %88,00) konusunda hafifçe öndedir; yani ilgili belgeleri ilk 10 genelinde biraz daha iyi sıralar. Ancak ilk sonucun doğru olmasının önemli olduğu çoğu uygulama için 149M model yeterlidir.
En büyük model en iyisi değil
qwen3_reranker_4b 4B parametreye sahiptir ve sorgu başına bir saniyeden fazla sürer. %77,67 Hit@1 elde ederek nemotron (1.2B), gte_modernbert (149M) ve jina'nın (560M) ardından dördüncü sırada yer alır. 5.3 yüzde puanı daha düşük doğruluk için nemotron'a göre 4.5x gecikme ödersiniz.
qwen3'ün mimarisi evet/hayır logit yaklaşımıyla nedensel dil modellemesi kullanır. Model, sorgu-belge çiftini okur ve "evet, bu ilgilidir" olasılığını çıkarır. Bu kavramsal olarak temizdir ancak otoregresif kod çözme yükü nedeniyle inference pahalıdır. SequenceClassification modelleri (gte_modernbert, bge) ve nemotron'ın prompt-template yaklaşımı bu çifti tek bir ileri geçişte işler; bu da temelde daha hızlıdır.
Jina en iyi hız-doğruluk dengesini sunuyor
jina_reranker_v3 188ms sürede %81,33 Hit@1 elde eder. nemotron 243ms sürede %83,00 elde eder. Sorgu başına 200ms'nin altında toplam gecikmeye ihtiyacınız varsa, üst düzeyde bunu sağlayan tek model Jina'dır. Saniyede binlerce isteğe hizmet veren bir üretim sisteminde 1.67 yüzde puanlık fark, ek 55ms'yi haklı çıkarmayabilir.
Bir reranker sonuçları daha da kötüleştiriyor
mxbai_rerank_xsmall (70M parametre) %64,67 Hit@1 elde eder. Hiçbir reranker olmadan temel düzey %62,67 elde eder. İyileşme yalnızca 2 yüzde puanıdır; bu, 300 sorgu için gürültü sınırları içindedir. 70M parametrede model, daha uzun veya daha incelikli metinlerde sorgu-belge ilgisini güvenilir şekilde yargılama kapasitesinden yoksundur.
Bir reranker otomatik olarak faydalı değildir. Dağıtımdan önce onu kendi gerçek verileriniz üzerinde test edin.
Retriever tavanı belirler
En iyi reranker'ların tümü 87-%88 Hit@10 civarında birleşir. Bu tavan, retriever'dan gelir. multilingual-e5-base doğru belgeyi ilk 100 aday arasına koymazsa hiçbir reranker onu kurtaramaz. Her reranker'ın başarısız olduğu kalan %12 sorgu, yoğun retriever'ın ilgili belgeyi tamamen kaçırdığı durumlardır.
Bu tavanın ötesine geçmek daha iyi bir retriever, daha büyük bir aday havuzu veya her ikisini gerektirir. İlk 250 adayı test ettik ve ilk 100'e kıyasla neredeyse hiç iyileşme görmedik; bu da e5_base'in yararlı adaylarını 250. sıranın çok öncesinde tükettiği anlamına gelir.
Reranker'lar nasıl çalışır?
Yoğun bir retriever (bi-encoder), sorguları ve belgeleri bağımsız olarak vektörlere kodlar. Getirme, bu vektörler üzerinde en yakın komşu aramasıdır. Bu hızlıdır çünkü arama sırasında yalnızca sorguyu kodlarsınız; ancak model sorguyu ve belgeyi asla birlikte görmediğinden incelikli ilgililik sinyallerini kaçırabilir.
Bir reranker (cross-encoder), sorgu-belge çiftini tek bir girdi olarak alır. Model her iki metni birlikte işler ve bağımsız kodlamanın kaçırdığı ilişkileri yakalar. Maliyet, modeli aday başına bir kez çalıştırmanız gerektiğidir; bu nedenle yalnızca küçük bir havuzu puanlayabilirsiniz.
Bu benchmark'taki mimariler
Dört farklı cross-encoder mimarisi test ettik:
SequenceClassification modelleri (bge_base, bge_v2_m3, mxbai_xsmall, gte_modernbert) girdi olarak bir [query, document] çifti alır ve tek bir logit puanı çıkarır. Bu, en basit ve en yaygın yaklaşımdır.
Nemotron, "question:{q} passage:{p}" biçiminde bir prompt template kullanır. Girdi yapılandırılmış bir çift yerine düz metin gibi görünür; ancak model yine SequenceClassification aracılığıyla tek bir ilgililik puanı çıkarır. LLM ön eğitimi (Llama tabanlı) ona güçlü dil anlayışı kazandırır.
Qwen3 reranker'ları nedensel dil modellemesi kullanır. Model çifti okur ve evet/hayır yargısı üretir. Puan log P(yes) / (P(yes) + P(no)) şeklindedir. Bu, daha yüksek gecikmeyi açıklayan tam otoregresif mekanizmayı gerektirir.
Jina v3, tokenization ve puanlamayı dahili olarak ele alan özel bir API (model.rerank()) kullanır. Temel mimari cross-attention kullanır; ancak arayüz ayrıntıları soyutlar.
Reranker benchmark metodolojisi
- GPU: NVIDIA H100 PCIe 80GB üzerinden Runpod
- Vektör veritabanı: Qdrant 1.12.0 (yerel ikili), kosinüs mesafesi
- Retriever: multilingual-e5-base (768 boyutlu). Sorgu öneki:
"query: ", belge öneki:"passage: " - Yazılım: transformers 5.2.0, PyTorch 2.8.0, CUDA 12.8.1
- Dataset: Amazon Reviews Multi (Kaggle) dataset'inin İngilizce alt kümesi.1 minimum 100 karakter filtresinden sonra ~145k yorum. Her yorumun bir product_id'si, yorum metni ve yıldız puanı vardır.
- Sorgu üretimi: Claude Sonnet 4.6 üzerinden OpenRouter. 300 İngilizce sorgu (5 tür: olgusal, görüş, kullanım, sorun çözme, özellik karşılaştırma). Her sorgu kaynak yorumundaki belirli ayrıntılara atıfta bulunmalıdır; genel sorular (özgüllük puanı < 4/5) filtrelenir.
- Belge formatı:
"Review Title: {title}\nReview: {body}" - Pipeline: multilingual-e5-base ile ilk 100 adayı getir, cross-encoder ile yeniden sırala, ilk 10 sonucu döndür. Temel düzey, yeniden sıralamayı atlar ve doğrudan retriever'ın ilk 10 sonucunu döndürür.
- Referans doğru yanıt: yalnızca product_id birebir eşleşmesi. Kosinüs benzerliğine dayalı yedek yok. Anlamsal olarak benzer ürünler için kısmi puan yok.
- Kontrollü değişken: Deneyler arasında yalnızca reranker modeli değişir. Retriever, aday sayısı, sorgu seti ve değerlendirme ölçütleri tüm çalıştırmalarda aynıdır.
- Fine-tuning yok: Tüm modeller varsayılan HuggingFace ağırlıklarıyla zero-shot olarak değerlendirilmiştir.
- Gecikme: Yeniden sıralama (cross-encoder'ın 100 adayı puanlaması). Sorgu başına GPU üzerinde ölçülmüştür.
Test edilen modeller
Sınırlamalar
Bu benchmark tek bir retriever (multilingual-e5-base) kullanır. Farklı bir retriever farklı aday kümeleri üretir ve reranker sıralamalarını değiştirebilir. Sonuçlar, her reranker'ın bu belirli retriever ile ne kadar iyi çalıştığını yansıtır; tek başına reranker kalitesini değil.
Amazon'dan İngilizce ürün yorumları üzerinde test ettik. Farklı alanlarda (bilimsel makaleler, hukuki belgeler, kod) veya farklı dillerde performans değişecektir.
Aday sayısı 100 olarak sabittir. Bazı reranker'lar 20 veya 200 adayla farklı sıralama yapabilir. 250 adayı test ettik ve ihmal edilebilir bir iyileşme gördük; bu da 100'ün e5_base için yeterli olduğunu düşündürür, ancak diğer retriever'lar farklı davranabilir.
300 sorgu orta düzeyde bir örneklem büyüklüğüdür. En iyi üç model (nemotron, gte_modernbert, jina) arasında 2 yüzde puanından az fark vardır. Daha büyük bir sorgu setiyle bu sıralamalar değişebilir. Üst düzey ile alt düzey arasındaki fark (20+ yüzde puanı) güçlüdür.
Sonuç
Reranker'lar işe yarar. Bu benchmark'taki en iyi model, Hit@1'i %62,67'ten %83,00'e (+20.33pp) çıkarır; yani daha önce ilk sırada yanlış belgeyi döndüren her 100 sorgudan 20'si artık doğru belgeyi döndürür. Bu, 250ms'nin altında gecikme ekleyen bir bileşen için önemli bir kazanımdır.
En yararlı bulgu, model boyutunun reranker kalitesini belirlemediğidir. 149M parametreli gte-reranker-modernbert-base, Hit@1'de 1.2B parametreli nemotron-rerank-1b ile eşleşir. 4B parametreli Qwen3 modeli dördüncü sırada bitirir. Üretim sistemi için bir reranker seçiyorsanız daha küçük modellerle başlayın. Daha büyüklerine hiç ihtiyacınız olmayabilir.
Gecikmeye duyarlı uygulamalar için 200ms altında en güçlü seçenek jina-reranker-v3'tür. Gecikme kısıtı olmadan maksimum doğruluk için nemotron-rerank-1b ve gte-reranker-modernbert-base en üst sırayı paylaşır. GPU bütçesi olan ekipler için gte-modernbert açık ara kazanandır: 1.2B'lik modelle aynı doğruluğu, bellek ayak izinin çok daha küçük bir kısmıyla sunar.
Tüm deneylerde tek bir örüntü vardı: retriever tavanı belirler. Hiçbir reranker Hit@10'u %88'nin üzerine çıkaramadı; çünkü doğru belgelerin kalan %12'si hiçbir zaman ilk 100 aday arasında yer almadı. Daha iyi bir retriever'a yatırım yapmak, ilk üç reranker arasında geçiş yapmaktan büyük olasılıkla daha büyük kazanç sağlar.
İleri okuma
Diğer RAG benchmark'larını keşfedin:
- Embedding Modelleri: OpenAI vs Gemini vs Cohere
- En İyi 16 Açık Kaynak RAG Embedding Modeli
- En İyi Vektör Veritabanı RAG için: Qdrant vs Weaviate vs Pinecone
- Agentic RAG benchmark: Çoklu veritabanı yönlendirme ve sorgu üretimi
- Çok Modlu Embedding Modelleri: Apple vs Meta vs OpenAI
- En İyi 10 Çok Dilli RAG Embedding Modeli
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Reranker Benchmark: En İyi 8 Model Karşılaştırması}},
year = {2026},
month = feb,
howpublished = {\url{https://aimultiple.com/rerankers}},
note = {AIMultiple. Erişim tarihi: 26 Şubat 2026}
}17 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 2 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.