Hizmetler
Bize Ulaşın

Reranker Kıyaslaması: En İyi 8 Model Karşılaştırıldı

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 26 Şub 2026

Yoğun getirim aşamasının ne kadar iyileştirme sağladığını ölçmek için 8 reranker modelini ~145k İngilizce Amazon yorumu üzerinde kıyasladık. multilingual-e5-base ile en iyi 100 adayı getirdik, her modelle yeniden sıraladık ve her biri kaynak yorumundaki somut ayrıntılara atıfta bulunan 300 sorguya karşı en iyi 10 sonucu değerlendirdik. En iyi reranker, Hit@1'i %62,67'den %83,00'e yükseltti (+20,33 puan).

Reranker kıyaslama sonuçları

Loading Chart

Metriklerin açıklaması:

ΔHit@1 / ΔHit@10, yeniden sıralamasız temel değere göre yüzde puanı (pp) cinsinden iyileşmeyi gösterir. Örneğin, +20,33 pp değeri, reranker'ın Hit@1'i, temel değer olan %62,67'ye kıyasla 20,33 yüzde puanı artırdığı anlamına gelir.

Hit@K, doğru product_id'ye sahip herhangi bir yorumun ilk K sonuç arasında görünüp görünmediğini ölçer. Doğru cevap (ground truth), sorguyu oluşturan yorumun product_id'sidir. Aynı ürüne ait farklı bir yorum ilk K'da yer alırsa bu bir isabet (hit) sayılır. Hit@1 en katı testtir: ilk sonuç doğru üründen mi? Hit@10 daha esnektir: doğru ürün ilk 10 sonuç içinde bir yerde var mı?

MRR@10 (Ortalama Ters Sıra), tüm sorgularda ilk doğru sonucun sıra numarasının tersinin ortalamasını alır. İlk eşleşen product_id 1. sıradaysa skor 1,0, 2. sıradaysa 0,5, 10. sıradaysa 0,1'dir. Bu, doğru ürünü mümkün olan en üst sıraya yerleştiren modelleri ödüllendirir.

nDCG@10 (Normalleştirilmiş İndirimli Kümülatif Kazanç), ilk 10 sonuçtaki tüm eşleşen yorumların pozisyonlarını değerlendirir, yalnızca ilkini değil. Aynı ürünün aday kümesinde birden fazla yorumu varsa ve bunlardan birkaçı ilk 10'a girerse, nDCG her birini konumuna göre kredilendirir. Uygulamada çoğu ürünün en iyi 100 adayda yalnızca 1-2 yorumu bulunduğundan, nDCG ve MRR yakın seyreder.

Recall@10, ilk 10'daki eşleşen yorumların (aynı product_id), tam aday kümesindeki (ilk 100) tüm eşleşen yorumlara oranını ölçer. Bir ürünün ilk 100'de 3 yorumu varsa ve reranker bunlardan 2'sini ilk 10'a koyarsa, o sorgu için Recall@10 = 2/3 olur. Çoğu ürünün aday kümesinde az sayıda mükerrer yorumu olduğundan, bu kıyaslamada Recall@10 ve Hit@10 neredeyse aynıdır.

Gecikme detayı

Yeniden sıralama gecikmesi, her bir cross-encoder'ın sorguya karşı 100 aday belgeyi puanlama süresini ölçer. Vektör arama süresi (~20 ms) tüm çalışmalarda sabit kaldığı ve yeniden sıralayıcıdan bağımsız olduğu için hariç tutulmuştur.

Gecikme metriklerinin açıklaması:

Rerank, cross-encoder'ın sorguya karşı tüm 100 aday belgeyi puanlaması için geçen süredir. Modeller burada farklılaşır: tek bir ileri geçiş hızlıyken, otoregresif kod çözme yavaştır.

P95, toplam gecikmenin 95. yüzdelik dilimidir. Bazı sorguların daha uzun yorum metinleri olması, tokenleştirme ve puanlama süresini artırır. P95, sorguların %95'i için beklemeniz gereken en kötü durumu gösterir.

Önemli bulgular

149M parametreli model, 1,2B parametreli modelle eşleşiyor

gte-reranker-modernbert-base 149M parametreye sahip, nemotron-rerank-1b ise 1,2B. Her ikisi de İngilizce'de %83,00 Hit@1 elde etti. ModernBERT mimarisi 8 kat daha küçük olmasına rağmen aynı üst düzey doğruluk oranını sunuyor.

Bu, model boyutunun önemsiz olduğu anlamına gelmez. nemotron, MRR@10 (0,8514 vs 0,8483) ve Hit@10 (%88,33 vs %88,00) bakımından az farkla öne geçiyor; yani ilgili belgeleri ilk 10 içinde biraz daha iyi sıralıyor. Ancak ilk sonucun doğruluğunun önemli olduğu çoğu uygulama için 149M parametreli model yeterlidir.

En büyük model en iyisi değil

qwen3_reranker_4b 4B parametreye sahip ve sorgu başına bir saniyeden uzun sürüyor. Hit@1 sonucu %77,67 ile nemotron (1,2B), gte_modernbert (149M) ve jina (560M)'ın ardından dördüncü sırada yer alıyor. nemotron'un 4,5 kat gecikmesini 5,3 yüzde puanı daha düşük doğrulukla ödüyorsunuz.

qwen3'ün mimarisi, yes/no logit yaklaşımıyla nedensel dil modellemesi kullanır. Model, sorgu-belge çiftini okur ve "evet, bu ilgili" olasılığının çıktısını verir. Bu kavramsal olarak temizdir, ancak çıkarım, otoregresif kod çözme yükü nedeniyle pahalıdır. SequenceClassification modelleri (gte_modernbert, bge) ve nemotron'un prompt'lar şablonu yaklaşımı çifti tek bir ileri geçişte işler; bu da temelde daha hızlıdır.

Jina en iyi hız-doğruluk dengesini sunuyor

jina_reranker_v3 188 ms'de %81,33 Hit@1 elde ediyor. nemotron 243 ms'de %83,00 elde ediyor. Sorgu başına 200 ms altında toplam gecikmeye ihtiyacınız varsa, Jina üst seviyede bunu sağlayan tek modeldir. Saniyede binlerce istek hizmet veren bir üretim sisteminde 1,67 yüzde puanlık fark, ekstra 55 ms'yi haklı çıkarmayabilir.

Bir reranker sonuçları daha da kötüleştiriyor

mxbai_rerank_xsmall (70M parametre) %64,67 Hit@1 elde ediyor. Reranker kullanmayan temel değer %62,67. İyileşme yalnızca 2 yüzde puanıdır ve bu, 300 sorgu için gürültü sayılabilecek bir aralıktadır. 70M parametre ile model, daha uzun veya daha ayrıntılı metinlerde sorgu-belge ilgisini güvenilir şekilde değerlendirme kapasitesinden yoksundur.

Bir reranker otomatik olarak faydalı değildir. Dağıtımdan önce kendi veriniz üzerinde test edin.

Tavanı belirleyen retriever'dır

Tüm üst düzey reranker'lar Hit@10'da yaklaşık 87-%88 civarında birleşiyor. Bu tavan, retriever'dan kaynaklanır. multilingual-e5-base doğru belgeyi ilk 100 aday arasına koymazsa hiçbir reranker onu kurtaramaz. Tüm reranker'ların başarısız olduğu sorguların kalan %12'si, yoğun retriever'ın ilgili belgeyi tamamen kaçırdığı durumları temsil eder.

Bu tavanın aşılması daha iyi bir retriever, daha geniş bir aday havuzu veya her ikisini gerektirir. En iyi 250 adayı test ettik ve en iyi 100'e kıyasla neredeyse hiç iyileşme bulamadık; bu da e5_base'in yararlı adaylarını 250. sıraya varmadan çok önce tükettiği anlamına gelir.

Reranker'lar nasıl çalışır?

Bir yoğun retriever (bi-encoder), sorguları ve belgeleri bağımsız olarak vektörlere kodlar. Getirim, bu vektörler üzerinde en yakın komşu aramasıdır. Arama anında yalnızca sorguyu kodladığınız için bu hızlıdır; ancak model sorgu ile belgeyi birlikte hiç görmez, bu nedenle ince ilgi sinyallerini kaçırabilir.

Bir reranker (cross-encoder), sorgu-belge çiftini tek bir girdi olarak alır. Model her iki metne ortaklaşa dikkat eder ve bağımsız kodlamanın yakalayamadığı ilişkileri yakalar. Bedeli ise her aday için modeli bir kez çalıştırmak zorunda olmanızdır; bu yüzden yalnızca küçük bir havuzu puanlamayı göze alabilirsiniz.

Bu kıyaslamadaki mimariler

Dört farklı cross-encoder mimarisini test ettik:

SequenceClassification modelleri (bge_base, bge_v2_m3, mxbai_xsmall, gte_modernbert), girdi olarak bir [query, document] çifti alır ve tek bir logit skoru çıktısı verir. Bu en basit ve en yaygın yaklaşımdır.

Nemotron bir prompt'lar şablonu biçimi kullanır: “question:{q} passage:{p}”. Girdi, yapılandırılmış bir çiftten ziyade düz metin gibi görünür, ancak model yine SequenceClassification aracılığıyla tek bir ilgililik skoru üretir. LLM ön eğitimi (Llama tabanlı) ona güçlü bir dil anlayışı sağlar.

Qwen3 reranker'lar nedensel dil modellemesi kullanır. Model çifti okur ve bir evet/hayır yargısı üretir. Skor log P(evet) / (P(evet) + P(hayır)) şeklindedir. Bu, tam otoregresif mekanizmayı gerektirir ve bu da yüksek gecikmeyi açıklar.

Jina v3, tokenleştirme ve puanlamayı dahili olarak ele alan özel bir API (model.rerank()) kullanır. Temel mimari cross-attention kullanır, ancak arayüz ayrıntıları soyutlar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Reranker kıyaslama metodolojisi

  • GPU: NVIDIA H100 PCIe 80GB, Runpod üzerinden
  • Vektör veritabanı: Qdrant 1.12.0 (yerel binary), kosinüs mesafesi
  • Retriever: multilingual-e5-base (768 boyutlu). Sorgu ön eki: "query: ", belge ön eki: "passage: "
  • Yazılım: transformers 5.2.0, PyTorch 2.8.0, CUDA 12.8.1
  • Veri seti: Amazon Reviews Multi (Kaggle) İngilizce alt kümesi.1 Minimum 100 karakter filtresinden sonra ~145k yorum. Her yorumda bir product_id, yorum metni ve yıldız puanı var.
  • Sorgu üretimi: Claude Sonnet 4.6 ile OpenRouter üzerinden. 300 İngilizce sorgu (5 tür: olgusal, görüş, kullanım, problem çözme, özellik karşılaştırma). Her sorgu, kaynak yorumundaki belirli ayrıntılara atıfta bulunmalıdır; genel sorular (özgüllük puanı < 4/5) elenmiştir.
  • Belge formatı: "Review Title: {title}\nReview: {body}"
  • İşlem hattı: multilingual-e5-base ile en iyi 100 adayı getir, cross-encoder ile yeniden sırala, en iyi 10 tanesini döndür. Temel yapılandırma yeniden sıralamayı atlar ve doğrudan retriever'ın en iyi 10 sonucunu döndürür.
  • Doğru cevap (ground truth): yalnızca product_id birebir eşleşmesi. Kosinüs benzerliği kullanılmaz. Anlamsal olarak benzer ürünler için kısmi kredi verilmez.
  • Kontrol edilen değişken: Deneyler arasında yalnızca reranker modeli değişir. Retriever, aday sayısı, sorgu seti ve değerlendirme kriterleri tüm çalışmalarda aynıdır.
  • İnce ayar yok: Tüm modeller, varsayılan HuggingFace ağırlıklarıyla sıfır atış (zero-shot) olarak değerlendirilmiştir.
  • Gecikme: Yeniden sıralama (100 adayın cross-encoder ile puanlanması). GPU üzerinde sorgu başına ölçülmüştür.

Test edilen modeller

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Sınırlamalar

Bu kıyaslama tek bir retriever (multilingual-e5-base) kullanır. Farklı bir retriever farklı aday kümeleri üretir ve reranker sıralamalarını değiştirebilir. Sonuçlar, bu belirli retriever ile her bir reranker'ın ne kadar iyi çalıştığını yansıtır, reranker kalitesini yalıtılmış olarak değil.

Amazon'daki İngilizce ürün yorumları üzerinde test ettik. Diğer alanlardaki (bilimsel makaleler, hukuki belgeler, kod) veya diğer dillerdeki performans farklı olacaktır.

Aday sayısı 100 olarak sabitlenmiştir. Bazı reranker'lar 20 veya 200 adayla farklı sıralama yapabilir. 250 adayla test ettik ve ihmal edilebilir düzeyde iyileşme bulduk; bu da e5_base için 100 adayın yeterli olduğunu gösterir, ancak diğer retriever'lar farklı davranabilir.

300 sorgu orta büyüklükte bir örneklemdir. En iyi üç model (nemotron, gte_modernbert, jina) arasındaki fark 2 yüzde puanından azdır. Daha büyük bir sorgu seti ile bu sıralamalar değişebilir. Üst grup ile alt grup arasındaki fark (20+ yüzde puanı) ise güçlüdür.

Sonuç

Reranker'lar işe yarıyor. Bu kıyaslamadaki en iyi model, Hit@1'i %62,67'den %83,00'e (+20,33 puan) yükseltiyor; bu da daha önce ilk sonuçta yanlış belge dönen her 100 sorgudan 20'sinin artık doğru belgeyi döndürdüğü anlamına geliyor. 250 ms'nin altında gecikme ekleyen bir bileşen için bu önemli bir kazanımdır.

En önemli bulgu, model boyutunun reranker kalitesini belirlemediğidir. 149M parametreli gte-reranker-modernbert-base, Hit@1'de 1,2B parametreli nemotron-rerank-1b ile eşleşiyor. 4B parametreli Qwen3 modeli dördüncü sırada. Bir üretim sistemi için reranker seçiyorsanız, daha küçük modellerle başlayın. Daha büyüklerine asla ihtiyacınız olmayabilir.

Gecikmeye duyarlı uygulamalar için jina-reranker-v3, 200 ms altındaki en güçlü seçenektir. Gecikme kısıtlaması olmaksızın maksimum doğruluk için nemotron-rerank-1b ve gte-reranker-modernbert-base zirveyi paylaşır. GPU bütçesi olan ekipler için gte-modernbert açık ara kazanandır: 1,2B'lik modelle aynı doğruluk, çok daha düşük bellek ayak izi.

Tüm deneylerde bir kalıp ortaya çıktı: tavanı retriever belirler. Hiçbir reranker, Hit@10'u %88'in üzerine çıkaramadı, çünkü kalan %12'lik doğru belge ilk 100 aday arasında hiç yer almadı. En iyi üç reranker arasında geçiş yapmaktansa daha iyi bir retriever'a yatırım yapmak muhtemelen daha büyük kazanımlar sağlayacaktır.

İleri okuma

Aşağıdaki gibi diğer RAG kıyaslamalarını keşfedin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Reranker Kıyaslaması: En İyi 8 Model Karşılaştırıldı". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 26 Şubat 2026, kaynak: https://aimultiple.com/rerankers [Çevrimiçi Kaynak]

Sarı, E. (2026, 26 Şubat). Reranker Kıyaslaması: En İyi 8 Model Karşılaştırıldı. AIMultiple. https://aimultiple.com/rerankers

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Reranker Kıyaslaması: En İyi 8 Model Karşılaştırıldı}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/rerankers}},
  note   = {AIMultiple. Erişim tarihi: 26 Şubat 2026}
}
Tüm verileri indir

9 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 14 Ağustos 2026
İndir
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da bir Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450