Dienstleistungen
Kontaktieren

Reranker-Benchmark: Top 8 Modelle im Vergleich

Ekrem Sarı
Ekrem Sarı
aktualisiert am 26. Feb. 2026

Wir haben 8 Reranker-Modelle auf ~145k englischen Amazon-Rezensionen getestet, um zu messen, wie stark eine Reranking-Stufe das Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Modell neu gerankt und die Top-10-Ergebnisse anhand von 300 Anfragen bewertet, von denen sich jede auf konkrete Details aus ihrer Quell-Rezension bezieht. Der beste Reranker erhöhte Hit@1 von 62.67 % auf 83.00 % (+20.33pp).

Ergebnisse des Reranker-Benchmarks

Loading Chart

Metriken erklärt:

ΔHit@1 / ΔHit@10 zeigt die Verbesserung gegenüber der Baseline (ohne Reranker) in Prozentpunkten (pp). Zum Beispiel bedeutet +20.33pp, dass der Reranker Hit@1 um 20.33 Prozentpunkte im Vergleich zu den 62.67 % der Baseline verbessert hat.

Hit@K misst, ob eine Rezension mit der korrekten product_id in den Top-K-Ergebnissen erscheint. Die Ground Truth ist die product_id der Rezension, die Anfrage erzeugt hat. Wenn eine andere Rezension desselben Produkts in den Top-K landet, zählt das als Treffer. Hit@1 ist der strengste Test: Stammt das oberste Ergebnis vom richtigen Produkt? Hit@10 ist großzügiger: Befindet sich das richtige Produkt irgendwo in den ersten 10 Ergebnissen?

MRR@10 (Mean Reciprocal Rank) bildet den Mittelwert von 1/Rang des ersten korrekten Ergebnisses über alle Anfragen. Wenn die erste passende product_id auf Rang 1 liegt, ist der Wert 1.0. Auf Rang 2 ist er 0.5. Auf Rang 10 ist er 0.1. Dies belohnt Modelle, die das richtige Produkt so hoch wie möglich platzieren.

nDCG@10 (Normalized Discounted Cumulative Gain) bewertet die Positionen aller passenden Rezensionen in den Top-10, nicht nur der ersten. Wenn dasselbe Produkt mehrere Rezensionen im Kandidatenset hat und mehrere in den Top-10 landen, berücksichtigt nDCG jede basierend auf ihrer Position. In der Praxis haben die meisten Produkte nur 1–2 Rezensionen unter den Top-100-Kandidaten, sodass nDCG und MRR eng beieinander liegen.

Recall@10 misst den Anteil passender Rezensionen (gleiche product_id) in den Top-10 an allen passenden Rezensionen im gesamten Kandidatenset (Top-100). Wenn ein Produkt 3 Rezensionen in den Top-100 hat und der Reranker 2 davon in die Top-10 bringt, beträgt Recall@10 für diese Anfrage 2/3. Da die meisten Produkte im Kandidatenset nur wenige doppelte Rezensionen haben, sind Recall@10 und Hit@10 in diesem Benchmark nahezu identisch.

Latenzaufschlüsselung

Die Reranking-Latenz misst die Zeit, die jeder Cross-Encoder benötigt, um 100 Kandidatendokumente gegenüber der Anfrage zu bewerten. Die Vektorsuchzeit (~20ms) ist ausgeschlossen, da sie über alle Läufe konstant bleibt und unabhängig vom Reranker ist.

Latenzmetriken erklärt:

Rerank ist die Zeit, die der Cross-Encoder benötigt, um alle 100 Kandidatendokumente gegenüber der Anfrage zu bewerten. Hier unterscheiden sich die Modelle: Ein einzelner Forward-Pass ist schnell, während autoregressives Dekodieren langsam ist.

P95 ist das 95th-Perzentil der Gesamtlatenz. Einige Anfragen haben längere Rezensionstexte, was die Tokenisierung und Bewertungszeit erhöht. P95 zeigt den schlechtesten Fall, den Sie für 95 % der Anfragen erwarten sollten.

Wichtigste Erkenntnisse

Ein 149M-Modell ist einem 1.2B-Modell ebenbürtig

gte-reranker-modernbert-base hat 149M Parameter, nemotron-rerank-1b hat 1.2B. Beide erreichen 83.00 % Hit@1 in englischer Sprache. Die ModernBERT-Architektur ist 8x kleiner und liefert identische Top-Genauigkeit.

Das bedeutet nicht, dass die Modellgröße irrelevant ist. nemotron liegt bei MRR@10 (0.8514 vs. 0.8483) und Hit@10 (88.33 % vs. 88.00 %) leicht vorn, was bedeutet, dass es relevante Dokumente über die gesamten Top-10 etwas besser einordnet. Aber für die meisten Anwendungen, bei denen es darauf ankommt, das erste Ergebnis richtig zu haben, reicht das 149M-Modell aus.

Das größte Modell ist nicht das beste

qwen3_reranker_4b hat 4B Parameter und benötigt über eine Sekunde pro Anfrage. Es erreicht 77.67 % Hit@1 und liegt damit auf Platz vier hinter nemotron (1.2B), gte_modernbert (149M) und jina (560M). Sie zahlen die 4.5x-fache Latenz von nemotron für 5.3 Prozentpunkte weniger Genauigkeit.

Die Architektur von qwen3 verwendet kausale Sprachmodellierung mit einem Ja/Nein-Logit-Ansatz. Das Modell liest das Query-Dokument-Paar und gibt die Wahrscheinlichkeit für „Ja, das ist relevant“ aus. Das ist konzeptionell sauber, aber die Inferenz ist wegen des Overheads durch autoregressives Dekodieren teuer. Die SequenceClassification-Modelle (gte_modernbert, bge) und der Prompt-Template-Ansatz von nemotron verarbeiten das Paar in einem einzigen Forward-Pass, was grundsätzlich schneller ist.

Jina bietet den besten Kompromiss zwischen Geschwindigkeit und Genauigkeit

jina_reranker_v3 erreicht 81.33 % Hit@1 bei 188ms. nemotron erreicht 83.00 % bei 243ms. Wenn Sie eine Gesamtlatenz von unter 200ms pro Anfrage benötigen, ist Jina das einzige Modell in der Spitzengruppe, das dies liefert. Der Abstand von 1.67 Prozentpunkten rechtfertigt möglicherweise nicht die zusätzlichen 55ms in einem Produktionssystem, das Tausende von Anfragen pro Sekunde verarbeitet.

Ein Reranker verschlechtert die Ergebnisse

mxbai_rerank_xsmall (70M Parameter) erreicht 64.67 % Hit@1. Die Baseline ohne Reranker erreicht 62.67 %. Die Verbesserung beträgt nur 2 Prozentpunkte, was bei 300 Anfragen im Rauschen liegt. Mit 70M Parametern fehlt dem Modell die Fähigkeit, die Relevanz zwischen Anfrage und Dokument bei längeren oder nuancierteren Texten zuverlässig zu beurteilen.

Ein Reranker ist nicht automatisch vorteilhaft. Testen Sie ihn vor dem Einsatz auf Ihren tatsächlichen Daten.

Der Retriever setzt die Obergrenze

Alle Top-Reranker konvergieren um 87-88 % Hit@10. Diese Obergrenze stammt vom Retriever. Wenn multilingual-e5-base das richtige Dokument nicht unter den Top-100-Kandidaten platziert, kann es kein Reranker wiederherstellen. Die verbleibenden 12 % der Anfragen, bei denen jeder Reranker scheitert, sind Fälle, in denen der Dense-Retriever das relevante Dokument schlicht vollständig verpasst hat.

Eine Verbesserung über diese Obergrenze hinaus erfordert einen besseren Retriever, einen größeren Kandidatenpool oder beides. Wir haben Top-250-Kandidaten getestet und gegenüber Top-100 fast keine Verbesserung festgestellt, was bedeutet, dass e5_base seine nützlichen Kandidaten deutlich vor Rang 250 erschöpft.

So funktionieren Reranker

Ein Dense-Retriever (Bi-Encoder) kodiert Anfragen und Dokumente unabhängig voneinander in Vektoren. Das Retrieval ist eine Nächster-Nachbar-Suche über diese Vektoren. Das ist schnell, weil bei der Suche nur die Anfrage kodiert werden muss, aber das Modell sieht Anfrage und Dokument nie zusammen und kann daher nuancierte Relevanzsignale übersehen.

Ein Reranker (Cross-Encoder) nimmt ein Anfrage-Dokument-Paar als eine einzige Eingabe entgegen. Das Modell betrachtet beide Texte gemeinsam und erkennt Beziehungen, die beim unabhängigen Kodieren entgehen. Der Preis ist, dass Sie das Modell einmal pro Kandidat ausführen müssen, sodass Sie es sich nur leisten können, einen kleinen Pool zu bewerten.

Architekturen in diesem Benchmark

Wir haben vier verschiedene Cross-Encoder-Architekturen getestet:

SequenceClassification-Modelle (bge_base, bge_v2_m3, mxbai_xsmall, gte_modernbert) nehmen ein [query, document]-Paar als Eingabe und geben einen einzelnen Logit-Score aus. Dies ist der einfachste und gebräuchlichste Ansatz.

Nemotron verwendet ein Prompt-Template-Format: „question:{q} passage:{p}“. Die Eingabe sieht wie reiner Text aus und nicht wie ein strukturiertes Paar, aber das Modell gibt dennoch über SequenceClassification einen einzelnen Relevanzwert aus. Das LLM-Pretraining (basierend auf Llama) verleiht ihm ein starkes Sprachverständnis.

Die Qwen3-Reranker verwenden kausale Sprachmodellierung. Das Modell liest das Paar und erzeugt eine Ja/Nein-Bewertung. Der Score ist log P(ja) / (P(ja) + P(no)). Dies erfordert die volle autoregressive Maschinerie, was die höhere Latenz erklärt.

Jina v3 verwendet eine eigene API (model.rerank()), die Tokenisierung und Bewertung intern übernimmt. Die zugrunde liegende Architektur verwendet Cross-Attention, aber die Schnittstelle abstrahiert die Details.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Methodik des Reranker-Benchmarks

  • GPU: NVIDIA H100 PCIe 80GB über Runpod
  • Vektordatenbank: Qdrant 1.12.0 (lokales Binary), Kosinusdistanz
  • Retriever: multilingual-e5-base (768-dim). Query-Präfix: "query: ", Dokument-Präfix: "passage: "
  • Software: transformers 5.2.0, PyTorch 2.8.0, CUDA 12.8.1
  • Datensatz: englische Teilmenge von Amazon Reviews Multi (Kaggle).1 ~145k Rezensionen nach Filterung auf mindestens 100 Zeichen. Jede Rezension hat eine product_id, einen Rezensionstext und eine Sternebewertung.
  • Query-Generierung: Claude Sonnet 4.6 über OpenRouter. 300 englische Anfragen (5 Typen: faktisch, Meinung, Nutzung, Problemlösung, Funktionsvergleich). Jede Anfrage muss sich auf konkrete Details aus ihrer Quell-Rezension beziehen; generische Fragen (Spezifitätswert < 4/5) werden herausgefiltert.
  • Dokumentformat: "Review Title: {title}\nReview: {body}"
  • Pipeline: Top-100-Kandidaten mit multilingual-e5-base abrufen, mit Cross-Encoder neu ranken, Top-10 zurückgeben. Die Baseline überspringt das Reranking und gibt die Top-10 des Retrievers direkt zurück.
  • Ground Truth: nur exakte Übereinstimmung der product_id. Kein Fallback über Kosinus-Ähnlichkeit. Keine Teilpunkte für semantisch ähnliche Produkte.
  • Kontrollierte Variable: Zwischen den Experimenten ändert sich nur das Reranker-Modell. Retriever, Kandidatenanzahl, Anfragenset und Bewertungskriterien sind über alle Läufe hinweg identisch.
  • Kein Fine-Tuning: Alle Modelle wurden im Zero-Shot-Verfahren mit den Standard-Gewichten von HuggingFace bewertet.
  • Latenz: Reranking (Cross-Encoder-Bewertung von 100 Kandidaten). Gemessen pro Anfrage auf der GPU.

Getestete Modelle

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Einschränkungen

Dieser Benchmark verwendet einen einzigen Retriever (multilingual-e5-base). Ein anderer Retriever würde andere Kandidatensets erzeugen und könnte das Ranking der Reranker verändern. Die Ergebnisse zeigen, wie gut jeder Reranker mit diesem spezifischen Retriever funktioniert, und nicht die Reranker-Qualität isoliert.

Wir haben mit englischen Produktrezensionen von Amazon getestet. Die Leistung in anderen Domänen (wissenschaftliche Arbeiten, juristische Dokumente, Code) oder anderen Sprachen wird abweichen.

Die Kandidatenanzahl ist auf 100 festgelegt. Einige Reranker könnten mit 20 oder 200 Kandidaten anders ranken. Wir haben 250 Kandidaten getestet und eine vernachlässigbare Verbesserung festgestellt, was darauf hindeutet, dass 100 für e5_base ausreichend ist, aber andere Retriever können sich anders verhalten.

300 Anfragen sind eine moderate Stichprobengröße. Die drei besten Modelle (nemotron, gte_modernbert, jina) liegen weniger als 2 Prozentpunkte auseinander. Mit einem größeren Anfragenset könnten sich diese Platzierungen verschieben. Der Abstand zwischen der oberen und der unteren Gruppe (20+ Prozentpunkte) ist robust.

Fazit

Reranker funktionieren. Das beste Modell in diesem Benchmark erhöht Hit@1 von 62.67 % auf 83.00 % (+20.33pp), was bedeutet, dass 20 von jeweils 100 Anfragen, die zuvor zuerst das falsche Dokument lieferten, nun das richtige liefern. Das ist ein erheblicher Gewinn für eine Komponente, die weniger als 250ms Latenz hinzufügt.

Die nützlichste Erkenntnis ist, dass die Modellgröße nicht über die Reranker-Qualität entscheidet. gte-reranker-modernbert-base mit 149M Parametern erreicht bei Hit@1 das Niveau von nemotron-rerank-1b mit 1.2B. Das 4B-Parameter-Modell von Qwen3 landet auf dem vierten Platz. Wenn Sie einen Reranker für ein Produktionssystem auswählen, beginnen Sie mit den kleineren Modellen. Möglicherweise benötigen Sie die größeren nie.

Für latenzsensible Anwendungen ist jina-reranker-v3 die stärkste Option unter 200ms. Für maximale Genauigkeit ohne Latenzbeschränkung teilen sich nemotron-rerank-1b und gte-reranker-modernbert-base den ersten Platz. Für Teams mit begrenztem GPU-Budget ist gte-modernbert der klare Gewinner: gleiche Genauigkeit wie das 1.2B-Modell bei einem Bruchteil des Speicherbedarfs.

Ein Muster zog sich durch alle Experimente: Der Retriever setzt die Obergrenze. Kein Reranker brachte Hit@10 über 88 %, da die verbleibenden 12 % der korrekten Dokumente nie unter den Top-100-Kandidaten auftauchten. Investitionen in einen besseren Retriever dürften größere Gewinne bringen als der Wechsel zwischen den drei besten Rerankern.

Weiterführende Lektüre

Entdecken Sie weitere RAG-Benchmarks, wie zum Beispiel:

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ekrem Sarı (2026) - "Reranker-Benchmark: Top 8 Modelle im Vergleich". Online veröffentlicht auf AIMultiple.com. Abgerufen am 26. Februar 2026, von: https://aimultiple.com/rerankers [Online-Ressource]

Sarı, E. (2026, 26. Februar). Reranker-Benchmark: Top 8 Modelle im Vergleich. AIMultiple. https://aimultiple.com/rerankers

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Reranker-Benchmark: Top 8 Modelle im Vergleich}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/rerankers}},
  note   = {AIMultiple. Abgerufen am 26. Februar 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 17 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die 2 CSV-Dateien und eine README enthält.

Zuletzt aktualisiert: 17. August 2026
Herunterladen
Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist KI-Forscher und Datenwissenschaftler bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450