Dienstleistungen
Kontaktieren

Reranker-Benchmark: Top-8-Models im Vergleich

Ekrem Sarı
Ekrem Sarı
aktualisiert am 26. Feb. 2026

Wir haben 8 Reranker-Models auf ~145k englischen Amazon-Rezensionen evaluiert, um zu messen, wie stark eine Reranking-Stufe die Dense Retrieval verbessert. Wir haben Top-100-Kandidaten mit multilingual-e5-base abgerufen, sie mit jedem Model neu gerankt und die Top-10-Ergebnisse anhand von 300 Queries bewertet, die jeweils auf konkrete Details aus ihrer Quellbewertung verweisen. Der beste Reranker steigerte Hit@1 von 62.67 % auf 83.00 % (+20.33pp).

Reranker-Benchmark-Ergebnisse

Loading Chart

Metriken erklärt:

ΔHit@1 / ΔHit@10 zeigt die Verbesserung gegenüber der Baseline (kein Reranker) in Prozentpunkten (pp). Beispielsweise bedeutet +20.33pp, dass der Reranker Hit@1 um 20.33 Prozentpunkte im Vergleich zu den 62.67 % der Baseline verbessert hat.

Hit@K misst, ob eine Bewertung mit der korrekten product_id in den Top-K-Ergebnissen erscheint. Die Ground Truth ist die product_id der Bewertung, die Query generiert hat. Wenn eine andere Bewertung desselben Produkts in den Top-K landet, zählt dies als Treffer. Hit@1 ist der strengste Test: Ist das oberste Ergebnis vom richtigen Produkt? Hit@10 ist großzügiger: Befindet sich das richtige Produkt irgendwo in den ersten 10 Ergebnissen?

MRR@10 (Mean Reciprocal Rank) mittelt 1/Rang des ersten korrekten Ergebnisses über alle Queries. Befindet sich die erste passende product_id auf Rang 1, beträgt der Score 1.0. Auf Rang 2 beträgt er 0.5. Auf Rang 10 beträgt er 0.1. Dies belohnt Models, die das richtige Produkt so weit oben wie möglich platzieren.

nDCG@10 (Normalized Discounted Cumulative Gain) bewertet die Positionen aller passenden Bewertungen in den Top-10, nicht nur der ersten. Wenn dasselbe Produkt mehrere Bewertungen im Kandidatenset hat und mehrere davon in den Top-10 landen, honoriert nDCG jede einzelne basierend auf ihrer Position. In der Praxis haben die meisten Produkte nur 1–2 Bewertungen in den Top-100-Kandidaten, sodass nDCG und MRR eng beieinander liegen.

Recall@10 misst den Anteil der passenden Bewertungen (gleiche product_id) in den Top-10 an allen passenden Bewertungen im vollständigen Kandidatenset (Top-100). Wenn ein Produkt 3 Bewertungen in den Top-100 hat und der Reranker 2 davon in die Top-10 bringt, beträgt Recall@10 für diese Query 2/3. Da die meisten Produkte nur wenige doppelte Bewertungen im Kandidatenset haben, sind Recall@10 und Hit@10 in diesem Benchmark nahezu identisch.

Latenzaufschlüsselung

Die Reranking-Latenz misst die Zeit, die jeder Cross-Encoder benötigt, um 100 Kandidatendokumente gegen die Query zu bewerten. Die Vektorsuchzeit (~20ms) ist ausgeschlossen, da sie über alle Durchläufe konstant bleibt und unabhängig vom Reranker ist.

Latenzmetriken erklärt:

Rerank ist die Zeit, die der Cross-Encoder benötigt, um alle 100 Kandidatendokumente gegen die Query zu bewerten. Hier unterscheiden sich die Models: Ein einzelner Forward-Pass ist schnell, während autoregressive Decodierung langsam ist.

P95 ist die Gesamtlatenz im 95th-Perzentil. Einige Queries haben längere Bewertungstexte, was die Tokenisierungs- und Bewertungszeit erhöht. P95 zeigt den Worst-Case, den Sie für 95 % der Queries erwarten sollten.

Wichtigste Erkenntnisse

Ein 149M-Model erreicht dasselbe wie ein 1.2B-Model

gte-reranker-modernbert-base hat 149M Parameter, nemotron-rerank-1b hat 1.2B. Beide erreichen 83.00 % Hit@1 auf Englisch. Die ModernBERT-Architektur ist 8x kleiner und liefert identische Top-Line-Genauigkeit.

Das bedeutet nicht, dass die Model-Größe irrelevant ist. Nemotron liegt bei MRR@10 (0.8514 vs. 0.8483) und Hit@10 (88.33 % vs. 88.00 %) knapp vorn, was bedeutet, dass es relevante Dokumente über die gesamten Top-10 etwas besser einordnet. Aber für die meisten Anwendungen, bei denen es darauf ankommt, das erste Ergebnis richtig zu haben, reicht das 149M-Model aus.

Das größte Model ist nicht das beste

qwen3_reranker_4b hat 4B Parameter und benötigt über eine Sekunde pro Query. Es erreicht 77.67 % Hit@1 und liegt damit auf Platz vier hinter Nemotron (1.2B), gte_modernbert (149M) und Jina (560M). Sie zahlen die 4.5x-fache Latenz von Nemotron für 5.3 Prozentpunkte weniger Genauigkeit.

Qwen3s Architektur verwendet Causal Language Modeling mit einem Ja/Nein-Logit-Ansatz. Das Model liest das Query-Dokument-Paar und gibt die Wahrscheinlichkeit für „ja, das ist relevant“ aus. Das ist konzeptionell sauber, aber die Inference ist aufgrund des Overheads der autoregressiven Decodierung teuer. Die SequenceClassification-Models (gte_modernbert, bge) und Nemotrons Prompt-Template-Ansatz verarbeiten das Paar in einem einzigen Forward-Pass, was grundsätzlich schneller ist.

Jina bietet den besten Kompromiss zwischen Geschwindigkeit und Genauigkeit

jina_reranker_v3 erreicht 81.33 % Hit@1 bei 188ms. Nemotron erreicht 83.00 % bei 243ms. Wenn Sie eine Gesamtlatenz von unter 200ms pro Query benötigen, ist Jina das einzige Model in der Spitzengruppe, das dies liefert. Die Lücke von 1.67 Prozentpunkten rechtfertigt möglicherweise nicht die zusätzlichen 55ms in einem Produktionssystem, das Tausende von Anfragen pro Sekunde bedient.

Ein Reranker verschlechtert die Ergebnisse

mxbai_rerank_xsmall (70M Parameter) erreicht 64.67 % Hit@1. Die Baseline ohne jeglichen Reranker erreicht 62.67 %. Die Verbesserung beträgt nur 2 Prozentpunkte, was bei 300 Queries im Rauschen liegt. Mit 70M Parametern fehlt dem Model die Kapazität, um die Query-Dokument-Relevanz bei längeren oder nuancierteren Texten zuverlässig zu beurteilen.

Ein Reranker ist nicht automatisch vorteilhaft. Testen Sie ihn an Ihren eigenen Daten, bevor Sie ihn einsetzen.

Der Retriever setzt die Obergrenze

Alle Top-Reranker konvergieren bei etwa 87–88 % Hit@10. Diese Obergrenze stammt vom Retriever. Wenn multilingual-e5-base das richtige Dokument nicht in die Top-100-Kandidaten aufnimmt, kann kein Reranker es wiederherstellen. Die verbleibenden 12 % der Queries, bei denen jeder Reranker versagt, stellen Fälle dar, in denen der Dense Retriever das relevante Dokument schlicht vollständig verfehlt hat.

Eine Verbesserung über diese Obergrenze hinaus erfordert einen besseren Retriever, einen größeren Kandidatenpool oder beides. Wir haben Top-250-Kandidaten getestet und kaum eine Verbesserung gegenüber Top-100 festgestellt, was bedeutet, dass e5_base seine nützlichen Kandidaten lange vor Rang 250 erschöpft.

Funktionsweise von Rerankern

Ein Dense Retriever (Bi-Encoder) codiert Queries und Dokumente unabhängig voneinander in Vektoren. Die Retrieval ist eine Nächste-Nachbarn-Suche über diese Vektoren. Das ist schnell, weil Sie zur Suchzeit nur die Query codieren müssen, aber das Model sieht Query und Dokument nie gemeinsam, sodass es nuancierte Relevanzsignale übersehen kann.

Ein Reranker (Cross-Encoder) nimmt ein Query-Dokument-Paar als einzelne Eingabe. Das Model betrachtet beide Texte gemeinsam und erfasst Beziehungen, die bei unabhängiger Codierung verloren gehen. Der Preis dafür ist, dass Sie das Model einmal pro Kandidat ausführen müssen, sodass Sie es sich nur leisten können, einen kleinen Pool zu bewerten.

Architekturen in diesem Benchmark

Wir haben vier verschiedene Cross-Encoder-Architekturen getestet:

SequenceClassification-Models (bge_base, bge_v2_m3, mxbai_xsmall, gte_modernbert) nehmen ein [query, document]-Paar als Eingabe und geben einen einzelnen Logit-Score aus. Dies ist der einfachste und gängigste Ansatz.

Nemotron verwendet ein Prompt-Template-Format: „question:{q} passage:{p}“. Die Eingabe sieht aus wie Klartext und nicht wie ein strukturiertes Paar, aber das Model gibt dennoch einen einzelnen Relevanzscore über SequenceClassification aus. Das LLM-Pretraining (basierend auf Llama) verleiht ihm ein starkes Sprachverständnis.

Qwen3-Reranker verwenden Causal Language Modeling. Das Model liest das Paar und generiert eine Ja/Nein-Beurteilung. Der Score ist log P(ja) / (P(ja) + P(no)). Dies erfordert die volle autoregressive Maschinerie, was die höhere Latenz erklärt.

Jina v3 verwendet eine benutzerdefinierte API (model.rerank()), die Tokenisierung und Bewertung intern handhabt. Die zugrunde liegende Architektur verwendet Cross-Attention, aber die Schnittstelle abstrahiert die Details.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Reranker-Benchmark-Methodik

  • GPU: NVIDIA H100 PCIe 80GB über Runpod
  • Vektordatenbank: Qdrant 1.12.0 (lokal, binär), Kosinus-Distanz
  • Retriever: multilingual-e5-base (768-dim). Query-Präfix: "query: ", Dokument-Präfix: "passage: "
  • Software: transformers 5.2.0, PyTorch 2.8.0, CUDA 12.8.1
  • Datenset: Englische Teilmenge von Amazon Reviews Multi (Kaggle).1 ~145k Bewertungen nach Filterung auf mindestens 100 Zeichen. Jede Bewertung hat eine product_id, einen Bewertungstext und eine Sternebewertung.
  • Query-Generierung: Claude Sonnet 4.6 über OpenRouter. 300 englische Queries (5 Typen: faktisch, Meinung, Nutzung, Problemlösung, Funktionsvergleich). Jede Query muss auf spezifische Details aus ihrer Quellbewertung verweisen; generische Fragen (Spezifitäts-Score < 4/5) werden herausgefiltert.
  • Dokumentformat: "Review Title: {title}\nReview: {body}"
  • Pipeline: Top-100-Kandidaten mit multilingual-e5-base abrufen, mit Cross-Encoder neu ranken, Top-10 zurückgeben. Die Baseline überspringt das Reranking und gibt die Top-10 des Retrievers direkt zurück.
  • Ground Truth: Nur exakter Abgleich der product_id. Kein Kosinus-Ähnlichkeits-Fallback. Keine Teilpunkte für semantisch ähnliche Produkte.
  • Kontrollierte Variable: Nur das Reranker-Model ändert sich zwischen den Experimenten. Retriever, Kandidatenanzahl, Query-Set und Bewertungskriterien sind über alle Durchläufe identisch.
  • Kein Fine-Tuning: Alle Models wurden Zero-Shot mit den Standard-HuggingFace-Gewichten evaluiert.
  • Latenz: Reranking (Cross-Encoder-Bewertung von 100 Kandidaten). Gemessen pro Query auf der GPU.

Getestete Models

Verpassen Sie nicht unsere Benchmarks und datengestützten Erkenntnisse. Die Schaltfläche öffnet Google; die Auswahl von AIMultiple bestätigt, dass Sie AIMultiple häufiger in den Google-Suchergebnissen sehen möchten.
GoogleAls bevorzugte Quelle hinzufügen

Einschränkungen

Dieser Benchmark verwendet einen einzigen Retriever (multilingual-e5-base). Ein anderer Retriever würde andere Kandidatensets erzeugen und könnte die Reranker-Rangfolge verändern. Die Ergebnisse zeigen, wie gut jeder Reranker mit diesem spezifischen Retriever funktioniert, nicht die Reranker-Qualität isoliert betrachtet.

Wir haben auf englischen Produktbewertungen von Amazon getestet. Die Leistung in anderen Domänen (wissenschaftliche Arbeiten, juristische Dokumente, Code) oder anderen Sprachen wird abweichen.

Die Kandidatenanzahl ist auf 100 festgelegt. Einige Reranker könnten mit 20 oder 200 Kandidaten anders ranken. Wir haben 250 Kandidaten getestet und eine vernachlässigbare Verbesserung festgestellt, was darauf hindeutet, dass 100 für e5_base ausreichend sind, aber andere Retriever können sich anders verhalten.

300 Queries sind eine moderate Stichprobengröße. Die drei besten Models (Nemotron, gte_modernbert, Jina) sind durch weniger als 2 Prozentpunkte getrennt. Mit einem größeren Query-Set könnten sich diese Rangfolgen verschieben. Der Abstand zwischen der Spitzengruppe und der unteren Gruppe (20+ Prozentpunkte) ist robust.

Fazit

Reranker funktionieren. Das beste Model in diesem Benchmark steigert Hit@1 von 62.67 % auf 83.00 % (+20.33pp), was bedeutet, dass 20 von jeweils 100 Queries, die zuvor das falsche Dokument zuerst zurückgaben, nun das richtige zurückgeben. Das ist ein erheblicher Gewinn für eine Komponente, die weniger als 250ms Latenz hinzufügt.

Die nützlichste Erkenntnis ist, dass die Model-Größe nicht die Reranker-Qualität bestimmt. gte-reranker-modernbert-base mit 149M Parametern erreicht dasselbe Hit@1 wie nemotron-rerank-1b mit 1.2B. Das 4B-Parameter-Qwen3-Model landet auf Platz vier. Wenn Sie einen Reranker für ein Produktionssystem auswählen, beginnen Sie mit den kleineren Models. Möglicherweise benötigen Sie die größeren nie.

Für latenzempfindliche Anwendungen ist jina-reranker-v3 die stärkste Option unter 200ms. Für maximale Genauigkeit ohne Latenzbeschränkung teilen sich nemotron-rerank-1b und gte-reranker-modernbert-base den Spitzenplatz. Für Teams mit GPU-Budget ist gte-modernbert der klare Gewinner: gleiche Genauigkeit wie das 1.2B-Model bei einem Bruchteil des Speicherbedarfs.

Ein Muster zeigte sich in allen Experimenten: Der Retriever setzt die Obergrenze. Kein Reranker brachte Hit@10 über 88 %, da die verbleibenden 12 % der korrekten Dokumente nie in den Top-100-Kandidaten erschienen. Die Investition in einen besseren Retriever wird wahrscheinlich größere Gewinne bringen als der Wechsel zwischen den drei besten Rerankern.

Weiterführende Literatur

Entdecken Sie weitere RAG-Benchmarks, wie zum Beispiel:

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ekrem Sarı (2026) - "Reranker-Benchmark: Top-8-Models im Vergleich". Online veröffentlicht auf AIMultiple.com. Abgerufen am 26. Februar 2026, von: https://aimultiple.com/rerankers [Online-Ressource]

Sarı, E. (2026, 26. Februar). Reranker-Benchmark: Top-8-Models im Vergleich. AIMultiple. https://aimultiple.com/rerankers

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Reranker-Benchmark: Top-8-Models im Vergleich}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/rerankers}},
  note   = {AIMultiple. Abgerufen am 26. Februar 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 9 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei und eine README enthält.

Zuletzt aktualisiert: 17. August 2026
Herunterladen
Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450