Dienstleistungen
Kontaktieren

Top 10 Multilinguale Embedding-Modelle für RAG

Ekrem Sarı
Ekrem Sarı
aktualisiert am 20. Feb. 2026

Wir haben 10 multilinguale Embedding-Modelle anhand von ~606k Amazon-Bewertungen in 6 Sprachen (Deutsch, Englisch, Spanisch, Französisch, Japanisch, Chinesisch) verglichen. Wir haben 1.800 Abfragen (300 pro Sprache) generiert, die jeweils konkrete Details aus der ursprünglichen Bewertung referenzieren.

Modelle, die für die Suche trainiert wurden (Trennung von Abfrage und Dokument), übertreffen größere Modelle, die für allgemeine Textähnlichkeit trainiert wurden: e5_base (110M Parameter) übertrifft Modelle mit 5x bis 70x mehr Parametern, während LaBSE (471M Parameter), ein vielzitiertes multilinguales Modell, auf dem vorletzten Platz liegt.

Multilinguale Abrufgenauigkeit

Top-1 misst, ob die richtige Bewertung das erste zurückgegebene Ergebnis ist; Top-10 misst, ob sie irgendwo unter den ersten zehn erscheint.

Top-1-Genauigkeit

Loading Chart

Top-3-Genauigkeit

Top-5-Genauigkeit

Top-10-Genauigkeit

Erklärte Metriken

  • Top-K-Genauigkeit: Ob das richtige Dokument (durch exakte product_id-Übereinstimmung) unter den ersten K Ergebnissen erscheint. „Kann das Modell die richtige deutsche Bewertung finden, wenn es eine deutsche Frage unter ~130k deutschen Bewertungen gestellt bekommt?“
  • Top-1/3/5/10: Getestete K-Werte. Top-1 ist am strengsten (das richtige Dokument muss das erste Ergebnis sein), Top-10 ist am großzügigsten.

Um unsere Evaluierung und Metriken im Detail zu verstehen, siehe unseren Evaluierungsaufbau und die Benchmark-Methodik für multilinguale Embedding-Modelle.

Korpus: ~606k Bewertungen (min_review_length≥100 Zeichen; ZH: ~17,7k, DE/EN/ES/FR/JA: jeweils ~120–145k), kein Kosinus-Ähnlichkeits-Fallback, ausschließlich exakte product_id-Übereinstimmung. Evaluierung auf NVIDIA H100 PCIe 80GB.

Latenz & Durchsatz

Die Latenz bestimmt, ob ein Modell für den Produktionseinsatz geeignet ist. Modelle mit einer Latenz von unter 15ms können die Echtzeitsuche unterstützen; oberhalb von 25ms ist Batching oder Caching erforderlich.

Wichtigste Erkenntnisse

1. e5_base führt über alle Sprachen hinweg

e5_base erreicht 16,5% Top-1-Durchschnitt über 6 Sprachen und übertrifft das nächstbeste Modell (e5_small) um 3,8 Prozentpunkte. Das asymmetrische Training mit Abfrage-/Passagen-Präfixen erzeugt präzise Embeddings, die semantisch ähnliche Bewertungen in derselben Sprache gut unterscheiden.

2. LLM-basierte Modelle sind trotz ihrer Größe wettbewerbsfähig

qwen3_emb_06b (600M Parameter) und llama_embed_nemotron_8b (8B Parameter) erreichen beide eine monolinguale Genauigkeit von 10%+. Ihr massives multilinguales Pre-Training scheint Repräsentationen aufzubauen, die das Retrieval-Fine-Tuning nicht vollständig auslöschen kann, und bleibt wettbewerbsfähig mit Modellen, die nur einen Bruchteil ihrer Parameterzahl haben. nemotron erreicht 25,8% bei Top-10, das insgesamt drittbeste Ergebnis.

3. nomic_embed_v1_5 versagt bei CJK-Sprachen

nomic erreicht 0% Genauigkeit in Chinesisch und nur 4% in Japanisch, das einzige Modell, das ganze Sprachen komplett verfehlt. Sein englisch-zentriertes Training kombiniert mit der Asymmetrie der Präfixe search_query/search_document erzeugt gravierende Abdeckungslücken für nicht-europäische Sprachen, obwohl es für Englisch (17% Top-1) und Deutsch (9%) gut funktioniert.

4. LaBSE versagt trotz seines Rufs beim Retrieval

LaBSE wurde explizit für multilinguale semantische Ähnlichkeit entwickelt und wird in der Literatur häufig zitiert. In diesem Benchmark landet es auf dem vorletzten Platz (4,8% Top-1). Sein Training auf Übersetzungspaaren und Natural Language Inference hat nicht die diskriminative Präzision aufgebaut, die für Retrieval erforderlich ist: die genaue Quell-Bewertung von Hunderten semantisch ähnlicher Produkte in derselben Sprache zu unterscheiden.

5. Top-10-Skalierung nützt allen Modellen, besonders aber den stärkeren

Der Wechsel von Top-1 zu Top-10 verdoppelt die Trefferquote über alle Modelle hinweg. nemotron zeigt den besten monolingualen Top-10-Durchschnitt (25,8%), obwohl es bei Top-1 auf Platz 3 liegt (12,0%), was darauf hindeutet, dass sein 4096-dimensionaler Raum eine gute Nachbarschaftsstruktur bei größerem K aufweist.

6. Spanisch und Französisch schneiden durchweg schlechter ab

Über alle Modelle hinweg belegen ES und FR konstant niedrigere Plätze als DE, EN, JA und ZH. Dieses Muster gilt selbst für Modelle mit explizitem multilingualem Training und deutet auf eine geringere Repräsentation in den Pre-Training-Korpora oder eine Domänenabweichung bei Produktbewertungen hin.

Wie multilinguale Embeddings funktionieren

Ein Embedding-Modell wandelt Text in einen hochdimensionalen Vektor um (z. B. 384 oder 768 Zahlen), der die Bedeutung des Textes erfasst, nicht die spezifischen Wörter. Zwei semantisch ähnliche Texte sollten in diesem Raum unabhängig von der Sprache Vektoren nahe beieinander haben.

Ein multilinguales Embedding-Modell verarbeitet mehrere Sprachen im selben Vektorraum. Beim Einsatz für Retrieval muss das Modell das richtige Dokument unter Zehntausenden von Bewertungen in derselben Sprache finden, die oft ähnliche Produkte und Themen behandeln. Die Herausforderung ist die diskriminative Präzision: die exakte Quell-Bewertung von Hunderten semantisch ähnlicher Bewertungen in derselben Kategorie zu unterscheiden.

Multilingualer Evaluierungsaufbau

~606k Produktbewertungen sind in Qdrant indiziert (nur Bewertungen mit ≥100 Zeichen im Textkörper; ZH: ~17,7k, andere Sprachen: jeweils ~120–145k). 1.800 Abfragen (300 pro Sprache) wurden nativ per LLM aus Bewertungen generiert, die denselben Längenschwellwert erfüllen. Jede Abfrage muss konkrete Details aus der ursprünglichen Bewertung referenzieren (Maße, Mengen, Markennamen, Zeitangaben); generische Fragen werden über einen Spezifitäts-Score herausgefiltert. Bei einer Abfrage in Sprache X besteht die Aufgabe darin, die Quell-Bewertung unter Bewertungen derselben Sprache zu finden. Qdrant filtert die Ergebnisse nach Sprache. Die Genauigkeit wird über exakte product_id-Übereinstimmung bei Top-1/3/5/10 ohne Kosinus-Ähnlichkeits-Fallback gemessen.

Beispielabfragen aus dem Benchmark:

Deutsch (Elektronik, OPINION):

Französisch (Drogerie, USAGE):

Spanisch (Industriebedarf, FACTUAL):

Das Modell muss jede Abfrage der exakten Quell-Bewertung anhand der product_id zuordnen. Eine Abfrage über WLAN-Signalverlust durch ein Antennenkabel könnte semantisch zu Tausenden von Elektronikbewertungen passen, die Verbindungsprobleme beschreiben; nur eine beschreibt, dass das Signal nach der Installation dieses speziellen Kabels von 60% auf 20% abfällt.

Lassen Sie unser Team einen Ihrer Geschäftsprozesse kostenlos mit KI-Agenten automatisieren.
Einen Prozess automatisieren

Technische Analyse & Empfehlungen

Symmetrische vs. asymmetrische Modelle

Das Trainingsziel sagt die Retrieval-Leistung weitgehend voraus:

Warum asymmetrische Modelle am besten abschneiden: Das Abfrage-/Passagen-Präfix bringt dem Modell bei, Abfragen und Dokumente in systematisch unterschiedlichen Regionen des Raums einzubetten, wodurch eine retrieval-spezifische Geometrie entsteht. Dies führt zu diskriminativeren Embeddings, die semantisch ähnliche, aber unterschiedliche Dokumente trennen. e5_base erreicht dies mit 110M Parametern, weil das Trainingsziel, nicht die Modellkapazität, die Retrieval-Präzision antreibt.

Warum LLM-basierte Modelle wettbewerbsfähig sind: Massives multilinguales Pre-Training baut eine reichhaltige semantische Struktur in den Modellgewichten auf. Retrieval-Fine-Tuning fügt auf dieser tiefen Sprachverständnisebene aufgabenspezifische Ausrichtung hinzu, was zu wettbewerbsfähiger Leistung führt. Der Kompromiss ist die Latenz: nemotrons 4096-dimensionale Vektoren kosten 25ms pro Abfrage gegenüber 11ms für e5_base.

Warum LaBSE trotz seines Rufs versagt: LaBSE wurde auf Übersetzungspaaren trainiert, um satzebene Bedeutung sprachübergreifend nahe zusammenzubringen, eine Ähnlichkeitsaufgabe. Retrieval ist grundlegend anders: Es erfordert, die exakte Quell-Bewertung von Hunderten semantisch ähnlicher Produkte in derselben Sprache zu unterscheiden. Ähnlichkeitstraining optimiert auf grobkörnige semantische Nähe; Retrieval verlangt feinkörnige Diskriminierung zwischen Nah-Duplikaten.

Welches Modell sollten Sie verwenden?

Beste Genauigkeit: e5_base (16,5% Top-1, 11ms Latenz). Mit Sprachfilter verwenden.

Bester Latenz-/Genauigkeits-Kompromiss: e5_small (12,7% Top-1, 9,7ms), fast so schnell wie minilm mit besserer Genauigkeit.

Beste Top-10-Trefferquote: nemotron (25,8% Top-10), wenn Sie sich die 25ms Latenz und den GPU-Speicher für 4096-dim-Vektoren leisten können.

Für latenzempfindliche Produktionssysteme: e5_small oder minilm mit ~10ms. e5_small wird stark bevorzugt (12,7% vs. 3,8%).

Verwenden Sie immer einen Sprachfilter, wenn Sie sicher sind, dass Abfrage- und Dokumentsprache übereinstimmen. Alle Modelle zeigen signifikante Genauigkeitsgewinne bei sprachgefilterter Suche.

Methodik der multilingualen Embedding-Modelle

  • GPU: NVIDIA H100 PCIe 80GB via Runpod
  • Vektordatenbank: Qdrant 1.12.0 (lokales Binary)
  • Embedding-Bibliothek: sentence-transformers 5.2.2
  • Abragegenerierung: Claude Sonnet 4.6 via OpenRouter. Jede Frage muss spezifische Details aus der ursprünglichen Bewertung referenzieren; generische Fragen (Spezifitäts-Score < 4/5) werden herausgefiltert.
  • Datensatz: Amazon Reviews Multi (Kaggle)1 , train.csv. ~606k Bewertungen indiziert (min 100 Zeichen; ZH: ~17,7k, andere: jeweils ~120-145k). 6 Sprachen: DE, EN, ES, FR, JA, ZH.
  • Abfragen: 1.800 insgesamt (300 pro Sprache, 5 Fragetypen, nativ in jeder Sprache generiert).
  • Dokumentenformat: "Review Title: {title}\nReview: {body}"
  • Ground Truth: ausschließlich exakte product_id-Übereinstimmung. Kein Kosinus-Ähnlichkeits-Fallback.
  • Suche: Qdrant Vektorsuche mit Kosinus-Distanz. Top-K = 10. Sprachfilter für monolinguale Evaluierung angewendet.
  • Embedding: L2-Normalisierung. Asymmetrische Präfixe wo anwendbar: "query: " / "passage: " (e5), "search_query: " / "search_document: " (nomic).
  • Kein Fine-Tuning: Alle Modelle wurden Zero-Shot mit Standardgewichten evaluiert.
  • Latenz: Nur Embedding-Inferenz (einzelne Abfrage). Beinhaltet nicht die Vektorsuchzeit.

Evaluierte Modelle

Warum die Werte niedriger sind als bei BEIR/MTEB

Die absoluten Genauigkeitszahlen in diesem Benchmark sollten nicht direkt mit den auf BEIR oder MTEB gemeldeten Werten verglichen werden. Die beiden Benchmarks unterscheiden sich in mehreren strukturellen Aspekten:

Die Metrik mit exakter Übereinstimmung ist der größte strukturelle Unterschied. Jede Abfrage referenziert konkrete Details aus ihrer Quell-Bewertung (z. B. „Wie viele Stunden hat der 3D-Drucker gebraucht, um die Katzendatei von der SD-Karte zu drucken?“), sodass jede Abfrage ein klares einzigartiges Ziel hat, aber die Metrik vergibt dennoch null Punkte für eine semantisch relevante Bewertung eines anderen Produkts. Metriken mit teilweiser Gutschrift wie nDCG würden bei denselben Retrieval-Ergebnissen höhere Zahlen liefern. Was in diesem Benchmark zählt, ist das relative Ranking zwischen den Modellen, nicht die absoluten Zahlen.

Entdecken Sie weitere unserer Benchmarks und datengestützten Erkenntnisse in der Google-Suche.
GoogleAls bevorzugte Quelle hinzufügen

Einschränkungen

  • Fragetypen repräsentieren möglicherweise keine echten Benutzerabfragen. LLM-generierte Fragen sind tendenziell wohlgeformt und spezifisch. Echte Benutzer schreiben oft fragmentarische oder mehrdeutige Abfragen.
  • Nur dichtes Retrieval wird getestet. Sparse-Methoden (BM25), hybride Abrufverfahren und Reranking-Pipelines werden nicht evaluiert. Diese könnten das Ranking zwischen den Modellen erheblich verändern.
  • 300 Abfragen pro Sprache sind eine moderate Stichprobe. Die sprachspezifischen Ergebnisse haben einigermaßen enge Konfidenzintervalle, aber Rankings in der Mitte der Tabelle sollten dennoch mit Vorsicht interpretiert werden.
  • Keine Bewertung der Embedding-Qualität über Retrieval hinaus. Clustering-Qualität, semantische Ähnlichkeitsgenauigkeit und andere nachgelagerte Aufgaben werden nicht gemessen.

Fazit

Für die Suche trainierte Modelle (mit getrennten Abfrage- und Dokumenten-Embeddings) schlagen durchweg Modelle, die für allgemeine Textähnlichkeit trainiert wurden, unabhängig von der Größe. e5_base (110M Parameter) übertrifft Modelle, die 5x bis 70x mehr Parameter haben. LaBSE (471M Parameter), das vielzitierte Modell für mehrsprachige Aufgaben, landet auf dem vorletzten Platz, weil sein Ähnlichkeitstraining nicht die feinkörnige Diskriminierung aufbaut, die Retrieval erfordert.

LLM-basierte Modelle (qwen3 mit 600M Parametern, nemotron mit 8B Parametern) erreichen dank tiefem multilingualem Pre-Training wettbewerbsfähige Genauigkeit, erkaufen sich dies aber mit Latenz: nemotron kostet 25ms pro Abfrage gegenüber 11ms für e5_base, bei nur geringfügig besserem Top-10-Recall. Für die meisten Produktionssysteme bieten die kleineren, für Suche trainierten Modelle den besseren Kompromiss.

Für Praktiker, die mehrsprachige RAG-Systeme aufbauen, ist e5_base mit einem Sprachfilter die klare Wahl (16,5% Top-1, 11ms Latenz und ein Vorsprung von 3,8 Prozentpunkten vor dem Zweitplatzierten).

Weiterführende Literatur

Entdecken Sie weitere RAG-Benchmarks, wie zum Beispiel:

Zitieren Sie diesen Benchmark

Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.

Ekrem Sarı (2026) - "Top 10 Multilinguale Embedding-Modelle für RAG". Online veröffentlicht auf AIMultiple.com. Abgerufen am 20. Februar 2026, von: https://aimultiple.com/multilingual-embedding-models [Online-Ressource]

Sarı, E. (2026, 20. Februar). Top 10 Multilinguale Embedding-Modelle für RAG. AIMultiple. https://aimultiple.com/multilingual-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Top 10 Multilinguale Embedding-Modelle für RAG}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/multilingual-embedding-models}},
  note   = {AIMultiple. Abgerufen am 20. Februar 2026}
}
Alle Daten herunterladen

Ergebnisse und Zeitstempel von 10 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei und eine README enthält.

Zuletzt aktualisiert: 15. Juli 2026
Herunterladen
Ekrem Sarı
Ekrem Sarı
KI-Forscher
Ekrem ist KI-Forscher und Datenanalyst bei AIMultiple. Er entwirft und führt praxisnahe Benchmarks für KI- und LLM-Systeme durch.
Vollständiges Profil anzeigen

Seien Sie der Erste, der kommentiert

Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.

0/450