Wir haben 14 Open-Source-Einbettungsmodelle auf einer einzelnen H100 selbst gehostet und anhand von über 500 manuell kuratierten Abfrageanfragen getestet, die Rechtsverträge, technische Support-Notizen und medizinische Zusammenfassungen abdecken. NVIDIA Llama-Embed-Nemotron-8B führt in der Genauigkeit. Bei den Kosten läuft Google EmbeddingGemma-300m etwa 4x günstiger als Nemotron, bei einem kleinen Genauigkeitsverlust.
Ergebnisse des Benchmarks für Open-Source-Einbettungsmodelle
Metriken erklärt
nDCG@3: Normalisierter kumulierter diskontierter Nutzen bei Cutoff 3. Bei einem relevanten Dokument pro Anfrage beträgt er 1 / log2(Rang + 1), wenn das Gold-Dokument unter den Top-3 landet, andernfalls 0. Rang 1 ergibt 1.000, Rang 2 ergibt 0.631, und Rang 3 ergibt 0.500. Wir verwenden nDCG@3 als primäre Metrik, da Produktions-RAG-Pipelines die Top-3 bis 5 Chunks an das LLM weitergeben und der Primacy Bias Rang 1 überproportional wichtig macht.
nDCG@10: Gleiche Formel mit Cutoff 10.
Recall@10: Anteil der Anfragen, bei denen das Gold-Dokument unter den Top 10 erscheint.
MRR@10: Mittlerer reziproker Rang bei Cutoff 10. Gold auf Rang 1 ergibt 1.000, Rang 2 ergibt 0.500, und Rang 10 ergibt 0.100. Ähnliche Absicht wie nDCG@3, aber mit einer stärkeren Rangbestrafung.
Top-1 hit: Anteil der Anfragen, bei denen das gold-relevante Dokument das einzige Top-Ergebnis ist. Die strengste Metrik und diejenige, die einem Workflow ohne LLM-Abfrage am nächsten kommt.
nDCG@3-Ergebnisse nach Domäne
Die Durchschnittsrangliste verdeckt Domäneninversionen. Harrier gewinnt CUAD, landet aber auf TechQA auf dem siebten Platz. SFR-2 rangiert auf TechQA auf Platz zwei, jedoch nur auf Platz vier bei CUAD. KaLM-12B ist Fünfter bei MedRAG und Neunter bei TechQA. nDCG@3 pro Domäne:
BM25 ist bei MedRAG wettbewerbsfähig (0.7862, schlägt PubMedBERT und das mehrsprachige Granite) und bei CUAD schwach (0.5844, wo 11 von 14 dichten Modellen es übertreffen). Rechtsverträge enthalten eine dichte Entitätssprache, die lexikalische Übereinstimmung belohnt. Bei medizinischen Zusammenfassungen übertreffen die führenden dichten Modelle (Nemotron 0.9629, SFR-2 0.9620, jina-v5 0.9523) BM25 um 0.17 bis 0.18 absolute nDCG@3-Punkte.
Bootstrap-95%-Konfidenzintervalle pro (Modell, Domäne)-Zelle, einschließlich eines Vier-Wege-Gleichstands an der Spitze bei MedRAG und einer Harrier-Nemotron-CUAD-Überlappung, die Punktschätzung-Rangliste einebnet, werden im Abschnitt Benchmark-Methodik berichtet.
Kosten pro Million Token
Die selbst gehosteten Kosten sind GPU-amortisiert: der Stundensatz geteilt durch die pro Stunde verarbeiteten Token. Der von uns verwendete Pod war eine RunPod Community-Cloud H100 80GB SXM5 zu $2.99/Std.. Die Wanduhrzeit pro Modell über den 551-Abfragen- und 3-Korpora-Durchlauf (~46.2M Token insgesamt) ergibt die folgenden $/1M Token-Schätzungen:
Die Formel:
GPU $/Std. = $2.99 (der RunPod Community H100 80GB SXM5-Tarif des von uns genutzten Pods). wall_seconds = gesamte Wanduhrzeit jedes Modells über den 551-Abfragen- und 3-Korpora-Durchlauf. total_tokens ≈ 46.22M (Summe der 3 Korpora + 551 Abfragen, Zeichenzählung ÷ 4 Heuristik).
Rechenbeispiel, Nemotron-8B: ($2.99 / 3600) × (1247.8 × 1,000,000 / 46,220,000) = $0.0224 pro 1M Token.
Fünf Modelle führen ihre Kostenstufe an (keine andere Zeile kostet weniger und erzielt eine höhere Punktzahl): Granite-278m-multilingual am unteren Ende der Kostenleiter, dann Granite-small-r2, EmbeddingGemma-300m, jina-v5-text-small und Nemotron-8B an der Spitze der Qualitätsleiter. Die Endpunkte umfassen eine Kostenspanne von 13x ($0.0017/M bis $0.0224/M) und 0.23 absolute nDCG@3-Punkte (0.6952 bis 0.9249).
Domänenspezialisten vs. Generalisten
PubMedBERT, feinabgestimmt auf PubMed-Titel-Abstract-Paare, ist das offensichtlich „richtige Werkzeug“ für die medizinische RAG-Abruf auf PubMed. Es erreicht nDCG@3 = 0.7084 auf MedRAG, was unter der lexikalischen BM25-Basislinie (0.7862) auf demselben Korpus liegt. Moderne Open-Source-Generalisten übertreffen es um 0.22 bis 0.25 absolute Punkte auf seiner Trainingsdatendomäne:
Der Grund, warum der Spezialist unterperformiert, sind Alter und Rezept. PubMedBERT ist ein BERT mit 110M Parametern aus dem Jahr 2022, mit symmetrischem Mean Pooling und ohne Instruktionspräfix. Die Generalisten von 2024-2026 basieren auf größeren Backbones, asymmetrischen Abfrage- und Dokumentpräfixen sowie instruktionsabgestimmten Retrieval-Zielen. Die architektonische Lücke wiegt schwerer als die Domänenübereinstimmung: Ein vier Jahre alter Fine-Tune kann nicht mit einem aktuellen instruktionsabgestimmten Retriever mithalten, selbst auf dem Trainingskorpus des Fine-Tunes.
Die Käuferregel lautet: Einen Domänenspezialisten vor der Bereitstellung anhand repräsentativer Abfragen gegen einen modernen Generalisten zu testen. Die Annahme „Der Spezialist gewinnt in seiner Domäne“ ist für Open-Source-Einbettungsmodelle im Jahr 2026 nicht mehr sicher.
Erkenntnisse aus dem Open-Source-Einbettungsbenchmark
Nemotron-8Bs TechQA-Vorsprung ist statistisch vom zweiten Platz getrennt
Nemotron-8B AVG nDCG@3 = 0.9249. Domänenbezogen erreicht es 0.8602 bei CUAD, 0.9515 bei TechQA und 0.9629 bei MedRAG. Das TechQA-Ergebnis (0.9515 0.923, 0.977) überschneidet sich nicht mit dem Zweitplatzierten SFR-Embedding-2_R (0.9109 0.869, 0.949). Die Bootstrap-CIs sind klar getrennt. Die 8B Llama-3.1-Basis, instruktionsabgestimmt für Retrieval mit einem abfrageseitigen Instruct: …\nQuery: … Präfix und einem symmetrischen dokumentseitigen Präfix, führt zu einem absoluten nDCG@3-Vorsprung von 0.04 gegenüber der nächsten Zeile bei Workloads mit langen Dokumenten.
Die beiden Domänen, in denen Nemotron klar gewinnt (TechQA, MedRAG), sind die Korpora mit langen Dokumenten, bei denen die Asymmetrie der Instruktionspräfixe am meisten zählt. CUAD ist die einzige Domäne, in der es nicht führt: Microsofts Harrier-oss-v1-0.6b (0.8720) übertrifft Nemotron (0.8602) bei Rechtsverträgen, obwohl es 13x kleiner ist, wobei die CIs sich überschneiden und der Vorsprung bei dieser Stichprobengröße statistisch nicht getrennt ist.
Ein 0.6B Microsoft Harrier Modell übertrifft jedes offene Modell mit unter 7B Parametern
Microsoft Harrier-oss-v1-0.6b (veröffentlicht 2026-04 mit einer Qwen3-0.6B-Basis und einer MIT-Lizenz) erreicht AVG nDCG@3 = 0.8911, insgesamt Platz vier. Es übertrifft das 12B Tencent KaLM-Gemma3 (0.8057, Tencent Community-Lizenz), das 7B Salesforce SFR-Embedding-2_R auf CUAD (0.8421 gegenüber Harrier 0.8720) und Googles EmbeddingGemma-300m (0.8706). Im Vergleich mit gleicher Architektur liegt Harrier-0.6b (0.8911) 0.074 nDCG@3 über Qwen3-Embedding-0.6B (0.8168), das auf der identischen Qwen3-0.6B-Basis aufbaut. Der Trainingskorpus und das Instruktionsrezept verursachten den Abstand, nicht die Parameteranzahl.
Für Käufer ist Harrier die bestplatzierte Open-Source-Zeile, die mit einer Lizenz ausgeliefert wird, die für die kommerzielle Nutzung ohne Einschränkungen geeignet ist. SFR-2 (CC-BY-NC), Nemotron (NSCL-v1) und jina-v5 (CC-BY-NC) übertreffen es in der AVG-Rangliste, aber alle drei sind nur für Forschungszwecke oder nicht kommerziell.
Ein medizinischer Spezial-Embedder verliert gegen BM25
NeuMLs PubMedBERT-base-embeddings wurde auf PubMed-Titel-Abstract-Paaren feinabgestimmt. Es ist das offensichtlich „richtige Werkzeug“ für einen medizinischen RAG-Benchmark auf PubMed. Es erzielt nDCG@3 = 0.7084 auf MedRAG, was 0.078 absolut unter der lexikalischen BM25-Basislinie (0.7862) auf demselben Korpus liegt. Die führenden Open-Source-Generalisten auf MedRAG liegen weit über beiden: Nemotron-8B 0.9629, SFR-Embedding-2_R 0.9620, Harrier-oss 0.9605, jina-v5 0.9523, KaLM-Gemma3-12B 0.9453.
Das ist die Umkehrung, die ändern sollte, wie ein Käufer einen Domänenspezialisten auswählt. PubMedBERT ist ein BERT mit 110M Parametern aus dem Jahr 2022, mit symmetrischem Mean Pooling und ohne Instruktionspräfix. Das Generalistenfeld von 2024 bis 2026 basiert auf größeren Backbones, asymmetrischen Abfrage- und Dokumentpräfixen und instruktionsabgestimmten Retrieval-Zielen. Bei MedRAG-Abfragen, die bereits medizinisches Vokabular enthalten, ist der lexikalische Abgleich von BM25 von Natur aus stark, und die Spezialisierung von PubMedBERT trägt nichts dazu bei.
Die praktische Schlussfolgerung ist, einen Spezial-Embedder nicht allein nach dem Namen auszuwählen. Führen Sie einen Benchmark mit Ihren eigenen Abfragen durch, bevor Sie sich festlegen.
Snowflake Arctic schwankt um 0.32 nDCG@3 über die Domänen hinweg
Snowflakes snowflake-arctic-embed-l-v2.0 (568M, Apache-2.0, bge-m3-retromae-Abkömmling, mehrsprachig) erzielt nDCG@3 = 0.5846 bei CUAD-Rechtsverträgen und 0.9053 bei MedRAG-medizinischen Zusammenfassungen. Dasselbe Modell, dasselbe Rezept, dasselbe Abfrageformat, mit einer Schwankung von 0.32 Punkten über zwei Domänen hinweg. Andere Modelle in der Liste schwanken weniger: SFR-2 reicht von 0.8421 bis 0.9620 (Lücke 0.12), Nemotron von 0.8602 bis 0.9629 (Lücke 0.10), Harrier von 0.8408 bis 0.9605 (Lücke 0.12).
Der Mechanismus ist die Zusammensetzung der Trainingsdaten. Arctic wurde auf BEIR, MIRACL und CLEF abgestimmt; Rechtsverträge sind nicht vertreten. Bei einer vertikalen Retrieval-Workload sind domänenspezifische Trainingsdaten wichtiger als die Parameteranzahl oder die Kontextlänge.
Wie die Inferenz mit Open-Source-Einbettungen funktioniert
In diesem Benchmark werden Open-Source-Einbettungsmodelle mit zwei Backends ausgeführt: sentence-transformers (12 Modelle) und vLLM (4 Modelle). Die Aufteilung betrifft nicht die Qualität, sondern die Laufzeiteffizienz bei Modellen mit 8B und mehr, bei denen die standardmäßige Python-Interferenzschleife von sentence-transformers zu langsam ist, um handhabbar zu sein.
Das Rezept pro Modell ist wichtiger als die Wahl des Backends. Moderne Retrieval-Modelle verwenden asymmetrische Präfixe: Die Abfrageseite wird in einen Instruct-artigen Prompt (Instruct: Given a question, retrieve passages...\nQuery: <text>) verpackt, während die Dokumentseite schlicht ist. Der Pooling-Typ variiert: BERT-abgeleitete Modelle verwenden CLS-Pooling; LLM-abgeleitete Modelle (Llama, Mistral, Qwen3, Gemma3-Basis) verwenden Last-Token-Pooling; mehrsprachige Modelle verwenden häufig Mean-Pooling. Die HuggingFace-Karte für jedes Modell ist die Quelle der Wahrheit dafür, welche Präfix- und Pooling-Kombination korrekt ist.
Backend-Stufe:
- vLLM: Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small
- sentence-transformers: Qwen3-0.6B, EmbeddingGemma-300m, Granite-Trio, SFR-2, Conan-v1, PubMedBERT, GIST, Snowflake Arctic, Microsoft Harrier
Beobachtete asymmetrische Präfixmuster:
- Instruct + Query/Document: SFR-2, KaLM-Gemma3, Nemotron-8B, Qwen3-Embedding
- Integriertes encode_query / encode_document: EmbeddingGemma, KaLM-Gemma3, Nemotron-8B
- task / prompt_name (sentence-transformers-Parameter): jina-v5, Snowflake Arctic, Harrier
- Kein Präfix (symmetrisch): Granite trio, Conan, PubMedBERT, GIST
Pooling-Typ nach Basisarchitektur:
- CLS-Pooling: Granite r2 Trio, Snowflake Arctic
- Last-Token-Pooling: Nemotron, KaLM-Gemma3, SFR-2, jina-v5, Qwen3-Embedding, Harrier
- Mean-Pooling: EmbeddingGemma, Granite-multilingual, Conan, PubMedBERT, GIST
Die Verwendung des falschen Rezepts verschlechtert stillschweigend die Retrieval-Qualität, ohne abzustürzen. Jeder Benchmark von Open-Source-Embeddern sollte eine Sanity-Untergrenze enthalten (Recall@10 unter 0.5 über alle Domänen hinweg für ein Modell ist ein Warnsignal für eine Fehlkonfiguration, nicht für ein Ergebnis).
Methodik des Benchmarks für Open-Source-Einbettungsmodelle
Es wurden drei Retrieval-Domänen evaluiert: CUAD-Rechtsverträge (246 Abfragen, 509 Verträge), TechQA-Kunden-Support-Technotes (151 Abfragen, 28000 IBM Technotes), MedRAG-PubMed-Gesundheitsabstrakte (154 Abfragen, 50000 Abstrakte). Insgesamt 551 Abfragen.
Die Methodik zur Erstellung des Datensatzes ist mit unserem vorherigen Benchmark für englische Einbettungsmodelle identisch: Protocol-A 3-LLM-Konsensus-Abfragegenerierung (rotierender Writer-Pool, fester Scorer, zwei Nicht-Schreiber-Validatoren pro Versuch), Korpus-Pinning durch SHA-256-Hash, domänenspezifische Whitelists für verbotene Token, um lexikalische BM25-Abkürzungen zu verhindern, Cohens κ-Inter-Rater-Übereinstimmung pro Validatorenpaar, synthetisierte BM25-Basislinienränge aus dem bm25_rank_at_target Feld, das bereits in jeder Abfrage-JSON vorhanden ist (Pyserini-äquivalent). Primäre Metrik nDCG@3 (RAG-realistisch, was Produktions-RAG-Systeme konsumieren); sekundäre Metriken nDCG@10, Recall@10, Recall@100, MRR@10, Top-1-Treffer.
Open-Source-spezifische Spezifikationen:
- GPU: 1 x NVIDIA H100 80GB SXM5 über RunPod Community Cloud
- Pod template:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
- Stack: PyTorch 2.10.0+cu128, vLLM 0.19.1, transformers 5.6.2, sentence-transformers 5.4.1
- Pro-Modell-Dispatch: HF-Modellkarte primärer Pfad. ST für 12 Modelle, vLLM für Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small.
- Pro-Modell-Chunking: Zeichen-basiertes Abschneiden bei
max_seq_length x 4Zeichen pro Token, dann schneidet der Tokenizer des Modells auf seine tatsächliche maximale Sequenzlänge ab.
- Asymmetrisches Retrieval: Jedes Modell, das dies unterstützt, erhält das in der HF-Karte dokumentierte Abfrage- und Dokumentpräfix. Kein Präfix ist für einige der dokumentierte Standard.
- L2-Normalisierung: einheitlich nach dem Pooling angewendet. Einige Modelle tun dies intern. Wir renormalisieren, um die Gleichheit über die Liste hinweg sicherzustellen.
- Embedding-Cache-Schlüssel: umfasst Präfix + Task + prompt_name + max_seq + Backend, sodass ein Präfixwechsel während des Laufs nicht stillschweigend veraltete Embeddings laden kann.
- Statistisches Protokoll: 10K Bootstrap-Resamples pro (Modell, Domäne, Metrik)-Zelle, Perzentil-95%-CI, seed=2026.
Getestete Modelle
Sortiert nach AVG nDCG@3 Rang. Backend-Spalte: ST = sentence-transformers, vLLM = vLLM 0.19.
Bootstrap-95%-Konfidenzintervalle Ergebnisse
Die obige vollständige Rangliste ist ein Einzellauf pro (Modell, Domäne)-Zelle. Die sitzungsübergreifende Modellinitialisierungsvarianz wird nicht gemessen. Um die abfragebezogene Varianz innerhalb eines Laufs zu erfassen, haben wir den Pro-Abfrage-Rangvektor für jede (Modell, Domäne)-Zelle 10,000 Mal mit Zurücklegen neu gesampled (Perzentilmethode, Seed=2026, Stichprobengrößen CUAD n=246, TechQA n=151, MedRAG n=154). Bootstrap-95%-CI pro Domäne für nDCG@3:
Die CIs ändern tatsächlich, welche Inversionen von den Daten gestützt werden. Bei CUAD überschneiden sich Harrier (0.8720, [0.836, 0.906]) und Nemotron (0.8602, [0.821, 0.897]), so dass der Harrier-Vorsprung auf CUAD bei dieser Stichprobengröße nicht eindeutig getrennt ist. Bei TechQA überschneiden sich Nemotron (0.9515, [0.923, 0.977]) und SFR-2 (0.9109, [0.869, 0.949]) nicht, so dass Nemotrons TechQA-Vorsprung statistisch getrennt ist. Bei MedRAG liegen die Top-Vier (Nemotron 0.9629, SFR-2 0.9620, Harrier 0.9605, jina-v5 0.9523) innerhalb der CIs voneinander und bilden ein statistisches Vierer-Gleichstand. Die Inversion von PubMedBERT unter BM25 bei MedRAG (0.7084 [0.641, 0.772] vs BM25 0.7862) liegt an der Grenze der Überschneidung. Die zentrale Tendenz stellt den Spezialisten klar unter BM25, aber es ist ein sitzungsübergreifender 3-Lauf erforderlich, um dies als getrennt und nicht als überlappend aufzulösen.
Einschränkungen
Einzellauf pro (Modell, Domäne)-Zelle. Die oben stehende Bootstrap-CI-Tabelle erfasst die abfragebezogene Varianz innerhalb eines Laufs (10K Resamples, Perzentilmethode, Seed=2026), aber die sitzungsübergreifende Modellinitialisierungsvarianz wird nicht gemessen. Ein sitzungsübergreifender 3-Lauf über Mitternacht ist für v2.1 geplant. Die engeren Gleichstände, die CI-Tabelle aufzeigt (z.B. der Vierfach-Gleichstand bei MedRAG an der Spitze, die Harrier-Nemotron-CUAD-Überlappung, die marginale Inversion von PubMedBERT vs BM25), würden am meisten von dem Mehrfachlauf profitieren.
Kontextlängen-Verwirrung pro Modell. Modelle mit 512-Token-Kontextfenstern (Granite-278m-multilingual, PubMedBERT, Conan, GIST) sehen nur die ersten ~2K Zeichen jedes Dokuments. Modelle mit 8K oder 32K Kontext (Nemotron, KaLM-12B, jina-v5, Harrier, Granite r2 english) sehen das gesamte Dokument. Dies begünstigt Modelle mit langem Kontext bei TechQA (lange Technotes) und MedRAG (lange Abstrakte).
Kontaminationsrisiko der MedRAG-Trainingsdaten. Mehrere der evaluierten Modelle wurden auf PubMed-abgeleiteten Daten trainiert (PubMedBERT per Definition, möglicherweise Granite-278m-multilingual, möglicherweise Qwen3-Basis). Ein Teil des MedRAG nDCG@3-Schubs könnte eine Trainingsdaten-Überschneidung widerspiegeln und nicht die Retrieval-Qualität.
Conan-v1 ist chinesisch trainiert. Die Einbeziehung in rein englischen Domänen ist ein aufschlussreicher Datenpunkt zur Sprachinkongruenz und kein fairer direkter Vergleich der englischen Retrieval-Qualität. Wir erwarten eine Unterperformance gegenüber englisch-trainierten Konkurrenten, und genau das zeigen die Daten.
Schlussfolgerung
NVIDIA Llama-Embed-Nemotron-8B führt bei AVG nDCG@3 = 0.9249 mit statistisch getrennten Siegen bei TechQA und MedRAG. Die bestplatzierte Open-Source-Wahl unter einer uneingeschränkten Lizenz (MIT) ist Microsoft Harrier-oss-v1-0.6b mit AVG 0.8911. Google EmbeddingGemma-300m läuft zu etwa 4x geringeren Kosten bei einer kleinen Genauigkeitseinbuße.
Weiterführende Lektüre
Entdecken Sie andere RAG-Benchmarks, wie z.B.:
- Top 10 mehrsprachige Einbettungsmodelle für RAG
- Einbettungsmodelle: OpenAI vs Gemini vs Voyage
- Top Vektordatenbank für RAG: Qdrant vs Weaviate vs Pinecone
- Reranker-Benchmark: Top 8 Modelle im Vergleich
- Multimodale Einbettungsmodelle: Apple vs Meta vs OpenAI
- Hybrid-RAG: Steigerung der RAG-Genauigkeit
- Graph-RAG vs Vektor-RAG
Zitieren Sie diesen Benchmark
Wählen Sie das Format, das zu Ihrem Veröffentlichungsort passt. Wenn Sie die Link-Version in Ihr CMS einfügen, bleibt der Backlink erhalten.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Benchmark für Open-Source-Einbettungsmodelle für RAG}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/open-source-embedding-models}},
note = {AIMultiple. Abgerufen am 3. Juli 2026}
}Ergebnisse und Zeitstempel von 15 Datenpunkten. Laden Sie die in diesem Artikel verwendeten Daten als ZIP-Datei herunter, die eine CSV-Datei und eine README enthält.
Seien Sie der Erste, der kommentiert
Ihre E-Mail-Adresse wird nicht veröffentlicht. Alle Felder sind erforderlich. Kommentare werden in ihrer Originalsprache belassen.