Premium
Hizmetler
Premium

Açık Kaynak Embedding Modelleri Benchmark'ı RAG için

We benchmarked 14 open-source embedding models, across 500+ manually curated retrieval queries spanning legal contracts, customer support tech notes, and medical abstracts.

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 10 Ağu 2026
Grafik Yükleniyor

NVIDIA Llama-Embed-Nemotron-8B doğrulukta lider. Maliyet açısından, Google'ın EmbeddingGemma-300m modeli, küçük bir doğruluk kaybı karşılığında Nemotron'dan kabaca 4x daha ucuza çalışıyor.

Açık kaynak embedding modelleri benchmark sonuçları

Metrikler açıklandı

nDCG@3: Kesme noktası 3'te normalize edilmiş indirimli kümülatif kazanç. Sorgu başına tek ilgili doküman varsa, altın doküman ilk 3'e girdiğinde 1 / log2(sıra + 1), aksi halde 0 olur. 1. sıra 1.000, 2. sıra 0.631, 3. sıra 0.500 puan alır. nDCG@3'ü birincil metrik olarak kullanıyoruz çünkü üretim RAG pipeline'ları üstteki 3 ila 5 parçayı LLM'e besler ve öncelik yanlılığı 1. sırayı orantısız biçimde önemli kılar.

nDCG@10: Kesme noktası 10 olan aynı formül.

Recall@10: Altın dokümanın ilk 10'da göründüğü sorguların oranı.

MRR@10: Kesme noktası 10'da ortalama ters sıra. 1. sıradaki altın doküman 1.000, 2. sıra 0.500, 10. sıra 10 0.100 puan alır. nDCG@3 ile benzer amaç taşır ancak daha sert bir sıra cezası uygular.

Top-1 isabet: Altın-ilgili dokümanın tek en üst sonuç olduğu sorguların oranı. En katı metrik ve LLM içermeyen bir arama iş akışına en yakın olanıdır.

Etki alanına göre nDCG@3 sonuçları

AVG sıralaması, etki alanı tersleşmelerini gizler. Harrier, CUAD'da birinci olurken TechQA'da yedinci sıraya iner. SFR-2, TechQA'da ikinci ancak CUAD'da yalnızca dördüncüdür. KaLM-12B, MedRAG'da beşinci, TechQA'da dokuzuncudur. Etki alanı başına nDCG@3:

Grafik Yükleniyor

BM25, MedRAG'da rekabetçidir (0.7862; PubMedBERT'i ve çok dilli Granite'ı geçer) ve CUAD'da zayıftır (0.5844; burada 11/14 yoğun model onu geçer). Hukuk sözleşmeleri, sözcüksel eşleşmeyi ödüllendiren yoğun varlık dili içerir. Tıbbi özetlerde en iyi yoğun modeller (Nemotron 0.9629, SFR-2 0.9620, jina-v5 0.9523) BM25'i 0.17 ila 0.18 mutlak nDCG@3 puanı farkla geçer.

Her (model, etki alanı) hücresi için bootstrap %95 güven aralıkları — tepede dört yönlü MedRAG eşitliği ve nokta tahmini sıralamasının düzleştirdiği Harrier-Nemotron CUAD örtüşmesi dahil — benchmark metodolojisi bölümünde raporlanmıştır.

Milyon token başına maliyet

Kendi kendine barındırılan maliyet GPU-amortize edilmiştir: saatlik ücret, saatte işlenen token sayısına bölünür. Kullandığımız pod, RunPod topluluk bulutunda H100 80GB SXM5 idi ve saat ücreti $2,99/saat idi. 551 sorguluk, 3 derlemli geçişte (~46.2M token toplam) model başına duvar saati süresi şu $/ 1M token tahminlerini verir:

Formül:

GPU $/saat = $2,99 (kullandığımız pod'un RunPod topluluk H100 80GB SXM5 ücreti). wall_seconds = her modelin 551 sorguluk, 3 derlemli geçiş boyunca toplam duvar saati süresi. total_tokens ≈ 46.22M (3 derlemin toplamı + 551 sorgu, karakter sayısı ÷ 4 sezgisel hesabı).

Örnek hesaplama, Nemotron-8B: ($2,99 / 3600) × (1247,8 × 1.000.000 / 46.220.000) = $0,0224/1M token.

Beş model kendi maliyet kademesinde liderdir (hem daha az maliyetli hem de daha yüksek puanlı başka bir satır yoktur): maliyet merdiveninin altında Granite-278m-multilingual, ardından Granite-small-r2, EmbeddingGemma-300m, jina-v5-text-small ve kalite merdiveninin tepesinde Nemotron-8B. Uç noktalar maliyette 13x fark ($0,0017/M ila $0,0224/M) ve 0.23 mutlak nDCG@3 (0.6952 ila 0.9249) gösterir.

Etki alanı uzmanları ile genelciler

PubMedBERT, PubMed başlık-özet çiftleri üzerinde fine-tune edilmiştir ve PubMed üzerinde tıbbi RAG alımı için bariz “doğru araçtır”. Aynı derlemdeki BM25 sözcüksel taban çizgisinin (0.7862) altında kalarak MedRAG'da nDCG@3 = 0.7084 puan alır. Modern açık kaynak genelciler, eğitim verisi etki alanında onu 0.22 ila 0.25 mutlak puan farkla geride bırakır:

Uzman modelin düşük performansının nedeni yaşı ve tarifidir. PubMedBERT, simetrik ortalama pooling'e sahip ve talimat öneki olmayan 2022 tarihli 110M parametreli bir BERT'tir. 2024-2026 genelcileri daha büyük omurgalar, asimetrik sorgu ve doküman önekleri ve talimatla eğitilmiş alım hedefleri üzerine inşa edilmiştir. Mimari fark, etki alanı eşleşmesinden daha önemlidir: 4 yıllık bir fine-tune, kendi eğitim derleminde bile mevcut nesil talimatla eğitilmiş bir alıcıya yetişemez.

Satın alan için kural, bir etki alanı uzmanını temsili sorgularda modern bir genelciyle dağıtıma almadan önce test etmektir. “Uzman kendi etki alanında kazanır” varsayımı, 2026'da açık kaynak embedding modelleri için artık güvenli değildir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Açık kaynak embedding benchmark'ından bulgular

Nemotron-8B'ın TechQA üstünlüğü istatistiksel olarak ikinci sıradan ayrışmıştır

Nemotron-8B AVG nDCG@3 = 0.9249. Etki alanına göre CUAD'da 0.8602, TechQA'da 0.9515 ve MedRAG'da 0.9629 değerini alır. TechQA sonucu (0.9515 0.923, 0.977) ikinci sıradaki SFR-Embedding-2_R sonucuyla (0.9109 0.869, 0.949) örtüşmez. Bootstrap güven aralıkları temiz biçimde ayrışır. 8B Llama-3.1 tabanı; sorgu tarafında Instruct: …\nQuery: … öneki ve simetrik doküman tarafı önekiyle alım için talimatla eğitilmiş olup uzun doküman destek iş yüklerinde bir sonraki satıra 0.04 mutlak nDCG@3 üstünlüğü sağlar.

Nemotron'un doğrudan kazandığı iki etki alanı (TechQA, MedRAG), talimat öneki asimetrisinin en çok önem taşıdığı uzun doküman derlemleridir. CUAD, onun lider olmadığı tek etki alanıdır: Microsoft'un Harrier-oss-v1-0.6b modeli (0.8720), 13x daha küçük olmasına rağmen hukuk sözleşmelerinde Nemotron'u (0.8602) geçer; ancak güven aralıkları örtüşür ve üstünlük bu örneklem boyutunda istatistiksel olarak ayrışmaz.

0.6B Microsoft Harrier modeli, 7B parametrenin altındaki her açık modeli geride bırakır

Microsoft Harrier-oss-v1-0.6b (Qwen3-0.6B tabanı ve MIT lisansıyla 2026-04 tarihinde yayımlanmıştır) AVG nDCG@3 = 0.8911 ile genel dördüncüdür. 12B Tencent KaLM-Gemma3'ü (0.8057, Tencent topluluk lisansı), CUAD'da 7B Salesforce SFR-Embedding-2_R'yi (0.8421 vs Harrier 0.8720) ve Google'ın EmbeddingGemma-300m modelini (0.8706) geride bırakır. Aynı mimari karşılaştırmasında Harrier-0.6b (0.8911), aynı Qwen3-0.6B tabanı üzerine inşa edilen Qwen3-Embedding-0.6B modelinin (0.8168) 0.074 nDCG@3 üzerindedir. Farkı parametre sayısı değil, eğitim derlemi ve talimat tarifi yaratmıştır.

Alıcılar için Harrier, kısıtlama olmaksızın ticari kullanıma uygun bir lisansla sunulan en üst sıradaki açık kaynak satırdır. SFR-2 (CC-BY-NC), Nemotron (NSCL-v1) ve jina-v5 (CC-BY-NC), AVG merdiveninde onu geçer; ancak bu üçü yalnızca araştırma amaçlı veya ticari olmayan lisanslara sahiptir.

Tıbbi bir uzman embedder BM25'e kaybediyor

NeuML'in PubMedBERT-base-embeddings modeli, PubMed başlık-özet çiftleriyle fine-tune edilmiştir. PubMed üzerindeki tıbbi RAG benchmark'ı için bariz “doğru araçtır”. nDCG@3 = 0.7084 MedRAG'da, aynı derlemdeki BM25 sözcüksel taban çizgisinin (0.7862) 0.078 mutlak puan altındadır. MedRAG'daki en iyi açık kaynak genelciler her ikisinin de çok üzerinde yer alır: Nemotron-8B 0.9629, SFR-Embedding-2_R 0.9620, Harrier-oss 0.9605, jina-v5 0.9523, KaLM-Gemma3-12B 0.9453.

Bu, bir alıcının etki alanı uzmanı seçme biçimini değiştirmesi gereken tersleşmedir. PubMedBERT, simetrik ortalama pooling'e sahip ve talimat öneki olmayan 2022 tarihli 110M-parametreli bir BERT'tir. 2024-2026 genelci sahası daha büyük omurgalar, asimetrik sorgu ve doküman önekleri ve talimatla eğitilmiş alım hedefleri üzerine kuruludur. Zaten tıbbi kelime dağarcığı içeren MedRAG sorgularında BM25'in sözcüksel eşleşmesi doğal olarak güçlüdür ve PubMedBERT'in uzmanlaşması bunun üzerine hiçbir şey eklemez.

Pratik sonuç, yalnızca isme bakarak uzman bir embedder seçmemektir. Kendi sorgularınızda taahhüt vermeden önce benchmark edin.

Snowflake Arctic, etki alanları arasında 0.32 nDCG@3 dalgalanır

Snowflake'in snowflake-arctic-embed-l-v2.0 modeli (568M, Apache-2.0, bge-m3-retromae türevi, çok dilli) CUAD hukuk sözleşmelerinde nDCG@3 = 0.5846, MedRAG tıbbi özetlerinde 0.9053 puan alır. Aynı model, aynı tarif, aynı sorgu biçimi, iki etki alanı arasında 0.32 puanlık bir dalgalanma gösterir. Listelenen diğer modeller daha az dalgalanır: SFR-2 0.8421 ile 0.9620 arasında uzanır (fark 0.12), Nemotron 0.8602 ile 0.9629 arasında uzanır (fark 0.10), Harrier 0.8408 ile 0.9605 arasında uzanır (fark 0.12).

Mekanizma eğitim verisi bileşimidir. Arctic, BEIR, MIRACL ve CLEF üzerinde eğitilmiştir; hukuk sözleşmeleri temsil edilmez. Dikey bir alım iş yükü için etki alanı eğitim verisi, parametre sayısından veya bağlam uzunluğundan daha önemlidir.

Açık kaynak embedding inference nasıl çalışır?

Bu benchmark'ta açık kaynak embedding modelleri iki backend'de çalışır: sentence-transformers (12 model) ve vLLM (4 model). Bu ayrım kaliteyle ilgili değildir; sentence-transformers'ın varsayılan Python inference döngüsünün kullanılamayacak kadar yavaş olduğu 8B ve daha büyük modellerde çalışma zamanı verimliliğiyle ilgilidir.

Model başına tarif, backend seçiminden daha önemlidir. Modern alım modelleri asimetrik önekler kullanır: sorgu tarafı Instruct tarzı bir prompt (Instruct: Given a question, retrieve passages...\nQuery: <text>) ile sarılırken doküman tarafı düzdür. Pooling türü değişir: BERT türevi modeller CLS pooling kullanır; LLM türevi modeller (Llama, Mistral, Qwen3, Gemma3 tabanı) son token pooling'i kullanır; çok dilli modeller genellikle ortalama pooling kullanır. Her modelin HuggingFace kartı, hangi önek ve pooling kombinasyonunun doğru olduğunun referansıdır.

Backend katmanı:

  • vLLM: Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small
  • sentence-transformers: Qwen3-0.6B, EmbeddingGemma-300m, Granite trio, SFR-2, Conan-v1, PubMedBERT, GIST, Snowflake Arctic, Microsoft Harrier

Gözlemlenen asimetrik önek desenleri:

  • Instruct + Sorgu/Doküman: SFR-2, KaLM-Gemma3, Nemotron-8B, Qwen3-Embedding
  • Yerleşik encode_query / encode_document: EmbeddingGemma, KaLM-Gemma3, Nemotron-8B
  • task / prompt_name (sentence-transformers parametresi): jina-v5, Snowflake Arctic, Harrier
  • Önek yok (simetrik): Granite trio, Conan, PubMedBERT, GIST

Taban mimarisine göre pooling türü:

  • CLS pooling: Granite r2 trio, Snowflake Arctic
  • Son token pooling: Nemotron, KaLM-Gemma3, SFR-2, jina-v5, Qwen3-Embedding, Harrier
  • Ortalama pooling: EmbeddingGemma, Granite-multilingual, Conan, PubMedBERT, GIST

Yanlış tarif, çökme olmadan alım kalitesini sessizce düşürür. Açık kaynak embedder'ların herhangi bir benchmark'ı, bir akıl sağlığı tabanını içermelidir (herhangi bir modelde tüm etki alanlarında Recall@10 değerinin 0.5 altında olması bir sonuç değil, yanlış yapılandırma işaretidir).

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Açık kaynak embedding modelleri benchmark metodolojisi

Üç alım etki alanı değerlendirildi: CUAD hukuk sözleşmeleri (246 sorgu, 509 sözleşme), TechQA müşteri destek teknik notları (151 sorgu, 28000 IBM teknik notu), MedRAG-PubMed sağlık özetleri (154 sorgu, 50000 özet). Toplam 551 sorgu.

Veri seti oluşturma metodolojisi, daha önceki İngilizce embedding modelleri benchmark'ı ile ortaktır: Protocol-A 3-LLM fikir birliği sorgu üretimi (dönüşümlü yazar havuzu, sabit puanlayıcı, deneme başına yazar olmayan iki doğrulayıcı), SHA-256 karması ile derlem sabitleme, BM25 sözcüksel kısayollarını önlemek için etki alanı bazlı varlık yasaklı token beyaz listeleri, doğrulayıcı çifti başına raporlanan Cohen’s κ değerlendiriciler arası uyumu, her sorgu JSON'unda zaten mevcut olan bm25_rank_at_target alanından sentezlenen BM25 taban çizgisi sıralamaları (Pyserini eşdeğeri). Birincil metrik nDCG@3 (RAG-gerçekçi; üretim RAG sistemlerinin tükettiği); ikincil metrikler nDCG@10, Recall@10, Recall@100, MRR@10, Top-1 isabet.

Açık kaynağa özgü özellikler:

  • GPU: 1 x NVIDIA H100 80GB SXM5, RunPod topluluk bulutu üzerinden
  • Pod şablonu: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • Stack: PyTorch 2.10.0+cu128, vLLM 0.19.1, transformers 5.6.2, sentence-transformers 5.4.1
  • Model başına dağıtım: HF model kartı birincil yolu. 12 model için ST; Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small için vLLM.
  • Model başına parçalama: token başına max_seq_length x 4 karakterde karakter düzeyinde kesme, ardından modelin tokenizer'ı gerçek maksimum dizi uzunluğuna keser.
  • Asimetrik alım: destekleyen her model, HF kartında belgelenen sorgu ve doküman önekini alır. Bazıları için belgelenen varsayılan önek yoktur.
  • L2 normalizasyonu: pooling sonrası tek tip uygulanır. Bazı modeller bunu dahili olarak yapar. Liste genelinde eşitlik sağlamak için yeniden normalize ediyoruz.
  • Embedding önbellek anahtarı: prefix + task + prompt_name + max_seq + backend içerir; böylece çalışma ortasında prefix değişimi sessizce bayat embedding'leri yükleyemez.
  • İstatistik protokolü: her (model, etki alanı, metrik) hücresi için 10K bootstrap yeniden örneklemesi, yüzdelik %95 güven aralığı, seed=2026.

Test edilen modeller

AVG nDCG@3 sırasına göre sıralanmıştır. Backend sütunu: ST = sentence-transformers, vLLM = vLLM 0.19.

Bootstrap %95 güven aralıkları sonuçları

Yukarıdaki tam liderlik tablosu her (model, etki alanı) hücresi için tek çalıştırmadır. Oturumlar arası model başlatma varyansı ölçülmemiştir. Çalışma içi sorgu düzeyi varyansını yakalamak için her (model, etki alanı) hücresine ait sorgu başına sıra vektörünü 10.000 kez değiştirerek yeniden örnekliyoruz (yüzdelik yöntem, seed=2026; örneklem boyutları CUAD n=246, TechQA n=151, MedRAG n=154). nDCG@3 üzerinde etki alanı başına bootstrap %95 güven aralığı:

GA'lar, verilerin hangi tersleşmeleri desteklediğini değiştirir. CUAD'da Harrier (0.8720, [0.836, 0.906]) ve Nemotron (0.8602, [0.821, 0.897]) örtüşür; bu nedenle Harrier'in CUAD üstünlüğü bu örneklem boyutunda temiz biçimde ayrışmaz. TechQA'da Nemotron (0.9515, [0.923, 0.977]) ve SFR-2 (0.9109, [0.869, 0.949]) örtüşmez; bu nedenle Nemotron'un TechQA üstünlüğü istatistiksel olarak ayrışmıştır. MedRAG'da ilk dört (Nemotron 0.9629, SFR-2 0.9620, Harrier 0.9605, jina-v5 0.9523) birbirlerinin GA'ları içindedir ve dört yönlü istatistiksel eşitlik oluşturur. MedRAG'daki PubMedBERT'in BM25'in altında kalma tersleşmesi (0.7084 [0.641, 0.772] vs BM25 0.7862) örtüşme sınırındadır. Merkezi eğilim açıkça uzmanı BM25'in altına koyar; ancak bunu örtüşme değil ayrışma olarak çözmek için 3 çalıştırmalı oturumlar arası geçiş gerekir.

Sınırlamalar

Her (model, etki alanı) hücresi için tek çalıştırma. Yukarıdaki bootstrap GA tablosu, çalışma içi sorgu düzeyi varyansını yakalar (10K yeniden örnekleme, yüzdelik yöntem, seed=2026); ancak oturumlar arası model başlatma varyansı ölçülmemiştir. v2.1 için 3 çalıştırmalı gece yarısı geçişi planlanmıştır. GA tablosunun ortaya çıkardığı daha yakın eşitlikler (ör. tepedeki dört yönlü MedRAG eşitliği, Harrier-Nemotron CUAD örtüşmesi, PubMedBERT-BM25 marjinal tersleşmesi) çoklu çalıştırma geçişinden en çok faydalanacaktır.

Model başına bağlam uzunluğu karıştırıcı etkisi. 512 token bağlam penceresine sahip modeller (Granite-278m-multilingual, PubMedBERT, Conan, GIST) her dokümanın yalnızca ilk ~2K karakterini görür. 8K veya 32K bağlama sahip modeller (Nemotron, KaLM-12B, jina-v5, Harrier, Granite r2 english) dokümanın tamamını görür. Bu, TechQA (uzun teknik notları) ve MedRAG (uzun özetler) üzerinde uzun bağlamlı modelleri kayırır.

MedRAG eğitim verisi kontaminasyon riski. Değerlendirilen modellerin birkaçı PubMed türevi verilerle eğitilmiştir (PubMedBERT tanım gereği, muhtemelen Granite-278m-multilingual, muhtemelen Qwen3 tabanı). Bazı MedRAG nDCG@3 artışları, alım kalitesinden çok eğitim verisi örtüşmesini yansıtabilir.

Conan-v1 Çince eğitilmiştir. Onu yalnızca İngilizce etki alanlarına dahil etmek, İngilizce alım kalitesi üzerine adil bir birebir karşılaştırmadan çok dil uyumsuzluğuna dair öğretici bir veri noktasıdır. İngilizce ile eğitilmiş benzerlerine kıyasla düşük performans bekliyoruz ve veriler de bunu gösteriyor.

Sonuç

NVIDIA Llama-Embed-Nemotron-8B, istatistiksel olarak ayrışmış TechQA ve MedRAG galibiyetleriyle AVG nDCG@3 = 0.9249 ile liderdir. Kısıtlamasız bir lisans (MIT) altındaki en üst sıradaki açık kaynak seçenek ise AVG 0.8911 ile Microsoft Harrier-oss-v1-0.6b modelidir. Google EmbeddingGemma-300m, küçük bir doğruluk kaybı karşılığında kabaca 4x daha düşük maliyetle çalışır.

İleri okuma

Aşağıdakiler gibi diğer RAG benchmark'larını keşfedin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Açık Kaynak Embedding Modelleri Benchmark'ı RAG için". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Ağustos 2026, kaynak: https://aimultiple.com/open-source-embedding-models [Çevrimiçi Kaynak]

Sarı, E. (2026, 10 Ağustos). Açık Kaynak Embedding Modelleri Benchmark'ı RAG için. AIMultiple. https://aimultiple.com/open-source-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Açık Kaynak Embedding Modelleri Benchmark'ı RAG için}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/open-source-embedding-models}},
  note   = {AIMultiple. Erişim tarihi: 10 Ağustos 2026}
}
Tüm verileri indir

44 veri noktasının sonuçları ve zaman damgaları. Bu makaledeki grafik ve tablolarda gösterilen özet verileri, 3 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 19 Eylül 2026
İndir

Arkasındaki ayrıntılı veriyi ister misiniz? Premium'a katılın

Değişiklik günlüğü

4 güncelleme
  1. 16 modelli Amazon yorumları Top-K karşılaştırması, 14 modelli CUAD, TechQA ve MedRAG nDCG@3 ve maliyet karşılaştırmasıyla değiştirildi.

  2. Açık kaynak gömme modelleri karşılaştırmasına Lisans ve ticari kullanım eklendi.

  3. Kıyaslama, beş ek açık kaynak modelini içerecek şekilde genişletildi.

  4. Değerlendirme kurulumundaki donanım, toplu iş boyutu ve hassasiyet güncellendi.

Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Bilimcidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450