Hizmetler
Bize Ulaşın

Açık Kaynak Embedding Models Benchmark RAG için

We benchmarked 14 open-source embedding models, across 500+ manually curated retrieval queries spanning legal contracts, customer support tech notes, and medical abstracts.

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 10 Ağu 2026
Loading Chart

NVIDIA Llama-Embed-Nemotron-8B doğrulukta önde. Maliyete gelince, Google’ın EmbeddingGemma-300m modeli, küçük bir doğruluk kaybı pahasına Nemotron’dan yaklaşık 4x daha ucuz çalışıyor.

Açık kaynak embedding models benchmark sonuçları

Metrikler açıklandı

nDCG@3: Kesme değeri 3 olan normalize edilmiş indirimli kümülatif kazanç. Sorgu başına tek ilgili belge olduğunda, altın belge ilk 3 içine girdiğinde 1 / log2(rank + 1), aksi durumda 0 olur. Sıra 1 1.000 puan alır, sıra 2 0.631 puan alır ve sıra 3 0.500 puan alır. nDCG@3’ü birincil metrik olarak kullanıyoruz çünkü üretim RAG pipeline’ları ilk 3 ila 5 parçayı LLM’e besler ve birincilik yanlılığı, sıra 1’in orantısız şekilde önemli olmasına neden olur.

nDCG@10: Kesme değeri 10 olan aynı formül.

Recall@10: Altın belgenin ilk 10 içinde göründüğü sorguların oranı.

MRR@10: Kesme değeri 10 olan ortalama karşılıklı sıra. Altın belge sıra 1’de 1.000 puan alır, sıra 2’de 0.500 puan alır ve sıra 10’da 0.100 puan alır. Niyet nDCG@3’e benzer ancak daha dik bir sıra cezası vardır.

Top-1 isabet: Altın ilgili belgenin tek en üst sonuç olduğu sorguların oranı. En katı metriktir ve LLM içermeyen bir arama iş akışına en yakın olandır.

Alana göre nDCG@3 sonuçları

AVG sıralaması alan ters dönmelerini gizler. Harrier CUAD’da kazanır ancak TechQA’da yedinci sıraya yerleşir. SFR-2 TechQA’da ikinci sıradır ancak CUAD’da yalnızca dördüncüdür. KaLM-12B MedRAG’da beşinci, TechQA’da dokuzuncudur. Alana göre nDCG@3:

Loading Chart

BM25, MedRAG’da rekabetçidir (0.7862, PubMedBERT’i ve çok dilli Granite’ı geçer) ve CUAD’da zayıftır (0.5844; burada 14 yoğun modelin 11’i onu geride bırakır). Hukuki sözleşmeler, sözcüksel eşleşmeyi ödüllendiren yoğun varlık dili içerir. Tıbbi özetlerde, en iyi yoğun modeller (Nemotron 0.9629, SFR-2 0.9620, jina-v5 0.9523) BM25’i 0.17 ila 0.18 nDCG@3 mutlak puan geride bırakır.

Her (model, alan) hücresi için bootstrap %95 güven aralıkları, en üstte dört yönlü bir MedRAG eşitliği ve nokta tahmini sıralamasının düzleştirdiği bir Harrier-Nemotron CUAD örtüşmesi dahil olmak üzere, benchmark metodolojisi bölümünde raporlanmıştır.

Milyon token başına maliyet

Self-hosted maliyet GPU amorti edilmiş şekildedir: saatlik ücret, saat başına işlenen token sayısına bölünür. Kullandığımız pod, $2,99/saat ücretli bir RunPod topluluk bulutu H100 80GB SXM5 idi. Model başına, 551 sorguluk, 3 korpuslu geçişteki (~toplam 46.2M token) duvar saati süresi aşağıdaki $/1M token tahminlerini verir:

Formül:

GPU $/saat = $2,99 (kullandığımız pod’un RunPod topluluk H100 80GB SXM5 ücreti). wall_seconds = her modelin 551 sorguluk, 3 korpuslu geçişteki toplam duvar saati süresi. total_tokens ≈ 46.22M (3 korpus + 551 sorgu toplamı, karakter sayısı ÷ 4 buluşsal yöntemi).

Çalışılmış örnek, Nemotron-8B: ($2,99 / 3600) × (1247.8 × 1.000.000 / 46.220.000) = $0,0224 / 1M token başına.

Beş model kendi maliyet kademesine liderlik eder (hem daha az maliyetli hem de daha yüksek puanlı başka bir satır yoktur): maliyet merdiveninin dibinde Granite-278m-multilingual, ardından Granite-small-r2, EmbeddingGemma-300m, jina-v5-text-small ve kalite merdiveninin tepesinde Nemotron-8B gelir. Uç noktalar maliyette 13x ($0,0017/M ila $0,0224/M) ve nDCG@3 mutlakta 0.23 (0.6952 ila 0.9249) aralığındadır.

Alan uzmanları ve genelciler

PubMedBERT, PubMed başlık-özet çiftleri üzerinde fine-tune edilmiş, PubMed üzerinde tıbbi RAG retrieval için bariz “doğru araç”tır. Aynı külliyat üzerinde BM25 sözcüksel taban çizgisinin (0.7862) altında kalan MedRAG üzerinde nDCG@3 = 0.7084 puanı alır. Modern açık kaynak genelciler, kendi eğitim verisi alanında onu 0.22 ila 0.25 mutlak puan geride bırakır:

Uzman modelin düşük performans göstermesinin nedeni yaş ve reçetedir. PubMedBERT, simetrik ortalama pooling ve talimat öneki olmayan 2022 tarihli 110M parametreli bir BERT’tir. 2024-2026 genelcileri daha büyük omurgalar, asimetrik sorgu ve belge önekleri ve talimatla fine-tune edilmiş retrieval hedefleri üzerine inşa edilmiştir. Mimari fark, alan eşleşmesinden daha önemlidir: 4 yıllık bir fine-tune, güncel nesil talimatla fine-tune edilmiş bir retriever’a, kendi eğitim külliyatında bile ayak uyduramaz.

Alıcı kuralı, bir alan uzmanını dağıtmadan önce temsili sorgular üzerinde modern bir genelciyle test etmektir. “Uzman kendi alanında kazanır” varsayımı, 2026’da açık kaynak embedding modelleri için artık güvenli değildir.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Açık kaynak embedding benchmark’ından bulgular

Nemotron-8B’in TechQA liderliği istatistiksel olarak ikinci sıradan ayrışmıştır

Nemotron-8B AVG nDCG@3 = 0.9249. Alana göre CUAD’da 0.8602, TechQA’da 0.9515 ve MedRAG’da 0.9629 değerlerine ulaşır. TechQA sonucu (0.9515 0.923, 0.977) ikinci sıradaki SFR-Embedding-2_R (0.9109 0.869, 0.949) ile örtüşmez. Bootstrap CI’ları temiz şekilde ayrışır. 8B Llama-3.1 tabanı, sorgu tarafında Instruct: …\nQuery: … öneki ve simetrik belge tarafı öneki ile retrieval için talimatla fine-tune edilmiş olup, uzun belge destek iş yüklerinde bir sonraki satıra karşı 0.04 mutlak nDCG@3 üstünlüğü sağlar.

Nemotron’un doğrudan kazandığı iki alan (TechQA, MedRAG), talimat öneki asimetrisinin en çok önem taşıdığı uzun belge külliyatlarıdır. CUAD, lider olmadığı tek alandır: Microsoft’un Harrier-oss-v1-0.6b modeli (0.8720), 13x daha küçük olmasına rağmen hukuki sözleşmelerde Nemotron’u (0.8602) geride bırakır; ancak CI’lar örtüşür ve bu örneklem boyutunda üstünlük istatistiksel olarak ayrışmış değildir.

Bir 0.6B Microsoft Harrier modeli, 7B parametrenin altındaki tüm açık modelleri geride bırakır

Microsoft Harrier-oss-v1-0.6b (Qwen3-0.6B tabanı ve MIT lisansıyla 2026-04 tarihinde yayınlandı) AVG nDCG@3 = 0.8911 ile genel olarak dördüncü sıraya yerleşir. 12B Tencent KaLM-Gemma3’ü (0.8057, Tencent topluluk lisansı), CUAD’da 7B Salesforce SFR-Embedding-2_R modelini (0.8421 vs Harrier 0.8720) ve Google’ın EmbeddingGemma-300m modelini (0.8706) geride bırakır. Aynı mimari karşılaştırmasında, Harrier-0.6b (0.8911), aynı Qwen3-0.6B tabanı üzerine kurulu Qwen3-Embedding-0.6B modelinden (0.8168) 0.074 nDCG@3 daha yüksektedir. Farkı yaratan parametre sayısı değil, eğitim külliyatı ve talimat reçetesidir.

Alıcılar için Harrier, kısıtlama olmaksızın ticari kullanıma uygun bir lisansla sunulan en yüksek sıralamalı açık kaynak satırdır. SFR-2 (CC-BY-NC), Nemotron (NSCL-v1) ve jina-v5 (CC-BY-NC) AVG merdiveninde onu geride bırakır, ancak bu üçü yalnızca araştırma amaçlıdır veya ticari değildir.

Tıbbi uzman bir embedder, BM25’e kaybeder

NeuML’nin PubMedBERT-base-embeddings modeli, PubMed başlık-özet çiftleri üzerinde fine-tune edilmiştir. PubMed üzerinde tıbbi bir RAG benchmark’ı için bariz “doğru araç”tır. Aynı külliyat üzerinde BM25 sözcüksel taban çizgisinin (0.7862) 0.078 mutlak altında olan MedRAG üzerinde nDCG@3 = 0.7084 puanı alır. MedRAG’daki en iyi açık kaynak genelciler her ikisinin de çok üzerindedir: Nemotron-8B 0.9629, SFR-Embedding-2_R 0.9620, Harrier-oss 0.9605, jina-v5 0.9523, KaLM-Gemma3-12B 0.9453.

Bu, bir alıcının alan uzmanı seçme şeklini değiştirmesi gereken tersine dönmedir. PubMedBERT, simetrik ortalama pooling ve talimat öneki olmayan 2022 tarihli 110M parametreli bir BERT’tir. 2024-2026 genelci alanı daha büyük omurgalar, asimetrik sorgu ve belge önekleri ve talimatla fine-tune edilmiş retrieval hedefleri üzerine kuruludur. Zaten tıbbi kelime dağarcığı içeren MedRAG sorgularında BM25’in sözcüksel eşleşmesi doğal olarak güçlüdür ve PubMedBERT’in uzmanlaşması bunun üzerine hiçbir şey eklemez.

Pratik sonuç, yalnızca ismine göre bir uzman embedder seçmemektir. Karar vermeden önce kendi sorgularınız üzerinde benchmark edin.

Snowflake Arctic alanlar arasında 0.32 nDCG@3 dalgalanır

Snowflake’in snowflake-arctic-embed-l-v2.0 modeli (568M, Apache-2.0, bge-m3-retromae türevi, çok dilli) CUAD hukuki sözleşmelerinde nDCG@3 = 0.5846 ve MedRAG tıbbi özetlerinde 0.9053 puanı alır. Aynı model, aynı reçete, aynı sorgu formatı, iki alan arasında 0.32 puanlık bir dalgalanma gösterir. Listedeki diğer modeller daha az dalgalanır: SFR-2 0.8421 ile 0.9620 arasında uzanır (fark 0.12), Nemotron 0.8602 ile 0.9629 arasında uzanır (fark 0.10), Harrier 0.8408 ile 0.9605 arasında uzanır (fark 0.12).

Mekanizma, eğitim verisi bileşimidir. Arctic, BEIR, MIRACL ve CLEF üzerinde tune edilmiştir; hukuki sözleşmeler temsil edilmemiştir. Dikey bir retrieval iş yükü için alan eğitim verileri, parametre sayısından veya bağlam uzunluğundan daha önemlidir.

Açık kaynak embedding inference nasıl çalışır

Açık kaynak embedding modelleri bu benchmark’ta iki backend’de çalışır: sentence-transformers (12 model) ve vLLM (4 model). Ayrım kaliteyle ilgili değildir; sentence-transformers’ın varsayılan Python inference döngüsünün kullanışlı olamayacak kadar yavaş olduğu 8B ve daha büyük modellerde çalışma zamanı verimliliğiyle ilgilidir.

Model başına reçete, backend seçiminden daha önemlidir. Modern retrieval modelleri asimetrik önekler kullanır: sorgu tarafı Instruct tarzı bir prompt (Instruct: Given a question, retrieve passages...\nQuery: <text>) ile sarılırken belge tarafı düzdür. Pooling türü değişir: BERT türevi modeller CLS pooling kullanır; LLM türevi modeller (Llama, Mistral, Qwen3, Gemma3 tabanı) son token pooling kullanır; çok dilli modeller genellikle ortalama pooling kullanır. Her model için HuggingFace kartı, hangi önek ve pooling kombinasyonunun doğru olduğu konusunda referans kaynaktır.

Backend kademesi:

  • vLLM: Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small
  • sentence-transformers: Qwen3-0.6B, EmbeddingGemma-300m, Granite üçlüsü, SFR-2, Conan-v1, PubMedBERT, GIST, Snowflake Arctic, Microsoft Harrier

Gözlemlenen asimetrik önek desenleri:

  • Instruct + Query/Document: SFR-2, KaLM-Gemma3, Nemotron-8B, Qwen3-Embedding
  • Yerleşik encode_query / encode_document: EmbeddingGemma, KaLM-Gemma3, Nemotron-8B
  • task / prompt_name (sentence-transformers parametresi): jina-v5, Snowflake Arctic, Harrier
  • Önek yok (simetrik): Granite üçlüsü, Conan, PubMedBERT, GIST

Taban mimarisine göre pooling türü:

  • CLS pooling: Granite r2 üçlüsü, Snowflake Arctic
  • Son token pooling: Nemotron, KaLM-Gemma3, SFR-2, jina-v5, Qwen3-Embedding, Harrier
  • Ortalama pooling: EmbeddingGemma, Granite-multilingual, Conan, PubMedBERT, GIST

Yanlış reçete kullanmak, çökmeden retrieval kalitesini sessizce düşürür. Açık kaynak embedder’lara yönelik herhangi bir benchmark, bir sağlamlık tabanı içermelidir (herhangi bir model için tüm alanlarda Recall@10 değerinin 0.5 altında olması, bir sonuç değil, yanlış yapılandırma için bir kırmızı bayraktır).

Kıyaslamalarımızı ve veri odaklı içgörülerimizi kaçırmayın. Düğme Google'ı açar; AIMultiple'ı seçmeniz, Google arama sonuçlarında AIMultiple'ı daha sık görmek istediğinizi onaylar.
GoogleTercih edilen kaynak olarak ekle

Açık kaynak embedding models benchmark metodolojisi

Üç retrieval alanı değerlendirildi: CUAD hukuki sözleşmeleri (246 sorgu, 509 sözleşme), TechQA müşteri destek teknik notları (151 sorgu, 28000 IBM teknik notu), MedRAG-PubMed sağlık özetleri (154 sorgu, 50000 özet). Toplam 551 sorgu.

Veri seti oluşturma metodolojisi, önceki İngilizce embedding models benchmark çalışmamızla paylaşılır: Protocol-A 3-LLM fikir birliği sorgu üretimi (dönüşümlü yazar havuzu, sabit puanlayıcı, deneme başına yazar olmayan iki doğrulayıcı), SHA-256 hash’i ile külliyat sabitleme, BM25 sözcüksel kısayollarını önlemek için alan başına varlık yasaklı token beyaz listeleri, doğrulayıcı çifti başına raporlanan Cohen κ değerlendiriciler arası uyumu, her sorgu JSON dosyasında zaten mevcut bm25_rank_at_target alanından sentezlenen BM25 taban sıraları (Pyserini eşdeğeri). Birincil metrik nDCG@3 (RAG gerçekçi, üretim RAG sistemlerinin tükettiği); ikincil metrikler nDCG@10, Recall@10, Recall@100, MRR@10, Top-1 isabet.

Açık kaynağa özgü özellikler:

  • GPU: RunPod topluluk bulutu üzerinden 1 x NVIDIA H100 80GB SXM5
  • Pod şablonu: runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
  • Yığın: PyTorch 2.10.0+cu128, vLLM 0.19.1, transformers 5.6.2, sentence-transformers 5.4.1
  • Model başına dağıtım: HF model kartı birincil yol. 12 model için ST, Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small için vLLM.
  • Model başına chunking: token başına max_seq_length x 4 karakterde karakter düzeyinde kesme, ardından modelin tokenizer’ı gerçek maksimum dizi uzunluğuna keser.
  • Asimetrik retrieval: bunu destekleyen her model, HF kartında belgelenen sorgu ve belge önekini alır. Bazıları için belgelenen varsayılan, önek olmamasıdır.
  • L2 normalizasyonu: pooling sonrası tek tip olarak uygulanır. Bazı modeller bunu dahili olarak yapar. Liste genelinde eşitliği sağlamak için yeniden normalize ediyoruz.
  • Embedding cache anahtarı: önek + task + prompt_name + max_seq + backend içerir; böylece çalışma ortasında bir önek değişikliği sessizce eski embedding’leri yükleyemez.
  • İstatistiksel protokol: (model, alan, metrik) hücresi başına 10K bootstrap yeniden örneklemesi, yüzdelik %95 CI, seed=2026.

Test edilen modeller

AVG nDCG@3 sırasına göre sıralanmıştır. Backend sütunu: ST = sentence-transformers, vLLM = vLLM 0.19.

Bootstrap %95 güven aralıkları sonuçları

Yukarıdaki tam liderlik tablosu, her (model, alan) hücresi için tek çalıştırmalıdır. Oturumlar arası model başlatma varyansı ölçülmemiştir. Çalıştırma içi sorgu düzeyindeki varyansı yakalamak için her (model, alan) hücresindeki sorgu başına sıra vektörünü, yerine koymalı olarak 10.000 kez yeniden örnekleriz (yüzdelik yöntem, seed=2026, örneklem boyutları CUAD n=246, TechQA n=151, MedRAG n=154). Alana göre bootstrap %95 CI, nDCG@3 üzerinde:

CI’lar, verilerin desteklediği tersine dönmeleri değiştirir. CUAD’da Harrier (0.8720, [0.836, 0.906]) ve Nemotron (0.8602, [0.821, 0.897]) örtüşür; bu nedenle Harrier’in CUAD üstünlüğü bu örneklem boyutunda temiz şekilde ayrışmaz. TechQA’da Nemotron (0.9515, [0.923, 0.977]) ve SFR-2 (0.9109, [0.869, 0.949]) örtüşmez; bu nedenle Nemotron’un TechQA üstünlüğü istatistiksel olarak ayrışır. MedRAG’da ilk dört (Nemotron 0.9629, SFR-2 0.9620, Harrier 0.9605, jina-v5 0.9523) birbirlerinin CI’ları içindedir ve dört yönlü istatistiksel bir eşitlik oluşturur. MedRAG’daki PubMedBERT-BM25’in altında kalma tersine dönmesi (0.7084 [0.641, 0.772] vs BM25 0.7862) örtüşme sınırındadır. Merkezi eğilim, uzman modeli açıkça BM25’in altına koyar; ancak bunun örtüşme yerine ayrışma olarak çözülmesi için 3 çalıştırmalı oturumlar arası bir geçiş gerekir.

Sınırlamalar

Her (model, alan) hücresinde tek çalıştırma. Yukarıdaki bootstrap CI tablosu, çalıştırma içi sorgu düzeyindeki varyansı yakalar (10K yeniden örnekleme, yüzdelik yöntem, seed=2026), ancak oturumlar arası model başlatma varyansı ölçülmemiştir. v2.1 için 3 çalıştırmalı gece yarısı ötesi geçiş planlanmıştır. CI tablosunun ortaya çıkardığı daha yakın eşitlikler (ör. üstteki dört yönlü MedRAG eşitliği, Harrier-Nemotron CUAD örtüşmesi, PubMedBERT-BM25 marjinal tersine dönmesi) en çok çoklu çalıştırma geçişinden faydalanır.

Model başına bağlam uzunluğu karışıklığı. 512 token bağlam penceresine sahip modeller (Granite-278m-multilingual, PubMedBERT, Conan, GIST) her belgenin yalnızca ilk ~2K karakterini görür. 8K veya 32K bağlama sahip modeller (Nemotron, KaLM-12B, jina-v5, Harrier, Granite r2 english) belgenin tamamını görür. Bu, TechQA (uzun teknik notlar) ve MedRAG (uzun özetler) üzerinde uzun bağlamlı modelleri kayırır.

MedRAG eğitim verisi kontaminasyon riski. Değerlendirilen modellerin birçoğu PubMed türevi verilerle eğitilmiştir (tanım gereği PubMedBERT, muhtemelen Granite-278m-multilingual, muhtemelen Qwen3 tabanı). Bazı MedRAG nDCG@3 artışı, retrieval kalitesinden ziyade eğitim verisi örtüşmesini yansıtabilir.

Conan-v1 Çince eğitilmiştir. Onu yalnızca İngilizce alanlara dahil etmek, İngilizce retrieval kalitesi üzerine adil bir birebir karşılaştırma yerine dil uyumsuzluğuna dair öğretici bir veri noktasıdır. İngilizce eğitilmiş akranlarına kıyasla düşük performans bekliyoruz ve veriler de bunu göstermektedir.

Sonuç

NVIDIA Llama-Embed-Nemotron-8B, istatistiksel olarak ayrışmış TechQA ve MedRAG galibiyetleriyle AVG nDCG@3 = 0.9249 ile öndedir. Kısıtsız bir lisans (MIT) altında en yüksek sıralamalı açık kaynak seçim, AVG 0.8911 ile Microsoft Harrier-oss-v1-0.6b modelidir. Google EmbeddingGemma-300m, küçük bir doğruluk kaybı pahasına yaklaşık 4x daha düşük maliyetle çalışır.

Daha fazla bilgi

Aşağıdaki gibi diğer RAG benchmark’larını keşfedin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "Açık Kaynak Embedding Models Benchmark RAG için". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 10 Ağustos 2026, kaynak: https://aimultiple.com/open-source-embedding-models [Çevrimiçi Kaynak]

Sarı, E. (2026, 10 Ağustos). Açık Kaynak Embedding Models Benchmark RAG için. AIMultiple. https://aimultiple.com/open-source-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Açık Kaynak Embedding Models Benchmark RAG için}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/open-source-embedding-models}},
  note   = {AIMultiple. Erişim tarihi: 10 Ağustos 2026}
}
Tüm verileri indir

44 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 3 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 17 Ağustos 2026
İndir
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da bir Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı benchmark'lar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450