Tek bir H100 üzerinde self-hosted olarak çalıştırılan 14 açık kaynak embedding modelini, hukuk sözleşmeleri, müşteri destek teknik notları ve tıbbi özetleri kapsayan 500'den fazla elle seçilmiş erişim sorgusu üzerinde karşılaştırdık. NVIDIA Llama-Embed-Nemotron-8B doğrulukta lider. Maliyet açısından, Google'ın EmbeddingGemma-300m modeli, küçük bir doğruluk kaybı karşılığında Nemotron'dan yaklaşık 4x daha ucuz çalışıyor.
Açık kaynak embedding model karşılaştırma sonuçları
Metriklerin açıklaması
nDCG@3: Kesme noktası 3'te normalize edilmiş indirimli kümülatif kazanç. Sorgu başına bir ilgili doküman ile, altın doküman ilk 3'e girdiğinde 1 / log2(sıra + 1), aksi takdirde 0'dır. Sıra 1 1.000 puan alır, sıra 2 0.631 puan alır ve sıra 3 0.500 puan alır. Üretim RAG pipeline'ları en iyi 3 ila 5 parçayı LLM'e beslediği ve öncelik yanlılığı sıra 1'i orantısız şekilde önemli kıldığı için birincil metrik olarak nDCG@3'ü kullanıyoruz.
nDCG@10: Kesme noktası 10 ile aynı formül.
Recall@10: Altın dokümanın ilk 10'da yer aldığı sorguların oranı.
MRR@10: Kesme noktası 10'da ortalama karşılıklı sıra. Altın doküman sıra 1'de 1.000 puan, sıra 2'de 0.500 puan ve sıra 10'da 0.100 puan alır. nDCG@3 ile benzer amaçlıdır ancak daha dik bir sıra cezası vardır.
Top-1 isabet: Altın ilgili dokümanın tek en iyi sonuç olduğu sorguların oranı. En katı metriktir ve LLM içermeyen bir arama iş akışına en yakın olanıdır.
Alana göre nDCG@3 sonuçları
Ortalama sıralama alan tersine dönmelerini gizler. Harrier CUAD'da birinci ancak TechQA'da yedinci sırada. SFR-2 TechQA'da ikinci ancak CUAD'da yalnızca dördüncü. KaLM-12B MedRAG'da beşinci ve TechQA'da dokuzuncu. Alana göre nDCG@3:
BM25 MedRAG'da rekabetçi (0.7862, PubMedBERT'i ve çok dilli Granite'i geride bırakıyor) ve CUAD'da zayıf (0.5844, 14 yoğun modelin 11'i onu geride bırakıyor). Hukuk sözleşmeleri, sözcüksel eşleşmeyi ödüllendiren yoğun varlık dili içerir. Tıbbi özetlerde, en iyi yoğun modeller (Nemotron 0.9629, SFR-2 0.9620, jina-v5 0.9523) BM25'i 0.17 ila 0.18 mutlak nDCG@3 puanı kadar geride bırakır.
En üstte dört yönlü bir MedRAG beraberliği ve nokta tahmini sıralamasının düzleştirdiği Harrier-Nemotron CUAD örtüşmesi dahil olmak üzere her (model, alan) hücresi için bootstrap %95 güven aralıkları karşılaştırma metodolojisi bölümünde raporlanmıştır.
Milyon token başına maliyet
Self-hosted maliyet GPU amortismanlıdır: saatlik ücret, saat başına işlenen token sayısına bölünür. Kullandığımız pod, $2.99/saat ücretle bir RunPod topluluk bulutu H100 80GB SXM5 idi. 551 sorguluk, 3 korpuslu geçişte (toplam ~46.2M token) model başına duvar saati süresi aşağıdaki $/1M token tahminlerini verir:
Formül:
GPU $/saat = $2.99 (kullandığımız pod'un RunPod topluluk H100 80GB SXM5 ücreti). wall_seconds = her modelin 551 sorguluk, 3 korpuslu geçişteki toplam duvar saati süresi. total_tokens ≈ 46.22M (3 korpus + 551 sorgunun toplamı, karakter sayısı ÷ 4 sezgisel yöntemi).
Çalışılmış örnek, Nemotron-8B: ($2.99 / 3600) × (1247.8 × 1,000,000 / 46,220,000) = $0.0224 / 1M token.
Beş model kendi maliyet kademelerinde liderdir (hem daha ucuz hem de daha yüksek puan alan başka bir satır yoktur): maliyet merdiveninin en altında Granite-278m-multilingual, ardından Granite-small-r2, EmbeddingGemma-300m, jina-v5-text-small ve kalite merdiveninin en üstünde Nemotron-8B. Uç noktalar maliyette 13x ($0.0017/M ila $0.0224/M) ve 0.23 mutlak nDCG@3 (0.6952 ila 0.9249) aralığındadır.
Alan uzmanları ve genelciler
PubMed başlık-özet çiftleri üzerinde fine-tune edilmiş PubMedBERT, PubMed üzerinde tıbbi RAG erişimi için bariz "doğru araç"tır. MedRAG'da nDCG@3 = 0.7084 puan alır, bu da aynı korpusta BM25 sözcüksel taban çizgisinin (0.7862) altındadır. Modern açık kaynak genelciler, onun eğitim verisi alanında onu 0.22 ila 0.25 mutlak puan kadar geride bırakır:
Uzmanın düşük performans göstermesinin nedeni yaş ve reçetedir. PubMedBERT, simetrik ortalama pooling ve talimat öneki olmayan 2022 yapımı 110M parametreli bir BERT'tir. 2024-2026 genelcileri daha büyük omurgalar, asimetrik sorgu ve doküman önekleri ve talimatla ayarlanmış erişim hedefleri üzerine inşa edilmiştir. Mimari fark, alan eşleşmesinden daha önemlidir: 4 yıllık bir fine-tune, fine-tune'un kendi eğitim korpusunda bile mevcut nesil talimatla ayarlanmış bir erişimciye ayak uyduramaz.
Alıcı kuralı, dağıtımdan önce bir alan uzmanını temsili sorgular üzerinde modern bir genelciye karşı test etmektir. "Uzman kendi alanında kazanır" varsayımı, 2026'da açık kaynak embedding modelleri için artık güvenli değildir.
Açık kaynak embedding karşılaştırmasından bulgular
Nemotron-8B'in TechQA liderliği ikinci sıradan istatistiksel olarak ayrışmıştır
Nemotron-8B ORT nDCG@3 = 0.9249. Alan bazında CUAD'da 0.8602, TechQA'da 0.9515 ve MedRAG'da 0.9629 elde eder. TechQA sonucu (0.9515 0.923, 0.977) ikinci sıradaki SFR-Embedding-2_R (0.9109 0.869, 0.949) ile örtüşmez. Bootstrap GA'lar temiz bir şekilde ayrışır. Sorgu tarafında Instruct: …\nQuery: … öneki ve simetrik bir doküman tarafı öneki ile erişim için talimatla ayarlanmış 8B Llama-3.1 tabanı, uzun doküman destek iş yüklerinde bir sonraki satıra karşı 0.04 mutlak nDCG@3 liderliği sağlar.
Nemotron'un açıkça kazandığı iki alan (TechQA, MedRAG), talimat öneki asimetrisinin en önemli olduğu uzun doküman korpuslarıdır. CUAD, lider olmadığı tek alandır: Microsoft'un Harrier-oss-v1-0.6b modeli (0.8720), 13x daha küçük olmasına rağmen hukuk sözleşmelerinde Nemotron'u (0.8602) geride bırakır, ancak GA'lar örtüşür ve bu örneklem büyüklüğünde liderlik istatistiksel olarak ayrışmaz.
0.6B parametreli bir Microsoft Harrier modeli, 7B parametre altındaki her açık modeli geride bırakıyor
Microsoft Harrier-oss-v1-0.6b (2026-04'te Qwen3-0.6B tabanı ve MIT lisansı ile yayınlandı) ORT nDCG@3 = 0.8911 ile genel olarak dördüncü sırada yer alır. 12B parametreli Tencent KaLM-Gemma3'ü (0.8057, Tencent topluluk lisansı), CUAD'da 7B parametreli Salesforce SFR-Embedding-2_R'ı (0.8421 vs Harrier 0.8720) ve Google'ın EmbeddingGemma-300m modelini (0.8706) geride bırakır. Aynı mimari karşılaştırmasında, Harrier-0.6b (0.8911), aynı Qwen3-0.6B tabanı üzerine inşa edilmiş Qwen3-Embedding-0.6B'nin (0.8168) 0.074 nDCG@3 üzerinde yer alır. Farkı yaratan parametre sayısı değil, eğitim korpusu ve talimat reçetesidir.
Alıcılar için Harrier, kısıtlama olmaksızın ticari kullanıma uygun bir lisansla sunulan en üst sıradaki açık kaynak satırdır. SFR-2 (CC-BY-NC), Nemotron (NSCL-v1) ve jina-v5 (CC-BY-NC) ORT merdiveninde onu geride bırakır, ancak üçü de yalnızca araştırma veya ticari olmayan kullanım içindir.
Tıbbi uzman bir embedder BM25'e kaybediyor
NeuML'nin PubMedBERT-base-embeddings modeli PubMed başlık-özet çiftleri üzerinde fine-tune edilmiştir. PubMed üzerinde bir tıbbi RAG karşılaştırması için bariz "doğru araç"tır. MedRAG'da nDCG@3 = 0.7084 puan alır, bu da aynı korpusta BM25 sözcüksel taban çizgisinin (0.7862) 0.078 mutlak altındadır. MedRAG'da en iyi açık kaynak genelciler her ikisinin de çok üzerindedir: Nemotron-8B 0.9629, SFR-Embedding-2_R 0.9620, Harrier-oss 0.9605, jina-v5 0.9523, KaLM-Gemma3-12B 0.9453.
Bu, bir alıcının alan uzmanı seçme şeklini değiştirmesi gereken tersine dönmedir. PubMedBERT, simetrik ortalama pooling ve talimat öneki olmayan 2022 yapımı 110M parametreli bir BERT'tir. 2024-2026 genelci alanı daha büyük omurgalar, asimetrik sorgu ve doküman önekleri ve talimatla ayarlanmış erişim hedefleri üzerine inşa edilmiştir. Halihazırda tıbbi kelime dağarcığı içeren MedRAG sorgularında, BM25'in sözcüksel eşleşmesi doğal olarak güçlüdür ve PubMedBERT'in uzmanlaşması bunun üzerine hiçbir şey eklemez.
Pratik sonuç, yalnızca isme göre bir uzman embedder seçmemektir. Karar vermeden önce kendi sorgularınız üzerinde test edin.
Snowflake Arctic alanlar arasında 0.32 nDCG@3 sapma gösteriyor
Snowflake'in snowflake-arctic-embed-l-v2.0 modeli (568M, Apache-2.0, bge-m3-retromae türevi, çok dilli) CUAD hukuk sözleşmelerinde nDCG@3 = 0.5846 ve MedRAG tıbbi özetlerinde 0.9053 puan alır. Aynı model, aynı reçete, aynı sorgu formatı, iki alan arasında 0.32 puanlık bir sapma. Listedeki diğer modeller daha az sapar: SFR-2 0.8421 ila 0.9620 (fark 0.12), Nemotron 0.8602 ila 0.9629 (fark 0.10), Harrier 0.8408 ila 0.9605 (fark 0.12).
Mekanizma eğitim verisi bileşimidir. Arctic, BEIR, MIRACL ve CLEF üzerinde ayarlanmıştır; hukuk sözleşmeleri temsil edilmemiştir. Dikey bir erişim iş yükü için, alan eğitim verisi parametre sayısından veya bağlam uzunluğundan daha önemlidir.
Açık kaynak embedding çıkarımı nasıl çalışır
Açık kaynak embedding modelleri bu karşılaştırmada iki arkayüzde çalışır: sentence-transformers (12 model) ve vLLM (4 model). Ayrım kaliteyle ilgili değildir; sentence-transformers'ın varsayılan Python çıkarım döngüsünün uygulanabilir olamayacak kadar yavaş olduğu 8B ve daha büyük modellerde çalışma zamanı verimliliği ile ilgilidir.
Model başına reçete, arkayüz seçiminden daha önemlidir. Modern erişim modelleri asimetrik önekler kullanır: sorgu tarafı Instruct tarzı bir prompt'a sarılır (Instruct: Given a question, retrieve passages...\nQuery: <text>) iken doküman tarafı düzdür. Pooling türü değişir: BERT türevi modeller CLS pooling kullanır; LLM türevi modeller (Llama, Mistral, Qwen3, Gemma3 tabanı) son token pooling kullanır; çok dilli modeller genellikle ortalama pooling kullanır. Her modelin HuggingFace kartı, hangi önek ve pooling kombinasyonunun doğru olduğu konusunda doğruluk kaynağıdır.
Arkayüz kademesi:
- vLLM: Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small
- sentence-transformers: Qwen3-0.6B, EmbeddingGemma-300m, Granite üçlüsü, SFR-2, Conan-v1, PubMedBERT, GIST, Snowflake Arctic, Microsoft Harrier
Gözlemlenen asimetrik önek desenleri:
- Instruct + Sorgu/Doküman: SFR-2, KaLM-Gemma3, Nemotron-8B, Qwen3-Embedding
- Yerleşik encode_query / encode_document: EmbeddingGemma, KaLM-Gemma3, Nemotron-8B
- task / prompt_name (sentence-transformers parametresi): jina-v5, Snowflake Arctic, Harrier
- Önek yok (simetrik): Granite üçlüsü, Conan, PubMedBERT, GIST
Taban mimariye göre pooling türü:
- CLS pooling: Granite r2 üçlüsü, Snowflake Arctic
- Son token pooling: Nemotron, KaLM-Gemma3, SFR-2, jina-v5, Qwen3-Embedding, Harrier
- Ortalama pooling: EmbeddingGemma, Granite-multilingual, Conan, PubMedBERT, GIST
Yanlış reçete kullanmak, çökme olmadan erişim kalitesini sessizce düşürür. Açık kaynak embedder'ların herhangi bir karşılaştırması bir sağlamlık tabanı içermelidir (herhangi bir model için tüm alanlarda Recall@10'un 0.5'in altında olması, bir sonuç değil, bir yanlış yapılandırma için kırmızı bayraktır).
Açık kaynak embedding model karşılaştırma metodolojisi
Üç erişim alanı değerlendirildi: CUAD hukuk sözleşmeleri (246 sorgu, 509 sözleşme), TechQA müşteri destek teknik notları (151 sorgu, 28000 IBM teknik notu), MedRAG-PubMed sağlık özetleri (154 sorgu, 50000 özet). Toplam 551 sorgu.
Veri seti oluşturma metodolojisi, önceki İngilizce embedding modelleri karşılaştırmamızla aynıdır: Protokol-A 3-LLM konsensüs sorgu üretimi (dönen yazar havuzu, sabit puanlayıcı, deneme başına iki yazar olmayan doğrulayıcı), SHA-256 hash ile korpus sabitleme, BM25 sözcüksel kısayollarını önlemek için alan başına varlık yasaklı token beyaz listeleri, doğrulayıcı çifti başına raporlanan Cohen'in κ değerlendiriciler arası uyumu, her sorgu JSON'unda halihazırda mevcut olan bm25_rank_at_target alanından sentezlenen BM25 taban çizgisi sıralamaları (Pyserini eşdeğeri). Birincil metrik nDCG@3 (RAG gerçekçi, üretim RAG sistemlerinin tükettiği şey); ikincil metrikler nDCG@10, Recall@10, Recall@100, MRR@10, Top-1 isabet.
Açık kaynağa özgü özellikler:
- GPU: 1 x NVIDIA H100 80GB SXM5, RunPod topluluk bulutu aracılığıyla
- Pod şablonu:
runpod/pytorch:1.0.2-cu1281-torch280-ubuntu2404
- Yığın: PyTorch 2.10.0+cu128, vLLM 0.19.1, transformers 5.6.2, sentence-transformers 5.4.1
- Model başına dağıtım: HF model kartı birincil yolu. 12 model için ST, Nemotron-8B, KaLM-Gemma3-12B, jina-v5-text-small için vLLM.
- Model başına parçalama: token başına
max_seq_length x 4karakterde karakter düzeyinde kesme, ardından modelin tokenleştiricisi gerçek maksimum dizi uzunluğuna keser.
- Asimetrik erişim: bunu destekleyen her model, HF kartında belgelenen sorgu ve doküman önekini alır. Bazıları için önek olmaması belgelenen varsayılandır.
- L2 normalizasyonu: pooling sonrası tekdüze olarak uygulanır. Bazı modeller bunu dahili olarak yapar. Liste genelinde eşitliği sağlamak için yeniden normalize ediyoruz.
- Embedding önbellek anahtarı: önek + task + prompt_name + max_seq + backend'i içerir, böylece çalışma ortasında bir önek değişikliği sessizce eski embedding'leri yükleyemez.
- İstatistiksel protokol: (model, alan, metrik) hücresi başına 10K bootstrap yeniden örnekleme, yüzdelik %95 GA, seed=2026.
Test edilen modeller
ORT nDCG@3 sıralamasına göre sıralanmıştır. Arkayüz sütunu: ST = sentence-transformers, vLLM = vLLM 0.19.
Bootstrap %95 güven aralıkları sonuçları
Yukarıdaki tam liderlik tablosu (model, alan) hücresi başına tek çalıştırmadır. Oturumlar arası model başlatma varyansı ölçülmemiştir. Çalışma içi sorgu düzeyi varyansı yakalamak için, her (model, alan) hücresi için sorgu başına sıra vektörünü değiştirmeli olarak 10,000 kez yeniden örnekliyoruz (yüzdelik yöntemi, seed=2026, örneklem büyüklükleri CUAD n=246, TechQA n=151, MedRAG n=154). nDCG@3 üzerinde alan başına bootstrap %95 GA:
GA'lar, verilerin hangi tersine dönmeleri desteklediğini değiştirir. CUAD'da, Harrier (0.8720, [0.836, 0.906]) ve Nemotron (0.8602, [0.821, 0.897]) örtüşür, dolayısıyla Harrier'ın CUAD liderliği bu örneklem büyüklüğünde temiz bir şekilde ayrışmaz. TechQA'da, Nemotron (0.9515, [0.923, 0.977]) ve SFR-2 (0.9109, [0.869, 0.949]) örtüşmez, dolayısıyla Nemotron'un TechQA liderliği istatistiksel olarak ayrışmıştır. MedRAG'da, ilk dört (Nemotron 0.9629, SFR-2 0.9620, Harrier 0.9605, jina-v5 0.9523) birbirlerinin GA'ları içindedir ve dört yönlü istatistiksel bir beraberlik oluşturur. MedRAG'da PubMedBERT-BM25-altı tersine dönmesi (0.7084 [0.641, 0.772] vs BM25 0.7862) örtüşme sınırındadır. Merkezi eğilim, uzmanı açıkça BM25'in altına koyar, ancak bunu örtüşen değil ayrışmış olarak çözümlemek için 3 çalıştırmalı oturumlar arası bir geçiş gereklidir.
Kısıtlamalar
(Model, alan) hücresi başına tek çalıştırma. Yukarıdaki bootstrap GA tablosu, çalışma içi sorgu düzeyi varyansı yakalar (10K yeniden örnekleme, yüzdelik yöntemi, seed=2026), ancak oturumlar arası model başlatma varyansı ölçülmemiştir. v2.1 için 3 çalıştırmalı gece yarısı geçişi planlanmaktadır. GA tablosu tarafından ortaya çıkarılan daha yakın beraberlikler (örneğin, en üstte dört yönlü MedRAG beraberliği, Harrier-Nemotron CUAD örtüşmesi, PubMedBERT-BM25 marjinal tersine dönmesi) en çok çoklu çalıştırma geçişinden faydalanacaktır.
Model başına bağlam uzunluğu karıştırıcı etkisi. 512 token bağlam penceresine sahip modeller (Granite-278m-multilingual, PubMedBERT, Conan, GIST) her dokümanın yalnızca ilk ~2K karakterini görür. 8K veya 32K bağlama sahip modeller (Nemotron, KaLM-12B, jina-v5, Harrier, Granite r2 english) dokümanın tamamını görür. Bu, TechQA (uzun teknik notlar) ve MedRAG'da (uzun özetler) uzun bağlamlı modelleri kayırır.
MedRAG eğitim verisi kontaminasyon riski. Değerlendirilen modellerin birkaçı PubMed türevi veriler üzerinde eğitilmiştir (PubMedBERT tanım gereği, muhtemelen Granite-278m-multilingual, muhtemelen Qwen3 tabanı). Bazı MedRAG nDCG@3 artışı, erişim kalitesinden ziyade eğitim verisi örtüşmesini yansıtabilir.
Conan-v1 Çince eğitilmiştir. Onu yalnızca İngilizce alanlara dahil etmek, İngilizce erişim kalitesi üzerine adil bir birebir karşılaştırmadan ziyade dil uyumsuzluğu hakkında öğretici bir veri noktasıdır. İngilizce eğitimli emsallerine kıyasla düşük performans bekliyoruz ve verilerin gösterdiği de budur.
Sonuç
NVIDIA Llama-Embed-Nemotron-8B, istatistiksel olarak ayrışmış TechQA ve MedRAG birincilikleriyle ORT nDCG@3 = 0.9249 ile liderdir. Kısıtlamasız bir lisans (MIT) altında en üst sıradaki açık kaynak seçim, ORT 0.8911 ile Microsoft Harrier-oss-v1-0.6b modelidir. Google EmbeddingGemma-300m, küçük bir doğruluk kaybı karşılığında yaklaşık 4x daha düşük maliyetle çalışır.
İleri okuma
Aşağıdakiler gibi diğer RAG karşılaştırmalarını keşfedin:
- RAG için En İyi 10 Çok Dilli Embedding Modeli
- Embedding Modelleri: OpenAI vs Gemini vs Voyage
- RAG için En İyi Vektör Veritabanı: Qdrant vs Weaviate vs Pinecone
- Reranker Karşılaştırması: En İyi 8 Model Karşılaştırıldı
- Çok Modlu Embedding Modelleri: Apple vs Meta vs OpenAI
- Hibrit RAG: RAG Doğruluğunu Artırma
- Graph RAG vs Vector RAG
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{RAG için Açık Kaynak Embedding Model Karşılaştırması}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/open-source-embedding-models}},
note = {AIMultiple. Erişim tarihi: 3 Temmuz 2026}
}15 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.