15 İngilizce metin embedding model'ini ve bir BM25 taban çizgisini, üç erişim alanında 500'den fazla elle derlenmiş sorgu üzerinde benchmark ettik: hukuk sözleşmeleri (CUAD), müşteri desteği (IBM TechQA) ve sağlık (MedRAG PubMed).
Voyage-3.5 genel olarak birinci sırada yer alıyor. Perplexity Embed V1 0.6b, benchmark'ımızdaki en düşük fiyat noktasında üst-orta seviyeye ulaşıyor.
Embedding model'leri benchmark sonuçları
Metrikler açıklandı
nDCG@3: Kesme değeri 3'te normalize edilmiş iskontolu kümülatif kazanç. Sorgu başına tek ilgili belge varken, altın belge ilk 3'te yer aldığında 1 / log2(sıra + 1), aksi takdirde 0'dır. Sıra 1 1.000 puan alır, sıra 2 0.631 puan alır, sıra 3 0.500 puan alır. nDCG@3'ü birincil metrik olarak kullanıyoruz çünkü üretim RAG pipeline'ları ilk 3 ila 5 parçayı LLM'e besler ve öncelik yanlılığı sıra 1'i orantısız biçimde önemli kılar.
nDCG@10: Aynı formül, kesme değeri 10.
Recall@10: Altın belgenin ilk 10'da göründüğü sorguların oranı.
MRR@10: Kesme değeri 10'da ortalama karşılıklı sıra. Sıra 1'deki altın 1.000 puan alır, sıra 2 0.500 puan alır ve sıra 10 0.100 puan alır. Amacı nDCG@3'e benzer ancak sıra cezası daha diktir.
Top-1 hit: Altın ilgili belgenin tek başına ilk sonuç olduğu sorguların oranı. En katı metriktir ve LLM içermeyen bir arama iş akışına en yakın olanıdır.
Alana göre nDCG@3
Hukuk (CUAD, 246 sorgu, 509 sözleşme): Hukuk, uzman voyage-law-2'nin kazandığı tek alandır; CUAD'a göre ayarlanmış eğitim verisi, voyage-4-large'a kıyasla +0.040 nDCG@3 getirir. openai/text-embedding-3-large 11. sıradadır ve 0.6430 ile altı daha ucuz modelin altındadır. BM25 tabanı: 0.5844.
Müşteri desteği (TechQA, 151 sorgu, 28.000 IBM teknik notu): voyage-4-lite ile sonraki model arasındaki fark 0.018'dir. gemini-embedding-001, TechQA'da daha yeni kardeşinin 0.045 gerisinde kalarak 7. sıraya düşer (0.8856), ancak diğer iki alanı kazanır. BM25 tabanı: 0.6097.
Sağlık (MedRAG-PubMed, 154 sorgu, 50.000 özet): Sağlık, benchmark'ımızdaki en sıkı kümedir (14 model 0.88 üzerinde puan alır) çünkü tıbbi kelime dağarcığı anahtar kelime yoğunlukludur ve bu da çoğu sorguyu üst kümeye iter. BM25 tabanı: 0.7862, en zayıf yoğun modelin 0.02 yakınındadır. gemini-embedding-001 ayrıca gemini-embedding-2-preview'i burada en geniş farkla (+0.013) geçer.
Alan bazındaki sıralama değişimleri 3 alan ortalamalı çerçeveyi haklı çıkarır: Hiçbir alan "hangi model en iyi" sorusu için adil bir proxy değildir ve tek bir alana göre seçim yapan bir alıcı diğerlerinde yanlış sıralama yapar.
Her alan hücresi için model başına %95 bootstrap güven aralıkları ve nokta tahmini sıralamalarının gizlediği dört ikili eşitlik, metodoloji bölümünde ayrıntılı olarak açıklanmıştır.
Doğruluk ve fiyat: 1M token başına maliyet
Metrikler açıklandı
1M girdi token başına fiyat, 2026-04-23 itibarıyla 1M girdi token'ını gömmek için liste fiyatıdır. Voyage fiyatları Voyage doğrudan fiyatlandırma sayfasından alınmıştır. OpenRouter üzerinden sunulan modeller aynı güne ait OpenRouter katalog anlık görüntüsünü kullanır. Test edilen her sağlayıcıda sorgu ve belge token'ları aynı ücretle fiyatlandırılır. BM25, log ekseninde gösterim için $0,001/M olarak çizilir. Gerçek kendi kendine barındırma maliyeti $0'dır.
3 alan ortalaması nDCG@3, üç külliyat üzerindeki alan başına nDCG@3 değerlerinin ağırlıksız ortalamasıdır. Her alan, sorgu sayısından bağımsız olarak ortalamaya eşit katkı yapar.
- Maliyet öncelikli RAG platformları için pplx-embed-v1-0.6b açık seçimdir. $0,004/M ile ticari amiral gemilerinin herhangi birinden 30-50x daha ucuzdur ve voyage-3.5’in kalitesinin %92'sini sunar (0.8604 / 0.9429). Benchmark'ımızdaki hiçbir diğer model bu fiyat noktasında rekabet edemez.
- Kalite öncelikli kurumsal RAG için, Voyage doğrudan SDK üzerinden voyage-3.5 en üst Pareto noktasını alır. Yalnızca OpenRouter içeren bir yığına kıyasla fazladan bir API entegrasyonu karşılığında, Voyage'ın kendi amiral gemisinden yarı fiyata marjinal olarak daha iyi bir model elde edersiniz. Voyage kataloğunda “her zaman en yeni ve en büyüğü seç” içgüdüsü yanlıştır.
- OSS / kendi kendine barındırılabilir / şirket içi dağıtımlar için qwen3-embedding-8b kazanır. Benchmark'ımızdaki $0,010/M ile en ucuz önemsiz olmayan embedder'dır, test ettiğimiz diğer tüm OSS encoder ailelerine eşit veya üstündür ve kendi kendine barındırılabilir ağırlıklarla birlikte gelir.
- Premium amiral gemileri (openai-3-large, gemini-2-preview, voyage-4-large, gemini-001) 3 alan ortalamasında voyage-3.5'e kaybeder, üstelik voyage-3.5 bunların herhangi birinden 2-3x daha ucuzdur.
Embedding benchmark'ından önemli bulgular
voyage-3.5 3 alan ortalamasını kazanır ve voyage-4-large amiral gemisini yarı fiyata geçer
voyage-3.5 hukuk, müşteri desteği ve sağlık alanlarında ortalama 0.9429 nDCG@3 elde eder. Amiral gemisi voyage-4-large, 1M token başına $0,12 ile ortalama 0.9416 alır; bu, voyage-3.5'in $0,06 fiyatının 2x katıdır. Amiral gemisi TechQA'yı 0.002 farkla kazanır ve MedRAG'ı 0.032 farkla kazanır. CUAD'ı 0.037 farkla kaybeder (0.8730 vs 0.9102), bu da 3 alan ortalamasını voyage-3.5'in altına iter. Voyage ürün gamında, eski orta seviye model daha iyi genel amaçlı seçimdir. Amiral gemisi yalnızca sağlıkta primini hak eder.
Voyage her üç alanda en üst sırayı aldı ve CUAD ile TechQA'da ilk 2'yi süpürdü. MedRAG'da gemini-embedding-001, voyage-4-large'ın 0.9855'inin ardından 0.9814 ile 2. sıraya girerek diğer tüm Voyage modellerinin önüne geçti. gemini-001 ayrıca CUAD'da üçüncü sıraya ulaşır. Voyage dışı hiçbir model tek bir alanda ilk 2'ye giremez.
Eski bir Gemini modeli, üç alanın ikisinde daha yeni “preview” kardeşini geçiyor
google/gemini-embedding-001 (Haziran 2025'te yayımlandı) hem CUAD (0.8980 vs 0.8958) hem de MedRAG (0.9814 vs 0.9685) üzerinde google/gemini-embedding-2-preview'den daha iyi performans gösterir. Daha yeni model yalnızca TechQA'yı kazanır (0.9301 vs 0.8856); bu 0.04'lük fark, 1M girdi token'ı başına $0,15'ten $0,20'ye %33 fiyat artışıyla birlikte gelir. Gemini 2'nin “daha yeni çok modlu yükseltme” çerçevesi, hukuk veya sağlık külliyatlarında İngilizce metin erişiminde geçerli değildir.
Bugün bu iki alandaki RAG iş yükleri için doğru Gemini seçimi gemini-embedding-001'dir. MedRAG'daki sıralama değişimi (001 2. sırada, 2-preview 3. sırada) “en yeni” modele yönelen bir alıcının ölçülebilir kalite kaybedeceği kadar büyüktür.
OpenAI text-embedding-3-large hukuk ve müşteri desteğinde orta seviyededir
openai/text-embedding-3-large, CUAD'da 0.6430 nDCG@3 ile 15 yoğun model arasında 11. sıradadır. Hukuk sözleşmelerinde kesinlikle daha ucuz sekiz model onu geçer: her iki $0,12 Voyage 4 serisi amiral gemisi, yarı fiyata voyage-3.5, 1/6 fiyata voyage-4-lite, her iki Qwen3 embedding çeşidi, 1/13 fiyata intfloat/e5-large-v2 ve 1/32 fiyata perplexity/pplx-embed-v1-0.6b (0.8031). OpenAI'nin amiral gemisi TechQA'da 9. sırada (0.8581) ve MedRAG'da 11. sıradadır (0.9296). Sağlık, onu sıkı bir üst kümeye yerleştirir (2. ile 11. arasındaki yayılım: 0.05 nDCG@3). Hukukta fark geniş ve pahalıdır.
1M girdi token'ı başına $0,13 ile pplx-embed-v1-0.6b'den 32x daha pahalıdır. “Güvenli seçim” olduğu için OpenAI'ye yönelen ekipler, 3 alanlı verinin haklı çıkarmadığı bir prim ödüyor.
pplx-embed-v1-0.6b karşılaştırılabilir amiral gemilerinin otuzda biri fiyatına üst seviyeye ulaşıyor
1M token başına $0,004 olan perplexity/pplx-embed-v1-0.6b, üç alanda ortalama 0.8604 nDCG@3 elde eder; yalnızca dört Voyage modelinin, iki Gemini varyantının ve qwen/qwen3-embedding-8b'nin gerisindedir. Kadrodaki tüm OpenAI ve OSS modellerini geçer. Ayrıca CUAD'da openai/text-embedding-3-large'i 0.16 nDCG@3 farkla geçer, TechQA'da 0.012 farkla kaybeder (0.8457 vs 0.8581) ve MedRAG'da 0.003 farkla kazanır. Sonraki en ucuz ilk 10 modeli, $0,010 ile qwen/qwen3-embedding-8b'dir (2.5x daha pahalı), o da OpenRouter üzerinden sunulur.
Embedding'in önemli bir maliyet kalemi olduğu maliyet öncelikli RAG platformları için pplx-0.6b açık seçimdir. Amiral gemisi fiyatlandırmasına göre 30-50x'lik fark, bu üç alanda erişim kalitesinde esasen hiçbir şey kazandırmaz.
BM25, tıbbi özetlerde en zayıf yoğun modelin 0.02 yakınındadır
MedRAG-PubMed'de BM25, 0.8038 nDCG@3 alan baai/bge-m3 (yoğun mod) karşısında 0.7862 puan alır; bu 0.02'lik bir farktır. Sözcüksel arama, bu külliyattaki on beş yoğun modelin yedisinin 0.15 yakınına gelir (bge-m3, e5-base-v2, openai-3-small, e5-large-v2, openai-3-large, pplx-0.6b, qwen3-4b). Neden yapısaldır: tıbbi sorgular tasarım gereği anahtar kelime yoğunlukludur (ilaç adları, hastalık adları, çalışma tasarımı terimleri, gen sembolleri) ve bu token'lar erişim sinyalinin çoğunu taşır. Lucene tarzı bir puanlayıcı, anlamsal bağlama ihtiyaç duymadan bunları doğrudan eşleştirir.
Anahtar kelime yoğun külliyatlar için BM25 üzerinde bir reranker, premium yoğun embedder'a makul ve daha ucuz bir alternatiftir: BM25'in bıraktığı erişim farkı (MedRAG'da üst seviyeye 0.2 nDCG@3), Cohere veya Voyage reranker'ının kapatabileceği türden bir farktır. CUAD'da BM25 ile en iyi yoğun model arasındaki fark 0.33, TechQA'da 0.36, MedRAG'da 0.20'dir. Alan kelime dağarcığı yoğunluğu, yoğun embedding'lerin ne kadar yardımcı olduğunun en büyük tek belirleyicisidir.
Sağlayıcılar genelinde alan uzmanları ve genelciler
Voyage, voyage-law-2'yi voyage-4-large ile aynı olan $0,12/M olarak fiyatlandırır. İki model satıcıyı, tokenizer'ı, SDK'yı ve asimetrik çağrı şemasını paylaşır. Yalnızca eğitim verisi vurgusu farklıdır. Her ikisini CUAD, TechQA ve MedRAG genelinde genelcilere karşı çalıştırmak, hukuk eğitiminin etkisini yalıtır.
CUAD'da voyage-law-2 0.9126 ile 1. sıradadır: voyage-3.5'in 0.0024 üzerinde, gemini-embedding-001'in 0.0146 üzerinde, voyage-4-large'ın 0.040 üzerinde, qwen3-embedding-8b'nin 0.097 üzerinde ve openai/text-embedding-3-large'ın (0.6430) 0.270 üzerindedir. TechQA'da voyage-law-2 0.9020 ile 4. sıradadır; voyage-4-large'ın 0.064 ve voyage-3.5'in 0.063 gerisindedir. MedRAG'da 0.9409 ile 6. sıradadır; voyage-4-large'ın 0.045 ve gemini-embedding-001'in 0.041 gerisindedir. Hukuk eğitimi CUAD'da nDCG@3'ü artırır, diğer iki alanda düşürür.
openai/text-embedding-3-large üzerinde CUAD tarzı erişimi yayınlayan bir hukuk ekibi, voyage-law-2'nin 0.9126'sine karşı 0.6430 nDCG@3 ile çalışır; bu 0.27'lik bir farktır. CUAD'da birinci olduğu için voyage-law-2'yi seçen bir sağlık veya destek ekibi, MedRAG'da voyage-4-large'a 0.045 ve TechQA'da 0.064 kaybeder. Alana özel embedding modelleri, genel erişim için doğrudan kullanılabilir yükseltmeler değildir. Sektörler genelinde tek bir “en iyi model” önerisi en az bir yönde yanlış seçim yapar.
voyage-law-2 ne zaman seçilmeli: yapısal olarak CUAD'a benzeyen ticari hukuk külliyatlarında sözleşme erişimi için. Ne zaman seçilmemeli: bu benchmark'taki diğer her şey için. voyage-3.5 $0,06/M'dir, CUAD'da voyage-law-2'nin 0.0024 altına iner ve hem TechQA hem MedRAG'da onu geçer.
Embedding erişim pipeline'ı nasıl değerlendirildi
Her model, bir bi-encoder aracılığıyla bir sorgu vektörünü ve N belge vektörünü kodlar. Sorgu vektörü ile her belge vektörü arasındaki kosinüs benzerliğini hesaplar, ardından o sorgu için top-k'yı sıralarız. Sorgu başına tek altın belge ve ikili ilgililik ile değerlendirici, altının top-k içinde görünüp görünmediğini ve hangi sırada olduğunu kontrol eder. Bu sıra nDCG@3 (birincil metriğimiz), nDCG@10 (BEIR/MTEB karşılaştırılabilirliği için), Recall@10 ve Top-1 isabet oranına beslenir.
Sorgu ve belge encoder'ları her zaman aynı işlev değildir. Bazı modeller asimetrik olarak eğitilir: sorgu tarafı bir dönüşüm uygular, belge tarafı başka bir dönüşüm uygular. Bu modelleri simetrik olarak çağırmak (“metni doğrudan geç”) erişim kalitesini sessizce 0.05-0.45 nDCG@10 düşürür. Kadromuz dört şekilde ayrılır:
Neden birincil olarak nDCG@3. Üretim RAG pipeline'ları ilk 3 ila 5 parçayı LLM'e besler, ilk 10'u değil. Uzun bağlamlı LLM'lerdeki öncelik yanlılığı, sıra 1'i sıra 3'ten daha önemli kılar ve LLM bağlamında altının üzerine çıkan her çeldirici, konfabulasyon adayıdır. Reranker'lar bu etkiyi düzleştirir, ancak çoğu üretim RAG'ı maliyet ve gecikme nedeniyle reranker olmadan çalışır; bu nedenle embedder'ın sırası son sıradır.
MedRAG'da Recall@10, üç Voyage modeli ve qwen3-8b için 1.000 tavanına ulaştı; nDCG@3 aynı sorgularda 0.10'luk bir yayılımı korudu. nDCG@10, BEIR karşılaştırılabilirliğini korur ancak operasyonel olarak önem taşıyan listenin üst sıralarındaki farkları yumuşatır.
Embedding model'leri benchmark metodolojisi
Külliyatlar (alan seçimi + nedeni)
Farklı erişim özelliklerini zorlayan ve en yaygın üç kurumsal RAG'ı kapsayan üç alan seçtik. Her külliyat SHA256 ile sabitlenmiştir, böylece her okuyucu çalıştırdığımız hücreyi birebir yeniden üretebilir.
PM209 (üretim kılavuzları) çıkarıldı: yalnızca 209 belge, 150 sorguda BM25 varlık kısayolu sorununu önlemek için çok küçük.
Sorgu üretimi: 3-LLM konsensüs protokolü
Sorgularımız, yazar-doğrulayıcı ayrımı altında LLM tarafından üretilir: bir sorguyu taslaklayan LLM kendi erişim hedefini asla yargılamaz, böylece kendi kendine yanlılık yapısal olarak dışlanır. Yalnızca yazar olmayan iki doğrulayıcı, hangisinin yazarın dayanak belgesi olduğuna dair ipucu olmadan karıştırılmış 20 adayı görerek kabul kararı verir. LLM konsensüsüne ek olarak, kabul edilen sorgu kümesinin yaklaşık %25'ini elle nokta incelemesinden geçirdik (doğrulayıcı oyundan bağımsız olarak sorgu doğallığı, hedef belge hizalaması ve R9 uyumu yazar tarafından incelendi).
Üretim kümesine girmeden önce her sorgu aşağıdaki pipeline'dan geçti:
- Yazar, rastgele örneklenmiş tek bir belgeye dayalı tek bir sorgu taslağı hazırlar. Yazar Claude Sonnet 4.6, Qwen3.6-plus ve Gemini 3 Flash preview arasında döner, böylece dilsel parmak izine tek bir model hâkim olmaz.
- Puanlayıcı (sabit: Claude Sonnet 4.6) sorguyu belirlilik dereceli puanlama anahtarına göre puanlar. semantic_bridge ≥ 4 (sorgu, belgenin öne sürdüğünü yalnızca ad eşleşmesiyle değil anlamsal olarak tanımlamalıdır) ve unique_referent 3-5 aralığında (tanımlayıcı çapalar külliyatta binlerce veya tam olarak bir değil, yaklaşık bir ila beş aday belgeyi belirlemelidir) şartı aradık.
- Zor negatif kontrolü: BM25 ilk 19 çeldirici belgesini ve hedefi alır, yakın kopya Jaccard kapısı çalıştırırız (>0.5 → sorguyu belirsiz referans gerçeği olarak reddeder).
- Doğrulayıcılar (2 model, asla yazarı içermez) karıştırılmış 20 adaylı kümeden hedef belgeyi bağımsız olarak seçer. Her iki doğrulayıcı da tam hedef yuvasında anlaşmalıdır, aksi takdirde sorgu atılır. “Yukarıdakilerin hiçbiri” ve “birden fazla doğru cevap” geçerli doğrulayıcı yanıtlarıdır ve ayrıca sorguyu atar.
- Cohen’in kappa değeri her doğrulayıcı çifti için hesaplanır. Her sorguda tam olarak 2 puanlayıcı vardı (3 modellik havuzdan yazar olmayanlar), bu nedenle 3 olası yazar hariç çift bize alan başına 3 ayrı kappa değeri verir. Bunları tek ve n ağırlıklı ortalama olarak raporluyoruz.
Kabul edilen sorgular ve her iki doğrulayıcının da karara vardığı tüm consensus_fail redleri üzerinden hesaplanan, gözlenen uyuşma po ve şansla beklenen pe ile çift başına Cohen kappa değerleri. Hücreler n / po / pe / κ gösterir:
n ağırlıklı ortalama, çıkarımsal bir istatistik değil tanımlayıcı bir özettir. Üç çift bazlı kappa değerini, her çiftin yargıladığı sorgu sayısıyla ağırlıklandırarak tek bir sayıya indirger; kendisi birleştirilmiş veri kümesi için bir kappa değeri değildir ve üzerindeki CI, sorgu düzeyinde bootstrap yeniden örneklemesiyle hesaplanmalıdır (v2.1'e ertelendi).
Her sorguda tam olarak 2 puanlayıcı olduğu için Cohen kappa kullandık (Fleiss kappa veya Krippendorff alfa değil): Buradaki doğal çerçeve, 3 ikili Cohen hesaplamasıdır çünkü 3 puanlayıcılı bir panelin uyumlu olup olmadığını değil, belirli iki modelin uyuşup uyuşmadığını bilmek istiyoruz. Krippendorff alfa tek bir sayı verir ancak üç çifti birbirine karıştırır ve çift düzeyindeki varyansı gizler.
CUAD özelinde: Claude × Qwen κ=0.974'e ulaşırken Claude × Gemini ve Gemini × Qwen κ=0.86 civarındadır; bu, hukuk sözleşmelerinde en gürültülü yargıç olarak Gemini-3-flash-preview'i yalıtır. Bu bilgi, ortalamayla yok edilmek yerine yüzeye çıkarılmaya değer bir metodoloji sinyalidir.
Bir alanı, n ağırlıklı ortalama kappa 0.85'i geçtikten sonra üretime yükselttik. Üçü de bu eşiği geçti. MedRAG'ın 0.986 değeri fiilen tavandır: 156 denemedeki iki uyuşmazlık, her iki doğrulayıcının da içsel olarak tutarlı olduğu ancak birinin ilgili ama altın olmayan bir özet seçtiği tıbbi açıdan belirsiz hedeflerdeydi.
R9 varlık anonimleştirme kural kümesi (alana göre)
R9, sorgu üretimi sırasında katı bir kısıttır. Onsuz BM25 0.97 nDCG@10'un üzerine çıkar çünkü adlandırılmış varlıklar mükemmel anahtar kelime kısayolları işlevi görür; yoğun embedding'lerin ölçülecek anlamsal bir avantajı kalmaz. Kural, o alanda erişim sinyalini gerçekten taşıyan çapaların kullanılabilir kalması için alana göre uyarlanır:
- CUAD katı. Tüm adlandırılmış varlıkları yasaklayın: taraf adları, ABD eyalet adları, personel, tam dolar cinsinden parasal tutarlar, belirli ürün adları. Tanımlayıcı benzersizliği zorunlu kılın: sektör + rol + zamansal dönem + parasal aralık + coğrafi kapsam. R9 uygulandıktan sonra BM25 tavanı 0.97'den 0.591'e düştü.
- TechQA Seçenek X. IBM ürün adlarına, sorgu ayrıca ikincil bir ürün dışı tanımlayıcı çapa içeriyorsa izin verilir (belirti sınıfı, hata kodu ailesi, sürüm dönemi, dağıtım bağlamı) çünkü bunlar bir sistem yöneticisi için birincil erişim sinyalidir. Müşteri adları, ABD eyaletleri, personel yine yasaktır. BM25 tavanı: 0.664.
- MedRAG tıbbi esnek + halüsinasyon güvenli. İlaç adları, hastalık terimleri, anatomi, gen sembolleri kaynaktan birebir korunur çünkü ilaç sınıfı etiketlerini koymak farmakoloji halüsinasyonu riski taşır (“p-chloroamphetamine” amfetamin sınıfı bir serotonin salıcıdır, ancak daha nadir ilaçların LLM etiket çevirileri sessizce başarısız olur). Saf ilaç adı anahtar kelime eşleşmesinin sonucu taşımaması için sorgu ≥2 ilaç dışı çapa içermelidir. BM25 tavanı: 0.809 (alanın yapısal özelliğidir, metodoloji kusuru değildir).
Örnek sorgular
Her örnekte, sorgu, embedding modeline verdiğimiz metindir. Altın belge, külliyatta sorguyu gerçekten yanıtlayan tek öğedir (509 CUAD sözleşmesi, 28.000 TechQA teknik notu veya 50.000 PubMed özeti içinden). Erişim görevi şudur: sorguyu gömün, külliyattaki her belgeye karşı kosinüs benzerliğini hesaplayın ve sıralayın. Altın belge 1. sıraya inerse sorgu nDCG@3'te 1.000 puan alır; 2. sıra 0.631 puan alır; 3. sıra 0.500 puan alır; ilk 3'ün altında 0 puan alır.
CUAD (hukuk)
Sorgu:
Altın belge (509 CUAD sözleşmesinden 1'i): ANIXABIOSCIENCESINC_06_09_2020-EX-10.1-COLLABORATION AGREEMENT. Bu, bir Alman firması ile bir ABD biyoteknoloji şirketi arasında COVID-19 ilaç keşfi için 2020 tarihli bir iş birliğidir; sözleşme, ilk hasta bir klinik denemenin Faz I'ine girdiğinde ödenmesi gereken bir kilometre taşı ödemesini belirtir. Sorgu, iki ülke token'ı dışında taraf adı, parasal tutar ve coğrafya içermez; erişim sinyali sektör + zamansal + kilometre taşı yapısıdır.
TechQA (müşteri desteği)
Sorgu:
Altın belge (28.000 IBM teknik notundan 1'i): swg1IY43185, tam olarak bu WebSEAL hatasını belgeler ve onu düzelten yamayı adlandırır. IBM ürün adı (WebSEAL) TechQA R9 varyantımız kapsamında serbesttir, ancak ayırt edici unsur yalnızca ürün adı değil, hatanın davranışsal örüntüsü ve istek sıralama çapasıdır.
MedRAG (sağlık)
Sorgu:
Altın belge (50.000 PubMed özetinden 1'i): PMID:231299, idrar yolu enfeksiyonu olan hamile kadınlarda sefradin ile pivmecillinam arasındaki advers reaksiyon bırakma oranlarını karşılaştıran bir klinik denemedir. İlaç adları korunur çünkü ilaç-ilaç karşılaştırması erişim sinyalidir, ancak sorgu hasta popülasyonu + tedavi süresi + advers olay çerçevesi ekler, böylece saf ilaç adı BM25 eşleşmesi hedefi tek başına bulamaz.
İstatistiksel protokol
Bootstrap %95 güven aralıkları, sorgu başına metrik vektörü üzerinde 10.000 yeniden örnekleme, yüzdelik yöntemi ve seed=2026 kullanır. Model A ile model B arasındaki ikili anlamlılık için aynı sorgu indekslerinde eşleştirilmiş bootstrap kullanılır (iddia, A > B olan yeniden örneklemelerin ≥%95'ini gerektirir).
Her (model, alan) hücresi için tek çalıştırma. 3 çalıştırmalı oturumlar arası varyans katmanı maliyet nedeniyle v2.1'e ertelendi. Oturum içi embedding API çağrıları, nokta kontrolüyle doğrulanmış olarak milyonda birkaç parça kosinüs farkı içinde deterministiktir; bu nedenle bootstrap CI, n=150-246 düzeyinde baskın varyans kaynağı olan sorgu düzeyindeki gürültüyü yakalar.
Dizinleme ve puanlama
Vektör veritabanı yok. Her model, her külliyat belgesini bir kez kodlar; kosinüs benzerliği, L2-normalize edilmiş embedding'lerin yoğun matris çarpımı olarak doğrudan NumPy'de hesaplanır. Bu yaklaşık değil kesindir, bu nedenle sıra eşitlikleri ANN yapıtları değil gerçek model eşitlikleridir.
Model başına parçalama kuralı: 512 bağlamlı modeller 512+64 örtüşmeyle parçalar; 8K-20K bağlamlı modeller örtüşme olmadan bağlama göre parçalar; 32K+ bağlamlı modeller sığdığında belgenin tamamını alır (CUAD'ın %9'luk uzun kuyruğu her Nemotron dışı bağlam penceresini aşar ve parçalamaya düşer; model genelinde adillik, her modele aynı bağlam boyutu başına politikayı uygulayarak korunur).
Model başına asimetrik erişim çağrısı, en etkili tek metodoloji ayrıntısıdır ve ayrı bir bölümü hak eder. gemini-embedding-2-preview'nin OpenRouter'ın belgelenmiş kod örneğinde 0.46 nDCG@10 puan almasının, buna karşılık Google'ın Vertex AI biçiminde 0.91 puan almasının nedeni budur. Aile başına tablo için yukarıdaki “Embedding erişim pipeline'ı nasıl değerlendirildi” bölümüne bakın.
Değerlendirme çerçevesi: birincil metrik motoru olarak ranx; MTEB liderlik tablosu gönderimleriyle uyumlu trec_eval tarzı çıktı. Bootstrap CI, değerlendirme geçişinde kaydedilen sorgu başına metrik dizileri üzerinden scripts/bootstrap_ci.py tarafından hesaplanır.
Test edilen modeller
Fiyatlar OpenRouter kataloğu ve Voyage doğrudan fiyatlandırma sayfasından 2026-04-23 itibarıyladır.
Model başına nDCG@3 ile %95 bootstrap CI
Bootstrap %95 güven aralıkları, sorgu başına metrik vektörünün 10.000 yeniden örneklemesiyle hesaplandı (yüzdelik yöntemi, seed=2026). Bu örneklem boyutlarında 0.03-0.07 arasındaki CI genişlikleri (n=154-246), ~0.03 altındaki nokta tahmini farklarının gürültü içinde olduğu ve eşitlik olarak ele alınması gerektiği anlamına gelir. 3 alan ortalama nDCG@3'e göre sıralanmıştır:
Nokta tahmini sıralamalarının %95 CI'da anlamlı olmadığı dört istatistiksel eşitlik:
Sınırlamalar
Bir yazar tarafından insan incelemesi: Bir yazar, nihai kabul edilen sorguların yaklaşık %25'ini doğallık, hedef hizalaması ve R9 uyumu açısından nokta incelemesinden geçirdi.
Sonuç
voyage-3.5 hukuk, müşteri desteği ve sağlık alanlarında ortalama 0.9429 nDCG@3 elde eder; Voyage'ın kendi amiral gemisini yarı fiyata geçer ve OpenAI'nin text-embedding-3-large'ini yarı fiyatın altında 0.13 nDCG@3 farkla geçer.
Embedding maliyetinin bir yuvarlama hatası olması gerekiyorsa $0,004/M ile pplx-embed-v1-0.6b'yi seçin. En üst Pareto noktası için $0,060/M ile voyage-3.5'i seçin. OSS'de kalmak için $0,010/M ile qwen/qwen3-embedding-8b'yi seçin. voyage-law-2'yi yalnızca CUAD'a yakın hukuk erişimi için kullanın; burada CUAD'da +0.04 nDCG@3 kazandırır ve başka yerde hiçbir şey kazandırmaz.
Daha fazla okuma
Aşağıdakiler gibi diğer RAG benchmark'larını keşfedin:
- RAG için En İyi 10 Çok Dilli Embedding Model'i
- RAG için En İyi 16 Açık Kaynak Embedding Model'i
- RAG için En İyi Vektör Veritabanı: Qdrant vs Weaviate vs Pinecone
- Reranker Benchmark'ı: Karşılaştırılan En İyi 8 Model
- Multimodal Embedding Model'leri: Apple vs Meta vs OpenAI
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Embedding Model'ler: OpenAI vs Gemini vs Voyage}},
year = {2026},
month = apr,
howpublished = {\url{https://aimultiple.com/embedding-models}},
note = {AIMultiple. Erişim tarihi: 25 Nisan 2026}
}51 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 7 CSV dosyası içeren ZIP dosyası olarak indirin.
Değişiklik günlüğü
4 güncelleme- 2026
Kıyaslama, hukuk, müşteri desteği ve sağlık derlemlerinde test edilen 15 model ve bir BM25 temeliyle değiştirildi.
- 2025
Gömme modeli performans farklılıklarının arkasındaki potansiyel nedenler bölümü eklendi.
Sonuç bölümü yeni model önerileriyle güncellendi.
Girişte Google, Gemini ile değiştirildi.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.