15 İngilizce metin embedding modelini ve bir BM25 temel çizgisini, üç erişim alanında (hukuk sözleşmeleri (CUAD), müşteri desteği (IBM TechQA) ve sağlık hizmetleri (MedRAG PubMed)) 500'den fazla elle derlenmiş sorgu üzerinde kıyasladık.
Voyage-3.5 genel sıralamada ilk sırada yer alıyor. Perplexity Embed V1 0.6b, kıyaslamamızdaki en düşük fiyat noktasında üst-orta seviyeye ulaşıyor.
Embedding modeli kıyaslama sonuçları
Metrikler açıklandı
nDCG@3: Kesme noktası 3'te normalleştirilmiş iskontolu kümülatif kazanç. Sorgu başına bir ilgili belge olduğunda, altın belge ilk 3'te yer aldığında 1 / log2(sıra + 1) olur, aksi takdirde 0 olur. 1. sıra 1.000, 2. sıra 0.631, 3. sıra 0.500 puan alır. Üretim RAG işlem hatları LLM'ye en üst 3 ila 5 parçayı beslediği ve öncelik yanlılığı 1. sırayı orantısız şekilde önemli kıldığı için birincil metrik olarak nDCG@3'ü kullanıyoruz.
nDCG@10: 10 kesme noktası ile aynı formül.
Recall@10: Altın belgenin ilk 10'da göründüğü sorguların oranı.
MRR@10: 10 kesme noktasında ortalama ters sıra. 1. sıradaki altın 1.000, 2. sıra 0.500 ve 10. sıra 0.100 puan alır. nDCG@3 ile benzer amaç taşır ancak daha dik bir sıra cezası vardır.
En yüksek-1 isabeti: Altın-ilgili belgenin tek en üst sonuç olduğu sorguların oranı. En katı metrik ve LLM olmadan yapılan bir arama iş akışına en yakın olanıdır.
Alana göre nDCG@3
Hukuk (CUAD, 246 sorgu, 509 sözleşme): Hukuk, özel voyage-law-2'nin kazandığı tek alandır; CUAD'a göre ayarlanmış eğitim verileri, voyage-4-large'a kıyasla nDCG@3'te +0.040 farkla karşılığını verir. openai/text-embedding-3-large 11. sırada, 0.6430 ile altı daha ucuz modelin altında yer alır. BM25 tabanı: 0.5844.
Müşteri desteği (TechQA, 151 sorgu, 28,000 IBM teknik notu): voyage-4-lite ile bir sonraki model arasındaki fark 0.018'dir. gemini-embedding-001, diğer iki alanı kazansa da TechQA'da daha yeni kardeşinin 0.045 gerisinde kalarak 7. sıraya (0.8856) düşer. BM25 tabanı: 0.6097.
Sağlık hizmetleri (MedRAG-PubMed, 154 sorgu, 50,000 özet): Sağlık hizmetleri, tıbbi sözcük dağarcığının anahtar sözcük yoğunluğu nedeniyle kıyaslamamızdaki en sıkı kümedir (14 model 0.88'in üzerinde puan alır), bu da çoğu sorguyu en üst kümeye iter. BM25 tabanı: 0.7862, en zayıf dense modele 0.02 farkla yakındır. gemini-embedding-001 ayrıca burada gemini-embedding-2-preview'i en geniş farkla (+0.013) yener.
Alan düzeyindeki bu değişimler, 3-alan-ortalaması yaklaşımını haklı çıkarır: Hiçbir alan "hangi model en iyisidir" için adil bir proxy değildir ve tek bir alana göre seçim yapan alıcı, diğer alanlarda yanlış sıralama yapar.
Her alan hücresi için model başına %95 bootstrap güven aralıkları ve nokta tahmini sıralamalarının gizlediği dört ikili eşitlik yöntem bölümünde ayrıntılandırılmıştır.
Doğruluk vs fiyat: 1M token başına maliyet
Metrikler açıklandı
1M girdi token başına fiyat, 2026-04-23 itibarıyla, 1M token girdisini embedding yapmanın liste fiyatıdır. Voyage fiyatları, Voyage doğrudan fiyatlandırma sayfasından alınmıştır. OpenRouter üzerinden sunulan modeller, aynı günün OpenRouter katalog anlık görüntüsünü kullanır. Test edilen tüm satıcılarda sorgu ve belge token'ları aynı oranda fiyatlandırılır. BM25, log ekseninde gösterim için $0.001/M olarak çizilmiştir. Gerçek kendi kendine barındırma maliyeti $0'dır.
3-alan ortalama nDCG@3, üç korpus genelindeki alan başına nDCG@3'ün ağırlıksız ortalamasıdır. Her alan, sorgu sayısından bağımsız olarak ortalamaya eşit katkıda bulunur.
- Maliyet öncelikli RAG platformları için, pplx-embed-v1-0.6b açık ara en iyi seçimdir. $0.004/M ile herhangi bir ticari amiral gemisinden 30-50x daha ucuzdur ve voyage-3.5'in kalitesinin %92'sini (0.8604 / 0.9429) sunar. Kıyaslamamızdaki hiçbir model bu fiyat noktasında rekabet edemez.
- Kalite öncelikli kurumsal RAG için, Voyage doğrudan SDK aracılığıyla voyage-3.5 en üst Pareto noktasını alır. Yalnızca OpenRouter yığınına karşı bir ekstra API entegrasyonu takas ederek, Voyage'ın kendi amiral gemisinden biraz daha iyi bir modeli yarı fiyatına elde edersiniz. Voyage'ın kataloğunda "her zaman en yeni ve en büyük olanı seç" içgüdüsü yanlıştır.
- Açık kaynak / kendi kendine barındırılabilir / özel sunucu dağıtımları için, qwen3-embedding-8b kazanır. Kıyaslamamızdaki en ucuz, önemsiz olmayan, embed edici olup fiyatı $0.010/M'dir, test ettiğimiz diğer tüm açık kaynak kodlayıcı ailelerini eşleştirir veya geride bırakır ve kendi kendine barındırılabilir ağırlıklarla birlikte gelir.
- Premium amiral gemileri (openai-3-large, gemini-2-preview, voyage-4-large, gemini-001) 3-alan ortalamasında voyage-3.5'e kaybeder, üstelik voyage-3.5 bunların herhangi birinden 2-3x daha ucuzdur.
Embedding kıyaslamasından önemli bulgular
voyage-3.5 3-alan ortalamasını kazanır ve voyage-4-large amiral gemisini yarı fiyatına geride bırakır
voyage-3.5, hukuk, müşteri desteği ve sağlık hizmetleri genelinde ortalama 0.9429 nDCG@3 elde eder. Amiral gemisi voyage-4-large, 1M token başına $0.12 fiyatla (0.06 olan voyage-3.5 fiyatının 2x katı) ortalama 0.9416 alır. Amiral gemisi TechQA'yı 0.002 farkla, MedRAG'ı 0.032 farkla kazanır. CUAD'ı 0.037 farkla (0.8730 vs 0.9102) kaybeder, öyle ki 3-alan ortalaması voyage-3.5'in altında kalır. Voyage'ın ürün yelpazesinde, eski orta kademe model daha iyi genel amaçlı seçimdir. Amiral gemisi yalnızca sağlık hizmetlerinde primini hak eder.
Voyage her üç alanda da zirveyi aldı ve CUAD ve TechQA'da ilk iki sırayı süpürdü. MedRAG'da, gemini-embedding-001 (0.9855 olan voyage-4-large'ın arkasından 0.9814 ile) 2. sıraya girdi ve diğer tüm Voyage modellerinin önünde yer aldı. gemini-001 aynı zamanda CUAD'da üçüncülüğe ulaştı. Başka hiçbir Voyage dışı model herhangi bir alanda ilk 2'ye giremedi.
Eski bir Gemini modeli, üç alanın ikisinde daha yeni "önizleme" kardeşini geride bırakıyor
google/gemini-embedding-001 (Haziran 2025'te piyasaya sürüldü) hem CUAD'da (0.8980 vs 0.8958) hem de MedRAG'da (0.9814 vs 0.9685) google/gemini-embedding-2-preview'den daha iyi performans sergiliyor. Daha yeni model yalnızca TechQA'yı (0.9301 vs 0.8856) kazanıyor; bu, 1M girdi token başına %33 fiyat artışıyla ($0.20 vs $0.15) gelen 0.04'lük bir fark. Gemini 2'nin "daha yeni çok modlu yükseltme" çerçevesi, İngilizce metin erişiminde hukuk veya sağlık hizmetleri korpuslarında tutmuyor.
Bugün bu iki alandaki RAG iş yükleri için, gemini-embedding-001 doğru Gemini seçimidir. MedRAG'daki bu değişim (001 2. sırada, 2-preview 3. sırada), "en yeni" modele yönelen bir alıcının ölçülebilir kalite kaybettiği anlamına gelecek kadar büyüktür.
OpenAI text-embedding-3-large, hukuk ve müşteri desteğinde orta kademede kalıyor
openai/text-embedding-3-large, CUAD'da 15 dense model arasında 0.6430 nDCG@3 ile 11. sırada. Sekiz adet kesinlikle daha ucuz model, hukuk sözleşmelerinde onu geride bırakıyor: her iki $0.12'lık Voyage 4 serisi amiral gemisi, yarı fiyatına voyage-3.5, 1/6 fiyatına voyage-4-lite, her iki Qwen3 embedding varyantı, 1/13 fiyatına intfloat/e5-large-v2 ve 1/32 fiyatına perplexity/pplx-embed-v1-0.6b (0.8031). OpenAI'ın amiral gemisi TechQA'da 9. (0.8581) ve MedRAG'da 11. (0.9296) sırada. Sağlık hizmetleri onu sıkı bir üst kümeye yerleştiriyor (2. sıradan 11. sıraya dağılım: 0.05 nDCG@3). Hukukta fark büyük ve maliyetli.
1M girdi token başına $0.13 ile pplx-embed-v1-0.6b'den 32x daha pahalıdır. "Güvenli seçenek" olduğu için OpenAI'a yönelen ekipler, 3-alan verilerinin haklı çıkarmadığı bir prim ödüyordur.
pplx-embed-v1-0.6b, karşılaştırılabilir amiral gemilerinin otuzda biri fiyatına en üst kademeye ulaşıyor
perplexity/pplx-embed-v1-0.6b, 1M token başına $0.004 ile üç alan genelinde ortalama 0.8604 nDCG@3 elde eder ve yalnızca dört Voyage modeli, iki Gemini varyantı ve qwen/qwen3-embedding-8b'nin gerisinde kalır. Ürün yelpazesindeki tüm OpenAI ve açık kaynak modellerini geride bırakır. Ayrıca CUAD'da openai/text-embedding-3-large'ı 0.16 nDCG@3 farkla yener, TechQA'da 0.012 farkla (0.8457 vs 0.8581) kaybeder ve MedRAG'da 0.003 farkla kazanır. Bir sonraki en ucuz ilk 10 modeli, yine OpenRouter üzerinden sunulan ve 2.5x daha pahalı olan $0.010 fiyatındaki qwen/qwen3-embedding-8b'dir.
Embedding'in önemli bir maliyet kalemi olduğu maliyet öncelikli RAG platformları için, pplx-0.6b açık ara en iyi seçimdir. Amiral gemisi fiyatlandırmasına olan 30-50x'lik fark, esasında bu üç alanda erişim kalitesi açısından hiçbir şey satın almaz.
BM25, tıbbi özetlerde en zayıf dense modelin 0.02 yakınına kadar geliyor
MedRAG-PubMed'da, BM25 nDCG@3'te 0.7862 puan alırken, baai/bge-m3 (dense modu) 0.8038 puandadır; bu 0.02'lik bir farktır. Sözcüksel arama, bu korpustaki on beş dense modelin yedisinin (bge-m3, e5-base-v2, openai-3-small, e5-large-v2, openai-3-large, pplx-0.6b, qwen3-4b) 0.15 yakınına gelir. Bunun nedeni yapısaldır: tıbbi sorgular tasarım gereği anahtar sözcük yoğunlukludur (ilaç adları, hastalık adları, çalışma-tasarım terimleri, gen sembolleri) ve bu token'lar erişim sinyalinin çoğunu taşır. Lucene tarzı bir puanlayıcı, anlamsal bağlama ihtiyaç duymadan bunları doğrudan eşleştirir.
Anahtar sözcük yoğunluklu korpuslar için BM25'in üstüne bir yeniden sıralayıcı eklemek, premium bir dense embed ediciye göre makul ve daha ucuz bir alternatiftir: BM25'in bıraktığı erişim farkı (MedRAG'da en üst kademeye 0.2 nDCG@3), bir Cohere veya Voyage yeniden sıralayıcısının kapatabileceği türden bir farktır. CUAD'da BM25'ten en iyi dense modele fark 0.33, TechQA'da 0.36, MedRAG'da 0.20'dir. Alan sözcük dağarcığı yoğunluğu, dense embedding'lerin ne kadar yardımcı olduğunun en büyük tek belirleyicisidir.
Satıcılar genelinde alan uzmanları ve genelciler
Voyage, voyage-law-2'yi voyage-4-large ile aynı olan $0.12/M olarak fiyatlandırır. İki model satıcıyı, tokenleştiriciyi, SDK'yı ve asimetrik çağrı şemasını paylaşır. Yalnızca eğitim verisi vurgusu farklıdır. Her ikisini de CUAD, TechQA ve MedRAG genelinde genelcilere karşı çalıştırmak, hukuk eğitiminin etkisini izole eder.
CUAD'da, voyage-law-2 0.9126 ile 1. sırada yer alır: voyage-3.5'in 0.0024 üstünde, gemini-embedding-001'in 0.0146 üstünde, voyage-4-large'ın 0.040 üstünde, qwen3-embedding-8b'nin 0.097 üstünde ve openai/text-embedding-3-large (0.6430)'ın 0.270 üstündedir. TechQA'da, voyage-law-2 0.9020 ile 4. sırada, voyage-4-large'ın 0.064 ve voyage-3.5'in 0.063 gerisindedir. MedRAG'da, 0.9409 ile 6. sırada, voyage-4-large'ın 0.045 ve gemini-embedding-001'in 0.041 gerisindedir. Hukuk eğitimi CUAD'da nDCG@3'ü yükseltir ve diğer iki alanda düşürür.
CUAD tarzı erişimi openai/text-embedding-3-large ile yürüten bir hukuk ekibi, voyage-law-2'nin 0.9126 ile 0.6430 nDCG@3'ünde çalışır; bu 0.27'lik bir farktır. CUAD'da birinci olduğu için voyage-law-2'yi seçen bir sağlık veya destek ekibi, MedRAG'da voyage-4-large'a 0.045 ve TechQA'da 0.064 kaybeder. Alana özgü embedding modelleri, genel erişim için doğrudan yükseltme değildir. Sektörler arası tek bir "en iyi model" önerisi en az bir yönde yanlış seçim yapar.
voyage-law-2 ne zaman seçilmeli: yapısal olarak CUAD'a benzeyen ticari hukuk korpuslarında sözleşme erişimi. Ne zaman seçilmemeli: bu kıyaslamadaki diğer her şey. voyage-3.5 $0.06/M'dir, CUAD'da voyage-law-2'nin 0.0024 altına iner ve hem TechQA hem de MedRAG'da onu geride bırakır.
Embedding erişim işlem hattı nasıl değerlendirildi
Her model, bir çift kodlayıcı aracılığıyla bir sorgu vektörü ve N belge vektörü kodlar. Sorgu vektörü ile her belge vektörü arasındaki kosinüs benzerliğini hesaplar, ardından bu sorgu için ilk k'yi sıralarız. Sorgu başına bir altın belge ve ikili ilgililik ile, değerlendirici altının ilk k'de görünüp görünmediğini ve hangi sırada olduğunu kontrol eder. Bu sıra, nDCG@3 (birincil metriğimiz), nDCG@10 (BEIR/MTEB karşılaştırılabilirliği için), Recall@10 ve En üst-1 isabet oranını besler.
Sorgu ve belge kodlayıcıları her zaman aynı fonksiyon değildir. Bazı modeller asimetrik olarak eğitilir: sorgu tarafı bir dönüşüm uygular, belge tarafı başka bir dönüşüm uygular. Bu modelleri simetrik olarak ("sadece metni geç") çağırmak, erişim kalitesini 10'da 0.05-0.45 nDCG@ kadar sessizce düşürür. Ürün yelpazemiz dört şekilde ayrılır:
Neden birincil olarak nDCG@3. Üretim RAG işlem hatları, 10 değil, en üstteki 3 ila 5 parçayı LLM'ye besler. Uzun bağlamlı LLM'lerdeki öncelik yanlılığı, 1. sırayı 3. sıradan daha önemli kılar ve LLM bağlamında altının üzerinde yer alan her çeldirici, uydurma için bir adaydır. Yeniden sıralayıcılar bu etkiyi düzleştirirdi, ancak çoğu üretim RAG'i maliyet ve gecikme nedenleriyle yeniden sıralayıcı olmadan çalışır, bu nedenle embed edicinin sırası nihai sıradır.
MedRAG'da, Recall@10 üç Voyage modeli ve qwen3-8b için 1.000 tavanına ulaştı; nDCG@3 aynı sorgularda 0.10'luk bir dağılımı korudu. nDCG@10, BEIR karşılaştırılabilirliğini korur ancak operasyonel olarak önemli olan liste başı farklarını yumuşatır.
Embedding modelleri kıyaslama yöntemi
Korpuslar (alan seçimi + nedeni)
Farklı erişim özelliklerini zorlayan ve en yaygın üç kurumsal RAG'i kapsayan üç alan seçtik. Her korpus SHA256 ile sabitlenmiştir, böylece herhangi bir okuyucu yürüttüğümüz tam hücreyi yeniden üretebilir.
PM209 (üretim kılavuzları) çıkarıldı: yalnızca 209 belge, 150 sorguda BM25 varlık-kestirme sorununu önlemek için çok küçük.
Sorgu üretimi: 3-LLM fikir birliği protokolü
Sorgularımız, yazar-doğrulayıcı ayrımı altında LLM tarafından üretilir: bir sorguyu taslaklayan LLM, kendi erişim hedefini asla yargılamaz, bu nedenle kendi kendine yanlılık yapısal olarak dışlanır. Yazarın dayanak belgesinin hangisi olduğuna dair hiçbir ipucu olmaksızın karıştırılmış 20 adayı gören yalnızca iki yazar olmayan doğrulayıcı kabul kararı verir. LLM fikir birliğine ek olarak, kabul edilen sorgu setinin yaklaşık %25'ini elle nokta incelemesinden geçirdik (doğrulayıcı oyundan bağımsız olarak sorgu doğallığı, hedef belge uyumu ve R9 uyumu için yazar incelemesi).
Her sorgu, üretim setine girmeden önce aşağıdaki işlem hattından geçti:
- Yazar, rastgele örneklenmiş bir belgeye dayanan tek bir sorgu taslağı hazırlar. Yazar, hiçbir tek modelin dilsel parmak izine hakim olmaması için Claude Sonnet 4.6, Qwen3.6-plus ve Gemini 3 Flash önizleme arasında döner.
- Puanlayıcı (sabit: Claude Sonnet 4.6) sorguyu bir özgüllük rubriğine göre derecelendirir. semantic_bridge ≥ 4 (sorgu, yalnızca ad eşleşmesi değil, belgenin ne iddia ettiğini anlamsal olarak tanımlamalıdır) ve unique_referent 3-5 arasında (tanımlayıcı bağlantı noktaları, tam olarak bir değil, korpusta yaklaşık bir ila beş aday belge tanımlamalıdır) olmasını şart koştuk.
- Zor-olumsuz kontrolü: BM25 ilk 19 çeldirici belgeyi artı hedefi çeker ve bir yarı-kopya Jaccard kapısı (> 0.5 → sorguyu belirsiz temel gerçek olarak reddet) çalıştırırız.
- Doğrulayıcılar (2 model, asla yazarı içermez) karıştırılmış 20 adaylı setten bağımsız olarak hedef belgeyi seçer. Her iki doğrulayıcı da tam hedef yuvası üzerinde anlaşmalıdır, aksi takdirde sorgu atılır. "Hiçbiri" ve "birden çok doğru cevap" geçerli doğrulayıcı yanıtlarıdır ve sorguyu da atar.
- Cohen'in kappa'sı her doğrulayıcı çifti için hesaplanır. Her sorgunun tam olarak 2 değerlendiricisi vardı (3 modellik havuzdan yazar olmayanlar), bu nedenle 3 olası yazar-hariç çifti bize alan başına 3 ayrı kappa değeri verir. Bunları bireysel olarak ve n ağırlıklı ortalama olarak rapor ederiz.
Her iki doğrulayıcının da bir karara vardığı, kabul edilen sorgular ve tüm fikir birliği_başarısız redleri üzerinden hesaplanan, gözlenen uyuşma po ve şansla beklenen pe ile çift başına Cohen'in kappası. Hücreler n / po / pe / κ gösterir:
n-ağırlıklı ortalama, tanımlayıcı bir özettir, çıkarımsal bir istatistik değildir. Üç çift başına kappayı, her bir çiftin yargıladığı sorgu sayısına göre ağırlıklandırarak tek bir sayıya yoğunlaştırır; kendisi havuzlanmış bir veri seti için bir kappa değeri değildir ve bunun üzerindeki GA'nın sorgu düzeyinde bootstrap yeniden örnekleme yoluyla hesaplanması gerekir (v2.1'e ertelenmiştir).
Cohen'in kappasını (Fleiss' kappa veya Krippendorff' alfa değil) kullandık çünkü her sorgunun tam olarak 2 değerlendiricisi vardı: buradaki doğal çerçeve, belirli herhangi iki modelin uyuşup uyuşmadığını bilmek istediğimiz için 3 ikili Cohen hesaplamasıdır, 3 değerlendiriciden oluşan bir panelin uyumlu olup olmadığını değil. Krippendorff'un alfası tek bir sayı verir ancak üç çifti birbirine karıştırır ve çift düzeyindeki varyansı gizler.
CUAD özelinde: Claude × Qwen κ=0.974'e ulaşırken, Claude × Gemini ve Gemini × Qwen κ=0.86 civarında kalır, bu da Gemini-3-flash-preview'i hukuk sözleşmelerinde en gürültülü yargıç olarak izole eder. Bu bilgi, ortalamayla yok edilmek yerine ortaya çıkarılmayı hak eden bir yöntem sinyalidir.
Bir alanı, n-ağırlıklı-ortalama kappa 0.85'i aştıktan sonra üretime yükselttik. Üçü de aştı. MedRAG'ın 0.986'i etkili bir şekilde tavandır: 156 denemedeki iki uyuşmazlık, her iki doğrulayıcının da dahili olarak tutarlı olduğu ancak birinin ilgili-ama-altın-olmayan bir özet seçtiği tıbbi olarak belirsiz hedefler üzerindeydi.
R9 varlık anonimleştirme kural seti (alan başına)
R9, sorgu üretimi sırasında katı bir kısıtlamadır. O olmadan, adlandırılmış varlıklar mükemmel anahtar sözcük kestirmeleri olarak hareket ettiği için BM25 10'da nDCG@0.97 üzerine çıkar; dense embedding'lerin ölçecek anlamsal bir üstünlüğü kalmaz. Kural, o alandaki erişim sinyalini gerçekten taşıyan bağlantı noktalarının kullanılabilir kalması için alan başına uyarlanır:
- CUAD katı. Tüm adlandırılmış varlıkları yasaklayın: taraf adları, ABD eyalet adları, personel, tam dolar cinsinden parasal tutarlar, belirli ürün adları. Tanımlayıcı benzersizliği zorunlu kılın: sektör + rol + zamansal dönem + parasal aralık + coğrafi kapsam. R9 uygulandıktan sonra BM25 tavanı 0.97'den 0.591'e düştü.
- TechQA Seçenek X. Sorgu ayrıca ikincil bir ürün dışı tanımlayıcı bağlantı noktası (belirti sınıfı, hata kodu ailesi, sürüm dönemi, dağıtım bağlamı) içeriyorsa IBM ürün adlarına (bir sistem yöneticisi için birincil erişim sinyalidir) izin verilir. Müşteri adları, ABD eyaletleri, personel hala yasak. BM25 tavanı: 0.664.
- MedRAG tıbbi-gevşek + halüsinasyon-güvenli. İlaç adları, hastalık terimleri, anatomi, gen sembolleri, kaynaktan aynen korunur, çünkü ilaç sınıfı etiketleriyle değiştirme farmakoloji halüsinasyonu riski taşır ("p-chloroamphetamine" bir amfetamin sınıfı serotonin salıcısıdır, ancak daha nadir ilaçların LLM etiket çevirileri sessizce başarısız olur). Sorgu, sadece ilaç adı anahtar sözcük eşleşmesinin sonucu taşımaması için ≥2 ilaç dışı bağlantı noktası içermelidir. BM25 tavanı: 0.809 (alanın yapısal özelliği, bir yöntem kusuru değil).
Örnek sorgular
Her örnek için, sorgu embedding modeline beslediğimiz metindir. Altın belge, korpustaki (509 CUAD sözleşmesi, 28,000 TechQA teknik notu veya 50,000 PubMed özeti arasından) sorguyu gerçekten yanıtlayan tek öğedir. Erişim görevi: sorguyu embed et, korpustaki her belgeye karşı kosinüs benzerliğini hesapla ve onları sırala. Altın belge 1. sıraya düşerse sorgu nDCG@3'te 1.000 puan alır; 2. sıra 0.631 puan; 3. sıra 0.500 puan; ilk 3'ün altı 0 puan alır.
CUAD (hukuk)
Sorgu:
Altın belge (509 CUAD sözleşmesinden 1'i): ANIXABIOSCIENCESINC_06_09_2020-EX-10.1-COLLABORATION AGREEMENT. COVID-19 ilaç keşfi için bir Alman firması ile bir ABD biyoteknoloji şirketi arasındaki 2020 yılında yapılmış bir işbirliğidir; sözleşme, bir klinik deneyin I. Fazına ilk hasta girdiğinde ödenmesi gereken bir kilometre taşı ödemesi belirtir. Sorgu hiçbir taraf adı, parasal tutar veya iki ülke token'ı dışında coğrafya içermez; erişim sinyali sektör + zamansal + kilometre taşı yapısıdır.
TechQA (müşteri desteği)
Sorgu:
Altın belge (28,000 IBM teknik notundan 1'i): swg1IY43185, tam olarak bu WebSEAL hatasını belgeleyen ve onu düzelten yamayı adlandıran not. IBM ürün adına (WebSEAL) TechQA R9 varyantımız kapsamında izin verilir, ancak ayrıştırıcı, hatanın davranışsal modeli ve istek sıralama bağlantı noktasıdır, yalnızca ürün adı değil.
MedRAG (sağlık hizmetleri)
Sorgu:
Altın belge (50,000 PubMed özetinden 1'i): PMID:231299, idrar yolu enfeksiyonu olan hamile kadınlarda sefradin ve pivmesilinam arasındaki advers reaksiyon bırakma oranlarını karşılaştıran bir klinik araştırmadır. İlaç adları korunur çünkü ilaç-karşılaştırma, erişim sinyalidir, ancak sorgu hasta popülasyonu + tedavi süresi + advers olay çerçevesi ekler, böylece yalnızca ilaç adı BM25 eşleşmesi hedefi tek başına bulmaz.
İstatistiksel protokol
Bootstrap %95 güven aralıkları, sorgu başına metrik vektörü üzerinde, tohum=2026 ile persentil yöntemi, 10,000 yeniden örnekleme kullanır. A modeli ile B modeli arasındaki ikili anlamlılık için aynı sorgu endeksleri üzerinde eşleştirilmiş bootstrap (iddia, A > B olan yeniden örneklemelerin ≥%95'ini gerektirir).
(Model, alan) hücresi başına tek çalıştırma. Maliyet nedenleriyle 3 çalıştırmalı çapraz oturum varyans katmanı v2.1'e ertelenmiştir. Oturum içi embedding API çağrıları, nokta kontrolünde doğrulanan milyonda birkaç parça kosinüs farkıyla deterministiktir; bu nedenle bootstrap GA, n=150-246'da baskın varyans kaynağı olan sorgu düzeyindeki gürültüyü yakalar.
Dizinleme ve puanlama
Vektör veritabanı yok. Her model, her korpus belgesini bir kez kodlar; kosinüs benzerliği, L2-normalleştirilmiş embedding'lerin yoğun bir matris çarpımı olarak doğrudan NumPy'de hesaplanır. Bu kesin sonuç verir, yaklaşık değil, bu nedenle sıra eşitlikleri ANN yapaylıkları değil, gerçek model eşitlikleridir.
Model başına parçalama kuralı: 512-bağlam modelleri 512+64 örtüşme ile parçalar; 8K-20K-bağlam modelleri, örtüşme olmadan bağlama göre parçalar; 32K+-bağlam modelleri, sığdığında tam belgeyi alır (CUAD'ın %9'luk uzun kuyruğu Nemotron olmayan her bağlam penceresini aşar ve parçalamaya geri döner; çapraz model adaleti, aynı bağlam-boyutu başına politikayı her modele uygulayarak korunur).
Model başına asimetrik erişim çağrısı, en etkili tek yöntem detayıdır ve özel bir bölümü hak eder. gemini-embedding-2-preview 0.46 nDCG@10 OpenRouter'ın belgelenmiş kod örneği altında puan alırken, 0.91 Google Vertex AI formatı altında puan alır. Aile başına tablo için yukarıdaki "Embedding erişim işlem hattı nasıl değerlendirildi" bölümüne bakın.
Eval çerçevesi: birincil metrik motoru olarak ranx; MTEB lider tablosu gönderimleriyle uyumlu trec_eval tarzı çıktı. Bootstrap GA, değerlendirme geçişinde kaydedilen sorgu başına metrik dizileri üzerinden scripts/bootstrap_ci.py tarafından hesaplanır.
Test edilen modeller
Fiyatlar, OpenRouter kataloğundan ve Voyage doğrudan fiyatlandırma sayfasından 2026-04-23 itibarıyladır.
%95 bootstrap GA ile model başına nDCG@3
Bootstrap %95 güven aralıkları, sorgu başına metrik vektörünün (persentil yöntemi, tohum=2026) 10,000 yeniden örneklemesi ile hesaplanır. Bu örneklem büyüklüklerinde (n=154-246) GA genişlikleri 0.03-0.07 olması, yaklaşık ~0.03 altındaki nokta tahmini farklarının gürültü içinde olduğu ve eşitlik olarak değerlendirilmesi gerektiği anlamına gelir. 3-alan ortalama nDCG@3'e göre sıralanmıştır:
%95 GA'da nokta tahmini sıralamalarının anlamlı olmadığı dört istatistiksel eşitlik:
Kısıtlılıklar
Bir yazar tarafından insan incelemesi: Bir yazar, doğallık, hedef uyumu ve R9 uyumu için nihai kabul edilen sorguların yaklaşık %25'ini nokta incelemesinden geçirdi.
Sonuç
voyage-3.5, hukuk, müşteri desteği ve sağlık hizmetleri genelinde ortalama 0.9429 nDCG@3 elde ederek, Voyage'ın kendi amiral gemisini yarı fiyatına ve OpenAI'ın text-embedding-3-large'ını yarıdan daha az fiyata 0.13 nDCG@3 farkla geçiyor.
Embedding maliyetinin yuvarlama hatası olması gerekiyorsa $0.004/M ile pplx-embed-v1-0.6b'yi seçin. En üst Pareto noktası için $0.060/M ile voyage-3.5'i seçin. Açık kaynakta kalmak için $0.010/M ile qwen/qwen3-embedding-8b'yi seçin. voyage-law-2'yi yalnızca CUAD'a bitişik hukuk erişimi için kullanın; burada CUAD'da +0.04 nDCG@3 satın alır ve başka hiçbir yerde işe yaramaz.
Daha fazla bilgi
Diğer RAG kıyaslamalarını keşfedin, örneğin:
- RAG için En İyi 10 Çok Dilli Embedding Modeli
- RAG için En İyi 16 Açık Kaynak Embedding Modeli
- RAG için En İyi Vektör Veritabanı: Qdrant vs Weaviate vs Pinecone
- Yeniden Sıralayıcı Kıyaslaması: En İyi 8 Model Karşılaştırıldı
- Çok Modlu Embedding Modelleri: Apple vs Meta vs OpenAI
- Hibrit RAG: RAG Doğruluğunu Artırma
- Graph RAG vs Vektör RAG
Bu benchmarkı kaynak gösterin
Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Embedding Modelleri: OpenAI vs Gemini vs Voyage}},
year = {2026},
month = apr,
howpublished = {\url{https://aimultiple.com/embedding-models}},
note = {AIMultiple. Erişim tarihi: 25 Nisan 2026}
}0 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, 0 CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.
Yorum yapan ilk kişi olun
E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.