Hizmetler
Bize Ulaşın

En İyi 10 Çok Dilli Embedding Model'leri RAG için

Ekrem Sarı
Ekrem Sarı
Güncellenme tarihi: 20 Şub 2026

10 çok dilli embedding model'ini ~606k Amazon yorumu üzerinde 6 dilde (Almanca, İngilizce, İspanyolca, Fransızca, Japonca, Çince) kıyasladık. 1,800 sorgu oluşturduk (dil başına 300), her biri kaynak incelemesinden somut ayrıntılara değinir.

Arama için eğitilmiş modeller (sorgu vs belge ayrımı), genel metin benzerliği için eğitilmiş daha büyük modellerden daha iyi performans gösterir: e5_base (110M parametre), 5x ila 70x daha fazla parametreli modellerden üstün gelirken, yaygın olarak atıfta bulunulan çok dilli bir model olan LaBSE (471M parametre) sondan ikinci sırada yer alır.

Çok dilli erişim doğruluğu

Top-1, doğru incelemenin döndürülen ilk sonuç olup olmadığını ölçer; Top-10, ilk on sonuç arasında herhangi bir yerde görünüp görünmediğini ölçer.

Top-1 doğruluğu

Loading Chart

Top-3 doğruluğu

Top-5 doğruluğu

Top-10 doğruluğu

Metrikler açıklandı

  • Top-K doğruluğu: Doğru belgenin (product_id tam eşleşme ile) ilk K sonuç arasında görünüp görünmediğini ölçer. “Model, ~130k Almanca yorum arasında Almanca bir soru sorulduğunda doğru Almanca incelemeyi bulabilir mi?”
  • Top-1/3/5/10: Test edilen K değerleri. Top-1 en katıdır (doğru belge ilk sonuç olmalıdır), Top-10 en esnektir.

Değerlendirme ve metriklerimizi ayrıntılı olarak anlamak için değerlendirme kurulumumuza ve çok dilli embedding modelleri için kıyaslama metodolojimize bakın.

Derlem: ~606k inceleme (min_review_length≥100 karakter; ZH: ~17.7k, DE/EN/ES/FR/JA: her biri ~120–145k), kosinüs benzerliği geri dönüşü olmadan, yalnızca tam product_id eşleşmesi. NVIDIA H100 PCIe 80GB üzerinde değerlendirildi.

Gecikme ve çıktı

Gecikme süresi, bir modelin üretim için uygun olup olmadığını belirler. 15ms altı gecikmeli modeller gerçek zamanlı aramayı destekleyebilir; 25ms üzerinde ise yığın işleme veya önbelleğe alma gereklidir.

Temel bulgular

1. e5_base tüm dillerde liderdir

e5_base, 6 dil genelinde ortalama %16.5 Top-1 başarısı yakalayarak ikinci modeli (e5_small) 3.8 puan geride bırakır. Asimetrik sorgu/pasaj öneki eğitimi, aynı dildeki anlamsal olarak benzer incelemeler arasında iyi ayrım yapabilen kesin embedding'ler üretir.

2. LLM tabanlı modeller boyutlarına rağmen rekabetçidir

qwen3_emb_06b (600M parametre) ve llama_embed_nemotron_8b (8B parametre), her ikisi de %10+ tek dilli doğruluk elde eder. Devasa çok dilli ön eğitimleri, erişim ince ayarının tamamen silemeyeceği temsiller oluşturur ve parametre sayısının çok altındaki modellerle rekabetçi kalmaya devam eder. nemotron, Top-10'da %25.8'e ulaşarak genel olarak en iyi üçüncü sonucu alır.

3. nomic_embed_v1_5 CJK dillerinde başarısız olur

nomic, Çincede %0, Japoncada ise yalnızca %4 doğruluk elde eder; bu, tüm dillerde tamamen başarısız olan tek modeldir. İngilizce (%17 Top-1) ve Almanca (%9) için iyi çalışmasına rağmen, İngilizce merkezli eğitimi, search_query/search_document öneki asimetrisiyle birleşerek Avrupa dışı diller için ciddi kapsam boşlukları oluşturur.

4. LaBSE, ününe rağmen erişimde başarısız olur

LaBSE, açıkça çok dilli anlamsal benzerlik için tasarlanmıştı ve literatürde yaygın olarak atıfta bulunulmaktadır. Bu kıyaslamada sondan ikinci sırada yer alır (%4.8 Top-1). Çeviri çiftleri ve doğal dil çıkarımı üzerine eğitimi, erişim için gereken ayırt edici kesinliği inşa etmemiştir: aynı dildeki yüzlerce anlamsal olarak benzer ürün arasından tam kaynak incelemeyi ayırt etme.

5. Top-10 ölçeklendirmesi tüm modellere fayda sağlar, ancak özellikle daha güçlü olanlara

Top-1'den Top-10'a geçiş, genel olarak geri getirmeyi ikiye katlar. nemotron, Top-1'de (%12.0) 3. sırada olmasına rağmen en iyi Top-10 tek dilli ortalamayı (%25.8) gösterir, bu da 4096 boyutlu uzayının daha yüksek K değerlerinde iyi en yakın komşu yapısına sahip olduğunu düşündürür.

6. İspanyolca ve Fransızca sürekli olarak daha düşük performans gösterir

Tüm modellerde, İspanyolca ve Fransızca, Almanca, İngilizce, Japonca ve Çince'den sürekli olarak daha düşük sıralarda yer alır. Bu durum, açıkça çok dilli eğitime sahip modeller için bile geçerlidir ve ön eğitim derlemlerinde bu dillerin daha düşük temsil edilmesini ya da ürün incelemeleri için alan uyumsuzluğunu düşündürür.

Çok dilli embedding'ler nasıl çalışır

Bir embedding modeli, metni, metnin belirli kelimelerden ziyade anlamını yakalayan yüksek boyutlu bir vektöre (örneğin, 384 veya 768 sayı) dönüştürür. Anlamsal olarak benzer iki metin, dil fark etmeksizin bu uzayda birbirine yakın vektörlere sahip olmalıdır.

Çok dilli bir embedding modeli, aynı vektör uzayında birden çok dili işler. Erişim için kullanıldığında, modelin, genellikle benzer ürünleri ve konuları ele alan on binlerce aynı dildeki inceleme arasından doğru belgeyi bulması gerekir. Zorluk, ayırt edici kesinliktir: aynı kategorideki yüzlerce anlamsal olarak benzer inceleme arasından tam kaynak incelemeyi ayırt etme.

Çok dilli değerlendirme kurulumu

~606k ürün incelemesi Qdrant'ta indekslenmiştir (yalnızca gövdesi ≥100 karakter olan incelemeler; ZH: ~17.7k, diğer diller: her biri ~120–145k). Aynı uzunluk eşiğini karşılayan incelemelerden bir LLM tarafından doğal olarak 1,800 sorgu (dil başına 300) oluşturulmuştur. Her sorgu, kaynak incelemesinden somut ayrıntılara (ölçüler, miktarlar, marka adları, zaman çizelgeleri) atıfta bulunmalıdır; genel sorular bir özgüllük puanı aracılığıyla filtrelenir. X dilinde bir sorgu verildiğinde, kaynak incelemeyi aynı dildeki incelemeler arasında bulma görevidir. Qdrant sonuçları dile göre filtreler. Doğruluk, kosinüs benzerliği geri dönüşü olmadan Top-1/3/5/10'da tam product_id eşleşmesi ile ölçülür.

Kıyaslamadan örnek sorgular:

Almanca (elektronik, GÖRÜŞ):

Fransızca (eczane, KULLANIM):

İspanyolca (endüstriyel malzemeler, OLGUSAL):

Modelin her sorguyu, tam kaynak incelemesiyle product_id ile eşleştirmesi gerekir. Anten kablosundan WiFi sinyal kaybıyla ilgili bir sorgu, bağlantı sorunlarını ele alan binlerce elektronik incelemeye anlamsal olarak uyabilir; yalnızca biri, bu belirli kabloyu taktıktan sonra sinyalin %60'tan %20'ye düştüğünü açıklar.

Ekibimiz, iş süreçlerinizden birini yapay zeka ajanlarıyla ücretsiz olarak otomatikleştirsin.
Bir süreci otomatikleştir

Teknik analiz ve öneriler

Simetrik ve asimetrik modeller

Eğitim hedefi, büyük ölçüde erişim performansını öngörür:

Asimetrik modeller neden en iyi performansı gösterir: Sorgu/pasaj öneki, modeli sorguları ve belgeleri uzayın sistematik olarak farklı bölgelerine yerleştirecek şekilde eğitir, erişime özgü bir geometri oluşturur. Bu, anlamsal olarak benzer ancak farklı belgeleri ayıran daha ayırt edici embedding'ler üretir. e5_base, bunu 110M parametreyle başarır çünkü erişim kesinliğini yönlendiren eğitim hedefidir, model kapasitesi değil.

LLM tabanlı modeller neden rekabetçidir: Devasa çok dilli ön eğitim, model ağırlıklarında zengin anlamsal yapı inşa eder. Erişim ince ayarı, bu derin dil anlayışının üzerine göreve özgü hizalama ekler ve rekabetçi performansla sonuçlanır. Takas, gecikme süresidir: nemotron'un 4096 boyutlu vektörleri sorgu başına 25ms, e5_base için ise 11ms'dir.

LaBSE ününe rağmen neden başarısız olur: LaBSE, çeviri çiftleri üzerinde eğitilerek cümle düzeyinde anlamı diller arasında yaklaştırmak için eğitildi; bu bir benzerlik görevidir. Erişim ise temelde farklıdır: tam kaynak incelemeyi aynı dildeki yüzlerce anlamsal olarak benzer üründen ayırt etmeyi gerektirir. Benzerlik eğitimi, kaba taneli anlamsal yakınlık için optimize eder; erişim, neredeyse aynılar arasında ince taneli ayrım yapmayı talep eder.

Hangi modeli kullanmalısınız?

En iyi doğruluk: e5_base (%16.5 Top-1, 11ms gecikme). Dil filtresiyle kullanın.

En iyi gecikme/doğruluk dengesi: e5_small (%12.7 Top-1, 9.7ms), minilm ile neredeyse aynı hızda ve daha iyi doğruluk.

En iyi top-10 geri getirme: nemotron (%25.8 Top-10), eğer 25ms gecikmeyi ve 4096 boyutlu vektörler için GPU belleğini karşılayabiliyorsanız.

Gecikme hassas üretim sistemleri için: e5_small veya minilm ~10ms ile. e5_small kesinlikle tercih edilir (%12.7 vs %3.8).

Sorgu ve belge dillerinin eşleştiğini bildiğinizde her zaman bir dil filtresi kullanın. Tüm modeller, dil filtresi uygulanmış aramada önemli doğruluk artışı gösterir.

Çok dilli embedding modelleri metodolojisi

  • GPU: NVIDIA H100 PCIe 80GB (Runpod aracılığıyla)
  • Vektör veritabanı: Qdrant 1.12.0 (yerel ikili)
  • Embedding kütüphanesi: sentence-transformers 5.2.2
  • Sorgu oluşturma: Claude Sonnet 4.6, OpenRouter aracılığıyla. Her soru, kaynak incelemesindeki belirli ayrıntılara atıfta bulunmalıdır; genel sorular (özgüllük puanı
  • Veri seti: Amazon Reviews Multi (Kaggle)1 , train.csv. ~606k inceleme indekslendi (en az 100 karakter; ZH: ~17.7k, diğerleri: her biri ~120-145k). 6 dil: DE, EN, ES, FR, JA, ZH.
  • Sorgular: Toplam 1,800 (dil başına 300, 5 soru türü, her dilde doğal olarak oluşturulmuştur).
  • Belge biçimi: "Review Title: {title}\nReview: {body}"
  • Doğru cevap: yalnızca product_id tam eşleşmesi. Kosinüs benzerliği geri dönüşü yok.
  • Arama: Qdrant vektör araması, kosinüs mesafesi ile. Top-K = 10. Tek dilli değerlendirme için dil filtresi uygulandı.
  • Embedding: L2 normalleştirme. Uygun yerlerde asimetrik önekler: "query: "/"passage: " (e5), "search_query: "/"search_document: " (nomic).
  • İnce ayar yapılmadı: Tüm modeller, varsayılan ağırlıklarla sıfır atış olarak değerlendirildi.
  • Gecikme: Yalnızca embedding çıkarımı (tek sorgu). Vektör arama süresini kapsamaz.

Değerlendirilen Modeller

Skorlar neden BEIR/MTEB'den daha düşük

Bu kıyaslamadaki mutlak doğruluk rakamları, BEIR veya MTEB'de raporlanan skorlarla doğrudan karşılaştırılmamalıdır. İki kıyaslama yapısal olarak birkaç açıdan farklılık gösterir:

Tam eşleşme metriği en büyük yapısal farktır. Her sorgu, kaynak incelemesinden somut ayrıntılara atıfta bulunur (örneğin, “3D yazıcının kedi dosyasını SD karttan basması kaç saat sürdü?”), dolayısıyla her sorgunun net bir hedefi vardır, ancak metrik, farklı bir üründen anlamsal olarak ilgili bir inceleme için yine de sıfır verir. nDCG gibi kısmi kredi metrikleri, aynı erişim sonuçlarında daha yüksek rakamlar üretecektir. Bu kıyaslamada önemli olan, mutlak rakamlar değil, modeller arasındaki göreceli sıralamadır.

Google Arama'da daha fazla kıyaslamamızı ve veri odaklı içgörülerimizi görün.
GoogleTercih edilen kaynak olarak ekle

Sınırlamalar

  • Soru türleri gerçek kullanıcı sorgularını temsil etmeyebilir. LLM tarafından üretilen sorular, iyi biçimlendirilmiş ve belirgin olma eğilimindedir. Gerçek kullanıcılar genellikle parçalı veya belirsiz sorgular yazar.
  • Yalnızca yoğun erişim test edilmiştir. Seyrek yöntemler (BM25), hibrit erişim ve yeniden sıralama boru hatları değerlendirilmemiştir. Bunlar, modeller arasındaki sıralamayı önemli ölçüdeğiştirebilir.
  • Dil başına 300 sorgu makul bir örneklemdir. Dil başına sonuçlar oldukça dar güven aralıklarına sahiptir, ancak tablonun ortasındaki sıralamalar yine de ihtiyatla yorumlanmalıdır.
  • Erişim dışında embedding kalitesi değerlendirilmemiştir. Kümeleme kalitesi, anlamsal benzerlik doğruluğu ve diğer aşağı akış görevleri ölçülmemiştir.

Sonuç

Arama için eğitilmiş modeller (ayrı sorgu ve belge embedding'leri ile), boyutuna bakılmaksızın genel metin benzerliği için eğitilmiş modelleri sürekli olarak geride bırakır. e5_base (110M parametre), 5x ila 70x daha büyük modellerden daha iyi performans gösterir. Çok dilli görevler için yaygın olarak atıfta bulunulan LaBSE (471M parametre), benzerlik eğitimi erişimin gerektirdiği ince taneli ayrımı inşa etmediği için sondan ikinci sırada yer alır.

LLM tabanlı modeller (qwen3 600M parametre ile, nemotron 8B parametre ile), derin çok dilli ön eğitim sayesinde rekabetçi doğruluk elde eder, ancak bunun bedelini gecikme süresinde öderler: nemotron sorgu başına 25ms maliyet çıkarırken, e5_base için bu 11ms'dir ve yalnızca çok az daha iyi Top-10 geri getirme sağlar. Çoğu üretim sistemi için, daha küçük, arama için eğitilmiş modeller daha iyi bir denge sunar.

Çok dilli RAG sistemleri inşa eden uygulayıcılar için, e5_base bir dil filtresiyle açık ara en iyi seçimdir (%16.5 Top-1, 11ms gecikme ve ikinci sıranın 3.8 puan önünde).

Daha fazla bilgi

Aşağıdakiler gibi diğer RAG kıyaslamalarını keşfedin:

Bu benchmarkı kaynak gösterin

Yayınlayacağınız yere uygun formatı seçin. Bağlantılı sürümü CMS'inize yapıştırmak, geri bağlantıyı korur.

Ekrem Sarı (2026) - "En İyi 10 Çok Dilli Embedding Model'leri RAG için". AIMultiple.com adresinde çevrimiçi yayımlanmıştır. Erişim tarihi: 20 Şubat 2026, kaynak: https://aimultiple.com/multilingual-embedding-models [Çevrimiçi Kaynak]

Sarı, E. (2026, 20 Şubat). En İyi 10 Çok Dilli Embedding Model'leri RAG için. AIMultiple. https://aimultiple.com/multilingual-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{En İyi 10 Çok Dilli Embedding Model'leri RAG için}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/multilingual-embedding-models}},
  note   = {AIMultiple. Erişim tarihi: 20 Şubat 2026}
}
Tüm verileri indir

10 veri noktasının sonuçları ve zaman damgaları. Bu makalede kullanılan verileri, bir CSV dosyası ve bir README içeren ZIP dosyası olarak indirin.

Son güncelleme: 15 Temmuz 2026
İndir
Ekrem Sarı
Ekrem Sarı
Yapay Zeka Araştırmacısı
Ekrem, AIMultiple'da Yapay Zeka Araştırmacısı ve Veri Analistidir. Yapay zeka ve LLM sistemleri için uygulamalı kıyaslamalar tasarlar ve yürütür.
Tam Profili Görüntüle

Yorum yapan ilk kişi olun

E-posta adresiniz yayınlanmayacak. Tüm alanlar gereklidir. Yorumlar orijinal dilinde bırakılır.

0/450