Services
Contactez-nous

Top 10 des modèles d'embedding multilingues pour RAG

Ekrem Sarı
Ekrem Sarı
mis à jour le 20 févr. 2026

Nous avons évalué 10 modèles d’embedding multilingues sur environ 606k avis Amazon dans 6 langues (allemand, anglais, espagnol, français, japonais, chinois). Nous avons généré 1,800 requêtes (300 par langue), chacune faisant référence à des détails concrets de son avis source.

Les modèles entraînés pour la recherche (séparation requête vs document) surpassent les modèles plus grands entraînés pour la similarité textuelle générale : e5_base (110M paramètres) surpasse les modèles ayant 5x à 70x plus de paramètres, tandis que LaBSE (471M paramètres), un modèle multilingue largement cité, se classe avant-dernier.

Précision de la recherche multilingue

Le Top-1 mesure si l’avis correct est le premier résultat retourné ; le Top-10 mesure s’il apparaît quelque part dans les dix premiers.

Précision Top-1

Loading Chart

Précision Top-3

Précision Top-5

Précision Top-10

Explication des métriques

  • Précision Top-K : Indique si le document correct (par correspondance exacte de product_id) apparaît dans les K premiers résultats. « Le modèle peut-il trouver le bon avis allemand lorsqu’on lui pose une question en allemand parmi environ 130k avis allemands ? »
  • Top-1/3/5/10 : Valeurs de K testées. Top-1 est le plus strict (le document correct doit être le premier résultat), Top-10 est le plus tolérant.

Pour comprendre notre évaluation et nos métriques en détail, consultez notre configuration d’évaluation et notre méthodologie de benchmark pour les modèles d’embedding multilingues.

Corpus : environ 606k avis (min_review_length ≥ 100 caractères ; ZH : environ 17.7k, DE/EN/ES/FR/JA : environ 120–145k chacun), sans recours à la similarité cosinus, correspondance exacte product_id uniquement. Évalué sur NVIDIA H100 PCIe 80GB.

Latence et débit

La latence détermine si un modèle est viable pour la production. Les modèles avec une latence inférieure à 15ms peuvent prendre en charge la recherche en temps réel ; au-dessus de 25ms, le traitement par lots ou la mise en cache est nécessaire.

Principaux résultats

1. e5_base domine toutes les langues

e5_base atteint une moyenne Top-1 de 16,5 % sur 6 langues, surpassant le modèle suivant (e5_small) de 3,8 points de pourcentage. Son entraînement asymétrique avec préfixes requête/passage produit des embeddings précis qui discriminent bien entre des avis sémantiquement similaires dans la même langue.

2. Les modèles basés sur LLM sont compétitifs malgré leur taille

qwen3_emb_06b (600M paramètres) et llama_embed_nemotron_8b (8B paramètres) atteignent tous deux une précision monolingue de 10 % ou plus. Leur pré-entraînement multilingue massif semble construire des représentations que le fine-tuning pour la recherche ne peut pas entièrement effacer, tout en restant compétitifs avec des modèles ayant une fraction de leurs paramètres. nemotron atteint 25,8 % au Top-10, le troisième meilleur résultat global.

3. nomic_embed_v1_5 échoue sur les langues CJK

nomic atteint une précision de 0 % en chinois et seulement 4 % en japonais, le seul modèle à échouer complètement sur des langues entières. Son entraînement centré sur l’anglais combiné à l’asymétrie des préfixes search_query/search_document crée de graves lacunes de couverture pour les langues non européennes, bien qu’il fonctionne bien pour l’anglais (17 % Top-1) et l’allemand (9 %).

4. LaBSE échoue en recherche malgré sa réputation

LaBSE a été explicitement conçu pour la similarité sémantique multilingue et est largement cité dans la littérature. Dans ce benchmark, il se classe avant-dernier (4,8 % Top-1). Son entraînement sur des paires de traduction et l’inférence en langage naturel n’a pas développé la précision discriminative requise pour la recherche : distinguer l’avis source exact de centaines de produits sémantiquement similaires dans la même langue.

5. Le passage au Top-10 profite à tous les modèles, mais surtout aux plus performants

Le passage du Top-1 au Top-10 double le rappel globalement. nemotron affiche la meilleure moyenne monolingue au Top-10 (25,8 %) bien qu’il se classe 3e au Top-1 (12,0 %), ce qui suggère que son espace à 4096 dimensions a une bonne structure de voisins les plus proches à des K plus grands.

6. L’espagnol et le français sous-performent constamment

Pour tous les modèles, ES et FR se classent constamment moins bien que DE, EN, JA et ZH. Ce schéma se vérifie même pour les modèles avec un entraînement multilingue explicite, ce qui suggère une représentation plus faible dans les corpus de pré-entraînement ou une inadéquation de domaine pour les avis sur les produits.

Comment fonctionnent les embeddings multilingues

Un modèle d’embedding convertit le texte en un vecteur de grande dimension (par exemple, 384 ou 768 nombres) qui capture le sens du texte plutôt que les mots spécifiques. Deux textes sémantiquement similaires doivent avoir des vecteurs proches dans cet espace, quelle que soit la langue.

Un modèle d’embedding multilingue gère plusieurs langues dans le même espace vectoriel. Lorsqu’il est utilisé pour la recherche, le modèle doit trouver le document correct parmi des dizaines de milliers d’avis dans la même langue qui discutent souvent de produits et de sujets similaires. Le défi est la précision discriminative : distinguer l’avis source exact de centaines d’avis sémantiquement similaires dans la même catégorie.

Configuration de l’évaluation multilingue

Environ 606k avis produits sont indexés dans Qdrant (seulement les avis avec un corps de ≥ 100 caractères ; ZH : environ 17.7k, autres langues : environ 120–145k chacun). 1,800 requêtes (300 par langue) sont générées nativement par un LLM à partir des avis satisfaisant le même seuil de longueur. Chaque requête doit faire référence à des détails concrets de son avis source (mesures, quantités, noms de marques, chronologies) ; les questions génériques sont filtrées via un score de spécificité. Pour une requête dans la langue X, la tâche consiste à retrouver l’avis source parmi les avis de la même langue. Qdrant filtre les résultats par langue. La précision est mesurée par correspondance exacte du product_id au Top-1/3/5/10, sans recours à la similarité cosinus.

Exemples de requêtes du benchmark :

Allemand (électronique, OPINION) :

Français (parapharmacie, USAGE) :

Espagnol (fournitures industrielles, FACTUAL) :

Le modèle doit faire correspondre chaque requête à son avis source exact par product_id. Une requête sur la perte de signal WiFi d’un câble d’antenne pourrait correspondre sémantiquement à des milliers d’avis d’électronique traitant de problèmes de connectivité ; un seul décrit une chute du signal de 60 % à 20 % après l’installation de ce câble spécifique.

article.automate_process_description
article.automate_process_button

Analyse technique et recommandations

Modèles symétriques vs asymétriques

L’objectif d’entraînement prédit largement la performance de recherche :

Pourquoi les modèles asymétriques sont les plus performants : Le préfixe requête/passage entraîne le modèle à intégrer les requêtes et les documents dans des régions systématiquement différentes de l’espace, créant une géométrie spécifique à la recherche. Cela produit des embeddings plus discriminants qui séparent les documents sémantiquement similaires mais distincts. e5_base y parvient avec 110M paramètres car c’est l’objectif d’entraînement, et non la capacité du modèle, qui détermine la précision de recherche.

Pourquoi les modèles basés sur LLM sont compétitifs : Le pré-entraînement multilingue massif construit une structure sémantique riche dans les poids du modèle. Le fine-tuning pour la recherche ajoute un alignement spécifique à la tâche par-dessus cette compréhension profonde du langage, ce qui donne des performances compétitives. Le compromis est la latence : les vecteurs à 4096 dimensions de nemotron coûtent 25ms par requête contre 11ms pour e5_base.

Pourquoi LaBSE échoue malgré sa réputation : LaBSE a été entraîné sur des paires de traduction pour rapprocher le sens au niveau des phrases entre les langues, une tâche de similarité. La recherche est fondamentalement différente : elle exige de distinguer l’avis source exact de centaines de produits sémantiquement similaires dans la même langue. L’entraînement à la similarité optimise une proximité sémantique grossière ; la recherche exige une discrimination fine entre quasi-doublons.

Quel modèle devriez-vous utiliser ?

Meilleure précision : e5_base (16,5 % Top-1, 11ms de latence). À utiliser avec un filtre de langue.

Meilleur compromis latence/précision : e5_small (12,7 % Top-1, 9,7ms), presque aussi rapide que minilm avec une meilleure précision.

Meilleur rappel Top-10 : nemotron (25,8 % Top-10) si vous pouvez vous permettre la latence de 25ms et la mémoire GPU pour des vecteurs à 4096 dimensions.

Pour les systèmes de production sensibles à la latence : e5_small ou minilm à environ 10ms. e5_small est fortement préféré (12,7 % contre 3,8 %).

Utilisez toujours un filtre de langue lorsque vous savez que la langue de la requête et celle des documents correspondent. Tous les modèles montrent des gains de précision significatifs avec une recherche filtrée par langue.

Méthodologie des modèles d’embedding multilingues

  • GPU : NVIDIA H100 PCIe 80GB via Runpod
  • Base de données vectorielle : Qdrant 1.12.0 (binaire local)
  • Bibliothèque d’embedding : sentence-transformers 5.2.2
  • Génération de requêtes : Claude Sonnet 4.6 via OpenRouter. Chaque question doit faire référence à des détails spécifiques de son avis source ; les questions génériques (score de spécificité < 4/5) sont filtrées.
  • Jeu de données : Amazon Reviews Multi (Kaggle)1 , train.csv. Environ 606k avis indexés (minimum 100 caractères ; ZH : environ 17.7k, autres : environ 120-145k chacun). 6 langues : DE, EN, ES, FR, JA, ZH.
  • Requêtes : 1,800 au total (300 par langue, 5 types de questions, générées nativement dans chaque langue).
  • Format du document : "Review Title: {title}\nReview: {body}"
  • Vérité terrain : correspondance exacte product_id uniquement. Aucun recours à la similarité cosinus.
  • Recherche : recherche vectorielle Qdrant avec distance cosinus. Top-K = 10. Filtre de langue appliqué pour l’évaluation monolingue.
  • Embedding : normalisation L2. Préfixes asymétriques le cas échéant : "query: " / "passage: " (e5), "search_query: " / "search_document: " (nomic).
  • Aucun fine-tuning : Tous les modèles évalués en zero-shot avec les poids par défaut.
  • Latence : Inférence d’embedding uniquement (requête unique). N’inclut pas le temps de recherche vectorielle.

Modèles évalués

Pourquoi les scores sont inférieurs à BEIR/MTEB

Les scores de précision absolus de ce benchmark ne doivent pas être comparés directement à ceux rapportés sur BEIR ou MTEB. Les deux benchmarks diffèrent structurellement sur plusieurs aspects :

La métrique de correspondance exacte est la plus grande différence structurelle. Chaque requête fait référence à des détails concrets de son avis source (par exemple, « Combien d’heures l’imprimante 3D a-t-elle mis pour imprimer le fichier chat depuis la carte SD ? »), de sorte que chaque requête a une cible unique claire, mais la métrique attribue toujours zéro pour un avis sémantiquement pertinent d’un produit différent. Les métriques à crédit partiel comme nDCG donneraient des chiffres plus élevés pour les mêmes résultats de recherche. Ce qui importe dans ce benchmark, c’est le classement relatif entre les modèles, pas les chiffres absolus.

Découvrez davantage de nos benchmarks et analyses basées sur les données dans la recherche Google.
GoogleAjouter comme source préférée

Limites

  • Les types de questions peuvent ne pas représenter les requêtes réelles des utilisateurs. Les questions générées par LLM ont tendance à être bien formulées et spécifiques. Les utilisateurs réels écrivent souvent des requêtes fragmentaires ou ambiguës.
  • Seule la recherche dense est testée. Les méthodes éparses (BM25), la recherche hybride et les pipelines de reranking ne sont pas évalués. Ceux-ci pourraient modifier significativement le classement entre les modèles.
  • 300 requêtes par langue constituent un échantillon modéré. Les résultats par langue ont des intervalles de confiance raisonnablement étroits, mais les classements proches du milieu du tableau doivent être interprétés avec prudence.
  • Aucune évaluation de la qualité des embeddings au-delà de la recherche. La qualité du clustering, la précision de la similarité sémantique et d’autres tâches en aval ne sont pas mesurées.

Conclusion

Les modèles entraînés pour la recherche (avec des embeddings distincts pour la requête et le document) surpassent systématiquement les modèles entraînés pour la similarité textuelle générale, quelle que soit leur taille. e5_base (110M paramètres) surpasse des modèles 5x à 70x plus grands. LaBSE (471M paramètres), largement cité pour les tâches multilingues, se classe avant-dernier car son entraînement à la similarité ne construit pas la discrimination fine requise par la recherche.

Les modèles basés sur LLM (qwen3 à 600M paramètres, nemotron à 8B paramètres) atteignent une précision compétitive grâce à un pré-entraînement multilingue profond, mais ils le paient en latence : nemotron coûte 25ms par requête contre 11ms pour e5_base, avec seulement un rappel Top-10 légèrement meilleur. Pour la plupart des systèmes de production, les modèles plus petits entraînés pour la recherche offrent un meilleur compromis.

Pour les praticiens construisant des systèmes RAG multilingues, e5_base avec un filtre de langue est le choix clair (16,5 % Top-1, 11ms de latence, et un écart de 3,8 points de pourcentage sur le deuxième).

Pour aller plus loin

Explorez d’autres benchmarks RAG, tels que :

Citez ce benchmark

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Ekrem Sarı (2026) - "Top 10 des modèles d'embedding multilingues pour RAG". Publié en ligne sur AIMultiple.com. Consulté le 20 Février 2026, à : https://aimultiple.com/multilingual-embedding-models [Ressource en ligne]

Sarı, E. (2026, 20 Février). Top 10 des modèles d'embedding multilingues pour RAG. AIMultiple. https://aimultiple.com/multilingual-embedding-models

@misc{sar2026,
  author = {Sarı, Ekrem},
  title  = {{Top 10 des modèles d'embedding multilingues pour RAG}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/multilingual-embedding-models}},
  note   = {AIMultiple. Consulté le 20 Février 2026}
}
Télécharger toutes les données

Résultats et horodatages de 10 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV et un README.

Dernière mise à jour : 15 Juillet 2026
Télécharger
Ekrem Sarı
Ekrem Sarı
Chercheur en IA
Ekrem est chercheur en IA chez AIMultiple, spécialisé dans l'automatisation intelligente, les GPU, les agents IA et les frameworks RAG.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450