Servizi
Contattaci

I migliori 10 modelli di embedding multilingue per RAG

Ekrem Sarı
Ekrem Sarı
aggiornato il 20 feb. 2026

Abbiamo testato 10 modelli di embedding multilingue su ~606k recensioni Amazon in 6 lingue (tedesco, inglese, spagnolo, francese, giapponese, cinese). Abbiamo generato 1,800 query (300 per lingua), ciascuna con riferimenti a dettagli concreti della recensione di origine.

I modelli addestrati per la ricerca (separazione query vs documento) superano modelli più grandi addestrati per la similarità testuale generica: e5_base (110M parametri) supera modelli con 5x fino a 70x più parametri, mentre LaBSE (471M parametri), un modello multilingue ampiamente citato, si classifica al penultimo posto.

Accuratezza del recupero multilingue

La Top-1 misura se la recensione corretta è il primo risultato restituito; la Top-10 misura se appare in qualsiasi posizione tra le prime dieci.

Accuratezza Top-1

Loading Chart

Accuratezza Top-3

Accuratezza Top-5

Accuratezza Top-10

Metriche spiegate

  • Accuratezza Top-K: Se il documento corretto (tramite corrispondenza esatta del product_id) appare nei primi K risultati. “Il modello riesce a trovare la recensione tedesca giusta quando viene posta una domanda in tedesco tra circa 130k recensioni tedesche?”
  • Top-1/3/5/10: Valori K testati. La Top-1 è la più rigorosa (il documento corretto deve essere il primo risultato), la Top-10 è la più permissiva.

Per comprendere nel dettaglio la nostra valutazione e le metriche, consulta la nostra configurazione di valutazione e la metodologia del benchmark per i modelli di embedding multilingue.

Corpus: ~606k recensioni (min_review_length≥100 caratteri; ZH: ~17.7k, DE/EN/ES/FR/JA: ~120–145k ciascuna), nessun fallback di similarità coseno, solo corrispondenza esatta di product_id. Valutato su NVIDIA H100 PCIe 80GB.

Latenza e throughput

La latenza determina se un modello è adatto alla produzione. I modelli con latenza inferiore a 15ms possono supportare la ricerca in tempo reale; oltre i 25ms, sono necessari il batching o la cache.

Risultati principali

1. e5_base domina su tutte le lingue

e5_base raggiunge una media del 16.5% di Top-1 su 6 lingue, superando il modello successivo (e5_small) di 3.8 punti percentuali. Il suo addestramento con prefisso asimmetrico query/passaggio produce embedding precisi che discriminano bene tra recensioni semanticamente simili nella stessa lingua.

2. I modelli basati su LLM sono competitivi nonostante le dimensioni

qwen3_emb_06b (600M parametri) e llama_embed_nemotron_8b (8B parametri) raggiungono entrambi un'accuratezza monolingue superiore al 10%. Il loro massiccio pre-addestramento multilingue sembra creare rappresentazioni che il fine-tuning per il recupero non riesce a cancellare completamente, rimanendo competitivi con modelli che hanno una frazione dei loro parametri. nemotron raggiunge il 25.8% nella Top-10, il terzo miglior risultato in assoluto.

3. nomic_embed_v1_5 fallisce sulle lingue CJK

nomic raggiunge un'accuratezza dello 0% in cinese e solo del 4% in giapponese, l'unico modello a fallire completamente su intere lingue. Il suo addestramento incentrato sull'inglese, combinato con l'asimmetria dei prefissi search_query/search_document, crea gravi lacune di copertura per le lingue non europee, pur funzionando bene per l'inglese (17% Top-1) e il tedesco (9%).

4. LaBSE fallisce nel recupero nonostante la sua reputazione

LaBSE è stato progettato esplicitamente per la similarità semantica multilingue ed è ampiamente citato nella letteratura. In questo benchmark, si classifica al penultimo posto (4.8% Top-1). Il suo addestramento su coppie di traduzione e inferenza del linguaggio naturale non ha sviluppato la precisione discriminativa necessaria per il recupero: distinguere la recensione di origine esatta da centinaia di prodotti semanticamente simili nella stessa lingua.

5. Il passaggio alla Top-10 avvantaggia tutti i modelli, ma soprattutto quelli più forti

Passare dalla Top-1 alla Top-10 raddoppia il recall in tutti i modelli. nemotron mostra la migliore media monolingue nella Top-10 (25.8%) nonostante si classifichi 3rd nella Top-1 (12.0%), suggerendo che il suo spazio a 4096 dimensioni ha una buona struttura di nearest-neighbor a K più grandi.

6. Spagnolo e francese hanno prestazioni costantemente inferiori

In tutti i modelli, ES e FR si classificano costantemente più in basso rispetto a DE, EN, JA e ZH. Lo schema persiste anche per i modelli con addestramento multilingue esplicito, suggerendo una minore rappresentazione nei corpora di pre-addestramento o una mancata corrispondenza del dominio per le recensioni di prodotti.

Come funzionano gli embedding multilingue

Un modello di embedding converte il testo in un vettore ad alta dimensionalità (ad esempio, 384 o 768 numeri) che cattura il significato del testo piuttosto che le parole specifiche. Due testi semanticamente simili dovrebbero avere vettori vicini in questo spazio, indipendentemente dalla lingua.

Un modello di embedding multilingue gestisce più lingue nello stesso spazio vettoriale. Quando viene utilizzato per il recupero, il modello deve trovare il documento corretto tra decine di migliaia di recensioni nella stessa lingua che spesso discutono prodotti e argomenti simili. La sfida è la precisione discriminativa: distinguere la recensione esatta tra centinaia di recensioni semanticamente simili nella stessa categoria.

Configurazione della valutazione multilingue

Circa 606k recensioni di prodotti sono indicizzate in Qdrant (solo recensioni con corpo ≥100 caratteri; ZH: ~17.7k, altre lingue: ~120–145k ciascuna). 1.800 query (300 per lingua) sono generate nativamente da LLM a partire da recensioni che soddisfano la stessa soglia di lunghezza. Ogni query deve fare riferimento a dettagli concreti della recensione di origine (misure, quantità, nomi di marchi, tempistiche); le domande generiche vengono filtrate tramite un punteggio di specificità. Data una query in lingua X, il compito è trovare la recensione di origine tra le recensioni nella stessa lingua. Qdrant filtra i risultati per lingua. L'accuratezza viene misurata tramite corrispondenza esatta di product_id a Top-1/3/5/10 senza fallback di similarità coseno.

Query di esempio dal benchmark:

Tedesco (elettronica, OPINIONE):

Francese (farmacia, USO):

Spagnolo (forniture industriali, FATTUALE):

Il modello deve associare ogni query alla sua esatta recensione di origine tramite product_id. Una query sulla perdita di segnale WiFi da un cavo dell'antenna potrebbe corrispondere semanticamente a migliaia di recensioni di elettronica che discutono problemi di connettività; solo una descrive la caduta del segnale dal 60% al 20% dopo l'installazione di questo cavo specifico.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Analisi tecnica e raccomandazioni

Modelli simmetrici vs asimmetrici

L'obiettivo di addestramento predice in gran parte le prestazioni di recupero:

Perché i modelli asimmetrici funzionano meglio: Il prefisso query/passaggio addestra il modello a incorporare query e documenti in regioni sistematicamente diverse dello spazio, creando una geometria specifica per il recupero. Questo produce embedding più discriminativi che separano documenti semanticamente simili ma distinti. e5_base raggiunge questo risultato con 110M parametri perché è l'obiettivo di addestramento, non la capacità del modello, a guidare la precisione del recupero.

Perché i modelli basati su LLM sono competitivi: Il massiccio pre-addestramento multilingue costruisce una ricca struttura semantica nei pesi del modello. Il fine-tuning per il recupero aggiunge un allineamento specifico del compito su questa profonda comprensione linguistica, ottenendo prestazioni competitive. Il compromesso è la latenza: i vettori a 4096 dimensioni di nemotron richiedono 25ms per query contro i 11ms di e5_base.

Perché LaBSE fallisce nonostante la sua reputazione: LaBSE è stato addestrato su coppie di traduzione per avvicinare il significato a livello di frase tra le lingue, un compito di similarità. Il recupero è fondamentalmente diverso: richiede di distinguere la recensione di origine esatta da centinaia di prodotti semanticamente simili nella stessa lingua. L'addestramento alla similarità ottimizza per la vicinanza semantica a grana grossa; il recupero richiede una discriminazione a grana fine tra quasi-duplicati.

Quale modello dovresti usare?

Migliore accuratezza: e5_base (16.5% Top-1, 11ms di latenza). Utilizzare con un filtro per lingua.

Miglior compromesso latenza/accuratezza: e5_small (12.7% Top-1, 9.7ms), quasi veloce quanto minilm ma con maggiore accuratezza.

Miglior recall nella Top-10: nemotron (25.8% Top-10) se puoi permetterti la latenza di 25ms e la memoria GPU per vettori a 4096 dimensioni.

Per sistemi di produzione sensibili alla latenza: e5_small o minilm a circa 10ms. e5_small è fortemente preferito (12.7% contro 3.8%).

Utilizzare sempre un filtro per lingua quando si sa che le lingue di query e documento corrispondono. Tutti i modelli mostrano significativi miglioramenti di accuratezza con la ricerca filtrata per lingua.

Metodologia dei modelli di embedding multilingue

  • GPU: NVIDIA H100 PCIe 80GB via Runpod
  • Database vettoriale: Qdrant 1.12.0 (binario locale)
  • Libreria di embedding: sentence-transformers 5.2.2
  • Generazione delle query: Claude Sonnet 4.6 via OpenRouter. Ogni domanda deve fare riferimento a dettagli specifici della recensione di origine; le domande generiche (punteggio di specificità < 4/5) vengono filtrate.
  • Dataset: Amazon Reviews Multi (Kaggle)1 , train.csv. ~606k recensioni indicizzate (min 100 caratteri; ZH: ~17.7k, altre: ~120-145k ciascuna). 6 lingue: DE, EN, ES, FR, JA, ZH.
  • Query: 1,800 in totale (300 per lingua, 5 tipi di domanda, generate nativamente in ciascuna lingua).
  • Formato documento: "Review Title: {title}\nReview: {body}"
  • Verità di riferimento: solo corrispondenza esatta di product_id. Nessun fallback di similarità coseno.
  • Ricerca: ricerca vettoriale Qdrant con distanza coseno. Top-K = 10. Filtro per lingua applicato per la valutazione monolingue.
  • Embedding: normalizzazione L2. Prefissi asimmetrici ove applicabile: "query: " / "passage: " (e5), "search_query: " / "search_document: " (nomic).
  • Nessun fine-tuning: Tutti i modelli valutati zero-shot con pesi predefiniti.
  • Latenza: Solo inferenza di embedding (query singola). Non include il tempo di ricerca vettoriale.

Modelli valutati

Perché i punteggi sono più bassi rispetto a BEIR/MTEB

I valori assoluti di accuratezza in questo benchmark non dovrebbero essere confrontati direttamente con i punteggi riportati su BEIR o MTEB. I due benchmark differiscono sotto diversi aspetti strutturali:

La metrica a corrispondenza esatta è la differenza strutturale più grande. Ogni query fa riferimento a dettagli concreti della recensione di origine (ad esempio, “Quante ore ha impiegato la stampante 3D per stampare il file del gatto dalla scheda SD?”), quindi ogni query ha un obiettivo unico e chiaro, ma la metrica assegna comunque zero a una recensione semanticamente rilevante di un prodotto diverso. Metriche a credito parziale come nDCG produrrebbero numeri più alti sugli stessi risultati di recupero. Ciò che conta in questo benchmark è il posizionamento relativo tra i modelli, non i numeri assoluti.

Scopri altri nostri benchmark e approfondimenti basati sui dati nella Ricerca Google.
GoogleAggiungi come fonte preferita

Limitazioni

  • I tipi di domanda potrebbero non rappresentare le query reali degli utenti. Le domande generate da LLM tendono a essere ben formulate e specifiche. Gli utenti reali spesso scrivono query frammentarie o ambigue.
  • Viene testato solo il recupero denso. I metodi sparsi (BM25), il recupero ibrido e le pipeline di reranking non sono valutati. Questi potrebbero cambiare significativamente la classifica tra i modelli.
  • 300 query per lingua sono un campione moderato. I risultati per lingua hanno intervalli di confidenza ragionevolmente ristretti, ma le classifiche vicino alla metà della tabella dovrebbero essere interpretate con cautela.
  • Nessuna valutazione della qualità dell'embedding oltre il recupero. La qualità del clustering, l'accuratezza della similarità semantica e altri compiti a valle non sono misurati.

Conclusione

I modelli addestrati per la ricerca (con embedding separati per query e documento) battono costantemente i modelli addestrati per la similarità testuale generica, indipendentemente dalla dimensione. e5_base (110M parametri) supera modelli da 5x a 70x più grandi. LaBSE (471M parametri), ampiamente citato per i compiti multilingue, si classifica al penultimo posto perché il suo addestramento alla similarità non costruisce la discriminazione a grana fine richiesta dal recupero.

I modelli basati su LLM (qwen3 con 600M parametri, nemotron con 8B parametri) raggiungono un'accuratezza competitiva grazie al profondo pre-addestramento multilingue, ma pagano in termini di latenza: nemotron costa 25ms per query contro gli 11ms di e5_base, con un recall nella Top-10 solo marginalmente migliore. Per la maggior parte dei sistemi di produzione, i modelli più piccoli addestrati per la ricerca offrono un compromesso migliore.

Per i professionisti che costruiscono sistemi RAG multilingue, e5_base con filtro per lingua è la scelta chiara (16.5% Top-1, 11ms di latenza e un distacco di 3.8 punti percentuali sul secondo posto).

Ulteriori letture

Esplora altri benchmark RAG, come:

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ekrem Sarı (2026) - "I migliori 10 modelli di embedding multilingue per RAG". Pubblicato online su AIMultiple.com. Consultato il 20 Febbraio 2026, da: https://aimultiple.com/multilingual-embedding-models [Risorsa online]

Sarı, E. (2026, 20 Febbraio). I migliori 10 modelli di embedding multilingue per RAG. AIMultiple. https://aimultiple.com/multilingual-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{I migliori 10 modelli di embedding multilingue per RAG}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/multilingual-embedding-models}},
  note   = {AIMultiple. Consultato il 20 Febbraio 2026}
}
Scarica tutti i dati

Risultati e timestamp di 10 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente un file CSV e un README.

Ultimo aggiornamento: 15 Luglio 2026
Scarica

Collegamenti di riferimento

1.
Amazon Reviews Multi | Kaggle
Ekrem Sarı
Ekrem Sarı
Ricercatore di intelligenza artificiale
Ekrem è un ricercatore di intelligenza artificiale presso AIMultiple, specializzato in automazione intelligente, GPU, agenti di intelligenza artificiale e framework RAG.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450