Avaliamos 10 modelos de embedding multilíngues em aproximadamente 606k avaliações da Amazon em 6 idiomas (alemão, inglês, espanhol, francês, japonês, chinês). Geramos 1.800 consultas (300 por idioma), cada uma referenciando detalhes concretos da avaliação de origem.
Modelos treinados para busca (separação entre consulta e documento) superam modelos maiores treinados para similaridade textual geral: e5_base (110M parâmetros) supera modelos com 5x a 70x mais parâmetros, enquanto o LaBSE (471M parâmetros), um modelo multilíngue amplamente citado, ocupa o penúltimo lugar.
Precisão da recuperação multilíngue
Top-1 mede se a avaliação correta é o primeiro resultado retornado; Top-10 mede se ela aparece em algum lugar entre os dez primeiros.
Precisão Top-1
Precisão Top-3
Precisão Top-5
Precisão Top-10
Métricas explicadas
- Precisão Top-K: Se o documento correto (por correspondência exata de product_id) aparece entre os primeiros K resultados. “O modelo consegue encontrar a avaliação em alemão correta quando perguntado em alemão entre ~130k avaliações em alemão?”
- Top-1/3/5/10: Valores de K testados. Top-1 é o mais rigoroso (o documento correto deve ser o primeiro resultado), Top-10 é o mais flexível.
Para entender nossa avaliação e métricas em detalhes, veja nossa configuração de avaliação e metodologia de benchmark para modelos de embedding multilíngues.
Corpus: ~606k avaliações (comprimento_mínimo_da_avaliação ≥ 100 caracteres; ZH: ~17,7k, DE/EN/ES/FR/JA: ~120–145k cada), sem fallback de similaridade de cosseno, apenas correspondência exata de product_id. Avaliado em NVIDIA H100 PCIe 80GB.
Latência & vazão
A latência determina se um modelo é viável para produção. Modelos com latência inferior a 15ms podem suportar busca em tempo real; acima de 25ms, é necessário usar lotes ou cache.
Principais conclusões
1. e5_base lidera em todos os idiomas
e5_base alcança média Top-1 de 16,5% em 6 idiomas, superando o próximo modelo (e5_small) por 3,8 pontos percentuais. Seu treinamento assimétrico com prefixos de consulta/passagem produz embeddings precisos que discriminam bem entre avaliações semanticamente semelhantes no mesmo idioma.
2. Modelos baseados em LLM são competitivos apesar de seu tamanho
qwen3_emb_06b (600M parâmetros) e llama_embed_nemotron_8b (8B parâmetros) ambos alcançam mais de 10% de precisão monolíngue. Seu vasto pré-treinamento multilíngue parece construir representações que o ajuste fino para recuperação não consegue apagar totalmente, permanecendo competitivos com modelos com uma fração de sua contagem de parâmetros. O nemotron atinge 25,8% no Top-10, o terceiro melhor resultado geral.
3. nomic_embed_v1_5 falha em idiomas CJK
O nomic alcança 0% de precisão em chinês e apenas 4% em japonês, o único modelo a falhar completamente em idiomas inteiros. Seu treinamento centrado no inglês combinado com a assimetria dos prefixos search_query/search_document cria graves lacunas de cobertura para idiomas não europeus, apesar de funcionar bem para inglês (17% Top-1) e alemão (9%).
4. LaBSE falha na recuperação apesar de sua reputação
O LaBSE foi explicitamente projetado para similaridade semântica multilíngue e é amplamente citado na literatura. Neste benchmark, ele ocupa o penúltimo lugar (4,8% Top-1). Seu treinamento em pares de tradução e inferência de linguagem natural não construiu a precisão discriminativa necessária para a recuperação: distinguir a avaliação de origem exata entre centenas de produtos semanticamente semelhantes no mesmo idioma.
5. O escalonamento para Top-10 beneficia todos os modelos, mas especialmente os mais fortes
A transição de Top-1 para Top-10 dobra a cobertura em todos os modelos. O nemotron mostra a melhor média monolíngue no Top-10 (25,8%) apesar de ficar em 3º no Top-1 (12,0%), sugerindo que seu espaço de 4096 dimensões tem boa estrutura de vizinhos mais próximos em K maior.
6. Espanhol e francês consistentemente têm desempenho inferior
Em todos os modelos, ES e FR têm classificação consistentemente inferior a DE, EN, JA e ZH. O padrão se mantém mesmo para modelos com treinamento multilíngue explícito, sugerindo menor representação nos corpora de pré-treinamento ou incompatibilidade de domínio para avaliações de produtos.
Como funcionam os embeddings multilíngues
Um modelo de embedding converte texto em um vetor de alta dimensão (por exemplo, 384 ou 768 números) que captura o significado do texto em vez das palavras específicas. Dois textos semanticamente semelhantes devem ter vetores próximos nesse espaço, independentemente do idioma.
Um modelo de embedding multilíngue lida com vários idiomas no mesmo espaço vetorial. Quando usado para recuperação, o modelo deve encontrar o documento correto entre dezenas de milhares de avaliações no mesmo idioma que frequentemente discutem produtos e tópicos semelhantes. O desafio é a precisão discriminativa: distinguir a avaliação de origem exata entre centenas de avaliações semanticamente semelhantes na mesma categoria.
Configuração da avaliação multilíngue
~606k avaliações de produtos são indexadas no Qdrant (apenas avaliações com corpo ≥ 100 caracteres; ZH: ~17,7k, outros idiomas: ~120–145k cada). 1.800 consultas (300 por idioma) são geradas nativamente por LLM a partir de avaliações que atendem ao mesmo limite de comprimento. Cada consulta deve referenciar detalhes concretos de sua avaliação de origem (medidas, quantidades, nomes de marcas, prazos); perguntas genéricas são filtradas por uma pontuação de especificidade. Dada uma consulta no idioma X, a tarefa é encontrar a avaliação de origem entre avaliações no mesmo idioma. O Qdrant filtra os resultados por idioma. A precisão é medida por correspondência exata de product_id em Top-1/3/5/10, sem fallback de similaridade de cosseno.
Exemplos de consultas do benchmark:
Alemão (eletrônicos, OPINIÃO):
Francês (drogaria, USO):
Espanhol (suprimentos industriais, FACTUAL):
O modelo deve combinar cada consulta com sua avaliação de origem exata por product_id. Uma consulta sobre perda de sinal WiFi de um cabo de antena poderia corresponder semanticamente a milhares de avaliações de eletrônicos discutindo problemas de conectividade; apenas uma descreve o sinal caindo de 60% para 20% após instalar este cabo específico.
Análise técnica & recomendações
Modelos simétricos vs assimétricos
O objetivo do treinamento prevê em grande parte o desempenho da recuperação:
Por que modelos assimétricos têm melhor desempenho: O prefixo consulta/passagem treina o modelo para incorporar consultas e documentos em regiões sistematicamente diferentes do espaço, criando uma geometria específica para recuperação. Isso produz embeddings mais discriminativos que separam documentos semanticamente semelhantes, mas distintos. e5_base consegue isso com 110M parâmetros porque o objetivo do treinamento, não a capacidade do modelo, impulsiona a precisão da recuperação.
Por que modelos baseados em LLM são competitivos: O pré-treinamento multilíngue massivo constrói uma rica estrutura semântica nos pesos do modelo. O ajuste fino para recuperação adiciona alinhamento específico da tarefa sobre essa profunda compreensão linguística, resultando em desempenho competitivo. O trade-off é a latência: os vetores de 4096 dimensões do nemotron custam 25ms por consulta contra 11ms do e5_base.
Por que o LaBSE falha apesar de sua reputação: O LaBSE foi treinado em pares de tradução para aproximar o significado no nível da frase entre idiomas, uma tarefa de similaridade. A recuperação é fundamentalmente diferente: requer distinguir a avaliação de origem exata entre centenas de produtos semanticamente semelhantes no mesmo idioma. O treinamento de similaridade otimiza para proximidade semântica de granularidade grossa; a recuperação exige discriminação fina entre quase duplicatas.
Qual modelo você deve usar?
Melhor precisão: e5_base (16,5% Top-1, 11ms de latência). Use com um filtro de idioma.
Melhor trade-off latência/precisão: e5_small (12,7% Top-1, 9,7ms), quase tão rápido quanto o minilm com melhor precisão.
Melhor cobertura no top-10: nemotron (25,8% Top-10) se você puder arcar com a latência de 25ms e a memória da GPU para vetores de 4096 dimensões.
Para sistemas de produção sensíveis à latência: e5_small ou minilm com ~10ms. e5_small é fortemente preferido (12,7% vs 3,8%).
Sempre use um filtro de idioma quando souber que os idiomas da consulta e do documento coincidem. Todos os modelos mostram ganhos significativos de precisão com busca filtrada por idioma.
Metodologia dos modelos de embedding multilíngues
- GPU: NVIDIA H100 PCIe 80GB via Runpod
- Banco de dados vetorial: Qdrant 1.12.0 (binário local)
- Biblioteca de embedding: sentence-transformers 5.2.2
- Geração de consultas: Claude Sonnet 4.6 via OpenRouter. Cada pergunta deve referenciar detalhes específicos de sua avaliação de origem; perguntas genéricas (pontuação de especificidade < 4/5) são filtradas.
- Conjunto de dados: Amazon Reviews Multi (Kaggle)1 , train.csv. ~606k avaliações indexadas (mín 100 caracteres; ZH: ~17,7k, outros: ~120-145k cada). 6 idiomas: DE, EN, ES, FR, JA, ZH.
- Consultas: 1.800 no total (300 por idioma, 5 tipos de perguntas, geradas nativamente em cada idioma).
- Formato do documento:
"Review Title: {title}\nReview: {body}" - Verdade fundamental: apenas correspondência exata de product_id. Sem fallback de similaridade de cosseno.
- Busca: busca vetorial do Qdrant com distância de cosseno. Top-K = 10. Filtro de idioma aplicado para avaliação monolíngue.
- Embedding: normalização L2. Prefixos assimétricos quando aplicável:
"query: "/"passage: "(e5),"search_query: "/"search_document: "(nomic). - Sem ajuste fino: Todos os modelos avaliados em zero-shot com pesos padrão.
- Latência: apenas inferência de embedding (consulta única). Não inclui o tempo de busca vetorial.
Modelos Avaliados
Por que as pontuações são mais baixas que as do BEIR/MTEB
Os números absolutos de precisão neste benchmark não devem ser comparados diretamente às pontuações relatadas no BEIR ou MTEB. Os dois benchmarks diferem de várias maneiras estruturais:
A métrica de correspondência exata é a maior diferença estrutural. Cada consulta referencia detalhes concretos de sua avaliação de origem (por exemplo, “Quantas horas a impressora 3D levou para imprimir o arquivo do gato do cartão SD?”), então cada consulta tem um alvo único claro, mas a métrica ainda atribui zero para uma avaliação semanticamente relevante de um produto diferente. Métricas de crédito parcial como nDCG produziriam números mais altos nos mesmos resultados de recuperação. O que importa neste benchmark é a classificação relativa entre os modelos, não os números absolutos.
Limitações
- Os tipos de perguntas podem não representar consultas reais de usuários. Perguntas geradas por LLM tendem a ser bem formuladas e específicas. Usuários reais frequentemente escrevem consultas fragmentadas ou ambíguas.
- Apenas recuperação densa é testada. Métodos esparsos (BM25), recuperação híbrida e pipelines de re-ranqueamento não são avaliados. Estes podem alterar significativamente a classificação entre os modelos.
- 300 consultas por idioma é uma amostra moderada. Os resultados por idioma têm intervalos de confiança razoavelmente estreitos, mas as classificações no meio da tabela ainda devem ser interpretadas com cautela.
- Nenhuma avaliação da qualidade do embedding além da recuperação. Qualidade de agrupamento, precisão da similaridade semântica e outras tarefas downstream não são medidas.
Conclusão
Modelos treinados para busca (com embeddings separados de consulta e documento) consistentemente superam modelos treinados para similaridade textual geral, independentemente do tamanho. e5_base (110M parâmetros) supera modelos 5x a 70x maiores. LaBSE (471M parâmetros), amplamente citado para tarefas multilíngues, ocupa o penúltimo lugar porque seu treinamento de similaridade não constrói a discriminação refinada que a recuperação exige.
Modelos baseados em LLM (qwen3 com 600M parâmetros, nemotron com 8B parâmetros) alcançam precisão competitiva graças ao profundo pré-treinamento multilíngue, mas pagam por isso em latência: o nemotron custa 25ms por consulta contra 11ms do e5_base, com apenas uma cobertura marginalmente melhor no Top-10. Para a maioria dos sistemas de produção, os modelos menores treinados para busca oferecem um melhor trade-off.
Para profissionais que constroem sistemas RAG multilíngues, e5_base com um filtro de idioma é a escolha clara (16,5% Top-1, 11ms de latência e uma vantagem de 3,8 pontos percentuais sobre o segundo colocado).
Leitura adicional
Explore outros benchmarks de RAG, como:
- Modelos de Embedding: OpenAI vs Gemini vs Cohere
- Os 16 melhores modelos de embedding de código aberto para RAG
- Melhor Banco de Dados Vetorial para RAG: Qdrant vs Weaviate vs Pinecone
- Benchmark de RAG agentivo: Roteamento multi-banco de dados e geração de consultas
- Modelos de Embedding Multimodal: Apple vs Meta vs OpenAI
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{sar2026,
author = {Sarı, Ekrem},
title = {{Os 10 melhores modelos de embedding multilíngues para RAG}},
year = {2026},
month = feb,
howpublished = {\url{https://aimultiple.com/multilingual-embedding-models}},
note = {AIMultiple. Acessado em 20 Fevereiro 2026}
}Resultados e carimbos de data/hora de 10 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV e um README.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.