Servicios
Contáctanos

Los 10 mejores Modelos de Embedding Multilingüe para RAG

Ekrem Sarı
Ekrem Sarı
actualizado el 20 de feb. de 2026

Evaluamos 10 modelos de embedding multilingüe en ~606k reseñas de Amazon en 6 idiomas (Alemán, Inglés, Español, Francés, Japonés, Chino). Generamos 1,800 consultas (300 por idioma), cada una haciendo referencia a detalles concretos de su reseña fuente.

Los modelos entrenados para búsqueda (separación consulta vs documento) superan a modelos más grandes entrenados para similitud de texto general: e5_base (110M params) supera a modelos con 5x a 70x más parámetros, mientras que LaBSE (471M params), un modelo multilingüe ampliamente citado, ocupa el penúltimo lugar.

Precisión de recuperación multilingüe

Top-1 mide si la reseña correcta es el primer resultado devuelto; Top-10 mide si aparece en algún lugar entre los diez primeros.

Precisión Top-1

Loading Chart

Precisión Top-3

Precisión Top-5

Precisión Top-10

Métricas explicadas

  • Precisión Top-K: Si el documento correcto (por coincidencia exacta de product_id) aparece en los primeros K resultados. “¿Puede el modelo encontrar la reseña alemana correcta cuando se le hace una pregunta en alemán entre ~130k reseñas alemanas?”
  • Top-1/3/5/10: Valores de K probados. Top-1 es el más estricto (el documento correcto debe ser el primer resultado), Top-10 es el más laxo.

Para entender nuestra evaluación y métricas en detalle, vea nuestra configuración de evaluación y la metodología de benchmark para modelos de embedding multilingües.

Corpus: ~606k reseñas (min_review_length≥100 caracteres; ZH: ~17.7k, DE/EN/ES/FR/JA: ~120–145k cada una), sin alternativa de similitud coseno, solo coincidencia exacta de product_id. Evaluado en NVIDIA H100 PCIe 80GB.

Latencia y rendimiento

La latencia determina si un modelo es viable para producción. Los modelos con latencia sub-15ms pueden soportar búsqueda en tiempo real; por encima de 25ms, es necesario el procesamiento por lotes o el almacenamiento en caché.

Hallazgos clave

1. e5_base lidera en todos los idiomas

e5_base alcanza un promedio de Top-1 del 16.5% en 6 idiomas, superando al siguiente modelo (e5_small) por 3.8 puntos porcentuales. Su entrenamiento asimétrico con prefijos de consulta/pasaje produce embeddings precisos que discriminan bien entre reseñas semánticamente similares en el mismo idioma.

2. Los modelos basados en LLM son competitivos a pesar de su tamaño

qwen3_emb_06b (600M params) y llama_embed_nemotron_8b (8B params) ambos logran una precisión monolingüe de más del 10%. Su masivo pre-entrenamiento multilingüe parece construir representaciones que el fine-tuning de recuperación no puede borrar por completo, manteniéndose competitivos con modelos que tienen una fracción de su número de parámetros. nemotron alcanza un 25.8% en Top-10, el tercer mejor resultado general.

3. nomic_embed_v1_5 falla en idiomas CJK

nomic logra una precisión del 0% en chino y solo 4% en japonés, el único modelo que falla completamente en idiomas completos. Su entrenamiento centrado en inglés combinado con la asimetría de prefijos search_query/search_document crea graves brechas de cobertura para idiomas no europeos, a pesar de funcionar bien para inglés (17% Top-1) y alemán (9%).

4. LaBSE falla en la recuperación a pesar de su reputación

LaBSE fue diseñado explícitamente para la similitud semántica multilingüe y es ampliamente citado en la literatura. En este benchmark, ocupa el penúltimo lugar (4.8% Top-1). Su entrenamiento con pares de traducción e inferencia de lenguaje natural no construyó la precisión discriminativa necesaria para la recuperación: distinguir la reseña fuente exacta de cientos de productos semánticamente similares en el mismo idioma.

5. El escalado a Top-10 beneficia a todos los modelos, pero especialmente a los más fuertes

Pasar de Top-1 a Top-10 duplica el recall en todos los ámbitos. nemotron muestra el mejor promedio monolingüe en Top-10 (25.8%) a pesar de ocupar el 3er lugar en Top-1 (12.0%), lo que sugiere que su espacio de 4096 dimensiones tiene una buena estructura de vecinos más cercanos para K más grandes.

6. El español y el francés consistentemente rinden por debajo

En todos los modelos, ES y FR ocupan consistentemente posiciones más bajas que DE, EN, JA y ZH. El patrón se mantiene incluso para modelos con entrenamiento multilingüe explícito, lo que sugiere una menor representación en los corpus de pre-entrenamiento o un desajuste de dominio para reseñas de productos.

Cómo funcionan los embeddings multilingües

Un modelo de embedding convierte texto en un vector de alta dimensión (por ejemplo, 384 o 768 números) que captura el significado del texto en lugar de las palabras específicas. Dos textos que son semánticamente similares deberían tener vectores cercanos en este espacio, independientemente del idioma.

Un modelo de embedding multilingüe maneja múltiples idiomas en el mismo espacio vectorial. Cuando se usa para recuperación, el modelo debe encontrar el documento correcto entre decenas de miles de reseñas en el mismo idioma que a menudo tratan sobre productos y temas similares. El desafío es la precisión discriminativa: distinguir la reseña fuente exacta de cientos de reseñas semánticamente similares en la misma categoría.

Configuración de evaluación multilingüe

~606k reseñas de productos están indexadas en Qdrant (solo reseñas con cuerpo de ≥100 caracteres; ZH: ~17.7k, otros idiomas: ~120–145k cada una). 1,800 consultas (300 por idioma) son generadas de forma nativa por LLM a partir de reseñas que cumplen el mismo umbral de longitud. Cada consulta debe hacer referencia a detalles concretos de su reseña fuente (medidas, cantidades, nombres de marcas, plazos); las preguntas genéricas se filtran mediante una puntuación de especificidad. Dada una consulta en el idioma X, la tarea es encontrar la reseña fuente entre las reseñas del mismo idioma. Qdrant filtra los resultados por idioma. La precisión se mide mediante coincidencia exacta de product_id en Top-1/3/5/10 sin alternativa de similitud coseno.

Consultas de ejemplo del benchmark:

Alemán (electrónica, OPINIÓN):

Francés (droguería, USO):

Español (suministros_industriales, HECHOS):

El modelo debe emparejar cada consulta con su reseña fuente exacta por product_id. Una consulta sobre la pérdida de señal WiFi de un cable de antena podría coincidir semánticamente con miles de reseñas de electrónica que discuten problemas de conectividad; solo una describe la caída de la señal del 60% al 20% después de instalar este cable específico.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Análisis técnico y recomendaciones

Modelos simétricos vs asimétricos

El objetivo de entrenamiento predice en gran medida el rendimiento de recuperación:

Por qué los modelos asimétricos funcionan mejor: El prefijo consulta/pasaje entrena al modelo para incrustar consultas y documentos en regiones sistemáticamente diferentes del espacio, creando una geometría específica para la recuperación. Esto produce embeddings más discriminativos que separan documentos semánticamente similares pero distintos. e5_base logra esto con 110M parámetros porque el objetivo de entrenamiento, no la capacidad del modelo, impulsa la precisión de recuperación.

Por qué los modelos basados en LLM son competitivos: El masivo pre-entrenamiento multilingüe construye una rica estructura semántica en los pesos del modelo. El fine-tuning de recuperación añade una alineación específica de la tarea sobre esta profunda comprensión del lenguaje, resultando en un rendimiento competitivo. El costo es la latencia: los vectores de 4096 dimensiones de nemotron cuestan 25ms por consulta frente a 11ms de e5_base.

Por qué LaBSE falla a pesar de su reputación: LaBSE fue entrenado con pares de traducción para acercar el significado a nivel de oración entre idiomas, una tarea de similitud. La recuperación es fundamentalmente diferente: requiere distinguir la reseña fuente exacta de cientos de productos semánticamente similares en el mismo idioma. El entrenamiento de similitud optimiza la cercanía semántica de grano grueso; la recuperación exige una discriminación de grano fino entre casi duplicados.

¿Qué modelo deberías usar?

Mejor precisión: e5_base (16.5% Top-1, 11ms latencia). Usar con un filtro de idioma.

Mejor equilibrio latencia/precisión: e5_small (12.7% Top-1, 9.7ms), casi tan rápido como minilm con mejor precisión.

Mejor recall en top-10: nemotron (25.8% Top-10) si puedes permitirte la latencia de 25ms y la memoria GPU para vectores de 4096 dimensiones.

Para sistemas de producción sensibles a la latencia: e5_small o minilm a ~10ms. e5_small se prefiere fuertemente (12.7% vs 3.8%).

Utilice siempre un filtro de idioma cuando sepa que los idiomas de la consulta y del documento coinciden. Todos los modelos muestran ganancias significativas de precisión con la búsqueda filtrada por idioma.

Metodología de modelos de embedding multilingües

  • GPU: NVIDIA H100 PCIe 80GB a través de Runpod
  • Base de datos vectorial: Qdrant 1.12.0 (binario local)
  • Librería de embedding: sentence-transformers 5.2.2
  • Generación de consultas: Claude Sonnet 4.6 a través de OpenRouter. Cada pregunta debe hacer referencia a detalles específicos de su reseña fuente; las preguntas genéricas (puntuación de especificidad
  • Conjunto de datos: Amazon Reviews Multi (Kaggle)1 , train.csv. ~606k reseñas indexadas (mín. 100 caracteres; ZH: ~17.7k, otros: ~120-145k cada una). 6 idiomas: DE, EN, ES, FR, JA, ZH.
  • Consultas: 1,800 total (300 por idioma, 5 tipos de preguntas, generadas de forma nativa en cada idioma).
  • Formato del documento: "Review Title: {title}\nReview: {body}"
  • Ground truth: solo coincidencia exacta de product_id. Sin alternativa de similitud coseno.
  • Búsqueda: búsqueda vectorial de Qdrant con distancia coseno. Top-K = 10. Filtro de idioma aplicado para evaluación monolingüe.
  • Embedding: normalización L2. Prefijos asimétricos cuando corresponda: "query: " / "passage: " (e5), "search_query: " / "search_document: " (nomic).
  • Sin fine-tuning: Todos los modelos evaluados zero-shot con pesos predeterminados.
  • Latencia: Solo inferencia de embedding (consulta única). No incluye el tiempo de búsqueda vectorial.

Modelos Evaluados

Por qué las puntuaciones son más bajas que BEIR/MTEB

Los números de precisión absoluta en este benchmark no deben compararse directamente con las puntuaciones reportadas en BEIR o MTEB. Los dos benchmarks difieren en varias formas estructurales:

La métrica de coincidencia exacta es la mayor diferencia estructural. Cada consulta hace referencia a detalles concretos de su reseña fuente (por ejemplo, “¿Cuántas horas tardó la impresora 3D en imprimir el archivo del gato desde la tarjeta SD?”), por lo que cada consulta tiene un objetivo único claro, pero la métrica aún otorga cero para una reseña semánticamente relevante de un producto diferente. Las métricas de crédito parcial como nDCG producirían números más altos en los mismos resultados de recuperación. Lo que importa en este benchmark es la clasificación relativa entre modelos, no los números absolutos.

Descubre más de nuestros análisis comparativos e insights basados en datos en la Búsqueda de Google.
GoogleAñadir como fuente preferida

Limitaciones

  • Los tipos de preguntas pueden no representar consultas reales de usuarios. Las preguntas generadas por LLM tienden a estar bien formuladas y ser específicas. Los usuarios reales a menudo escriben consultas fragmentarias o ambiguas.
  • Solo se prueba la recuperación densa. Los métodos dispersos (BM25), la recuperación híbrida y los pipelines de re-ranking no se evalúan. Estos pueden cambiar significativamente la clasificación entre modelos.
  • 300 consultas por idioma es una muestra moderada. Los resultados por idioma tienen intervalos de confianza razonablemente estrechos, pero las clasificaciones cerca del centro de la tabla aún deben interpretarse con precaución.
  • No se evalúa la calidad del embedding más allá de la recuperación. La calidad de agrupamiento, la precisión de similitud semántica y otras tareas posteriores no se miden.

Conclusión

Los modelos entrenados para búsqueda (con embeddings separados de consulta y documento) superan consistentemente a los modelos entrenados para similitud de texto general, independientemente del tamaño. e5_base (110M params) supera a modelos 5x a 70x más grandes. LaBSE (471M params), ampliamente citado para tareas multilingües, ocupa el penúltimo lugar porque su entrenamiento de similitud no construye la discriminación de grano fino que requiere la recuperación.

Los modelos basados en LLM (qwen3 con 600M params, nemotron con 8B params) logran una precisión competitiva gracias a un profundo pre-entrenamiento multilingüe, pero lo pagan en latencia: nemotron cuesta 25ms por consulta frente a 11ms de e5_base, con solo un recall ligeramente mejor en Top-10. Para la mayoría de los sistemas de producción, los modelos más pequeños entrenados para búsqueda ofrecen un mejor equilibrio.

Para los profesionales que construyen sistemas RAG multilingües, e5_base con un filtro de idioma es la elección clara (16.5% Top-1, 11ms de latencia y una brecha de 3.8 puntos porcentuales sobre el segundo lugar).

Lecturas adicionales

Explore otros benchmarks de RAG, como:

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Ekrem Sarı (2026) - "Los 10 mejores Modelos de Embedding Multilingüe para RAG". Publicado en línea en AIMultiple.com. Recuperado el 20 de Febrero de 2026, de: https://aimultiple.com/multilingual-embedding-models [Recurso en línea]

Sarı, E. (2026, 20 de Febrero). Los 10 mejores Modelos de Embedding Multilingüe para RAG. AIMultiple. https://aimultiple.com/multilingual-embedding-models

@misc{sari2026,
  author = {Sarı, Ekrem},
  title  = {{Los 10 mejores Modelos de Embedding Multilingüe para RAG}},
  year   = {2026},
  month  = feb,
  howpublished    = {\url{https://aimultiple.com/multilingual-embedding-models}},
  note   = {AIMultiple. Recuperado el 20 de Febrero de 2026}
}
Descargar todos los datos

Resultados y marcas de tiempo de 10 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV y un README.

Última actualización: 15 de Julio de 2026
Descargar

Enlaces de referencia

1.
Amazon Reviews Multi | Kaggle
Ekrem Sarı
Ekrem Sarı
Investigador de IA
Ekrem es investigador de IA en AIMultiple, donde se centra en la automatización inteligente, las GPU, los agentes de IA y los marcos de trabajo RAG.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450