Los modelos de embedding multimodal destacan en la identificación de objetos, pero tienen dificultades con las relaciones. Los modelos actuales luchan por distinguir “teléfono sobre un mapa” de “mapa sobre un teléfono”. Comparamos 7 modelos líderes en MS-COCO y Winoground para medir esta limitación específica.
Para garantizar una comparación justa, evaluamos cada modelo en condiciones idénticas utilizando hardware NVIDIA A40 y precisión bfloat16. Esta configuración determinista revela qué modelos entienden realmente la estructura de la escena y cuáles son simplemente coincidencias sofisticadas de palabras clave.
Resultados del benchmark de modelos de embedding multimodal
Métricas explicadas
- T2I R@1 (recall@1 de texto a imagen): Dada una descripción, ¿puede el modelo clasificar la imagen correcta como la número uno entre 5.000 candidatos? Esta es la métrica de recuperación más difícil porque no hay crédito parcial por clasificarse en segundo lugar.
- I2T R@1 (recall@1 de imagen a texto): Dada una imagen, ¿puede el modelo clasificar cualquiera de las cinco descripciones de referencia como la número uno entre 25.000? Las puntuaciones son aproximadamente 20 puntos porcentuales más altas que T2I porque hay cinco respuestas válidas en lugar de una.
- Imagen Winoground: Dadas dos imágenes y dos descripciones que difieren solo en la estructura (“teléfono sobre un mapa” frente a “mapa sobre un teléfono”), ¿puede el modelo emparejar correctamente ambas parejas? La probabilidad aleatoria es del 25 por ciento.
Hallazgos clave
- Apple DFN5B-H logra la mayor precisión de recuperación (50.1 por ciento en T2I R@1) y la mayor puntuación de razonamiento composicional (35.2 por ciento en Winoground).
- El razonamiento composicional sigue siendo deficiente en todos los modelos. Incluso el rendimiento de Apple del 35.2 por ciento apenas supera la línea de base aleatoria del 25 por ciento.
- OpenAI CLIP muestra su antigüedad, quedando por detrás de los modelos modernos entre 10 y 16 puntos porcentuales a pesar de tener una arquitectura similar.
Nota: Las puntuaciones I2T son aproximadamente 20 puntos porcentuales más altas que T2I debido a un artefacto del protocolo. Cada imagen tiene cinco descripciones válidas, mientras que cada descripción se asigna a una sola imagen válida. Consulte la sección metodología del benchmark de embedding multimodal para más detalles.
Cómo funcionan los modelos de embedding multimodal
Antes de profundizar en los detalles del benchmark, es esencial comprender qué hacen realmente estos modelos y dónde fallan.
El mecanismo central
Un modelo de embedding multimodal convierte tanto imágenes como texto en vectores numéricos, que son listas de números que ocupan el mismo espacio geométrico. Los conceptos similares se agrupan, mientras que los conceptos diferentes quedan más alejados.
Para buscar, se calcula qué vector de imagen está más cerca del vector de texto. Por eso la búsqueda basada en embeddings es rápida: se comparan números, no se “entiende” el significado en un sentido humano.
Dónde falla
Observe lo que sucede con descripciones composicionalmente diferentes:
Los vectores son casi idénticos. Ambas descripciones contienen los mismos conceptos: {teléfono, mapa, sobre}. El modelo codifica lo que está presente pero pierde cómo se relacionan las cosas.
Este es el problema de la bolsa de palabras. El modelo ve los mismos “ingredientes” y produce embeddings similares, aunque las escenas sean completamente diferentes. En una, el teléfono está encima. En la otra, lo está el mapa. La estructura relacional desaparece durante la codificación.
Tareas de evaluación: recuperación frente a razonamiento
MS-COCO: encontrar una aguja en un pajar
La configuración:
Una galería de 5.000 imágenes contiene grupos de contenido similar, incluidos cientos de escenas al aire libre, decenas de vehículos y numerosas áreas y estructuras de almacenamiento. Cada imagen tiene cinco descripciones diferentes escritas por distintos anotadores, para un total de 25.000 descripciones.
La consulta: “Una motocicleta estacionada debajo de una estructura de madera junto con otros artículos.”
La imagen:
La misma imagen también podría describirse como:
- “Motocicleta negra debajo de un saliente en el exterior.”
- “Motocicleta estacionada bajo una zona cubierta en un patio cercado.”
Cada descripción se prueba por separado y el modelo debe encontrar la imagen correcta independientemente de cómo esté redactada.
La tarea:
Encontrar la única imagen específica que coincide. No cualquier motocicleta, ni cualquier estructura de madera, sino esta escena exacta entre 5.000 candidatos.
La métrica: Recall@1
Binaria e implacable. Imagen correcta clasificada como n.º 1 = acierto. Clasificada como n.º 2 = error. Sin crédito parcial.
Winoground: comprender quién hizo qué a quién
La configuración:
400 pares adversarios. Cada uno contiene 2 imágenes y 2 descripciones que difieren solo en la estructura composicional.
La consulta:
- Descripción A: “hay un teléfono sobre un mapa”
- Descripción B: “hay un mapa sobre un teléfono“
Ambas descripciones contienen exactamente los mismos conceptos: {teléfono, mapa, sobre}. La única diferencia es qué objeto está encima de cuál.
La imagen:
La tarea:
Emparejar ambas descripciones con sus imágenes correctas simultáneamente. La descripción A debe corresponder a la imagen A (teléfono reposando sobre el mapa), y la descripción B debe corresponder a la imagen B (mapa mostrado en el teléfono). Sin crédito parcial: acertar solo una cuenta como error.
La métrica: puntuación de imagen
Binaria e implacable. Ambas parejas emparejadas correctamente = acierto. Una o cero correctas = error. La probabilidad aleatoria es del 25 %.
Más ejemplos de Winoground:
Por qué los modelos fallan en la composición
Las bajas puntuaciones de Winoground (30-40 % frente a la línea de base aleatoria del 25 %) indican que los modelos actuales tienen dificultades con este tipo específico de razonamiento composicional. Sin embargo, se aplican varias advertencias:
- Tamaño de muestra pequeño: Winoground contiene solo 400 ejemplos, lo que produce intervalos de confianza de aproximadamente ±5 puntos porcentuales. Esto lo hace útil como indicador, pero no como prueba definitiva de las capacidades composicionales.
- Alcance de tareas específico pero diverso: Winoground prueba múltiples tipos de razonamiento composicional, incluidas las relaciones espaciales (sobre/encima/debajo), los intercambios agente-paciente (quién hace qué a quién), la vinculación de atributos (asignaciones de color/tamaño), los cuantificadores (más/menos, contar), la coordinación de acciones (se sienta/se levanta), la ordenación temporal (antes/después), la negación (con/sin) y la ambigüedad de alcance. Esta diversidad convierte a Winoground en una sonda eficaz de la comprensión composicional a través de múltiples fenómenos lingüísticos.
Análisis técnico y recomendaciones de implementación
La calidad de los datos supera la escala del modelo
Apple, LAION y MetaCLIP utilizan la misma columna vertebral ViT-H/14 (630M parámetros).
Apple tiene una ventaja de +3.8pp que parece deberse principalmente a su enfoque de Red de Filtrado de Datos (DFN).
- Curación automatizada: En lugar de usar solo descripciones sintéticas, Apple entrenó un modelo maestro para filtrar agresivamente los datos de entrenamiento. El modelo aprendió a identificar y descartar pares imagen-texto ruidosos del enorme conjunto web.
- La implicación: En la frontera, las mejoras provienen de la calidad de la curación (elegir los datos correctos) en lugar de solo la síntesis o la escala bruta.
La implicación: en la frontera, las mejoras provienen de mejores datos, no de arquitecturas más grandes.
Comprender el nivel de rendimiento del 50 %
MS-COCO fue diseñado con imágenes diferenciadas y curadas en las que cada descripción describe una escena específica. Aunque existen pequeñas ambigüedades (por ejemplo, dos escenas similares de estacionamiento), los creadores del dataset seleccionaron intencionadamente imágenes visualmente distinguibles.
La precisión del 50 % refleja que los modelos realmente no logran clasificar la imagen correcta en primer lugar, no una penalización injusta por seleccionar alternativas igualmente válidas.
Por qué OpenAI CLIP se queda atrás por 10-16pp
El CLIP-L (2021) de OpenAI obtiene un 34.4 % en T2I R@1, mientras que los modelos modernos con arquitecturas ViT similares logran entre 44 y 50 %. Esta brecha de 10 a 16 puntos porcentuales refleja tres años de progreso:
Si bien los principios arquitectónicos centrales siguieron siendo similares (transformadores de visión con aprendizaje contrastivo), los modelos modernos duplicaron su tamaño. Sin embargo, la mayor parte de las mejoras de rendimiento provino de una mejor curación de datos y técnicas de entrenamiento, más que solo de la innovación arquitectónica.
ColPali: sacrificar velocidad por flexibilidad arquitectónica
ColPali representa un enfoque arquitectónico diferente: en lugar de codificar cada imagen en un solo vector, produce 1.030 embeddings de parches mediante interacción tardía. Esta decisión de diseño crea varias ventajas y desventajas:
Ventajas:
- Recuperación más simétrica: ColPali muestra solo una brecha de 3.9pp entre I2T (48.8 %) y T2I (44.9 %), en comparación con brechas de 16-24pp en los modelos densos. Esto sugiere que codifica la estructura de la imagen de forma más uniforme.
- Flexibilidad arquitectónica: La interacción tardía permite un emparejamiento detallado entre tokens de texto y parches de imagen, lo que puede beneficiar a dominios especializados.
Desventajas:
- Sobrecarga de almacenamiento: Cada imagen requiere 1.030 vectores en lugar de 1, lo que aumenta el tamaño del índice en ~1000×.
- Menor rendimiento general: ColPali ocupa el 4 lugar en nuestro benchmark (44.9 % T2I), quedando por detrás de los mejores modelos densos por 5.2pp (frente a Apple DFN5B-H con 50.1 %).
Coste computacional: Requiere tamaños de lote 4 veces más pequeños (4 frente a 32) debido a la sobrecarga de memoria de 1.030 embeddings por imagen. Esto se traduce en una indexación más lenta y mayores costes de servicio a escala.
¿Qué modelo debería usar?
Metodología del benchmark de embedding multimodal
Hardware y software
- GPU: NVIDIA A40 (48GB VRAM) a través de RunPod
- Precisión: bfloat16
- Framework: PyTorch 2.4.0, CUDA 12.1
- Bibliotecas:
transformers==4.44.0,datasets==2.20.0
Modelos evaluados
Utilizamos los siguientes pesos de modelo específicos del Hub de Hugging Face. Todos los modelos se cargaron con precisión bfloat16 directamente desde estos repositorios sin modificaciones.
Protocolo de inferencia
Los modelos densos (CLIP/SigLIP) se evaluaron con un tamaño de lote de 32, ya que un solo vector por imagen permite un alto paralelismo. ColPali usó un tamaño de lote de 4, ya que sus 1.030 embeddings de parches por imagen requieren significativamente más memoria.
Protocolo de evaluación
- Zero-Shot: Modelos evaluados tal cual, usando los pesos de Hugging Face. Sin fine-tuning.
- Determinista: Semilla aleatoria fijada en 42. Mismo orden del dataset para todos los modelos.
- Divisiones estándar: prueba yerevann/coco-karpathy (5.000 imágenes), validación facebook/winoground.
La brecha entre I2T y T2I
Las puntuaciones I2T son sistemáticamente ~20pp más altas que T2I debido a la probabilidad estadística, no a un error del modelo.
- T2I (texto a imagen): El modelo debe encontrar 1 imagen específica entre 5.000. (Conjunto objetivo = 1).
- I2T (imagen a texto): El modelo puede emparejar cualquiera de las 5 descripciones válidas asociadas con esa imagen. (Conjunto objetivo = 5).
Dado que la tarea I2T ofrece cinco respuestas “correctas” distintas para cada consulta, la tasa de éxito se infla naturalmente en comparación con la estricta correspondencia uno a uno que requiere T2I.
Limitaciones
Tamaño de muestra de Winoground
400 muestras producen intervalos de confianza de ~±5pp con una precisión del 35 %. Los resultados son indicativos, no definitivos. Existen benchmarks más grandes (ARO, SugarCrepe), pero requieren una infraestructura diferente.
Solo Zero-Shot
Sin fine-tuning de dominio. Las aplicaciones médicas, legales o satelitales podrían ver mejoras de 5-10pp con entrenamiento específico del dominio.
Limitaciones del dataset:
MS-COCO y Winoground prueban aspectos específicos de la comprensión multimodal. El rendimiento en estos benchmarks no garantiza resultados similares en tareas específicas de dominio ni en otras pruebas de razonamiento composicional.
Conclusión
Los modelos actuales de embedding multimodal son buenos en el reconocimiento de objetos, pero tienen dificultades con el razonamiento composicional.
Para la recuperación estándar (“buscar fotos de motocicletas”), cualquiera de los 3 mejores modelos funciona bien. Para consultas relacionales (“teléfono sobre un mapa” frente a “mapa sobre un teléfono”), espere una precisión de 30-40 % como máximo.
Según nuestros hallazgos y las tendencias de investigación actuales, varios enfoques pueden mejorar el rendimiento:
- Calidad de datos sobre escala: Apple, con su ventaja de +3.8pp usando la misma arquitectura ViT-H, sugiere que la curación de los datos de entrenamiento contribuye significativamente, aunque esto se basa en una única comparación.
- Datos de entrenamiento composicionales: Incluir negativos duros con variaciones relacionales durante el entrenamiento podría mejorar teóricamente la sensibilidad composicional, aunque esto sigue sin probarse en gran medida a escala.
- Arquitecturas híbridas: Los pipelines de dos etapas (recuperación densa → reranking con interacción tardía) combinan velocidad con precisión, aunque nuestro benchmark muestra que esto aún no supera a los modelos densos en estas tareas.
Hasta que cambien los paradigmas de entrenamiento, la comprensión composicional sigue siendo una frontera abierta.
Lecturas adicionales
Explore otros benchmarks de RAG, como:
- Modelos de embedding: OpenAI vs Gemini vs Cohere
- Mejor base de datos vectorial para RAG: Qdrant vs Weaviate vs Pinecone
- Benchmark de RAG agéntico: enrutamiento entre múltiples bases de datos y generación de consultas
- 11 modelos de embedding de código abierto para RAG
Cita esta investigación
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{sari2026,
author = {Sarı, Ekrem},
title = {{Modelos de embedding multimodal: Apple vs Meta vs OpenAI}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/multimodal-embeddings}},
note = {AIMultiple. Recuperado el 14 de Agosto de 2026}
}

Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.