Servicios
Contáctanos

Modelos de Lenguaje Visual Comparados con el Reconocimiento de Imágenes

Cem Dilmegani
Cem Dilmegani
actualizado el 30 de jun. de 2026

¿Pueden los Modelos de Lenguaje Visual (VLMs) avanzados reemplazar los modelos tradicionales de reconocimiento de imágenes? Para averiguarlo, evaluamos 16 modelos líderes en tres paradigmas: CNNs tradicionales (ResNet, EfficientNet), VLMs (como GPT-4.1, Gemini 2.5), y APIs cloud (AWS, Google, Azure).

La Precisión Media Promedio (mAP) sirvió como nuestra métrica principal de exactitud, complementada por análisis de latencia, coste y rendimiento específico por clase.

Puedes consultar la metodología del benchmark aquí.

Benchmark de precisión vs latencia

En nuestro benchmark, evaluamos los modelos en cuatro dimensiones: latencia, precisión media promedio (mAP), precio y tasa de éxito. La latencia mide el tiempo que tarda un modelo en procesar una sola imagen, mientras que la mAP refleja la precisión general de clasificación. La tasa de éxito registra si un modelo devolvió una salida JSON válida, algo particularmente relevante para los modelos de lenguaje visual, que interpretan imágenes en lenguaje natural en lugar de datos estructurados.

Loading Chart

Los modelos tradicionales de reconocimiento de imágenes, como EfficientNet, ResNet18, ResNet50, ResNet101 y DenseNet121, muestran consistentemente tanto baja latencia (0.03–0.2 segundos) como precisión competitiva (mAP 0.75–0.81). Entre ellos, DenseNet121 y ResNet18 logran las puntuaciones mAP más altas (0.81 y 0.80 respectivamente), mientras que EfficientNet les sigue de cerca (0.78). ResNet50 y ResNet101 muestran un rendimiento moderado dentro de este grupo (0.75 y 0.77), pero todos los modelos tradicionales superan significativamente a las herramientas de reconocimiento de imágenes basadas en la nube como AWS Rekognition, Google Cloud Vision y Azure Vision, que logran una precisión moderada (mAP 0.61–0.64) con latencias entre 2–3.5 segundos. Esto demuestra que los modelos tradicionales dominan tanto en velocidad como en precisión.

Para los modelos de lenguaje visual, incluyendo OpenAI GPT-4.1, Claude Opus 4.1, X-IA Grok 2 Vision, Meta-Llama/LLama-3.2-11B Vision Instruct, y Google Gemini 2.5 Flash, las latencias son significativamente más altas, oscilando entre 1 y 12 segundos, con valores de mAP entre 0.60 y 0.75. Google Gemini 2.5 Flash logra 0.75 de mAP, convirtiéndolo en el VLM más preciso de nuestra prueba. Entre otros VLMs, GPT-4.1 tiene un buen rendimiento con una mAP de 0.73, seguido por Claude Opus 4.1 (0.71) y X-IA Grok 2 Vision (0.70). GPT-4o-mini muestra un rendimiento moderado (0.66 mAP), mientras que Meta-Llama Vision Instruct se queda significativamente atrás (0.60 mAP).

La mayoría de los modelos de lenguaje visual devuelven salidas JSON de forma fiable con casi un 100% de éxito, excepto Meta-Llama Vision Instruct, que solo tuvo éxito el 36% de las veces, y Gemini 2.5 Pro, que falló consistentemente (0% de éxito), limitando severamente su aplicabilidad práctica en pipelines automatizados.

Aunque los modelos de lenguaje visual generalmente van por detrás de los modelos tradicionales de reconocimiento de imágenes en velocidad bruta, los VLMs de mejor rendimiento como Google Gemini 2.5 Flash (0.75 mAP) y GPT-4.1 (0.73 mAP) logran una precisión de clasificación que se acerca al rendimiento de las CNNs tradicionales y supera significativamente a las APIs cloud como AWS Rekognition y Azure Vision. En términos de latencia, la mayoría de los modelos de lenguaje visual se agrupan alrededor de 3-4 segundos, excepto Meta-Llama, que es notablemente más lento con 12 segundos, lo que destaca el impacto de la arquitectura del modelo y la optimización.

En general, los modelos tradicionales de reconocimiento de imágenes siguen destacando tanto en velocidad como en precisión. Sin embargo, los VLMs muestran potencial para el razonamiento multimodal y las salidas estructuradas, con una latencia consistentemente mayor pero con los mejores modelos logrando una precisión que se acerca a las CNNs tradicionales y supera a los servicios de reconocimiento de imágenes basados en la nube.

Rendimiento específico por clase: dónde destacan y fallan los modelos

Nuestra evaluación utilizó siete clases solapadas que ponen a prueba diferentes aspectos de la detección de objetos:

  • face: Representa solo la región facial. El modelo necesita detectar la cara de una persona, lo cual puede ser difícil debido a su pequeño tamaño y detalles finos.
  • head: Cubre toda la cabeza excluyendo la cara. Se enfoca en detectar la forma y estructura de la cabeza.
  • head_with_helmet: Representa la cabeza llevando un casco. El modelo debe detectar tanto la cabeza como el casco juntos, poniendo a prueba su capacidad para reconocer su relación.
  • helmet: Representa solo el casco, independientemente de la presencia de una persona o cabeza. Importante para la detección de equipamiento.
  • person: Detecta la presencia de una persona, con o sin casco. Sirve como clase general de detección humana.
  • person_no_helmet: Representa una persona que no lleva casco. El modelo debe identificar tanto la presencia humana como la ausencia de casco.
  • person_with_helmet: Representa una persona que lleva casco. Requiere distinguir tanto la presencia humana como el uso de casco, estrechamente relacionada con person_no_helmet.

Estas clases solapadas y estrechamente relacionadas pueden ser un desafío para los modelos de lenguaje visual, ya que interpretan la información visual a través del lenguaje natural en lugar de capturar directamente diferencias finas a nivel de píxel.

Rendimiento de las CNNs tradicionales

  1. Clase Face
    • Mejor rendimiento: EfficientNet y DenseNet121 (100%)
    • Más bajo: ResNet101 (95%)La detección de caras es altamente precisa en las CNNs, superando a la mayoría de los VLMs.
  2. Clase Head
    • Mejor: ResNet18 y DenseNet121 (69%)
    • Más bajo: ResNet50 (50%)Rendimiento moderado; las CNNs tienen más dificultades con la detección de cabezas que con las clases de cara y casco.
  3. Head y Head_with_helmet
    • Mejor rendimiento: EfficientNet y ResNet18 (Head_with_helmet 98%, Head 65–69%)
    • Más bajo: ResNet50 (Head 50%, Head_with_helmet 96%)Las CNNs rinden muy bien en cabezas con casco, logrando una precisión del 96–98% en todos los modelos. La detección de cabezas sin casco es más desafiante, con menor precisión (50–69%), lo que indica que las CNNs distinguen mejor objetos prominentes como los cascos que regiones menos distintivas como las cabezas sin casco.
  4. Clase Person
    • Todos los modelos: 0% de precisión
  5. Person_no_helmet
    • Mejor: DenseNet121 (72%)
    • Más bajo: ResNet50 (53%)Las CNNs manejan esta clase desafiante mejor que los VLMs, lo que destaca su capacidad para capturar detalles finos.
  6. Person_with_helmet
    • Mejor: EfficientNet (98%)
    • Más bajo: DenseNet121 (96%)Alta precisión en todos los modelos; las personas con casco son reconocidas consistentemente.

Rendimiento de los modelos de lenguaje visual

  1. Clase Face (detección facial)
    • Mejor rendimiento: Claude Opus 4.1 (83%)
    • Más débil: Meta-Llama Vision Instruct (4%) y GPT-4o-mini (12%)Los VLMs generalmente rinden peor en objetos pequeños y detallados como las caras; Meta-Llama y GPT-4o-mini tienen dificultades con los detalles finos.
  2. Head y Head_with_helmet
    • Head: Claude Opus 4.1 (96%) más alto, Meta-Llama (30%) más bajo
    • Head_with_helmet: GPT-4.1 (99%) y Gemini 2.5 Flash (98%) más altos, Meta-Llama (50%) más bajoLos modelos rinden bien en detección de cabezas con o sin casco; la mayoría alcanza más del 90% de precisión excepto Meta-Llama.
  3. Clase Helmet
    • Más alto: Grok 2 Vision (100%), GPT-4.1 (99%), Gemini 2.5 Flash (98%)
    • Más bajo: Meta-Llama (52%)Distinguir objetos con casco frente a sin casco es generalmente más fácil, pero Meta-Llama tiene un bajo rendimiento.
  4. Clase Person
    • Todos los modelos logran el 100%, probablemente debido a objetos grandes y claros.
  5. Person_no_helmet
    • Mejor: GPT-4.1 y Gemini 2.5 Flash (58%)
    • Más bajo: Meta-Llama (18%) y GPT-4o-mini (29%)Detectar detalles finos como la ausencia de casco es desafiante; algunos modelos destacan en objetos prominentes pero se quedan atrás en clases matizadas.
  6. Person_with_helmet
    • Más alto: GPT-4.1 (98%) y Gemini 2.5 Flash (98%)
    • Más bajo: Meta-Llama (55%)La mayoría de los modelos rinden muy bien aquí.

Rendimiento de las APIs cloud

  • Clase Face
    • Mejor: AWS Rekognition (22%)
    • Más bajo: Google Cloud Vision (0%)La detección facial es generalmente pobre en las APIs cloud; las distinciones finas como las caras son desafiantes.
  • Head y Head_with_helmet
    • Head: AWS Rekognition (24%) mejor, Azure Vision más bajo (0%)
    • Head_with_helmet: AWS Rekognition (10%) mejor, Azure Vision (1%) más bajo La detección de cabezas, especialmente con o sin casco, es limitada; las APIs cloud se centran en objetos más amplios en lugar de detalles finos.
  • Clase Helmet
    • Mejor: AWS Rekognition (94%)
    • Más bajo: Azure Vision (37%)La detección de cascos es moderadamente exitosa para algunas APIs (AWS), pero inconsistente entre proveedores.
  • Clase Person
    • Todos los modelos: 100% Los objetos grandes y claros como personas completas son detectados de forma fiable por todas las APIs cloud.
  • Person_no_helmet
    • Mejor: Azure Vision (78%)
    • Más bajo: Google Cloud Vision (26%)El rendimiento varía ampliamente; algunas APIs pueden manejar clases desafiantes moderadamente bien.
  • Person_with_helmet
    • Mejor: AWS Rekognition (94%)
    • Más bajo: Azure Vision (37%) Las personas con casco son detectadas de forma fiable por AWS pero de manera inconsistente por otros proveedores.

Para faces, las CNNs logran la mayor precisión, seguidas por los VLMs, mientras que las APIs cloud rinden pobremente. En las clases head y head_with_helmet, las CNNs se mantienen fuertes, los VLMs rinden bien en cabezas con casco pero de forma menos consistente en cabezas sin casco, y las APIs cloud tienen dificultades con ambas. Para helmets, las CNNs y los VLMs generalmente rinden muy bien, mientras que las APIs cloud muestran un éxito variable. En la clase person, todos los paradigmas detectan personas completas de forma fiable. Para person_no_helmet, las CNNs superan tanto a los VLMs como a las APIs cloud, demostrando un manejo superior de los detalles finos. Finalmente, para person_with_helmet, las CNNs y los VLMs mantienen una alta precisión, mientras que las APIs cloud muestran un rendimiento inconsistente dependiendo del proveedor.

Precisión, recall y puntuación F1

La precisión mide cuántas de las predicciones positivas de un modelo son realmente correctas. En otras palabras, responde a la pregunta: «De las predicciones que el modelo etiquetó como positivas, ¿cuántas son verdaderamente correctas?»

El recall mide cuántas de las instancias positivas reales identifica con éxito el modelo. Responde a la pregunta: «De todos los casos positivos reales, ¿cuántos detectó el modelo?»

La puntuación F1 es un resumen equilibrado de precisión y recall. Proporciona una métrica única que refleja tanto la exactitud como la cobertura, particularmente útil cuando se quiere equilibrar precisión y recall.

Los modelos basados en CNNs (ResNet50, ResNet101, DenseNet121) muestran un alto rendimiento tanto en precisión (0.93–0.95) como en recall (0.91–0.94), resultando en altas puntuaciones F1 (0.92–0.93). Esto indica que son altamente precisos en sus predicciones y capaces de capturar la mayoría de las instancias positivas reales. EfficientNet también muestra una alta puntuación F1 (0.92), ofreciendo un rendimiento consistente y fiable.

Las APIs cloud (AWS Rekognition, Google Cloud Vision, Azure Vision) tienen menor precisión y recall, con puntuaciones F1 que oscilan entre 0.32 y 0.58. Esto sugiere que, aunque los servicios cloud están optimizados para tareas de propósito general, su precisión en distinciones de clases finas es limitada.

Los modelos de lenguaje visual muestran un rendimiento más variable. GPT-4.1, X-IA Grok 2 Vision y Claude Opus 4.1 logran exactamente 0.76 de puntuación F1, mientras que Google Gemini 2.5 Flash rinde ligeramente mejor con una puntuación F1 de 0.80. Aunque estos modelos demuestran un buen rendimiento en algunas clases, generalmente van por detrás de las CNNs en precisión general. Meta-Llama Vision Instruct tiene una puntuación F1 de 0.47, con baja precisión y recall, lo que significa que el modelo tiene dificultades tanto para hacer predicciones correctas como para capturar verdaderos positivos.

Posibles razones detrás de las diferencias de rendimiento

Ventaja de la arquitectura CNN

Las CNNs tradicionales están especializadas en la extracción de características a nivel de píxel, permitiendo una detección rápida y precisa de objetos con detalles finos. Sus capas convolucionales optimizadas y mapas de características jerárquicos permiten baja latencia y alta mAP en tareas estándar de reconocimiento de imágenes.

Sobrecarga multimodal en los VLMs

Los Modelos de Lenguaje Visual procesan tanto imágenes como texto, añadiendo pasos de atención cruzada y alineación de embeddings. Esto permite razonamiento y salidas contextuales pero aumenta el tiempo de inferencia, lo que conlleva una mayor latencia en comparación con las CNNs.

Detección de clases con detalles finos

Las clases solapadas o sutiles (por ejemplo, person_no_helmet vs person_with_helmet) ponen de relieve las diferencias entre modelos. Las CNNs capturan consistentemente estos detalles, los VLMs rinden bien en objetos prominentes pero tienen dificultades con distinciones sutiles, y las APIs cloud se centran en clases amplias, limitando la precisión.

Fiabilidad de la salida estructurada

La generación inconsistente de JSON afecta al rendimiento de los VLMs. Los modelos con bajas tasas de éxito parecen menos efectivos en pipelines, mientras que las CNNs y las APIs cloud producen salidas predecibles y deterministas.

Entonces, ¿cuál deberías elegir?

Las CNNs tradicionales son ideales para aplicaciones donde la velocidad es crítica y los tiempos de respuesta en milisegundos importan, como el procesamiento de vídeo en tiempo real, vehículos autónomos o sistemas de seguridad industrial. Con su precisión superior (mAP 0.75–0.81) e inferencia ultrarrápida (0.03–0.2s), estos modelos de IA tradicionales destacan cuando necesitas un rendimiento fiable y consistente sin la sobrecarga del procesamiento de lenguaje natural o la complejidad del modelo. Las CNNs se centran en tareas de datos visuales y clasificación de imágenes como la detección de objetos, ofreciendo tanto precisión visual como eficiencia sin necesidad de fine-tuning en modelos multimodales.

Los Modelos de Lenguaje Visual (VLMs) brillan cuando necesitas comprensión contextual y salidas flexibles. Estos modelos de lenguaje visual funcionan tanto en modalidades visuales como textuales, permitiendo que los modelos de lenguaje grandes procesen entradas de imagen junto con descripciones de texto. Perfectos para aplicaciones que requieren explicaciones en lenguaje natural, subtitulado de imágenes, tareas de razonamiento visual o incluso respuesta a preguntas visuales, aprovechan codificadores de visión y capas de atención cruzada para alinear pares de imagen-texto en el mismo espacio dimensional. Aunque aceptas una mayor latencia (3–12s), las capacidades de razonamiento que aportan a la comprensión de imágenes, elementos visuales e instrucciones visuales los hacen ideales para tareas posteriores más específicas como moderación inteligente de contenido, generación de imágenes, razonamiento matemático visual o asistentes de visión interactivos. Mediante el uso de fine-tuning eficiente en parámetros con datos de entrenamiento de alta calidad, los modelos de lenguaje visual (VLMs) se convierten en potentes modelos de machine learning que unifican información visual y textual bajo un espacio de embedding compartido.

Las APIs cloud proporcionan respuestas detalladas y completas con metadatos enriquecidos y puntuaciones de confianza, lo que las hace ideales cuando necesitas información extensa más allá de la simple clasificación. Estas APIs a menudo se basan en componentes de codificador de visión preentrenados y codificadores visuales entrenados con datasets de modelos públicos a gran escala de descripciones conceptuales y fotos relevantes. Ideales para aplicaciones que requieren salidas JSON estructuradas, bounding boxes, localización de objetos o comprensión de vídeos largos, son soluciones listas para usar sin necesidad de entrenamiento robusto de modelos o gestión de infraestructura. Aunque su precisión es moderada (mAP 0.61–0.66), reducen los detalles técnicos y los costes de infraestructura, permitiendo tareas como generación automatizada de informes, extracción de significado semántico e integración unificada con modelos generativos existentes.

Deja que nuestro equipo automatice uno de tus procesos de negocio con agentes de IA, sin coste alguno.
Automatizar un proceso

Calculadora de precios

Modelos de lenguaje visual (VLMs) – Características clave y ventajas

Razonamiento multimodal

Los Modelos de Lenguaje Visual (VLMs) son potentes modelos multimodales que pueden procesar simultáneamente modalidades visuales y textuales, permitiéndoles interpretar información visual y textual de una manera más rica y consciente del contexto. Al alinear la entrada de imagen con prompts en lenguaje natural, permiten tareas avanzadas como subtitulado automático de imágenes, detección de cascos en material de seguridad, tareas de razonamiento visual, respuesta a preguntas visuales e incluso explicar contenido visual en lenguaje natural. A diferencia de los modelos de IA tradicionales que se centran solo en datos visuales, los VLMs combinan capacidades de visión con el razonamiento de modelos de lenguaje grandes, haciéndolos ideales para tareas posteriores complejas.

Salida estructurada y generación de JSON

Muchos modelos de lenguaje visual pueden generar salidas estructuradas como JSON, lo cual es valioso para pipelines automatizados y aplicaciones que requieren descripciones de texto junto con características de imagen. En nuestro benchmark, ChatGPT-5 y Gemini 2.5 Pro fallaron consistentemente, mientras que Meta-Llama Vision Instruct solo tuvo éxito aproximadamente el 36% de las veces. Las salidas estructuradas son particularmente útiles para asistentes de visión, permitiendo tareas como detección de objetos, localización de objetos y producción de datos fiables para modelos de machine learning sin necesidad de un fine-tuning extenso.

Capacidades de fine-tuning

Los VLMs admiten fine-tuning eficiente en parámetros con datos de entrenamiento relativamente pequeños, permitiendo una rápida adaptación a tareas de razonamiento visual específicas de dominio. Por ejemplo, pueden ser fine-tuneados para distinguir individuos con casco frente a sin casco o equipos de seguridad especializados en escenarios de entrada de imagen. Al aprovechar arquitecturas de codificador de visión preentrenadas y técnicas robustas de entrenamiento de modelos, pueden generalizar mejor con menos descripciones conceptuales o pares de imagen-texto.

No te pierdas nuestros análisis comparativos e insights basados en datos. El botón abre Google; seleccionar AIMultiple confirma que deseas ver AIMultiple con más frecuencia en los resultados de búsqueda de Google.
GoogleAñadir como fuente preferida

Limitaciones de los modelos de lenguaje visual

Latencia y velocidad

En comparación con las CNNs tradicionales o modelos de visión más simples, los modelos de lenguaje visual suelen tener una mayor latencia, lo que puede limitar aplicaciones en tiempo real como la comprensión de vídeos largos. Algunos modelos multimodales, como X-IA Grok 2 Vision y Google Gemini 2.5 Flash, se acercan a las APIs cloud en velocidad, pero Meta-Llama es notablemente más lento. El compromiso proviene de su diseño de modelo extremo a extremo y capas de atención cruzada, que mejoran las capacidades de razonamiento pero aumentan el tiempo de inferencia.

Desafíos por clase

Los modelos de lenguaje visual a veces tienen dificultades con clases solapadas y reconocimiento de objetos con detalles finos, como diferenciar entre una «head» y una «head_with_helmet» o entre «person_no_helmet» y «person_with_helmet». Mientras que algunos modelos rinden bien en clases con casco, tienen un bajo rendimiento en otras tareas de razonamiento visual como detectar caras o elementos visuales sutiles. Esto resalta la importancia de datos de entrenamiento de alta calidad y un fine-tuning cuidadoso al apuntar a tareas posteriores más específicas.

Fiabilidad de la salida estructurada

La consistencia de las salidas estructuradas como JSON varía ampliamente. Mientras que algunos VLMs generan salidas válidas de forma fiable, otros fallan en casos de uso particulares, limitando su utilidad en pipelines completamente automatizados. Incluso con backbones de codificador de visión preentrenados y enfoques de espacio de embedding compartido, algunos modelos aún fallan en mantener el significado semántico en la salida estructurada. Esta inconsistencia subraya la necesidad de un entrenamiento robusto de modelos, fotos relevantes en el dataset y mejoras continuas en los modelos generativos para las modalidades de visión y lenguaje.

Metodología del benchmark

Realizamos nuestra evaluación exhaustiva utilizando el dataset de detección de cascos de seguridad SHEL5K, utilizando específicamente las primeras 500 imágenes para garantizar una comparación consistente entre todas las arquitecturas de modelos. El dataset contiene siete clases solapadas diseñadas para poner a prueba las capacidades de detección de objetos con detalles finos: face, head, head_with_helmet, helmet, person, person_no_helmet y person_with_helmet.

Preprocesamiento de datos

Las anotaciones originales del dataset SHEL5K se proporcionaron en formato XML. Desarrollamos un pipeline de preprocesamiento para convertir estas anotaciones en un formato CSV multi-etiqueta adecuado para una evaluación sistemática:

Cada imagen fue mapeada a sus etiquetas de ground truth correspondientes, creando un marco de evaluación estandarizado. Para las CNNs tradicionales, las imágenes fueron preprocesadas a una resolución de 224×224 con normalización estándar. Los modelos de lenguaje visual y las APIs cloud recibieron las imágenes en su formato original para preservar la información contextual.

Protocolo de evaluación de CNNs tradicionales

Las redes neuronales convolucionales tradicionales (EfficientNet, variantes de ResNet, DenseNet121) se sometieron a fine-tuning supervisado utilizando las mejores prácticas establecidas:

Configuración de entrenamiento:

  • Arquitectura: Modelos preentrenados con cabezas de clasificación modificadas
  • Función de pérdida: BCEWithLogitsLoss para clasificación multi-etiqueta
  • Optimizador: Adam con tasa de aprendizaje 1e-4
  • Épocas de entrenamiento: 5
  • División de datos: 80% entrenamiento, 20% validación
  • Tamaño de batch: 16

Marco de prueba de modelos de lenguaje visual

Los VLMs fueron evaluados mediante prompts cuidadosamente estructurados diseñados para obtener respuestas consistentes y legibles por máquina. Nuestro enfoque de ingeniería de prompts solicitaba puntuaciones de confianza en formato JSON para cada clase.

Configuración de API:

  • Temperatura: 0.1 (temperatura baja para consistencia)
  • Tokens máximos: 800
  • Modelos probados mediante integración con la API de OpenRouter
  • Parseo de JSON con manejo de errores y validación de formato

Seguimiento de tasa de éxito: Monitorizamos el porcentaje de respuestas JSON válidas, ya que los VLMs a veces generan explicaciones en lenguaje natural en lugar de salida estructurada. Esta métrica resultó crucial para evaluar la viabilidad de despliegue práctico.

Integración de APIs cloud y mapeo de etiquetas

Las APIs cloud presentaron desafíos únicos debido a su naturaleza de propósito general y diferentes taxonomías. Desarrollamos estrategias de mapeo integrales para cada servicio:

Estrategia de mapeo de etiquetas:

Las APIs cloud presentan un desafío fundamental: no fueron diseñadas para nuestra taxonomía específica de siete clases. Estos servicios devuelven etiquetas de propósito general como «person», «helmet», «construction worker» o «safety equipment» en lugar de las combinaciones precisas que necesitamos evaluar (como «person_with_helmet» o «head_with_helmet»).

Para abordar esta limitación, desarrollamos diccionarios de mapeo integrales para cada servicio cloud basados en sus salidas. El mapeo de Azure Computer Vision incluyó más de 50 variantes de etiquetas que cubren diferentes formas en que la API podría describir personas (person, man, woman, worker, individual), cascos (helmet, hard hat, safety helmet, cap) y rasgos faciales (face, human face, portrait). Se crearon mapeos extensos similares para AWS Rekognition y Google Cloud Vision, cada uno adaptado al vocabulario y patrones de etiquetado específicos de ese servicio.

Lógica de inferencia de clases combinadas:

El aspecto más sofisticado de nuestra evaluación de APIs cloud implicó inferir clases combinadas que las APIs no reconocen explícitamente. Implementamos lógica basada en reglas para detectar cuándo aparecen juntos múltiples elementos básicos:

Cuando tanto «person» como «helmet» se detectan en la misma imagen con suficiente confianza, el sistema infiere «person_with_helmet» utilizando la puntuación de confianza mínima entre las dos detecciones (enfoque conservador). De manera similar, detectar «head» y «helmet» simultáneamente activa la clasificación «head_with_helmet».

Para clasificaciones negativas, cuando se detecta una persona pero no se encuentra ningún casco, el sistema infiere «person_no_helmet» con una confianza ligeramente reducida (90% de la confianza original de persona) para tener en cuenta la incertidumbre inherente a la inferencia negativa.

Este enfoque reconoce que las APIs cloud destacan en la detección de objetos individuales pero tienen dificultades con el razonamiento relacional sobre combinaciones de objetos—una limitación clave al evaluar tareas de clasificación con detalles finos y dependientes del contexto.

Métricas de evaluación y análisis estadístico

Métricas principales:

  • Precisión Media Promedio (mAP): Medida principal de exactitud utilizando macro-promediado entre clases
  • Precisión, Recall, Puntuación F1: Micro-promediado para evaluación de rendimiento general
  • Exactitud por clase: Rendimiento individual por clase para análisis detallado
  • Latencia: Tiempo de procesamiento extremo a extremo por imagen
  • Tasa de éxito: Porcentaje de salidas válidas (particularmente relevante para VLMs)

Selección de umbral: Se aplicó un umbral de clasificación de 0.5 de manera consistente en todos los modelos, utilizando puntuaciones de confianza para los VLMs y logits activados con sigmoide para los modelos tradicionales.

Robustez estadística: Cada modelo fue evaluado en conjuntos de imágenes idénticos con preprocesamiento consistente para garantizar una comparación justa. Las mediciones de latencia se promediaron en múltiples ejecuciones para tener en cuenta la varianza del sistema.

Controles experimentales y limitaciones

Controles implementados:

  • Conjunto de prueba idéntico de 500 imágenes en todos los modelos
  • Métricas de evaluación y umbrales consistentes
  • Manejo de errores y procedimientos de timeout estandarizados
  • Rotación de múltiples claves de API para manejar límites de tasa

Cita este benchmark

Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.

Cem Dilmegani and Nazlı Şipi (2026) - "Modelos de Lenguaje Visual Comparados con el Reconocimiento de Imágenes". Publicado en línea en AIMultiple.com. Recuperado el 30 de Junio de 2026, de: https://aimultiple.com/vision-language-models [Recurso en línea]

Dilmegani, C., & Şipi, N. (2026, 30 de Junio). Modelos de Lenguaje Visual Comparados con el Reconocimiento de Imágenes. AIMultiple. https://aimultiple.com/vision-language-models

@misc{dilmegani2026,
  author = {Dilmegani, Cem and Şipi, Nazlı},
  title  = {{Modelos de Lenguaje Visual Comparados con el Reconocimiento de Imágenes}},
  year   = {2026},
  month  = jun,
  howpublished    = {\url{https://aimultiple.com/vision-language-models}},
  note   = {AIMultiple. Recuperado el 30 de Junio de 2026}
}
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem ha sido el analista principal en AIMultiple desde 2017. AIMultiple informa a cientos de miles de empresas (según similarWeb), incluido el 60% de Fortune 500 cada mes. El trabajo de Cem ha sido citado por publicaciones globales líderes como Business Insider, Forbes, Washington Post, firmas globales como Deloitte, HPE y ONG como el Foro Económico Mundial y organizaciones supranacionales como la Comisión Europea. A lo largo de su carrera, Cem se ha desempeñado como consultor tecnológico, comprador de tecnología y emprendedor tecnológico. Asesoró a empresas en sus decisiones tecnológicas en McKinsey & Company y Altman Solon durante más de una década. También publicó un informe de McKinsey sobre digitalización. Lideró la estrategia tecnológica y las adquisiciones de una empresa de telecomunicaciones reportando directamente al CEO. También lideró el crecimiento comercial de la empresa de tecnología profunda Hypatos, que alcanzó ingresos recurrentes anuales de 7 dígitos y una valoración de 9 dígitos desde 0 en 2 años. El trabajo de Cem en Hypatos fue cubierto por publicaciones tecnológicas líderes como TechCrunch y Business Insider. Cem habla regularmente en conferencias internacionales de tecnología. Se graduó de la Universidad de Bogazici como ingeniero informático y tiene un MBA de Columbia Business School.
Ver perfil completo
Investigado por
Nazlı Şipi
Nazlı Şipi
Investigadora de IA
Nazlı es analista de datos en AIMultiple. Tiene experiencia previa en análisis de datos en diversas industrias, donde trabajó en la transformación de conjuntos de datos complejos en información procesable.
Ver perfil completo

Sé el primero en comentar

Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.

0/450