Comparación de las principales herramientas de reconocimiento de imágenes
Evaluamos las configuraciones predeterminadas de API de Amazon Rekognition, Google Cloud Vision y Microsoft Azure IA Vision en 100 imágenes de 5 clases de objetos, y comparamos sus precios y cobertura de funciones.
Resultados de la evaluación comparativa de herramientas de reconocimiento de imágenes
Resumen del rendimiento con IoU=0.5
Se evaluaron las métricas de rendimiento de tres plataformas de reconocimiento de imágenes con un umbral de Intersección sobre Unión (IoU) de 0.5, comparando los valores de mAP, puntuación F1, recuperación y precisión.
El mAP es la métrica de evaluación principal a considerar para tareas de detección de objetos, ya que proporciona una medida integral de la calidad de la detección en diferentes umbrales de confianza y clases de objetos.
Puede leer más sobre nuestra metodología de evaluación comparativa.
Precisión media por clase (AP) con IoU=0.5
Los tres servicios detectan personas de manera fiable, pero pierden precisión en equipos de protección, siendo los cascos los que muestran la mayor caída.
Mientras que Amazon y Google muestran baja precisión en la detección de guantes y gorras, Microsoft Azure IA Vision alcanza una precisión del 0% para ambas categorías. Azure IA Vision no detecta objetos que sean pequeños (menos del 5% de la imagen) o que estén muy juntos, lo que podría contribuir a la baja precisión observada en la detección de guantes y gorras.1
Ninguno de los servicios puede detectar máscaras con éxito (precisión del 0%), lo que pone de relieve una brecha crítica en sus capacidades de reconocimiento de objetos cuando se utilizan en configuraciones predeterminadas sin etiquetado personalizado.
Puede leer más sobre las limitaciones del reconocimiento de imágenes.
mAP en diferentes umbrales de IoU [0.5:0.05:0.95]
A medida que los umbrales de IoU se endurecen de 0.5 a 0.95, el mAP disminuye para los tres servicios, pero a ritmos diferentes. Amazon Rekognition resiste mejor en todo el rango, lo que sugiere una alineación más precisa de las cajas delimitadoras que los otros dos servicios.
Factores potenciales que afectarían las diferencias de rendimiento
Enfoque de entrenamiento del modelo y alcance del producto
- Amazon Rekognition incluye capacidades dedicadas a la detección de EPP, lo que probablemente resulta en una mejor cobertura de entrenamiento y representaciones de características para objetos como cascos y guantes.
- Google Cloud Vision y Azure IA Vision priorizan tareas generales de comprensión de imágenes (por ejemplo, OCR, puntos de referencia, marcas, detección web), lo que hace que los EPP y objetos similares sean secundarios en sus objetivos de entrenamiento.
Configuración predeterminada de API y compensaciones precisión-recuperación
- Todos los servicios se evaluaron utilizando las configuraciones predeterminadas, que normalmente priorizan una alta precisión para minimizar los falsos positivos.
- Esta elección de diseño conduce a puntuaciones de precisión sólidas en todos los proveedores, pero a una recuperación significativamente menor, especialmente para objetos menos prominentes.
Limitaciones en la detección de objetos pequeños
- Objetos como guantes, gorras y cascos a menudo ocupan una pequeña fracción de la imagen, lo que dificulta su detección fiable.
- Azure IA Vision, que según la documentación tiene un rendimiento inferior en objetos pequeños o muy juntos, muestra la degradación más pronunciada en estas categorías.
Taxonomía de etiquetas y mapeo de evaluación
- Las etiquetas específicas de los proveedores tuvieron que mapearse a una taxonomía de referencia unificada.
- Las detecciones válidas que usaban etiquetas no coincidentes o más granulares pueden haber sido excluidas de la evaluación.
Ausencia de detección de máscaras
- Ninguno de los servicios evaluados expone etiquetas de objetos relacionadas con máscaras en sus API predeterminadas.
- Por lo tanto, los tres devolvieron una precisión del 0% para máscaras.
Sensibilidad al IoU y calidad de localización
- Las diferencias de rendimiento aumentan en umbrales de IoU más altos, donde se requiere una alineación más estricta de las cajas delimitadoras.
- Amazon Rekognition mantiene un mAP relativamente más alto en estos umbrales, lo que sugiere una mayor precisión de localización.
Metodología de evaluación comparativa de herramientas de reconocimiento de imágenes
Probamos el rendimiento listo para usar (es decir, sin etiquetado personalizado) de estos proveedores en casos de la vida real.
Utilizamos 100 imágenes. Escalamos las imágenes a 512×512 píxeles, preservando las regiones esenciales que contenían instancias, ya que el conjunto de datos original comprendía dimensiones variables.
Queremos repetir esta prueba sin que los proveedores entrenen sus soluciones en el conjunto de datos. Por lo tanto, no revelamos el conjunto de datos que utilizamos para esta evaluación comparativa.
Procesamos las respuestas de las API de los proveedores de servicios de la siguiente manera:
- mapeó las etiquetas de los proveedores de servicios a las categorías de referencia definidas en la tabla anterior. Las etiquetas de los proveedores de servicios que no coincidían con estas etiquetas de referencia se excluyeron de la evaluación.
- normalizó los formatos de las cajas delimitadoras de los diferentes proveedores
- calculó el IoU entre las cajas predichas y las de referencia
- emparejó las predicciones con las referencias basándose en el umbral de IoU
- calculó métricas: precisión, recuperación, F1 y AP por categoría
- calculó el mAP estilo COCO utilizando umbrales 0.5-0.95
A continuación se muestra un ejemplo de cálculo de IoU, precisión, recuperación y F1:
Métricas de evaluación comparativa
Precisión
La precisión mide la exactitud de las predicciones positivas realizadas por el modelo. En el reconocimiento de imágenes, para una clase determinada (por ejemplo, “persona”), responde a la pregunta: “De todas las imágenes que el modelo etiquetó como que contenían una persona, ¿cuántas la contenían realmente?”. Esto es crucial en escenarios donde los falsos positivos (etiquetar incorrectamente una imagen como positiva) son costosos.
Recuperación
La recuperación mide la exhaustividad de las predicciones positivas, respondiendo: “De todas las imágenes que realmente contienen la clase, ¿cuántas identificó correctamente el modelo?”. Esto es vital cuando es crítico pasar por alto una instancia positiva (falso negativo).
Puntuación F1
La puntuación F1 es la media armónica de la precisión y la recuperación, proporcionando una medida equilibrada que es especialmente útil cuando hay una distribución desigual de clases (por ejemplo, pocas imágenes de cascos en comparación con imágenes sin casco). Es una métrica única que captura tanto los falsos positivos como los falsos negativos.
mAP
El mAP, o Precisión Media Promedio, es una métrica utilizada principalmente en tareas de detección de objetos dentro del reconocimiento de imágenes. Evalúa la precisión del modelo en diferentes clases promediando la Precisión Media (AP) de cada clase. La AP en sí misma es el área bajo la curva de precisión-recuperación, que se genera variando el umbral de confianza para las detecciones.
Esta herramienta interactiva le permite comparar los resultados de detección entre proveedores utilizando imágenes de ejemplo del conjunto de datos. Utilice los botones superiores para seleccionar Amazon, Google, Microsoft o todos los proveedores. Alterne la referencia con la casilla de verificación. Navegue entre las imágenes de prueba utilizando los botones numerados de la izquierda. Los recuadros codificados por colores muestran cada detección con puntuaciones de confianza.
Mejores API de reconocimiento de imágenes
Amazon Rekognition
Amazon Rekognition incluye API dedicadas a la detección de EPP junto con la detección general de objetos y rostros, lo que le proporciona una cobertura de etiquetas más amplia en clases como cascos y guantes que los otros dos servicios. Este alcance del producto es coherente con los resultados de AP por clase en la evaluación comparativa.
Sus API de imagen se dividen en dos grupos:
- Grupo 1 (identificación facial): CompareFaces, IndexFaces, SearchFaces, utilizados para verificación de identidad y búsqueda facial en colecciones de imágenes.
- Grupo 2 (análisis de contenido): DetectLabels (detección general de objetos), DetectModerationLabels, DetectText, RecognizeCelebrities, DetectPPE.
Se integra con el resto de AWS (S3 para almacenamiento, Lambda para procesamiento basado en eventos, SageMaker para entrenamiento de modelos personalizados).
Google Cloud Vision
Google Cloud Vision superó el 89% de precisión con IoU=0.5, el mismo mínimo de precisión que los otros dos servicios, pero produjo una recuperación menor en objetos pequeños y equipos de protección. Su alcance de producto se inclina hacia la comprensión de imágenes de propósito general en lugar de la detección industrial: OCR, reconocimiento de puntos de referencia, identificación de logotipos y marcas, y Detección Web (coincidencia de una imagen con imágenes indexadas públicamente).
Capacidades principales:
- Localización de objetos y detección de etiquetas
- OCR para texto impreso y manuscrito en varios idiomas
- Detección de puntos de referencia, logotipos y celebridades
- Detección Web para búsqueda inversa de imágenes
- Entrenamiento de modelos personalizados a través de Vertex IA
Se integra con Cloud Storage, BigQuery y Google Workspace, y acepta una gama más amplia de formatos de archivo que Rekognition (JPEG, PNG, GIF, BMP, WEBP, RAW, ICO, PDF, TIFF).
Microsoft Azure IA Vision
Microsoft Azure IA Vision proporciona análisis de imágenes, OCR, subtitulado de imágenes y un servicio independiente de eliminación de fondo. Su documentación señala que el detector de objetos no maneja de forma fiable objetos pequeños o muy juntos, por lo que se posiciona más hacia la comprensión general de imágenes y la lectura de texto que hacia la detección de objetos de grano fino.
Las capacidades principales se dividen en dos grupos:
- Grupo 1 (detección de elementos visuales): etiquetado, rostros, detección de objetos, detección de marcas y puntos de referencia, recorte inteligente, OCR.
- Grupo 2 (salida consciente del lenguaje): descripción de imágenes, subtítulos densos, lectura completa (OCR de documentos).
Características diferenciadoras de los proveedores de servicios
Resumen de precios de API
Creación de modelos de visión personalizados
Las API alojadas como Amazon Rekognition, Google Cloud Vision y Microsoft Azure IA Vision devuelven predicciones de un conjunto fijo de etiquetas definido por el proveedor. Cuando falta una clase de objeto requerida en ese conjunto, o cuando la precisión en un dominio específico es demasiado baja, la alternativa es entrenar un modelo personalizado. Roboflow es un ejemplo que cubre este flujo de trabajo.
Roboflow
Roboflow es una plataforma de visión por computadora que cubre la anotación de datos, el entrenamiento de modelos y el despliegue. Funciona con un modelo diferente al de las API de detección alojadas mencionadas anteriormente: los usuarios entrenan modelos en sus propios conjuntos de datos etiquetados y ejecutan la inferencia en su propio hardware, en lugar de llamar a un endpoint gestionado. Este es el camino que toman los equipos cuando las API de nube predeterminadas no exponen etiquetas para una clase de objeto específica, como las máscaras que obtuvieron una precisión del 0% en los tres servicios evaluados.
Roboflow incluye tres componentes principales:
- RF-DETR: un modelo basado en transformadores en tiempo real para detección y segmentación de objetos, destinado a entradas de cámara y video en vivo.2
- AutoDistill: una herramienta que utiliza grandes modelos fundacionales para etiquetar automáticamente conjuntos de datos de imágenes sin anotación manual.3
- Inference: un paquete de despliegue que admite múltiples backends (ONNX, TensorRT, PyTorch), con ejecución en GPU, CPU o dispositivos de borde como NVIDIA Jetson a través de un servicio Dockerizado.4
Computación de borde en el reconocimiento de imágenes
El reconocimiento de imágenes basado en la nube envía cada fotograma a un centro de datos remoto para su análisis. La computación de borde ejecuta el modelo en el dispositivo que capturó el fotograma, por lo que el resultado (una etiqueta, una alerta, una señal) abandona el dispositivo.
Cómo funciona la computación de borde
En una configuración de nube, las cámaras actúan como recolectores de datos y transmiten fotogramas sin procesar aguas arriba; el modelo reside en el centro de datos. En una configuración de borde, el dispositivo ejecuta la red neuronal localmente y transmite la salida relevante: “persona detectada”, “inventario bajo”, “defecto encontrado”.
Por qué es importante para el reconocimiento de imágenes
- Latencia: la inferencia local elimina el viaje de ida y vuelta a la nube, lo cual es importante para vehículos autónomos, robots de fabricación y cualquier sistema que deba actuar sobre la predicción en milisegundos.
- Privacidad: las imágenes no abandonan el dispositivo, lo cual es útil donde se aplican restricciones de residencia de datos o GDPR (imágenes médicas, CCTV en tiendas).
- Ancho de banda y costo: se cargan los metadatos, no el video completo, lo que reduce los costos de red y de API en la nube para despliegues de gran volumen.
- Funcionamiento sin conexión: los dispositivos de borde siguen funcionando cuando falla la red, lo cual es necesario para sistemas de seguridad y sitios industriales remotos.
Ejemplos del mundo real de IA de borde en el reconocimiento de imágenes
SDK en el dispositivo Captur
El procesamiento en el dispositivo es la forma más común de IA de borde en contextos móviles. Captur proporciona un SDK de verificación de imágenes en el dispositivo que ejecuta modelos de visión por computadora localmente en dispositivos móviles en ~30ms, incluso sin conexión.5 El proveedor de logística GoBolt integró el SDK de Captur en su aplicación de conductor para la verificación de prueba de entrega e informó una disminución del 30% en las reclamaciones de entrega no recibida en la primera semana.6
Ultralytics YOLO26
YOLO26 de Ultralytics es un modelo de visión por computadora de código abierto diseñado para dispositivos de borde y de bajo consumo.7 Su arquitectura completamente de extremo a extremo, libre de NMS, elimina pasos de posprocesamiento como la supresión no máxima, reduciendo la latencia y mejorando la exportabilidad a hardware de borde, al tiempo que admite detección de objetos, segmentación, clasificación y estimación de poses dentro de una única familia de modelos.8
Transformadores de visión en el reconocimiento de imágenes
Las API de reconocimiento de imágenes evaluadas aquí utilizan detectores basados en CNN. Los Transformadores de Visión (ViTs) son una arquitectura alternativa que divide la imagen en parches de tamaño fijo (normalmente 16×16 píxeles) y procesa todos los parches en paralelo, lo que permite que el modelo relacione regiones distantes de la imagen desde la primera capa en lugar de construir ese contexto gradualmente a través de convoluciones apiladas.
Para la detección de objetos, esto importa cuando la identidad de un objeto depende de la escena circundante (un sombrero en una persona versus un sombrero en un estante). Las CNN capturan esto a través de convoluciones apiladas; los ViTs lo capturan a través de la atención en todos los parches a la vez.
Los tres servicios en la nube de esta evaluación comparativa ejecutan modelos basados en CNN en producción. Las arquitecturas híbridas CNN-Transformer están apareciendo en modelos de código abierto más nuevos (por ejemplo, RF-DETR de Roboflow utiliza un backbone de transformador DINOv2), pero las API de nube de producción aún no han migrado.
Modelos de transformadores de visión para el reconocimiento de imágenes
- Google ViT: el Transformador de Visión original, entrenado en ImageNet para clasificación de imágenes. Disponible en Hugging Face con pesos pre-entrenados.
- Swin Transformer: utiliza un mecanismo de ventana desplazada para capturar detalles globales y locales, utilizado para detección y segmentación.
- DINOv2 (Meta): modelo auto-supervisado entrenado sin etiquetas manuales, que produce embeddings de imagen de propósito general.
- Segment Anything Model (SAM): segmentador basado en ViT que puede aislar objetos para los que no ha sido entrenado.
Casos de uso del software de reconocimiento de imágenes
En el panorama digital actual, las tecnologías de visión por computadora y procesamiento de imágenes han transformado la forma en que las empresas aprovechan los datos visuales. Los algoritmos avanzados de clasificación de imágenes permiten herramientas de reconocimiento de imágenes sofisticadas que están remodelando las operaciones en todas las industrias.
Estas tecnologías de reconocimiento de imágenes combinan potentes enfoques de entrenamiento de modelos con interfaces intuitivas que permiten a los usuarios automatizar tareas visuales complejas. Desde soluciones de visión personalizadas para necesidades empresariales específicas hasta sistemas de reconocimiento facial para seguridad, estas herramientas pueden identificar patrones, objetos y características dentro de las imágenes.
Inspección visual
El reconocimiento de imágenes permite la inspección visual automatizada en múltiples industrias. Estos sistemas identifican objetos, detectan características y verifican la compatibilidad analizando datos visuales.
Por ejemplo, Chamberlain Group implementó Amazon Rekognition en su aplicación myQ, permitiendo a los usuarios capturar automáticamente imágenes de su abridor de puerta de garaje para verificar la compatibilidad. Esta solución optimizada reemplazó un proceso manual complejo y aumentó significativamente las tasas de conexión de usuarios.9
Procesamiento de documentos
La tecnología OCR extrae texto de imágenes y documentos, automatizando la entrada de datos en varios idiomas. Los sistemas modernos pueden procesar texto manuscrito y diseños complejos, transformando los flujos de trabajo basados en papel y haciendo que los documentos sean buscables.
Por ejemplo, el grupo de seguros francés LSA Courtage utiliza Google Cloud Vision API para reconocer texto de permisos de conducir y documentos de registro. Esta implementación de OCR redujo el tiempo de procesamiento de documentos en un 45% por página y aumentó la productividad de los suscriptores en un 20%, permitiéndoles procesar 1,500 documentos al día.10
Puede consultar nuestra evaluación comparativa de OCR para ver la precisión de las diversas herramientas de OCR para diferentes tipos de documentos.
Monitoreo agrícola
Los agricultores utilizan imágenes de drones con reconocimiento de imágenes para monitorear la salud de los cultivos, detectar enfermedades y optimizar el riego. Al identificar áreas de estrés en los cultivos antes de que aparezcan síntomas visibles, los agricultores pueden intervenir temprano y reducir el uso de recursos.
Por ejemplo, Project FarmBeats de Microsoft (ahora Azure Data Manager for Agriculture) utiliza sensores, drones y aprendizaje automático para permitir la agricultura basada en datos en entornos con energía y conectividad a internet limitadas. El sistema ayuda a aumentar la productividad agrícola y reducir costos combinando datos visuales con el conocimiento de los agricultores sobre su tierra.11
Seguridad y vigilancia
Los sistemas de seguridad utilizan reconocimiento facial y detección de objetos para identificar actividades, controlar el acceso y localizar personas. Estos sistemas monitorean transmisiones de video y alertan al personal sobre amenazas. Por ejemplo, Sun Finance utiliza Amazon Rekognition para verificar la identidad del cliente comparando selfies con documentos de identidad, acelerando la verificación y previniendo el fraude mientras amplía la inclusión financiera.12
Moderación de contenido
Las plataformas de redes sociales utilizan el reconocimiento de imágenes para filtrar contenido inapropiado como desnudos, violencia o imágenes gráficas de las cargas de los usuarios. La generación de subtítulos puede agregar una segunda capa al describir el contexto de la imagen que los clasificadores a nivel de píxel pasan por alto, por ejemplo, detectando símbolos de odio en el fondo de una foto por lo demás benigna. Según AWS, el filtrado automático normalmente reduce el volumen que los moderadores humanos necesitan revisar al 1–5% del total.13
Por ejemplo, CoStar Group utiliza Amazon Rekognition para la moderación de contenido y el análisis de video de aproximadamente 150,000 cargas diarias de imágenes y videos en su plataforma de bienes raíces comerciales. Esta solución de moderación de contenido escanea imágenes, clasifica contenido, detecta material no deseado y aprovecha la tecnología de subtitulado de imágenes para comprender el contexto, ahorrando tiempo y asegurando el cumplimiento y datos de alta calidad.14
Puede leer más sobre las aplicaciones del reconocimiento de imágenes.
Limitaciones de la tecnología de reconocimiento de imágenes
Reducción de detalles en objetos pequeños
Cuando los objetos aparecen pequeños en las imágenes, contienen menos píxeles, lo que resulta en datos visuales limitados. Además, las CNN tienden a perder detalles finos importantes durante el procesamiento a través de capas de reducción de resolución, lo que dificulta significativamente las capacidades de detección.
Detecciones omitidas
Los sistemas de reconocimiento de imágenes generalmente favorecen objetos más grandes durante las fases de entrenamiento y análisis, lo que resulta en mayores frecuencias de objetos pequeños omitidos o falsos negativos.
Interferencia de fondo
Los objetos más pequeños son más vulnerables a ser ocultados por ruido visual, desorden de fondo o elementos superpuestos, lo que dificulta su identificación precisa. Incluso la oclusión parcial puede afectar desproporcionadamente a los objetos pequeños, ya que tienen menos área distinguible para empezar.
Variabilidad de escala
Los objetos que aparecen a diferentes distancias o escalas plantean dificultades para los modelos no diseñados específicamente para detectar detalles finos en tamaños de objetos variables.
Demandas computacionales
Las técnicas para mejorar la detección de objetos pequeños, como la extracción de características multiescala o entradas de mayor resolución, requieren más potencia de procesamiento, lo que limita la aplicabilidad en tiempo real.
Sesgo de entrenamiento
Los conjuntos de datos a menudo subrepresentan objetos pequeños o carecen de anotaciones suficientes para ellos, lo que reduce la generalización del modelo a tales casos en escenarios del mundo real.
Preguntas frecuentes
El software de reconocimiento de imágenes es un tipo de tecnología de visión por computadora que utiliza algoritmos de aprendizaje automático para analizar datos no estructurados como imágenes digitales y datos de video. Va más allá de identificar objetos específicos; los sistemas avanzados apuntan a la comprensión de escenas, interpretando el contexto y las relaciones dentro de una imagen para proporcionar un análisis más completo. Esto permite a las computadoras ver y clasificar información visual de manera efectiva.
Ningún software de reconocimiento de imágenes o software de visión por computadora es universalmente el mejor. La elección ideal entre las tecnologías de reconocimiento de imágenes depende de sus necesidades específicas. Considere factores como la precisión requerida, el tipo de tareas que necesita realizar (como detección de objetos o OCR, e incluso considerando si necesita integrarse con procesamiento de lenguaje natural para tareas que combinan la comprensión de imágenes con el análisis de texto), la facilidad de uso, la escalabilidad, el presupuesto, las opciones de personalización y la experiencia técnica de su equipo. Probar diferentes opciones es la mejor manera de encontrar las tecnologías de reconocimiento de imágenes que mejor proporcionen las capacidades de visión por computadora que necesita para su aplicación.
Si bien el reconocimiento de imágenes ha mejorado significativamente, la precisión no está garantizada. Los factores que afectan el rendimiento incluyen la calidad de la imagen (iluminación, resolución), la complejidad de la escena, las variaciones en la apariencia de los objetos y la calidad de los datos de entrenamiento utilizados para los algoritmos de aprendizaje profundo. Lograr una comprensión robusta de la escena y detectar con precisión objetos específicos puede ser un desafío en datos visuales complejos o ruidosos.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Comparación de las principales herramientas de reconocimiento de imágenes}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/image-recognition-software}},
note = {AIMultiple. Recuperado el 17 de Junio de 2026}
}
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.