Nous avons évalué les configurations API par défaut d'Amazon Rekognition, Google Cloud Vision et Microsoft Azure IA Vision sur 100 images réparties sur 5 classes d'objets, et comparé leurs tarifs et leurs couvertures fonctionnelles.
Résultats du benchmark des outils de reconnaissance d'images
Aperçu des performances à IoU=0.5
Les indicateurs de performance de trois plateformes de reconnaissance d'images ont été évalués à un seuil d'Intersection over Union (IoU) de 0.5, en comparant les valeurs de mAP, score F1, rappel et précision.
La mAP est le principal indicateur d'évaluation à prendre en compte pour les tâches de détection d'objets, car elle fournit une mesure complète de la qualité de détection à travers différents seuils de confiance et classes d'objets.
Vous pouvez en savoir plus sur notre méthodologie de benchmark.
Précision moyenne (AP) par classe à IoU=0.5
Les trois services détectent les personnes de manière fiable mais perdent en précision sur les équipements de protection, les casques affichant la baisse la plus marquée.
Bien qu'Amazon et Google montrent une faible précision pour la détection des gants et des casquettes, Microsoft Azure IA Vision atteint une précision de 0% pour les deux catégories. Azure IA Vision ne détecte pas les objets de petite taille (moins de 5% de l'image) ou disposés de manière rapprochée, ce qui pourrait contribuer à la faible précision observée dans la détection des gants et des casquettes.1
Aucun des services ne parvient à détecter les masques (précision de 0%), soulignant une lacune critique de leurs capacités de reconnaissance d'objets lorsqu'ils sont utilisés avec les paramètres par défaut sans étiquetage personnalisé.
Vous pouvez en savoir plus sur les limites de la reconnaissance d'images.
mAP à différents seuils IoU [0.5:0.05:0.95]
Lorsque les seuils IoU se resserrent de 0.5 à 0.95, la mAP diminue pour les trois services, mais à des rythmes différents. Amazon Rekognition résiste le mieux sur l'ensemble de la plage, suggérant un alignement des boîtes englobantes plus précis que les deux autres services.
Facteurs potentiels affectant les différences de performance
Focus sur l'entraînement du modèle et portée du produit
- Amazon Rekognition inclut des capacités dédiées aux EPI, ce qui se traduit probablement par une meilleure couverture d'entraînement et de meilleures représentations de caractéristiques pour les objets tels que les casques et les gants.
- Google Cloud Vision et Azure IA Vision privilégient les tâches générales de compréhension d'image (par exemple, OCR, points de repère, marques, détection Web), faisant des EPI et des objets similaires des objectifs secondaires dans leur entraînement.
Configuration API par défaut et compromis précision–rappel
- Tous les services ont été évalués en utilisant les paramètres par défaut, qui privilégient généralement une haute précision pour minimiser les faux positifs.
- Ce choix de conception conduit à de solides scores de précision chez tous les fournisseurs, mais à un rappel significativement plus faible, en particulier pour les objets moins proéminents.
Limites de la détection des petits objets
- Les objets tels que les gants, les casquettes et les casques occupent souvent une petite fraction de l'image, ce qui les rend difficiles à détecter de manière fiable.
- Azure IA Vision, qui est documentée comme étant moins performante sur les objets petits ou rapprochés, montre la dégradation la plus prononcée dans ces catégories.
Taxonomie des étiquettes et cartographie d'évaluation
- Les étiquettes spécifiques aux fournisseurs ont dû être cartographiées selon une taxonomie de vérité terrain unifiée.
- Les détections valides utilisant des étiquettes non correspondantes ou plus granulaires ont pu être exclues de l'évaluation.
Absence de détection de masque
- Aucun des services évalués n'expose d'étiquettes d'objet liées aux masques dans leurs API par défaut.
- Tous les trois ont donc obtenu une précision de 0% pour les masques.
Sensibilité IoU et qualité de localisation
- Les différences de performance augmentent à des seuils IoU plus élevés, où un alignement plus strict des boîtes englobantes est requis.
- Amazon Rekognition conserve une mAP relativement plus élevée à ces seuils, suggérant une plus grande précision de localisation.
Méthodologie du benchmark des outils de reconnaissance d'images
Nous avons testé les performances prêtes à l'emploi (c'est-à-dire sans étiquetage personnalisé) de ces fournisseurs dans des cas réels.
Nous avons utilisé 100 images. Nous avons redimensionné les images à une taille de 512×512 pixels tout en préservant les régions essentielles contenant les instances, étant donné que le jeu de données d'origine avait des dimensions variables.
Nous souhaitons exécuter ce test à nouveau sans que les éditeurs-entraînent leurs solutions sur le jeu de données. Par conséquent, nous ne divulguons pas le jeu de données que nous avons utilisé pour ce benchmark.
Nous avons traité les réponses des API des fournisseurs de services de la manière suivante :
- cartographié les étiquettes des fournisseurs de services vers les catégories de vérité terrain définies dans le tableau ci-dessus. Les étiquettes des fournisseurs de services ne correspondant pas à ces étiquettes de vérité terrain ont été exclues de l'évaluation.
- normalisé les formats de boîtes englobantes des différents fournisseurs
- calculé l'IoU entre les boîtes prédites et les boîtes de vérité terrain
- apparié les prédictions à la vérité terrain en fonction du seuil IoU
- calculé les métriques : précision, rappel, F1 et AP par catégorie
- calculé la mAP de style COCO en utilisant les seuils 0.5-0.95
Un exemple de calcul de l'IoU, de la précision, du rappel et du F1 est présenté dans la figure ci-dessous :
Métriques du benchmark
Précision
La précision mesure l'exactitude des prédictions positives faites par le modèle. En reconnaissance d'images, pour une classe donnée (par exemple, « personne »), elle répond à la question : « De toutes les images que le modèle a étiquetées comme contenant une personne, combien en contiennent réellement ? ». C'est crucial dans les scénarios où les faux positifs (étiqueter incorrectement une image comme positive) sont coûteux.
Rappel
Le rappel mesure l'exhaustivité des prédictions positives, répondant à la question : « De toutes les images contenant réellement la classe, combien le modèle a-t-il correctement identifiées ? ». C'est vital lorsque manquer une instance positive (faux négatif) est critique.
Score F1
Le score F1 est la moyenne harmonique de la précision et du rappel, fournissant une mesure équilibrée particulièrement utile en cas de distribution inégale des classes (par exemple, peu d'images de casques par rapport aux images sans casque). C'est une métrique unique qui capture à la fois les faux positifs et les faux négatifs.
mAP
La mAP, ou mean Average Precision, est une métrique principalement utilisée dans les tâches de détection d'objets en reconnaissance d'images. Elle évalue la précision du modèle pour différentes classes en faisant la moyenne de la précision moyenne (AP) de chaque classe. L'AP elle-même est l'aire sous la courbe précision-rappel, générée en faisant varier le seuil de confiance pour les détections.
Cet outil interactif vous permet de comparer les résultats de détection entre les fournisseurs en utilisant des images exemples du jeu de données. Utilisez les boutons du haut pour sélectionner Amazon, Google, Microsoft ou tous les fournisseurs. Affichez la vérité terrain avec la case à cocher. Naviguez entre les images de test à l'aide des boutons numérotés à gauche. Des boîtes colorées montrent chaque détection avec les scores de confiance.
Meilleures API de reconnaissance d'images
Amazon Rekognition
Amazon Rekognition inclut des API dédiées à la détection d'EPI en plus de la détection générale d'objets et de visages, ce qui lui confère une couverture d'étiquettes plus large sur des classes telles que les casques et les gants que les deux autres services. Cette portée produit est cohérente avec les résultats AP par classe du benchmark.
Ses API image sont divisées en deux groupes :
- Groupe 1 (identification faciale) : CompareFaces, IndexFaces, SearchFaces, utilisés pour la vérification d'identité et la recherche de visages dans des collections d'images.
- Groupe 2 (analyse de contenu) : DetectLabels (détection générale d'objets), DetectModerationLabels, DetectText, RecognizeCelebrities, DetectPPE.
Il s'intègre au reste d'AWS (S3 pour le stockage, Lambda pour le traitement événementiel, SageMaker pour l'entraînement de modèles personnalisés).
Google Cloud Vision
Google Cloud Vision a dépassé 89% de précision à IoU=0.5, le même plancher de précision que les deux autres services, mais a produit un rappel plus faible sur les petits objets et les équipements de protection. Son orientation produit penche vers la compréhension d'image à usage général plutôt que vers la détection industrielle : OCR, reconnaissance de points de repère, identification de logos et de marques, et Détection Web (mise en correspondance d'une image avec des images indexées publiquement).
Capacités de base :
- Localisation d'objets et détection d'étiquettes
- OCR pour le texte imprimé et manuscrit dans plusieurs langues
- Détection de points de repère, de logos et de célébrités
- Détection Web pour la recherche inversée d'images
- Entraînement de modèles personnalisés via Vertex IA
Il s'intègre à Cloud Storage, BigQuery et Google Workspace, et accepte une plus large gamme de formats de fichiers que Rekognition (JPEG, PNG, GIF, BMP, WEBP, RAW, ICO, PDF, TIFF).
Microsoft Azure IA Vision
Microsoft Azure IA Vision fournit l'analyse d'images, OCR, le sous-titrage d'images et un service distinct de suppression d'arrière-plan. Sa documentation indique que le détecteur d'objets ne gère pas de manière fiable les objets petits ou rapprochés, se positionnant donc davantage vers la compréhension générale d'images et la lecture de texte que vers la détection fine d'objets.
Les capacités de base sont divisées en deux groupes :
- Groupe 1 (détection d'éléments visuels) : étiquetage, visage, détection d'objets, détection de marques et de points de repère, recadrage intelligent, OCR.
- Groupe 2 (sortie sensible au langage) : description d'image, sous-titres denses, lecture complète (OCR de document).
Fonctionnalités différenciantes des fournisseurs de services
Aperçu des tarifs des API
Création de modèles de vision personnalisés
Les API hébergées telles qu'Amazon Rekognition, Google Cloud Vision et Microsoft Azure IA Vision renvoient des prédictions à partir d'un ensemble d'étiquettes fixe défini par le fournisseur. Lorsqu'une classe d'objet requise est absente de cet ensemble, ou lorsque la précision sur un domaine spécifique est trop faible, l'alternative est d'entraîner un modèle personnalisé. Roboflow est un exemple qui couvre ce flux de travail.
Roboflow
Roboflow est une plateforme de vision par ordinateur qui couvre l'annotation de données, l'entraînement de modèles et le déploiement. Elle fonctionne sur un modèle différent des API de détection hébergées ci-dessus : les utilisateurs entraînent des modèles sur leurs propres jeux de données étiquetés et exécutent l'inférence sur leur propre matériel, plutôt que d'appeler un point de terminaison géré. C'est la voie que prennent les équipes lorsque les API cloud par défaut n'exposent pas d'étiquettes pour une classe d'objet spécifique, comme les masques qui ont obtenu une précision de 0% pour les trois services testés.
Roboflow inclut trois composants principaux :
- RF-DETR : un modèle temps réel basé sur Transformer pour la détection et la segmentation d'objets, destiné aux entrées de caméras et vidéos en direct.2
- AutoDistill : un outil qui utilise de grands modèles de fondation pour étiqueter automatiquement les jeux de données d'images sans annotation manuelle.3
- Inference : un package de déploiement prenant en charge plusieurs backends (ONNX, TensorRT, PyTorch), avec exécution sur GPU, CPU ou appareils edge tels que NVIDIA Jetson via un service Dockerisé.4
Edge computing dans la reconnaissance d'images
La reconnaissance d'images basée sur le cloud envoie chaque image à un centre de données distant pour analyse. L'edge computing exécute le modèle sur l'appareil qui a capturé l'image, de sorte que le résultat (une étiquette, une alerte, un drapeau) quitte l'appareil.
Fonctionnement de l'edge computing
Dans une configuration cloud, les caméras agissent comme des collecteurs de données et diffusent des images brutes en amont ; le modèle réside dans le centre de données. Dans une configuration edge, l'appareil exécute le réseau de neurones localement et transmet la sortie pertinente : « personne détectée », « stock faible », « défaut trouvé ».
Pourquoi c'est important pour la reconnaissance d'images
- Latence : l'inférence locale supprime l'aller-retour vers le cloud, ce qui est important pour les véhicules autonomes, les robots de fabrication et tout système devant agir sur la prédiction en quelques millisecondes.
- Confidentialité : les images ne quittent pas l'appareil, ce qui est utile lorsque des contraintes de résidence des données ou de RGPD s'appliquent (imagerie médicale, vidéosurveillance en magasin).
- Bande passante et coût : les métadonnées sont téléversées, pas la vidéo complète, ce qui réduit les coûts de réseau et d'API cloud pour les déploiements à haut volume.
- Fonctionnement hors ligne : les appareils edge continuent de fonctionner lorsque le réseau tombe en panne, ce qui est requis pour les systèmes de sécurité et les sites industriels éloignés.
Exemples concrets d'IA edge dans la reconnaissance d'images
SDK sur appareil Captur
Le traitement sur appareil est la forme la plus courante d'IA edge dans les contextes mobiles. Captur fournit un SDK de vérification d'image sur appareil qui exécute des modèles de vision par ordinateur localement sur les appareils mobiles en ~30ms, même hors ligne.5 Le prestataire logistique GoBolt a intégré le SDK de Captur dans son application chauffeur pour la vérification de la preuve de livraison et a signalé une baisse de 30% des réclamations pour livraison non reçue dès la première semaine.6
Ultralytics YOLO26
YOLO26 d'Ultralytics est un modèle de vision par ordinateur open source conçu pour les appareils edge et à faible consommation.7 Son architecture entièrement de bout en bout, sans NMS, supprime les étapes de post-traitement telles que la suppression non maximale, réduisant la latence et améliorant l'exportabilité vers le matériel edge tout en prenant en charge la détection d'objets, la segmentation, la classification et l'estimation de pose au sein d'une seule famille de modèles.8
Les Transformers de vision dans la reconnaissance d'images
Les API de reconnaissance d'images testées ici utilisent des détecteurs basés sur les CNN. Les Transformers de vision (ViT) sont une architecture alternative qui divise l'image en patchs de taille fixe (typiquement 16×16 pixels) et traite tous les patchs en parallèle, ce qui permet au modèle de relier des régions éloignées de l'image dès la première couche plutôt que de construire ce contexte progressivement par convolutions empilées.
Pour la détection d'objets, cela est important lorsque l'identité d'un objet dépend de la scène environnante (un chapeau sur une personne par rapport à un chapeau sur une étagère). Les CNN capturent cela par des convolutions empilées ; les ViT le capturent par attention sur tous les patchs à la fois.
Les trois services cloud de ce benchmark exécutent tous des modèles basés sur des CNN en production. Des architectures hybrides CNN-Transformer apparaissent dans les nouveaux modèles open source (par exemple, RF-DETR de Roboflow utilise un backbone Transformer DINOv2), mais les API cloud de production n'ont pas encore migré.
Modèles de Transformers de vision pour la reconnaissance d'images
- Google ViT : le Transformer de vision original, entraîné sur ImageNet pour la classification d'images. Disponible sur Hugging Face avec des poids pré-entraînés.
- Swin Transformer : utilise un mécanisme de fenêtres décalées pour capturer à la fois les détails globaux et locaux, utilisé pour la détection et la segmentation.
- DINOv2 (Meta) : modèle auto-supervisé entraîné sans étiquettes manuelles, produisant des embeddings d'images à usage général.
- Segment Anything Model (SAM) : un segmenteur basé sur ViT qui peut isoler des objets sur lesquels il n'a pas été entraîné.
Cas d'usage des logiciels de reconnaissance d'images
Dans le paysage numérique actuel, les technologies de vision par ordinateur et de traitement d'images ont transformé la manière dont les entreprises exploitent les données visuelles. Des algorithmes avancés de classification d'images permettent des outils de reconnaissance d'images sophistiqués qui remodèlent les opérations dans tous les secteurs.
Ces technologies de reconnaissance d'images combinent des approches puissantes d'entraînement de modèles avec des interfaces intuitives qui permettent aux utilisateurs d'automatiser des tâches visuelles complexes. Des solutions de vision personnalisées pour des besoins métier spécifiques aux systèmes de reconnaissance faciale pour la sécurité, ces outils peuvent identifier des motifs, des objets et des caractéristiques dans les images.
Inspection visuelle
La reconnaissance d'images permet une inspection visuelle automatisée dans de multiples secteurs. Ces systèmes identifient les objets, détectent les caractéristiques et vérifient la compatibilité en analysant les données visuelles.
Par exemple, Chamberlain Group a implémenté Amazon Rekognition dans son application myQ, permettant aux utilisateurs de capturer automatiquement des images de leur ouvre-porte de garage pour vérifier la compatibilité. Cette solution simplifiée a remplacé un processus manuel complexe et a considérablement augmenté les taux de connexion des utilisateurs.9
Traitement de documents
La technologie OCR extrait le texte des images et des documents, automatisant la saisie de données dans plusieurs langues. Les systèmes modernes peuvent traiter le texte manuscrit et les mises en page complexes, transformant les flux de travail papier et rendant les documents consultables.
Par exemple, le groupe d'assurance français LSA Courtage utilise Google Cloud Vision API pour reconnaître le texte des permis de conduire et des cartes grises. Cette implémentation OCR a réduit le temps de traitement des documents de 45% par page et augmenté la productivité des souscripteurs de 20%, leur permettant de traiter 1 500 documents par jour.10
Vous pouvez consulter notre benchmark OCR pour voir la précision des divers outils OCR pour différents types de documents.
Surveillance agricole
Les agriculteurs utilisent l'imagerie par drone avec la reconnaissance d'images pour surveiller la santé des cultures, détecter les maladies et optimiser l'irrigation. En identifiant les zones de stress des cultures avant l'apparition de symptômes visibles, les agriculteurs peuvent intervenir tôt et réduire l'utilisation des ressources.
Par exemple, le Project FarmBeats de Microsoft (désormais Azure Data Manager for Agriculture) utilise des capteurs, des drones et l'apprentissage automatique pour permettre une agriculture basée sur les données dans des environnements avec une alimentation électrique et une connectivité Internet limitées. Le système aide à augmenter la productivité agricole et à réduire les coûts en combinant les données visuelles avec les connaissances des agriculteurs sur leurs terres.11
Sécurité et surveillance
Les systèmes de sécurité utilisent la reconnaissance faciale et la détection d'objets pour identifier les activités, contrôler l'accès et localiser les personnes. Ces systèmes surveillent les flux vidéo et alertent le personnel en cas de menace. Par exemple, Sun Finance utilise Amazon Rekognition pour vérifier l'identité des clients en comparant des selfies avec des documents d'identité, accélérant la vérification et prévenant la fraude tout en élargissant l'inclusion financière.12
Modération de contenu
Les plateformes de médias sociaux utilisent la reconnaissance d'images pour filtrer les contenus inappropriés tels que la nudité, la violence ou les images graphiques des téléversements d'utilisateurs. La génération de légendes peut ajouter une deuxième couche en décrivant un contexte d'image que les classificateurs au niveau des pixels ne détectent pas, par exemple des symboles de haine en arrière-plan d'une photo par ailleurs anodine. Selon AWS, le filtrage automatique réduit généralement le volume que les modérateurs humains doivent examiner à 1–5% du total.13
Par exemple, CoStar Group utilise Amazon Rekognition pour la modération de contenu et l'analyse vidéo d'environ 150 000 téléversements quotidiens d'images et de vidéos vers leur plateforme immobilière commerciale. Cette solution de modération de contenu analyse les images, classe le contenu, détecte les contenus indésirables et exploite la technologie de sous-titrage d'images pour comprendre le contexte, ce qui permet de gagner du temps tout en garantissant la conformité et des données de haute qualité.14
Vous pouvez en savoir plus sur les applications de la reconnaissance d'images.
Limites de la technologie de reconnaissance d'images
Réduction des détails dans les petits objets
Lorsque les objets apparaissent petits dans les images, ils contiennent moins de pixels, ce qui se traduit par des données visuelles limitées. De plus, les CNN ont tendance à perdre d'importants détails fins lors du traitement à travers les couches de sous-échantillonnage, ce qui entrave considérablement les capacités de détection.
Détections manquées
Les systèmes de reconnaissance d'images privilégient généralement les objets plus grands pendant les phases d'entraînement et d'analyse, ce qui entraîne des fréquences plus élevées de petits objets manqués ou de faux négatifs.
Interférences de l'arrière-plan
Les objets plus petits sont plus vulnérables au fait d'être obscurcis par le bruit visuel, l'encombrement de l'arrière-plan ou des éléments qui se chevauchent, ce qui les rend plus difficiles à identifier avec précision. Même une occlusion partielle peut affecter de manière disproportionnée les petits objets, car ils ont une surface moins distincte au départ.
Variabilité d'échelle
Les objets apparaissant à différentes distances ou échelles posent des difficultés aux modèles qui ne sont pas spécifiquement conçus pour détecter les détails fins à travers des tailles d'objets variables.
Exigences computationnelles
Les techniques visant à améliorer la détection des petits objets, comme l'extraction de caractéristiques multi-échelles ou les entrées à plus haute résolution, nécessitent plus de puissance de traitement, limitant l'applicabilité en temps réel.
Biais d'entraînement
Les jeux de données sous-représentent souvent les petits objets ou manquent d'annotations suffisantes pour ceux-ci, réduisant la généralisation du modèle à de tels cas dans les scénarios réels.
FAQ
Un logiciel de reconnaissance d'images est un type de technologie de vision par ordinateur qui utilise des algorithmes d'apprentissage automatique pour analyser des données non structurées comme les images numériques et les données vidéo. Il va au-delà de l'identification d'objets spécifiques ; les systèmes avancés visent la compréhension de scène, en interprétant le contexte et les relations au sein d'une image pour fournir une analyse plus complète. Cela permet aux ordinateurs de voir et de classer efficacement les informations visuelles.
Aucun logiciel de reconnaissance d'images ou de vision par ordinateur n'est universellement le meilleur. Le choix idéal parmi les technologies de reconnaissance d'images dépend de vos besoins spécifiques. Tenez compte de facteurs tels que la précision requise, le type de tâches à effectuer (comme la détection d'objets ou l'OCR, et même considérer si vous devez intégrer le traitement du langage naturel pour des tâches combinant compréhension d'image et analyse de texte), la facilité d'utilisation, l'évolutivité, le budget, les options de personnalisation et l'expertise technique de votre équipe. Essayer différentes options est le meilleur moyen de trouver les technologies de reconnaissance d'images qui fournissent le mieux les capacités de vision par ordinateur dont vous avez besoin pour votre application.
Bien que la reconnaissance d'images se soit considérablement améliorée, la précision n'est pas garantie. Les facteurs ayant un impact sur les performances incluent la qualité de l'image (éclairage, résolution), la complexité de la scène, les variations d'apparence des objets et la qualité des données d'entraînement utilisées pour les algorithmes d'apprentissage profond. Atteindre une compréhension robuste de la scène et détecter avec précision des objets spécifiques peut être difficile dans des données visuelles complexes ou bruitées.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Comparatif des meilleurs outils de reconnaissance d'images}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/image-recognition-software}},
note = {AIMultiple. Consulté le 17 Juin 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.