Services
Contactez-nous

Benchmark éthique et conforme des données web

Cem Dilmegani
Cem Dilmegani
mis à jour le 4 août 2026

À mesure que les entreprises développent leurs opérations de données web, les responsables de la conformité, des données et des risques évaluent de plus en plus les risques éthiques, réputationnels et juridiques associés.

Nous avons évalué 5 grands services de collecte de données web selon 3 dimensions et testé chaque service avec plus de 20 scénarios potentiellement contraires à l’éthique.

Notre travail vous aide à évaluer la position éthique de vos pratiques de collecte de données et à comprendre les conséquences potentielles des approches non éthiques. Nous fournissons également des lignes directrices pour la collecte éthique de données web et évaluons les services de collecte de données web sous l’angle de l’éthique et de la conformité :

Évaluation des services de collecte de données web

Nous avons évalué les principaux services de collecte de données web (également appelés fournisseurs de données web ou infrastructure de données web) à l’aide de notre checklist éthique des données web. Ces scores représentent des niveaux de maturité, 5 étant le niveau le plus élevé :

Fournisseurs
Résumé
Utilisation éthique par les clients
Approvisionnement éthique
Certification externe
Couverture d’assurance partagée**
Niveau 5
Niveau 5
Niveau 5
Sécurité des données, traitement des PII. Sources IP sur liste blanche. Pratiques éthiques évaluées.
Niveau 1
Niveau 1
Niveau 1
Sécurité des données
Niveau 1
Niveau 1
Niveau 1
Sécurité des données
Nimble
Niveau 1
Niveau 1
Niveau 0
Sécurité des données

* Ce sont des codes pour les noms des fournisseurs. Ces fournisseurs n’ont pas souhaité être cités dans ce rapport et figurent en bas de liste jusqu’à ce que nous résolvions ce problème.

** ✅ indique que l’entreprise a choisi de partager ses certificats d’assurance avec AIMultiple. ❌ indique que l’entreprise a décidé de ne pas partager ses certificats d’assurance avec nous et que nous n’avons donc pas pu valider sa couverture d’assurance. La couverture d’assurance est la catégorie pour laquelle nous avons dépendu de la participation des entreprises de services de données web afin de les évaluer.

Trié par score récapitulatif.

Modèle de notation pour des données web éthiques

Nous expliquons ci-dessous comment ces scores sont calculés. Vous pouvez également consulter la justification du choix de ces dimensions de notation.

Dans les 2 premières catégories, nous avons identifié 5 compétences, et les entreprises ont reçu des scores basés sur le nombre de compétences satisfaites. Le niveau 5 représente la maturité la plus élevée observée sur le marché, reflétant les meilleures pratiques actuelles plutôt que la perfection.

Capacités pour une utilisation éthique par les clients

  • Processus efficaces pour une utilisation éthique : Nous évaluons la capacité de chaque fournisseur à empêcher l’utilisation non éthique de ses services de proxy résidentiel au moyen de scénarios de test contrôlés. Si l’une quelconque de nos demandes est bloquée par le fournisseur, ce critère est atteint.
  • Processus améliorés pour une utilisation éthique : Similaire à « processus efficaces pour une utilisation éthique ». Toutefois, cette capacité signifie que le fournisseur de services a bloqué plus d’une de nos tentatives d’utilisation de ses services dans des cas d’usage non éthiques.
  • Processus de meilleures pratiques pour une utilisation éthique : Similaire à « processus efficaces pour une utilisation éthique ». Toutefois, cette capacité signifie que le fournisseur de services a bloqué la plupart de nos tentatives d’utilisation de ses services dans des cas d’usage non éthiques.
  • Fondations de gestion des abus : Publication d’une politique de gestion des abus et d’une méthode pour signaler les abus.
  • Gestion réactive des abus : Nous avons mesuré la manière dont les entreprises ont répondu à plusieurs signalements d’abus. Même en l’absence de ligne directe pour signaler un abus, nous avons utilisé les adresses e-mail indiquées par l’entreprise pour joindre son équipe. Si nous n’avons reçu aucune réponse à notre signalement dans un délai d’une semaine, l’entreprise est considérée comme non réactive.

Capacités pour un approvisionnement éthique

L’approvisionnement éthique consiste à acquérir des adresses IP de manière éthique. Notre analyse du marché a identifié les niveaux de transparence suivants concernant l’approvisionnement éthique en IP :

  • Niveau 1 : Publication d’une politique d’approvisionnement en IP.
  • Niveau 2 : A divulgué au moins une source (par exemple une application mobile) d’IP fournissant des IP de manière éthique. La source divulguée doit avoir au total au moins 10k avis sur des plateformes tierces, notamment Google, Apple, les boutiques d’applications Amazon et Trustpilot.
  • Niveau 3 : Identique au niveau 3 mais avec 100k avis
  • Niveau 4 : Identique au niveau 3 mais avec 1M avis
  • Niveau 5 : Identique au niveau 4 mais avec 10M avis

Les avis sont un indicateur de la popularité des applications et constituent un signal important pour cette évaluation. Les services de collecte de données web doivent collaborer avec des applications populaires pour pouvoir répondre aux besoins en IP de leurs clients.

Pour être admissibles, les applications divulguées doivent suivre ces bonnes pratiques. Nous ne vérifierons pas cela pour chaque application divulguée, mais pour quelques-unes sélectionnées au hasard :

  • Consentement éclairé :
    • Les utilisateurs doivent donner leur consentement explicite avant de partager leur connexion internet. L’écran d’acceptation doit indiquer :
      • Le fournisseur
      • Le service
      • Comment leur IP sera utilisée
    • Les utilisateurs doivent pouvoir accéder à des informations détaillées sur
      • Comment leur connexion internet sera utilisée
      • Politique de confidentialité
  • Valeur : Les utilisateurs doivent recevoir une certaine valeur de l’application (par exemple un paiement, la possibilité d’éviter les publicités ou une autre fonctionnalité)
  • Confidentialité : Collecte de données utilisateur limitée et transparente.

Pour les réseaux de proxy résidentiel, les acheteurs doivent également vérifier si le consentement est spécifique, éclairé, révocable et séparé des autorisations d’application sans rapport. Ils doivent demander si les utilisateurs peuvent facilement se désinscrire, si l’utilisation de la bande passante est plafonnée, si les mineurs sont exclus et si le fournisseur audite les applications ou les SDK qui fournissent des IP résidentielles.

Certification externe

Nous avons évalué la certification externe selon que les entreprises ont obtenu ces certificats pertinents pour la sécurité et la conformité de niveau entreprise.

  • Certification PII : Capacité démontrée à gérer les PII par l’obtention de la norme ISO 27018
  • Certification de sécurité des données : Pratiques de sécurité des données démontrées par l’obtention de l’un de ces certificats : SOC 2 ou ISO/IEC 27001
  • Source IP sur liste blanche : Des organismes de certification externes comme McAfee certifient soit :
    • Des applications 3rd parties spécifiques qui fournissent des IP
    • SDK qui collecte des IP à partir d’applications 3rd parties
  • Pratiques éthiques évaluées : Un projet d’assurance ISAE 3000 peut être réalisé pour évaluer les pratiques internes de conformité et d’éthique.

Assurance

Nous avons demandé aux fournisseurs de nous fournir ces documents d’assurance :

  • Assurance responsabilité civile professionnelle : certificat offrant une couverture pour les responsabilités des fournisseurs en cas de problèmes dans le service
  • Certificat de cyber-assurance offrant une couverture pour les responsabilités des fournisseurs en cas de problèmes liés à la sécurité de l’information.

Score récapitulatif

Ce score est la somme de tous les scores divisée par 3. Les scores sont :

  • 0 à 5 pour les capacités d’utilisation éthique par les clients
  • 0 à 5 pour les capacités d’approvisionnement éthique
  • 0 à 3 pour la certification externe
  • 0 à 2 pour les assurances

Principaux services de collecte de données web

AIMultiple a sélectionné les 7 plus grands services de collecte de données web en termes d’employés sur LinkedIn. Nous avons choisi cette métrique car elle est à la fois publique et devrait être corrélée aux revenus de l’entreprise et à sa préparation pour les entreprises. De meilleures métriques telles que les revenus ou le nombre d’employés salariés ne sont pas disponibles publiquement pour ces entreprises privées.

Toutes les entreprises sélectionnées comptent plus de 100 employés connectés à leurs pages de profil LinkedIn en avril 2025. Actuellement, 5 des 7 entreprises sélectionnées figurent sur cette page et les 2 autres ont choisi de ne pas être incluses dans le rapport.

Produits de collecte de données web concernés

Ces entreprises proposent une gamme de produits incluant des proxies, des APIs de data scraping et des datasets. Bien que tous les produits puissent être examinés d’un point de vue éthique, nous sommes d’abord concentrés sur le produit qui offre le plus de flexibilité et alimente la plupart des autres produits : les proxies résidentiels.

Les produits de collecte de données web peuvent être considérés comme une hiérarchie dans laquelle les proxies constituent la couche centrale sur laquelle reposent tous les autres services. En effet, les proxies permettent aux machines d’accéder à Internet via différentes destinations, offrant un ensemble diversifié et vaste de connexions internet crucial pour la collecte de données. Par conséquent, les proxies sont le produit de collecte de données web le plus capable ; il peut être utilisé pour exécuter des fonctions qui ne seraient pas possibles avec des datasets ou des APIs de data scraping.

Parmi les proxies, les proxies résidentiels sont le produit le plus difficile à identifier comme proxy pour les sites web. Par exemple, d’autres proxies comme les proxies de datacenter sont faciles à identifier en raison de leur localisation. Par conséquent, les proxies résidentiels alimentent la plupart des autres produits de données web comme les APIs de data scraping.

Vérifier : votre collecte de données web est-elle conforme & éthique ?

Votre entreprise exploite très probablement des données web. Cependant, le secteur est peu réglementé, d’où l’importance de choisir un fournisseur éthique et conforme. Pour y parvenir, nous avons préparé un cadre holistique prenant en compte différents aspects de la collecte de données web, notamment l’approvisionnement éthique, l’utilisation éthique et la certification externe.

Les données web sont un actif opérationnel courant

En tant qu’entreprise, votre activité repose en partie sur les données web en raison de leurs nombreux cas d’usage, tels que :

  • Tarification dynamique pour le retail & l’e-commerce
  • Données alternatives en temps réel pour les fonds d’investissement
  • Processus KYC dans la banque commerciale
  • Entraînement ou ajustement de modèles d’IA
  • Inférence IA ou RAG
  • Étude de marché

Avec l’IA, les données web sont désormais plus importantes

Bien que la collecte de données web soit aussi ancienne que le web, son importance a considérablement augmenté après l’essor des modèles d’IA générative. Les créateurs de ces modèles, tels que OpenAI et Anthropic, ont démarré sans partenariats de contenu significatifs et ont principalement utilisé des données en ligne pour construire leurs modèles initiaux, ce qui a conduit à l’essor de l’industrie de l’IA de mille milliards de dollars.

Supervision réglementaire limitée

Bien que la réglementation de l’IA soit sous le spotlight, le secteur de la collecte de données reste en grande partie non réglementé dans la plupart des pays. Les activités en ligne clairement illégales sont bien définies. Toutefois, il existe peu d’exigences réglementaires obligeant les acteurs du secteur à prévenir de manière proactive le mauvais usage de leurs services par les utilisateurs.

Il appartient aux plateformes elles-mêmes de définir les bonnes pratiques et les normes de conformité pour garantir une collecte de données éthique et une utilisation éthique des proxies. Par conséquent, le choix de votre fournisseur a plus d’importance dans la collecte de données que dans les secteurs fortement réglementés comme la banque, où chaque fournisseur de services est tenu de se conformer à de nombreuses réglementations.

La position éthique de vos fournisseurs fait partie de la réputation de votre entreprise

Que vous collectiez ou consommiez les données, vous êtes responsable de leur processus d’acquisition.

La responsabilité des entreprises pour les activités illicites dans leur chaîne d’approvisionnement dépend de la juridiction. Par exemple, en Allemagne, les entreprises sont tenues de mener des activités KYS et de gestion des risques pour identifier et prévenir les préjudices causés par leur chaîne d’approvisionnement. Même lorsque les entreprises ne sont pas responsables des préjudices causés par leur chaîne d’approvisionnement, elles peuvent subir un risque réputationnel.

Quel est le coût d’une collecte de données non éthique & non conforme ?

Risque réputationnel

S’il devient public qu’une entreprise utilise un service de collecte de données web qui adopte un comportement non éthique ou des actions mettant en danger sa sécurité des données, cela peut entraîner des dommages réputationnels importants tels qu’une perte d’activité, un taux d’attrition des clients, une fuite des talents et une perte de confiance des investisseurs.

Exemples réels de fournisseurs d’entreprise entraînant une perte de réputation :

  • Nike a subi des dommages réputationnels à plusieurs reprises en raison des pratiques de travail non éthiques de ses fournisseurs.1
  • De nombreuses entreprises comme EY ont perdu la confiance de leurs clients lorsqu’elles ont été touchées par la violation du logiciel de transfert de fichiers géré MOVEit. 2

La perte de réputation, surtout lorsqu’elle suscite l’indignation publique, est généralement suivie de poursuites judiciaires de la part des clients de l’entreprise ou d’autres parties prenantes lésées par les pratiques non éthiques.

Exemple réel : Starbucks est l’une des marques récentes poursuivies en justice pour s’être approvisionnée auprès d’entreprises aux pratiques non éthiques.3

Checklist éthique des données web

Les données web d’entreprise doivent satisfaire 3 exigences pour être éthiques :

Utilisation éthique par les clients

Dans le cadre de leurs processus Know Your Supplier, les entreprises évitent d’utiliser des services qui permettent des activités non éthiques. L’utilisation de tels services expose les entreprises à un préjudice réputationnel.

Exemple réel : Dans des cas où un fournisseur a été documenté alors qu’il permettait que sa plateforme soit utilisée pour des activités non éthiques, de nombreuses entreprises ont pris leurs distances avec ce fournisseur jusqu’à ce qu’il améliore ses pratiques.4

Lien avec les données web : Les données web sont collectées via différentes adresses IP. Ces adresses peuvent être utilisées pour mener différentes activités illicites telles que des attaques DDOS visant à empêcher la fourniture de services numériques, la collecte non autorisée de données non publiques ou la fraude publicitaire. Les acteurs malveillants ont besoin d’IP pour alimenter leurs actions, et les fournisseurs d’infrastructures de données web/proxy sont les plus grands fournisseurs d’IP aux utilisateurs particuliers.

Approvisionnement éthique

Des services utilisés à des fins éthiques peuvent causer des actions non éthiques et nuisibles au cours de leur production. Par exemple, des marques comme Nike et Nestlé ont subi des préjudices réputationnels et fait face à des poursuites en raison du recours au travail des enfants par leurs sous-traitants.

Lien avec les données web :

Les entreprises doivent accéder à un grand nombre et à une diversité de sources de bande passante pour une collecte de données rapide et mondiale. Cela nécessite l’utilisation de proxies résidentiels : si la collecte de données publiques est légale dans de nombreuses conditions, 5 les sites web peuvent aussi choisir de bloquer certains de leurs visiteurs. Par exemple, ils peuvent bloquer les robots d’exploration de leurs concurrents. Dans de tels cas, les entreprises doivent s’appuyer sur un grand nombre de connexions provenant d’utilisateurs particuliers ou d’autres 3rd parties pour collecter des données web.

Les fournisseurs de proxy collectent des millions de connexions internet auprès de diverses sources et les fournissent aux entreprises qui utilisent des adresses IP pour accéder à ces connexions. Certaines de ces IP proviennent d’appareils d’utilisateurs résidentiels. La collecte de ces connexions peut être légale ou illicite :

  • Légal : les pratiques conformes à la loi impliquent d’obtenir le consentement éclairé de l’utilisateur, de fournir une compensation et d’offrir des mécanismes de désinscription conformément aux réglementations locales. Le fournisseur de données web doit :
    • Informer les utilisateurs de la manière dont leur bande passante serait utilisée
    • Obtenir leur consentement par voie numérique
    • Les rémunérer en contrepartie
    • Leur permettre de se désinscrire à tout moment
  • Illégal : les acteurs malveillants peuvent accéder aux appareils des utilisateurs et utiliser leur connexion internet sans autorisation ni compensation. Cela peut se produire par le biais d’applications malveillantes, d’appareils compromis, d’installations masquées, d’acceptation automatique et d’autres méthodes pouvant mettre le propriétaire de l’appareil en danger.

Les entreprises utilisant des proxies obtenus illégalement peuvent, sans le vouloir, rémunérer des acteurs malveillants pour un accès non autorisé à des appareils.

Exemples réels :

  • Des fournisseurs de proxy résidentiel cotés en bourse ont été documentés comme partageant leur infrastructure avec des SDK qui utilisent les connexions des appareils sans le consentement des utilisateurs.6 7
  • Des routeurs et des appareils IoT ont été compromis pour des opérations de botnet et vendus comme proxies résidentiels.8 9
  • Certains fournisseurs de proxy font la promotion de leurs services sur des forums fréquentés par des acteurs malveillants. Ces IP sont susceptibles d’avoir été obtenues illégalement.10
  • Des applications VPN sur le Google Play Store ont également été utilisées pour acquérir des IP résidentielles sans le consentement des utilisateurs.11

Bien que ces opérations aient été fermées, il est probable que des acteurs malveillants accèdent encore à des IP résidentielles sans consentement via des botnets et des applications compromises ou malveillantes.

Certification externe

Les acheteurs d’entreprise ont besoin de solutions sécurisées et prêtes pour l’entreprise. Nous avons identifié les ingrédients d’une organisation de données web mature qui peuvent être documentés par une certification externe :

Sécurité des données

Le manque de sécurité des données dans les systèmes d’un fournisseur peut éroder l’avantage concurrentiel d’une entreprise ou entraîner des pertes de données et des temps d’arrêt du système. La perte de fonctionnalités du système peut éroder la confiance et entraîner la dévalorisation d’une entreprise.

Intrusion dans le système

Les services de collecte de données ne sont pas aussi profondément intégrés aux systèmes d’une entreprise que les services numériques essentiels (par exemple un système d’enregistrement comme un CRM). Par conséquent, leurs références de sécurité ne sont pas examinées aussi attentivement que celles d’un système essentiel comme un système d’enregistrement. Toutefois, la sécurité des données est essentielle pour les clients des services de collecte de données, car ces services :

  • Sont parfois intégrés à des systèmes plus centraux comme les moteurs de tarification.
  • Peuvent infecter les systèmes d’entreprise même lorsqu’ils ne sont pas intégrés à de tels systèmes. L’utilisation d’un service de collecte de données implique la réception de données de ce service. Même certaines des formes les plus sécurisées de transfert de données comportent des risques.

L’intrusion dans le système peut également conduire les attaquants à cibler les appareils qui fournissent des IP résidentielles à un service de proxy. Cela peut entraîner un préjudice réputationnel pour les clients de ce service de proxy.

Exemple réel de vulnérabilité dans un fournisseur de proxy résidentiel :

Les opérateurs du botnet Kimwolf ont acheté des services de proxy auprès du fournisseur de proxy résidentiel IPIDEA. À l’aide de commandes malveillantes, ils ont infecté les réseaux internes des appareils fournissant des IP à IPIDEA. Ces réseaux ont ensuite été analysés et d’autres appareils vulnérables sur ces réseaux locaux ont également été infectés.

On estime que Kimwolf s’est propagé à plus de 2 millions d’appareils grâce à cette méthode. Les données collectées par les clients d’IPIDEA ont également transité par ces réseaux infectés.12

Perte de données

Sans sécurité des données, les acteurs malveillants peuvent accéder aux données collectées par les entreprises pour identifier leurs activités et leurs stratégies, entraînant une perte d’avantage concurrentiel ou d’opportunités commerciales.

Exemple réel :

Bien que les données web soient publiques, les entreprises peuvent les utiliser de manière innovante pour obtenir un avantage concurrentiel. Par exemple, les investisseurs consacrent jusqu’à 10 % de leur budget de données de marché aux données alternatives13 , mais ils divulguent rarement leurs stratégies car ils pensent que cela peut les aider à obtenir un avantage par rapport à leurs concurrents. Une fuite de données peut entraîner l’exposition de leurs stratégies et donc leur reproduction par leurs concurrents.

Gestion des PII

Les données web comprennent des données privées derrière une connexion ou des PII qui peuvent être divulguées accidentellement ou intentionnellement sur des sites web publics. Si les services de collecte de données web ne gèrent pas correctement les PII, ces données peuvent être acquises par des acteurs malveillants. Cela peut entraîner un préjudice réputationnel pour le service de collecte de données web et ses clients.

Sécurité des applications

Les applications ou programmes intermédiaires comme les SDK qui fournissent les IP des services de collecte de données web peuvent être placés sur liste blanche par des organismes de certification externes comme McAfee. Cela accroît la confiance de l’entreprise dans les pratiques d’approvisionnement éthique du service de collecte de données web.

Couverture d’assurance

Les entreprises exigent généralement ces assurances de la part de tout fournisseur numérique :

  • Assurance responsabilité civile professionnelle
  • Certificat de cyber-assurance
Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Benchmark détaillé : évaluation des fournisseurs d’infrastructures de données web

Benchmark : utilisation éthique par les clients

Nous cherchons ici à répondre à la question : l’entreprise garantit-elle que l’utilisation de sa solution est éthique et conforme aux lois et réglementations en vigueur ? Résumé de nos conclusions :

* Non applicable : étant donné que Zyte et Apify achètent des proxies auprès de leurs fournisseurs et ne les collectent pas directement auprès d’utilisateurs résidentiels, les propriétaires de sites web ne les contacteraient pas en cas d’abus et ils n’ont donc pas besoin de créer un formulaire de contact pour les sites web.

Premièrement, nous avons examiné les politiques :

Examen des politiques d’utilisation acceptable

Tous les fournisseurs interdisent les activités illégales et donnent des exemples comme les attaques DoS, les messages en masse non sollicités, l’usurpation d’identité ou le spoofing.

En outre, certains fournisseurs soulignent également qu’ils interdisent les activités susceptibles d’être illégales. Ci-dessous, nous listons les activités interdites sur la base des politiques d’utilisation acceptable et de leurs avenants (par exemple, un avenant sur le traitement des données) pour chaque fournisseur.

Nous avons recherché des termes qui interdiraient les activités susceptibles d’être illégales et pouvant être identifiées en fonction de l’activité de l’utilisateur. Par exemple, une part importante des utilisateurs qui utilisent des proxies pour répondre à des sondages rémunérés pourraient les utiliser pour tromper les fournisseurs de sondages sur leur emplacement réel. Par conséquent, cette activité est à la fois susceptible d’être illégale et peut être identifiée en fonction de l’activité de l’utilisateur (c’est-à-dire lorsqu’un utilisateur se connecte à un site de sondages rémunérés).

Bien qu’identifier clairement les activités interdites soit bénéfique, ce n’est pas une exigence et cela n’a pas d’incidence sur nos scores. Les entreprises peuvent choisir d’indiquer qu’elles n’autorisent pas les activités illégales plutôt que de mentionner chaque cas possible d’activités illégales.

Mentionner une activité comme interdite ne signifie pas que ces activités seront examinées ou bloquées. Nos scores reposent sur la manière dont ces politiques sont mises en œuvre, comme expliqué ci-dessous :

Processus pour une utilisation éthique

Si certaines catégories énoncées dans les politiques d’utilisation acceptable sont assez larges (par exemple, le data scraping ou l’accès non autorisé), d’autres sont suffisamment précises pour être converties en actions préventives (par exemple le blocage de l’accès) que les services de collecte de données peuvent mettre en œuvre pour les utilisateurs qui n’ont pas terminé leur processus KYC.

Sur la base de ces utilisations interdites spécifiques, nous avons préparé une liste exhaustive d’utilisations susceptibles d’être des utilisations illégales de proxies. Pour chaque cas d’usage, nous avons identifié des scénarios incluant des domaines web et des actions pertinents. Par exemple, dans le scénario d’engagement artificiel sur les réseaux sociaux, nous avons tenté de nous connecter à un réseau social en utilisant un proxy pour aimer une publication existante.

Ensuite, pour vérifier si les entreprises autorisent une utilisation non éthique par les clients, nous avons créé un compte sur le service de chaque fournisseur en utilisant une adresse e-mail non AIMultiple. Nous n’avons pas terminé le processus KYC avec ce compte et avons utilisé les services pour comprendre ce que des utilisateurs anonymes peuvent accomplir avec chaque service. La procédure KYC est une étape cruciale au cours de laquelle l’utilisateur soumet des données pour valider l’entité juridique qu’il représente. Cela relie l’activité de l’utilisateur à une entité juridique :

  • Qui peut être tenue responsable.
  • Dont la justification des actions en ligne (par exemple l’utilisation de proxies pour se connecter à des sites web gouvernementaux) peut être examinée. Par exemple, après avoir compris son cas d’usage, un chercheur ou un organisme gouvernemental peut être autorisé à se connecter à un site web gouvernemental en utilisant un proxy.

Nous attendions à ce que ces cas d’usage déclenchent une procédure KYC, mais chez la plupart des fournisseurs, cela ne s’est pas produit. Une coche indique que la demande a été bloquée pour les utilisateurs n’ayant pas encore terminé la procédure KYC :

Pour plus de clarté, les entreprises de services de collecte de données n’ont aucune obligation légale de bloquer ces sites web et certains de ces scénarios peuvent relever d’une utilisation légale. Par exemple, un chercheur peut vouloir utiliser des proxies pour mener une expérience contrôlée sur les réseaux sociaux. Toutefois, compte tenu du potentiel d’abus de ces scénarios, nous attendions à ce que les services de collecte de données les bloquent pour les utilisateurs qui n’ont pas terminé la procédure KYC.

Comment les marques communiquent les domaines qu’elles bloquent
  • Bright Data liste les catégories de domaines restreints dans sa politique d’utilisation acceptable.
Respecter les préférences des sites web en matière de collecte automatisée de données

Qu’est-ce que robots.txt ?

robots.txt est un nom de fichier pour la mise en œuvre du protocole d’exclusion des robots. Ce protocole est utilisé par les sites web pour indiquer les parties du site que le propriétaire préfère que les bots ne visitent pas. L’adhésion à robots.txt est volontaire.

Avantages et inconvénients du respect de robots.txt

  • Respecte les préférences des sites web.
  • Peut ne pas être récemment mis à jour et donc être obsolète.
  • Il contient généralement des conditions indiquant que le propriétaire du site préfère que certaines sections publiques du site ne soient pas accessibles aux bots.

Robots.txt peut également offrir un accès inégal aux bots. Par exemple, les propriétaires de sites web peuvent indiquer qu’ils préfèrent que les bots des moteurs de réponse ne visitent pas certaines URL que les bots des moteurs de recherche visitent.

Robots.txt n’est pas un document juridique et il peut demander à bloquer l’accès des bots à des pages qui sont légalement :

  • autorisées à être scrapées (par ex. les données publiques) ou
  • non autorisées à être scrapées (par ex. les données derrière un login lorsque les CGU du propriétaire du site interdisent le scraping de ces données).

Les fournisseurs de services de collecte de données web peuvent demander aux utilisateurs de proxies résidentiels de terminer une procédure KYC et de prouver qu’ils ont un cas d’usage légal et éthique avant que ces utilisateurs puissent ignorer robots.txt.

Pour les tests, nous avons envoyé des requêtes vers des pages de sous-dossiers dont le blocage est demandé par robots.txt. Les domaines que nous avons utilisés étaient aimultiple.com et 5 domaines web parmi les 100 sites web les plus visités. Bright Data a bloqué ces requêtes :

Exemple de CNN

Le fichier robots.txt de CNN bloque le dossier /terms14 . Pour le test, nous avons navigué vers ce dossier avec des proxies résidentiels et avons reçu des messages 200 avec les données de la page de tous les fournisseurs à l’exception de Bright Data. La réponse de Bright Data est : « Échec résidentiel (bad_endpoint) : le site demandé n’est pas disponible pour le mode d’accès résidentiel immédiat (sans KYC) conformément à robots.txt. Pour obtenir un accès résidentiel complet au ciblage de ce site, remplissez le formulaire KYC : https://brightdata.com/cp/kyc ».

Gestion des abus

Nous avons défini une méthodologie pour évaluer les pratiques de gestion des abus des fournisseurs et collecté des données pour répondre à nos critères d’évaluation :

* Non applicable : Zyte achète des proxies auprès d’autres fournisseurs de proxy et, par conséquent, lorsque le service de Zyte est utilisé à des fins abusives, les propriétaires de sites web contacteraient ses fournisseurs de proxy plutôt que Zyte.

Bien que tous les fournisseurs offrent des moyens permettant aux 3rd parties ou à leurs clients de les contacter, ces moyens sont importants pour la résolution des problèmes :

  • Politique publique en matière d’abus
  • Une adresse e-mail dédiée pour signaler les abus
  • Une méthode de contact alternative (par exemple un formulaire web ou une interface de messagerie) qui permet aux personnes signalant un problème de joindre l’entreprise. Cela est utile car les e-mails peuvent être filtrés et ne pas parvenir dans la boîte de réception.
  • Réactivité aux messages

3 fournisseurs du benchmark (Bright Data) ont fourni une adresse e-mail pour signaler les abus. Tous ces fournisseurs ont également présenté leurs politiques dans ce domaine.

Nous attendons à ce que tous les autres fournisseurs fassent de même et que cela devienne une pratique sectorielle répandue à court terme.

Enfin, nous avons évalué la réactivité de la gestion des abus en envoyant des signalements d’abus depuis des domaines tiers (c’est-à-dire non AIMultiple) et en mesurant les délais de réponse. Si nous ne trouvions pas d’adresse e-mail dédiée aux abus, nous envoyions le signalement au formulaire de contact général. Nous avons testé cela via 3 séries d’e-mails envoyés le :

  • Vendredi 2 mai 2025 depuis :
    • Un service de vente de billets avec un trafic mensuel d’environ 30k
    • Un cabinet d’avocats avec un trafic mensuel d’environ 1k
  • Le 17 mai 2025 depuis le service de vente de billets.
  • Le 24 mai 2025 depuis une agence de médias sociaux avec un trafic en ligne limité.

Les premiers e-mails envoyés le 2 mai 2025 ont été adressés aux entreprises qui fournissaient des adresses e-mail dédiées. Par la suite, nous avons élargi notre liste et inclus des adresses e-mail plus générales figurant dans les sections de contact de tous les services de collecte de données web évalués. Si une entreprise répondait à nos e-mails, nous cessions de lui envoyer d’autres e-mails.

Dans nos e-mails, nous avons indiqué que nos sites web avaient reçu un trafic de bots suspect via des proxies et avons demandé leur aide pour identifier la source des proxies. Nous avons réussi à obtenir une réponse de toutes les équipes de conformité sauf une. Presque toutes les réponses ont été reçues le jour même.

Transparence d’utilisation

Historiquement, les propriétaires de sites web qui fournissent des données web et des services de collecte web n’avaient aucun échange de données concernant les activités de collecte de données. Pour limiter les activités de crawling, les propriétaires de sites web pouvaient soit :

  • Contacter les services de collecte de données web pour signaler un abus
  • Travailler avec des fournisseurs de gestion des bots comme Cloudflare pour rendre le crawling plus difficile.

Il existe désormais des initiatives pour un échange de données plus structuré entre ces parties. Bright Data a lancé la console Webmaster de Bright Data pour permettre aux webmasters de surveiller les activités de crawling sur leurs sites web. Une plus grande transparence est susceptible d’améliorer les pratiques de collecte de données web.

Notre expérience avec la console Webmaster

Nous sommes inscrits en vérifiant la propriété de notre domaine et en ajoutant un fichier collectors.txt sur le domaine.

Nous avons désormais accès à l’activité des bots de Bright Data sur notre site web :

Benchmark : approvisionnement éthique

* Les avis sur ces plateformes 3rd party ont été inclus : Amazon Appstore, App Store, Google Play Store, Trustpilot. Par commodité, cette valeur a été calculée pour 5 applications majeures de Bright Data, et non pour toutes les 120 applications présentées sur son site web.

Transparence des partenaires

La bande passante requise par les entreprises d’infrastructure de données web peut être fournie de manière éthique en offrant des avantages (par exemple des paiements, des fonctionnalités comme la possibilité d’éviter les publicités) en échange du consentement au partage de sa connexion internet. Toutefois, il est également possible d’obtenir un accès non autorisé aux systèmes des utilisateurs particuliers et de vendre leurs connexions.

Les fournisseurs d’infrastructures de données web peuvent formuler des politiques et des processus, faire réaliser des audits externes et publier leur approche ainsi que les conclusions de ces audits afin de créer de la transparence sur la manière dont ils acquièrent leurs connexions internet. Cela peut renforcer la confiance dans l’approvisionnement éthique de leur service.

Nous avons créé un cadre pour la transparence côté offre dans les données web et avons évalué les fournisseurs à l’aide de ce cadre. Nous avons appliqué ce cadre indépendamment du fait qu’un service de collecte de données web acquière des IP résidentielles lui-même ou par l’intermédiaire d’autres proxies. Notre objectif est d’apporter de la transparence à l’ensemble de la chaîne d’approvisionnement des IP, car des pratiques non éthiques peuvent apparaître à tout moment de la chaîne d’approvisionnement.

Vous trouverez ici nos résultats détaillés :

Bright Data

Bright Data est classé au niveau 5 car ils publient

  • Leur approche d’approvisionnement et la manière dont les développeurs d’applications peuvent travailler avec eux via leur SDK15 16
  • Des détails sur 120 fournisseurs ont été partagés publiquement. Nous avons pu consulter les avis de ces fournisseurs sur des plateformes 3rd party pour estimer leur popularité. 17

Examen des applications sélectionnées

Bright Data partage 120 applications sur son site web. Des applications comme Bright VPN sont certifiées par des 3rd parties concernant leur divulgation et leur expérience utilisateur.18 Nous avons également téléchargé ces applications pour les examiner plus en détail :

  • Bright VPN
  • EarnApp
  • Sling Kong

Formulaire d’acceptation avec obligation de ne pas collecter de données personnellement identifiables : Formulaire de consentement avec une explication claire de

Bright VPN :

Earn App :

Écran mobile EarnApp intitulé « Comment gagner ? », expliquant que garder l’application ouverte sur le WiFi permet à Bright Data d’utiliser la connexion pour indexer des sites web publics, avec un paiement via PayPal, Wise ou des cartes cadeaux Amazon. Une illustration montre une main tenant un téléphone endormi avec des pièces flottant à côté. Les sections Collecte de données et Confidentialité ci-dessous indiquent qu’aucune donnée personnelle n’est requise ni collectée.

Sling Kong :

  • L’offre est présentée à l’utilisateur pendant le jeu :
Offre du jeu mobile Sling Kong affichée en cours de partie : le joueur se voit proposer 500 pièces en jeu pour autoriser l’indexation web de Bright Data à utiliser les ressources libres de l’appareil et son adresse IP.
  • Acceptation :
La même offre d’acceptation de Sling Kong pour 500 pièces en échange de l’autorisation d’indexation web de Bright Data, suivie d’une seconde capture d’écran du même écran assombri alors qu’une superposition d’informations supplémentaires commence à apparaître.
  • Informations supplémentaires lors de l’acceptation :
Écran d’acceptation de Sling Kong assombri derrière une fenêtre d’information indiquant que Bright Data ne suit pas l’utilisateur mais que l’adresse IP sera utilisée pour soutenir la recherche universitaire, aider les marques à suivre les vendeurs de contrefaçons, collecter des données web publiques telles que les prix des produits et les avis, et agréger des informations de voyage comme les vols et les prix des hôtels.
  • Désinscription :
Réglage d’indexation web dans le jeu Sling Kong, montrant un interrupteur marche/arrêt à côté d’un bouton Informations.Boîte de dialogue de confirmation de Sling Kong indiquant que l’utilisateur s’est bien désinscrit de l’indexation web et peut se réinscrire à tout moment, avec un bouton OK.

Valeur fournie par les applications :

  • Bright VPN : service VPN gratuit
  • EarnApp : paiements
  • Sling Kong : monnaie virtuelle en jeu
Autres

Bien que la plupart des fournisseurs soient conscients de l’éthique du web scraping et aient publié sur le sujet (par exemple 19 , nous n’avons pas identifié leurs engagements spécifiques sur ce front, à l’exception de Zyte.20

Nous attendons à ce que cela change et à ce que la plupart des fournisseurs passent au moins au niveau 1 à court terme.

Certification externe

* Indique que l’entreprise a obtenu toutes les certifications externes de cette catégorie

Il est essentiel que les fournisseurs disposent des bons systèmes, du personnel et des processus adéquats pour protéger les données des clients et sécuriser les applications qui fournissent leurs IP. Consultez notre méthodologie de mesure de la certification externe pour comprendre la logique de notre notation.

Conformité au RGPD & CCPA

Tous les fournisseurs affirment publiquement être conformes aux deux réglementations sur la confidentialité des données. Par conséquent, cela n’a pas été inclus dans la notation.

Comment nous avons mesuré les maturités organisationnelles

Sur la base des capacités que nous avons identifiées dans ce domaine, nous avons vérifié l’existence de ces certificats chez chaque fournisseur à l’aide de leurs déclarations publiques :

  • Certification de sécurité des données & certification PII : 21 22 23 24
  • Source IP sur liste blanche : 25
  • Pratiques éthiques évaluées : 26

Certains fournisseurs ne détenant pas de certificats ISO 27018 ont affirmé qu’ils devraient être considérés comme certifiés puisqu’ils utilisent des fournisseurs de services cloud qui détiennent des certificats ISO 27018. L’avis de notre conseiller en cybersécurité était que, même si cela faciliterait l’obtention du certificat, ils devraient tout de même faire certifier leurs politiques et leurs contrôles pour acquérir le certificat.

Couverture d’assurance

3 entreprises de collecte de données web ont partagé leurs certificats d’assurance. Nous ne publions pas les certificats, mais nous avons examiné les documents pour garantir que :

  • ils couvraient ces 2 catégories d’assurance
  • Le plafond d’assurance dans chaque catégorie est au moins de plusieurs millions de dollars américains.

Alliances industrielles et données web éthiques

Il existe 2 grandes alliances industrielles :

  • Alliance for Responsible Data Collection incluant Bright Data, Common Crawl et d’autres
  • Ethical Web Data Collection Initiative (EWDCI) qui inclut Oxylabs, ProxyEmpire, Zyte, entre autres. Elle incluait autrefois NetNut jusqu’à ce que NetNut soit fermé par le FBI ; la participation à une alliance industrielle n’a donc pas empêché les entreprises d’enfreindre la loi.
Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Avertissements et recommandations pour la suite

Tous les fournisseurs de ce benchmark, à l’exception de Nimble, sont clients d’AIMultiple. Comme toujours, nous avons suivi nos engagements éthiques au cours de cette recherche.

Nous avons réalisé un examen exhaustif de la collecte éthique de données web et, même si nous sommes satisfaits de la portée de ce benchmark, nous aimerions accroître la participation. Nous remercions ces entreprises d’avoir partagé leur couverture d’assurance : Apify, Bright Data, Zyte.

Nous attendons des réponses de Nimble. Nous mettrons à jour le rapport dès que nous aurons plus de nouvelles de leur part. 2 fournisseurs ont choisi de ne pas participer à cette itération du benchmark. Nous actualisons toujours ce rapport si l’une de ces 7 entreprises suggère des modifications factuelles, équitables pour tous les fournisseurs et aidant les entreprises à prendre de meilleures décisions.

NetNut figurait parmi les entreprises que nous avons évaluées lors de la première publication de ce rapport en 2025. Elle avait le score le plus bas possible (niveau 0) dans notre analyse approfondie de l’approvisionnement éthique où nous avons examiné les sources d’IP de ces fournisseurs. NetNut a été fermé en 2026 après que le FBI a identifié ses liens avec des botnets.27 Nous espérons que cela incitera tous les fournisseurs à faire preuve de transparence sur leur approvisionnement.

Selon nos recherches, il s’agit du premier rapport axé sur les données web éthiques. Nous espérons que cette transparence pourra aider le secteur des données web à trouver des solutions créatives à ses défis. Ces solutions devront équilibrer les intérêts des collecteurs de données web, des utilisateurs d’automatisation web, des propriétaires de sites web et des utilisateurs résidentiels qui fournissent leurs IP au secteur.

Limites méthodologiques

Ce benchmark mesure des indicateurs de maturité observables, notamment les contrôles d’utilisation par les clients, la transparence de l’approvisionnement en IP, les certifications externes et le partage des assurances. Toutefois, la notation ne détermine pas entièrement si un fournisseur est en conformité légale dans chaque cas d’usage client.

Par conséquent, un score élevé au benchmark doit être considéré comme un élément d’entrée pour la due diligence liée aux achats, et non comme une garantie de légalité ou d’utilisation éthique.

Références

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Cem Dilmegani (2026) - "Benchmark éthique et conforme des données web". Publié en ligne sur AIMultiple.com. Consulté le 4 Août 2026, à : https://aimultiple.com/web-scraping-ethics [Ressource en ligne]

Dilmegani, C. (2026, 4 Août). Benchmark éthique et conforme des données web. AIMultiple. https://aimultiple.com/web-scraping-ethics

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Benchmark éthique et conforme des données web}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/web-scraping-ethics}},
  note   = {AIMultiple. Consulté le 4 Août 2026}
}

Liens de référence

1.
Workers Fainted at Nike Clothing Factory Despite a Vow to Reform — ProPublica
ProPublica
2.
2023 MOVEit data breach - Wikipedia
Contributors to Wikimedia projects
3.
https://www.courthousenews.com/wp-content/uploads/2024/01/starbucks-labor-rights-violations-suit.pdf
4.
Verifying Device
5.
Court Rules in Favor of Bright Data in Meta v. Bright Data Case - Bright Data
Bright Data
6.
Popa: From Sourcing to Distribution | Synthient
Synthient
7.
‘Popa’ Botnet Linked to Publicly-Traded Israeli Firm – Krebs on Security
8.
https://media.defense.gov/2024/Sep/18/2003547016/-1/-1/0/CSA-PRC-LINKED-ACTORS-BOTNET.PDF
9.
Internet Crime Complaint Center (IC3) | Home Internet Connected Devices Facilitate Criminal Activity
10.
A Look at the Residential Proxy Market | Intel 471
Website
11.
Satori Threat Intelligence Alert: PROXYLIB and LumiApps Transform Mobile Devices into Proxy Nodes - HUMAN Security
HUMAN Security
12.
Kimwolf Botnet Lurking in Corporate, Govt. Networks – Krebs on Security
13.
Subscribe to read
Financial Times
14.
https://edition.cnn.com/robots.txt
15.
Ethically Sourcing Residential Proxies | Bright Data
Bright Data
16.
homepage - Bright SDK
Bright SDK
17.
How Bright Data Obtains Its Residential IPs - Bright Data
Bright Data
18.
Bright VPN Compliance with guidelines - Google Sheets
19.
What is ethical scraping and how do you do it?
Apify Blog
20.
Web Scraping Data Compliance | Zyte
21.
Page not found - Bright Data
Bright Data
22.
Security | Platform | Apify Documentation
23.
Nimble Trust Center | Security, Compliance & Reliability
24.
Trust Center | Zyte
25.
Bright SDK Compliance with Guidelines - Google Sheets
26.
pwc-report - Bright Data
Bright Data
27.
FBI Seizes NetNut Proxy Platform, Popa Botnet – Krebs on Security
Cem Dilmegani
Cem Dilmegani
Analyste principal
Cem est analyste principal chez AIMultiple depuis 2017. AIMultiple informe des centaines de milliers d'entreprises (selon SimilarWeb) dont 60 % du Fortune 500 chaque mois.

Les travaux de Cem ont été cités par des publications internationales de premier plan telles que Business Insider, Forbes, Washington Post, des entreprises mondiales comme Deloitte, HPE et des ONG comme le Forum économique mondial et des organisations supranationales comme la Commission européenne.

Tout au long de sa carrière, Cem a exercé en tant que consultant tech, acheteur tech et entrepreneur tech. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus d'une décennie. Il a également publié un rapport McKinsey sur la numérisation.

Il a dirigé la stratégie technologique et les achats d'un opérateur télécom tout en rendant compte au PDG. Il a également mené la croissance commerciale de l'entreprise deep tech Hypatos qui a atteint un chiffre d'affaires récurrent annuel à 7 chiffres et une valorisation à 9 chiffres à partir de 0 en 2 ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.

Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de la Bogazici University en tant qu'ingénieur informatique et détient un MBA de la Columbia Business School.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450