À mesure que les entreprises développent leurs opérations de données web, les responsables conformité, données et risques évaluent de plus en plus les risques éthiques, réputationnels et juridiques associés.
Nous avons évalué 5 services leaders de collecte de données web selon 3 dimensions et avons testé chaque service avec plus de 20 scénarios potentiellement contraires à l’éthique.
Notre travail vous aide à évaluer la posture éthique de vos pratiques de collecte de données et à comprendre les conséquences potentielles des approches contraires à l’éthique. Nous fournissons également des lignes directrices pour une collecte éthique des données web et évaluons les services de collecte de données web sous l’angle de l’éthique et de la conformité :
Évaluation des services de collecte de données web
Nous avons évalué les principaux services de collecte de données web (également appelés fournisseurs de données web ou infrastructure de données web) à l’aide de notre liste de contrôle éthique des données web. Ces scores représentent des niveaux de maturité, 5 étant le niveau le plus élevé :
Fournisseurs | Résumé | Utilisation éthique
par les clients | Approvisionnement
éthique | Certification externe | Couverture d’assurance
partagée** |
|---|---|---|---|---|---|
Niveau 5 | Niveau 5 | Niveau 5 | Sécurité des données, traitement des PII. Sources IP sur liste blanche. Pratiques éthiques évaluées. | ✅ | |
Niveau 1 | Niveau 1 | Niveau 1 | Sécurité des données | ✅ | |
Niveau 1 | Niveau 1 | Niveau 1 | Sécurité des données | ✅ | |
Nimble | Niveau 1 | Niveau 1 | Niveau 0 | Sécurité des données | ❌ |
* Il s’agit de codes pour les noms des fournisseurs. Ces fournisseurs ne souhaitaient pas être mentionnés dans ce rapport et sont répertoriés en bas de liste jusqu’à ce que nous résolvions ce problème.
** ✅ indique que l’entreprise a choisi de partager ses certificats d’assurance avec AIMultiple. ❌ indique que l’entreprise a décidé de ne pas partager ses certificats d’assurance avec nous et que nous n’avons donc pas pu valider leur couverture d’assurance. La couverture d’assurance est la catégorie pour laquelle nous avons dépendu de la participation des entreprises de services de données web pour les évaluer.
Trié par score récapitulatif.
Modèle de notation pour les données web éthiques
Ci-dessous, nous expliquons comment ces scores sont calculés. Vous pouvez également consulter la justification du choix de ces dimensions de notation.
Dans les 2 premières catégories, nous avons identifié 5 compétences, et les entreprises ont reçu des scores en fonction du nombre de compétences qu’elles satisfaisaient. Le niveau 5 représente la maturité la plus élevée observée sur le marché, reflétant les meilleures pratiques actuelles plutôt que la perfection.
Capacités pour une utilisation éthique par les clients
- Processus efficaces pour une utilisation éthique : nous évaluons la capacité de chaque fournisseur à empêcher une utilisation contraire à l’éthique de ses services de proxy résidentiel au moyen de scénarios de test contrôlés. Si l’une de nos requêtes est bloquée par le fournisseur, ce critère est atteint.
- Processus améliorés pour une utilisation éthique : similaire à « processus efficaces pour une utilisation éthique ». Toutefois, cette capacité indique que le fournisseur a bloqué plus d’une de nos tentatives d’utiliser ses services à des fins contraires à l’éthique.
- Processus exemplaires pour une utilisation éthique : similaire à « processus efficaces pour une utilisation éthique ». Toutefois, cette capacité indique que le fournisseur a bloqué la plupart de nos tentatives d’utiliser ses services à des fins contraires à l’éthique.
- Fondation de gestion des abus : publication d’une politique de gestion des abus et d’une méthode de signalement des abus
- Gestion réactive des abus : nous avons mesuré comment les entreprises ont répondu à plusieurs signalements d’abus. Même en l’absence de ligne directe pour signaler un abus, nous avons utilisé les e-mails indiqués par l’entreprise pour joindre son équipe. Si nous n’avons reçu aucune réponse à notre signalement dans un délai d’une semaine, l’entreprise est considérée comme non réactive.
Capacités pour un approvisionnement éthique
L’approvisionnement éthique consiste à acquérir des adresses IP de manière éthique. Notre analyse de marché a identifié les niveaux de transparence suivants concernant l’approvisionnement éthique en IP :
- Niveau 1 : publication d’une politique d’approvisionnement en IP.
- Niveau 2 : a divulgué au moins une source (par exemple une application mobile) d’IP qui fournit des IP de manière éthique. La source divulguée doit avoir au total au moins 10k avis sur des plateformes tierces, notamment Google, Apple, les boutiques d’applications Amazon et Trustpilot.
- Niveau 3 : identique au niveau 3 mais avec 100k avis
- Niveau 4 : identique au niveau 3 mais avec 1M avis
- Niveau 5 : identique au niveau 4 mais avec 10M avis
Les avis sont un indicateur de la popularité des applications et constituent un signal important pour cette évaluation. Les services de collecte de données web doivent travailler avec des applications populaires pour pouvoir satisfaire les besoins en IP de leurs clients.
Pour être qualifiées, les applications divulguées doivent suivre ces bonnes pratiques. Nous ne vérifierons pas cela pour chaque application divulguée, mais pour quelques-unes sélectionnées au hasard :
- Consentement éclairé :
- Les utilisateurs doivent donner leur consentement avant de partager leur connexion internet. L’écran d’acceptation doit indiquer :
- Le fournisseur
- Le service
- Comment leur IP sera utilisée
- Les utilisateurs doivent pouvoir accéder à des informations détaillées sur
- Comment leur connexion internet sera utilisée
- La politique de confidentialité
- Les utilisateurs doivent donner leur consentement avant de partager leur connexion internet. L’écran d’acceptation doit indiquer :
- Valeur : les utilisateurs doivent recevoir une certaine valeur de l’application (par exemple, un paiement, la possibilité de passer les publicités ou une autre fonctionnalité)
- Confidentialité : collecte de données utilisateur limitée et transparente.
Pour les réseaux de proxy résidentiel, les acheteurs doivent également vérifier si le consentement est spécifique, éclairé, révocable et séparé des autorisations d’application sans rapport. Ils doivent demander si les utilisateurs peuvent facilement se désinscrire, si l’utilisation de la bande passante est plafonnée, si les mineurs sont exclus et si le fournisseur audite les applications ou les SDK qui fournissent des IP résidentielles.
Certification externe
Nous avons évalué la certification externe en fonction de l’obtention par les entreprises de ces certificats pertinents pour la sécurité et la conformité de niveau entreprise.
- Certification PII : capacité démontrée à gérer les PII par l’obtention de la norme ISO 27018
- Certification de sécurité des données : pratiques de sécurité des données démontrées par l’obtention de l’un de ces certificats : SOC 2 ou ISO/IEC 27001
- Source IP sur liste blanche : des fournisseurs de certification externe comme McAfee certifient soit :
- des applications 3rd parties spécifiques qui fournissent des IP
- un SDK qui collecte des IP auprès d’applications 3rd parties
- Pratiques éthiques évaluées : un projet d’assurance ISAE 3000 peut être réalisé pour évaluer la conformité interne et les pratiques éthiques.
Assurance
Nous avons demandé aux fournisseurs de nous fournir ces documents d’assurance :
- Assurance responsabilité civile professionnelle : certificat offrant une couverture pour les responsabilités des fournisseurs en cas de problèmes dans le service
- Certificat d’assurance cyber offrant une couverture pour les responsabilités des fournisseurs en cas de problèmes liés à la sécurité de l’information.
Score récapitulatif
Ce score est la somme de tous les scores divisée par 3. Les scores sont :
- 0 à 5 pour les capacités d’utilisation éthique par les clients
- 0 à 5 pour les capacités d’approvisionnement éthique
- 0 à 3 pour la certification externe
- 0 à 2 pour les assurances
Principaux services de collecte de données web
AIMultiple a sélectionné les 7 plus grands services de collecte de données web en termes d’employés sur LinkedIn. Nous avons choisi cette mesure car elle est à la fois publique et devrait être corrélée aux revenus de l’entreprise et à sa maturité d’entreprise. De meilleures mesures telles que les revenus ou le nombre d’employés salariés ne sont pas accessibles publiquement pour ces entreprises privées.
Toutes les entreprises sélectionnées ont plus de 100 employés connectés à leurs pages de profil LinkedIn en avril 2025. Actuellement, 5 des 7 entreprises sélectionnées figurent sur cette page et les 2 autres ont choisi de ne pas être incluses dans le rapport.
Produits de collecte de données web à l’étude
Ces entreprises proposent une gamme de produits comprenant des proxies, des APIs de scraping de données et des jeux de données. Bien que tous les produits puissent être examinés sous un angle éthique, nous sommes d’abord concentrés sur le produit qui offre le plus haut niveau de flexibilité et qui alimente la plupart des autres produits : les proxies résidentiels.
Les produits de collecte de données web peuvent être considérés comme une hiérarchie dans laquelle les proxies constituent la couche centrale sur laquelle tous les autres services sont construits. En effet, les proxies permettent aux machines d’accéder à internet via différentes destinations, offrant un ensemble diversifié et important de connexions internet cruciales pour la collecte de données. Par conséquent, les proxies sont le produit de collecte de données web le plus performant ; il peut être utilisé pour exécuter des fonctions qui ne seraient pas possibles avec des jeux de données ou des APIs de scraping de données.
Parmi les proxies, les proxies résidentiels sont le produit le plus difficile à identifier comme proxy par les sites web. Par exemple, d’autres proxies, comme les proxies de datacenter, sont faciles à identifier en raison de leur localisation. Par conséquent, les proxies résidentiels alimentent la plupart des autres produits de données web, comme les APIs de scraping de données.
Vérification : votre collecte de données web est-elle conforme et éthique ?
Votre entreprise exploite très probablement des données web. Cependant, le secteur est peu réglementé, ce qui rend important le choix d’un fournisseur éthique et conforme. Pour y parvenir, nous avons préparé un cadre holistique prenant en compte différents aspects de la collecte de données web, notamment l’approvisionnement éthique, l’utilisation éthique et la certification externe.
Les données web sont un actif opérationnel courant
En tant qu’entreprise, votre activité repose en partie sur les données web en raison de leurs nombreux cas d’usage, tels que :
- Tarification dynamique pour le commerce de détail et l’e-commerce
- Données alternatives en temps réel pour les fonds d’investissement
- Processus KYC dans la banque commerciale
- Entraînement de modèles d’IA ou finetuning
- IA inference ou RAG
- Étude de marché
Avec l’IA, les données web sont désormais plus importantes
Bien que la collecte de données web soit aussi ancienne que le web, son importance a considérablement augmenté après l’essor des modèles d’IA générative. Les créateurs de ces modèles, tels que OpenAI et Anthropic, ont commencé sans partenariats de contenu significatifs et ont principalement utilisé des données en ligne pour construire leurs modèles initiaux, ce qui a conduit à l’essor du secteur de l’IA de mille milliards de dollars.
Supervision réglementaire limitée
Les exigences réglementaires relatives à la collecte de données web varient considérablement selon les juridictions. Ce benchmark se concentre donc sur les pratiques éthiques et de conformité plutôt que de supposer un cadre réglementaire uniforme d’un pays à l’autre.
Les activités en ligne clairement illégales sont bien définies. Cependant, il existe peu d’exigences réglementaires obligeant les acteurs du secteur à prévenir de manière proactive l’utilisation abusive de leurs services par les utilisateurs.
Il appartient aux plateformes elles-mêmes de définir les bonnes pratiques et les normes de conformité pour garantir une collecte de données éthique et une utilisation éthique des proxies. Par conséquent, le choix du fournisseur a plus d’importance dans la collecte de données que dans des secteurs fortement réglementés comme la banque, où chaque fournisseur de services est tenu de respecter de nombreuses réglementations.
La position éthique de vos fournisseurs fait partie de la réputation de votre entreprise
Du point de vue de l’éthique et du risque fournisseur, les entreprises doivent évaluer comment les données web sont acquises, même lorsqu’elles consomment les données plutôt que de les collecter directement.
La responsabilité des entreprises pour les activités illégales dans leur chaîne d’approvisionnement dépend de la juridiction. Par exemple, en Allemagne, les entreprises sont tenues de mener des activités de KYS et de gestion des risques pour identifier et prévenir les préjudices causés par leur chaîne d’approvisionnement. Même lorsque les entreprises ne sont pas responsables des préjudices causés par leur chaîne d’approvisionnement, elles peuvent subir un risque de réputation.
Quel est le coût d’une collecte de données non éthique et non conforme ?
Risque de réputation
S’il devient public qu’une entreprise utilise un service de collecte de données web qui adopte un comportement contraire à l’éthique ou des actions mettant en danger sa sécurité des données, cela peut entraîner des dommages de réputation importants tels que la perte d’activité, l’attrition des clients, la perte de talents et la perte de confiance des investisseurs.
Exemples réels de fournisseurs d’entreprise entraînant une perte de réputation :
- Nike a subi des dommages de réputation à de nombreuses reprises en raison des pratiques de travail contraires à l’éthique de ses fournisseurs.1
- De nombreuses entreprises, comme EY, ont perdu la confiance de leurs clients lorsqu’elles ont été touchées par la violation du logiciel de transfert de fichiers géré MOVEit. 2
Risque juridique
La perte de réputation, surtout lorsqu’elle suscite l’indignation publique, est généralement suivie de poursuites judiciaires de la part des clients de l’entreprise ou d’autres parties prenantes lésées par les pratiques contraires à l’éthique.
Exemple réel : Starbucks est l’une des marques récentes poursuivies pour s’être approvisionnée auprès d’entreprises aux pratiques contraires à l’éthique.3
Liste de contrôle des données web éthiques
Les données web d’entreprise doivent satisfaire 3 exigences pour être éthiques :
Utilisation éthique par les clients
Dans le cadre de leurs processus Know Your Supplier, les entreprises évitent d’utiliser des services qui permettent des activités contraires à l’éthique. L’utilisation de tels services expose les entreprises à des risques de réputation.
Exemple réel : Dans les cas où un fournisseur a été documenté alors qu’il permettait que sa plateforme soit utilisée à des fins contraires à l’éthique, de nombreuses entreprises se sont distanciées du fournisseur jusqu’à ce qu’il améliore ses pratiques.4
Lien avec les données web : les données web sont collectées via différentes adresses IP. Ces adresses peuvent être utilisées pour se livrer à différentes activités illégales telles que des attaques DDOS visant à empêcher la fourniture de services numériques, la collecte non autorisée de données non publiques ou la fraude publicitaire. Les acteurs malveillants ont besoin d’IP pour mener leurs actions, et les fournisseurs d’infrastructure de données web/proxies sont les plus grands fournisseurs d’IP aux utilisateurs particuliers.
Approvisionnement éthique
Les services utilisés à des fins éthiques peuvent entraîner des actions contraires à l’éthique et nuisibles au cours de leur production. Par exemple, des marques comme Nike et Nestlé ont subi des atteintes à leur réputation et fait face à des poursuites en raison du recours au travail des enfants par leurs sous-traitants.
Lien avec les données web :
Les entreprises doivent accéder à un grand nombre et à une diversité de sources de bande passante pour une collecte de données rapide et mondiale. Cela nécessite l’utilisation de proxies résidentiels : aux États-Unis, l’accès à des données web publiquement disponibles peut ne pas constituer un accès non autorisé au sens de la CFAA dans certaines circonstances, bien que d’autres lois et restrictions contractuelles puissent toujours s’appliquer. 5 Les sites web peuvent également choisir de bloquer certains de leurs visiteurs. Par exemple, ils peuvent bloquer les robots d’exploration de leurs concurrents. Dans de tels cas, les entreprises doivent s’appuyer sur un grand nombre de connexions d’utilisateurs particuliers ou d’autres 3rd parties pour collecter des données web.
Les fournisseurs de proxies collectent des millions de connexions internet provenant de diverses sources et les fournissent aux entreprises qui utilisent des adresses IP pour accéder à ces connexions. Certaines de ces IP proviennent des appareils d’utilisateurs résidentiels. La collecte de ces connexions peut être légale ou illégale :
- Légal : les pratiques conformes à la loi impliquent d’obtenir le consentement éclairé de l’utilisateur, de fournir une compensation et de proposer des mécanismes de désinscription conformément aux réglementations locales. Le fournisseur de données web doit
- Informer les utilisateurs de la manière dont leur bande passante sera utilisée
- Recueillir leur consentement par voie numérique
- Les dédommager en retour
- Leur permettre de se désinscrire à tout moment
- Illégal : les acteurs malveillants peuvent accéder aux appareils des utilisateurs et utiliser leur connexion internet sans autorisation ni compensation. Cela peut se produire par le biais d’applications malveillantes, d’appareils compromis, d’installations masquées, d’acceptation automatique et d’autres méthodes qui peuvent mettre le propriétaire de l’appareil en danger.
Les entreprises qui utilisent des proxies obtenus illégalement peuvent, par inadvertance, rémunérer des acteurs malveillants pour un accès non autorisé à des appareils.
Exemples réels :
- Des fournisseurs de proxies résidentiels cotés en bourse ont été documentés comme partageant leur infrastructure avec des SDK qui utilisent les connexions des appareils sans le consentement des utilisateurs.67
- Des routeurs et des appareils IoT ont été compromis pour des opérations de botnet et vendus comme proxies résidentiels.8 9
- Certains fournisseurs de proxies promeuvent leurs services dans des forums fréquentés par des acteurs malveillants. L’utilisation de proxies pour déformer sa localisation ou son identité dans des sondages rémunérés peut enfreindre les règles du fournisseur de sondages et, selon la juridiction et l’intention, peut également soulever des problèmes juridiques liés à la fraude.10
- Des applications VPN sur le Play Store de Google ont également été utilisées pour acquérir des IP résidentielles sans le consentement des utilisateurs.11
Bien que ces opérations aient été démantelées, il est probable que des acteurs malveillants accèdent encore à des IP résidentielles sans consentement via des botnets et des applications compromises ou malveillantes.
Certification externe
Les acheteurs d’entreprise ont besoin de solutions sécurisées et prêtes pour l’entreprise. Nous avons identifié les ingrédients d’une organisation mature de données web qui peuvent être documentés par une certification externe :
Sécurité des données
Le manque de sécurité des données dans les systèmes d’un fournisseur peut éroder l’avantage concurrentiel d’une entreprise ou entraîner des pertes de données et des temps d’arrêt du système. La perte de fonctionnalités du système peut éroder la confiance et conduire à la dévalorisation d’une entreprise.
Intrusion dans le système
Les services de collecte de données ne sont pas aussi profondément intégrés aux systèmes d’une entreprise que les services numériques de base (par exemple un système d’enregistrement comme un CRM). Par conséquent, leurs références de sécurité ne sont pas examinées aussi minutieusement que celles d’un système central comme un système d’enregistrement. Cependant, la sécurité des données est essentielle pour les clients des services de collecte de données, car ces services :
- Sont parfois intégrés à des systèmes plus centraux comme les moteurs de tarification.
- Peuvent infecter les systèmes de l’entreprise même lorsqu’ils ne sont pas intégrés à de tels systèmes. L’utilisation d’un service de collecte de données implique de recevoir des données de ce service. Même certaines des formes les plus sécurisées de transfert de données comportent des risques.
Une intrusion dans le système peut également conduire les attaquants à cibler les appareils qui fournissent des IP résidentielles à un service de proxies. Cela peut nuire à la réputation des clients de ces services de proxies.
Exemple réel de vulnérabilité chez un fournisseur de proxy résidentiel :
Les opérateurs du botnet Kimwolf ont acheté des services de proxy auprès du fournisseur de proxy résidentiel IPIDEA. À l’aide de commandes malveillantes, ils ont infecté les réseaux internes des appareils fournissant des IP à IPIDEA. Ces réseaux ont ensuite été analysés et d’autres appareils vulnérables sur ces réseaux locaux ont également été infectés.
On estime que Kimwolf s’est propagé à plus de 2 millions d’appareils avec cette méthode. Les données collectées par les clients d’IPIDEA ont également transité par ces réseaux infectés.12
Perte de données
Sans sécurité des données, des acteurs malveillants peuvent accéder aux données collectées par les entreprises pour identifier leurs activités et stratégies, entraînant une perte d’avantage concurrentiel ou d’opportunités commerciales.
Exemple réel :
Bien que les données web soient publiques, les entreprises peuvent les utiliser de manière novatrice pour obtenir un avantage concurrentiel. Par exemple, les investisseurs consacrent jusqu’à 10 % de leur budget de données de marché aux données alternatives13, mais ils divulguent rarement leurs stratégies car ils pensent que cela peut les aider à prendre l’avantage sur leurs concurrents. Une fuite de données peut exposer leurs stratégies et donc les faire reproduire par leurs concurrents.
Gestion des PII
Les données web incluent des données privées derrière des identifiants de connexion ou des PII qui peuvent être divulguées accidentellement ou délibérément sur des sites web publics. Si les services de collecte de données web ne gèrent pas correctement les PII, ces données peuvent être acquises par des acteurs malveillants. Cela peut nuire à la réputation du service de collecte de données web et de ses clients.
Sécurité des applications
Les applications ou programmes intermédiaires comme les SDK qui fournissent les IP des services de collecte de données web peuvent être mis sur liste blanche par des fournisseurs de certification externe comme McAfee. Cela renforce la confiance des entreprises dans les pratiques d’approvisionnement éthiques du service de collecte de données web.
Couverture d’assurance
Les entreprises exigent généralement ces assurances de la part de tout fournisseur numérique :
- Assurance responsabilité civile professionnelle
- Certificat d’assurance cyber
Benchmark détaillé : évaluation des fournisseurs d’infrastructure de données web
Benchmark : utilisation éthique par les clients
Nous cherchons ici à répondre à la question : l’entreprise garantit-elle que l’utilisation de sa solution est éthique et conforme aux lois et réglementations applicables ? Résumé de nos conclusions :
* Non applicable : étant donné que Zyte et Apify achètent des proxies auprès de leurs fournisseurs et ne les collectent pas directement auprès des utilisateurs résidentiels, les propriétaires de sites web ne les contacteraient pas en cas d’abus et ils n’ont donc pas besoin de créer un formulaire de contact pour les sites web.
Tout d’abord, nous avons examiné les politiques :
Examen de la politique d’utilisation acceptable
Tous les fournisseurs interdisent les activités illégales et fournissent des exemples tels que les attaques DoS, les messages en masse non sollicités, l’usurpation d’identité ou le spoofing.
En outre, certains fournisseurs soulignent également qu’ils interdisent les activités susceptibles d’être illégales. Ci-dessous, nous répertorions les activités interdites sur la base des politiques d’utilisation acceptable et de leurs avenants (par exemple, l’avenant de traitement des données) pour chaque fournisseur.
Nous avons recherché les termes qui interdiraient les activités susceptibles d’être illégales et pouvant être identifiées sur la base de l’activité de l’utilisateur. Par exemple, une part importante des utilisateurs de proxies pour répondre à des sondages rémunérés pourrait utiliser des proxies pour tromper les fournisseurs de sondages sur leur localisation réelle. Par conséquent, cette activité est à la fois susceptible d’être illégale et peut être identifiée sur la base de l’activité de l’utilisateur (c’est-à-dire lorsqu’un utilisateur se connecte à un site de sondage rémunéré).
Bien qu’il soit utile d’identifier clairement les activités interdites, ce n’est pas une exigence et cela n’a pas d’impact sur nos scores. Les entreprises peuvent choisir de mentionner qu’elles interdisent les activités illégales plutôt que d’énumérer chaque cas possible d’activité illégale.
Mentionner qu’une activité est interdite ne signifie pas que ces activités seront examinées ou bloquées. Nos scores reposent sur la manière dont ces politiques sont mises en œuvre, comme indiqué ci-dessous :
Processus pour une utilisation éthique
Bien que certaines catégories décrites dans les politiques d’utilisation acceptable soient assez vastes (par exemple, le scraping ou l’accès non autorisé aux données), d’autres sont suffisamment précises pour être converties en mesures préventives (par exemple, le blocage d’accès) que les services de collecte de données peuvent mettre en œuvre pour les utilisateurs qui n’ont pas terminé leur processus KYC.
Sur la base de ces utilisations interdites spécifiques, nous avons préparé une longue liste d’utilisations susceptibles d’être des utilisations illégales de proxies. Pour chaque cas d’utilisation, nous avons identifié des scénarios comprenant les domaines web et les actions pertinents. Par exemple, dans le scénario d’engagement artificiel sur les réseaux sociaux, nous avons tenté de nous connecter à un réseau social en utilisant un proxy pour aimer une publication existante.
Ensuite, pour tester si les entreprises autorisent une utilisation contraire à l’éthique par leurs clients, nous avons créé un compte sur le service de chaque fournisseur en utilisant une adresse e-mail non-AIMultiple. Nous n’avons pas effectué de processus KYC avec ce compte et avons utilisé les services pour comprendre ce que les utilisateurs anonymes peuvent accomplir avec chaque service. KYC est une étape cruciale au cours de laquelle l’utilisateur soumet des données pour valider l’entité juridique qu’il représente. Cela lie l’activité de l’utilisateur à une entité juridique :
- Qui peut être tenue responsable.
- Dont la justification des actions en ligne (par exemple, utiliser des proxies pour se connecter à des sites web gouvernementaux) peut être examinée. Par exemple, après avoir compris leur cas d’usage, un chercheur ou une agence gouvernementale peut être autorisé à se connecter à un site gouvernemental en utilisant un proxy.
Nous attendions à ce que ces cas d’utilisation déclenchent un processus KYC, mais chez la plupart des fournisseurs, cela ne s’est pas produit. Une coche indique que la requête a été bloquée pour les utilisateurs qui n’avaient pas encore terminé le processus KYC :
Pour plus de clarté, les entreprises de services de collecte de données n’ont aucune obligation légale de bloquer ces sites web et certains de ces scénarios peuvent relever d’une utilisation légale. Par exemple, un chercheur peut vouloir utiliser des proxies pour mener une expérience contrôlée sur les réseaux sociaux. Cependant, étant donné le potentiel d’abus de ces scénarios, nous attendions à ce que les services de collecte de données les bloquent pour les utilisateurs n’ayant pas terminé le processus KYC.
Comment les marques communiquent les domaines qu’elles bloquent
- Bright Data répertorie les catégories de domaines restreints dans sa politique d’utilisation acceptable.
Respecter les préférences des sites web en matière de collecte automatisée de données
Qu’est-ce que le robots.txt ?
robots.txt est un nom de fichier permettant de mettre en œuvre le protocole d’exclusion des robots. Ce protocole est utilisé par les sites web pour indiquer les parties du site que le propriétaire préfère que les robots ne visitent pas. L’adhésion au robots.txt est volontaire.
Avantages et inconvénients du respect du robots.txt
- Respecte les préférences des sites web.
- Peut ne pas être mis à jour récemment et donc être obsolète.
- Il comporte généralement des conditions indiquant que le propriétaire du site préfère que certaines sections publiques du site ne soient pas accessibles aux robots.
Le robots.txt peut également fournir un accès inégal aux robots. Par exemple, les propriétaires de sites peuvent indiquer qu’ils préfèrent que les robots des moteurs de réponse ne visitent pas certaines URL que les robots des moteurs de recherche visitent.
Le robots.txt n’est pas un document juridique et peut demander le blocage de l’accès des robots à des pages qui sont légalement :
- autorisées à être scrapées (par exemple, les données publiques) ou
- non autorisées à être scrapées (par exemple, les données derrière une connexion où les CGU du propriétaire du site interdisent le scraping de ces données).
Les fournisseurs de services de collecte de données web peuvent demander aux utilisateurs de proxies résidentiels de terminer un processus KYC et de prouver qu’ils ont un cas d’usage légal et éthique avant que ces utilisateurs puissent ignorer le robots.txt.
Pour les tests, nous avons envoyé des requêtes vers des pages de sous-dossiers dont le robots.txt demande le blocage. Les domaines utilisés étaient aimultiple.com et 5 domaines web parmi les 100 domaines web les plus visités. Bright Data a bloqué ces requêtes :
Exemple CNN
Le robots.txt de CNN bloque le dossier /terms14. Pour les tests, nous avons navigué vers ce dossier avec des proxies résidentiels et avons reçu des messages 200 avec les données de la page de tous les fournisseurs sauf Bright Data. La réponse de Bright Data est : « Residential Failed (bad_endpoint) : le site demandé n’est pas disponible pour le mode d’accès résidentiel immédiat (sans KYC) conformément au robots.txt. Pour obtenir un accès résidentiel complet au ciblage de ce site, remplissez le formulaire KYC : https://brightdata.com/cp/kyc ».
Gestion des abus
Nous avons décrit une méthodologie pour évaluer les pratiques de gestion des abus des fournisseurs et avons collecté des données pour satisfaire nos critères d’évaluation :
* Non applicable : Zyte achète des proxies auprès d’autres fournisseurs de proxies et, par conséquent, lorsque le service de Zyte est utilisé à des fins abusives, les propriétaires de sites web contacteraient ses fournisseurs de proxies plutôt que Zyte.
Bien que tous les fournisseurs offrent des moyens aux 3rd parties ou à leurs clients de les contacter, il est important d’en disposer pour la résolution des problèmes :
- Politique publique sur les abus
- Une adresse e-mail dédiée pour signaler les abus
- Un moyen de contact alternatif (par exemple, un formulaire web ou une interface de messagerie) permettant aux déclarants de joindre l’entreprise. Cela est utile car les e-mails peuvent être filtrés et ne pas atteindre la boîte de réception.
- Réactivité aux messages
3 fournisseurs du benchmark (Bright Data) ont fourni un e-mail pour signaler les abus. Tous ces fournisseurs ont également exposé leurs politiques dans ce domaine.
Nous attendons de tous les autres fournisseurs qu’ils fassent de même et que cela devienne une pratique sectorielle répandue à court terme.
Enfin, nous avons évalué la réactivité de la gestion des abus en envoyant des signalements d’abus depuis des domaines tiers (c’est-à-dire non-AIMultiple) et en mesurant les temps de réponse. Si nous ne trouvions pas d’adresse e-mail dédiée aux abus, nous l’envoyions au formulaire de contact général. Nous avons testé cela via 3 lots d’e-mails envoyés :
- Vendredi 2 mai 2025 depuis :
- Un service de vente de billets avec un trafic mensuel d’environ 30k
- Un cabinet d’avocats avec un trafic mensuel d’environ 1k
- Le 17 mai 2025 depuis le service de vente de billets.
- Le 24 mai 2025 depuis une agence de médias sociaux avec un trafic en ligne limité.
Les premiers e-mails envoyés le 2 mai 2025 ont été adressés aux entreprises qui fournissaient des adresses e-mail dédiées. Par la suite, nous avons élargi notre liste et inclus des adresses e-mail plus générales figurant dans les sections contact de tous les services de collecte de données web évalués. Si une entreprise répondait à nos e-mails, nous cessions de lui envoyer d’autres e-mails.
Dans nos e-mails, nous mentionnions que nos sites web recevaient un trafic de robots suspect via des proxies et demandions leur aide pour identifier la source des proxies. Nous avons réussi à obtenir une réponse de toutes les équipes de conformité sauf une. Presque toutes les réponses ont été reçues le jour même.
Transparence d’utilisation
Les propriétaires de sites web qui fournissent des données web et des services de collecte web n’ont historiquement eu aucun échange de données sur les activités de collecte de données. Pour limiter les activités d’exploration, les propriétaires de sites pouvaient soit :
- Contacter les services de collecte de données web pour signaler un abus
- Travailler avec des fournisseurs de gestion des robots comme Cloudflare pour rendre l’exploration plus difficile.
Il existe désormais des initiatives pour un échange de données plus structuré entre ces parties. Bright Data a lancé la console Webmaster de Bright Data pour permettre aux webmasters de surveiller les activités d’exploration sur leurs sites. Une plus grande transparence est susceptible d’améliorer les pratiques de collecte de données web.
Notre expérience avec la console Webmaster
Nous sommes inscrits en vérifiant la propriété de notre domaine et en ajoutant un fichier collectors.txt sur le domaine.
Nous avons désormais accès à l’activité des robots de Bright Data sur notre site :
Benchmark : approvisionnement éthique
* Les avis sur ces plateformes 3rd parties ont été inclus : Amazon Appstore, App Store, Google Play Store, Trustpilot. Pour plus de commodité, cette valeur a été calculée pour 5 applications majeures de Bright Data, et non pour les 120 applications présentées sur leur site.
Transparence des partenaires
La bande passante requise par les entreprises d’infrastructure de données web peut être fournie de manière éthique en offrant des avantages (par exemple, des paiements, des fonctionnalités comme la possibilité de passer les publicités) en échange du consentement au partage de sa connexion internet. Cependant, il est également possible d’obtenir un accès non autorisé aux systèmes des utilisateurs particuliers et de vendre leurs connexions.
Les fournisseurs d’infrastructure de données web peuvent formuler des politiques et des processus, mener des audits externes et publier leur approche et les résultats de leurs audits pour créer de la transparence sur la manière dont ils acquièrent leurs connexions internet. Cela peut favoriser la confiance dans l’approvisionnement éthique de leur service.
Nous avons créé un cadre de transparence côté offre pour les données web et avons évalué les fournisseurs à l’aide de ce cadre. Nous avons appliqué ce cadre indépendamment du fait qu’un service de collecte de données web acquière lui-même des IP résidentielles ou par l’intermédiaire d’autres proxies. Notre objectif est d’apporter de la transparence à l’ensemble de la chaîne d’approvisionnement des IP, car des pratiques contraires à l’éthique peuvent apparaître à tout moment dans la chaîne d’approvisionnement.
Vous trouverez ici nos résultats détaillés :
Bright Data
Bright Data est classé au niveau 5 car il publie
- Son approche d’approvisionnement et la manière dont les développeurs d’applications peuvent travailler avec lui via son SDK15 16
- Des détails sur 120 fournisseurs ont été partagés publiquement. Nous avons pu vérifier les avis sur ces fournisseurs sur des plateformes 3rd parties pour estimer leur popularité. 17
Examen des applications sélectionnées
Bright Data partage 120 applications sur son site. Des applications comme Bright VPN sont certifiées par des 3rd parties quant à leur divulgation et leur UX.18 Nous avons également téléchargé ces applications pour les voir plus en détail :
- Bright VPN
- EarnApp
- Sling Kong
Formulaire d’acceptation avec obligation de ne pas collecter de données personnellement identifiables : Formulaire de consentement avec une explication claire de la part de
Bright VPN :
Earn App :

Sling Kong :
- L’utilisateur se voit présenter l’offre pendant le jeu :

- Acceptation :

- Informations supplémentaires lors de l’acceptation :

- Désinscription :


Valeur fournie par les applications :
- Bright VPN : service VPN gratuit
- EarnApp : paiements
- Sling Kong : monnaie virtuelle dans le jeu
Autres
Bien que la plupart des fournisseurs soient conscients des questions d’éthique dans le web scraping et aient publié sur le sujet (par exemple, 19, nous n’avons pas identifié leurs engagements spécifiques sur ce front, à l’exception de Zyte.20
Nous attendons à ce que cela change et à ce que la plupart des fournisseurs passent au moins au niveau 1 à court terme.
Certification externe
* Indique que l’entreprise a obtenu toutes les certifications externes de cette catégorie
Il est crucial que les fournisseurs disposent des bons systèmes, du personnel et des bons processus pour protéger les données des clients et sécuriser les applications qui fournissent ses IP. Consultez notre méthodologie de mesure de la certification externe pour comprendre la logique de notre notation.
Conformité RGPD & CCPA
Tous les fournisseurs affirment publiquement être conformes aux deux réglementations sur la confidentialité des données. Par conséquent, cela n’a pas été inclus dans la notation.
Comment nous avons mesuré la maturité organisationnelle
Sur la base des capacités que nous avons identifiées dans ce domaine, nous avons vérifié l’existence de ces certificats chez chaque fournisseur à l’aide de leurs déclarations publiques :
- Certification de sécurité des données et certification PII : 21222324
- Source IP sur liste blanche : 25
- Pratiques éthiques évaluées : 26
Certains fournisseurs qui ne détiennent pas de certificats ISO 27018 ont affirmé qu’ils devraient être considérés comme certifiés puisqu’ils utilisent des fournisseurs de services cloud qui détiennent des certificats ISO 27018. L’avis de notre conseiller en cybersécurité était que, bien que cela faciliterait l’obtention du certificat, ils devraient tout de même faire certifier leurs politiques et contrôles pour l’acquérir.
Couverture d’assurance
3 entreprises de collecte de données web ont partagé leurs certificats d’assurance. Nous ne publions pas les certificats, mais avons examiné les documents pour nous assurer que
- ils couvraient ces 2 catégories d’assurance
- Le plafond d’assurance dans chaque catégorie est au moins de plusieurs millions de dollars US.
Alliances sectorielles et données web éthiques
Il existe 2 grandes alliances sectorielles :
- Alliance for Responsible Data Collection incluant Bright Data, Common Crawl et d’autres
- Ethical Web Data Collection Initiative (EWDCI) qui comprend Oxylabs, ProxyEmpire, Zyte, entre autres. Elle comptait autrefois NetNut jusqu’à ce que NetNut soit fermé par le FBI ; la participation à une alliance sectorielle n’a donc pas empêché des entreprises d’enfreindre la loi.
Avertissements et recommandations pour la suite
Tous les fournisseurs de ce benchmark, à l’exception de Nimble, sont clients d’AIMultiple. Comme toujours, nous avons suivi nos engagements éthiques au cours de cette recherche.
Nous avons réalisé une revue exhaustive de la collecte éthique de données web et, bien que nous soyons satisfaits de la portée de ce benchmark, nous aimerions accroître la participation. Nous remercions ces entreprises d’avoir partagé leur couverture d’assurance : Apify, Bright Data, Zyte.
Nous attendons des réponses de Nimble. Nous mettrons à jour le rapport dès que nous aurons de ses nouvelles. 2 fournisseurs ont choisi de ne pas participer à cette itération du benchmark. Nous mettons toujours à jour ce rapport si l’une de ces 7 entreprises suggère des modifications fondées sur des faits, équitables pour tous les fournisseurs et aidant les entreprises à prendre de meilleures décisions.
NetNut faisait partie des entreprises que nous avons évaluées lors de la première publication de ce rapport en 2025. Elle avait obtenu le score le plus bas possible (niveau 0) dans notre analyse approfondie de l’approvisionnement éthique, où nous avons examiné les sources d’IP de ces fournisseurs. NetNut a été fermé en 2026 après que le FBI a identifié ses liens avec des botnets.27 Nous espérons que cela incitera tous les fournisseurs à faire preuve de transparence sur leur approvisionnement.
Il s’agit, selon nos recherches, du premier rapport consacré aux données web éthiques. Nous espérons que cette transparence aidera le secteur des données web à trouver des solutions créatives à ses défis. Ces solutions devront équilibrer les intérêts des collecteurs de données web, des utilisateurs d’automatisation web, des propriétaires de sites web et des utilisateurs résidentiels qui fournissent leurs IP au secteur.
Limites de la méthodologie
Ce benchmark mesure des indicateurs de maturité observables, notamment les contrôles d’utilisation par les clients, la transparence de l’approvisionnement en IP, les certifications externes et le partage des assurances. Cependant, la notation ne détermine pas pleinement si un fournisseur est conforme à la loi dans chaque cas d’usage client.
Par conséquent, un score élevé au benchmark doit être considéré comme un élément de la diligence raisonnable en matière d’approvisionnement, et non comme une garantie de légalité ou d’utilisation éthique.
Références
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Benchmark éthique et conforme des données web}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/web-scraping-ethics}},
note = {AIMultiple. Consulté le 4 Août 2026}
}Résultats et horodatages de 66 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant 8 fichiers CSV.
Journal des modifications
8 mises à jour- 2026
Réduit le benchmark de 7 à 5 services de collecte de données web, deux fournisseurs ayant choisi de se retirer.
Ajout d'une section sur les limites méthodologiques à la fin du benchmark.
- 2025
Codes de fournisseur ajoutés à l'introduction de la section "Ethical & Compliant Web Data Benchmark".
Extension des données de l'exemple réel dans la section Risque de réputation.
Remplacement de la section « Ethical & Compliant Web Data Benchmark » par une nouvelle évaluation des services de collecte de données web.
Ajout des Organisations pour le Scraping Web Éthique à la section Pour en savoir plus.
Mise à jour des résultats des affaires Meta vs Bright Data et X Corp. vs Bright Data dans la section « Historique des principales poursuites en matière de web scraping ».
- 2024
Mise à jour des données du cas "eBay vs Bidder's Edge" dans la section "Affaires Juridiques".
Liens de référence
Le travail de Cem chez AIMultiple a été cité par des publications mondiales de premier plan, notamment Business Insider, Forbes, Morning Brew et Washington Post, par des entreprises mondiales comme Deloitte et HPE, par des ONG comme World Economic Forum et par des organisations supranationales comme European Commission. [1], [2], [3], [4], [5]
Tout au long de sa carrière, Cem a été consultant en technologies, acheteur de technologies et entrepreneur technologique. Il a conseillé des entreprises sur leurs décisions technologiques chez McKinsey & Company et Altman Solon pendant plus de dix ans. Il a également publié un rapport McKinsey sur la digitalisation.
Il a dirigé la stratégie technologique et les achats d'un opérateur télécom, sous la responsabilité du PDG. Il a également dirigé la croissance commerciale de l'entreprise de technologie profonde Hypatos, qui a atteint un revenu récurrent annuel à 7 chiffres et une valorisation à 9 chiffres, passant de 0 à ce résultat en deux ans. Le travail de Cem chez Hypatos a été couvert par des publications technologiques de premier plan comme TechCrunch et Business Insider.
Cem intervient régulièrement lors de conférences technologiques internationales. Il est diplômé de Bogazici University en tant qu'ingénieur informatique et titulaire d'un MBA de la Columbia Business School.




Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.