À medida que as empresas escalam suas operações de dados da web, executivos de compliance, dados e riscos avaliam cada vez mais os riscos éticos, reputacionais e legais associados.
Comparamos 5 serviços líderes de coleta de dados da web em 3 dimensões e testamos cada serviço com mais de 20 cenários potencialmente antiéticos.
Nosso trabalho ajuda você a avaliar a posição ética de suas práticas de coleta de dados e a entender as possíveis consequências de abordagens antiéticas. Também fornecemos diretrizes para a coleta ética de dados da web e avaliamos os serviços de coleta de dados da web sob a perspectiva de ética e conformidade:
Avaliação dos serviços de coleta de dados da web
Avaliamos os principais serviços de coleta de dados da web (também chamados de provedores de dados da web ou infraestrutura de dados da web) usando nosso checklist de dados da web éticos. Essas pontuações representam níveis de maturidade, sendo 5 o nível mais alto:
Fornecedores | Resumo | Uso ético
pelos clientes | Fornecimento
ético | Certificação externa | Cobertura de seguro
compartilhada** |
|---|---|---|---|---|---|
Nível 5 | Nível 5 | Nível 5 | Segurança de dados, processamento de PII. Fontes de IP em whitelist. Práticas éticas avaliadas. | ✅ | |
Nível 1 | Nível 1 | Nível 1 | Segurança de dados | ✅ | |
Nível 1 | Nível 1 | Nível 1 | Segurança de dados | ✅ | |
Nimble | Nível 1 | Nível 1 | Nível 0 | Segurança de dados | ❌ |
* Estes são códigos para nomes de fornecedores. Esses fornecedores não quiseram ser referenciados neste relatório e estão listados no final da lista até resolvermos essa questão.
** ✅ indica que a empresa optou por compartilhar seus certificados de seguro com AIMultiple. ❌ indica que a empresa decidiu não compartilhar seus certificados de seguro conosco e, portanto, não pudemos validar sua cobertura de seguro. A cobertura de seguro é a categoria em que dependemos da participação das empresas de serviços de dados da web para avaliá-las.
Ordenadas por pontuação resumida.
Modelo de pontuação para dados da web éticos
Abaixo, descrevemos como essas pontuações são derivadas. Você também pode ver a justificativa para a seleção dessas dimensões de pontuação.
Nas 2 primeiras categorias, identificamos 5 competências, e as empresas receberam pontuações com base no número de competências que atenderam. O Nível 5 representa a maior maturidade observada no mercado, refletindo as melhores práticas atuais em vez da perfeição.
Capacidades para uso ético pelos clientes
- Processos eficazes para uso ético: Avaliamos a capacidade de cada provedor de impedir o uso antiético de seus serviços de proxy residencial por meio de cenários de teste controlados. Se qualquer uma de nossas solicitações for bloqueada pelo provedor, isso é considerado alcançado.
- Processos aprimorados para uso ético: Semelhante a "processos eficazes para uso ético". No entanto, essa capacidade indica que o provedor de serviços bloqueou mais de uma de nossas tentativas de usar seus serviços para casos de uso antiéticos.
- Melhores práticas para uso ético: Semelhante a "processos eficazes para uso ético". No entanto, essa capacidade indica que o provedor de serviços bloqueou a maioria de nossas tentativas de usar seus serviços para casos de uso antiéticos.
- Base de gestão de abusos: Publicação de política de gestão de abusos e um método para denunciar abusos.
- Gestão responsiva de abusos: Medimos como as empresas responderam a múltiplos relatórios de abuso. Mesmo quando não havia linha direta para denunciar abusos, usamos os e-mails listados pela empresa para contatar a equipe. Se não recebêssemos respostas ao nosso relatório dentro de uma semana, a empresa era considerada não responsiva.
Capacidades para fornecimento ético
O fornecimento ético envolve a aquisição de endereços IP de maneira ética. Nossa análise de mercado identificou os seguintes níveis de transparência em relação ao fornecimento ético de IP:
- Nível 1: Política de origem de IP publicada.
- Nível 2: Divulgou pelo menos uma fonte (por exemplo, um aplicativo móvel) para IPs que fornece IPs de maneira ética. A fonte divulgada deve ter, no total, pelo menos 10k avaliações em plataformas de terceiros, incluindo Google, Apple, lojas de aplicativos Amazon e Trustpilot.
- Nível 3: Igual ao Nível 3, mas com 100k avaliações
- Nível 4: Igual ao Nível 3, mas com 1M avaliações
- Nível 5: Igual ao Nível 4, mas com 10M avaliações
As avaliações são um indicador da popularidade dos aplicativos e são um sinal importante para esta avaliação. Os serviços de coleta de dados da web precisam trabalhar com aplicativos populares para conseguir atender às necessidades de IP de seus clientes.
Para qualificação, os aplicativos divulgados devem seguir estas melhores práticas. Não verificaremos isso para todos os aplicativos divulgados, mas verificaremos para alguns selecionados aleatoriamente:
- Consentimento informado:
- Os usuários precisam aceitar antes de compartilhar sua conexão de internet. A tela de opt-in deve descrever:
- O provedor
- O serviço
- Como o IP deles será usado
- Os usuários devem poder acessar informações detalhadas sobre
- Como sua conexão de internet será usada
- Política de privacidade
- Os usuários precisam aceitar antes de compartilhar sua conexão de internet. A tela de opt-in deve descrever:
- Valor: Os usuários devem receber algum valor do aplicativo (por exemplo, pagamento, capacidade de pular anúncios ou alguma outra funcionalidade)
- Privacidade: Coleta de dados do usuário limitada e transparente.
Para redes de proxies residenciais, os compradores também devem verificar se o consentimento é específico, informado, revogável e separado das permissões não relacionadas do aplicativo. Eles devem perguntar se os usuários podem optar por sair facilmente, se o uso de largura de banda é limitado, se menores de idade são excluídos e se o provedor audita aplicativos ou SDKs que fornecem IPs residenciais.
Certificação externa
Avaliamos a certificação externa com base em se as empresas adquiriram estes certificados relevantes para segurança e conformidade de nível empresarial.
- Certificação de PII: Capacidade demonstrada de gerenciar PII por meio da obtenção da ISO 27018
- Certificação de segurança de dados: Práticas de segurança de dados demonstradas por meio da obtenção de um destes certificados: SOC 2 ou ISO/IEC 27001
- Fonte de IP em whitelist: Provedores de certificação externa, como a McAfee, certificam:
- Aplicativos específicos de 3rd party que fornecem IPs
- SDK que coleta IPs de aplicativos de 3rd party
- Práticas éticas avaliadas: Um projeto de auditoria ISAE 3000 pode ser concluído para avaliar as práticas internas de conformidade e ética.
Seguro
Pedimos aos fornecedores que nos fornecessem estes documentos de seguro:
- Seguro de responsabilidade civil profissional fornecendo cobertura para responsabilidades dos fornecedores em caso de problemas no serviço
- Certificado de seguro cibernético fornecendo cobertura para responsabilidades dos fornecedores em caso de problemas relacionados à segurança da informação.
Pontuação resumida
Esta pontuação é a soma de todas as pontuações dividida por 3. As pontuações são:
- 0 a 5 para capacidades de uso ético pelos clientes
- 0 a 5 para capacidades de fornecimento ético
- 0 a 3 para certificação externa
- 0 a 2 para seguros
Principais serviços de coleta de dados da web
AIMultiple selecionou os 7 maiores serviços de coleta de dados da web em número de funcionários no LinkedIn. Escolhemos essa métrica porque ela é pública e deve estar correlacionada com as receitas da empresa e a prontidão empresarial. Métricas melhores, como receitas ou número de funcionários na folha de pagamento, não estão publicamente disponíveis para essas empresas privadas.
Todas as empresas selecionadas tinham mais de 100 funcionários conectados às suas páginas de perfil no LinkedIn em abril de 2025. Atualmente, 5 das 7 selecionadas são exibidas nesta página, e as 2 empresas restantes optaram por não ser incluídas no relatório.
Produtos de coleta de dados da web em foco
Essas empresas oferecem uma variedade de produtos, incluindo proxies, APIs de raspagem de dados e datasets. Embora todos os produtos possam ser examinados de uma perspectiva ética, inicialmente focamos no produto que oferece o maior nível de flexibilidade e potencializa a maioria dos outros produtos: proxies residenciais.
Os produtos de coleta de dados da web podem ser considerados uma hierarquia em que os proxies formam a camada central sobre a qual todos os outros serviços são construídos. Isso ocorre porque os proxies permitem que máquinas acessem a internet por meio de destinos diferentes, permitindo um conjunto diversificado e grande de conexões de internet cruciais para a coleta de dados. Portanto, os proxies são o produto de coleta de dados da web mais capaz e podem ser usados para executar funções que não seriam possíveis com datasets ou APIs de raspagem de dados.
Entre os proxies, os proxies residenciais são o produto mais difícil de ser identificado pelos sites como proxy. Por exemplo, outros proxies, como proxies de datacenter, são fáceis de identificar devido à sua localização. Portanto, os proxies residenciais alimentam a maioria dos outros produtos de dados da web, como APIs de raspagem de dados.
Verifique: a sua coleta de dados da web está em conformidade e é ética?
Sua empresa provavelmente utiliza dados da web. No entanto, o setor enfrenta regulamentação limitada, tornando importante escolher um provedor ético e em conformidade. Para isso, preparamos um framework holístico que leva em consideração diferentes aspectos da coleta de dados da web, incluindo sourcing ético, uso ético e certificação externa.
Dados da web são um ativo operacional comum
Como empresa, seu negócio depende parcialmente de dados da web devido aos seus numerosos casos de uso, como:
- Precificação dinâmica para varejo e comércio eletrônico
- Dados alternativos em tempo real para fundos de investimento
- Processo de KYC em bancos comerciais
- Treinamento de IA model ou fine-tuning
- IA inference ou RAG
- Pesquisa de mercado
Com a IA, os dados da web agora são mais importantes
Embora a coleta de dados da web seja tão antiga quanto a web, sua importância aumentou drasticamente após o surgimento dos models generativos de IA. Os criadores desses models, como OpenAI e Anthropic, começaram sem parcerias significativas de conteúdo e usaram principalmente dados online para construir seus models iniciais, o que levou ao surgimento da indústria de IA de trilhões de dólares.
Supervisão regulatória limitada
Os requisitos regulatórios para a coleta de dados da web variam significativamente de acordo com a jurisdição. Portanto, este benchmark se concentra em práticas éticas e de conformidade, em vez de assumir um framework regulatório uniforme entre os países.
Atividades online claramente ilegais são bem definidas. No entanto, existem requisitos regulatórios limitados para que os participantes do setor previnam proativamente o uso indevido de seus serviços pelos usuários.
Cabe às próprias plataformas definir melhores práticas e padrões de conformidade para garantir a coleta ética de dados e o uso de proxies. Portanto, sua escolha de fornecedor importa mais na coleta de dados em comparação com setores fortemente regulamentados, como o bancário, onde cada provedor de serviços é obrigado a cumprir inúmeras regulamentações.
A postura ética dos seus fornecedores faz parte da reputação da sua empresa
De uma perspectiva ética e de risco de fornecedores, as empresas devem avaliar como os dados da web são adquiridos, mesmo quando os consomem em vez de coletá-los diretamente.
As responsabilidades das empresas por atividades ilegais em sua cadeia de suprimentos dependem da jurisdição. Por exemplo, na Alemanha, as empresas são responsáveis por realizar atividades de KYS e gestão de riscos para identificar e prevenir danos causados por sua cadeia de suprimentos. Mesmo quando as empresas não são responsáveis pelos danos causados por sua cadeia de suprimentos, elas podem sofrer risco reputacional.
Qual é o custo da coleta de dados antiética e não conforme?
Risco reputacional
Se tornar público que uma empresa está usando um serviço de coleta de dados da web que se envolve em comportamento antiético ou em ações que colocam em risco sua segurança de dados, isso pode levar a danos reputacionais significativos, como perda de negócios, rotatividade de clientes, rotatividade de talentos e perda de confiança dos investidores.
Exemplos reais de fornecedores empresariais que levam à perda de reputação:
- A Nike sofreu danos reputacionais várias vezes devido às práticas trabalhistas antiéticas de seus fornecedores.1
- Muitas empresas, como a EY, perderam a confiança de seus clientes quando foram afetadas pela violação do software de transferência gerenciada de arquivos MOVEit. 2
Risco legal
A perda de reputação, especialmente aquela que gera indignação pública, é tipicamente seguida por ações judiciais de clientes da empresa ou de outras partes interessadas que foram prejudicadas pelas práticas antiéticas.
Exemplo real: Starbucks é uma das marcas recentes a ser processada por obter produtos de empresas com práticas antiéticas.3
Checklist de dados da web éticos
Os dados da web empresariais precisam atender a 3 requisitos para serem éticos:
Uso ético pelos clientes
Como parte dos processos de Know Your Supplier, as empresas evitam usar serviços que possibilitam atividades antiéticas. O uso de tais serviços expõe as empresas a danos reputacionais.
Exemplo do mundo real: Nos casos em que um provedor foi documentado permitindo que sua plataforma fosse usada em atividades antiéticas, inúmeras empresas se afastaram do provedor até que ele melhorasse suas práticas.4
Como isso se relaciona com os dados da web: Os dados da web são coletados por meio de diferentes endereços IP. Esses endereços podem ser usados para realizar diferentes atividades ilegais, como ataques DDoS para impedir a entrega de serviços digitais, coleta não autorizada de dados não públicos ou fraude de anúncios. Atores mal-intencionados precisam de IPs para alimentar suas ações, e os provedores de infraestrutura de dados da web/proxy são os maiores fornecedores de IPs para usuários de varejo.
Fornecimento ético
Serviços usados para fins éticos podem causar ações antiéticas e danosas durante sua produção. Por exemplo, marcas como Nike e Nestlé sofreram danos reputacionais e enfrentaram ações judiciais devido ao uso de trabalho infantil por seus contratados.
Como isso se relaciona com os dados da web:
As empresas precisam acessar um grande número e fontes diversas de largura de banda para a coleta de dados rápida e global. Isso exige o uso de proxies residenciais: nos Estados Unidos, acessar dados da web publicamente disponíveis pode não constituir acesso não autorizado sob a CFAA em algumas circunstâncias, embora outras leis e restrições contratuais ainda possam se aplicar. 5 Os sites também podem optar por bloquear alguns de seus visitantes. Por exemplo, eles podem bloquear os rastreadores de seus concorrentes. Nesses casos, as empresas precisam contar com um grande número de conexões de usuários de varejo ou de outras 3rd parties para coletar dados da web.
Os provedores de proxy coletam milhões de conexões de internet de várias fontes e as fornecem a empresas que usam endereços IP para acessar essas conexões. Alguns desses IPs se originam dos dispositivos de usuários residenciais. A coleta dessas conexões pode ser legal ou ilegal:
- Legal: Práticas legalmente em conformidade envolvem obter consentimento informado do usuário, fornecer compensação e oferecer mecanismos de opt-out de acordo com as regulamentações locais. O provedor de dados da web deve
- Informar os usuários sobre como sua largura de banda será usada
- Obter seu consentimento digitalmente
- Compensá-los em troca
- Permitir que eles optem por sair a qualquer momento
- Ilegal: Atores mal-intencionados podem obter acesso aos dispositivos dos usuários e usar sua conexão de internet sem permissão ou compensação. Isso pode acontecer por meio de aplicativos maliciosos, dispositivos comprometidos, instalações mascaradas, opt-in automático e outros métodos que podem colocar o proprietário do dispositivo em risco.
Empresas que usam proxies obtidos ilegalmente podem inadvertidamente pagar atores mal-intencionados pelo acesso não autorizado a dispositivos.
Exemplos reais:
- Provedores de proxy residencial listados na bolsa de valores foram documentados compartilhando sua infraestrutura com SDKs que usam conexões de dispositivos sem o consentimento do usuário.67
- Roteadores e dispositivos IoT foram comprometidos para operações de botnet e vendidos como proxies residenciais.8 9
- Certos provedores de proxy promovem seus serviços em fóruns frequentados por atores mal-intencionados. Usar proxies para distorcer a localização ou a identidade em pesquisas pagas pode violar as regras do provedor da pesquisa e, dependendo da jurisdição e da intenção, também pode levantar questões legais relacionadas a fraude.10
- Aplicativos de VPN na Google Play Store também foram usados para adquirir IPs residenciais sem o consentimento do usuário.11
Embora essas operações tenham sido encerradas, é provável que atores mal-intencionados ainda estejam acessando IPs residenciais sem consentimento por meio de botnets e aplicativos comprometidos ou maliciosos.
Certificação externa
Os compradores empresariais precisam de soluções seguras e prontas para a empresa. Identificamos os ingredientes para uma organização madura de dados da web que podem ser documentados por meio de certificação externa:
Segurança de dados
A falta de segurança de dados nos sistemas de um fornecedor pode corroer a vantagem competitiva de uma empresa ou levar à perda de dados e ao tempo de inatividade do sistema. A perda de funcionalidade do sistema pode corroer a confiança e levar à desvalorização de uma empresa.
Intrusão no sistema
Os serviços de coleta de dados não são tão profundamente integrados aos sistemas de uma empresa quanto os serviços digitais essenciais (por exemplo, um system of record como CRM). Portanto, suas credenciais de segurança não são revisadas tão minuciosamente quanto as credenciais de um sistema central como um system of record. No entanto, a segurança de dados é fundamental para os clientes dos serviços de coleta de dados, pois esses serviços:
- Às vezes são integrados a sistemas mais centrais, como motores de precificação.
- Podem infectar sistemas empresariais mesmo quando não estão integrados a esses sistemas. O uso de um serviço de coleta de dados envolve receber dados desse serviço. Mesmo algumas das formas mais seguras de transferência de dados incluem riscos.
A intrusão no sistema também pode levar os atacantes a atingir os dispositivos que fornecem IPs residenciais a um serviço de proxy. Isso pode resultar em danos reputacionais aos clientes desse serviço de proxy.
Exemplo real de vulnerabilidade em um provedor de proxy residencial:
Operadores do botnet Kimwolf compraram serviços de proxy do provedor de proxy residencial IPIDEA. Usando comandos maliciosos, eles infectaram as redes internas dos dispositivos que fornecem IPs à IPIDEA. Essas redes foram então escaneadas, e outros dispositivos vulneráveis nessas redes locais também foram infectados.
Estima-se que o Kimwolf tenha se espalhado para mais de 2 milhões de dispositivos com esse método. Os dados coletados pelos clientes da IPIDEA também passaram por essas redes infectadas.12
Perda de dados
Sem segurança de dados, atores mal-intencionados podem obter acesso aos dados coletados pelas empresas para identificar suas atividades e estratégias, levando à perda de vantagem competitiva ou oportunidades de negócios.
Exemplo real:
Embora os dados da web sejam públicos, as empresas podem usá-los de maneiras inovadoras para obter vantagem competitiva. Por exemplo, os investidores gastam até 10% do seu orçamento de dados de mercado em dados alternativos13, mas raramente divulgam suas estratégias, pois acreditam que isso pode ajudá-los a ganhar vantagem em relação aos concorrentes. Um vazamento de dados pode levar à exposição de suas estratégias e, portanto, à sua replicação pelos concorrentes.
Gestão de PII
Os dados da web incluem dados privados atrás de login ou PII que podem ser divulgados acidentalmente ou propositalmente em sites públicos. Se os serviços de coleta de dados da web não gerenciarem PII corretamente, esses dados podem ser adquiridos por atores mal-intencionados. Isso pode levar a danos reputacionais ao serviço de coleta de dados da web e aos seus clientes.
Segurança de aplicações
Aplicativos ou programas intermediários, como SDKs, que fornecem os IPs dos serviços de coleta de dados da web podem ser colocados na whitelist por provedores de certificação externa, como a McAfee. Isso aumenta a confiança da empresa nas práticas de fornecimento ético do serviço de coleta de dados da web.
Cobertura de seguro
As empresas normalmente exigem estes seguros de qualquer provedor digital:
- Seguro de responsabilidade civil profissional
- Certificado de seguro cibernético
Benchmark detalhado: avaliação dos provedores de infraestrutura de dados da web
Benchmark: uso ético pelos clientes
Aqui buscamos responder à pergunta: a empresa garante que o uso de sua solução seja ético e esteja em conformidade com as leis e regulamentações aplicáveis? Resumo de nossas descobertas:
* Não aplicável: como a Zyte e a Apify compram proxies de seus fornecedores e não os coletam diretamente de usuários residenciais, os proprietários de sites não os contatariam sobre abusos e, portanto, não precisam criar um formulário de contato para sites.
Primeiro, revisamos as políticas:
Revisão da política de uso aceitável
Todos os fornecedores proíbem atividades ilegais e fornecem exemplos como ataques DoS, mensagens em massa não solicitadas, personificação ou spoofing.
Além disso, alguns fornecedores também destacam que proíbem atividades que provavelmente são ilegais. Abaixo, listamos as atividades proibidas com base nas políticas de uso aceitável e seus adendos (por exemplo, adendo de processamento de dados) de cada fornecedor.
Procuramos termos que proibissem atividades que provavelmente são ilegais e que podem ser identificadas com base na atividade do usuário. Por exemplo, uma parcela significativa de usuários que usam proxies para realizar pesquisas pagas pode estar usando proxies para enganar os provedores de pesquisa sobre sua localização real. Portanto, essa atividade provavelmente é ilegal e pode ser identificada com base na atividade do usuário (ou seja, quando um usuário faz login em um site de pesquisa paga).
Embora identificar claramente as atividades proibidas seja benéfico, não é um requisito e não afeta nossas pontuações. As empresas podem optar por mencionar que não permitem atividades ilegais em vez de mencionar todas as possíveis instâncias de atividades ilegais.
Mencionar uma atividade como proibida não significa que tais atividades serão revisadas ou bloqueadas. Nossas pontuações dependem de como essas políticas são implementadas, conforme descrito abaixo:
Processos para uso ético
Embora algumas categorias descritas nas políticas de uso aceitável sejam bastante amplas (por exemplo, raspagem de dados não autorizada ou acesso), outras são específicas o suficiente para serem convertidas em ações preventivas (por exemplo, bloqueio de acesso) que os serviços de coleta de dados podem implementar para usuários que não concluíram o processo de KYC.
Com base nesses usos proibidos específicos, preparamos uma lista extensa de usos que provavelmente são usos ilegais de proxies. Para cada caso de uso, identificamos cenários incluindo domínios da web e ações relevantes. Por exemplo, no cenário de engajamento artificial em mídias sociais, tentamos entrar em uma rede social usando um proxy para curtir uma publicação existente.
Em seguida, para testar se as empresas permitem o uso antiético pelos clientes, criamos uma conta no serviço de cada provedor usando um endereço de e-mail que não era da AIMultiple. Não concluímos um processo de KYC com essa conta e passamos a usar os serviços para entender o que usuários anônimos podem fazer com cada serviço. O KYC é uma etapa crucial durante a qual o usuário envia dados para validar a entidade legal que representa. Isso vincula a atividade do usuário a uma entidade legal:
- Que pode ser responsabilizada.
- Cuja justificativa para ações online (por exemplo, usar proxies para entrar em sites do governo) pode ser examinada. Por exemplo, após entender seu caso de uso, um pesquisador ou uma agência governamental pode ter permissão para entrar em um site do governo usando um proxy.
Esperávamos que esses casos de uso acionassem um processo de KYC, mas na maioria dos fornecedores isso não aconteceu. Uma marca de verificação indica que a solicitação foi bloqueada para usuários que ainda não concluíram o processo de KYC:
Para esclarecer, as empresas de serviços de coleta de dados não têm obrigação legal de bloquear esses sites, e alguns desses cenários podem fazer parte de usos legais. Por exemplo, um pesquisador pode querer usar proxies para realizar um experimento controlado em mídias sociais. No entanto, dado o potencial de abuso nesses cenários, esperávamos que os serviços de coleta de dados os bloqueassem para usuários que não concluíram o processo de KYC.
Como as marcas comunicam os domínios que bloqueiam
- Bright Data lista categorias de domínios restritos em sua política de uso aceitável.
Respeitar as preferências dos sites em relação à coleta automatizada de dados
O que é robots.txt?
robots.txt é um nome de arquivo para implementar o Robots Exclusion Protocol. Esse protocolo é usado pelos sites para indicar partes do site que o proprietário prefere que os bots não visitem. A adesão ao robots.txt é voluntária.
Prós e contras de aderir ao robots.txt
- Respeita as preferências do site.
- Pode não ser atualizado recentemente e, portanto, estar desatualizado.
- Normalmente envolve termos que indicam que o proprietário do site prefere que certas seções públicas do site não sejam acessadas por bots.
O robots.txt também pode fornecer acesso desigual aos bots. Por exemplo, os proprietários de sites podem indicar que preferem que os bots dos mecanismos de resposta não visitem determinados URLs que os bots dos mecanismos de busca visitam.
O robots.txt não é um documento legal e pode solicitar o bloqueio do acesso de bots a páginas que, legalmente, são:
- permitidas para raspagem (por exemplo, dados públicos) ou
- não permitidas para raspagem (por exemplo, dados atrás de um login quando os Termos de Serviço do proprietário do site proíbem a raspagem desses dados).
Os provedores de serviços de coleta de dados da web podem solicitar que usuários de proxies residenciais concluam um processo de KYC e provem que possuem um caso de uso legal e ético antes que esses usuários possam desconsiderar o robots.txt.
Para os testes, enviamos solicitações a páginas em subpastas que o robots.txt solicita bloquear. Os domínios que usamos foram aimultiple.com e 5 domínios da web entre os 100 mais visitados. O Bright Data bloqueou essas solicitações:
Exemplo da CNN
O robots.txt da CNN bloqueia a pasta /terms14. Para testar, navegamos até essa pasta com proxies residenciais e recebemos mensagens 200 com os dados da página de todos os provedores, exceto o Bright Data. A resposta do Bright Data é: “Residential Failed (bad_endpoint): O site solicitado não está disponível para o modo de acesso residencial imediato (sem KYC), de acordo com o robots.txt. Para obter acesso residencial completo para segmentar este site, preencha o formulário de KYC: https://brightdata.com/cp/kyc”.
Gestão de abusos
Descrevemos uma metodologia para avaliar as práticas de gestão de abusos dos fornecedores e coletamos dados para atender aos nossos critérios de avaliação:
* Não aplicável: a Zyte compra proxies de outros provedores de proxy e, portanto, quando o serviço da Zyte é usado para abuso, os proprietários de sites contatariam seus provedores de proxy, e não a Zyte.
Embora todos os fornecedores ofereçam meios para 3rd parties ou seus clientes entrarem em contato, ter esses meios é importante para a resolução de problemas:
- Política pública de abuso
- Um endereço de e-mail dedicado para denunciar abusos
- Um método de contato alternativo (por exemplo, formulário web ou interface de mensagens) que permita que os denunciantes contatem a empresa. Isso é útil, pois os e-mails podem ser filtrados e talvez não cheguem à caixa de entrada.
- Capacidade de resposta às mensagens
3 provedores no benchmark (Bright Data) forneceram um e-mail para denunciar abusos. Todos esses provedores também descreveram suas políticas nesse domínio.
Esperamos que todos os outros provedores façam o mesmo e que isso se torne uma prática generalizada do setor no curto prazo.
Por fim, avaliamos a capacidade de resposta da gestão de abusos enviando relatórios de abuso por e-mail a partir de domínios de terceiros (ou seja, não-AIMultiple) e medindo os tempos de resposta. Se não encontrássemos um endereço de e-mail para abuso, enviávamos ao formulário de contato geral. Testamos isso por meio de 3 lotes de e-mails enviados em:
- Sexta-feira, 2 de maio de 2025, de:
- Um serviço de venda de ingressos com ~30k de tráfego mensal
- Um escritório de advocacia com ~1k de tráfego mensal em
- Em 17 de maio de 2025, do serviço de venda de ingressos.
- Em 24 de maio de 2025, de uma agência de mídias sociais com tráfego online limitado.
Os primeiros e-mails enviados em 2 de maio de 2025 foram enviados a empresas que forneceram e-mails dedicados. Depois, expandimos nossa lista e incluímos endereços de e-mail mais gerais listados nas seções de contato de todos os serviços de coleta de dados da web avaliados. Se uma empresa respondesse aos nossos e-mails, parávamos de enviar novos e-mails a ela.
Em nossos e-mails, mencionamos que nossos sites receberam tráfego suspeito de bots via proxies e pedimos apoio para identificar a origem dos proxies. Conseguimos que todas as equipes de conformidade, exceto uma, nos respondessem. Quase todas as respostas foram recebidas no mesmo dia.
Transparência de uso
Os proprietários de sites que fornecem dados da web e serviços de coleta da web historicamente não tiveram troca de dados sobre as atividades de coleta. Para limitar as atividades de rastreamento, os proprietários de sites podiam:
- Contatar serviços de coleta de dados da web para denunciar abusos
- Trabalhar com provedores de gestão de bots, como Cloudflare, para dificultar o rastreamento.
Agora, existem iniciativas para uma troca de dados mais estruturada entre essas partes. A Bright Data lançou o console Webmaster da Bright Data para que os webmasters monitorem as atividades de rastreamento em seus sites. Mais transparência provavelmente melhorará as práticas de coleta de dados da web.
Nossa experiência com o console Webmaster
Nós nos inscrevemos verificando a propriedade do nosso domínio e adicionando um arquivo collectors.txt no domínio.
Agora temos acesso à atividade de bots do Bright Data em nosso site:
Benchmark: fornecimento ético
* Foram incluídas avaliações nessas plataformas de 3rd party: Amazon Appstore, App Store, Google Play Store, Trustpilot. Por conveniência, esse valor foi calculado para 5 aplicativos principais da Bright Data, não para todos os 120 aplicativos exibidos em seu site.
Transparência de parceiros
A largura de banda exigida pelas empresas de infraestrutura de dados da web pode ser fornecida de maneira ética por meio da oferta de benefícios (por exemplo, pagamentos, recursos como a capacidade de pular anúncios) em troca do consentimento para compartilhar a conexão de internet. No entanto, também é possível obter acesso não autorizado aos sistemas de usuários de varejo e vender suas conexões.
Provedores de infraestrutura de dados da web podem formular políticas e processos, realizar auditorias externas e publicar sua abordagem e os resultados das auditorias para criar transparência sobre como adquirem suas conexões de internet. Isso pode promover a confiança no fornecimento ético de seus serviços.
Criamos um framework para transparência do lado da oferta em dados da web e avaliamos os fornecedores usando esse framework. Aplicamos esse framework independentemente de o serviço de coleta de dados da web adquirir IPs residenciais diretamente ou por meio de outros proxies. Nosso objetivo é trazer transparência a toda a cadeia de fornecimento de IPs, pois práticas antiéticas podem se originar em qualquer ponto da cadeia de suprimentos.
Aqui você encontra nossos resultados detalhados:
Bright Data
Bright Data é classificado como Nível 5 porque publica:
- Sua abordagem de sourcing e como os desenvolvedores de aplicativos podem trabalhar com eles por meio de seu SDK15 16
- Detalhes sobre 120 fornecedores foram compartilhados publicamente. Pudemos verificar as avaliações desses fornecedores em plataformas de 3rd party para estimar o quão populares eles são. 17
Revisão de aplicativos selecionados
Bright Data compartilha 120 aplicativos em seu site. Aplicativos como o Bright VPN são certificados por 3rd parties em sua divulgação e UX.18 Também baixamos esses aplicativos para vê-los em mais detalhes:
- Bright VPN
- EarnApp
- Sling Kong
Formulário de opt-in com obrigação de não coletar dados de identificação pessoal: Formulário de consentimento com explicação clara de
Bright VPN:
Earn App:

Sling Kong:
- O usuário recebe a oferta durante o jogo:

- Opt-in:

- Informações adicionais durante o opt-in:

- Opt-out:


Valor fornecido pelos aplicativos:
- Bright VPN: Serviço de VPN gratuito
- EarnApp: Pagamentos
- Sling Kong: Moeda virtual dentro do jogo
Outros
Embora a maioria dos provedores esteja ciente da ética no web scraping e tenha publicado sobre o tema (por exemplo, 19, não identificamos seus compromissos específicos nesse aspecto, exceto no caso da Zyte.20
Esperamos que isso mude e que a maioria dos provedores avance para pelo menos o Nível 1 no curto prazo.
Certificação externa
* Indica que a empresa obteve todas as certificações externas nesta categoria
É fundamental que os fornecedores tenham sistemas, pessoal e processos adequados para proteger os dados dos clientes e proteger os aplicativos que fornecem seus IPs. Consulte nossa metodologia de medição de certificação externa para entender a lógica por trás de nossa pontuação.
Conformidade com GDPR e CCPA
Todos os fornecedores declaram publicamente estar em conformidade com ambas as regulamentações de privacidade de dados. Portanto, isso não foi incluído na pontuação.
Como medimos as maturidades organizacionais
Com base nas capacidades que identificamos nesse domínio, verificamos a existência desses certificados em cada provedor usando suas declarações públicas:
- Certificação de segurança de dados e certificação de PII: 21222324
- Fonte de IP em whitelist: 25
- Práticas éticas avaliadas: 26
Alguns provedores que não possuem certificados ISO 27018 alegaram que deveriam ser considerados certificados por usarem provedores de serviços em nuvem que possuem certificados ISO 27018. A opinião do nosso consultor de cibersegurança foi que, embora isso facilitasse a obtenção do certificado, eles ainda precisariam ter suas políticas e controles certificados para obter o certificado.
Cobertura de seguro
3 empresas de coleta de dados da web compartilharam seus certificados de seguros. Não publicamos certificados, mas revisamos os documentos para garantir que
- cobrissem essas 2 categorias de seguro
- O limite de seguro em cada categoria seja de pelo menos na escala de vários milhões em US$.
Alianças do setor e dados da web éticos
Existem 2 grandes alianças do setor:
- Alliance for Responsible Data Collection incluindo Bright Data, Common Crawl e outros
- Ethical Web Data Collection Initiative (EWDCI) que inclui Oxylabs, ProxyEmpire, Zyte, entre outros. Costumava incluir a NetNut até que NetNut foi encerrada pelo FBI, portanto a participação em uma aliança do setor não impediu que empresas infringissem a lei.
Avisos e recomendações para os próximos passos
Todos os provedores neste benchmark, exceto a Nimble, são clientes da AIMultiple. Como sempre, seguimos nossos compromissos éticos durante esta pesquisa.
Concluímos uma revisão exaustiva da coleta ética de dados da web e, embora estejamos satisfeitos com o escopo deste benchmark, gostaríamos de aumentar sua participação. Agradecemos a essas empresas por compartilhar sua cobertura de seguro: Apify, Bright Data, Zyte.
Estamos aguardando respostas da Nimble. Atualizaremos o relatório assim que tivermos mais novidades deles. 2 fornecedores optaram por não participar desta edição do benchmark. Estamos sempre atualizando este relatório se alguma dessas 7 empresas sugerir mudanças baseadas em fatos, justas para todos os fornecedores e que ajudem as empresas a tomar melhores decisões.
NetNut estava entre as empresas que avaliamos quando publicamos este relatório pela primeira vez em 2025. Eles tiveram a pontuação mais baixa possível (Nível 0) em nossa análise aprofundada de fornecimento ético, na qual examinamos as fontes de IPs desses provedores. A NetNut foi encerrada em 2026, pois o FBI identificou seus vínculos com botnets.27 Esperamos que isso seja um incentivo para que todos os fornecedores sejam transparentes sobre seu sourcing.
Este é o primeiro relatório a focar em dados da web éticos, de acordo com nossa pesquisa. Esperamos que essa transparência possa ajudar o setor de dados da web a encontrar soluções criativas para seus desafios. Essas soluções precisarão equilibrar os interesses dos coletores de dados da web, dos usuários de automação da web, dos proprietários de sites e dos usuários residenciais que fornecem seus IPs ao setor.
Limitações da metodologia
Este benchmark mede indicadores observáveis de maturidade, incluindo controles de uso pelo cliente, transparência no fornecimento de IP, certificações externas e compartilhamento de seguros. No entanto, a pontuação não determina completamente se um provedor está legalmente em conformidade em todos os casos de uso do cliente.
Portanto, uma pontuação alta no benchmark deve ser tratada como insumo para a due diligence de compras, e não como garantia de legalidade ou uso ético.
Referências
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dilmegani2026,
author = {Dilmegani, Cem},
title = {{Benchmark de Dados da Web Éticos e em Conformidade}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/web-scraping-ethics}},
note = {AIMultiple. Acessado em 4 Agosto 2026}
}Resultados e carimbos de data/hora de 66 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 8 arquivos CSV.
Registro de alterações
6 atualizações- 2025
Adicionados códigos de fornecedor à introdução da seção "Ethical & Compliant Web Data Benchmark".
Expandidos os dados de "Exemplo da vida real" na seção "Risco de reputação".
Substituída a seção "Ethical & Compliant Web Data Benchmark" por uma nova avaliação dos serviços de coleta de dados da web.
Adicionadas Organizações para Web Scraping Ético à seção Leitura Adicional.
Atualizados os resultados dos casos Meta vs Bright Data e X Corp. vs Bright Data na seção "Histórico dos principais processos de web scraping".
- 2024
Atualizados os dados do caso "eBay vs Bidder's Edge" na seção "Casos Legais".
Links de referência
O trabalho de Cem na AIMultiple foi citado por publicações globais líderes, incluindo Business Insider, Forbes, Morning Brew e Washington Post, por empresas globais como Deloitte e HPE, ONGs como o World Economic Forum e organizações supranacionais como a European Commission. [1], [2], [3], [4], [5]
Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas sobre suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.
Ele liderou a estratégia de tecnologia e as compras de uma operadora de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de deep tech Hypatos, que atingiu uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia líderes como TechCrunch e Business Insider.
Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou como engenheiro da computação pela Bogazici University e possui um MBA pela Columbia Business School.




Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.