Serviços
Contate-nos

Benchmark de Dados Web Éticos e em Conformidade

Cem Dilmegani
Cem Dilmegani
atualizado em 4 ago. 2026

À medida que as empresas escalam suas operações de dados web, executivos de conformidade, dados e riscos avaliam cada vez mais os riscos éticos, reputacionais e legais associados.

Comparamos 5 serviços líderes de coleta de dados web em 3 dimensões e testamos cada serviço com mais de 20 cenários potencialmente antiéticos.

Nosso trabalho ajuda você a avaliar a posição ética das suas práticas de coleta de dados e a entender as possíveis consequências de abordagens antiéticas. Também fornecemos diretrizes para a coleta ética de dados web e avaliamos serviços de coleta de dados web sob a perspectiva de ética e conformidade:

Avaliação dos serviços de coleta de dados web

Avaliamos os principais serviços de coleta de dados web (também chamados de provedores de dados web ou infraestrutura de dados web) usando nosso checklist de dados web éticos. Essas pontuações representam níveis de maturidade, sendo 5 o nível mais alto:

Fornecedores
Resumo
Uso ético pelos clientes
Fornecimento ético
Certificação externa
Cobertura de seguro compartilhada**
Nível 5
Nível 5
Nível 5
Segurança de dados, processamento de PII. Fontes de IP na lista de permissões. Práticas éticas avaliadas.
Nível 1
Nível 1
Nível 1
Segurança de dados
Nível 1
Nível 1
Nível 1
Segurança de dados
Nimble
Nível 1
Nível 1
Nível 0
Segurança de dados

* Estes são códigos para os nomes dos fornecedores. Esses fornecedores não quiseram ser mencionados neste relatório e estão listados no final da lista até resolvermos essa questão.

** ✅ indica que a empresa optou por compartilhar seus certificados de seguro com AIMultiple. ❌ indica que a empresa decidiu não compartilhar seus certificados de seguro conosco e, portanto, não pudemos validar a cobertura de seguro deles. A cobertura de seguro é a categoria em que dependemos da participação das empresas de serviços de dados web para avaliá-las.

Classificados pela pontuação resumida.

Modelo de pontuação para dados web éticos

Abaixo, explicamos como essas pontuações são derivadas. Você também pode ver a lógica para selecionar essas dimensões de pontuação.

Nas 2 primeiras categorias, identificamos 5 competências, e as empresas receberam pontuações com base no número de competências que atenderam. O nível 5 representa a maior maturidade observada no mercado, refletindo as melhores práticas atuais em vez da perfeição.

Capacidades para uso ético pelos clientes

  • Processos eficazes para uso ético: Avaliamos a capacidade de cada provedor de impedir o uso antiético de seus serviços de proxy residencial por meio de cenários de teste controlados. Se qualquer uma de nossas solicitações for bloqueada pelo provedor, isso é alcançado.
  • Processos aprimorados para uso ético: Semelhante a “processos eficazes para uso ético”. No entanto, essa capacidade indica que o provedor de serviços bloqueou mais de uma de nossas tentativas de usar seus serviços para casos de uso antiéticos.
  • Processos de melhores práticas para uso ético: Semelhante a “processos eficazes para uso ético”. No entanto, essa capacidade indica que o provedor de serviços bloqueou a maioria de nossas tentativas de usar seus serviços para casos de uso antiéticos.
  • Base de gestão de abusos: Publicação de uma política de gestão de abusos e de um método para denunciar abusos
  • Gestão responsiva de abusos: Medimos como as empresas responderam a múltiplos relatos de abuso. Mesmo quando não havia uma linha direta para denúncias de abuso, usamos os e-mails listados pela empresa para contatar a equipe. Se não recebêssemos nenhuma resposta ao nosso relato em uma semana, a empresa foi considerada sem capacidade de resposta.

Capacidades para fornecimento ético

O fornecimento ético envolve adquirir endereços IP de maneira ética. Nossa análise de mercado identificou os seguintes níveis de transparência em relação ao fornecimento ético de IP:

  • Nível 1: Publicação da política de obtenção de IP.
  • Nível 2: Divulgou pelo menos uma fonte (ex.: um aplicativo móvel) de IPs que fornece IPs de maneira ética. A fonte divulgada deve ter no total pelo menos 10k avaliações em plataformas de terceiros, incluindo Google, Apple, lojas de aplicativos da Amazon e Trustpilot.
  • Nível 3: O mesmo que o Nível 3, mas com 100k avaliações
  • Nível 4: O mesmo que o Nível 3, mas com 1M avaliações
  • Nível 5: O mesmo que o Nível 4, mas com 10M avaliações

As avaliações são um indicador da popularidade dos aplicativos e um sinal importante para esta avaliação. Os serviços de coleta de dados web precisam trabalhar com aplicativos populares para conseguir atender às necessidades de IP de seus clientes.

Para a qualificação, os aplicativos divulgados devem seguir estas melhores práticas. Não verificaremos isso para todos os aplicativos divulgados, mas verificaremos para alguns selecionados aleatoriamente:

  • Consentimento informado:
    • Os usuários precisam aceitar antes de compartilhar sua conexão com a internet. A tela de aceite deve explicar:
      • O provedor
      • O serviço
      • Como o IP deles será usado
    • Os usuários devem poder acessar informações detalhadas sobre
      • Como a conexão com a internet deles será usada
      • Política de privacidade
  • Value: Os usuários devem receber algum valor do aplicativo (ex.: pagamento, capacidade de pular anúncios ou alguma outra funcionalidade)
  • Privacidade: Coleta limitada e transparente de dados do usuário.

Para redes de proxy residencial, os compradores também devem verificar se o consentimento é específico, informado, revogável e separado de permissões não relacionadas do aplicativo. Eles devem perguntar se os usuários podem optar facilmente por sair, se o uso de largura de banda é limitado, se menores são excluídos e se o provedor audita aplicativos ou SDKs que fornecem IPs residenciais.

Certificação externa

Avaliamos a certificação externa com base em as empresas terem adquirido esses certificados relevantes para segurança e conformidade de nível corporativo.

  • Certificação de PII: Capacidade demonstrada de gerenciar PII por meio da obtenção da ISO 27018
  • Certificação de segurança de dados: Práticas de segurança de dados demonstradas por meio da obtenção de um destes certificados: SOC 2 ou ISO/IEC 27001
  • Fonte de IP na lista de permissões: Provedores de certificação externa, como a McAfee, certificam qualquer um dos seguintes:
    • Aplicativos de 3rd party específicos que fornecem IPs
    • SDK que coleta IPs de aplicativos de 3rd party
  • Práticas éticas avaliadas: Um projeto de garantia ISAE 3000 pode ser concluído para avaliar as práticas internas de conformidade e ética.

Seguro

Perguntamos aos fornecedores os seguintes documentos de seguro:

  • Seguro de responsabilidade civil profissional, certificado que oferece cobertura para responsabilidades dos fornecedores em caso de problemas no serviço
  • Certificado de seguro cibernético, que oferece cobertura para responsabilidades dos fornecedores em caso de problemas relacionados à segurança da informação.

Pontuação resumida

Essa pontuação é a soma de todas as pontuações dividida por 3. As pontuações são:

  • 0 a 5 para capacidades de uso ético pelos clientes
  • 0 a 5 para capacidades de fornecimento ético
  • 0 a 3 para certificação externa
  • 0 a 2 para seguros

Principais serviços de coleta de dados web

AIMultiple selecionou os 7 maiores serviços de coleta de dados web em número de funcionários no LinkedIn. Escolhemos essa métrica porque ela é pública e deve estar correlacionada com as receitas e a prontidão corporativa da empresa. Métricas melhores, como receitas ou número de funcionários na folha de pagamento, não estão publicamente disponíveis para essas empresas privadas.

Todas as empresas selecionadas têm mais de 100 funcionários conectados às suas páginas de perfil do LinkedIn em abril de 2025. Atualmente, 5 das 7 selecionadas são exibidas nesta página, e as 2 empresas restantes optaram por não ser incluídas no relatório.

Produtos de coleta de dados web em foco

Essas empresas oferecem uma variedade de produtos, incluindo proxies, APIs de raspagem de dados e datasets. Embora todos os produtos possam ser examinados de uma perspectiva ética, inicialmente nos concentramos no produto que oferece o maior nível de flexibilidade e alimenta a maioria dos outros produtos: proxies residenciais.

Os produtos de coleta de dados web podem ser considerados uma hierarquia em que os proxies formam a camada central sobre a qual todos os outros serviços são construídos. Isso ocorre porque os proxies permitem que as máquinas acessem a internet por meio de diferentes destinos, possibilitando um conjunto diverso e grande de conexões de internet cruciais para a coleta de dados. Portanto, os proxies são o produto de coleta de dados web mais capaz; eles podem ser usados para realizar funções que não seriam possíveis com datasets ou APIs de raspagem de dados.

Entre os proxies, os proxies residenciais são o produto mais difícil de ser identificado pelos sites como proxy. Por exemplo, outros proxies, como proxies de datacenter, são fáceis de identificar devido à sua localização. Portanto, os proxies residenciais alimentam a maioria dos outros produtos de dados web, como APIs de raspagem de dados.

Verifique: a sua coleta de dados web está em conformidade e é ética?

Sua empresa provavelmente utiliza dados web. No entanto, o setor enfrenta regulamentação limitada, o que torna importante escolher um provedor ético e em conformidade. Para isso, preparamos uma estrutura holística que leva em conta diferentes aspectos da coleta de dados web, incluindo obtenção ética, uso ético e certificação externa.

Dados web são um ativo operacional comum

Como empresa, seu negócio depende parcialmente de dados web devido aos seus inúmeros casos de uso, como:

  • Precificação dinâmica para varejo e e-commerce
  • Dados alternativos em tempo real para fundos de investimento
  • Processo KYC em bancos comerciais
  • Treinamento de IA models ou finetuning
  • IA inference ou RAG
  • Pesquisa de mercado

Com IA, os dados web agora são mais importantes

Embora a coleta de dados web seja tão antiga quanto a web, sua importância aumentou drasticamente após o surgimento dos IA models generativos. Construtores desses models, como OpenAI e Anthropic, começaram sem parcerias de conteúdo significativas e usaram principalmente dados online para construir seus models iniciais, o que levou ao surgimento da indústria de IA de trilhões de dólares.

Supervisão regulatória limitada

Embora a regulamentação da IA esteja sob o spotlight, o setor de coleta de dados permanece, em grande parte, não regulamentado na maioria dos países. Atividades online claramente ilegais são bem definidas. No entanto, existem requisitos regulatórios limitados para que os participantes do setor impeçam proativamente o uso indevido de seus serviços pelos usuários.

Cabe às próprias plataformas estabelecer melhores práticas e padrões de conformidade para garantir a coleta ética de dados e o uso de proxy. Portanto, a escolha do fornecedor importa mais na coleta de dados do que em setores fortemente regulamentados, como o bancário, onde todos os provedores de serviços precisam cumprir inúmeras regulamentações.

A postura ética de seus fornecedores faz parte da reputação da sua empresa

Independentemente de você coletar ou consumir os dados, você é responsável pelo processo de aquisição deles.

A responsabilidade das empresas por atividades ilegais na cadeia de suprimentos depende da jurisdição. Por exemplo, na Alemanha, as empresas são responsáveis por realizar atividades KYS e de gerenciamento de riscos para identificar e prevenir danos causados por sua cadeia de suprimentos. Mesmo quando as empresas não são responsáveis por danos causados por sua cadeia de suprimentos, elas podem sofrer risco reputacional.

Qual é o custo da coleta de dados antiética e não conforme?

Risco reputacional

Se tornar público que uma empresa está usando um serviço de coleta de dados web que se envolve em comportamentos antiéticos ou em ações que colocam em risco sua segurança de dados, isso pode causar danos reputacionais significativos, como perda de negócios, rotatividade de clientes, rotatividade de talentos e perda de confiança de investidores.

Exemplos reais de fornecedores corporativos que levam à perda reputacional:

  • Nike sofreu danos reputacionais diversas vezes devido a práticas trabalhistas antiéticas de seus fornecedores.1
  • Muitas empresas, como a EY, perderam a confiança de seus clientes quando foram afetadas pela violação do software de transferência gerenciada de arquivos MOVEit. 2

A perda reputacional, especialmente a que gera indignação pública, geralmente é seguida por processos judiciais movidos por clientes da empresa ou por outras partes interessadas prejudicadas pelas práticas antiéticas.

Exemplo real: Starbucks é uma das marcas recentes processadas por comprar de empresas com práticas antiéticas.3

Checklist de dados web éticos

Os dados web corporativos precisam atender a 3 requisitos para serem éticos:

Uso ético pelos clientes

Como parte de seus processos Know Your Supplier, as empresas evitam usar serviços que possibilitam atividades antiéticas. Usar esses serviços expõe os negócios a danos reputacionais.

Exemplo do mundo real: Em casos em que um provedor foi documentado permitindo que sua plataforma fosse usada em atividades antiéticas, inúmeras empresas se distanciaram do provedor até que ele melhorasse suas práticas.4

Como isso se relaciona com os dados web: Os dados web são coletados por meio de diferentes endereços IP. Esses endereços podem ser usados para realizar diferentes atividades ilegais, como ataques DDOS para impedir a entrega de serviços digitais, coleta não autorizada de dados não públicos ou fraude de anúncios. Atores mal-intencionados precisam de IPs para potencializar suas ações, e os provedores de infraestrutura de dados web/proxy são os maiores fornecedores de IPs para usuários de varejo.

Fornecimento ético

Serviços usados para fins éticos podem causar ações antiéticas e prejudiciais durante sua produção. Por exemplo, marcas como Nike e Nestlé sofreram danos reputacionais e enfrentaram processos judiciais devido ao uso de trabalho infantil por seus contratados.

Como isso se relaciona com os dados web:

As empresas precisam acessar um grande número e diversas fontes de largura de banda para coleta rápida e global de dados. Isso exige o uso de proxies residenciais: embora coletar dados públicos seja legal em muitas condições, 5 os sites também podem optar por bloquear alguns de seus visitantes. Por exemplo, eles podem bloquear os crawlers de concorrentes. Nesses casos, as empresas precisam depender de um grande número de conexões de usuários de varejo ou de outros 3rd parties para coletar dados web.

Os provedores de proxy coletam milhões de conexões de internet de várias fontes e as fornecem a empresas que usam endereços IP para acessar essas conexões. Alguns desses IPs se originam de dispositivos de usuários residenciais. Coletar essas conexões pode ser legal ou ilegal:

  • Legal: Práticas legalmente em conformidade envolvem obter consentimento informado do usuário, fornecer compensação e oferecer mecanismos de opt-out de acordo com as regulamentações locais. O provedor de dados web deve
    • Informar os usuários sobre como sua largura de banda seria usada
    • Obter consentimento digitalmente
    • Compensá-los em troca
    • Permitir que eles optem por sair a qualquer momento
  • Ilegal: Atores mal-intencionados podem obter acesso aos dispositivos dos usuários e usar sua conexão com a internet sem permissão ou compensação. Isso pode acontecer por meio de aplicativos de malware, dispositivos comprometidos, instalações mascaradas, opt-in automático e outros métodos que podem colocar o proprietário do dispositivo em risco.

Empresas que usam proxies obtidos ilegalmente podem, inadvertidamente, pagar a atores mal-intencionados pelo acesso não autorizado a dispositivos.

Exemplos reais:

  • Provedores de proxy residencial listados na bolsa de valores foram documentados compartilhando sua infraestrutura com SDKs que usam conexões de dispositivos sem o consentimento do usuário.6 7
  • Roteadores e dispositivos IoT foram comprometidos para operações de botnet e vendidos como proxies residenciais.8 9
  • Certos provedores de proxy promovem seus serviços em fóruns frequentados por atores mal-intencionados. Esses IPs provavelmente são obtidos ilegalmente.10
  • Aplicativos VPN na Google Play Store também foram usados para adquirir IPs residenciais sem o consentimento do usuário.11

Embora essas operações tenham sido encerradas, é provável que atores mal-intencionados ainda acessem IPs residenciais sem consentimento por meio de botnets e aplicativos comprometidos ou maliciosos.

Certificação externa

Compradores corporativos precisam de soluções seguras e prontas para empresas. Identificamos os ingredientes para uma organização de dados web madura que podem ser documentados por meio de certificação externa:

Segurança de dados

A falta de segurança de dados nos sistemas de um fornecedor pode corroer a vantagem competitiva de uma empresa ou levar à perda de dados e ao tempo de inatividade do sistema. A perda de funcionalidade do sistema pode corroer a confiança e levar à desvalorização de uma empresa.

Intrusão no sistema

Os serviços de coleta de dados não estão tão profundamente integrados aos sistemas de uma empresa quanto os serviços digitais essenciais (ex.: um sistema de registro, como CRM). Portanto, suas credenciais de segurança não são revisadas tão minuciosamente quanto as credenciais de um sistema central, como um sistema de registro. No entanto, a segurança de dados é fundamental para os clientes dos serviços de coleta de dados, pois esses serviços:

  • Às vezes, são integrados a sistemas mais centrais, como mecanismos de precificação.
  • Podem infectar sistemas corporativos mesmo quando não estão integrados a esses sistemas. Usar um serviço de coleta de dados envolve receber dados desse serviço. Até mesmo algumas das formas mais seguras de transferência de dados incluem riscos.

A intrusão no sistema também pode levar invasores a atacar os dispositivos que fornecem IPs residenciais a um serviço de proxy. Isso pode resultar em danos reputacionais para os clientes desse serviço de proxy.

Exemplo real de vulnerabilidade em um provedor de proxy residencial:

Operadores do botnet Kimwolf compraram serviços de proxy do provedor de proxy residencial IPIDEA. Usando comandos maliciosos, eles infectaram as redes internas de dispositivos que fornecem IPs à IPIDEA. Essas redes foram então escaneadas, e outros dispositivos vulneráveis nessas redes locais também foram infectados.

Estima-se que o Kimwolf tenha se espalhado para mais de 2 milhões de dispositivos com esse método. Os dados coletados pelos clientes da IPIDEA também passaram por essas redes infectadas.12

Perda de dados

Sem segurança de dados, atores mal-intencionados podem obter acesso aos dados coletados pelas empresas para identificar suas atividades e estratégias, levando à perda de vantagem competitiva ou de oportunidades de negócios.

Exemplo real:

Embora os dados web sejam públicos, as empresas podem usá-los de maneiras inovadoras para obter vantagem competitiva. Por exemplo, investidores gastam até 10% de seu orçamento de dados de mercado em dados alternativos13 , mas raramente divulgam suas estratégias, pois acreditam que isso pode ajudá-los a obter vantagem sobre os concorrentes. Um vazamento de dados pode expor suas estratégias e, portanto, permitir que sejam replicadas pelos concorrentes.

Gestão de PII

Dados web incluem dados privados atrás de login ou PII que podem ser divulgados acidentalmente ou propositalmente em sites públicos. Se os serviços de coleta de dados web não gerenciarem PII corretamente, esses dados podem ser adquiridos por atores mal-intencionados. Isso pode causar danos reputacionais ao serviço de coleta de dados web e a seus clientes.

Segurança de aplicações

Aplicações ou programas intermediários, como SDKs, que originam os IPs dos serviços de coleta de dados web podem ser incluídos na lista de permissões por provedores de certificação externa, como a McAfee. Isso aumenta a confiança da empresa nas práticas éticas de fornecimento do serviço de coleta de dados web.

Cobertura de seguro

As empresas normalmente exigem os seguintes seguros de qualquer provedor digital:

  • Seguro de responsabilidade civil profissional
  • Certificado de seguro cibernético
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Benchmark detalhado: Avaliação dos provedores de infraestrutura de dados web

Benchmark: Uso ético pelos clientes

Aqui, pretendemos responder à pergunta: A empresa garante que o uso de sua solução seja ético e esteja em conformidade com as leis e regulamentações aplicáveis? Resumo das nossas descobertas:

* Não aplicável: Como Zyte e Apify compram proxies de seus fornecedores e não os coletam diretamente de usuários residenciais, eles não seriam contatados por proprietários de sites sobre abuso e, portanto, não precisam criar um formulário de contato para sites.

Primeiro, revisamos as políticas:

Revisão da política de uso aceitável

Todos os fornecedores proíbem atividades ilegais e fornecem exemplos como ataques DoS, mensagens em massa não solicitadas, falsificação de identidade ou spoofing.

Além disso, alguns fornecedores também destacam que proíbem atividades que provavelmente são ilegais. Abaixo listamos as atividades proibidas com base nas políticas de uso aceitável e em seus aditivos (ex.: aditivo de processamento de dados) de cada fornecedor.

Procuramos termos que proibissem atividades que provavelmente são ilegais e que podem ser identificadas com base na atividade do usuário. Por exemplo, uma parcela significativa de usuários que usam proxies para responder a pesquisas remuneradas pode estar usando proxies para enganar os provedores das pesquisas sobre sua localização real. Portanto, essa atividade provavelmente é ilegal e pode ser identificada com base na atividade do usuário (ou seja, quando um usuário faz login em um site de pesquisa remunerada).

Embora identificar claramente atividades proibidas seja benéfico, isso não é um requisito e não afeta nossas pontuações. As empresas podem optar por mencionar que não permitem atividades ilegais em vez de mencionar cada instância possível de atividades ilegais.

Mencionar uma atividade como proibida não significa que tais atividades serão revisadas ou bloqueadas. Nossas pontuações dependem de como essas políticas são implementadas, conforme descrito abaixo:

Processos para uso ético

Embora algumas categorias descritas nas políticas de uso aceitável sejam bastante amplas (ex.: raspagem ou acesso não autorizado de dados), outras são específicas o suficiente para serem convertidas em ações preventivas (ex.: bloqueio de acesso) que os serviços de coleta de dados podem implementar para usuários que não concluíram o processo KYC.

Com base nesses usos proibidos específicos, preparamos uma lista extensa de usos que provavelmente são usos ilegais de proxies. Para cada caso de uso, identificamos cenários incluindo domínios da web e ações relevantes. Por exemplo, no cenário de engajamento artificial em redes sociais, tentamos entrar em uma rede social usando um proxy para curtir uma postagem existente.

Em seguida, para testar se as empresas permitem uso antiético por clientes, criamos uma conta no serviço de cada provedor usando um endereço de e-mail não-AIMultiple. Não concluímos um processo KYC com essa conta e passamos a usar os serviços para entender o que usuários anônimos podem fazer com cada serviço. O KYC é uma etapa crucial durante a qual o usuário envia dados para validar a entidade legal que representa. Isso vincula a atividade do usuário a uma entidade legal:

  • Que pode ser responsabilizada.
  • Cuja justificativa para ações online (ex.: usar proxies para acessar sites governamentais) pode ser examinada. Por exemplo, depois de entender o caso de uso, um pesquisador ou agência governamental pode ter permissão para fazer login em um site governamental usando um proxy.

Esperávamos que esses casos de uso acionassem um processo KYC, mas na maioria dos fornecedores isso não aconteceu. Uma marca de verificação indica que a solicitação foi bloqueada para usuários que ainda não concluíram o processo KYC:

Para esclarecer, as empresas de serviços de coleta de dados não têm obrigação legal de bloquear esses sites, e alguns desses cenários podem fazer parte de um uso legal. Por exemplo, um pesquisador pode querer usar proxies para executar um experimento controlado em redes sociais. No entanto, dado o potencial de abuso nesses cenários, esperávamos que os serviços de coleta de dados os bloqueassem para usuários que não concluíram o processo KYC.

Como as marcas comunicam os domínios que bloqueiam
  • Bright Data lista categorias de domínios restritos em sua política de uso aceitável.
Respeitar as preferências dos sites em relação à coleta automatizada de dados

O que é robots.txt?

O robots.txt é um nome de arquivo para implementar o Robots Exclusion Protocol. Esse protocolo é usado por sites para indicar partes do site que o proprietário prefere que os bots não visitem. A adesão ao robots.txt é voluntária.

Prós e contras de seguir o robots.txt

  • Respeita as preferências do site.
  • Pode não ter sido atualizado recentemente e, portanto, estar desatualizado.
  • Geralmente inclui termos que indicam que o proprietário do site prefere que certas seções públicas do site não sejam acessadas por bots.

O robots.txt também pode fornecer acesso desigual aos bots. Por exemplo, os proprietários de sites podem indicar que não preferem que bots de mecanismos de resposta visitem certas URLs que os bots de mecanismos de busca visitam.

O robots.txt não é um documento legal e pode solicitar o bloqueio do acesso de bots a páginas que são legalmente:

  • autorizadas a serem raspadas (ex.: dados públicos) ou
  • não autorizadas a serem raspadas (ex.: dados atrás de um login, onde os ToC do proprietário do site proíbem a raspagem desses dados).

Os provedores de serviços de coleta de dados web podem solicitar que usuários de proxy residencial concluam um processo KYC e comprovem que têm um caso de uso legal e ético antes que esses usuários possam ignorar o robots.txt.

Para o teste, enviamos solicitações para páginas em subpastas que são solicitadas a serem bloqueadas pelo robots.txt. Os domínios que usamos foram aimultiple.com e 5 domínios da web entre os 100 domínios mais visitados. Bright Data bloqueou essas solicitações:

Exemplo da CNN

O robots.txt da CNN bloqueia a pasta /terms14 . Para o teste, navegamos até essa pasta com proxies residenciais e recebemos 200 mensagens com os dados da página de todos os provedores, exceto Bright Data. A resposta da Bright Data é: “Falha residencial (bad_endpoint): o site solicitado não está disponível para o modo de acesso residencial imediato (sem KYC), de acordo com o robots.txt. Para obter acesso residencial completo para segmentar este site, preencha o formulário KYC: https://brightdata.com/cp/kyc.

Gestão de abusos

Descrevemos uma metodologia para avaliar as práticas de gestão de abuso dos fornecedores e coletamos dados para cumprir nossos critérios de avaliação:

* Não aplicável: Zyte compra proxies de outros provedores de proxy e, portanto, quando o serviço da Zyte é usado para abuso, os proprietários de sites entrariam em contato com os provedores de proxy dela, e não com a Zyte.

Embora todos os fornecedores ofereçam meios para 3rd parties ou seus clientes entrarem em contato, ter esses itens é importante para a resolução de problemas:

  • Política pública de abuso
  • Um endereço de e-mail dedicado para denunciar abuso
  • Um método de contato alternativo (ex.: formulário web ou interface de mensagens) que permita aos denunciantes entrar em contato com a empresa. Isso é útil porque os e-mails podem ser filtrados e talvez não cheguem à caixa de entrada.
  • Capacidade de resposta às mensagens

3 provedores no benchmark (Bright Data) forneceram um e-mail para denúncia de abuso. Todos esses provedores também descreveram suas políticas nessa área.

Esperamos que todos os outros provedores façam o mesmo e que isso se torne uma prática generalizada do setor no curto prazo.

Por fim, avaliamos a capacidade de resposta da gestão de abusos enviando denúncias de abuso por e-mail de domínios de terceiros (ou seja, não-AIMultiple) e medindo os tempos de resposta. Se não encontrássemos um endereço de e-mail de abuso, enviávamos ao formulário de contato geral. Testamos isso em 3 lotes de e-mails enviados em:

  • Sexta-feira, 2 de maio de 2025, de:
    • Um serviço de venda de ingressos com ~30k de tráfego mensal
    • Um escritório de advocacia com ~1k de tráfego mensal em
  • 17 de maio de 2025, do serviço de venda de ingressos.
  • 24 de maio de 2025, de uma agência de mídias sociais com tráfego online limitado.

Os primeiros e-mails enviados em 2 de maio de 2025 foram para empresas que forneceram e-mails dedicados. Depois, expandimos nossa lista e incluímos endereços de e-mail mais gerais listados nas seções de contato de todos os serviços de coleta de dados web avaliados. Se uma empresa respondeu aos nossos e-mails, paramos de enviar novos e-mails.

Em nossos e-mails, mencionamos que nossos sites receberam tráfego suspeito de bots por meio de proxies e pedimos apoio para identificar a origem dos proxies. Conseguimos que todas as equipes de conformidade, exceto uma, nos respondessem. Quase todas as respostas foram recebidas no mesmo dia.

Transparência de uso

Os proprietários de sites que fornecem dados web e serviços de coleta web historicamente não tinham troca de dados sobre as atividades de coleta. Para limitar as atividades de rastreamento, os proprietários de sites podiam:

  • Entrar em contato com serviços de coleta de dados web para denunciar abuso
  • Trabalhar com provedores de gestão de bots, como Cloudflare, para tornar o rastreamento mais desafiador.

Agora, há iniciativas para uma troca de dados mais estruturada entre essas partes. A Bright Data lançou o Bright Data Webmaster console para que webmasters monitorem as atividades de rastreamento em seus sites. Mais transparência provavelmente melhorará as práticas de coleta de dados web.

Nossa experiência com o console do Webmaster

Nós nos cadastramos verificando a propriedade do domínio e adicionando um arquivo collectors.txt no domínio.

Agora temos acesso à atividade de bots da Bright Data em nosso site:

Benchmark: Fornecimento ético

* Avaliações nessas plataformas de 3rd party foram incluídas: Amazon Appstore, App Store, Google Play Store, Trustpilot. Por conveniência, esse valor foi calculado para 5 aplicativos principais da Bright Data, não para todos os 120 aplicativos exibidos no site da empresa.

Transparência de parceiros

A largura de banda exigida pelas empresas de infraestrutura de dados web pode ser fornecida de maneira ética por meio de benefícios (ex.: pagamentos, recursos como a capacidade de pular anúncios) em troca do consentimento para compartilhar a conexão de internet. No entanto, também é possível obter acesso não autorizado aos sistemas de usuários de varejo e vender suas conexões.

Os provedores de infraestrutura de dados web podem formular políticas e processos, executar auditorias externas e publicar sua abordagem e os resultados das auditorias para criar transparência sobre como adquirem suas conexões de internet. Isso pode fomentar a confiança no fornecimento ético de seus serviços.

Criamos uma estrutura para transparência do lado da oferta em dados web e avaliamos os fornecedores usando essa estrutura. Aplicamos essa estrutura independentemente de o serviço de coleta de dados web ter adquirido IPs residenciais diretamente ou por meio de outros proxies. Nosso objetivo é trazer transparência para toda a cadeia de suprimentos de IPs, já que práticas antiéticas podem surgir em qualquer ponto da cadeia de suprimentos.

Aqui você encontra nossos resultados detalhados:

Bright Data

Bright Data é classificada como Nível 5, pois publica

  • Sua abordagem de fornecimento e como os desenvolvedores de aplicativos podem trabalhar com eles por meio de seu SDK15 16
  • Detalhes sobre 120 fornecedores foram compartilhados publicamente. Pudemos verificar as avaliações desses fornecedores em plataformas de 3rd party para estimar o quão populares são. 17

Revisão dos aplicativos selecionados

Bright Data compartilha 120 aplicativos em seu site. Aplicativos como o Bright VPN são certificados por 3rd parties em relação à divulgação e UX.18 Também baixamos esses aplicativos para vê-los em mais detalhes:

  • Bright VPN
  • EarnApp
  • Sling Kong

Formulário de opt-in com obrigação de não coletar dados pessoalmente identificáveis: Formulário de consentimento com explicação clara de

Bright VPN:

Earn App:

Tela do aplicativo móvel EarnApp com o título 'Como ganhar?', explicando que manter o app aberto no Wi-Fi permite que a Bright Data use a conexão para indexar sites públicos, com pagamento via PayPal, Wise ou cartões-presente da Amazon. Uma ilustração mostra uma mão segurando um celular em modo de espera com moedas flutuando ao lado. As seções Coleta de Dados e Privacidade abaixo afirmam que nenhum dado pessoal é necessário ou coletado.

Sling Kong:

  • O usuário recebe a oferta durante o jogo:
Oferta do jogo móvel Sling Kong exibida durante a partida: o jogador recebe 500 moedas do jogo por permitir que a indexação web da Bright Data use os recursos livres e o endereço IP do dispositivo.
  • Opt-in:
A mesma oferta de opt-in do Sling Kong de 500 moedas em troca de permitir a indexação web da Bright Data, seguida por uma segunda captura da mesma tela escurecida conforme uma sobreposição de informações adicionais começa a aparecer.
  • Informações adicionais durante o opt-in:
Tela de opt-in do Sling Kong escurecida atrás de um pop-up de informações afirmando que a Bright Data não rastreia o usuário, mas o endereço IP será usado para apoiar pesquisas acadêmicas, ajudar marcas a rastrear vendedores de produtos falsificados, coletar dados públicos da web, como preços e avaliações de produtos, e agregar informações de viagens, como voos e preços de hotéis.
  • Opt-out:
Configuração de Indexação Web no jogo Sling Kong, mostrando um botão liga/desliga ao lado de um botão Info.Diálogo de confirmação do Sling Kong informando que o usuário optou com sucesso por sair da Indexação Web e pode optar por entrar novamente a qualquer momento, com um botão OK.

Valor fornecido pelos aplicativos:

  • Bright VPN: Serviço de VPN gratuito
  • EarnApp: Pagamentos
  • Sling Kong: Moeda virtual dentro do jogo
Outros

Embora a maioria dos provedores esteja ciente da ética no web scraping e tenha publicado sobre o tema (ex.: 19 , não identificamos seus compromissos específicos nessa frente, exceto pela Zyte.20

Esperamos que isso mude e que a maioria dos provedores passe para pelo menos o Nível 1 no curto prazo.

Certificação externa

* Indica que a empresa obteve todas as certificações externas nesta categoria

É crucial que os fornecedores tenham os sistemas, pessoal e processos adequados para proteger os dados dos clientes e proteger os aplicativos que fornecem seus IPs. Veja nossa metodologia de medição de certificação externa para entender a lógica por trás da nossa pontuação.

Conformidade com GDPR e CCPA

Todos os fornecedores declaram publicamente estar em conformidade com as duas regulamentações de privacidade de dados. Portanto, isso não foi incluído na pontuação.

Como medimos as maturidades organizacionais

Com base nas capacidades que identificamos nesse domínio, verificamos a existência desses certificados em cada provedor usando suas declarações públicas:

  • Certificação de segurança de dados e certificação PII: 21 22 23 24
  • Fonte de IP na lista de permissões: 25
  • Práticas éticas avaliadas: 26

Alguns provedores que não possuem certificados ISO 27018 alegaram que deveriam ser considerados certificados porque usam provedores de serviços em nuvem que possuem certificados ISO 27018. A opinião do nosso consultor de cibersegurança foi que, embora isso facilitasse a obtenção do certificado, eles ainda precisariam ter suas políticas e controles certificados para obter o certificado.

Cobertura de seguro

3 empresas de coleta de dados web compartilharam seus certificados de seguro. Não publicamos os certificados, mas revisamos os documentos para garantir que

  • eles cobrissem essas 2 categorias de seguro
  • o limite de seguro em cada categoria seja pelo menos na escala de vários milhões em US$.

Alianças do setor e dados web éticos

Existem 2 grandes alianças do setor:

  • Alliance for Responsible Data Collection incluindo Bright Data, Common Crawl e outros
  • Ethical Web Data Collection Initiative (EWDCI) que inclui Oxylabs, ProxyEmpire, Zyte, entre outros. Ela costumava incluir NetNut até a NetNut foi encerrada pelo FBI, de modo que a participação em uma aliança do setor não impediu que empresas violassem a lei.
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Avisos e recomendações para os próximos passos

Todos os provedores deste benchmark, exceto a Nimble, são clientes da AIMultiple. Como sempre, seguimos nossos compromissos éticos durante esta pesquisa.

Concluímos uma revisão exaustiva da coleta ética de dados web e, embora estejamos satisfeitos com o escopo deste benchmark, gostaríamos de aumentar sua participação. Agradecemos a estas empresas por compartilhar sua cobertura de seguro: Apify, Bright Data, Zyte.

Estamos aguardando respostas da Nimble. Atualizaremos o relatório assim que tivermos mais informações deles. 2 fornecedores optaram por não participar desta edição do benchmark. Estamos sempre atualizando este relatório se alguma dessas 7 empresas sugerir mudanças baseadas em fatos, justas para todos os fornecedores e que ajudem as empresas a tomar melhores decisões.

A NetNut estava entre as empresas que avaliamos quando publicamos este relatório pela primeira vez em 2025. Ela tinha a pontuação mais baixa possível (Nível 0) em nosso aprofundamento de fornecimento ético, no qual examinamos as fontes de IPs desses provedores. A NetNut foi encerrada em 2026, depois que o FBI identificou seus vínculos com botnets.27 Esperamos que isso seja um incentivo para que todos os fornecedores sejam transparentes sobre sua forma de fornecimento.

Este é o primeiro relatório com foco em dados web éticos, de acordo com nossa pesquisa. Esperamos que essa transparência ajude o setor de dados web a encontrar soluções criativas para seus desafios. Essas soluções precisarão equilibrar os interesses dos coletores de dados web, usuários de automação web, proprietários de sites e usuários residenciais que fornecem seus IPs ao setor.

Limitações da metodologia

Este benchmark mede indicadores de maturidade observáveis, incluindo controles de uso pelo cliente, transparência no fornecimento de IP, certificações externas e compartilhamento de seguro. No entanto, a pontuação não determina totalmente se um provedor é legalmente compatível em todos os casos de uso do cliente.

Portanto, uma pontuação alta no benchmark deve ser tratada como insumo para a devida diligência de compras, não como garantia de legalidade ou uso ético.

Referências

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Cem Dilmegani (2026) - "Benchmark de Dados Web Éticos e em Conformidade". Publicado on-line em AIMultiple.com. Acessado em 4 Agosto 2026, em: https://aimultiple.com/web-scraping-ethics [Recurso on-line]

Dilmegani, C. (2026, 4 Agosto). Benchmark de Dados Web Éticos e em Conformidade. AIMultiple. https://aimultiple.com/web-scraping-ethics

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Benchmark de Dados Web Éticos e em Conformidade}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/web-scraping-ethics}},
  note   = {AIMultiple. Acessado em 4 Agosto 2026}
}

Links de referência

1.
Workers Fainted at Nike Clothing Factory Despite a Vow to Reform — ProPublica
ProPublica
2.
2023 MOVEit data breach - Wikipedia
Contributors to Wikimedia projects
3.
https://www.courthousenews.com/wp-content/uploads/2024/01/starbucks-labor-rights-violations-suit.pdf
4.
Verifying Device
5.
Court Rules in Favor of Bright Data in Meta v. Bright Data Case - Bright Data
Bright Data
6.
Popa: From Sourcing to Distribution | Synthient
Synthient
7.
‘Popa’ Botnet Linked to Publicly-Traded Israeli Firm – Krebs on Security
8.
https://media.defense.gov/2024/Sep/18/2003547016/-1/-1/0/CSA-PRC-LINKED-ACTORS-BOTNET.PDF
9.
Internet Crime Complaint Center (IC3) | Home Internet Connected Devices Facilitate Criminal Activity
10.
A Look at the Residential Proxy Market | Intel 471
Website
11.
Satori Threat Intelligence Alert: PROXYLIB and LumiApps Transform Mobile Devices into Proxy Nodes - HUMAN Security
HUMAN Security
12.
Kimwolf Botnet Lurking in Corporate, Govt. Networks – Krebs on Security
13.
Subscribe to read
Financial Times
14.
https://edition.cnn.com/robots.txt
15.
Ethically Sourcing Residential Proxies | Bright Data
Bright Data
16.
homepage - Bright SDK
Bright SDK
17.
How Bright Data Obtains Its Residential IPs - Bright Data
Bright Data
18.
Bright VPN Compliance with guidelines - Google Sheets
19.
What is ethical scraping and how do you do it?
Apify Blog
20.
Web Scraping Data Compliance | Zyte
21.
Page not found - Bright Data
Bright Data
22.
Security | Platform | Apify Documentation
23.
Nimble Trust Center | Security, Compliance & Reliability
24.
Trust Center | Zyte
25.
Bright SDK Compliance with Guidelines - Google Sheets
26.
pwc-report - Bright Data
Bright Data
27.
FBI Seizes NetNut Proxy Platform, Popa Botnet – Krebs on Security
Cem Dilmegani
Cem Dilmegani
Analista Principal
Cem tem sido o analista principal do AIMultiple desde 2017. O AIMultiple informa centenas de milhares de empresas (de acordo com o similarWeb), incluindo 60% das empresas da Fortune 500 todos os meses.

O trabalho de Cem foi citado por publicações globais de destaque, incluindo Business Insider, Forbes, Washington Post, empresas globais como Deloitte, HPE e ONGs como o Fórum Econômico Mundial e organizações supranacionais como a Comissão Europeia.

Ao longo de sua carreira, Cem atuou como consultor de tecnologia, comprador de tecnologia e empreendedor de tecnologia. Ele aconselhou empresas em suas decisões de tecnologia na McKinsey & Company e na Altman Solon por mais de uma década. Ele também publicou um relatório da McKinsey sobre digitalização.

Ele liderou a estratégia de tecnologia e aquisições de uma empresa de telecomunicações, reportando-se ao CEO. Ele também liderou o crescimento comercial da empresa de tecnologia profunda Hypatos, que alcançou uma receita recorrente anual de 7 dígitos e uma avaliação de 9 dígitos partindo do zero em 2 anos. O trabalho de Cem na Hypatos foi coberto por publicações de tecnologia de destaque como TechCrunch e Business Insider.

Cem fala regularmente em conferências internacionais de tecnologia. Ele se formou na Universidade Bogazici como engenheiro de computação e possui um MBA pela Columbia Business School.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450