As regulamentações legais mudaram no mercado de web scraping. Embora os litígios antes se concentrassem no acesso não autorizado, novas ações judiciais relacionadas ao treinamento de IA e soluções técnicas alternativas estão moldando as práticas aceitáveis.
Aviso legal: Nosso trabalho tem finalidade informativa e não constitui aconselhamento jurídico; procure orientação jurídica profissional para orientações específicas.
O web scraping é legal?
O web scraping é legal se você extrair dados publicamente disponíveis na web. No entanto, a legalidade do web scraping depende de como, o quê e por que você está fazendo scraping.
Em 2026, as diretrizes da Comissão da UE esclareceram as regras para a extração de dados para treinamento de IA na Europa. Agora, os desenvolvedores são obrigados a respeitar opt-outs legíveis por máquina. 1
O web scraping pode ser legal quando você:
- Priorize a extração sem login: Extraia dados publicamente disponíveis de páginas da web acessíveis sem login, assinatura ou pagamento.
- Evite a evasão técnica: Respeite os termos de serviço do site, o arquivo robots.txt e as leis de direitos autorais.
- Esteja alinhado com as políticas de uso comercial: Garanta que sua intenção de scraping (por exemplo, indexação de busca vs. treinamento de IA models) esteja alinhada com as políticas de uso comercial do site. Casos como Reddit v. Anthropic estão atualmente definindo novos limites para o “uso justo” quando os dados são explicitamente extraídos para o desenvolvimento de IA.
- Cumpra as leis globais de privacidade: Não colete dados pessoais ou sensíveis, como nomes ou informações de contato, de maneira que viole as leis de privacidade, incluindo o Regulamento Geral sobre a Proteção de Dados (GDPR) e a Lei de Privacidade do Consumidor da Califórnia (CCPA).
Para saber mais sobre coleta ética de dados, confira nosso benchmark ético e em conformidade de dados web.
Últimas atualizações legais sobre web scraping
Embora o web scraping possa ser legal, ser alvo de scraping não é desejado pelas empresas. Se essas plataformas puderem demonstrar que ser alvo de scraping por um bot prejudica sua infraestrutura ou suas operações, essa atividade poderá ser considerada ilegal pelo tribunal.
Aqui, compilamos os processos judiciais mais significativos em que o tribunal decidiu a favor do site que sofreu scraping; esses casos, especialmente dos EUA.
Reddit vs. Perplexity AI e serviços de scraping
Tribunal: Tribunal Distrital dos EUA para o Distrito Sul de Nova York
Cronograma: Outubro de 2025 – Presente (Caso Ativo)
O Reddit processou o mecanismo de busca de IA Perplexity AI e três grandes provedores de scraping/proxy (SerpApi, Oxylabs, AWMProxy) por coleta de dados em escala industrial e evasão de barreiras técnicas. 2
Conflito:
O Reddit alega que os réus se envolveram em um esquema “estilo assalto a banco” para roubar conteúdo protegido por direitos autorais. Em vez de firmar acordos de licenciamento (como OpenAI e Google), Perplexity usou ferramentas especializadas de scraping para contornar as defesas do Reddit.
Argumentos jurídicos:
- Scraping indireto via Google: Os réus contornaram os bloqueios do próprio Reddit ao extrair o conteúdo Reddit diretamente dos Resultados de Pesquisa do Google (SERPs).
- Violações da DMCA: Diferentemente de casos anteriores de “dados públicos” (como hiQ), o Reddit está invocando a Seção 1201 do Digital Millennium Copyright Act (DMCA). Eles argumentam que os réus não “acessaram” os dados, mas contornaram deliberadamente “medidas tecnológicas” (limites de taxa, captchas e SearchGuard).
- Recusa de licenciamento: O Reddit destaca que, enquanto outras gigantes de IA pagam pelo acesso aos dados, a Perplexity aumentou seu volume de scraping em 40 vezes após receber uma carta de cessar e desistir, optando pela “evasão em vez da cooperação”.
Situação atual:
Até o final de 2025, o caso está em andamento e nenhuma decisão final foi proferida.
Reddit vs. Anthropic
Tribunal: Tribunal Superior da Califórnia em São Francisco
Cronograma: Final de 2025 – Presente (Litígio Ativo)
O Reddit processou a startup de IA Anthropic, acusando-a de usar ilegalmente dados de seus 100 milhões de usuários diários para treinar seus sistemas de IA.
Diferentemente de Google e OpenAI, que têm acordos de licenciamento pagos com o Reddit, a Anthropic supostamente se recusou a firmar um acordo. A equipe jurídica do Reddit argumenta que, sem um acordo formal, não há salvaguardas para garantir a proteção da privacidade dos usuários.
Situação atual:
Até o final de 2025, não houve decisão judicial final. O caso está atualmente na fase de discovery pré-julgamento. A Anthropic pediu a rejeição de partes do caso, argumentando que dados factuais não são protegidos por direitos autorais.
Caso Linkedin vs hiQ Labs
Tribunal: Tribunal Distrital dos EUA / Tribunal de Apelações do Nono Circuito
Cronograma: 2017–2022
O LinkedIn processou a hiQ Labs, uma empresa de análise de dados, por extrair perfis publicamente disponíveis para realizar uma análise de habilidades profissionais.3 Vários tribunais, incluindo a Suprema Corte, revisaram o caso:
- O tribunal inicialmente decidiu a favor da hiQ, decidindo que a extração de dados públicos não viola a Computer Fraud and Abuse Act (CFAA).4
- Em 2022, o Nono Circuito reafirmou isso, afirmando que acessar dados publicamente disponíveis sem autorização não é “acesso não autorizado” sob a CFAA.
O tribunal decidiu que as ações do LinkedIn para bloquear a hiQ eram lícitas. Apesar das considerações sobre a CFAA, violar os termos de serviço de um site pode resultar em consequências legais. As violações do acordo de usuário do LinkedIn pela hiQ desempenharam um papel significativo na sentença final.
Meta vs Bright Data
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Cronograma: 2023–2024
Tipo de caso: Ação cível envolvendo quebra de contrato e extração não autorizada de dados
Em janeiro de 2023, a Meta iniciou uma ação judicial contra a Bright Data, alegando que esta havia extraído ilegalmente dados das plataformas Facebook e Instagram da Meta. Curiosamente, a Bright Data contestou as alegações da Meta sobre seus direitos de extração de dados, levando ambas as partes ao tribunal.
O tribunal decidiu a favor da Bright Data, considerando insuficientes as provas para demonstrar que a Bright Data havia extraído dados não públicos ou acessado dados enquanto logada em contas de usuários. Em fevereiro de 2024, a Meta decidiu desistir das alegações restantes contra a Bright Data.5
A Meta (Facebook/Instagram) proíbe toda coleta automatizada de dados?
Se você leu os termos de uso do Instagram, provavelmente viu a cláusula que afirma que ‘a extração por meios automatizados é proibida’.
No entanto, a realidade jurídica é mais complexa. No caso histórico Meta v. Bright Data (2024), o tribunal decidiu que, se você estiver extraindo dados públicos sem estar logado, os termos da Meta não se aplicam necessariamente, porque você nunca assinou um contrato ao fazer login.
Muitos sites incluem um aviso ‘termos do Facebook, coleta automatizada de dados, extração proibida’. Mas, como visto nas recentes atualizações legais sobre web scraping, os tribunais estão cada vez mais distinguindo entre dados atrás de uma barreira de login e dados disponíveis na web aberta.
X Corp., anteriormente Twitter vs Bright Data
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Cronograma: 2023–em andamento
Tipo de caso: Acesso não autorizado a dados sob estatutos de fraude informática, violações de propriedade intelectual
Em julho de 2023, a X Corp. entrou com uma ação judicial contra a Bright Data, alegando que a Bright Data violou seus termos de serviço ao extrair e vender grandes quantidades de dados da plataforma X. 6A ação judicial na Califórnia tratava do acesso da Bright Data a dados públicos no Twitter.
O caso foi arquivado, e o juiz decidiu que a X não conseguiu alegar plausivelmente que a Bright Data havia violado seu acordo de usuário. O tribunal considerou que os termos de serviço não poderiam impedir a extração de dados, uma vez que a X Corp não era a proprietária do conteúdo e, portanto, não poderia fazer valer seus direitos autorais.
Ser proprietária do conteúdo usuário invalidaria a proteção de porto seguro da X Corp, que permite que as empresas de mídia social se distanciem da violação de direitos autorais e de outros crimes cometidos por seus usuários. Portanto, os tribunais novamente decidiram a favor de uma parte que coletou dados públicos de uma rede social.
Caso eBay vs Bidder’s Edge
Tribunal: Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia
Cronograma: 1999–2000
Tipo de caso: Ação cível por violação de propriedade sobre bens móveis, na qual o eBay acusou a Bidder’s Edge de extrair ilegalmente dados de seu site usando bots automatizados de coleta de dados.
A Bidder’s Edge (BE), um site de comparação de preços on-line, usou ferramentas de web scraping para agregar listagens de leilões de várias plataformas, incluindo o eBay, sem permissão. O eBay alegou que os bots automatizados da BE causaram uso não autorizado de seus sistemas.
A ordem judicial impedia a Bidger’s Edge de extrair novamente o conteúdo eBay. O principal argumento vencedor do eBay foi que a Bidger’s Edge estava sobrecarregando o sistema deles e que outras empresas que seguissem a Bidger’s Edge poderiam causar mais danos ao sistema do eBay.
Caso Facebook vs Power Ventures
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Posteriormente, houve recurso para o Tribunal de Apelações dos EUA para o Nono Circuito
Cronograma: 2008–2017
Tipo de caso: Ação cível sob a CFAA e a lei anti-hacking da Califórnia, com o Facebook alegando acesso não autorizado à sua plataforma.
Em 2009, o Facebook processou a Power Ventures por extrair conteúdo dos sites enviados por seus usuários. Este conjunto de exemplos é para um caso em que o web scraping foi avaliado do ponto de vista da propriedade intelectual. O tribunal decidiu a favor do Facebook e ordenou uma penalidade financeira para a Power Ventures.7
Regulamentações mais recentes sobre web scraping por país
Estados Unidos
Situação legal: A extração de dados publicamente disponíveis é considerada legal.
Não há leis federais contra o web scraping nos Estados Unidos, desde que os dados extraídos estejam publicamente disponíveis e a atividade de scraping não prejudique o site que está sendo alvo de scraping. Há uma lei específica de 2016 contra a compra de um número excessivo de ingressos de uma só vez usando bots para evitar mercados negros.8
União Europeia e Reino Unido
Situação legal: Na UE e no Reino Unido, o web scraping de conteúdo publicamente disponível, não pessoal e não protegido por direitos autorais é legal, mas a extração de dados pessoais sem base legal é proibida sob o GDPR.
A UE aprovou recentemente a Lei de Serviços Digitais, que visa colocar todos os países da UE sob o Mercado Único Digital, compartilhando as mesmas regulamentações. De acordo com os Artigos 3.º e 4.º desse regulamento, a “reprodução de conteúdo publicamente disponível” não é ilegal.9 10
Essa regulamentação aborda o tema sob a perspectiva da propriedade intelectual e, desnecessário dizer, consideraria ilegal qualquer web scraping que envolva dados pessoais sob o GDPR. Fora isso, a situação é semelhante à dos EUA nos mercados da UE e no Reino Unido.
O que fazer e o que não fazer no web scraping legal e ético
Do ponto de vista jurídico, uma pergunta que as empresas devem se fazer é se seus atos de scraping prejudicam o site que está sendo alvo de scraping. Se a atividade de scraping:
- É intensa demais, o que pode interromper os serviços do site extraído
- Os dados extraídos forem usados para duplicar a atividade ou o serviço desse site, mesmo que não existam regulamentações.
O site teria motivos para entrar com uma ação judicial contra o scraper.
Do ponto de vista ético, dado que o web scraping tem muitos casos de uso e provedores profissionais no mercado, não há vergonha em usá-lo para fins comerciais. Existem práticas recomendadas técnicas de web scraping que reduzirão a carga de tráfego no site alvo da extração, tais como:
- Usar as APIs do site em vez de web scraping, quando disponíveis.
- Integrar web scrapers com servidores proxy.
- Usar navegadores headless.
Desde que você encontre um web scraper confiável para trabalhar ou garanta que seus recursos técnicos considerem esses pontos, você pode defender seu web scraping como ético para seus fins comerciais.
O que fazer:
- Extraia os dados de que você precisa definindo o caso de negócio exato e personalizando sua tecnologia de web crawler de acordo. Isso minimizará o risco de sobrecarregar o site alvo da extração com tráfego indesejado.
- Sempre leia os termos de uso do site que sofre scraping. Além dos termos de uso comercial, os sites também têm um arquivo robots.txt que especifica permissões para o conteúdo site. Sua solução de web crawling ou especialistas técnicos devem ajudá-lo a cumprir essas permissões.
- Seja transparente sobre seu web scraping e esteja pronto para explicar seu processo de scraping para assegurar a outros que sua abordagem é legal e ética.
O que não fazer:
- Não sobrecarregue o site alvo da extração com muita frequência e com coletas muito extensas. Isso também aumentará a probabilidade de o site extraído bloquear seu crawler.
- Não colete informações de identificação pessoal ou, se o robots.txt permitir a coleta, garanta que você mascare os dados para minimizar a exposição durante o processamento.
- Não exponha os dados extraídos ao público. Certifique-se de que eles sejam armazenados com segurança, como os dados da sua própria empresa. Você nunca sabe para quais finalidades eles poderão ser usados se vazarem.
Organizações para web scraping ético
Empresas líderes em infraestrutura de dados web formaram associações para alinhar seu setor e as partes interessadas sobre o uso ético do web scraping. Essas associações são:
- Alliance for Responsible Data Collection, que inclui Bright Data e Common Crawl, entre outras partes interessadas.
- Ethical Web Data Collection Initiative (EWDCI), que inclui Oxylabs, ProxyEmpire, Zyte, entre outros.
A extração de dados para treinamento de IA é legal?
O status legal da extração de dados depende do tipo de dados, de sua localização e dos métodos usados para acessá-los. Muitas leis relevantes estão sendo interpretadas e estabelecidas pelos tribunais.
Por exemplo, nos Estados Unidos, os tribunais decidiram que extrair dados publicamente acessíveis sem exigir login ou contornar medidas de segurança não viola a Computer Fraud and Abuse Act (CFAA). Casos como hiQ v. LinkedIn, Meta v. Bright Data e Van Buren v. Estados Unidos confirmam que a extração de dados públicos não viola a CFAA.
No entanto, violar os termos de serviço de um site ou extrair dados atrás de barreiras de login ainda pode gerar responsabilidade. O método de acesso é fundamental, pois fazer login ou contornar barreiras técnicas muda significativamente a análise jurídica.
Perguntas frequentes
Se os termos de serviço (ToS) de um site proibirem explicitamente a extração, o acesso ou a coleta de dados desse site por meios automatizados, isso pode constituir uma violação desses termos.
Por exemplo, nos Estados Unidos, o acesso não autorizado a um sistema de computador pode ser crime federal sob a Computer Fraud and Abuse Act (CFAA). Você pode entrar em contato com o proprietário do site para solicitar permissão ou usar as APIs oficiais para acessar os dados.
Não por si só. Os tribunais tratam as violações dos termos de serviço como uma questão contratual civil, não como crime. No entanto, uma violação pode fundamentar alegações de quebra de contrato e reforçar alegações sob outras leis, especialmente após aviso explícito, como uma notificação de cessar e desistir.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{karatas2026,
author = {Karatas, Gulbahar},
title = {{O web scraping é legal? Leis e melhores práticas}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/is-web-scraping-legal}},
note = {AIMultiple. Acessado em 2 junho 2026}
}Registro de alterações
2 atualizaçõesAdicionada a seção "O scraping de dados para treinar IA é legal?" e as diretrizes da UE nas FAQs.
Comentários 1
Compartilhe suas ideias
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.
Thank you for the great and well-written articles. Can you write an article explaining the limits and/ or usefulness of using a website’s APIs rather than web scraping, when available. Instagram & TikTok website APIs for example are limited to what type of data can be extracted. My understanding is that not everything can be scrapped using their websites API. Looking forward to your response. Thank you.