Os regulamentos legais mudaram no mercado de web scraping. Embora os litígios já tenham se concentrado no acesso não autorizado, novas ações judiciais relacionadas ao treinamento de IA e soluções técnicas alternativas estão moldando as práticas aceitáveis.
Aviso Legal: Nosso trabalho tem fins informativos e não constitui aconselhamento jurídico; procure aconselhamento jurídico profissional para orientação específica.
O web scraping é legal?
O web scraping é legal se você raspar dados publicamente disponíveis na web. No entanto, a legalidade do web scraping depende de como, o quê e por que você está raspando.
Em 2026, as diretrizes da Comissão da UE esclareceram as regras para a raspagem de dados para treinamento de IA na Europa. Agora, os desenvolvedores são obrigados a respeitar as exclusões voluntárias legíveis por máquina. 1
O web scraping pode ser legal quando você:
- Prioriza a raspagem sem login: Raspa dados publicamente disponíveis de páginas da web acessíveis sem login, assinatura ou pagamento.
- Evita a evasão técnica: Respeita os termos de serviço do site, o arquivo robots.txt e as leis de direitos autorais.
- Alinha-se com as políticas de uso comercial: Garante que sua intenção de raspagem (por exemplo, indexação de pesquisa vs. treinamento de modelo de IA) esteja alinhada com as políticas de uso comercial do site. Casos como Reddit v. Anthropic estão atualmente definindo novos limites para o "Uso Justo" quando os dados são explicitamente raspados para desenvolvimento de IA.
- Cumpre as leis globais de privacidade: Não coleta dados pessoais ou sensíveis, como nomes ou informações de contato, de uma maneira que viole as leis de privacidade, incluindo o Regulamento Geral de Proteção de Dados (GDPR) e a Lei de Privacidade do Consumidor da Califórnia (CCPA).
Para saber mais sobre coleta ética de dados, confira nosso benchmark de dados web éticos e em conformidade.
Atualizações legais mais recentes sobre web scraping
Embora o web scraping possa ser legal, ser raspado não é desejado pelas empresas. Se essas plataformas puderem mostrar que serem raspadas por um bot danifica sua infraestrutura ou operações, essa atividade pode ser considerada ilegal pelo tribunal.
Aqui, compilamos os processos judiciais mais significativos em que o tribunal ficou do lado do site raspado; esses casos, especialmente dos EUA.
Reddit vs. Perplexity IA e serviços de raspagem
Tribunal: Tribunal Distrital dos EUA para o Distrito Sul de Nova York
Cronograma: Outubro de 2025 – Presente (Caso Ativo)
O Reddit processou o mecanismo de busca de IA Perplexity IA e três grandes provedores de raspagem/proxy (SerpApi, Oxylabs, AWMProxy) por coleta de dados em escala industrial e evasão de barreiras técnicas. 2
Conflito:
O Reddit alega que os réus se envolveram em um esquema "estilo assalto a banco" para roubar conteúdo protegido por direitos autorais. Em vez de firmar acordos de licenciamento (como OpenAI e Google), Perplexity usou ferramentas de raspagem especializadas para contornar as defesas do Reddit.
Argumentos legais:
- Raspagem indireta via Google: Os réus contornaram os bloqueios do próprio Reddit raspando o conteúdo Reddit diretamente dos Resultados de Pesquisa do Google (SERPs).
- Violações da DMCA: Ao contrário de casos anteriores de "dados públicos" (como hiQ), o Reddit está invocando a Lei de Direitos Autorais do Milênio Digital (DMCA) Seção 1201. Eles argumentam que os réus não "acessaram" os dados, mas contornaram propositalmente "medidas tecnológicas" (limites de taxa, captchas e SearchGuard).
- Recusa em licenciar: O Reddit destaca que, enquanto outros gigantes da IA pagam pelo acesso aos dados, Perplexity aumentou seu volume de raspagem em 40 vezes após receber uma carta de cessação e desistência, escolhendo "evasão em vez de cooperação".
Situação atual:
Até o final de 2025, o caso está em andamento e nenhuma decisão final foi emitida.
Reddit vs. Anthropic
Tribunal: Tribunal Superior da Califórnia em São Francisco
Cronograma: Final de 2025 – Presente (Litígio Ativo)
O Reddit processou a startup de IA Anthropic, acusando-a de usar ilegalmente dados de seus 100 milhões de usuários diários para treinar seus sistemas de IA.
Ao contrário do Google e da OpenAI, que têm acordos de licenciamento pagos com o Reddit, Anthropic supostamente se recusou a firmar um acordo. A equipe jurídica do Reddit argumenta que, sem um acordo formal, não há barreiras de proteção para garantir as proteções de privacidade do usuário.
Situação atual:
Até o final de 2025, não houve decisão judicial final. O caso está atualmente na fase de descoberta pré-julgamento. Anthropic moveu uma moção para que partes do caso fossem arquivadas, argumentando que dados factuais não são protegidos por direitos autorais.
Caso Linkedin vs hiQ Labs
Tribunal: Tribunal Distrital dos EUA / Tribunal de Apelações do Nono Circuito
Cronograma: 2017–2022
O LinkedIn processou a hiQ Labs, uma empresa de análise de dados, por raspar perfis publicamente disponíveis para realizar uma análise de habilidades profissionais.3 Vários tribunais, incluindo a Suprema Corte, revisaram o caso:
- O tribunal inicialmente ficou do lado da hiQ, decidindo que raspar dados públicos não viola a Lei de Fraude e Abuso de Computadores (CFAA).4
- Em 2022, o Nono Circuito reafirmou isso, declarando que acessar dados publicamente disponíveis sem autorização não é "acesso não autorizado" sob a CFAA.
O tribunal decidiu que as ações do LinkedIn para bloquear a hiQ eram lícitas. Apesar das considerações da CFAA, violar os termos de serviço de um site pode resultar em consequências legais. As violações do acordo de usuário do LinkedIn pela hiQ desempenharam um papel significativo no julgamento final.
Meta vs Bright Data
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Cronograma: 2023–2024
Tipo de Caso: Ação civil envolvendo quebra de contrato e raspagem de dados não autorizada
Em janeiro de 2023, Meta iniciou uma ação judicial contra Bright Data, alegando que havia extraído ilegalmente dados das plataformas Facebook e Instagram da Meta. Curiosamente, Bright Data contestou as alegações da Meta sobre seus direitos de raspagem de dados, levando ambas as partes ao tribunal.
O tribunal decidiu a favor da Bright Data, não encontrando evidências suficientes para mostrar que a Bright Data havia raspado dados não públicos ou acessado dados enquanto logada em contas de usuário. Em fevereiro de 2024, Meta decidiu retirar as reivindicações restantes contra Bright Data.5
Meta (Facebook/Instagram) proíbe toda coleta automatizada de dados?
Se você leu os termos de uso do Instagram, provavelmente viu a cláusula que afirma que 'a raspagem por meios automatizados é proibida'.
No entanto, a realidade jurídica é mais complexa. No importante caso Meta v. Bright Data (2024), o tribunal decidiu que, se você estiver raspando dados públicos enquanto estiver deslogado, os termos da Meta não se aplicam necessariamente porque você nunca assinou um contrato ao fazer login.
Muitos sites incluem um aviso de 'termos do Facebook, coleta automatizada de dados, raspagem proibida'. Mas, como visto em atualizações legais recentes sobre web scraping, os tribunais estão cada vez mais distinguindo entre dados atrás de um muro de login e dados disponíveis na web aberta.
X Corp., anteriormente Twitter vs Bright Data
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Cronograma: 2023–em andamento
Tipo de Caso: Acesso não autorizado a dados sob estatutos de fraude informática, violações de propriedade intelectual
Em julho de 2023, a X Corp. entrou com uma ação judicial contra Bright Data, alegando que Bright Data violou seus termos de serviço ao raspar e vender grandes quantidades de dados da plataforma X. 6 A ação legal na Califórnia era sobre o acesso da Bright Data a dados públicos no Twitter.
O caso foi arquivado, e o juiz decidiu que a X não conseguiu alegar de forma plausível que Bright Data havia violado seu acordo de usuário. O tribunal considerou que os termos de serviço não poderiam impedir a raspagem de dados, uma vez que a X Corp não era a proprietária do conteúdo e, portanto, não poderia fazer valer seus direitos autorais.
Ser proprietário do conteúdo usuário invalidaria a proteção de porto seguro da X Corp, que permite que as empresas de mídia social se distanciem de violações de direitos autorais e outros crimes cometidos por seus usuários. Portanto, os tribunais novamente decidiram a favor de uma parte que coletou dados públicos de uma rede social.
Caso eBay vs Bidder's Edge
Tribunal: Tribunal Distrital dos Estados Unidos para o Distrito Norte da Califórnia
Cronograma: 1999–2000
Tipo de caso: Ação civil por violação de propriedade móvel, na qual o eBay acusou a Bidder's Edge de raspar ilegalmente seu site usando bots automatizados de coleta de dados.
A Bidder's Edge (BE), um site de comparação de preços online, usou ferramentas de web scraping para agregar listagens de leilões de várias plataformas, incluindo o eBay, sem permissão. O eBay alegou que os bots automatizados da BE causaram uso não autorizado de seus sistemas.
A ordem judicial impedia a Bidger's Edge de raspar o conteúdo eBay novamente. O principal argumento que o eBay ganhou foi que a Bidger's Edge estava sobrecarregando seu sistema, e que outros seguindo a Bidger's Edge poderiam causar mais danos ao sistema do eBay.
Caso Facebook vs Power Ventures
Tribunal: Tribunal Distrital dos EUA para o Distrito Norte da Califórnia
Posteriormente, foi apelado para o Tribunal de Apelações dos EUA para o Nono Circuito
Cronograma: 2008–2017
Tipo de Caso: Ação civil sob a CFAA e a lei anti-hacking da Califórnia, com o Facebook alegando acesso não autorizado à sua plataforma.
Em 2009, o Facebook processou a Power Ventures por raspar conteúdo dos sites enviados por seus usuários. Este exemplo serve para um caso em que o web scraping foi avaliado do ponto de vista da propriedade intelectual. O tribunal ficou do lado do Facebook e ordenou uma penalidade fiscal para a Power Ventures.7
Regulamentações mais recentes sobre web scraping por país
Estados Unidos
Situação Legal: O web scraping de dados publicamente disponíveis é considerado legal.
Não há leis federais contra o web scraping nos Estados Unidos, desde que os dados raspados estejam publicamente disponíveis e a atividade de raspagem não prejudique o site que está sendo raspado. Existe uma lei específica de 2016 contra a compra de um número excessivo de ingressos de uma só vez usando bots para evitar mercados negros.8
União Europeia e Reino Unido
Situação Legal: Na UE e no Reino Unido, o web scraping de conteúdo publicamente disponível, não pessoal e não protegido por direitos autorais é legal, mas raspar dados pessoais sem uma base legal é proibido sob o GDPR.
A UE aprovou recentemente a Lei de Serviços Digitais, que visa reunir todos os países da UE sob o Mercado Único Digital, compartilhando os mesmos regulamentos. De acordo com os Artigos 3º e 4º deste regulamento, a "reprodução de conteúdo publicamente disponível" não é ilegal.9 10
Este regulamento aborda o tópico de uma perspectiva de propriedade intelectual e, desnecessário dizer, consideraria ilegal qualquer web scraping envolvendo dados pessoais sob o GDPR. Além disso, a situação é semelhante à dos EUA nos mercados da UE e do Reino Unido.
O que fazer e o que não fazer no web scraping legal e ético
Do ponto de vista legal, uma pergunta que as empresas devem se fazer é se seus atos de raspagem prejudicam o site raspado. Se a atividade de raspagem:
- For muito intensa, podendo interromper os serviços do site raspado
- Os dados raspados forem usados para duplicar a atividade ou serviço desse site, mesmo que não existam regulamentações.
O site teria motivos para entrar com uma ação judicial contra o raspador.
Do ponto de vista ético, dado que o web scraping tem muitos casos de uso e provedores profissionais no mercado, não há vergonha em usá-lo para fins comerciais. Existem práticas recomendadas técnicas de web scraping que aliviarão a carga de tráfego no site raspado, como:
- Usar as APIs do site em vez de web scraping, quando disponíveis.
- Integrar web scrapers com servidores proxy.
- Usar navegadores headless.
Contanto que você encontre um web scraper confiável para trabalhar ou garanta que seus recursos técnicos considerem isso, você pode defender seu web scraping como ético para seus fins comerciais.
O que fazer:
- Raspe os dados de que você precisa definindo o caso de negócio exato e personalizando sua tecnologia de web crawler de acordo. Isso minimizará o risco de sobrecarregar o site raspado com tráfego indesejado.
- Sempre leia os termos de uso do site raspado. Além dos termos de uso comerciais, os sites também possuem um arquivo robots.txt que especifica permissões para o conteúdo site. Sua solução de web crawling ou especialistas técnicos devem ajudá-lo a cumprir essas permissões.
- Seja transparente sobre seu web scraping e esteja pronto para explicar seu processo de raspagem para garantir aos outros que sua abordagem é legal e ética.
O que não fazer:
- Não sobrecarregue o site raspado com muita frequência e com extrações muito extensas. Isso também aumentará a probabilidade de o site raspado bloquear seu crawler.
- Não colete informações de identificação pessoal, ou se o robot.txt permitir que você as colete, certifique-se de mascarar os dados para minimizar a exposição durante o processamento.
- Não exponha os dados raspados ao público. Certifique-se de que estejam armazenados com segurança, como os dados da sua própria empresa. Nunca se sabe para quais finalidades eles podem ser usados se vazarem.
Organizações para web scraping ético
Empresas líderes em infraestrutura de dados da web formaram associações para alinhar seu setor e partes interessadas sobre o uso ético do web scraping. Essas associações são:
- Alliance for Responsible Data Collection, que inclui Bright Data e Common Crawl entre outras partes interessadas.
- Ethical Web Data Collection Initiative (EWDCI), que inclui Oxylabs, ProxyEmpire, Zyte, entre outros.
A raspagem de dados para treinamento de IA é legal?
A situação legal da raspagem de dados depende do tipo de dados, sua localização e os métodos usados para acessá-los. Muitas leis relevantes estão sendo interpretadas e estabelecidas pelos tribunais.
Por exemplo, nos Estados Unidos, os tribunais decidiram que raspar dados publicamente acessíveis sem exigir um login ou contornar medidas de segurança não viola a Lei de Fraude e Abuso de Computadores (CFAA). Casos como hiQ v. LinkedIn, Meta v. Bright Data e Van Buren v. Estados Unidos confirmam que raspar dados públicos não viola a CFAA.
No entanto, violar os termos de serviço de um site ou raspar dados atrás de muros de login ainda pode gerar responsabilidade. O método de acesso é crítico, pois fazer login ou contornar barreiras técnicas altera significativamente a análise jurídica.
Perguntas frequentes
Se os termos de serviço (ToS) de um site proíbem explicitamente a raspagem, o acesso ou a coleta de dados desse site por meios automatizados, fazê-lo pode constituir uma violação desses termos.
Por exemplo, nos Estados Unidos, o acesso não autorizado a um sistema de computador pode ser um crime federal sob a Lei de Fraude e Abuso de Computadores (CFAA). Você pode entrar em contato com o proprietário do site para solicitar permissão ou usar as APIs oficiais para acessar os dados.
Não por si só. Os tribunais tratam as violações dos termos de serviço como uma questão de contrato civil, não uma ofensa criminal. No entanto, uma violação pode apoiar reivindicações de quebra de contrato e fortalecer reivindicações sob outras leis, particularmente após notificação explícita, como uma carta de cessação e desistência.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{karatas2026,
author = {Karatas, Gulbahar},
title = {{O Web Scraping é Legal? Leis e Melhores Práticas}},
year = {2026},
month = jun,
howpublished = {\url{https://aimultiple.com/is-web-scraping-legal}},
note = {AIMultiple. Acessado em 2 Junho 2026}
}
Comentários 1
Compartilhe suas ideias
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.
Thank you for the great and well-written articles. Can you write an article explaining the limits and/ or usefulness of using a website’s APIs rather than web scraping, when available. Instagram & TikTok website APIs for example are limited to what type of data can be extracted. My understanding is that not everything can be scrapped using their websites API. Looking forward to your response. Thank you.