Realizámos dois benchmarks em websites reais, de 5 a 5.000 pedidos simultâneos. O primeiro enviou 260.000 pedidos através de quatro desbloqueadores web pelos 10.000 domínios do topo do Tranco, mais um teste de extração de markdown em 10.000 URLs. O segundo recolheu 65.000 páginas de produto e pesquisa de cada um dos cinco fornecedores de scraping em 100 domínios de comércio eletrónico.
Benchmark de scrapers de comércio eletrónico
Métricas explicadas
Taxa de sucesso verificada pelo conteúdo: a proporção de pedidos que devolveram o conteúdo esperado, confirmado através de um seletor CSS ou de um campo JSON estruturado que transporta os dados alvo. Uma página de bloqueio, um captcha ou uma casca vazia pontuaram zero, mesmo com um código HTTP 200.
Tempo de resposta mediano (P50): o pedido típico, em segundos, no eixo horizontal. A dica de contexto também indica o P90, os 10% de pedidos mais lentos.
Concorrência: o número de pedidos em voo ao mesmo tempo, selecionável através dos botões de filtro. O nível de 5.000 pressiona os limites de taxa e os tetos ao nível da conta do fornecedor, em vez da qualidade da extração.
Média: ao longo deste artigo, a média do comércio eletrónico é a média dos níveis de concorrência de 5 e 100. O nível de 5.000 está excluído porque dois dos cinco fornecedores o executaram.
Os detalhes de preços e as taxas de sucesso para páginas de produto e pesquisa estão no benchmark de scrapers de comércio eletrónico.
Benchmark de desbloqueadores web
Métricas explicadas
Tempo médio de conclusão: a média aritmética do tempo de ponta a ponta para pedidos bem-sucedidos, em segundos, no eixo horizontal. O gráfico de comércio eletrónico usa uma mediana no seu eixo horizontal, e este usa uma média, pelo que os dois eixos transportam estatísticas diferentes.
Os resultados da extração de markdown, a tabela de preços e as análises por fornecedor estão no benchmark de desbloqueadores web.
Resultados do benchmark de scraping em grande escala
Em 100 domínios de comércio eletrónico, a taxa de sucesso verificada pelo conteúdo mais elevada foi de 76.0% e a mais baixa de 59.4%, ambas médias dos níveis de concorrência de 5 e 100. Nos 10.000 domínios do topo do Tranco, os quatro desbloqueadores variaram entre 88% e 94%. São testes separados contra conjuntos alvo diferentes, tipos de página diferentes e conjuntos de fornecedores diferentes, pelo que os dois intervalos não se combinam numa só pontuação.
O sucesso atinge o pico nos 100 pedidos simultâneos
Todos os fornecedores no benchmark de comércio eletrónico obtiveram pontuações mais elevadas com 100 pedidos simultâneos do que com 5: Bright Data de 73.7% para 78.3%, Zyte de 71.1% para 73.0%, Apify de 67.7% para 72.5%, Nimble de 56.6% para 67.3%, Decodo de 55.6% para 63.1%. No benchmark de desbloqueadores, Bright Data atingiu o pico nos 500 pedidos simultâneos com 95% e Zyte nos 500 com 93%.
O declínio atinge os 5.000, com Bright Data a cair para 71.0% e Nimble para 56.0%. Portanto, a curva tem uma banda média em vez de uma inclinação monótona, e um scraper ajustado para uma configuração de baixa concorrência produz uma taxa de sucesso mensurável. O mecanismo não é algo que estes benchmarks isolem. Tanto as execuções de 5 pedidos como as de 5.000 pedidos usaram os mesmos URLs e a mesma validação, pelo que a diferença reside no comportamento do lado do fornecedor que os testes observaram, e não em explicações.
As páginas de listagem falham mais frequentemente do que as páginas de produto
Todos os cinco fornecedores de comércio eletrónico devolveram o conteúdo esperado com menos frequência nas páginas de pesquisa e listagem do que nas páginas de produto. A diferença vai de 4.6 pontos na Zyte a 14.9 pontos na Decodo.
As páginas de produto contêm um único item com campos estruturados como título, preço, SKU e imagens. As páginas de pesquisa e listagem devolvem muitos itens de uma consulta ou categoria, frequentemente paginados e renderizados após o HTML inicial. Para um plano de rastreamento, semear a partir de um sitemap de produtos ou de um conjunto de IDs de produto produz uma taxa mais próxima da página de produto do que paginar através dos resultados de pesquisa.
O tempo de resposta mediano não prevê a cauda
Zyte registou uma mediana mais longa do que a Bright Data, 20.9s contra 16.2s, e uma cauda mais curta, 52s contra 62s. A cauda da Apify atingiu 116s contra uma mediana de 45.7s, e a da Decodo 23s contra 7.0s.
Um timeout por pedido definido a partir da mediana corta, portanto, uma fatia de tráfego diferente em cada fornecedor do que um definido a partir do P90. Uma página que excedeu o timeout também tem um custo, uma vez que os pedidos falhados contam para o gasto, mas não para o total de páginas.
Dois fornecedores concluíram uma execução com 5.000 pedidos simultâneos
No benchmark de comércio eletrónico, a Bright Data manteve 71% e a Nimble 56% com 5.000 pedidos paralelos. Os outros fornecedores estavam limitados pela concorrência ao nível da conta ou pelos tetos de crédito a essa carga, e não pela capacidade de scraping, pelo que não é publicado nenhum resultado para eles nesse nível. No benchmark de desbloqueadores, a Bright Data apresenta um resultado de concorrência de 5.000 com 92% e a Nimble com 88%. Não é publicado nenhum valor de concorrência de 5.000 para a Zyte ou para a Firecrawl.
Os scrapers dedicados cobrem no máximo 59 dos 100 domínios
Os fornecedores diferem na forma como extraem os dados. Alguns fornecem um scraper pré-construído por marketplace que devolve os campos estruturados do site, outros aplicam um motor a qualquer site.
No catálogo mais amplo do conjunto, 41 dos 100 domínios ainda recorrem a um motor universal. Uma lista alvo fixa acarreta, portanto, trabalho de cauda longa em todos os fornecedores testados, o que é um argumento para verificar uma lista de domínios específica face ao catálogo de scrapers de um fornecedor antes de assinar. As contagens de campos de metadados provêm de dois fornecedores e descrevem esses dois produtos, e não os dois modos de extração em geral.
Que camada corresponde à lista alvo
Três camadas situam-se entre um scraper e um site alvo, e a lista alvo decide qual delas faz o trabalho.
Uma API de scraper devolve campos analisados para um site que já suporta. Um desbloqueador web devolve a página e deixa a análise para o chamador. Proxies residenciais devolvem uma ligação e deixam tanto o tratamento anti-bot como a análise para o chamador. Navegadores de scraping situam-se ao lado da camada de desbloqueio, acrescentando controlo programático do navegador para páginas que necessitam de interação.
Uma lista alvo fixa e conhecida é o caso que o benchmark de comércio eletrónico mede. Tal lista contém domínios que mudam raramente, tipos de página por site que vale a pena aprender e uma atualização recorrente. Os scrapers dedicados compensam aqui na medida em que o catálogo cobre a lista, o que a tabela de cobertura acima limita a 59 dos 100 domínios. O restante necessita de um caminho de motor universal planeado desde o início.
Uma lista alvo aberta de cauda longa é o caso que o benchmark de desbloqueadores mede. Tal lista contém domínios não conhecidos antecipadamente, nenhum analisador por site que valha a pena escrever e um motor genérico emparelhado com extração genérica. O top 10.000 do Tranco é uma lista de popularidade geral, e não uma lista de sites obscuros, pelo que serve como proxy da heterogeneidade da lista alvo, e não da obscuridade da lista alvo.
O formato de saída atravessa ambos os casos. No teste de extração de markdown, os fornecedores devolveram texto limpo em vez de HTML bruto.
Teste de extração de markdown, 10.000 URLs. Todos os fornecedores presentes em ambos os testes registaram aqui uma taxa mais baixa do que no teste HTML, que foi executado em 260.000 pedidos sobre um conjunto de URLs diferente. A Exa aparece apenas neste teste porque não devolve documentos HTML brutos.
Modelos de linguagem de grande dimensão tratam agora da análise que antes necessitava de correspondência de padrões escrita à mão, e os fornecedores integram esse passo na sua oferta. A análise por LLM introduz o seu próprio modo de falha. Os campos analisados automaticamente precisam de ser testados contra valores conhecidos, porque um preço alucinado é lido como dados válidos. Ferramentas de web scraping com IA cobrem essa categoria.
Modos de falha em grande escala
Defesas anti-bot e páginas dinâmicas
Os sistemas anti-bot empilham reputação de IP, verificações de cabeçalhos de pedido, desafios JavaScript e portões de captcha, e uma página que monta o seu conteúdo após a execução de scripts acrescenta uma segunda superfície a limpar antes de qualquer extração ser executada.
Ultrapassar um desafio JavaScript significa executar uma sessão de navegador em vez de um pedido HTTP simples, e isso custa ao fornecedor cerca de 5 a 10 vezes mais computação. Como resultado, os fornecedores definem preços e ritmos diferentes para pedidos renderizados.
Concorrência ao nível da conta e tetos de crédito
Com 5.000 pedidos paralelos no benchmark de comércio eletrónico, três dos cinco fornecedores não devolveram nenhuma execução concluída. O limite relatado aí foi a concorrência ao nível da conta ou os tetos de crédito a essa carga, e não a capacidade de scraping.
Falhas silenciosas e precisão dos dados
O sucesso em ambos os benchmarks foi contado apenas quando o conteúdo esperado estava presente na resposta, verificado contra uma verdade de campo definida antes da execução. Um código HTTP 200 a transportar uma página de bloqueio, um captcha ou uma casca vazia pontuou zero, pelo que estes valores ficam abaixo do que uma contagem de códigos de estado produziria no mesmo tráfego. Uma pipeline que verifica apenas códigos de estado reporta sucesso enquanto recolhe páginas de bloqueio.
Risco legal
A recolha em grande escala atrai a atenção das equipas de segurança, e o litígio segue-se quando uma parte dela toca em dados atrás de um login ou dados pessoais. A Google processou a SerpApi por fazer scraping de conteúdo protegido por direitos de autor que aparecia nos seus resultados de pesquisa públicos.1 A legalidade do web scraping cobre as fronteiras com mais detalhe.
Metodologia do benchmark de scraping em grande escala
Metodologia dos desbloqueadores web
Quatro fornecedores, os 10.000 domínios do topo do Tranco, 260.000 pedidos, concorrência 5, 100, 500 e 5.000. Os domínios foram filtrados para remover servidores mortos, endpoints apenas de infraestrutura e sites sem conteúdo rastreável, e depois triados contra listas de bloqueio públicas, um limiar de autoridade de domínio e uma lista de palavras-chave. Avançaram os domínios que retinham pelo menos três URLs rastreáveis. As divisões de teste usaram conjuntos de URLs distintos e não sobrepostos.
O sucesso passou por uma validação faseada, começando com um pré-filtro de assinatura de página de bot, depois uma correspondência de seletor CSS de verdade de campo, depois correspondência de texto no corpo bruto e sem etiquetas, com fallbacks para nomes de classe com hash, escape de CSS utilitário e corrupção de codificação de caracteres. Um teste separado de extração de markdown cobriu 10.000 URLs. Aplica-se uma limitação. Não é publicado nenhum valor de concorrência de 5.000 para a Zyte ou para a Firecrawl.
Metodologia dos scrapers de comércio eletrónico
Cinco fornecedores, 100 domínios de comércio eletrónico, 65.000 páginas de produto e pesquisa cada, concorrência 5, 100 e 5.000. A média reportada é a média dos níveis de concorrência de 5 e 100, porque a Bright Data e a Nimble foram os dois fornecedores que concluíram uma execução completa com 5.000.
Os domínios foram selecionados dos 15 principais países por PIB, excluindo a Rússia e a China, mais líderes de categoria retirados das listas de categorias do SimilarWeb e do Semrush. Os URLs de produto vieram de sitemaps dos sites, rastreamentos de categorias e pesquisa restrita ao site, e os URLs de pesquisa de consultas geradas a partir dos nomes de categoria e slugs de produto do próprio domínio, na língua do próprio site. Cada URL foi descoberto sem ir buscar a página alvo através de um fornecedor benchmarked. Onde um fornecedor oferecia um scraper de comércio eletrónico dedicado para um domínio, esse scraper foi executado. Caso contrário, foi executado o desbloqueador geral do fornecedor. Todos os fornecedores correram a partir da mesma localização de servidor. O custo foi registado como gasto por 1.000 páginas de produto bem-sucedidas, com os pedidos falhados a contar para o gasto.
Fornecedores testados
O que é web scraping em grande escala?
Web scraping em grande escala é a recolha automatizada de dados web num volume em que a escolha da infraestrutura começa a ditar a arquitetura, em vez de a seguir.
As transições observáveis marcam o intervalo. A 10.000 pedidos por mês, os preços da lista de desbloqueadores vão de $0 na Exa e $7.50 na Bright Data a $99 na Firecrawl. A um milhão por mês, os mesmos fornecedores vão de $749 a $4.080. A 5.000 pedidos simultâneos, três dos cinco fornecedores de comércio eletrónico não produziram nenhuma execução concluída. O volume e a concorrência, e não a técnica de scraping, são o que muda a esta escala.
Conclusão
A taxa de sucesso verificada pelo conteúdo mais elevada medida em 100 domínios de comércio eletrónico foi de 76.0%, em média dos níveis de concorrência de 5 e 100, e a mais baixa de 59.4%. Nos 10.000 do topo do Tranco, os quatro desbloqueadores variaram entre 88% e 94%. Ambos os valores são contagens verificadas pelo conteúdo, que pontuam uma página de bloqueio devolvida com um código HTTP 200 como uma falha, pelo que ficam abaixo do que uma contagem de códigos de estado reporta no mesmo tráfego.
Para uma lista alvo fixa e conhecida, a Bright Data registou 76.0% de sucesso médio a $1.52 por 1.000 páginas de produto bem-sucedidas e scrapers dedicados para 59 dos 100 domínios. Para o tempo de resposta na mesma lista, a Decodo registou uma mediana de 7.0s e a Nimble 8.9s, com 59.4% e 62.0%. Para uma lista aberta de cauda longa, a Bright Data registou 94% com uma média de 5s, e a Firecrawl 88% a 4s. Para carga sustentada a 5.000 pedidos simultâneos, a Bright Data e a Nimble apresentam resultados publicados em ambos os benchmarks.
Leitura adicional
- Roteiro de Web Scraping: Insights de 30M Pedidos
- Benchmark de Scrapers de Comércio Eletrónico
- Desbloqueadores de Websites Comparados e Avaliados
- As Melhores APIs de Web Scraping Avaliadas
- Os Melhores e Mais Baratos Proxies Residenciais
- As Melhores Ferramentas de Web Scraping com IA
- Os Desafios Mais Comuns do Web Scraping
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{Web Scraping em Grande Escala: 7 Provedores Comparados}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/large-scale-web-scraping}},
note = {AIMultiple. Acessado em 30 Julho 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.