Serviços
Contate-nos
Avaliação em Mundo Aberto

Arquivo da web APIs: 4 principais fornecedores testados e comparados

Nazlı Şipi
Nazlı Şipi
atualizado em 10 ago. 2026

Um arquivo da web mantém páginas que foram coletadas antes de você solicitá-las, para que você possa extraí-las sem rastrear os sites por conta própria. O que cada fornecedor armazena, e quanto disso entregará, varia bastante.

Testamos 4 deles com consultas de exemplo para ver como funcionam e o que retornam.

Comparação de recursos das APIs de arquivo da web

  • HTML bruto disponível: marcação da página como o servidor a enviou. Os termos do Webz.io mencionam “as páginas HTML completas”, mas o arquivo retorna um campo text e não concede direitos aos arquivos brutos.
  • Entrega em massa para o seu próprio armazenamento: uma seleção filtrada gravada em um destino que você controla. O corpus do Common Crawl fica em S3 público para você baixar; nada é enviado para lugar nenhum. O Webz.io entrega somente por meio de sua API.
  • Ao vivo raspagem do mesmo fornecedor: cobre a família de produtos, não apenas o endpoint de arquivo, então responde se um único fornecedor pode cobrir páginas arquivadas e nunca arquivadas. A Exa é a única em que o fallback fica dentro da mesma chamada.

Preço e créditos gratuito

Bright Data cobra US$ 0.2 por 1.000 páginas para dados das últimas 24 horas e US$ 1 por 1.000 para qualquer coisa mais antiga. A Exa cobra US$ 7 por 1.000 buscas além do preço por página; portanto, localizar 1.000 páginas antes de recuperá-las acrescenta cerca de US$ 0.70, o que faz os dois valores idênticos de US$ 1 se comportarem de maneira diferente na prática.

Créditos gratuitos cobrem a entrega de dados: a consulta é gratuito nos quatro, então a diferença é se os créditos gratuito também pagam para extrair os dados. O Bright Data permite 100 buscas no arquivo por dia sem custo, cada uma retornando a contagem de registros correspondentes e o preço de entrega antes de qualquer cobrança, para que um trabalho possa ser dimensionado gratuito. O Webz.io funciona da mesma forma, com uma amostra gratuito e uma estimativa de custo, mas um dump exige créditos pré-pagos adquiridos separadamente. O Common Crawl e a Exa permitem que créditos gratuito paguem pela recuperação real.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Arquivamento da web APIs

Bright Data Web Archive API vende acesso a páginas que sua infraestrutura já coletou por meio do Unlocker e das SERP APIs. Em vez de executar um rastreador, você descreve o que deseja com filtros, analisa uma estimativa de custo e recebe as páginas correspondentes em seu próprio armazenamento.

Filtros

Tudo passa por um objeto filters com 20 campos: intervalo de tempo, domínio, padrão de URL, categoria, idioma, país e resultado da coleta. O tempo é obrigatório, e a categoria é uma lista fechada de 30 valores; portanto, as páginas são classificadas na entrada.

Dois campos descrevem como a página foi coletada, em vez do que ela contém. ip_country filtra pelo país do IP de saída que coletou a página, confirmando que o arquivo é um subproduto da rede de proxy. captcha e robots_block retornam apenas registros em que um CAPTCHA foi acionado ou uma regra de robots se aplicou; portanto, tentativas bloqueadas são armazenadas em vez de descartadas.

Busca e custo

A busca é gratuito, até 100 consultas por dia, e a resposta traz tudo o que você precisa para dimensionar um trabalho antes de pagar: a contagem de registros correspondentes, o custo estimado de entrega e uma divisão mostrando quantas páginas estão na camada de cache de 24 horas em comparação com a camada de arquivo.

  • Cobertura de sites que bloqueiam rastreadores: o Common Crawl mantém zero páginas de zillow.com em um rastreamento mensal inteiro. O Bright Data retornou 13.282 registros para uma única janela de 24 horas.
  • A velocidade da consulta varia com a janela: uma consulta de 240 dias em redfin.com retornou 59.831 registros em 1 minuto e 53 segundos. A consulta de 24 horas em zillow.com retornou em 10.8 segundos.
  • Duas camadas de armazenamento: dados das últimas 24 horas custam US$ 0.2 por 1.000 páginas. Qualquer coisa mais antiga vai para o S3 Glacier Deep Archive por US$ 1 por 1.000. O tempo de entrega acompanha: nosso trabalho de 24 horas chegou em cerca de 30 segundos, enquanto o trabalho de 240 dias permaneceu em restoring_archive_data por dezenas de minutos.
  • Entrega para seu próprio armazenamento: Amazon S3, Azure Blob Storage, Google Cloud Storage ou webhook. Testamos o caminho do webhook; dez páginas chegaram como um único tar com um .html.gz e um .meta.json por página.
  • Amostra antes de se comprometer: max_entries limita quantos arquivos uma entrega inclui; portanto, uma consulta de 59.831 registros pode ser amostrada com dez páginas por uma fração de centavo.

Obtenha 100 gratuito buscas de arquivo por dia com Bright Data

Obter acesso gratuito

O que há de fato nos arquivos

Cada página chega como o servidor a enviou, com nove campos de metadados: domain, url, timestamp, language, category, ip_country, content_type, charset e status_code. Para verificar se esse HTML bruto é utilizável sem um navegador, abrimos dez páginas arquivadas do Zillow, removemos scripts e tags e procuramos no texto restante os campos de anúncio.

Common Crawl é uma organização sem fins lucrativos que publica um rastreamento da web aberta aproximadamente uma vez por mês e o distribui gratuitamente. Não há conta, nem chave, nem cota. A contrapartida é que você recebe arquivos em vez de um serviço: nada é entregue a você, e qualquer coisa além de uma consulta de uma única página exige executar seu próprio processamento.

Escolhendo um formato

Cada rastreamento vem em vários formatos. As respostas HTTP brutas carregam o HTML original. Um extrato de metadados carrega links, títulos e cabeçalhos como JSON. Uma versão em texto simples carrega o texto do artigo sem marcação. Dois conjuntos menores cobrem arquivos robots.txt e respostas não 200.

A escolha importa porque é de mão única. O texto simples é muito menor e mais rápido de trabalhar, mas tags, atributos e JSON-LD incorporado são removidos dele; portanto, a extração estruturada precisa começar a partir do conjunto bruto.

Não há entrega filtrada. Você escolhe um formato, baixa o que precisa e processa por conta própria.

Encontrando uma página

Existem dois mecanismos, e eles respondem a perguntas diferentes. O servidor CDX lida com consultas de uma única URL por meio de um formulário da web ou de uma API. O índice colunar, publicado como Parquet, lida com perguntas em massa por meio de SQL.

A interface CDX pede duas coisas: qual rastreamento mensal pesquisar, a partir de uma lista que remonta a 2008, e um padrão de URL.

Os resultados retornam como JSON, uma linha por captura. Três campos importam mais do que os demais: o nome do arquivo WARC, um deslocamento em bytes e o comprimento do registro.

Duas coisas são visíveis na saída. A mesma URL aparece várias vezes com timestamps diferentes; portanto, um único rastreamento mensal não é um único instantâneo. E respostas com falha são armazenadas separadamente, com redirecionamentos e erros em uma pasta crawldiagnostics, em vez de junto às coletas bem-sucedidas.

Extraindo uma página sem baixar o arquivo em que ela está

O nome do arquivo, o deslocamento e o comprimento permitem solicitar um único registro com um cabeçalho HTTP Range. Testamos isso em uma página de anúncio da Redfin.

A consulta CDX retornou em menos de um segundo, e a busca por intervalo de bytes levou 0.38 segundos para 210 KB. Todos os sete campos de anúncio que procuramos, incluindo preço, quartos e endereço, estavam presentes no HTML bruto sem nenhum JavaScript executado.

Filtragem em massa com SQL

Para qualquer coisa maior do que uma única URL, o índice colunar é o caminho. É Parquet, pode ser consultado via HTTPS e expõe 33 colunas que cobrem URL, host, TLD, idioma, tipo MIME, status de coleta e timestamp.

Consultas em um único shard de 7.29 milhões de linhas retornaram em bem menos de um segundo cada, sem nada gravado em disco. Um detalhe que vale saber antes de usar: os shards são indexados por um nome de host invertido; portanto, cada arquivo contém uma fatia alfabética estreita, em vez de uma amostra aleatória. Consultar um shard arbitrário em busca de um domínio específico normalmente não retornará nada.

Quanto ele mantém para um determinado domínio

Consultamos o índice para dois domínios, redfin.com e zillow.com, localizando o shard que cobre cada um e contando suas linhas.

redfin.com retornou 14.406 páginas, todas HTTP 200. zillow.com não retornou nenhuma. Isso não é cobertura parcial nem uma coleta com falha; o domínio não está no índice. O Common Crawl respeita o robots.txt; portanto, um site que proíbe seu rastreador fica ausente, em vez de escassamente representado.

Extraímos uma página arquivada de cada um de oito sites grandes e medimos quanto texto sobrevivia sem um navegador. Dois deles não tinham nenhuma página HTML utilizável no arquivo. Entre os demais, a maioria era renderizada no servidor, incluindo Airbnb e Walmart. O TripAdvisor foi a exceção, retornando uma página de 18 KB que continha 282 caracteres de texto visível.

Custo e licença

Os dados são gratuito e o bucket de armazenamento fica aberto sem uma conta. O que você paga é computação e largura de banda; por isso, recomenda-se processar na mesma região de nuvem dos dados.

A licença não é uma licença de dados abertos. O Common Crawl concede uma licença limitada ao serviço, afirma que não pode licenciar o conteúdo das páginas em si e exige que os usuários o indenizem contra alegações decorrentes do uso do conteúdo “em conexão com inteligência artificial, aprendizado de máquina ou outras tecnologias semelhantes”. A responsabilidade total é limitada a US$ 100.

Webz.io vende acesso a um arquivo de artigos de notícias, posts de blog, tópicos de fórum e avaliações que coleta desde 2008. O que ele retorna não é a página, mas um registro processado: o texto do artigo, além de entidades extraídas, pontuações de sentimento, contagens de engajamento social e metadados do site. Qualquer coisa com mais de cerca de 30 dias fica no produto de arquivo; material mais recente é servido pelas APIs de News, Blogs e Forums.

O construtor de consultas

As consultas combinam uma expressão booleana sobre o texto com condições em nível de campo, unidas por AND. Cada condição é construída a partir de uma propriedade, um operador e um valor.

Um detalhe que vale saber antes de usar: o operador rotulado Equals não exige uma correspondência exata. Inserimos redfin no campo de título do site, e ele correspondeu a um site cujo título é “Redfin Real Estate News”.

O que retorna

Cada resultado traz o texto completo junto com entities, sentiment, social, categories, language, domain_rank, country e um objeto syndication que registra se a mesma história apareceu em outro lugar. Não há campo de HTML bruto. A página do produto descreve o que você recebe como “o texto integral de cada artigo, post, tópico ou avaliação”, e a entrega é “via API ou executando uma consulta você mesmo”.

  • O arquivo contém publicadores, não sites de listagem. Pesquisar por Redfin retornou o blog de notícias corporativas da Redfin, hospedado em convesio.cloud, em vez de páginas de redfin.com. Consultar diretamente o campo de domínio do site por redfin.com não retornou nada, enquanto convesio.cloud e yahoo.com retornaram resultados; portanto, a resposta vazia reflete cobertura, e não uma consulta quebrada.
  • A coleta em massa é restringida por contrato. Os termos de serviço proíbem um filtro asterisco que pega tudo e filtros verticais como site_type:news ou language:english, que são exatamente os formatos de consulta que um comprador de corpus usaria. A própria interface sugere adicionar site_type:news para restringir uma busca.
  • A documentação do arquivo é inexistente. Existem quatro páginas na navegação de docs, cobrindo dumps de dados, limites, construção de datasets e a referência da API. Cada uma contém um cabeçalho e nada mais.

Exa construiu seu próprio índice da web e vende busca sobre ele. A empresa relata mais de 500 bilhões de URLs. Para esta comparação, a parte relevante não é o endpoint de busca, mas /contents, que retorna o texto de uma página do cache do Exa, em vez de buscá-la ao vivo.

Opções de cache ou ao vivo

Um único parâmetro controla isso. maxAgeHours definido como 24 significa usar a cópia em cache se ela tiver menos de um dia; caso contrário, rastreia. Definido como 0, ele sempre rastreia. Definido como -1, ele nunca rastreia, retornando apenas o que já está armazenado. O valor máximo aceito é 720 horas; portanto, o parâmetro não pode referenciar nada com mais de 30 dias.

Executamos duas solicitações com o limite de idade definido como seis meses. A primeira pediu uma página de cidade da Redfin.

Ela retornou CRAWL_NOT_FOUND após 7.07 segundos. A segunda pediu a página inicial da Redfin.

Ele retornou o conteúdo completo da página em 0.010 segundos. Dez milissegundos é menos do que uma viagem de ida e volta na rede; portanto, essa resposta veio do armazenamento, não de uma coleta. O cache é real, e a falha de sete segundos foi o Exa procurando e não encontrando.

Dois outros padrões são visíveis na mesma tela. O conteúdo é limitado a 20.000 caracteres, e “apenas conteúdo principal” está ativado; portanto, navegação e textos padronizados são removidos pela lógica do próprio Exa, e não pela sua.

A cobertura é irregular no nível da página

A página inicial estava em cache; a página da cidade de San Francisco não estava. Pesquisar o domínio mostra por que isso não é uma simples questão de presença ou ausência.

A consulta retornou a página inicial da Redfin, uma página “Houses For Sale Near Me” e uma página da cidade de Wichita; portanto, páginas profundas realmente existem no índice. A cobertura é dispersa em um domínio, em vez de completa ou vazia.

Limitações

A mesma tela traz a frase que separa o Exa dos arquivos nesta comparação: “Número de resultados: 10. Máximo: 100. Entre em contato para mais resultados.”

Não há contagem total. O Common Crawl respondeu a essa pergunta com uma consulta SQL, e o Bright Data respondeu com um campo files_count.

Sem exportação em massa, sem entrega para seu próprio armazenamento, sem firehose. O nível Enterprise menciona índices personalizados, que são índices sob medida servidos pela API, em vez de dados entregues.

Qual se encaixa em qual tarefa

Esses quatro produtos não são substitutos. A questão não é qual é o melhor, mas qual responde à pergunta que você tem.

  • HTML bruto em escala, incluindo sites que bloqueiam rastreadores. O Bright Data é o único aqui que grava uma seleção filtrada no armazenamento que você controla e o único que mantém páginas de domínios que proíbem rastreadores.
  • Um corpus amplo sem custo, se você tiver capacidade de engenharia. O Common Crawl oferece rastreamentos completos em WARC, enumeráveis com SQL, e não pede nada além de sua própria computação. O processamento é seu para construir.
  • Texto de notícias, blogs e fóruns com entidades e sentimento já extraídos. O Webz.io retorna registros processados em vez de páginas, o que elimina o trabalho de extração, mas também remove a marcação.
  • Contexto de página no momento da consulta, para um agente ou um pipeline de RAG. O Exa retorna texto em cache em milissegundos e recorre a uma coleta ao vivo quando uma página não está armazenada, na mesma chamada.
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Como testamos APIs de arquivo da web

Trabalhamos dentro de cada produto, em vez de a partir de sua documentação. Cada fornecedor foi operado primeiro por meio de seu próprio console ou playground e, depois, por sua API, para que pudéssemos ver a solicitação que a interface gera e o que retorna antes de qualquer cobrança.

Para cada um, criamos uma consulta, executamos e lemos a resposta bruta, em vez do resumo renderizado. Quando o produto retornava uma contagem, uma estimativa de custo ou um objeto de status, registramos esses campos diretamente. Quando oferecia uma amostra ou uma entrega, nós a pegávamos, descompactávamos os arquivos e os abríamos.

Pequenos scripts cuidaram das partes que exigiam repetição ou cronometragem: buscar um único registro em um arquivo de vários terabytes, descompactar um pacote entregue e procurar campos específicos no HTML bruto, consultar um índice colunar com SQL e medir quanto tempo uma resposta em cache leva em comparação com uma que precisa ser rastreada. Esses scripts estão vinculados ao lado dos resultados que produziram.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Nazlı Şipi (2026) - "Arquivo da web APIs: 4 principais fornecedores testados e comparados". Publicado on-line em AIMultiple.com. Acessado em 10 Agosto 2026, em: https://aimultiple.com/web-archive-api [Recurso on-line]

Şipi, N. (2026, 10 Agosto). Arquivo da web APIs: 4 principais fornecedores testados e comparados. AIMultiple. https://aimultiple.com/web-archive-api

@misc{sipi2026,
  author = {Şipi, Nazlı},
  title  = {{Arquivo da web APIs: 4 principais fornecedores testados e comparados}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/web-archive-api}},
  note   = {AIMultiple. Acessado em 10 Agosto 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 15 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 2 arquivos CSV.

Última atualização: 17 Agosto 2026
Baixar
Nazlı Şipi
Nazlı Şipi
Pesquisadora de IA
Nazlı é analista de dados na AIMultiple. Ela tem experiência anterior em análise de dados em vários setores, onde trabalhou na transformação de datasets complexos em insights acionáveis.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450