Abbiamo eseguito due benchmark su siti web live, da 5 a 5.000 richieste concorrenti. Il primo ha inviato 260.000 richieste attraverso quattro web unblocker sui primi 10.000 domini Tranco, più un test di estrazione markdown su 10.000 URL. Il secondo ha recuperato 65.000 pagine prodotto e di ricerca da ciascuno dei cinque fornitori di scraping su 100 domini di e-commerce.
Benchmark dello scraper e-commerce
Metriche spiegate
Tasso di successo verificato dal contenuto: la quota di richieste che ha restituito il contenuto previsto, confermato tramite un selettore CSS o un campo JSON strutturato contenente i dati target. Una pagina di blocco, un captcha o un guscio vuoto hanno ottenuto zero anche con uno stato HTTP 200.
Tempo di risposta mediano (P50): la richiesta tipica, in secondi, sull'asse orizzontale. Il tooltip riporta anche P90, il 10% più lento delle richieste.
Concorrenza: il numero di richieste in volo contemporaneamente, selezionabile tramite i pulsanti filtro. Il livello di 5.000 sollecita i limiti di velocità e i massimali a livello di account del fornitore piuttosto che la sua qualità di estrazione.
Media: in questo articolo, la media e-commerce è la media dei livelli di concorrenza 5 e 100. Il livello 5.000 è escluso perché due dei cinque fornitori lo hanno eseguito.
I dettagli sui prezzi e i tassi di successo per le pagine prodotto e di ricerca sono nel benchmark dello scraper e-commerce.
Benchmark dei web unblocker
Metriche spiegate
Tempo medio di completamento: il tempo medio aritmetico end-to-end per le richieste riuscite, in secondi, sull'asse orizzontale. Il grafico e-commerce riporta una mediana sull'asse orizzontale, mentre questo riporta una media, quindi i due assi presentano statistiche diverse.
I risultati dell'estrazione markdown, la tabella dei prezzi e le recensioni per fornitore sono nel benchmark dei web unblocker.
Risultati del benchmark di scraping su larga scala
Su 100 domini di e-commerce, il tasso di successo verificato dal contenuto più alto è stato del 76.0% e il più basso del 59.4%, entrambi mediati sui livelli di concorrenza 5 e 100. Sui primi 10.000 domini Tranco, i quattro unblocker sono variati dall'88% al 94%. Si tratta di test separati su insiemi di target diversi, tipi di pagina diversi e insiemi di fornitori diversi, quindi i due intervalli non si combinano in un unico punteggio.
Il successo raggiunge il picco a 100 richieste concorrenti
Ogni fornitore nel benchmark e-commerce ha ottenuto un punteggio più alto a 100 richieste concorrenti che a 5: Bright Data 73.7% a 78.3%, Zyte 71.1% a 73.0%, Apify 67.7% a 72.5%, Nimble 56.6% a 67.3%, Decodo 55.6% a 63.1%. Nel benchmark dei web unblocker, Bright Data ha raggiunto il picco a 500 richieste concorrenti con il 95% e Zyte a 500 con il 93%.
Il declino raggiunge 5.000, con Bright Data che scende al 71.0% e Nimble al 56.0%. Quindi la curva ha una fascia centrale anziché una pendenza monotona e uno scraper sintonizzato su un'impostazione a bassa concorrenza produce un tasso di successo misurabile. Il meccanismo non è qualcosa che questi benchmark isolano. Sia le esecuzioni a 5 richieste che a 5.000 richieste hanno utilizzato gli stessi URL e la stessa validazione, quindi la differenza risiede nel comportamento lato fornitore osservato dai test piuttosto che in spiegazioni.
Le pagine elenco falliscono più spesso delle pagine prodotto
Tutti e cinque i fornitori e-commerce hanno restituito il contenuto previsto meno spesso sulle pagine di ricerca ed elenco che sulle pagine prodotto. Il divario va da 4.6 punti con Zyte a 14.9 punti con Decodo.
Le pagine prodotto presentano un singolo articolo con campi strutturati come titolo, prezzo, SKU e immagini. Le pagine di ricerca ed elenco restituiscono molti articoli da una query o da una categoria, spesso impaginati e renderizzati dopo l'HTML iniziale. Per un piano di scansione, partire da una sitemap prodotto o da un insieme di ID prodotto restituisce un tasso più vicino a quello delle pagine prodotto piuttosto che paginare tra i risultati di ricerca.
La mediana dei tempi di risposta non prevede la coda
Zyte ha registrato una mediana più lunga di Bright Data, 20.9s contro 16.2s, e una coda più corta, 52s contro 62s. La coda di Apify ha raggiunto 116s contro una mediana di 45.7s, e quella di Decodo 23s contro 7.0s.
Un timeout per richiesta impostato sulla mediana taglia quindi una quota di traffico diversa per ciascun fornitore rispetto a uno impostato su P90. Una pagina in timeout comporta inoltre un costo, poiché le richieste fallite contano per la spesa ma non per il totale delle pagine.
Due fornitori hanno completato un'esecuzione a 5.000 richieste concorrenti
Nel benchmark e-commerce, Bright Data ha mantenuto il 71% e Nimble il 56% a 5.000 richieste parallele. Gli altri fornitori erano limitati dalla concorrenza a livello di account o dai limiti di credito a quel carico piuttosto che dalla capacità di scraping, quindi per loro non è pubblicato alcun risultato a quel livello. Nel benchmark dei web unblocker, Bright Data presenta un risultato a 5.000 richieste concorrenti al 92% e Nimble all'88%. Nessun dato a 5.000 richieste concorrenti è pubblicato per Zyte o Firecrawl.
Gli scraper dedicati coprono al massimo 59 dei 100 domini
I fornitori differiscono nel modo in cui estraggono i dati. Alcuni forniscono uno scraper predefinito per marketplace che restituisce i campi strutturati del sito, altri applicano un unico motore a qualsiasi sito.
Nel catalogo più ampio del gruppo, 41 dei 100 domini ricadono ancora su un motore universale. Un elenco di target fisso comporta quindi un lavoro a coda lunga presso ogni fornitore testato, il che è un argomento per verificare un elenco di domini specifico rispetto al catalogo degli scraper di un fornitore prima di sottoscrivere. I conteggi dei campi di metadati provengono da due fornitori e descrivono quei due prodotti, non le due modalità di estrazione in generale.
Quale strato corrisponde all'elenco target
Tre strati si trovano tra uno scraper e un sito target, ed è l'elenco target a decidere quale di essi svolge il lavoro.
Uno scraper API restituisce campi analizzati per un sito che già supporta. Un web unblocker restituisce la pagina e lascia l'analisi al chiamante. I proxy residenziali restituiscono una connessione e lasciano sia la gestione anti-bot che l'analisi al chiamante. I browser di scraping si affiancano allo strato unblocker, aggiungendo il controllo programmatico del browser per le pagine che richiedono interazione.
Un elenco di target fisso e noto è il caso misurato dal benchmark e-commerce. Tale elenco contiene domini che cambiano raramente, tipi di pagina per sito che vale la pena apprendere e un aggiornamento ricorrente. Gli scraper dedicati danno i loro frutti nella misura in cui il catalogo copre l'elenco, cosa che la tabella di copertura sopra delimita a 59 dei 100 domini. Per il resto è necessario pianificare sin dall'inizio un percorso con motore universale.
Un elenco di target aperto e a coda lunga è il caso misurato dal benchmark dei web unblocker. Tale elenco contiene domini non noti in anticipo, nessun parser per sito che valga la pena scrivere e un unico motore generico abbinato a un'estrazione generica. La top 10.000 di Tranco è una lista di popolarità generale piuttosto che un elenco di siti oscuri, quindi rappresenta l'eterogeneità dell'elenco target piuttosto che la sua oscurità.
Il formato di output attraversa entrambi i casi. Nel test di estrazione markdown, i fornitori hanno restituito testo pulito anziché HTML grezzo.
Test di estrazione markdown, 10.000 URL. Ogni fornitore presente in entrambi i test ha registrato un tasso inferiore qui rispetto al test HTML, che ha eseguito 260.000 richieste su un insieme di URL diverso. Exa compare solo in questo test perché non restituisce documenti HTML grezzi.
I large language model ora gestiscono l'analisi che un tempo richiedeva pattern matching scritto a mano, e i fornitori integrano questo passaggio nella loro offerta. L'analisi tramite LLM introduce la propria modalità di errore. I campi analizzati automaticamente devono essere testati rispetto a valori noti, perché un prezzo allucinato viene letto come dato valido. Strumenti di web scraping IA copre quella categoria.
Modalità di errore su larga scala
Difese anti-bot e pagine dinamiche
I sistemi anti-bot accumulano reputazione IP, controlli delle intestazioni delle richieste, sfide JavaScript e gate captcha, e una pagina che assembla il suo contenuto dopo l'esecuzione dello script aggiunge una seconda superficie da superare prima di qualsiasi estrazione.
Superare una sfida JavaScript significa eseguire una sessione browser anziché una semplice richiesta HTTP, e questo costa al fornitore circa da 5 a 10 volte più risorse di calcolo. Di conseguenza, i fornitori fissano prezzi e ritmo per le richieste renderizzate in modo diverso.
Concorrenza a livello di account e limiti di credito
A 5.000 richieste parallele nel benchmark e-commerce, tre dei cinque fornitori non hanno restituito alcuna esecuzione completata. Il limite riscontrato era la concorrenza a livello di account o i limiti di credito a quel carico piuttosto che la capacità di scraping.
Errori silenziosi e accuratezza dei dati
Il successo in entrambi i benchmark è stato conteggiato solo quando il contenuto previsto era presente nella risposta, verificato rispetto a una verità di base definita prima dell'esecuzione. Un HTTP 200 che restituisce una pagina di blocco, un captcha o un guscio vuoto ha ottenuto zero, quindi queste cifre sono inferiori a quelle prodotte da un conteggio dei codici di stato sullo stesso traffico. Una pipeline che controlla solo i codici di stato segnala il successo mentre raccoglie pagine di blocco.
Rischio legale
La raccolta su larga scala attira l'attenzione dei team di sicurezza e il contenzioso segue quando una parte di essa tocca dati dietro un login o dati personali. Google ha fatto causa a SerpApi per lo scraping di contenuti protetti da copyright apparsi nei suoi risultati di ricerca pubblici.1 La legalità del web scraping copre i confini in modo più dettagliato.
Metodologia del benchmark di scraping su larga scala
Metodologia dei web unblocker
Quattro fornitori, i primi 10.000 domini Tranco, 260.000 richieste, concorrenza 5, 100, 500 e 5.000. I domini sono stati filtrati per server non funzionanti, endpoint solo infrastrutturali e siti senza contenuto scansionabile, quindi vagliati rispetto a blocklist pubbliche, una soglia di autorità del dominio e un elenco di parole chiave. I domini che conservavano almeno tre URL scansionabili sono passati. Le suddivisioni dei test hanno utilizzato insiemi di URL distinti e non sovrapposti.
Il successo è stato convalidato in più fasi, a partire da un pre-filtro di riconoscimento delle pagine anti-bot, poi un match con il selettore CSS di verità di base, infine il matching testuale sul corpo grezzo e privato dei tag, con fallback per nomi di classe hash, escaping CSS di utilità e corruzione della codifica dei caratteri. Un test separato di estrazione markdown ha coperto 10.000 URL. Si applica una limitazione. Nessun dato di concorrenza 5.000 è pubblicato per Zyte o Firecrawl.
Metodologia dello scraper e-commerce
Cinque fornitori, 100 domini di e-commerce, 65.000 pagine prodotto e di ricerca ciascuno, concorrenza 5, 100 e 5.000. La media riportata è la media dei livelli di concorrenza 5 e 100, perché Bright Data e Nimble sono stati i due fornitori che hanno completato un'esecuzione completa a 5.000.
I domini sono stati selezionati tra i primi 15 paesi per PIL, esclusi Russia e Cina, più i leader di categoria tratti dagli elenchi di categorie di SimilarWeb e Semrush. Gli URL dei prodotti provenivano da sitemap dei siti, scansioni di categorie e ricerche limitate al sito, mentre gli URL di ricerca da query generate a partire dai nomi delle categorie e dagli slug dei prodotti di ciascun dominio, nella lingua del sito. Ogni URL è stato scoperto senza recuperare la pagina target tramite un fornitore sottoposto a benchmark. Quando un fornitore offriva uno scraper e-commerce dedicato per un dominio, veniva eseguito quello scraper. Altrimenti, veniva eseguito l'unblocker generico del fornitore. Tutti i fornitori sono stati eseguiti dalla stessa posizione server. Il costo è stato registrato come spesa per 1.000 pagine prodotto riuscite, con le richieste fallite conteggiate nella spesa.
Fornitori testati
Che cos'è il web scraping su larga scala?
Il web scraping su larga scala è la raccolta automatizzata di dati web a un volume in cui la scelta dell'infrastruttura inizia a dettare l'architettura anziché seguirla.
Le transizioni osservabili segnano l'intervallo. A 10.000 richieste al mese, i prezzi di listino degli unblocker vanno da $0 con Exa e $7,50 con Bright Data fino a $99 con Firecrawl. A un milione al mese gli stessi fornitori vanno da $749 a $4.080. A 5.000 richieste concorrenti, tre dei cinque fornitori e-commerce non hanno prodotto alcuna esecuzione completata. Il volume e la concorrenza, non la tecnica di scraping, sono ciò che cambia su questa scala.
Conclusione
Il tasso di successo verificato dal contenuto più alto misurato su 100 domini e-commerce è stato del 76.0%, mediato sui livelli di concorrenza 5 e 100, e il più basso del 59.4%. Sui primi 10.000 domini Tranco, i quattro unblocker sono andati dall'88% al 94%. Entrambe le cifre sono conteggi verificati sul contenuto, che valutano come fallimento una pagina di blocco restituita con un HTTP 200, quindi sono inferiori a quanto riportato da un conteggio dei codici di stato sullo stesso traffico.
Per un elenco target fisso e noto, Bright Data ha registrato un successo medio del 76.0% a $1,52 per 1.000 pagine prodotto riuscite e scraper dedicati per 59 dei 100 domini. Per i tempi di risposta sulla stessa lista, Decodo ha registrato una mediana di 7.0s e Nimble 8.9s, rispettivamente al 59.4% e 62.0%. Per un elenco aperto a coda lunga, Bright Data ha registrato il 94% con una media di 5s, e Firecrawl l'88% a 4s. Per carichi sostenuti a 5.000 richieste concorrenti, Bright Data e Nimble presentano risultati pubblicati in entrambi i benchmark.
Ulteriori letture
- Roadmap del Web Scraping: Approfondimenti da 30M Richieste
- Benchmark dello Scraper E-Commerce
- Web Unblocker: Confronto e Benchmark
- Le Migliori API di Web Scraping a Confronto
- I Migliori e Più Economici Proxy Residenziali
- I Migliori Strumenti di Web Scraping IA
- Le Sfide Più Comuni del Web Scraping
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{Web Scraping su Larga Scala: 7 Fornitori Confrontati}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/large-scale-web-scraping}},
note = {AIMultiple. Consultato il 30 Luglio 2026}
}Registro delle modifiche
10 aggiornamenti- 2026
Aggiunta la sezione "Benchmark di affidabilità dell'infrastruttura dati web".
- 2025
Aggiornata la sezione metodologia con nuovi dettagli su come sono state gestite le richieste.
Ampliata la sezione sulla metodologia.
Rimossa la sezione "Recommendation".
Aggiunto "Total Price for Enterprise Package" alla sezione "How to scrape websites at large scale".
Ampliata la sezione 'Come fare scraping di siti web su larga scala' con i dati di tasso di successo e tempo di risposta di Oxylabs.
Rimossa la sezione 'Cos'è il web scraping su larga scala?'.
Rimosso un invito all'azione dalla fine dell'articolo.
Aggiunti i risultati del benchmark alla sezione "Scraping di centinaia di pagine da un grande sito web".
- 2024
Aggiunto Apify all'elenco dei prodotti sponsorizzati.
Collegamenti di riferimento
- Ha 20 anni di esperienza come hacker white-hat e guru dello sviluppo, con una vasta competenza nei linguaggi di programmazione e nelle architetture dei server.
- È consulente del consiglio di amministrazione presso una società di venture capital che investe in aziende tecnologiche in fase iniziale e presso Ödeal, una piattaforma di pagamento digitale regionale che serve 125.000 commercianti.
- Ha guidato l'infrastruttura tecnologica e la cybersecurity di sette elezioni nazionali ed è stato riconosciuto nella Hall of Fame della cybersecurity da leader tecnologici globali tra cui Twitter.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.