Abbiamo confrontato quattro fornitori di dati web su 100 domini e-commerce, recuperando 65.000 pagine di prodotto e di ricerca ciascuno con da 5 a 5.000 richieste simultanee.
Tempo di risposta e tasso di successo
Nella media tra i livelli di concorrenza, Bright Data ha raggiunto il tasso di successo più alto (76%) con una mediana di 16 secondi. Apify ha registrato il tempo di risposta mediano più alto, pari a 46 secondi.
Il tempo di risposta è riportato come mediana (P50), la richiesta tipica, e come coda (P90), il 10% più lento delle richieste.
I tassi di successo sono calcolati in media tra i livelli di concorrenza 5 e 100, poiché solo Bright Data e Nimble hanno completato un ciclo completo a 5.000.
Consulta la nostra metodologia di benchmark e-commerce per sapere come abbiamo eseguito i test.
Tasso di successo dello scraper e-commerce per concorrenza
Bright Data ha registrato il tasso di successo complessivo più alto. A 5.000 richieste parallele, Bright Data ha mantenuto il 71% e Nimble il 56%.
La concorrenza è il numero di richieste inviate nello stesso momento. Il livello di 5.000 richieste mette sotto stress i limiti di velocità e l'infrastruttura di un fornitore.
Tasso di successo su pagine prodotto e pagine di ricerca
Ogni fornitore ha ottenuto risultati migliori sulle pagine di prodotto (dettaglio) rispetto alle pagine di ricerca (elenco).
- Le pagine di ricerca (elenco) restituiscono molti articoli da una query o da una categoria, spesso impaginate e renderizzate dinamicamente, il che rende più difficile un'estrazione coerente.
- Le pagine di prodotto (dettaglio) mostrano un singolo articolo con campi strutturati come titolo, prezzo, SKU e immagini.
Tasso di successo per fornitore anti-bot
Abbiamo identificato il fornitore anti-bot per ciascuno dei 100 domini, quindi abbiamo raggruppato per fornitore la stessa misura di successo verificata sui contenuti. Akamai copre 42, Cloudflare 16, AWS WAF 10, HUMAN 8 e DataDome 6, e 18 domini presentano fornitori troppo piccoli per essere rappresentati nel grafico.
La separazione più ampia si osserva su DataDome, che difende 6 dei domini. Bright Data ha restituito il 92.5% lì, contro il 46.0% - 75.3% degli altri tre fornitori.
Su Akamai, il gruppo più numeroso con 42 domini, i quattro fornitori variano dal 65.7% al 70.4%, con intervalli sovrapposti.
Valutazione degli scraper e-commerce
Bright Data offre una API Web Scraper abbinata a un'interfaccia no-code, insieme a uno scraper e-commerce dedicato e oltre 1.000 scraper già pronti che coprono marketplace come Amazon, eBay, AliExpress, Walmart e Target. La combinazione di accesso API e pannello di controllo no-code lo rende utilizzabile sia dai team tecnici sia da quelli non tecnici. Nel nostro benchmark, Bright Data ha registrato il tasso di successo complessivo più alto ed è stato uno dei pochi fornitori a mantenere il proprio tasso sotto carico simultaneo elevato.
Prestazioni:
- Tasso di successo complessivo più alto: 76% su 100 domini.
- Ha mantenuto il proprio tasso sotto carico: uno dei due fornitori a sostenere il successo a 5.000 richieste simultanee (71%).
Inizia con 5K gratuito record/mese per testare lo scraper di Bright Data
Visita il sito webZyte API è un'API di web scraping che combina gestione dei ban, rendering headless e capacità di estrazione tramite intelligenza artificiale per strutturare l'HTML grezzo in dati tipizzati, come nomi dei prodotti, prezzi e valutazioni, dalle pagine di prodotto dei rivenditori. È accessibile tramite REST e si integra con il framework open source Scrapy, mantenuto da Zyte, insieme all'hosting Scrapy Cloud. Nel nostro benchmark, ha registrato il secondo tasso di successo complessivo più alto ed è rimasto costante sui principali marketplace e con concorrenza elevata.
Prestazioni:
- Secondo tasso di successo complessivo più alto: 72% su 100 domini.
- Costante sui principali marketplace: Amazon 95%, Walmart 97%, Target 96%, eBay 98%.
- Divario più ridotto tra prodotto e ricerca: 74% sulle pagine di prodotto e 70% sulle pagine di ricerca, il divario più stretto tra i due tra tutti i fornitori.
Inizia con $5 di credito gratuito per testare lo scraper di Zyte
Visita il sito webIl marketplace di Apify ospita migliaia di Actor sviluppati da Apify e dalla sua community, al servizio sia di sviluppatori sia di agenti.
Nel nostro benchmark, abbiamo utilizzato il suo E-commerce Scraping Tool, un singolo Actor universale che estrae dati di prodotti e prezzi, dettagli di categoria, recensioni e informazioni sul venditore da piattaforme retail e marketplace come Amazon, Walmart ed eBay, a partire da un URL di prodotto, un URL di categoria o una ricerca per parole chiave.
Prestazioni:
- Successo con carico standard: 70% complessivo, 96% su Amazon e 92% su Best Buy.
- Flessibilità: accetta un URL di prodotto, un URL di categoria o una ricerca per parole chiave ed esporta JSON, CSV, Excel, XML o HTML.
- Tempo di risposta e carico: tempo di risposta mediano di 46 secondi.
Inizia con $5 gratuito al mese per testare lo scraper di Apify
Visita il sito webNimble offre un'API di web scraping generica accanto a un'API e-commerce dedicata che restituisce JSON strutturato tramite intelligenza artificiale e NLP e supporta i principali marketplace, tra cui Amazon, Walmart e Google Shopping. L'API include proxy residenziali integrati e il geo-targeting fino a livello di paese, stato, città e codice postale. Nel nostro benchmark, Nimble ha mantenuto il proprio tasso di successo sotto carico simultaneo elevato meglio di ogni altro fornitore tranne Bright Data.
Prestazioni:
- Secondo più resiliente sotto carico: ha mantenuto il 56% di successo con 5.000 richieste simultanee, dietro Bright Data.
- Veloce: tempo di risposta mediano di circa 9 secondi.
- Forza specifica per dominio: 100% su AliExpress e 90% su Best Buy, 25% su Amazon.
Copertura degli scraper dedicati per fornitore
I fornitori differiscono per il modo in cui estraggono i dati. Alcuni offrono uno scraper dedicato e predefinito per ogni marketplace che restituisce i campi strutturati del sito; altri applicano un unico motore universale a qualsiasi sito. Bright Data ha offerto la copertura dedicata più ampia sui 100 domini. Zyte e Apify utilizzano un unico motore di estrazione universale invece di una libreria per singolo marketplace.
Per ciascun fornitore, la colonna dei campi metadati conta gli attributi distinti dei dati in un record di prodotto JSON analizzato, come prezzo, marchio, valutazione, SKU o immagine. Il valore è la media tra le pagine di prodotto che hanno restituito un record di prodotto analizzato ed esclude gli header HTTP, i metadati della richiesta e qualsiasi campo che contenga l'HTML grezzo della pagina.
Gli scraper dedicati di Bright Data restituiscono dati dalle pagine prodotto. La copertura riflette il catalogo di ciascun fornitore al momento del benchmark.
Prezzi degli scraper e-commerce
*Il prezzo di Bright Data è per record (un elemento estratto, ad es. un prodotto o una recensione), non per richiesta. Sulle pagine di ricerca, una singola richiesta può restituire più record.
Nel nostro benchmark, restituire 1.000 pagine di prodotto con il contenuto previsto è costato $1.30 con Nimble, $1.52 con Bright Data, $3.32 con Zyte e $7.50 con Apify. Le richieste non riuscite contano per la spesa ma non per il totale delle pagine, quindi si tratta di tariffe effettive piuttosto che di prezzi di listino.
Metodologia di benchmark e-commerce
Selezione dei domini
Abbiamo selezionato i primi 15 paesi per PIL ed escluso Russia e Cina. Per ogni paese, abbiamo preso i primi 5 domini degli ultimi tre mesi nella categoria e-commerce di SimilarWeb. Abbiamo aggiunto i primi 5 siti web globali nell'elettronica di consumo e nel settore alimentare. Per gli Stati Uniti, classificati al primo posto, abbiamo inoltre preso i primi 20 domini della categoria retail da Semrush, poiché le classifiche pubbliche di Semrush mostrano 20 siti dove SimilarWeb ne mostra 5.
Abbiamo poi incluso i primi 20 della categoria retail globale e i primi 20 della categoria abbigliamento/moda per gennaio 2026. Abbiamo escluso i domini che servono paesi al di fuori del gruppo selezionato, i siti che richiedevano l'autenticazione per la navigazione e i siti che richiedevano la selezione del paese nella pagina di destinazione prima della navigazione. Abbiamo escluso i percorsi regionali dei domini globali (ad esempio etsy.com/fr), ma abbiamo mantenuto i siti regionali con un dominio separato. Quando un'esclusione lasciava una lacuna nei primi 5 di un paese, l'abbiamo colmata dalla lista e-commerce dei primi 20 di Semrush per quel paese. Per raggiungere 100 domini, abbiamo aggiunto 10 selezioni dai principali marketplace e-commerce.
Due domini monomarca, apple.com e consumer.huawei.com, hanno restituito solo poche centinaia di prodotti distinti anche dopo aver esaminato ogni categoria, al di sotto dell'obiettivo per dominio. Li abbiamo sostituiti con due domini ad alto traffico secondo SimilarWeb, bol.com e argos.co.uk.
Raccolta URL
Per ciascun dominio, abbiamo raccolto sia URL di prodotto sia URL di elenco, conservando un numero sufficiente di URL di riserva affinché ogni esecuzione e test di carico attinga da un insieme nuovo. Abbiamo scoperto ogni URL senza recuperare la pagina di destinazione tramite alcun fornitore sottoposto a benchmark, quindi quelle pagine restano inutilizzate prima del benchmark stesso.
Per gli URL di prodotto, abbiamo utilizzato tre fonti in sequenza, fermandoci quando un dominio raggiungeva il proprio obiettivo:
- La sitemap di prodotto del sito.
- Una scansione delle pagine di categoria del sito (dalla homepage fino alle pagine di categoria e sottocategoria) quando la sitemap era mancante o troppo piccola, raccogliendo i link ai prodotti mentre si recuperavano le pagine di categoria ma mai la pagina di prodotto.
- Ricerca limitata al sito su Google quando un dominio era ancora al di sotto dell'obiettivo.
Ogni URL è stato confrontato con un modello di prodotto per dominio per scartare le pagine non di prodotto, e ogni dominio ancora al di sotto dell'obiettivo è stato segnalato per la revisione manuale o sostituito con una riserva.
Per gli URL di ricerca, abbiamo generato le query dal catalogo di ciascun dominio anziché da un elenco esterno di parole. Le parole chiave provenivano dai nomi delle categorie e dagli slug dei prodotti del sito, quindi erano nella lingua del sito stesso (un sito giapponese o coreano viene interrogato nella propria lingua, senza un passaggio di traduzione separato), e sono state eventualmente generalizzate a termini di categoria semplici come "scarpe da corsa". Abbiamo eseguito le query rispetto all'endpoint di ricerca del sito, o alle sue pagine di categoria dove non esisteva una ricerca per parole chiave, e abbiamo mantenuto le query che restituivano diversi prodotti distinti. Tutti gli URL sono stati poi normalizzati a una localizzazione per dominio, privati dei parametri di tracciamento e deduplicati.
Validazione degli URL
Poiché il benchmark recupera ogni URL con ogni fornitore, la convalida dell'intero insieme avrebbe consumato gli URL inutilizzati, quindi abbiamo convalidato un campione di circa una dozzina di pagine per ogni tipo di pagina per dominio, circa 2.500 URL. Abbiamo verificato che le pagine di prodotto fossero attive e mostrassero un prezzo e che le pagine di elenco fossero attive e restituissero diversi prodotti distinti invece di una pagina vuota o di un singolo prodotto. Abbiamo rimosso i sottodomini di staging e di QA e le localizzazioni miste, ed escluso ogni URL campionato dal gruppo consegnato.
Esecuzione del benchmark
Ciascun fornitore ha recuperato gli stessi URL nuovi, con un numero uguale di pagine estratte da ogni dominio a ogni esecuzione. Quando un fornitore offriva uno scraper e-commerce dedicato per un dominio, lo abbiamo utilizzato; in caso contrario, abbiamo usato il web unblocker generico del fornitore. Tutti i fornitori sono stati eseguiti dalla stessa posizione server, così la posizione non ha dato vantaggio ad alcun fornitore.
Per misurare il comportamento sotto carico anziché il comportamento migliore, abbiamo eseguito l'intero gruppo a tre livelli di concorrenza: 5, 100 e 5.000 richieste parallele. Uno stato HTTP 200 non contava di per sé come successo. Per ogni URL, abbiamo definito in anticipo i dati attesi, quindi abbiamo verificato la pagina restituita rispetto ad essi: una risposta veniva considerata un successo solo quando il suo contenuto corrispondeva a quella verità di base tramite un selettore CSS o un campo strutturato (JSON) contenente i dati obiettivo (un prezzo e i campi del prodotto su una pagina di prodotto, diversi prodotti distinti su una pagina di elenco).
Una pagina di blocco, un captcha o un guscio vuoto hanno ottenuto zero anche con uno stato 200. Ogni grafico di questo articolo utilizza questo tasso di successo verificato sui contenuti. Abbiamo registrato lo stato HTTP e il tempo di risposta end-to-end insieme ad esso, e riportiamo il tempo di risposta come mediana (P50) e coda (P90) delle richieste riuscite.
Solo Bright Data e Nimble hanno sostenuto un'esecuzione completa al livello di 5.000 richieste; gli altri due fornitori sono stati limitati dalla concorrenza a livello di account o dai massimali di credito a quel carico, non dalla capacità di scraping, quindi non sono mostrati a quel livello di concorrenza.
Rilevamento anti-bot
Abbiamo etichettato ciascuno dei 100 domini separatamente dall'esecuzione del benchmark, inviando due richieste agli stessi URL di prodotto e di ricerca usati dal benchmark, poiché le difese anti-bot sono solitamente attive su quei percorsi piuttosto che su una homepage. Un client a riga di comando standard, bloccato da 70 dei 100 domini, restituisce una pagina di blocco che indica il nome del fornitore. Gli altri 30 sono identificabili dai cookie e dagli script di difesa che una normale risposta simile a quella del browser porta con sé. I domini che hanno rifiutato qualsiasi richiesta diretta dalla nostra posizione sono stati recuperati tramite un proxy.
Abbiamo classificato le prove invece di trattare ogni segnale come equivalente. Un cookie o un header unico per un prodotto di difesa anti-bot, come _abck di Akamai o datadome di DataDome, conta come stack attivato, e una pagina di sfida che indica il nome del fornitore conta allo stesso modo. Una pagina generica di diniego identifica l'azienda ma non il prodotto, e i soli header del livello di distribuzione non costituiscono una rivendicazione di difesa anti-bot. Abbiamo verificato i marcatori ambigui rispetto alla documentazione del fornitore e alle informative sui cookie del sito, quindi abbiamo eseguito un passaggio che cercava di confutare ogni attribuzione. Ha corretto diversi casi, inclusi i cookie __uzm su eBay, che appartengono a Radware piuttosto che a Imperva.
Lo scraping e-commerce è legale?
È legale raccogliere informazioni pubbliche come nomi dei prodotti, prezzi e stato delle scorte, a condizione di non aggirare i login o accedere a dati privati.
Tuttavia, nuove regole sull'IA si applicheranno ad alcune piattaforme. Ad esempio, a partire dal 2026, eBay ha modificato il proprio Contratto d'uso per vietare ai “LLM-driven bots” e agli “buy-for-me agents” di utilizzare la sua piattaforma senza autorizzazione scritta. Questo aggiornamento risponde alla diffusione dell'“agentic commerce.”1
Sebbene lo scraping generico sia ancora legale, l'uso di agenti IA per interagire con i marketplace è ora soggetto a regole più severe.
FAQ
In questo benchmark, Apify, Zyte e Bright Data hanno ottenuto ciascuno 93% o più sulle pagine prodotto di Amazon. Su Amazon, Walmart, Target ed eBay, Bright Data ha registrato dal 92% al 99% e Zyte dal 95% al 98%.
Lo scraping e-commerce consiste nella raccolta automatica di dettagli di prodotto dalle pagine di prodotto, come titoli, prezzi dei concorrenti, stato delle scorte, recensioni e immagini, da negozi online e marketplace.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{dogan2026,
author = {Dogan, Sedat and Sarı, Ekrem},
title = {{Scraper e-commerce: 4 fornitori a confronto}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ecommerce-scraper}},
note = {AIMultiple. Consultato il 14 Agosto 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.