Servizi
Contattaci

Benchmark sui dati web etici e conformi

Cem Dilmegani
Cem Dilmegani
aggiornato il 4 ago. 2026

Man mano che le aziende ampliano le proprie operazioni sui dati web, i dirigenti responsabili di compliance, dati e rischi valutano sempre più i rischi etici, reputazionali e legali associati.

Abbiamo confrontato 5 servizi leader di raccolta di dati web su 3 dimensioni e testato ciascun servizio con più di 20 scenari potenzialmente non etici.

Il nostro lavoro ti aiuta a valutare la posizione etica delle tue pratiche di raccolta dati e a comprendere le potenziali conseguenze di approcci non etici. Forniamo inoltre linee guida per la raccolta etica di dati web e valutiamo i servizi di raccolta di dati web da una prospettiva etica e di conformità:

Valutazione dei servizi di raccolta di dati web

Abbiamo valutato i principali servizi di raccolta di dati web (chiamati anche fornitori di dati web o infrastrutture per dati web) utilizzando la nostra checklist etica per i dati web. Questi punteggi rappresentano livelli di maturità, dove 5 è il livello più alto:

Fornitori
Sintesi
Uso etico da parte dei clienti
Fornitura etica
Certificazione esterna
Copertura assicurativa condivisa**
Livello 5
Livello 5
Livello 5
Sicurezza dei dati, trattamento delle PII. Fonti IP nella whitelist. Pratiche etiche valutate.
Livello 1
Livello 1
Livello 1
Sicurezza dei dati
Livello 1
Livello 1
Livello 1
Sicurezza dei dati
Nimble
Livello 1
Livello 1
Livello 0
Sicurezza dei dati

* Questi sono codici per i nomi dei fornitori. Questi fornitori non hanno voluto essere citati in questo report e sono elencati in fondo all'elenco finché non risolveremo la questione.

** ✅ indica che l'azienda ha scelto di condividere i propri certificati assicurativi con AIMultiple. ❌ indica che l'azienda ha deciso di non condividere i propri certificati assicurativi con noi e quindi non abbiamo potuto convalidare la loro copertura assicurativa. La copertura assicurativa è la categoria in cui ci siamo basati sulla partecipazione delle aziende di servizi di dati web per valutarle.

Ordinati per punteggio complessivo.

Modello di punteggio per i dati web etici

Di seguito spieghiamo come vengono derivati questi punteggi. Puoi anche consultare la logica alla base della scelta di queste dimensioni di valutazione.

Nelle prime 2 categorie abbiamo identificato 5 competenze e le aziende hanno ricevuto punteggi in base al numero di competenze soddisfatte. Il Livello 5 rappresenta la maturità più alta osservata sul mercato, riflettendo le attuali migliori pratiche piuttosto che la perfezione.

Capacità per un uso etico da parte dei clienti

  • Processi efficaci per l'uso etico: Valutiamo la capacità di ciascun fornitore di prevenire un uso non etico dei propri servizi di proxy residenziali attraverso scenari di test controllati. Se anche una sola delle nostre richieste viene bloccata dal fornitore, questo obiettivo è raggiunto.
  • Processi migliorati per l'uso etico: Simile a “processi efficaci per l'uso etico”. Tuttavia, questa capacità indica che il fornitore di servizi ha bloccato più di uno dei nostri tentativi di utilizzare i propri servizi per casi d'uso non etici.
  • Best practice processi per l'uso etico: Simile a “processi efficaci per l'uso etico”. Tuttavia, questa capacità indica che il fornitore di servizi ha bloccato la maggior parte dei nostri tentativi di utilizzare i propri servizi per casi d'uso non etici.
  • Fondamenta per la gestione degli abusi: Pubblicazione di una policy di gestione degli abusi e di un metodo per segnalare gli abusi
  • Gestione reattiva degli abusi: Abbiamo misurato come le aziende hanno risposto a più segnalazioni di abusi. Anche in assenza di una hotline per segnalare abusi, abbiamo utilizzato le email indicate dall'azienda per contattare il loro team. Se non abbiamo ricevuto risposte alla nostra segnalazione entro una settimana, l'azienda è considerata non reattiva.

Capacità per una fornitura etica

La fornitura etica consiste nell'acquisire indirizzi IP in modo etico. La nostra analisi di mercato ha identificato i seguenti livelli di trasparenza riguardo alla fornitura etica di IP:

  • Livello 1: Pubblicazione di una policy di approvvigionamento degli IP.
  • Livello 2: Divulgata almeno una fonte (ad es. un'app mobile) per gli IP che fornisce IP in modo etico. La fonte divulgata dovrebbe avere in totale almeno 10k recensioni su piattaforme di terze parti, tra cui gli app store di Google, Apple, Amazon e Trustpilot.
  • Livello 3: Come il Livello 3 ma con 100k recensioni
  • Livello 4: Come il Livello 3 ma con 1M recensioni
  • Livello 5: Come il Livello 4 ma con 10M recensioni

Le recensioni sono un indicatore della popolarità delle app e rappresentano un segnale importante per questa valutazione. I servizi di raccolta di dati web devono collaborare con applicazioni popolari per poter soddisfare le esigenze di IP dei propri clienti.

Per la qualificazione, le app divulgate dovrebbero seguire queste best practice. Non lo verificheremo per ogni app divulgata, ma per alcune selezionate casualmente:

  • Consenso informato:
    • Gli utenti devono dare il consenso esplicito prima di condividere la propria connessione internet. La schermata di opt-in dovrebbe illustrare:
      • Il fornitore
      • Il servizio
      • Come verrà utilizzato il loro IP
    • Gli utenti dovrebbero poter accedere a informazioni dettagliate su
      • Come verrà utilizzata la loro connessione internet
      • Informativa sulla privacy
  • Valore: Gli utenti devono ricevere un valore dall'app (ad es. pagamento, possibilità di saltare la pubblicità o altre funzionalità)
  • Privacy: Raccolta di dati degli utenti limitata e trasparente.

Per le reti di proxy residenziali, gli acquirenti dovrebbero inoltre verificare se il consenso è specifico, informato, revocabile e separato da permessi app non correlati. Dovrebbero chiedere se gli utenti possono facilmente rinunciare, se l'uso della larghezza di banda è limitato, se i minori sono esclusi e se il fornitore controlla le app o gli SDK che forniscono IP residenziali.

Certificazione esterna

Abbiamo valutato la certificazione esterna in base al possesso da parte delle aziende di certificati rilevanti per la sicurezza e la conformità di livello enterprise.

  • Certificazione PII: capacità dimostrata di gestire le PII ottenendo la ISO 27018
  • Certificazione di sicurezza dei dati: pratiche di sicurezza dei dati dimostrate ottenendo uno di questi certificati: SOC 2 o ISO/IEC 27001
  • Fonte IP nella whitelist: I fornitori di certificazione esterna come McAfee certificano:
    • Specifiche app di 3rd parti che forniscono IP
    • SDK che raccoglie IP da app di 3rd parti
  • Pratiche etiche valutate: È possibile completare un progetto di assurance ISAE 3000 per valutare le pratiche interne di conformità ed etica.

Assicurazione

Abbiamo chiesto ai fornitori di fornirci questi documenti assicurativi:

  • Assicurazione di responsabilità professionale certificato che fornisce copertura per le responsabilità dei fornitori in caso di problemi nel servizio
  • Certificato di assicurazione cyber che fornisce copertura per le responsabilità dei fornitori in caso di problemi legati alla sicurezza delle informazioni.

Punteggio complessivo

Questo punteggio è la somma di tutti i punteggi divisa per 3. I punteggi sono:

  • da 0 a 5 per le capacità di uso etico da parte dei clienti
  • da 0 a 5 per le capacità di fornitura etica
  • da 0 a 3 per la certificazione esterna
  • da 0 a 2 per le assicurazioni

Principali servizi di raccolta di dati web

AIMultiple ha selezionato i 7 maggiori servizi di raccolta di dati web in termini di dipendenti su LinkedIn. Abbiamo scelto questa metrica perché è pubblica e dovrebbe essere correlata ai ricavi dell'azienda e alla sua prontezza per il livello enterprise. Metriche migliori come i ricavi o il numero di dipendenti a libro paga non sono disponibili pubblicamente per queste aziende private.

Tutte le aziende selezionate hanno più di 100 dipendenti collegati alle loro pagine profilo LinkedIn ad aprile 2025. Attualmente 5 delle 7 selezionate sono mostrate in questa pagina e le restanti 2 aziende hanno scelto di non essere incluse nel report.

Prodotti di raccolta di dati web in primo piano

Queste aziende offrono una gamma di prodotti che include proxy, API di scraping dei dati e dataset. Sebbene tutti i prodotti possano essere esaminati da una prospettiva etica, inizialmente ci siamo concentrati sul prodotto che offre il massimo livello di flessibilità e alimenta la maggior parte degli altri prodotti: i proxy residenziali.

I prodotti di raccolta di dati web possono essere considerati come una gerarchia in cui i proxy formano il livello centrale su cui sono costruiti tutti gli altri servizi. Questo perché i proxy consentono alle macchine di accedere a Internet attraverso destinazioni diverse, consentendo un insieme ampio e diversificato di connessioni Internet cruciale per la raccolta di dati. Pertanto, i proxy sono il prodotto di raccolta di dati web più capace: possono essere utilizzati per svolgere funzioni che non sarebbero possibili con dataset o API di scraping dei dati.

Tra i proxy, i proxy residenziali sono il prodotto più difficile da identificare come proxy per i siti web. Ad esempio, altri proxy come i proxy datacenter sono facili da identificare a causa della loro posizione. Pertanto, i proxy residenziali alimentano la maggior parte degli altri prodotti di dati web, come le API di scraping dei dati.

Verifica: la tua raccolta di dati web è conforme ed etica?

La tua azienda con ogni probabilità sfrutta i dati web. Tuttavia, il settore è soggetto a una regolamentazione limitata, quindi è importante scegliere un fornitore etico e conforme. Per raggiungere questo obiettivo, abbiamo preparato un framework olistico che tiene conto di diversi aspetti della raccolta di dati web, tra cui l'approvvigionamento etico, l'uso etico e la certificazione esterna.

I dati web sono un asset operativo comune

Come impresa, la tua azienda dipende in parte dai dati web a causa dei numerosi casi d'uso, come:

  • Prezzi dinamici per retail ed e-commerce
  • Dati alternativi in tempo reale per fondi di investimento
  • Processo KYC nel settore bancario commerciale
  • Addestramento o fine-tuning di modelli di IA
  • Inferenza IA o RAG
  • Ricerche di mercato

Con l'IA, i dati web sono ora più importanti

Sebbene la raccolta di dati web sia vecchia quanto il web, la sua importanza è aumentata drasticamente dopo l'ascesa dei modelli di IA generativa. I creatori di questi modelli, come OpenAI e Anthropic, hanno iniziato senza partnership significative sui contenuti e hanno utilizzato principalmente dati online per costruire i loro modelli iniziali, il che ha portato alla nascita di un'industria dell'IA da trilioni di dollari.

Supervisione normativa limitata

I requisiti normativi per la raccolta di dati web variano notevolmente da giurisdizione a giurisdizione. Questo benchmark si concentra quindi sulle pratiche etiche e di conformità piuttosto che assumere un quadro normativo uniforme tra i Paesi.

Le attività online chiaramente illegali sono ben definite. Tuttavia, vi sono requisiti normativi limitati per gli operatori del settore per prevenire proattivamente l'uso improprio dei loro servizi da parte degli utenti.

Spetta alle piattaforme stesse definire le migliori pratiche e gli standard di conformità per garantire una raccolta dati etica e un uso corretto dei proxy. Pertanto, la scelta del fornitore è più importante nella raccolta dati rispetto a settori fortemente regolamentati come quello bancario, dove ogni fornitore di servizi è tenuto a rispettare numerose normative.

La posizione etica dei tuoi fornitori fa parte della reputazione della tua azienda

Da una prospettiva etica e di rischio fornitore, le imprese dovrebbero valutare come vengono acquisiti i dati web, anche quando li consumano anziché raccoglierli direttamente.

Le responsabilità delle imprese per le attività illecite nella loro supply chain dipendono dalla giurisdizione. Ad esempio, in Germania le imprese sono responsabili di svolgere attività KYS e di gestione del rischio per identificare e prevenire i danni causati dalla loro supply chain. Anche quando le aziende non sono responsabili dei danni causati dalla propria supply chain, possono subire un rischio reputazionale.

Qual è il costo di una raccolta dati non etica e non conforme?

Rischio reputazionale

Se diventa pubblico che un'impresa utilizza un servizio di raccolta di dati web che adotta comportamenti non etici o azioni che mettono a rischio la sicurezza dei dati, ciò può causare danni reputazionali significativi come perdita di affari, abbandono dei clienti, perdita di talenti e perdita di fiducia degli investitori.

Esempi reali di fornitori aziendali che hanno portato a perdite reputazionali:

  • Nike ha subito danni reputazionali numerose volte a causa delle pratiche di lavoro non etiche dei suoi fornitori.1
  • Molte aziende come EY hanno perso la fiducia dei clienti quando sono state colpite dalla violazione del software di trasferimento file gestito MOVEit. 2

La perdita reputazionale, soprattutto quando porta a indignazione pubblica, è tipicamente seguita da cause legali da parte dei clienti dell'azienda o di altri stakeholder danneggiati dalle pratiche non etiche.

Esempio reale: Starbucks è uno dei marchi recenti a essere stato citato in giudizio per essersi rifornito da aziende con pratiche non etiche.3

Checklist etica per i dati web

I dati web aziendali devono soddisfare 3 requisiti per essere etici:

Uso etico da parte dei clienti

Nell'ambito dei processi Know Your Supplier, le imprese evitano di utilizzare servizi che consentono attività non etiche. L'uso di tali servizi espone le aziende a danni reputazionali.

Esempio reale: Nei casi in cui è stato documentato che un fornitore consentiva l'uso della propria piattaforma per attività non etiche, numerose aziende hanno preso le distanze dal fornitore finché non ha migliorato le proprie pratiche.4

Come si collega ai dati web: I dati web vengono raccolti tramite diversi indirizzi IP. Questi indirizzi possono essere utilizzati per svolgere diverse attività illecite come attacchi DDoS per impedire l'erogazione di servizi digitali, raccolta non autorizzata di dati non pubblici o frode pubblicitaria. I malintenzionati hanno bisogno di IP per alimentare le proprie azioni e i fornitori di infrastrutture dati web/proxy sono i maggiori fornitori di IP agli utenti retail.

Fornitura etica

I servizi utilizzati per scopi etici possono causare azioni non etiche e dannose durante la loro produzione. Ad esempio, marchi come Nike e Nestlé hanno subito danni reputazionali e affrontato cause legali a causa del ricorso al lavoro minorile da parte dei loro appaltatori.

Come si collega ai dati web:

Le aziende devono accedere a un gran numero di fonti di larghezza di banda diverse per una raccolta dati rapida e globale. Ciò richiede l'uso di proxy residenziali: negli Stati Uniti, l'accesso a dati web pubblicamente disponibili può non costituire accesso non autorizzato ai sensi del CFAA in alcune circostanze, sebbene possano ancora applicarsi altre leggi e restrizioni contrattuali. 5 I siti web possono anche scegliere di bloccare alcuni visitatori. Ad esempio, possono bloccare i crawler dei concorrenti. In tali casi, le aziende devono fare affidamento su un gran numero di connessioni da utenti retail o da altre 3rd parti per raccogliere dati web.

I fornitori di proxy raccolgono milioni di connessioni Internet da varie fonti e le forniscono alle aziende che utilizzano gli indirizzi IP per accedere a queste connessioni. Alcuni di questi IP provengono dai dispositivi degli utenti residenziali. La raccolta di queste connessioni può essere legale o illecita:

  • Legale: le pratiche conformi alla legge prevedono l'ottenimento del consenso informato dell'utente, la fornitura di un compenso e l'offerta di meccanismi di opt-out in conformità con le normative locali. Il fornitore di dati web dovrebbe
    • Informare gli utenti su come verrà utilizzata la loro larghezza di banda
    • Ottenere il loro consenso digitalmente
    • Compensarli in cambio
    • Consentire loro di rinunciare in qualsiasi momento
  • Illegale: i malintenzionati possono ottenere accesso ai dispositivi degli utenti e utilizzare la loro connessione Internet senza permesso o compenso. Ciò può avvenire tramite app malware, dispositivi compromessi, installazioni mascherate, opt-in automatico e altri metodi che possono mettere a rischio il proprietario del dispositivo.

Le aziende che utilizzano proxy ottenuti illegalmente possono inavvertitamente pagare i malintenzionati per l'accesso non autorizzato ai dispositivi.

Esempi reali:

  • È stato documentato che i fornitori di proxy residenziali quotati in borsa hanno condiviso la propria infrastruttura con SDK che utilizzano le connessioni dei dispositivi senza il consenso degli utenti.67
  • Router e dispositivi IoT sono stati compromessi per operazioni di botnet e venduti come proxy residenziali.8 9
  • Alcuni fornitori di proxy promuovono i propri servizi in forum frequentati da malintenzionati. L'uso di proxy per dichiarare falsamente la posizione o l'identità nei sondaggi retribuiti può violare le regole del fornitore del sondaggio e, a seconda della giurisdizione e dell'intento, può anche sollevare questioni legali legate alla frode.10
  • Anche le app VPN sul Play Store di Google sono state utilizzate per acquisire IP residenziali senza il consenso degli utenti.11

Sebbene queste operazioni siano state chiuse, è probabile che i malintenzionati stiano ancora accedendo agli IP residenziali senza consenso tramite botnet e applicazioni compromesse o dannose.

Certificazione esterna

Gli acquirenti aziendali hanno bisogno di soluzioni sicure e pronte per l'impresa. Abbiamo identificato gli elementi di un'organizzazione matura di dati web che possono essere documentati tramite certificazione esterna:

Sicurezza dei dati

La mancanza di sicurezza dei dati nei sistemi dei fornitori può erodere il vantaggio competitivo di un'impresa o provocare perdita di dati e tempi di inattività del sistema. La perdita di funzionalità del sistema può erodere la fiducia e portare alla svalutazione di un'impresa.

Intrusione nei sistemi

I servizi di raccolta dati non sono integrati nei sistemi di un'impresa così profondamente come i servizi digitali core (ad es. un sistema di registrazione come il CRM). Pertanto, le loro credenziali di sicurezza non vengono esaminate con la stessa attenzione delle credenziali di un sistema core come un sistema di registrazione. Tuttavia, la sicurezza dei dati è fondamentale per i clienti dei servizi di raccolta dati, poiché questi servizi:

  • Sono talvolta integrati con sistemi più centrali come i motori di pricing.
  • Possono infettare i sistemi aziendali anche quando non sono integrati con tali sistemi. L'uso di un servizio di raccolta dati comporta la ricezione di dati da tale servizio. Anche alcune delle forme più sicure di trasferimento dati comportano rischi.

L'intrusione nei sistemi può anche portare gli aggressori a prendere di mira i dispositivi che forniscono IP residenziali a un servizio proxy. Ciò può causare danni reputazionali ai clienti di tale servizio proxy.

Esempio reale di vulnerabilità in un fornitore di proxy residenziali:

Gli operatori della botnet Kimwolf hanno acquistato servizi proxy dal fornitore di proxy residenziali IPIDEA. Utilizzando comandi dannosi, hanno infettato le reti interne dei dispositivi che fornivano IP a IPIDEA. Queste reti sono state poi scansionate e anche altri dispositivi vulnerabili su queste reti locali sono stati infettati.

Si stima che Kimwolf si sia diffuso su più di 2 milioni di dispositivi con questo metodo. Anche i dati raccolti dai clienti di IPIDEA sono transitati attraverso queste reti infette.12

Perdita di dati

Senza sicurezza dei dati, i malintenzionati possono accedere ai dati raccolti dalle imprese per identificare le loro attività e strategie, con conseguente perdita di vantaggio competitivo o opportunità di business.

Esempio reale:

Sebbene i dati web siano pubblici, le aziende possono utilizzare i dati web in modi innovativi per ottenere un vantaggio competitivo. Ad esempio, gli investitori spendono fino al 10% del proprio budget per i dati di mercato in dati alternativi13, ma raramente divulgano le proprie strategie poiché ritengono che ciò possa aiutarli a ottenere un vantaggio rispetto ai concorrenti. Una fuga di dati può portare all'esposizione delle loro strategie e quindi alla loro replica da parte dei concorrenti.

Gestione delle PII

I dati web includono dati privati dietro accesso o PII che possono essere divulgati accidentalmente o intenzionalmente su siti web pubblici. Se i servizi di raccolta di dati web non gestiscono correttamente le PII, tali dati possono essere acquisiti da malintenzionati. Ciò può causare danni reputazionali al servizio di raccolta dati e ai suoi clienti.

Sicurezza delle applicazioni

Le applicazioni o i programmi intermedi come gli SDK che forniscono gli IP dei servizi di raccolta dati web possono essere inseriti nella whitelist da fornitori di certificazione esterna come McAfee. Ciò aumenta la fiducia delle imprese nelle pratiche di fornitura etica del servizio di raccolta di dati web.

Copertura assicurativa

Le imprese in genere richiedono queste assicurazioni a qualsiasi fornitore digitale:

  • Assicurazione di responsabilità professionale
  • Certificato di assicurazione cyber
Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Benchmark dettagliato: valutazione dei fornitori di infrastrutture per dati web

Benchmark: uso etico da parte dei clienti

Qui intendiamo rispondere alla domanda: l'azienda garantisce che l'uso della sua soluzione sia etico e conforme alle leggi e ai regolamenti applicabili? Sintesi dei nostri risultati:

* Non applicabile: poiché Zyte e Apify acquistano proxy dai propri fornitori e non li raccolgono direttamente dagli utenti residenziali, i proprietari di siti web non li contatterebbero per segnalare abusi e quindi non hanno bisogno di creare un modulo di contatto per i siti web.

In primo luogo, abbiamo esaminato le policy:

Revisione della policy di utilizzo accettabile

Tutti i fornitori vietano le attività illegali e forniscono esempi come attacchi DoS, messaggi massivi non richiesti, impersonificazione o spoofing.

Inoltre, alcuni fornitori sottolineano anche di vietare attività che sono probabilmente illegali. Di seguito elenchiamo le attività vietate in base alle policy di utilizzo accettabile e ai loro addendum (ad es. l'addendum sul trattamento dei dati) per ciascun fornitore.

Abbiamo cercato termini che vietassero attività probabilmente illegali e identificabili in base all'attività dell'utente. Ad esempio, una quota significativa di utenti che utilizza proxy per partecipare a sondaggi retribuiti potrebbe utilizzare i proxy per ingannare i fornitori di sondaggi sulla propria posizione effettiva. Pertanto, questa attività è sia probabilmente illegale sia identificabile in base all'attività dell'utente (ovvero quando un utente accede a un sito web di sondaggi retribuiti).

Sebbene identificare chiaramente le attività vietate sia utile, non è un requisito e non influisce sui nostri punteggi. Le aziende possono scegliere di dichiarare che non consentono attività illegali piuttosto che menzionare ogni possibile fattispecie di attività illegali.

Menzionare un'attività come vietata non significa che tali attività verranno esaminate o bloccate. I nostri punteggi si basano su come queste policy vengono implementate, come illustrato di seguito:

Processi per l'uso etico

Mentre alcune categorie delineate nelle policy di utilizzo accettabile sono piuttosto ampie (ad es. scraping di dati o accesso non autorizzato), altre sono sufficientemente specifiche da poter essere tradotte in azioni preventive (ad es. blocco dell'accesso) che i servizi di raccolta dati possono implementare per gli utenti che non hanno completato il processo KYC.

Sulla base di questi usi vietati specifici, abbiamo preparato un elenco esteso di usi che sono probabilmente usi illegali dei proxy. Per ogni caso d'uso, abbiamo identificato scenari che includono domini web e azioni pertinenti. Ad esempio, nello scenario per il coinvolgimento sociale artificiale sui social media, abbiamo provato ad accedere a un social network utilizzando un proxy per mettere like a un post esistente.

Quindi, per verificare se le aziende consentono un uso non etico da parte dei clienti, abbiamo creato un account sul servizio di ciascun fornitore utilizzando un indirizzo email non-AIMultiple. Non abbiamo completato un processo KYC con questo account e abbiamo proceduto a utilizzare i servizi per capire cosa possono ottenere gli utenti anonimi con ciascun servizio. Il KYC è un passaggio cruciale durante il quale l'utente invia dati per convalidare l'entità legale che rappresenta. Questo collega l'attività dell'utente a un'entità legale:

  • Che può essere ritenuta responsabile.
  • La cui logica per le azioni online (ad es. usare proxy per accedere a siti web governativi) può essere esaminata. Ad esempio, dopo aver compreso il loro caso d'uso, un ricercatore o un'agenzia governativa può essere autorizzato ad accedere a un sito web governativo utilizzando un proxy.

Ci aspettavamo che questi casi d'uso attivassero un processo KYC, ma nella maggior parte dei fornitori non è avvenuto. Un segno di spunta indica che la richiesta è stata bloccata per gli utenti che non avevano ancora completato il processo KYC:

Per chiarezza, le aziende di servizi di raccolta dati non hanno alcun obbligo legale di bloccare questi siti web e alcuni di questi scenari possono rientrare in un uso legale. Ad esempio, un ricercatore potrebbe voler sfruttare i proxy per condurre un esperimento controllato sui social media. Tuttavia, dato il potenziale di abuso in questi scenari, ci aspettavamo che i servizi di raccolta dati li bloccassero per gli utenti che non hanno completato il processo KYC.

Come i marchi comunicano i domini che bloccano
  • Bright Data elenca le categorie di domini limitate nella propria policy di utilizzo accettabile.
Rispetto delle preferenze dei siti web riguardo alla raccolta automatizzata dei dati

Che cos'è robots.txt?

robots.txt è il nome di un file per implementare il Robots Exclusion Protocol. Questo protocollo viene utilizzato dai siti web per indicare le parti del sito che il proprietario preferisce che i bot non visitino. L'aderenza a robots.txt è volontaria.

Pro e contro dell'aderenza a robots.txt

  • Rispetta le preferenze del sito web.
  • Potrebbe non essere aggiornato di recente e quindi essere obsoleto.
  • In genere contiene termini che indicano che il proprietario del sito preferisce che determinate sezioni pubbliche del sito non siano accessibili ai bot.

Robots.txt può anche fornire un accesso disomogeneo ai bot. Ad esempio, i proprietari di siti web possono indicare che non preferiscono che i bot dei motori di risposta visitino determinati URL che i bot dei motori di ricerca visitano.

Robots.txt non è un documento legale e può richiedere di bloccare l'accesso dei bot a pagine che sono legalmente:

  • consentite allo scraping (ad es. dati pubblici) o
  • non consentite allo scraping (ad es. dati dietro un accesso in cui i Termini e condizioni del proprietario del sito vietano lo scraping di tali dati).

I fornitori di servizi di raccolta dati web possono richiedere agli utenti di proxy residenziali di completare un processo KYC e dimostrare di avere un caso d'uso legale ed etico prima che questi utenti possano ignorare robots.txt.

Per i test, abbiamo inviato richieste a pagine in sottocartelle che robots.txt richiede di bloccare. I domini che abbiamo utilizzato erano aimultiple.com e 5 domini web tra i 100 domini web più visitati. Bright Data ha bloccato queste richieste:

Esempio CNN

robots.txt di CNN blocca la cartella /terms14. Per i test, abbiamo navigato in quella cartella con proxy residenziali e ricevuto 200 messaggi con i dati della pagina da tutti i fornitori tranne Bright Data. La risposta di Bright Data è: “Residential Failed (bad_endpoint): il sito richiesto non è disponibile per la modalità di accesso residenziale immediato (senza KYC) in conformità con robots.txt. Per ottenere l'accesso residenziale completo per questo sito, compila il modulo KYC: https://brightdata.com/cp/kyc.

Gestione degli abusi

Abbiamo delineato una metodologia per valutare le pratiche di gestione degli abusi dei fornitori e raccolto dati per soddisfare i nostri criteri di valutazione:

* Non applicabile: Zyte acquista proxy da altri fornitori di proxy e pertanto, quando il servizio di Zyte viene utilizzato per abusi, i proprietari dei siti web contatterebbero i suoi fornitori di proxy piuttosto che Zyte.

Sebbene tutti i fornitori offrano mezzi per essere contattati da 3rd parti o dai loro clienti, disporne è importante per la risoluzione dei problemi:

  • Policy pubblica sugli abusi
  • Un indirizzo email dedicato per segnalare gli abusi
  • Un metodo di contatto alternativo (ad es. modulo web o interfaccia di messaggistica) che consenta ai segnalatori di contattare l'azienda. Ciò è utile perché le email possono essere filtrate e potrebbero non raggiungere la casella di posta.
  • Reattività ai messaggi

3 fornitori nel benchmark (Bright Data) hanno fornito un'email per segnalare gli abusi. Tutti questi fornitori hanno inoltre illustrato le proprie policy in questo ambito.

Ci aspettiamo che tutti gli altri fornitori facciano lo stesso e che questa diventi una pratica di settore diffusa nel breve termine.

Infine, abbiamo valutato la reattività nella gestione degli abusi inviando segnalazioni di abuso da domini di terze parti (ovvero non-AIMultiple) e misurando i tempi di risposta. Se non siamo riusciti a trovare un indirizzo email per gli abusi, abbiamo inviato la segnalazione al modulo di contatto generale. Abbiamo testato questo tramite 3 gruppi di email inviate il:

  • Venerdì 2 maggio 2025 da:
    • Un servizio di vendita di biglietti con un traffico mensile di ~30k
    • Uno studio legale con un traffico mensile di ~1k
  • 17 maggio 2025 dal servizio di vendita di biglietti.
  • 24 maggio 2025 da un'agenzia di social media con traffico online limitato.

Le prime email inviate il 2 maggio 2025 sono state inviate alle aziende che fornivano email dedicate. In seguito, abbiamo ampliato il nostro elenco e incluso indirizzi email più generali elencati nelle sezioni di contatto di tutti i servizi di raccolta di dati web oggetto del benchmark. Se un'azienda rispondeva alle nostre email, smettevamo di inviarle ulteriori email.

Nelle nostre email, abbiamo menzionato che i nostri siti web avevano ricevuto sospetto traffico bot tramite proxy e abbiamo chiesto il loro supporto per identificare la fonte dei proxy. Siamo riusciti a ottenere risposta da tutti i team di conformità tranne uno. Quasi tutte le risposte sono arrivate lo stesso giorno.

Trasparenza d'uso

Storicamente i proprietari di siti web che forniscono dati web e servizi di raccolta web non hanno avuto scambi di dati sulle attività di raccolta. Per limitare le attività di crawling, i proprietari di siti web potevano:

  • Contattare i servizi di raccolta di dati web per segnalare abusi
  • Collaborare con fornitori di gestione dei bot come Cloudflare per rendere il crawling più difficile.

Ora esistono iniziative per uno scambio di dati più strutturato tra queste parti. Bright Data ha lanciato la console per webmaster di Bright Data per consentire ai webmaster di monitorare le attività di crawling sui propri siti web. È probabile che una maggiore trasparenza migliori le pratiche di raccolta dei dati web.

La nostra esperienza con la console Webmaster

Ci siamo registrati verificando la proprietà del nostro dominio e aggiungendo un file collectors.txt sul dominio.

Ora abbiamo accesso all'attività dei bot di Bright Data sul nostro sito web:

Benchmark: fornitura etica

* Sono state incluse le recensioni su queste piattaforme di 3rd parti: Amazon Appstore, App Store, Google Play Store, Trustpilot. Per comodità, questo valore è stato calcolato per 5 app principali di Bright Data, non per tutte le 120 app presenti sul loro sito web.

Trasparenza dei partner

La larghezza di banda richiesta dalle aziende di infrastrutture per dati web può essere fornita in modo etico offrendo benefici (ad es. pagamenti, funzionalità come la possibilità di saltare la pubblicità) in cambio del consenso a condividere la propria connessione Internet. Tuttavia, è anche possibile ottenere accesso non autorizzato ai sistemi degli utenti retail e vendere le loro connessioni.

I fornitori di infrastrutture per dati web possono formulare policy e processi, condurre audit esterni e pubblicare il proprio approccio e i risultati degli audit per creare trasparenza su come acquisiscono le connessioni Internet. Ciò può favorire la fiducia nella fornitura etica del loro servizio.

Abbiamo creato un framework per la trasparenza lato fornitura nei dati web e valutato i fornitori utilizzando questo framework. Abbiamo applicato questo framework indipendentemente dal fatto che un servizio di raccolta dati web acquisisse gli IP residenziali direttamente o tramite altri proxy. Il nostro obiettivo è portare trasparenza all'intera supply chain degli IP, poiché le pratiche non etiche possono originare in qualsiasi punto della supply chain.

Qui puoi trovare i nostri risultati dettagliati:

Bright Data

Bright Data è classificato come Livello 5 poiché pubblica

  • Il proprio approccio di approvvigionamento e come gli sviluppatori di app possono collaborare con loro tramite il loro SDK15 16
  • Sono stati condivisi pubblicamente dettagli su 120 fornitori. Abbiamo potuto verificare le recensioni di questi fornitori su piattaforme di 3rd parti per stimare quanto sono popolari. 17

Revisione delle app selezionate

Bright Data condivide 120 app sul proprio sito web. App come Bright VPN sono certificate da 3rd parti per la loro divulgazione e UX.18 Abbiamo anche scaricato queste app per vederle in maggiore dettaglio:

  • Bright VPN
  • EarnApp
  • Sling Kong

Modulo di opt-in con obbligo di non raccogliere dati personali identificativi: Modulo di consenso con una spiegazione chiara da

Bright VPN:

Earn App:

Schermata mobile di EarnApp intitolata

Sling Kong:

  • L'offerta viene presentata all'utente durante il gioco:
Offerta del gioco mobile Sling Kong mostrata durante il gioco: al giocatore vengono offerte 500 monete di gioco per consentire all'indicizzazione web di Bright Data di usare le risorse libere del dispositivo e l'indirizzo IP.
  • Opt-in:
La stessa offerta di opt-in di Sling Kong per 500 monete in cambio della possibilità per Bright Data di eseguire l'indicizzazione web, seguita da un secondo screenshot della stessa schermata oscurata mentre inizia a comparire un overlay informativo aggiuntivo.
  • Informazioni aggiuntive durante l'opt-in:
Schermata di opt-in di Sling Kong oscurata dietro un popup informativo che afferma che Bright Data non traccia l'utente, ma l'indirizzo IP verrà utilizzato per supportare la ricerca accademica, aiutare i marchi a tracciare venditori di prodotti contraffatti, raccogliere dati web pubblici come prezzi e recensioni dei prodotti e aggregare informazioni di viaggio come voli e prezzi degli hotel.
  • Opt-out:
Impostazione di indicizzazione web di Sling Kong nel gioco, che mostra un interruttore on/off accanto a un pulsante Info.Finestra di conferma di Sling Kong che informa che l'utente ha rinunciato con successo all'indicizzazione web e può aderire di nuovo in qualsiasi momento, con un pulsante OK.

Valore fornito dalle app:

  • Bright VPN: servizio VPN gratuito
  • EarnApp: pagamenti
  • Sling Kong: valuta virtuale di gioco
Altri

Sebbene la maggior parte dei fornitori sia consapevole dell'etica nello scraping web e abbia pubblicato sull'argomento (ad es. 19, non abbiamo identificato impegni specifici al riguardo tranne che per Zyte.20

Ci aspettiamo che questo cambi e che la maggior parte dei fornitori passi almeno al Livello 1 nel breve termine.

Certificazione esterna

* Indica che l'azienda ha ottenuto tutte le certificazioni esterne in questa categoria

È fondamentale che i fornitori dispongano di sistemi, personale e processi adeguati per proteggere i dati dei clienti e mettere in sicurezza le app che forniscono i loro IP. Consulta la nostra metodologia di misurazione della certificazione esterna per vedere la logica alla base del nostro punteggio.

Conformità a GDPR e CCPA

Tutti i fornitori dichiarano pubblicamente di essere conformi a entrambe le normative sulla privacy dei dati. Pertanto, questo non è stato incluso nel punteggio.

Come abbiamo misurato la maturità organizzativa

Sulla base delle capacità che abbiamo identificato in questo ambito, abbiamo verificato l'esistenza di questi certificati presso ciascun fornitore utilizzando le loro dichiarazioni pubbliche:

  • Certificazione di sicurezza dei dati e certificazione PII: 21222324
  • Fonte IP nella whitelist: 25
  • Pratiche etiche valutate: 26

Alcuni fornitori che non possiedono certificati ISO 27018 hanno affermato che dovrebbero essere considerati certificati poiché utilizzano fornitori di servizi cloud che possiedono certificati ISO 27018. Il parere del nostro consulente di cybersecurity è stato che, sebbene ciò faciliterebbe l'ottenimento del certificato, dovrebbero comunque far certificare le proprie policy e i propri controlli per acquisire il certificato.

Copertura assicurativa

3 aziende di raccolta di dati web hanno condiviso i propri certificati assicurativi. Non pubblichiamo i certificati, ma abbiamo esaminato i documenti per assicurare che

  • coprissero queste 2 categorie assicurative
  • Il limite assicurativo in ciascuna categoria sia almeno su scala multimilionaria in dollari USA.

Alleanze di settore e dati web etici

Esistono 2 principali alleanze di settore:

  • Alliance for Responsible Data Collection, che include Bright Data, Common Crawl e altri
  • Ethical Web Data Collection Initiative (EWDCI), che include Oxylabs, ProxyEmpire, Zyte, tra gli altri. Includeva NetNut fino a quando NetNut è stato chiuso dall'FBI, quindi la partecipazione a un'alleanza di settore non ha impedito alle aziende di violare la legge.
Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

Disclaimer e raccomandazioni per i prossimi passi

Tutti i fornitori in questo benchmark, ad eccezione di Nimble, sono clienti di AIMultiple. Come sempre, durante questa ricerca abbiamo seguito i nostri impegni etici.

Abbiamo completato una revisione esaustiva della raccolta etica di dati web e, sebbene siamo soddisfatti della portata di questo benchmark, ci piacerebbe aumentarne la partecipazione. Ringraziamo queste aziende per aver condiviso la propria copertura assicurativa: Apify, Bright Data, Zyte.

Stiamo aspettando risposte da Nimble. Aggiorneremo il report non appena avremo ulteriori aggiornamenti da parte loro. 2 fornitori hanno scelto di non partecipare a questa iterazione del benchmark. Aggiorniamo sempre questo report se una qualsiasi di queste 7 aziende suggerisce modifiche basate sui fatti, eque per tutti i fornitori e utili per aiutare le imprese a prendere decisioni migliori.

NetNut era tra le aziende che abbiamo valutato quando abbiamo pubblicato per la prima volta questo report nel 2025. Avevano il punteggio più basso possibile (Livello 0) nel nostro approfondimento sulla fornitura etica, in cui abbiamo esaminato le fonti degli IP di questi fornitori. NetNut è stato chiuso nel 2026 dopo che l'FBI ha identificato i suoi legami con le botnet.27 Speriamo che questo sia un incentivo per tutti i fornitori a essere trasparenti sul proprio approvvigionamento.

Secondo la nostra ricerca, questo è il primo report incentrato sui dati web etici. Speriamo che questa trasparenza possa aiutare il settore dei dati web a trovare soluzioni creative alle sue sfide. Queste soluzioni dovranno bilanciare gli interessi dei raccoglitori di dati web, degli utenti dell'automazione web, dei proprietari di siti web e degli utenti residenziali che forniscono i propri IP al settore.

Limiti della metodologia

Questo benchmark misura indicatori di maturità osservabili, inclusi i controlli sull'uso da parte dei clienti, la trasparenza nella fornitura di IP, le certificazioni esterne e la condivisione di assicurazioni. Tuttavia, il punteggio non determina completamente se un fornitore sia legalmente conforme in ogni caso d'uso del cliente.

Pertanto, un punteggio elevato nel benchmark dovrebbe essere considerato un input per la due diligence di procurement, non una garanzia di legalità o uso etico.

Riferimenti

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Cem Dilmegani (2026) - "Benchmark sui dati web etici e conformi". Pubblicato online su AIMultiple.com. Consultato il 4 Agosto 2026, da: https://aimultiple.com/web-scraping-ethics [Risorsa online]

Dilmegani, C. (2026, 4 Agosto). Benchmark sui dati web etici e conformi. AIMultiple. https://aimultiple.com/web-scraping-ethics

@misc{dilmegani2026,
  author = {Dilmegani, Cem},
  title  = {{Benchmark sui dati web etici e conformi}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/web-scraping-ethics}},
  note   = {AIMultiple. Consultato il 4 Agosto 2026}
}
Scarica tutti i dati

Risultati e timestamp di 66 punti dati. Scarica i dati utilizzati in questo articolo come file ZIP contenente 8 file CSV.

Ultimo aggiornamento: 17 Agosto 2026
Scarica

Registro delle modifiche

8 aggiornamenti
  1. 2026

    Ridotto il benchmark da 7 a 5 servizi di raccolta dati web, con due fornitori che hanno scelto di non essere inclusi.

  2. Aggiunta una sezione sui limiti metodologici alla fine del benchmark.

  3. 2025

    Aggiunti codici fornitore all'introduzione della sezione "Ethical & Compliant Web Data Benchmark".

  4. Espansi i dati dell'esempio reale nella sezione Rischio reputazionale.

  5. Sostituita la sezione "Ethical & Compliant Web Data Benchmark" con una nuova valutazione dei servizi di raccolta dati web.

  6. Aggiunte le Organizzazioni per il Web Scraping Etico alla sezione Ulteriori letture.

  7. Aggiornati gli esiti dei casi Meta vs Bright Data e X Corp. vs Bright Data nella sezione "Storia delle principali cause legali di web scraping".

  8. 2024

    Aggiornati i dati del caso "eBay vs Bidder's Edge" nella sezione "Casi Legali".

Collegamenti di riferimento

1.
Workers Fainted at Nike Clothing Factory Despite a Vow to Reform — ProPublica
ProPublica
2.
2023 MOVEit data breach - Wikipedia
Contributors to Wikimedia projects
3.
https://www.courthousenews.com/wp-content/uploads/2024/01/starbucks-labor-rights-violations-suit.pdf
4.
Verifying Device
5.
Court Rules in Favor of Bright Data in Meta v. Bright Data Case - Bright Data
Bright Data
6.
Popa: From Sourcing to Distribution | Synthient
Synthient
7.
‘Popa’ Botnet Linked to Publicly-Traded Israeli Firm – Krebs on Security
8.
https://media.defense.gov/2024/Sep/18/2003547016/-1/-1/0/CSA-PRC-LINKED-ACTORS-BOTNET.PDF
9.
Internet Crime Complaint Center (IC3) | Home Internet Connected Devices Facilitate Criminal Activity
10.
A Look at the Residential Proxy Market | Intel 471
Website
11.
Satori Threat Intelligence Alert: PROXYLIB and LumiApps Transform Mobile Devices into Proxy Nodes - HUMAN Security
HUMAN Security
12.
Kimwolf Botnet Lurking in Corporate, Govt. Networks – Krebs on Security
13.
Subscribe to read
Financial Times
14.
https://edition.cnn.com/robots.txt
15.
Ethically Sourcing Residential Proxies | Bright Data
Bright Data
16.
homepage - Bright SDK
Bright SDK
17.
How Bright Data Obtains Its Residential IPs - Bright Data
Bright Data
18.
Bright VPN Compliance with guidelines - Google Sheets
19.
What is ethical scraping and how do you do it?
Apify Blog
20.
Web Scraping Data Compliance | Zyte
21.
Page not found - Bright Data
Bright Data
22.
Security | Platform | Apify Documentation
23.
Nimble Trust Center | Security, Compliance & Reliability
24.
Trust Center | Zyte
25.
Bright SDK Compliance with Guidelines - Google Sheets
26.
pwc-report - Bright Data
Bright Data
27.
FBI Seizes NetNut Proxy Platform, Popa Botnet – Krebs on Security
Cem Dilmegani
Cem Dilmegani
Analista principale
Cem è analista principale presso AIMultiple dal 2017.

Il lavoro di Cem presso AIMultiple è stato citato da importanti testate internazionali tra cui Business Insider, Forbes, Morning Brew e Washington Post, da aziende globali come Deloitte e HPE, da ONG come il World Economic Forum e da organizzazioni sovranazionali come la Commissione europea. [1], [2], [3], [4], [5]

Nel corso della sua carriera, Cem ha lavorato come consulente tecnologico, acquirente tecnologico e imprenditore tecnologico. Ha consigliato le aziende sulle loro decisioni tecnologiche presso McKinsey & Company e Altman Solon per più di un decennio. Ha inoltre pubblicato un report McKinsey sulla digitalizzazione.

Ha guidato la strategia tecnologica e gli approvvigionamenti di una società di telecomunicazioni rispondendo direttamente al CEO. Ha inoltre guidato la crescita commerciale dell'azienda deep tech Hypatos, che ha raggiunto ricavi ricorrenti annuali a 7 cifre e una valutazione a 9 cifre partendo da zero in 2 anni. Il lavoro di Cem in Hypatos è stato ripreso da importanti testate tecnologiche come TechCrunch e Business Insider.

Cem interviene regolarmente a conferenze tecnologiche internazionali. Si è laureato come ingegnere informatico presso l'Università di Bogazici e possiede un MBA della Columbia Business School.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450