Crunchbase è protetto dal sistema anti-bot aziendale di Cloudflare, che blocca la maggior parte degli scraper automatizzati. Anche strumenti avanzati come Selenium spesso restituiscono errori 403 o infinite pagine con scritto “Solo un momento…”.
Impara come estrarre dati da Crunchbase con Python: configurare l'ambiente, utilizzare un sbloccatore web per aggirare le restrizioni ed estrarre dati dai risultati della ricerca di Crunchbase e dalle pagine aziendali.
Risultato del benchmark dello scraper Crunchbase API
Il grafico mostra il tasso di successo giornaliero degli scraper Crunchbase API:
Per dettagli su come vengono raccolte queste metriche, consulta la metodologia completa del benchmark per lo scraping di Crunchbase metodologia.
Come estrarre dati da Crunchbase con Python
In questo tutorial di scraping con Python, mostreremo come raccogliere dati da Crunchbase, inclusi nomi delle aziende, descrizioni, siti web, sedi principali, numero di dipendenti, round di finanziamento e metriche di crescita.
Abbiamo utilizzato Bright Data Web Unlocker per aggirare le sfide anti-bot e mantenere un accesso stabile.
Passo 1: Configurazione
Inizia installando le librerie Python necessarie per lo scraping web e configurando il nostro proxy per l'API di Crunchbase API.
Gli slug aziendali sono gli identificatori URL univoci su Crunchbase (ad esempio, se l'URL della pagina è crunchbase.com/organization/anthropic, lo slug è anthropic).
Passo 2: Effettuare richieste tramite sbloccatore web
Invece di inviare richieste dirette a Crunchbase, utilizziamo l'API del web unlocker API per aggirare i sistemi anti-bot e garantire risultati costanti. Questo metodo è ideale per lo scraping su larga scala di Crunchbase, poiché restituisce risposte HTML pulite gestendo automaticamente i CAPTCHA e i ritardi nel rendering di JavaScript.
Passo 3: Analizzare il contenuto HTML
Analizziamo l'HTML restituito da Crunchbase utilizzando BeautifulSoup, estraendo il testo per l'estrazione di dati strutturati. Questo passaggio è essenziale per qualsiasi scraper Python per Crunchbase, poiché ci permette di individuare elementi come il nome dell'azienda, la descrizione e l'URL del sito web.
Passo 4: Estrarre il nome dell'azienda
Qui estraiamo il nome dell'azienda dal tag <title> della pagina Crunchbase. Il nome appare prima del primo trattino e utilizziamo le espressioni regolari per catturarlo e pulirlo. Ciò garantisce che il nostro scraper Crunchbase raccolga solo nomi di aziende validi, non titoli di sistema o segnaposto.
Passo 5: Estrarre la descrizione dell'azienda
Il tag meta description ci fornisce un riassunto standardizzato dell'azienda. È un'ottima fonte di descrizioni aziendali coerenti per costruire uno scraper di dati aziendali o un dataset di arricchimento.
Passo 6: Estrarre l'URL del sito web dell'azienda
Questo blocco estrae l'URL del sito web ufficiale dell'azienda da Crunchbase. Poiché Crunchbase visualizza i domini come testo del link visibile, filtriamo i link interni di Crunchbase e identifichiamo i siti web validi delle aziende.
Passo 7: Estrarre la posizione della sede principale
Individuiamo la città o il paese della sede principale cercando i link di Crunchbase che corrispondono a modelli URL di posizione noti. Estrarre questo dato garantisce che i tuoi dati Crunchbase includano metadati di posizione utili per analisi regionali o segmentazione di mercato.
Passo 8: Estrarre il numero di dipendenti
Lo scraper dei dati Crunchbase tenta di estrarre il numero di dipendenti utilizzando i tag strutturati in Crunchbase. Se non disponibile in formato link, ricorre alla ricerca in span di testo (ad esempio, “da 1001 a 5000 dipendenti”). Ciò garantisce dati affidabili sulla dimensione dell'azienda per analisi e segmentazione.
Passo 9: Estrarre le informazioni sui finanziamenti
Questa parte del tutorial di scraping di Crunchbase estrae le informazioni sui round di finanziamento (ad esempio, Serie A, Seed, Serie F) e i valori totali raccolti.
Indirizzando campi di finanziamento strutturati, questo metodo consente al tuo scraper Python per Crunchbase di raccogliere dati accurati sugli investimenti delle startup per analisi di tendenza e crescita.
Passo 10: Estrarre i punteggi di crescita e di popolarità
La documentazione attuale di Crunchbase colloca anche questi segnali come parte di un livello predittivo più ampio che può includere informazioni sulla crescita, previsioni di finanziamento e altri indicatori futuri. Ciò significa che lo scraping del testo della pagina potrebbe non catturare più tutto il contesto ora disponibile attraverso flussi di lavoro autorizzati di Crunchbase.
Estraiamo i punteggi di crescita e di popolarità per misurare l'impulso dell'azienda. Poiché Crunchbase non fornisce sempre una struttura HTML coerente per questi valori, lo scraper Crunchbase utilizza le espressioni regolari per rilevarli direttamente dal testo.
Se hai accesso autorizzato, le interfacce ufficiali del prodotto Crunchbase o pacchetti API potrebbero essere una fonte più stabile per questi segnali rispetto all'analisi HTML.
Passo 11: Costruire i risultati e salvare l'output
Infine, strutturiamo tutti i dati aziendali di Crunchbase, inclusi nome, descrizione, finanziamenti, dimensioni e punteggi, in un dizionario, aggiungiamo un breve ritardo tra le richieste (per uno scraping sicuro) e salviamo l'output come crunchbase_data.json.
Ciò garantisce che la tua pipeline di estrazione dei dati di Crunchbase produca risultati puliti e strutturati pronti per l'analisi, dashboard o integrazione in pipeline di dati.
Esempio di output
Questo output dimostra come lo scraper Python per Crunchbase struttura ed esporta i dati.
Ogni voce include il nome, la descrizione, i finanziamenti, la posizione, la dimensione del personale e i punteggi di prestazione dell'azienda, tutti formattati in JSON per una facile integrazione in strumenti di analisi o database.
Perché lo scraping di Crunchbase è difficile
Abbiamo provato diversi metodi prima di trovare un approccio affidabile che funzionasse per Crunchbase. Ogni metodo convenzionale ha fallito a causa del sistema anti-bot avanzato di Cloudflare. La protezione di Crunchbase non si basa su semplici controlli IP. Cloudflare esegue un'impronta digitale del browser approfondita, analizzando dozzine di indicatori:
- Modelli di handshake TLS
- Comportamento di esecuzione di JavaScript
- Completezza delle API del browser
- Impronte digitali di Canvas e WebGL
- Tempistica dei movimenti del mouse e focus della finestra
Anche se utilizzi proxy, Cloudflare può comunque identificare l'impronta digitale del tuo client. I normali proxy per scraping nascondono solo il tuo IP; non emulano il comportamento di un browser reale.
Le semplici richieste HTTP non hanno funzionato
Abbiamo iniziato con la libreria requests di Python per inviare semplici richieste GET agli URL di Crunchbase. Ogni tentativo ha restituito 403 Forbidden. I server di Crunchbase hanno immediatamente rilevato la firma del bot e si sono rifiutati di fornire qualsiasi contenuto.
Aggiungere intestazioni del browser ha comunque fallito
Successivamente, abbiamo provato ad aggiungere stringhe User-Agent, intestazioni Accept e altri metadati simili a quelli del browser per imitare un comportamento legittimo. Abbiamo testato diversi profili e combinazioni, ma ogni richiesta è stata bloccata. Il sistema di Cloudflare li ha rilevati tutti istantaneamente.
Selenium con Chrome si è bloccato su Cloudflare
Siamo passati a Selenium, pensando che automatizzare un vero browser Chrome avrebbe risolto il problema. Invece, abbiamo incontrato ogni volta la pagina di verifica di Cloudflare con scritto “Solo un momento…”. Lo spinner di caricamento girava all'infinito e anche se a volte riuscivamo a passare, ci trovavamo di fronte a CAPTCHA che non potevano essere risolti in modo programmato.
Undetected ChromeDriver era instabile
Abbiamo quindi testato Undetected-ChromeDriver, che modifica Selenium per farlo apparire più simile a un utente umano. Anche se ha funzionato brevemente, abbiamo riscontrato problemi di compatibilità del browser e sfide intermittenti di Cloudflare. Alcune pagine si caricavano correttamente, ma le successive venivano bloccate senza alcun modello chiaro, troppo instabile per un uso in produzione.
La soluzione funzionante: gli sbloccatori web
Dopo aver testato diversi metodi, abbiamo scoperto che questa era l'unica soluzione affidabile per uno scraping di Crunchbase coerente e scalabile. Gli sbloccatori web risolvono questo problema eseguendo veri browser nel cloud, completi di impronte digitali, esecuzione di JavaScript e risoluzione di CAPTCHA. Essi:
- Ruotano automaticamente IP residenziali
- Randomizzano le impronte digitali del browser
- Eseguono il rendering completo del browser (JavaScript, cookie, contenuti dinamici)
- Risolvono CAPTCHA e sfide di Cloudflare in tempo reale
A differenza dei proxy che cambiano solo la tua posizione di rete, gli sbloccatori web replicano il comportamento di un utente reale, che è ciò che Cloudflare si aspetta.
Metodologia del benchmark per lo scraping di Crunchbase
Valuta le prestazioni dello scraping delle pagine aziendali di Crunchbase, misurando il successo delle richieste, il tempo di risposta e l'affidabilità in condizioni costanti.
- URL di destinazione: 100 pagine aziendali di Crunchbase (crunchbase.com/organization…)
- Intervallo di richiesta: ogni 15 minuti
- Limite di timeout: 60 secondi
- Frequenza di valutazione: giornaliera
Ogni richiesta utilizza la stessa configurazione per consentire un confronto diretto tra i tentativi.
Criteri di successo:
Una richiesta è considerata riuscita se:
- Il codice di stato HTTP è compreso tra 200 e 399, e
- La risposta contiene dati aziendali validi di Crunchbase rilevati da selettori CSS predefiniti o controlli dei byte del contenuto.
Le risposte vuote o malformate sono contrassegnate come fallite.
Classificazione degli errori:
- Timeout: >60s, contrassegnato come fallito
- Errori di rete: registrati con dettagli
- Errori di decodifica: errore di analisi
- Risposte vuote o malformate: contenuto mancante
Raccolta dati giornaliera:
Alla fine della giornata, i risultati vengono aggregati per calcolare il risultato finale. Queste metriche quantificano l'affidabilità e le prestazioni dello scraping di Crunchbase.:
- Tasso di successo giornaliero
- Tempo medio di risposta
- Distribuzione degli errori
FAQ
Lo scraping di dati pubblicamente disponibili dalle pagine di Crunchbase è generalmente legale se fatto in modo responsabile e per scopi personali o di ricerca. Tuttavia, lo scraping automatizzato potrebbe violare i Termini di Servizio di Crunchbase, specialmente per usi su larga scala o commerciali. Controlla il loro API ufficiale prima di intraprendere qualsiasi progetto di scraping di dati.1
Puoi estrarre punti dati aziendali pubblici, inclusi nome dell'azienda, fascia di ricavi, profilo aziendale, tipo di organizzazione, tipo di azienda e email di contatto. Evita di raccogliere informazioni personali o private, come email personali o link LinkedIn.
Puoi usare l'API di Crunchbase quando:
* Devi raccogliere dati su larga scala
* Richiedi aggiornamenti frequenti (giornalieri o orari).
* Pensi di integrare i dati di Crunchbase a livello commerciale o rivendere informazioni.
Per analisi della concorrenza, ricerca su startup, generazione di lead di vendita o business intelligence, i dati strutturati sulle aziende sono essenziali. Utilizzare uno scraper di Crunchbase può aiutare ad automatizzare la raccolta e l'elaborazione di grandi volumi di dati.
Sì, l'API di Crunchbase fornisce accesso strutturato ai dati su aziende, finanziamenti e persone. Tuttavia, ha limitazioni significative:
* Richiede una licenza dati a pagamento o un abbonamento per un accesso più ampio o completo ai dati
* Le richieste al minuto o al giorno sono limitate a seconda del piano utilizzato
* Campi dati come il punteggio di crescita o il punteggio di popolarità potrebbero non essere disponibili nel piano gratuito.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{karatas2026,
author = {Karatas, Gulbahar},
title = {{Crunchbase Scraper (Python): Tutorial e Benchmark}},
year = {2026},
month = mar,
howpublished = {\url{https://aimultiple.com/crunchbase-scraper}},
note = {AIMultiple. Consultato il 13 Marzo 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.