Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti
L'identificazione dei clienti fa parte della due diligence commerciale. Abbiamo testato 16 modelli nella ricerca di elenchi clienti per tre siti di ricerca e recensioni, uno dei quali AIMultiple, valutando i loro invii rispetto alle chiavi di risposta da noi compilate e alle pagine citate.
Risultati del benchmark sull'identificazione dei clienti
Non abbiamo impostato alcun livello di ragionamento per nessun modello. Ogni modello è stato eseguito con l'impostazione predefinita del proprio programma agente e il modello di valutazione è stato chiamato con temperatura 0.
- Fable 5.1 ottiene 90.2, la media più alta dei 16 modelli. Opus 5 segue a 89.1 e GLM 5.3 a 81.0.
- GLM 5.3 ha ottenuto tra 79.6 e 83.3 su tutti e tre i target. Claude Sonnet 5 ha ottenuto 90.8 su uno e 0.0 su un altro, e Gemini 3.8 Flash ha ottenuto 87.0 e 9.2. Le medie di 48.0 e 60.7 non descrivono le esecuzioni di nessuno dei due modelli.
Difficoltà dei target
I punteggi mediani sono 64.3 sul primo target, 59.2 sul secondo e 87.0 sul terzo. Dieci dei 16 modelli ottengono almeno 84 sul terzo, la cui chiave di risposta contiene 18 clienti, quindi un cliente corretto vale 5.6 dei 100 punti di copertura che rappresentano metà del punteggio.
Il punteggio di ciascun modello è la media di tutti e tre i target. Eliminare un target facile dopo aver visto i punteggi distorcerebbe il confronto. Il prossimo turno richiede aziende target più difficili.
Confronto tra costi e punteggi
- Fable 5.1 ha una media di 90.2 a $4,38 per attività. Opus 5 ha una media di 89.1 a $8,51, il costo più alto tra i 15 modelli con importi in dollari. GLM 5.3 ha una media di 81.0 a $1.40.
- Grok 4.6 ha una media di 80.5 a $0,42 per attività, un ventesimo di quanto costa Opus 5 per 8.6 punti in meno.
- GPT 6 Astra ha una media di 74.2. Le sue tre attività in abbonamento hanno utilizzato 279.253 token e Codex CLI non registra costi in dollari, quindi il grafico dei costi lo omette.
Perché il lavoro sulle liste clienti mette alla prova gli agenti IA?
Un elenco clienti richiede un nome e una prova della relazione commerciale. Un elenco plausibile può comunque citare pagine che confrontano solo prodotti.
Le fonti pubbliche possono confermare un singolo rapporto con un cliente. Questo benchmark non verifica se un elenco sia completo.
Un cliente reale può essere assente dalla chiave di risposta. Un invio guadagna credito per un cliente quando la pagina citata dimostra la relazione e perde punti di copertura per un'azienda extra non supportata.
Metodologia
Copertura dei modelli
Il grafico dei punteggi utilizza i 16 modelli selezionati per questa campagna di benchmark. Cinque modelli superati restano nei dati storici e non vengono rappresentati nel grafico. I punteggi vanno da 0 a 100 e le etichette delle barre sono arrotondate ai punti interi.
Il benchmark IT agentica utilizza una scala diversa, quindi i suoi punteggi non sono confrontabili.
Attività e invii
Il primo target è AIMultiple, l'editore di questo benchmark, e la sua chiave di risposta è stata compilata da un analista di AIMultiple. Il secondo target è un sito di recensioni software e il terzo una società di ricerca per analisti.
Le tre chiavi di risposta contengono 45, 65 e 18 clienti e sono state tenute nascoste ai modelli testati. L'esecuzione copre 48 assegnazioni modello-azienda e 47 elenchi clienti non vuoti; Inkling Small non ha prodotto righe cliente sulla seconda azienda e ha ottenuto zero punti lì.
Ogni punteggio utilizza un invio per azienda. Gli invii vanno da luglio a settembre e alcuni sostituiscono tentativi precedenti.
Riponderare i tre target su tutte le 27 estrazioni ordinate con reinserimento colloca il 95% centrale delle medie di Fable 5.1 tra 86.0-94.8 e quelle di Opus 5 tra 82.4-96.1, quindi l'intervallo di Fable 5.1 ricade all'interno di quello di Opus 5. Abbiamo riponderato solo questi tre target e non abbiamo misurato la variazione tra un'esecuzione e l'altra.
Costi ed esecuzione
Il costo per attività è la media tra le tre esecuzioni di un modello, inclusa l'esecuzione che non ha prodotto righe cliente. Un'attività corrisponde a un'azienda target. I costi in dollari coprono 15 dei 16 modelli e i dati sul tempo trascorso coprono 13 modelli.
Le cifre in dollari non sono tutte misurate allo stesso modo. Le esecuzioni su opencode includono il costo di OpenRouter per quella sessione. Le esecuzioni su Claude Code e Grok Build si autenticano tramite un abbonamento, quindi le loro cifre sono prezzi di listino applicati ai token segnalati dal programma. Codex CLI non registra alcun costo in dollari.
Ogni modello ha ricevuto un prompt congelato che indicava l'azienda e richiedeva un CSV con nomi delle aziende, URL LinkedIn, URL delle prove e date delle prove. Grok Build ha utilizzato la ricerca web nativa; gli altri programmi agente hanno raggiunto il web tramite Bright Data, uno degli strumenti di web scraping che confrontiamo.
Un programma agente fornisce al modello una shell e l'accesso al web, quindi un punteggio riflette sia il modello sia il programma in cui è stato eseguito. I prezzi di listino dei provider sono disponibili nel nostro confronto LLM pricing.
Punteggio e prove
La copertura dei clienti rappresenta 50% del punteggio, l'accuratezza su LinkedIn 17%, la qualità delle prove 17% e la recenza delle prove 16%.
La valutazione è stata eseguita il 10 settembre 2026. Accetta prove datate dal 10 settembre 2025 al 12 settembre 2026, i 12 mesi precedenti la valutazione più due giorni. Un URL citato che restituisce 404 o 410 limita quell'invio a 40 e in questa tornata nessun invio ha raggiunto il limite.
Il codice controlla formattazione, nomi, duplicati, date e stato degli URL. Claude Sonnet 5 legge un estratto di ogni pagina citata e giudica se conferma la relazione. Claude Sonnet 5 è anche uno dei 16 modelli valutati e i modelli Anthropic occupano i primi due posti. Non abbiamo verificato se un giudice Anthropic favorisca i modelli Anthropic.
Il prompt del giudice indica se l'azienda è presente nella chiave di risposta, quindi il verdetto del giudice non è indipendente dalla chiave. Abbiamo rieseguito il valutatore eliminando un'azienda da una chiave e, sulla stessa pagina e sullo stesso estratto, il suo verdetto è cambiato da cliente a menzione.
Il team del benchmark ha registrato una decisione al posto del verdetto del giudice su 58 righe, 30 contro il modello e 28 a favore. Cinquantaquattro provengono da una revisione del testo della pagina conservata del 9 settembre 2026 e quattro sono decisioni editoriali registrate il 10 settembre.
La valutazione accetta 140 righe al di fuori delle chiavi di risposta, 125 delle quali sul secondo target. Le righe supportate guadagnano gli stessi punti delle voci presenti nella chiave.
Ulteriori letture
- Benchmark AIM di marketing agentico
- Trading azionario basato sull'IA: quale strumento di IA generativa è migliore
- Benchmark di finanza con IA agentica
FAQ
Questo test ha verificato singole relazioni con i clienti a partire da prove pubbliche. Non ha valutato se un elenco sia completo.
Un semplice confronto non basta. Una pagina deve anche stabilire una relazione commerciale, come un cliente indicato per nome o un abbonato ai servizi della società di ricerca.
I valori di copertura derivano dalla chiave di risposta. Il giudice controlla la pagina citata da un modello, quindi un invio guadagna credito per i clienti supportati al di fuori della chiave.
Il test riguarda la ricerca di elenchi clienti. Non valuta la selezione degli investimenti, la valutazione o la qualità delle decisioni di un fondo.
Cita questo benchmark
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Consultato il 10 settembre 2026}
}Risultati e timestamp di 13 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente un file CSV e un README.
Vuoi i dati granulari che ci stanno dietro? Passa a Premium
Registro delle modifiche
1 aggiornamentiHa sostituito il benchmark di deal sourcing e mappatura dei concorrenti con un benchmark di identificazione clienti a 14 agenti.
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.