Premium
Servizi
Premium

Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
aggiornato il 10 set. 2026

L'identificazione dei clienti fa parte della due diligence commerciale. Abbiamo testato 16 modelli nella ricerca di elenchi clienti per tre siti di ricerca e recensioni, uno dei quali AIMultiple, valutando i loro invii rispetto alle chiavi di risposta da noi compilate e alle pagine citate.

Risultati del benchmark sull'identificazione dei clienti

Caricamento del grafico

Non abbiamo impostato alcun livello di ragionamento per nessun modello. Ogni modello è stato eseguito con l'impostazione predefinita del proprio programma agente e il modello di valutazione è stato chiamato con temperatura 0.

  • Fable 5.1 ottiene 90.2, la media più alta dei 16 modelli. Opus 5 segue a 89.1 e GLM 5.3 a 81.0.
  • GLM 5.3 ha ottenuto tra 79.6 e 83.3 su tutti e tre i target. Claude Sonnet 5 ha ottenuto 90.8 su uno e 0.0 su un altro, e Gemini 3.8 Flash ha ottenuto 87.0 e 9.2. Le medie di 48.0 e 60.7 non descrivono le esecuzioni di nessuno dei due modelli.

Difficoltà dei target

I punteggi mediani sono 64.3 sul primo target, 59.2 sul secondo e 87.0 sul terzo. Dieci dei 16 modelli ottengono almeno 84 sul terzo, la cui chiave di risposta contiene 18 clienti, quindi un cliente corretto vale 5.6 dei 100 punti di copertura che rappresentano metà del punteggio.

Il punteggio di ciascun modello è la media di tutti e tre i target. Eliminare un target facile dopo aver visto i punteggi distorcerebbe il confronto. Il prossimo turno richiede aziende target più difficili.

Confronto tra costi e punteggi

  • Fable 5.1 ha una media di 90.2 a $4,38 per attività. Opus 5 ha una media di 89.1 a $8,51, il costo più alto tra i 15 modelli con importi in dollari. GLM 5.3 ha una media di 81.0 a $1.40.
  • Grok 4.6 ha una media di 80.5 a $0,42 per attività, un ventesimo di quanto costa Opus 5 per 8.6 punti in meno.
  • GPT 6 Astra ha una media di 74.2. Le sue tre attività in abbonamento hanno utilizzato 279.253 token e Codex CLI non registra costi in dollari, quindi il grafico dei costi lo omette.

Perché il lavoro sulle liste clienti mette alla prova gli agenti IA?

Un elenco clienti richiede un nome e una prova della relazione commerciale. Un elenco plausibile può comunque citare pagine che confrontano solo prodotti.

Le fonti pubbliche possono confermare un singolo rapporto con un cliente. Questo benchmark non verifica se un elenco sia completo.

Un cliente reale può essere assente dalla chiave di risposta. Un invio guadagna credito per un cliente quando la pagina citata dimostra la relazione e perde punti di copertura per un'azienda extra non supportata.

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Metodologia

Copertura dei modelli

Il grafico dei punteggi utilizza i 16 modelli selezionati per questa campagna di benchmark. Cinque modelli superati restano nei dati storici e non vengono rappresentati nel grafico. I punteggi vanno da 0 a 100 e le etichette delle barre sono arrotondate ai punti interi.

Il benchmark IT agentica utilizza una scala diversa, quindi i suoi punteggi non sono confrontabili.

Attività e invii

Il primo target è AIMultiple, l'editore di questo benchmark, e la sua chiave di risposta è stata compilata da un analista di AIMultiple. Il secondo target è un sito di recensioni software e il terzo una società di ricerca per analisti.

Le tre chiavi di risposta contengono 45, 65 e 18 clienti e sono state tenute nascoste ai modelli testati. L'esecuzione copre 48 assegnazioni modello-azienda e 47 elenchi clienti non vuoti; Inkling Small non ha prodotto righe cliente sulla seconda azienda e ha ottenuto zero punti lì.

Ogni punteggio utilizza un invio per azienda. Gli invii vanno da luglio a settembre e alcuni sostituiscono tentativi precedenti.

Riponderare i tre target su tutte le 27 estrazioni ordinate con reinserimento colloca il 95% centrale delle medie di Fable 5.1 tra 86.0-94.8 e quelle di Opus 5 tra 82.4-96.1, quindi l'intervallo di Fable 5.1 ricade all'interno di quello di Opus 5. Abbiamo riponderato solo questi tre target e non abbiamo misurato la variazione tra un'esecuzione e l'altra.

Costi ed esecuzione

Il costo per attività è la media tra le tre esecuzioni di un modello, inclusa l'esecuzione che non ha prodotto righe cliente. Un'attività corrisponde a un'azienda target. I costi in dollari coprono 15 dei 16 modelli e i dati sul tempo trascorso coprono 13 modelli.

Le cifre in dollari non sono tutte misurate allo stesso modo. Le esecuzioni su opencode includono il costo di OpenRouter per quella sessione. Le esecuzioni su Claude Code e Grok Build si autenticano tramite un abbonamento, quindi le loro cifre sono prezzi di listino applicati ai token segnalati dal programma. Codex CLI non registra alcun costo in dollari.

Ogni modello ha ricevuto un prompt congelato che indicava l'azienda e richiedeva un CSV con nomi delle aziende, URL LinkedIn, URL delle prove e date delle prove. Grok Build ha utilizzato la ricerca web nativa; gli altri programmi agente hanno raggiunto il web tramite Bright Data, uno degli strumenti di web scraping che confrontiamo.

Un programma agente fornisce al modello una shell e l'accesso al web, quindi un punteggio riflette sia il modello sia il programma in cui è stato eseguito. I prezzi di listino dei provider sono disponibili nel nostro confronto LLM pricing.

Punteggio e prove

La copertura dei clienti rappresenta 50% del punteggio, l'accuratezza su LinkedIn 17%, la qualità delle prove 17% e la recenza delle prove 16%.

La valutazione è stata eseguita il 10 settembre 2026. Accetta prove datate dal 10 settembre 2025 al 12 settembre 2026, i 12 mesi precedenti la valutazione più due giorni. Un URL citato che restituisce 404 o 410 limita quell'invio a 40 e in questa tornata nessun invio ha raggiunto il limite.

Il codice controlla formattazione, nomi, duplicati, date e stato degli URL. Claude Sonnet 5 legge un estratto di ogni pagina citata e giudica se conferma la relazione. Claude Sonnet 5 è anche uno dei 16 modelli valutati e i modelli Anthropic occupano i primi due posti. Non abbiamo verificato se un giudice Anthropic favorisca i modelli Anthropic.

Il prompt del giudice indica se l'azienda è presente nella chiave di risposta, quindi il verdetto del giudice non è indipendente dalla chiave. Abbiamo rieseguito il valutatore eliminando un'azienda da una chiave e, sulla stessa pagina e sullo stesso estratto, il suo verdetto è cambiato da cliente a menzione.

Il team del benchmark ha registrato una decisione al posto del verdetto del giudice su 58 righe, 30 contro il modello e 28 a favore. Cinquantaquattro provengono da una revisione del testo della pagina conservata del 9 settembre 2026 e quattro sono decisioni editoriali registrate il 10 settembre.

La valutazione accetta 140 righe al di fuori delle chiavi di risposta, 125 delle quali sul secondo target. Le righe supportate guadagnano gli stessi punti delle voci presenti nella chiave.

Ulteriori letture

Non perderti i nostri benchmark e approfondimenti basati sui dati. Il pulsante apre Google; selezionare AIMultiple conferma che desideri vedere AIMultiple più spesso nei risultati di ricerca di Google.
GoogleAggiungi come fonte preferita

FAQ

Questo test ha verificato singole relazioni con i clienti a partire da prove pubbliche. Non ha valutato se un elenco sia completo.

Un semplice confronto non basta. Una pagina deve anche stabilire una relazione commerciale, come un cliente indicato per nome o un abbonato ai servizi della società di ricerca.

I valori di copertura derivano dalla chiave di risposta. Il giudice controlla la pagina citata da un modello, quindi un invio guadagna credito per i clienti supportati al di fuori della chiave.

Il test riguarda la ricerca di elenchi clienti. Non valuta la selezione degli investimenti, la valutazione o la qualità delle decisioni di un fondo.

Cita questo benchmark

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti". Pubblicato online su AIMultiple.com. Consultato il 10 settembre 2026, da: https://aimultiple.com/ai-vc [Risorsa online]

PhD., E. A., & Kalelioğlu, B. (2026, 10 settembre). Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti. AIMultiple. https://aimultiple.com/ai-vc

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{Benchmark IA VC: 16 agenti IA sull'identificazione dei clienti}},
  year   = {2026},
  month  = sep,
  howpublished    = {\url{https://aimultiple.com/ai-vc}},
  note   = {AIMultiple. Consultato il 10 settembre 2026}
}
Scarica tutti i dati

Risultati e timestamp di 13 punti dati. Scarica i dati di sintesi mostrati nei grafici e nelle tabelle di questo articolo come file ZIP contenente un file CSV e un README.

Ultimo aggiornamento: 21 settembre 2026
Scarica

Vuoi i dati granulari che ci stanno dietro? Passa a Premium

Registro delle modifiche

1 aggiornamenti
  1. Ha sostituito il benchmark di deal sourcing e mappatura dei concorrenti con un benchmark di identificazione clienti a 14 agenti.

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista di settore
Ezgi ha conseguito un PhD in Economia aziendale con specializzazione in finanza e ricopre il ruolo di analista di settore presso AIMultiple. Conduce ricerche e approfondimenti all'intersezione tra tecnologia e business, con competenze che spaziano dalla sostenibilità alle indagini e all'analisi del sentiment, dalle applicazioni di agenti IA nella finanza all'ottimizzazione dei motori di risposta, dalla gestione dei firewall alle tecnologie di procurement.
Visualizza il profilo completo
Revisionato tecnicamente da
Berk Kalelioğlu
Berk Kalelioğlu
Ricercatore di IA
Berk è un ricercatore di IA presso il team benchmark di AIMultiple, concentrandosi su IA agentica, apprendimento automatico e modelli linguistici grandi e piccoli (LLM e SLM).
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450