IA VC Benchmark: 11 Agenti IA su compiti reali di venture capital
Collaborando con VC in fase iniziale, abbiamo convertito due flussi di lavoro di analisti in benchmark con verità fondante verificata da umani e abbiamo valutato 11 agenti IA su di essi. Vedi i compiti, i risultati e il metodo di valutazione:
Risultati del benchmark di venture capital
Ciascuno dei 11 modelli ha eseguito ogni compito una volta. I punteggi sono su 100. Kimi K3 non ha prodotto alcun risultato valutabile per il deal sourcing ed è registrato come 0.
Entrambi i compiti richiedono accesso a dati freschi e capacità di ragionamento:
- Deal sourcing: i VC hanno criteri specifici e i nostri partner volevano identificare aziende IA in fase iniziale fondate da fondatori di un paese specifico
- Identificazione dei competitor durante la due diligence
Risultati del deal sourcing della diaspora
La maggior parte del gruppo ha raggiunto la metà dei punti e si è collocata in un'ampia fascia centrale, con un ampio divario tra il leader e la coda. La griglia spiega la forma. Una riga guadagna punti quando ogni criterio è supportato da prove, quindi un agente totalizza punti alla velocità con cui può verificare origine del fondatore, anno di fondazione e finanziamenti, non alla velocità con cui può elencare nomi plausibili. Le aziende qualificate sono state fondate entro i 18 mesi precedenti, il che le colloca al di là della portata dei dati di addestramento, quindi la distribuzione riflette la profondità di ricerca e la disciplina di verifica piuttosto che la conoscenza memorizzata. Anche l'agente migliore ha lasciato sul tavolo una quota sostanziale dei punti, il che significa che il richiamo completo di un set di riferimento fresco e vincolato a prove resta fuori portata per gli agenti attuali che lavorano con un budget di tempo.
Risultati della mappatura dei competitor
La distribuzione è divisa in tre livelli, ciascuno corrispondente a un meccanismo di punteggio. La coppia di testa ha coperto diverse categorie di competitor dell'azienda target e ha catturato parte del gruppo di pari prossimi. La fascia centrale è ciò che la griglia produce quando un agente mappa in modo pulito i nomi noti degli analisti e delle recensioni e manca i piccoli peer recenti più vicini al target: esecuzione solida, penalizzata due volte attraverso punti di richiamo persi e penalità per mancate rilevazioni. La coda quasi a zero è la più istruttiva, perché un punteggio così basso non richiede un file vuoto. Le penalità per i peer mancati e per i non-competitor restituiti possono annullare tutto ciò che un CSV ordinato guadagna, quindi una mappa sicura e ben formattata delle aziende sbagliate finisce per valere quanto nessuna mappa.
Perché i risultati dei due compiti divergono
Il sourcing premia la verifica meccanica di cinque criteri dichiarati; la mappatura dei competitor richiede un giudizio su dove finisca il mercato di una società di ricerca di nicchia, senza una lista di criteri da controllare. Quel giudizio ha separato il campo molto più della formattazione o della velocità, ed è il motivo per cui il leader è cambiato tra le colonne mentre diversi agenti hanno scambiato bruscamente posizione. La forza in un flusso di lavoro di ricerca dice poco su quello successivo, quindi i team che selezionano un agente dovrebbero testarlo sul flusso di lavoro che intendono automatizzare anziché basarsi su una singola classifica.
Metodologia del benchmark di venture capital
Ogni compito viene fornito come un file di specifiche che abbiamo scritto, il quale fissa il ruolo dell'analista, il file di output, l'accesso agli strumenti e il budget di tempo prima che qualsiasi esecuzione inizi. La tabella riassume queste specifiche:
Il limite di tempo vincola ogni esecuzione: un agente deve fare ricerca, verificare e consegnare il suo CSV entro quella finestra, e il deal sourcing riceve il budget più lungo perché verifica decine di aziende candidate contro cinque criteri mentre la mappatura dei competitor indaga un singolo target.
Entrambi collocano l'agente nel ruolo che un analista junior ricopre presso un fondo di venture capital, ed entrambi richiedono un CSV con celle atomiche, URL di fonti risolti e nessun commento. Tutti i fatti sono valutati a partire da una data di snapshot congelata, e i set di riferimento vengono riverificati trimestralmente perché i dati sui finanziamenti si spostano.
Compito 1: Deal sourcing della diaspora
L'agente agisce come un analista di deal sourcing presso un fondo in fase iniziale focalizzato su fondatori della diaspora turca. Deve restituire aziende IA che soddisfano tutti questi criteri di investimento alla data dello snapshot:
- Finanziamenti inferiori a $5M. Capitale totale raccolto dichiarato, non una cifra di valutazione o fatturato. Se il finanziamento non è divulgato, l'azienda si qualifica se prove positive mostrano che l'importo è al di sotto della soglia. Altrimenti, deve essere esclusa.
- Fondata nel 2025 o 2026. Qualsiasi cosa precedente fallisce.
- Origine del fondatore con prove pubbliche. Almeno un fondatore è nato in Turchia, ha studiato in un'istituzione turca o è nato da genitori turchi. Un cognome che suona turco non è una prova.
- Sede centrale all'estero. L'azienda stessa ha sede al di fuori della Turchia.
- Focalizzata sull'IA. Sia le aziende a livello di infrastruttura che quelle a livello applicativo si qualificano.
Ogni riga associa ogni dato a un URL di fonte che l'agente ha aperto. Un URL fabbricato o irraggiungibile invalida la riga che supporta.
Come viene valutato
La valutazione avviene contro una verità fondante nascosta: un set di riferimento di aziende qualificate verificate che il modello non vede mai. Si applicano quattro dimensioni:
- Richiamo contro un set di riferimento verificato di aziende qualificate.
- Precisione contro un set trappola di quasi-corrispondenze, ciascuna delle quali fallisce esattamente un criterio. Gli elementi squalificanti nominati comportano penalità fisse.
- Accuratezza dei dati su un campione casuale fisso di righe estratto con un seed registrato, in modo che un passaggio di valutazione possa essere riprodotto: sede centrale, anno di fondazione, finanziamento entro la tolleranza e fonti che supportano l'affermazione accanto a esse.
- Conformità del formato: ordine delle colonne, celle atomiche, finanziamento numerico, CSV valido.
Riempire una lista con aziende plausibili ma non verificate fa perdere più in precisione di quanto guadagni in richiamo. Il design premia meno righe, completamente verificate.
Compito 2: Mappatura dei competitor
L'agente conduce una due diligence commerciale su un'azienda target per un potenziale investitore. Per l'esecuzione valutata, abbiamo indirizzato gli agenti verso la nostra azienda: il target è AIMultiple stessa, il che ci ha permesso di verificare la verità fondante contro una conoscenza di prima mano di chi compete con noi. Il compito: identificare i competitor diretti del target, dimostrare ciascuno con dati pubblici e restituirli come un documento CSV.
Le regole di ambito definiscono cosa conta come competitor:
- Sostituibilità. Un'azienda si qualifica quando offre un prodotto o servizio sostituibile a clienti sovrapposti, in qualsiasi categoria in cui il target compete.
- Copertura completa delle categorie. Il target opera in molteplici categorie. L'agente deve coprire i competitor in ciascuna di esse, non solo in quella più ovvia.
- Esclusioni. Aziende di cui il target scrive, con cui collabora o che elenca, ma con cui non compete. Operatori adiacenti in una categoria vicina. Il target stesso.
Una mappa completa per un target di questa ampiezza va da 8 a 15 competitor. Ogni riga include la pagina LinkedIn del competitor, il finanziamento totale dichiarato (o Non divulgato), il paese della sede centrale, l'anno di fondazione e l'organico su LinkedIn, con un URL di fonte accanto a ciascun dato. Due colonne di ragionamento affiancano i dati: un elemento differenziante rispetto al target e una motivazione per l'inclusione, ciascuna richiesta in modo specifico e non generico. Un dato di finanziamento deve essere supportato da una fonte di finanziamento.
Come viene valutato
La valutazione avviene contro una verità fondante nascosta, organizzata per categoria di competitor. Si applicano cinque dimensioni:
- Precisione. Ogni non-competitor restituito riduce il punteggio. Elementi squalificanti nominati, come strumenti SEO e fornitori di modelli IA, che il target si limita a confrontare comportano penalità fisse. Un meccanismo morbido anti-riempimento riduce il peso in eccesso quando una singola categoria rappresenta la maggior parte del set trovato. I competitor hanno due livelli di peso. Un piccolo insieme di peer imperdibili, le aziende più vicine al core business del target, pesano tre volte una voce standard. Un competitor genuino assente dalla verità fondante guadagna comunque credito dopo la revisione esperta, così un set di riferimento incompleto non penalizza un ritrovamento corretto.
- Penalità graduate. Indipendentemente dal peso del richiamo, ogni peer imperdibile che l'agente non restituisce sottrae una penalità fissa dimensionata dalla vicinanza. Mancare i peer più prossimi del target è trattato come un fallimento centrale della due diligence, non come una normale lacuna di richiamo.
- Accuratezza del finanziamento. Righe campionate controllate entro la tolleranza, con Non divulgato e N/D (pubblico) accettati come risposte corrette ove applicabile.
- Evidenze metriche e ragionamento. Dati richiesti presenti, atomici, provvisti di fonte e accurati entro la tolleranza. Le celle di elemento differenziante e motivazione sono valutate per la specificità rispetto a frasi fatte.
Perché i criteri resistono al pattern matching
Entrambi i compiti sono costruiti per bloccare le scorciatoie che gli agenti prendono sotto pressione temporale:
- Indovinare fallisce. Dove un dato non è pubblico, la risposta valutata è una lacuna comprovata, non una stima. Un numero inventato costa punti due volte, una per l'accuratezza e una per la precisione, quindi ammettere l'ignoto supera il riempirlo.
- Le risposte si trovano oltre la prima pagina di ricerca. Entrambi i set di riferimento si basano su aziende giovani o scarsamente documentate che i dati di addestramento non hanno ancora raggiunto, quindi i punteggi dipendono dalla ricerca viva e stratificata piuttosto che dal richiamo.
- Le prove battono l'inferenza. Un segnale plausibile, un nome familiare o una pagina di alto ranking, non stabiliscono un fatto; lo fa un record citabile. Entrambe le griglie valutano la fonte accanto all'affermazione, non l'affermazione da sola.
- Completezza e precisione si tirano contro. Riempire con nomi non verificati costa più di quanto guadagni, mentre una lista corta eccessivamente prudente perde richiamo. Il punteggio spinge gli agenti verso l'equilibrio che un fondo si aspetta da un analista: ogni scoperta verificata, nessuna scoperta genuina saltata.
Costruire i compiti
Ogni benchmark è nato come un flusso di lavoro reale all'interno delle nostre operazioni di sviluppo aziendale e ricerca. Abbiamo convertito le specifiche originali degli analisti in file di compiti con una struttura fissa: ruolo, regole di ammissibilità, colonne di output esatte, accesso agli strumenti e un limite di tempo. Le griglie di valutazione vivono in file separati con punti per criterio: formato e aritmetica passano attraverso controlli automatici, e i giudizi di valore vanno a un revisore umano.
Tre regole di progettazione sono state applicate a entrambi i compiti:
- Ogni dato ha bisogno di una fonte che l'agente ha aperto. Le homepage nude e le pagine dei risultati di ricerca non contano.
- Non divulgato batte inventato. Scrivere Non divulgato per un round pre-seed privato dà punti; inventare un numero costa punti due volte, una per l'accuratezza e una per la precisione.
- Output atomico. Un valore per cella, ordine esatto delle colonne. Le violazioni di struttura costano punti prima che il contenuto venga giudicato.
Controllo delle fughe
Le prime esecuzioni ci hanno insegnato la lezione più importante nella metodologia. Quando il file della griglia era raggiungibile dalla directory di lavoro del modello, il modello lo leggeva e copiava la verità fondante. I punteggi salivano per ragioni non legate alla capacità di ricerca.
Ogni griglia ora prevede un requisito di isolamento dell'harness: il modello riceve il file di prompt, e nient'altro, e il valutatore applica la griglia successivamente. Qualsiasi esecuzione in cui la griglia era raggiungibile è trattata come non valida. I costruttori di benchmark che saltano questo controllo sovrastimeranno ciò che i loro agenti possono fare.
Cosa misurano le griglie
Le griglie condividono una filosofia di punteggio tra entrambi i compiti:
- Richiamo contro verità fondante verificata. Ogni azienda qualificata o competitor nel set di riferimento è stato confermato da un ricercatore umano rispetto a documenti pubblici prima che qualsiasi modello venisse valutato.
- Precisione con trappole nominate. Entrambi i set di verità fondante contengono quasi-corrispondenze che falliscono esattamente un criterio e sono elementi squalificanti nominati con penalità fisse, così il pattern matching senza verifica viene catturato.
- Punti negativi per la fabbricazione. Un dato di finanziamento allucinato o un URL di fonte morto sottrae punti invece di segnare zero. Le lacune oneste battono gli errori sicuri.
- Gestione della deriva. Finanziamenti, valutazioni e organici cambiano. Ogni griglia contiene una data di snapshot, contrassegna i dati soggetti a deriva e richiede la riverifica prima di ogni passaggio di valutazione.
- Controllo misto. I controlli di richiamo, precisione e formato vengono eseguiti automaticamente. Le prove di origine del fondatore e le motivazioni di inclusione vanno a un revisore umano.
I punteggi bassi derivano dal rendere il compito genuinamente difficile, non dallo schiacciare le buone risposte con dei limiti. Richiamo, precisione, accuratezza e onestà tirano ciascuno su una diversa modalità di fallimento, così un modello non può compensare una ricerca debole con una formattazione sicura.
Perché il lavoro di venture capital mette alla prova gli agenti IA
Le società di venture capital funzionano sul lavoro degli analisti. Lo screening del deal flow e la due diligence sono compiti di ricerca in più fasi. Ciascuno richiede ricerca web, verifica delle fonti e output strutturato. Ciascuno produce anche risposte sbagliate dall'aspetto plausibile, il che li rende difficili da fingere e utili da valutare.
Queste proprietà rendono il lavoro dell'analista VC un dominio di benchmark forte:
- Verità fondante verificabile. Round di finanziamento, anni di fondazione e organici possono essere controllati rispetto a documenti pubblici.
- Pressione alla fabbricazione. I modelli che non riescono a trovare un dato tendono a inventarne uno. I compiti lo espongono direttamente.
- Valore economico reale. Un fondo che automatizza parti della due diligence cambia la propria struttura dei costi. Il benchmark misura il lavoro per cui qualcuno paga oggi.
Ulteriori letture
- AIM Agentic Marketing Benchmark
- IA-Based Stock Trading: Quale strumento Gen IA è migliore
- Agentic IA Finance Benchmark
FAQ
No. I compiti corrispondono al lavoro che svolgono gli analisti junior: sourcing, mappatura dei competitor, comparabili. Le decisioni di investimento, il giudizio dei partner e le relazioni con i fondatori restano al di fuori del loro ambito. L'IA comprime i tempi di ricerca; gli umani prendono la decisione.
Le aziende pubbliche hanno bilanci certificati, il che rende la valutazione un esercizio di consultazione. Le startup private in fase iniziale costringono l'agente a stimare, dichiarare una base e etichettare l'incertezza. È lì che la pressione alla fabbricazione è più alta e dove si concentra il vero sforzo di due diligence.
Questi benchmark mostrano che l'IA sta sostituendo gli analisti di venture capital?
No. I compiti corrispondono al lavoro che svolgono gli analisti junior: sourcing, mappatura dei competitor, comparabili. Le decisioni di investimento, il giudizio dei partner e le relazioni con i fondatori restano al di fuori del loro ambito. L'IA comprime i tempi di ricerca; gli umani prendono la decisione.
Perché i compiti si concentrano su aziende private?
Le aziende pubbliche hanno bilanci certificati, il che rende la valutazione un esercizio di consultazione. Le startup private in fase iniziale costringono l'agente a stimare, dichiarare una base e etichettare l'incertezza. È lì che la pressione alla fabbricazione è più alta e dove si concentra il vero sforzo di due diligence.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{IA VC Benchmark: 11 Agenti IA su compiti reali di venture capital}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Consultato il 19 Luglio 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.