IA VC Benchmark: 11 IA Agents su Compiti Reali di Venture Capital
Collaborando con VC in fase iniziale, abbiamo convertito due flussi di lavoro di analista in benchmark con verità fondante verificata da umani e valutato 11 agenti IA su di essi. Vedi i compiti, i risultati e il metodo di valutazione:
Risultati del benchmark di venture capital
Ciascuno dei 11 modelli ha eseguito ogni compito una volta. I punteggi sono su 100. Kimi K3 non ha prodotto alcun run di deal sourcing valutabile ed è registrato come 0.
Entrambi i compiti richiedono accesso a dati freschi e capacità di ragionamento:
- Deal sourcing: i VC hanno criteri specifici e i nostri partner volevano identificare aziende IA in fase iniziale fondate da imprenditori di un determinato paese
- Identificazione dei competitor durante la due diligence
Risultati del diaspora deal sourcing
La maggior parte del campo ha superato la metà dei punti e si è collocata in un'ampia fascia intermedia, con un ampio divario tra il leader e la coda. La rubrica spiega la forma. Una riga guadagna punti quando ogni criterio è supportato da evidenza, quindi un agente ottiene punteggio alla velocità con cui può verificare l'origine del fondatore, l'anno di fondazione e il finanziamento, non alla velocità con cui può elencare nomi plausibili. Le aziende qualificate sono state fondate negli ultimi 18 mesi, il che le colloca oltre la portata dei dati di addestramento, quindi la distribuzione riflette la profondità di ricerca e la disciplina di verifica piuttosto che la conoscenza memorizzata. Anche l'agente leader ha lasciato una quota sostanziale di punti sul tavolo, il che significa che il recupero completo di un insieme gold fresco e basato su evidenze rimane fuori portata per gli attuali agenti che lavorano entro un limite di tempo.
Risultati della mappatura dei competitor
La distribuzione è suddivisa in tre fasce, ciascuna mappata a un meccanismo di punteggio. La coppia di testa ha coperto diverse categorie di competitor del target e ha intercettato parte del gruppo di peer stretti. La fascia intermedia è ciò che la rubrica produce quando un agente mappa in modo pulito i nomi noti di analisti e recensioni e perde i peer piccoli e recenti più vicini al target: esecuzione solida, penalizzata due volte tramite punti di richiamo persi e penalità flat per mancata individuazione. La coda vicina allo zero è la più istruttiva, perché un punteggio così basso non richiede un file vuoto. Le penalità per peer mancati e per non-competitor restituiti possono annullare tutto ciò che un CSV ordinato guadagna, quindi una mappa sicura e ben formattata delle aziende sbagliate finisce per valere quanto nessuna mappa.
Perché i risultati dei due compiti divergono
Il sourcing premia la verifica meccanica di cinque criteri dichiarati; la mappatura dei competitor richiede un giudizio su dove finisce il mercato di un'azienda di ricerca di nicchia, senza una lista di criteri da verificare. Quel giudizio ha separato il campo molto più della formattazione o della velocità, ed è il motivo per cui il leader è cambiato tra le colonne mentre diversi agenti hanno scambiato posizioni nettamente. La forza in un flusso di lavoro di ricerca dice poco sul successivo, quindi i team che selezionano un agente dovrebbero testarlo sul flusso di lavoro che intendono automatizzare piuttosto che affidarsi a una singola classifica.
Metodologia del benchmark di venture capital
Ogni compito viene fornito come file di specifiche che abbiamo redatto, che fissa il ruolo dell'analista, il file di output, l'accesso agli strumenti e il budget di tempo prima che inizi qualsiasi esecuzione. La tabella riassume quelle specifiche:
Il limite di tempo limita ogni esecuzione: un agente deve ricercare, verificare e consegnare il suo CSV entro quella finestra, e il deal sourcing riceve il budget più lungo perché verifica dozzine di aziende candidate contro cinque criteri mentre la mappatura dei competitor indaga un singolo target.
Entrambi collocano l'agente in un ruolo che un analista junior ricopre in un fondo di venture capital, ed entrambi richiedono un CSV con celle atomiche, URL di origine risolti e nessun commento. Tutti i fatti sono giudicati a una data di snapshot congelata, e gli insiemi gold sono riverificati trimestralmente perché i dati di finanziamento cambiano.
Compito 1: Diaspora deal sourcing
L'agente agisce come analista di deal sourcing presso un fondo in fase iniziale focalizzato su fondatori della diaspora. Deve restituire aziende IA che soddisfano tutti questi criteri di investimento alla data di snapshot:
- Finanziamento inferiore a $5M. Capitale totale dichiarato raccolto, non una valutazione o una cifra di fatturato. Se il finanziamento non è dichiarato, l'azienda si qualifica se evidenze positive mostrano che l'importo è inferiore alla soglia. Altrimenti, deve essere esclusa.
- Fondata nel 2025 o 2026. Qualsiasi cosa prima fallisce.
- Origine del fondatore con evidenza pubblica. Almeno un fondatore è nato in un paese specifico, ha studiato presso un'istituzione in questo paese o è nato con una specifica nazionalità.
- Sede all'estero. L'azienda stessa ha sede al di fuori della Turchia.
- Focalizzata sull'IA. Sia le aziende a livello di infrastruttura che quelle a livello applicativo si qualificano.
Ogni riga associa ogni cifra a un URL di origine che l'agente ha aperto. Un URL fabbricato o irraggiungibile invalida la riga che supporta.
Come viene valutato
Il punteggio viene eseguito contro una verità fondante nascosta: un insieme gold di aziende qualificate verificate che il modello non vede mai. Si applicano quattro dimensioni:
- Richiamo contro un insieme gold verificato di aziende qualificate.
- Precisione contro un insieme trappola di quasi-ammissibili, ciascuna che fallisce esattamente un criterio. I disqualificatori nominati comportano penalità fisse.
- Accuratezza dei dati su un campione casuale fisso di righe estratto con un seme registrato, in modo che un passaggio di valutazione possa essere riprodotto: sede, anno di fondazione, finanziamento entro tolleranza e fonti che supportano l'affermazione accanto.
- Conformità al formato: ordine delle colonne, celle atomiche, finanziamento numerico, CSV valido.
Riempire una lista con aziende plausibili ma non verificate perde più in precisione di quanto guadagni in richiamo. Il design premia meno righe, completamente verificate.
Compito 2: Mappatura dei competitor
L'agente conduce due diligence commerciale su un'azienda target per un potenziale investitore. Per l'esecuzione valutata, abbiamo indirizzato gli agenti verso la nostra stessa azienda: il target è AIMultiple stessa, il che ci ha permesso di verificare la verità fondante contro la conoscenza diretta di chi compete con noi. Il compito: identificare i competitor diretti del target, evidenziare ciascuno con dati pubblici e restituirli come documento CSV.
Le regole di ambito definiscono cosa conta come competitor:
- Sostituibilità. Un'azienda si qualifica quando offre un prodotto o servizio sostituibile a clienti sovrapposti, in qualsiasi categoria in cui il target compete.
- Copertura completa delle categorie. Il target opera in più categorie. L'agente deve coprire i competitor in ognuna di esse, non solo quella più ovvia.
- Esclusioni. Aziende di cui il target scrive, con cui collabora o che elenca, ma con cui non compete. Attori adiacenti in una categoria vicina. Il target stesso.
Una mappa approfondita per un target di questa ampiezza va da 8 a 15 competitor. Ogni riga include la pagina LinkedIn del competitor, il finanziamento totale dichiarato (o Non Dichiarato), il paese della sede, l'anno di fondazione e il numero di dipendenti su LinkedIn, con un URL di origine accanto a ciascuna metrica. Due colonne di ragionamento affiancano le metriche: un elemento differenziante rispetto al target e una motivazione per l'inclusione, ciascuna deve essere specifica e non generica. Una cifra di finanziamento deve essere supportata da una fonte di finanziamento.
Come viene valutato
Il punteggio viene eseguito contro una verità fondante nascosta, organizzata per categoria di competitor. Si applicano cinque dimensioni:
- Precisione. Ogni non-competitor restituito riduce il punteggio. I disqualificatori nominati, come gli strumenti SEO e i fornitori di modelli IA che il target si limita a benchmarkare, comportano penalità fisse. Una protezione anti-riempimento morbida riduce il peso in eccesso quando una singola categoria rappresenta la maggior parte dell'insieme trovato. I competitor hanno due livelli di peso. Un piccolo insieme di peer da non perdere, le aziende più vicine al core business del target, pesano tre volte una voce standard. Un competitor autentico assente dalla verità fondante guadagna comunque credito dopo revisione esperta, quindi un insieme gold incompleto non penalizza un ritrovamento corretto.
- Graduazione delle penalità. Indipendentemente dal peso di richiamo, ogni peer da non perdere che l'agente non restituisce sottrae una penalità fissa dimensionata in base alla vicinanza. Mancare i peer più vicini al target è trattato come un fallimento centrale di due diligence, non come una normale lacuna di richiamo.
- Accuratezza del finanziamento. Righe campionate controllate entro tolleranza, con Non Dichiarato e N/D (pubblico) accettati come risposte corrette ove applicabile.
- Evidenza delle metriche e ragionamento. Metriche richieste presenti, atomiche, con fonte e accurate entro tolleranza. Le celle di elemento differenziante e motivazione sono valutate per specificità contro la banalità.
Perché i criteri resistono al pattern matching
Entrambi i compiti sono costruiti per bloccare le scorciatoie che gli agenti prendono sotto pressione temporale:
- Indovinare fallisce. Dove una cifra non è pubblica, la risposta valutata è una lacuna evidenziata, non una stima. Un numero inventato costa punti due volte, una per accuratezza e una per precisione, quindi ammettere l'ignoto è meglio che riempirlo.
- Le risposte sono oltre la prima pagina di ricerca. Entrambi gli insiemi gold si basano su aziende giovani o scarsamente documentate che i dati di addestramento non hanno ancora raggiunto, quindi i punteggi dipendono da una ricerca viva e stratificata anziché dal richiamo.
- L'evidenza batte l'inferenza. Un segnale plausibile, un nome familiare o una pagina di alto ranking non stabilisce un fatto; lo fa un record citabile. Entrambe le rubriche valutano la fonte accanto all'affermazione, non l'affermazione da sola.
- Completezza e precisione si oppongono. Riempire con nomi non verificati costa più di quanto guadagni, mentre una lista breve troppo cauta perde richiamo. Il punteggio spinge gli agenti verso l'equilibrio che un fondo si aspetta da un analista: ogni risultato verificato, nessun risultato autentico saltato.
Costruzione dei compiti
Ogni benchmark è nato come un flusso di lavoro reale all'interno delle nostre operazioni di sviluppo business e ricerca. Abbiamo convertito le specifiche originali degli analisti in file di compiti con una struttura fissa: ruolo, regole di ammissibilità, colonne di output esatte, accesso agli strumenti e un limite di tempo. Le rubriche sono in file separati con punti per criterio: il formato e l'aritmetica passano attraverso controlli automatizzati, e le valutazioni soggettive vanno a un revisore umano.
Tre regole di progettazione si applicano a entrambi i compiti:
- Ogni cifra ha bisogno di una fonte che l'agente ha aperto. Le homepage nude e le pagine dei risultati di ricerca non contano.
- Non Dichiarato batte inventato. Scrivere Non Dichiarato per un round pre-seed privato dà punti; inventare un numero costa punti due volte, una per accuratezza e una per precisione.
- Output atomico. Un valore per cella, ordine esatto delle colonne. Le violazioni di struttura costano punti prima che il contenuto venga giudicato.
Controllo delle perdite
Le prime esecuzioni ci hanno insegnato la lezione più importante di metodologia. Quando il file della rubrica era accessibile dalla directory di lavoro del modello, il modello lo leggeva e copiava la verità fondante. I punteggi salivano per ragioni non correlate alla capacità di ricerca.
Ogni rubrica ora porta un requisito di isolamento del harness: il modello riceve il file di prompt, e nient'altro, e il valutatore applica la rubrica dopo. Qualsiasi esecuzione in cui la rubrica era accessibile è trattata come non valida. I costruttori di benchmark che saltano questo controllo sovrastimeranno ciò che i loro agenti possono fare.
Cosa misurano le rubriche
Le rubriche condividono una filosofia di punteggio in entrambi i compiti:
- Richiamo contro verità fondante verificata. Ogni azienda qualificante o competitor nell'insieme gold è stato confermato da un ricercatore umano rispetto a registri pubblici prima che qualsiasi modello fosse valutato.
- Precisione con trappole nominate. Entrambi gli insiemi di verità fondante contengono quasi-ammissibili che falliscono esattamente un criterio e sono disqualificatori nominati con penalità fisse, così il pattern matching senza verifica viene scoperto.
- Punti negativi per fabbricazione. Una cifra di finanziamento allucinata o un URL di fonte morto sottrae punti invece di dare zero. Le lacune oneste battono gli errori sicuri.
- Gestione della deriva. Finanziamenti, valutazioni e numero di dipendenti cambiano. Ogni rubrica ha una data di snapshot, contrassegna i dati soggetti a deriva e richiede la riverifica prima di ogni passaggio di valutazione.
- Controllo misto. Richiamo, precisione e controlli di formato vengono eseguiti automaticamente. Le evidenze sull'origine del fondatore e le motivazioni di inclusione vanno a un revisore umano.
I punteggi bassi derivano dal rendere il compito realmente difficile, non dallo schiacciare buone risposte con massimali. Richiamo, precisione, accuratezza e onestà tirano ciascuno su una diversa modalità di fallimento, quindi un modello non può compensare una ricerca debole con una formattazione sicura.
Perché il lavoro di venture capital testa bene gli agenti IA
Le società di venture capital funzionano sul lavoro degli analisti. Lo screening del deal flow e la due diligence sono compiti di ricerca a più fasi. Ciascuno richiede ricerca web, verifica delle fonti e output strutturato. Ciascuno produce anche risposte sbagliate dall'aspetto plausibile, il che li rende difficili da falsificare e utili da valutare.
Queste proprietà rendono il lavoro di analista VC un dominio di benchmark forte:
- Verità fondante verificabile. I round di finanziamento, gli anni di fondazione e il numero di dipendenti possono essere verificati rispetto a registri pubblici.
- Pressione alla fabbricazione. I modelli che non riescono a trovare una cifra tendono a inventarne una. I compiti lo espongono direttamente.
- Valore economico reale. Un fondo che automatizza parti della due diligence cambia la propria struttura di costo. Il benchmark misura un lavoro per cui qualcuno paga oggi.
Ulteriori letture
- AIM Agentic Marketing Benchmark
- IA-Based Stock Trading: Quale strumento Gen IA è migliore
- Agentic IA Finance Benchmark
FAQ
No. I compiti mappano il lavoro che svolgono gli analisti junior: sourcing, mappatura dei competitor, comparabili. Le decisioni di investimento, il giudizio dei partner e le relazioni con i fondatori sono al di fuori del loro ambito. L'IA comprime i tempi di ricerca; gli umani prendono la decisione.
Le aziende pubbliche hanno bilanci certificati, il che rende la valutazione un esercizio di consultazione. Le startup private in fase iniziale costringono l'agente a stimare, dichiarare una base ed etichettare l'incertezza. È lì che la pressione alla fabbricazione è più alta e dove viene profuso il vero sforzo di due diligence.
Questi benchmark mostrano che l'IA sostituisce gli analisti di venture capital?
No. I compiti mappano il lavoro che svolgono gli analisti junior: sourcing, mappatura dei competitor, comparabili. Le decisioni di investimento, il giudizio dei partner e le relazioni con i fondatori sono al di fuori del loro ambito. L'IA comprime i tempi di ricerca; gli umani prendono la decisione.
Perché i compiti prendono di mira aziende private?
Le aziende pubbliche hanno bilanci certificati, il che rende la valutazione un esercizio di consultazione. Le startup private in fase iniziale costringono l'agente a stimare, dichiarare una base ed etichettare l'incertezza. È lì che la pressione alla fabbricazione è più alta e dove viene profuso il vero sforzo di due diligence.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{IA VC Benchmark: 11 IA Agents su Compiti Reali di Venture Capital}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Consultato il 21 Luglio 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.