Benchmark IA VC: 11 agents IA sur des tâches réelles de capital-risque
En partenariat avec des VC early stage, nous avons converti deux flux de travail d'analyste en benchmarks avec une vérité terrain vérifiée humainement et avons évalué 11 agents IA sur ceux-ci. Découvrez les tâches, les résultats et la méthode de notation :
Résultats du benchmark de capital-risque
Chacun des 11 modèles a exécuté chaque tâche une fois. Les scores sont sur 100. Kimi K3 n'a produit aucun run de deal sourcing notifiable et est enregistré comme 0.
Les deux tâches nécessitent un accès à des données récentes et des compétences de raisonnement :
- Deal sourcing : les VC ont des critères spécifiques et nos partenaires souhaitaient identifier des entreprises IA early stage fondées par des entrepreneurs originaires d'un pays spécifique
- Identification des concurrents lors de la due diligence
Résultats du deal sourcing de la diaspora
La plupart des participants ont obtenu la moitié des points et se sont situés dans une large bande médiane, avec un écart important entre le leader et la queue du classement. La grille d'évaluation explique cette répartition. Une ligne gagne des points lorsque chaque critère est étayé par des preuves, de sorte qu'un agent marque des points au rythme où il peut vérifier l'origine du fondateur, l'année de création et le financement, et non au rythme où il peut énumérer des noms plausibles. Les entreprises éligibles ont été fondées au cours des 18 mois précédents, ce qui les place hors de portée des données d'entraînement, de sorte que la dispersion reflète la profondeur de recherche et la discipline de vérification plutôt que des connaissances mémorisées. Même l'agent leader a laissé une part substantielle des points sur la table, ce qui signifie qu'un rappel complet d'un ensemble de référence récent, conditionné par des preuves, reste hors de portée des agents actuels travaillant dans le cadre d'un budget temps.
Résultats de la cartographie des concurrents
La distribution est divisée en trois niveaux, chacun correspondant à un mécanisme de notation. Le duo de tête a couvert plusieurs des catégories de concurrents de la cible et a identifié une partie du groupe de pairs proches. La bande médiane est ce que la grille produit lorsqu'un agent cartographie correctement les noms bien connus des analystes et des revues, mais manque les petits pairs récents les plus proches de la cible : une exécution solide, pénalisée deux fois par la perte de points de rappel et les pénalités forfaitaires pour omission. La queue proche de zéro est la plus instructive, car un score aussi bas ne nécessite pas un fichier vide. Les pénalités pour les pairs manqués et pour les non-concurrents retournés peuvent annuler tout ce qu'un CSV bien formaté rapporte, de sorte qu'une cartographie confiante et bien formatée des mauvaises entreprises finit par valoir autant que l'absence totale de cartographie.
Pourquoi les résultats des deux tâches divergent
Le sourcing récompense la vérification mécanique de cinq critères énoncés ; la cartographie des concurrents exige un jugement sur les limites du marché d'une société de recherche de niche, sans liste de critères à vérifier. Ce jugement a séparé les participants bien plus que le formatage ou la vitesse, et c'est la raison pour laquelle le leader a changé entre les colonnes tandis que plusieurs agents ont fortement échangé leurs positions. La force dans un flux de travail de recherche dit peu de choses sur le suivant, donc les équipes qui sélectionnent un agent devraient le tester sur le flux de travail qu'elles prévoient d'automatiser plutôt que de se fier à un seul classement.
Méthodologie du benchmark de capital-risque
Chaque tâche est livrée sous forme de fichier de spécifications que nous avons rédigé, qui fixe le rôle de l'analyste, le fichier de sortie, l'accès aux outils et le budget temps avant le début de chaque run. Le tableau résume ces spécifications :
La limite de temps plafonne chaque run : un agent doit rechercher, vérifier et livrer son CSV dans cette fenêtre, et le deal sourcing obtient le budget plus long car il vérifie des dizaines d'entreprises candidates par rapport à cinq critères tandis que la cartographie des concurrents enquête sur une seule cible.
Les deux placent l'agent dans un rôle qu'un analyste junior occupe dans un fonds de capital-risque, et les deux exigent un CSV avec des cellules atomiques, des URL sources résolues et aucun commentaire. Tous les faits sont jugés à une date de référence figée, et les ensembles de référence sont revérifiés trimestriellement car les données de financement évoluent.
Tâche 1 : Deal sourcing de la diaspora
L'agent agit comme un analyste de deal sourcing dans un fonds early stage axé sur les fondateurs de la diaspora. Il doit retourner des entreprises IA qui répondent à tous ces critères d'investissement à la date de référence :
- Financement inférieur à $5M. Capital total divulgué levé, pas une valorisation ou un chiffre d'affaires. Si le financement n'est pas divulgué, l'entreprise est éligible si des preuves positives montrent que le montant est inférieur au seuil. Sinon, elle doit être exclue.
- Fondée en 2025 ou 2026. Toute création antérieure est éliminatoire.
- Origine du fondateur avec preuve publique. Au moins un fondateur est né dans un pays spécifique, a étudié dans une institution de ce pays, ou est né d'une nationalité spécifique.
- Siège social à l'étranger. L'entreprise elle-même est située en dehors de Türkiye.
- Axée sur l'IA. Les entreprises de couche infrastructure et de couche application sont toutes deux éligibles.
Chaque ligne associe chaque chiffre à une URL source que l'agent a ouverte. Une URL fabriquée ou inaccessible invalide la ligne qu'elle soutient.
Comment c'est noté
La notation s'exécute par rapport à une vérité terrain cachée : un ensemble de référence d'entreprises éligibles vérifiées que le modèle ne voit jamais. Quatre dimensions s'appliquent :
- Rappel par rapport à un ensemble de référence vérifié d'entreprises éligibles.
- Précision par rapport à un ensemble piège de quasi-succès, chacun échouant exactement à un critère. Les disqualifiants nommés entraînent des pénalités fixes.
- Exactitude des données sur un échantillon aléatoire fixe de lignes tirées avec une graine enregistrée, afin qu'un passage de notation puisse être reproduit : siège social, année de création, financement dans la tolérance, et sources qui soutiennent l'affirmation à côté d'eux.
- Conformité du format : ordre des colonnes, cellules atomiques, financement numérique, CSV valide.
Remplir une liste avec des entreprises plausibles mais non vérifiées perd plus en précision qu'il ne gagne en rappel. La conception récompense moins de lignes, mais entièrement vérifiées.
Tâche 2 : Cartographie des concurrents
L'agent effectue une due diligence commerciale sur une entreprise cible pour un investisseur potentiel. Pour le run noté, nous avons dirigé les agents vers notre propre entreprise : la cible est AIMultiple elle-même, ce qui nous a permis de vérifier la vérité terrain par rapport à notre connaissance directe de qui est en concurrence avec nous. La tâche : identifier les concurrents directs de la cible, étayer chacun par des données publiques, et les retourner sous forme de document CSV.
Les règles de périmètre définissent ce qui compte comme un concurrent :
- Substituabilité. Une entreprise est éligible lorsqu'elle offre un produit ou service substituable à des clients qui se chevauchent, dans toute catégorie où la cible est en concurrence.
- Couverture complète des catégories. La cible opère dans plusieurs catégories. L'agent doit couvrir les concurrents dans chacune d'entre elles, pas seulement la plus évidente.
- Exclusions. Les entreprises sur lesquelles la cible écrit, avec lesquelles elle s'associe, ou qu'elle liste, mais avec lesquelles elle n'est pas en concurrence. Les acteurs adjacents dans une catégorie voisine. La cible elle-même.
Une cartographie approfondie pour une cible de cette envergure compte de 8 à 15 concurrents. Chaque ligne inclut la page LinkedIn du concurrent, le financement total divulgué (ou Non divulgué), le pays du siège social, l'année de création et l'effectif LinkedIn, avec une URL source à côté de chaque métrique. Deux colonnes de raisonnement accompagnent les métriques : un différenciateur par rapport à la cible et une justification de l'inclusion, chacun devant être spécifique plutôt que générique. Un chiffre de financement doit être étayé par une source de financement.
Comment c'est noté
La notation s'exécute par rapport à une vérité terrain cachée, organisée par catégorie de concurrents. Cinq dimensions s'appliquent :
- Précision. Chaque non-concurrent retourné réduit le score. Les disqualifiants nommés, tels que les outils SEO et les fournisseurs de modèles d'IA, que la cible ne fait que benchmarker, entraînent des pénalités fixes. Une protection anti-remplissage souple réduit le poids excessif lorsqu'une seule catégorie représente la majeure partie de l'ensemble trouvé. Les concurrents ont deux niveaux de poids. Un petit ensemble de pairs à ne pas manquer, les entreprises les plus proches du cœur de métier de la cible, pèsent trois fois une entrée standard. Un concurrent authentique absent de la vérité terrain obtient tout de même un crédit après examen par un expert, de sorte qu'un ensemble de référence incomplet ne pénalise pas une découverte correcte.
- Pénalités graduées. Indépendamment du poids de rappel, chaque pair à ne pas manquer que l'agent ne retourne pas entraîne une pénalité forfaitaire proportionnée à la proximité. Manquer les pairs les plus proches de la cible est traité comme un échec fondamental de due diligence, pas comme un simple écart de rappel.
- Exactitude du financement. Lignes échantillonnées vérifiées dans la tolérance, avec Non divulgué et N/A (public) acceptés comme réponses correctes là où ils s'appliquent.
- Preuves des métriques et raisonnement. Métriques requises présentes, atomiques, sourcées et exactes dans la tolérance. Les cellules de différenciateur et de justification sont notées pour leur spécificité par rapport aux formulations génériques.
Pourquoi les critères résistent à la correspondance de motifs
Les deux tâches sont conçues pour bloquer les raccourcis que les agents prennent sous pression temporelle :
- Deviner échoue. Lorsqu'un chiffre n'est pas public, la réponse notée est une lacune documentée, pas une estimation. Un nombre inventé coûte des points deux fois, une fois sur l'exactitude et une fois sur la précision, donc admettre l'inconnu surpasse le fait de le combler.
- Les réponses se trouvent au-delà de la première page de recherche. Les deux ensembles de référence s'appuient sur des entreprises jeunes ou peu documentées que les données d'entraînement n'ont pas encore rattrapées, de sorte que les scores dépendent d'une recherche en direct et par couches plutôt que du rappel.
- La preuve bat l'inférence. Un signal plausible, un nom à consonance familière ou une page bien classée, n'établit pas un fait ; un enregistrement citable le fait. Les deux grilles notent la source à côté de l'affirmation, pas l'affirmation seule.
- L'exhaustivité et la précision s'opposent. Le remplissage avec des noms non vérifiés coûte plus qu'il ne rapporte, tandis qu'une liste courte trop prudente perd du rappel. La notation pousse les agents vers l'équilibre qu'un fonds attend d'un analyste : chaque découverte vérifiée, aucune découverte authentique omise.
Construction des tâches
Chaque benchmark a commencé comme un flux de travail réel au sein de nos opérations de développement commercial et de recherche. Nous avons converti les spécifications originales des analystes en fichiers de tâches avec une structure fixe : rôle, règles d'éligibilité, colonnes de sortie exactes, accès aux outils et limite de temps. Les grilles d'évaluation résident dans des fichiers séparés avec des points par critère : le format et l'arithmétique passent par des vérifications automatisées, et les appels de jugement vont à un réviseur humain.
Trois règles de conception ont été appliquées aux deux tâches :
- Chaque chiffre nécessite une source que l'agent a ouverte. Les pages d'accueil nues et les pages de résultats de recherche ne comptent pas.
- Non divulgué bat l'invention. Écrire Non divulgué pour un tour de pré-amorçage privé rapporte des points ; inventer un nombre coûte des points deux fois, une fois pour l'exactitude et une fois pour la précision.
- Sortie atomique. Une valeur par cellule, ordre exact des colonnes. Les violations de structure coûtent des points avant que le contenu ne soit jugé.
Contrôle des fuites
Les premiers runs nous ont appris la leçon la plus importante en méthodologie. Lorsque le fichier de la grille d'évaluation était accessible depuis le répertoire de travail du modèle, le modèle lisait et copiait la vérité terrain. Les scores augmentaient pour des raisons sans rapport avec la capacité de recherche.
Chaque grille d'évaluation comporte désormais une exigence d'isolement du harness : le modèle reçoit le fichier de prompt, et rien d'autre, et l'évaluateur applique la grille ensuite. Tout run où la grille était accessible est traité comme invalide. Les constructeurs de benchmarks qui sautent ce contrôle surestimeront ce que leurs agents peuvent faire.
Ce que mesurent les grilles d'évaluation
Les grilles d'évaluation partagent une philosophie de notation à travers les deux tâches :
- Rappel par rapport à la vérité terrain vérifiée. Chaque entreprise éligible ou concurrent dans l'ensemble de référence a été confirmé par un chercheur humain par rapport aux registres publics avant qu'un modèle ne soit noté.
- Précision avec pièges nommés. Les deux ensembles de vérité terrain comportent des quasi-succès qui échouent exactement à un critère et sont des disqualifiants nommés avec des pénalités fixes, de sorte que la correspondance de motifs sans vérification est détectée.
- Points négatifs pour la fabrication. Un chiffre de financement halluciné ou une URL source morte soustrait des points au lieu de marquer zéro. Les lacunes honnêtes battent les erreurs confiantes.
- Gestion de la dérive. Les financements, les valorisations et les effectifs changent. Chaque grille comporte une date de référence, marque les données sujettes à dérive et nécessite une revérification avant chaque passage de notation.
- Vérification mixte. Les vérifications de rappel, de précision et de format s'exécutent automatiquement. Les preuves d'origine des fondateurs et les justifications d'inclusion vont à un réviseur humain.
Les scores bas proviennent du fait de rendre la tâche véritablement difficile, pas d'écraser les bonnes réponses avec des plafonds. Le rappel, la précision, l'exactitude et l'honnêteté tirent chacun sur un mode de défaillance différent, de sorte qu'un modèle ne peut pas compenser une recherche faible par un formatage confiant.
Pourquoi le travail de capital-risque teste bien les agents IA
Les sociétés de capital-risque fonctionnent grâce au travail des analystes. Le filtrage du deal flow et la due diligence sont des tâches de recherche en plusieurs étapes. Chacune nécessite une recherche web, une vérification des sources et une sortie structurée. Chacune produit également des réponses erronées d'apparence plausible, ce qui les rend difficiles à simuler et utiles à noter.
Ces propriétés font du travail d'analyste VC un domaine de benchmark solide :
- Vérité terrain vérifiable. Les tours de financement, les années de création et les effectifs peuvent être vérifiés par rapport aux registres publics.
- Pression de fabrication. Les modèles qui ne peuvent pas trouver un chiffre ont tendance à en inventer un. Les tâches exposent cela directement.
- Valeur économique réelle. Un fonds qui automatise des parties de la due diligence modifie sa propre structure de coûts. Le benchmark mesure un travail pour lequel quelqu'un paie aujourd'hui.
Lectures complémentaires
- Benchmark AIM Agentic Marketing
- Trading boursier basé sur l'IA : Quel outil d'IA générative est le meilleur
- Benchmark Agentic IA Finance
FAQ
Non. Les tâches correspondent au travail que font les analystes juniors : sourcing, cartographie des concurrents, comparables. Les décisions d'investissement, le jugement des associés et les relations avec les fondateurs se situent en dehors de leur périmètre. L'IA compresse le temps de recherche ; les humains prennent la décision.
Les entreprises publiques ont des états financiers audités, ce qui fait de l'évaluation un exercice de consultation. Les startups privées early stage obligent l'agent à estimer, à énoncer une base et à qualifier l'incertitude. C'est là que la pression de fabrication est la plus élevée et là où l'effort réel de due diligence est consacré.
Ces benchmarks montrent-ils que l'IA remplace les analystes en capital-risque ?
Non. Les tâches correspondent au travail que font les analystes juniors : sourcing, cartographie des concurrents, comparables. Les décisions d'investissement, le jugement des associés et les relations avec les fondateurs se situent en dehors de leur périmètre. L'IA compresse le temps de recherche ; les humains prennent la décision.
Pourquoi les tâches ciblent-elles les entreprises privées ?
Les entreprises publiques ont des états financiers audités, ce qui fait de l'évaluation un exercice de consultation. Les startups privées early stage obligent l'agent à estimer, à énoncer une base et à qualifier l'incertitude. C'est là que la pression de fabrication est la plus élevée et là où l'effort réel de due diligence est consacré.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{Benchmark IA VC: 11 agents IA sur des tâches réelles de capital-risque}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Consulté le 21 Juillet 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.