IA VC Benchmark: 16 agents IA sur l'identification des clients
L’identification des clients fait partie de la due diligence commerciale. Nous avons testé 16 modèles sur la recherche de listes de clients pour trois sites de recherche et d’avis, dont AIMultiple, en notant leurs soumissions par rapport aux corrigés que nous avons compilés et aux pages qu’ils ont citées.
Résultats du benchmark d’identification des clients
Nous n’avons défini aucun niveau d’effort de raisonnement pour quelque modèle que ce soit. Chacun a fonctionné avec la valeur par défaut de son programme d’agent, et le modèle de notation a été appelé à une température de 0.
- Fable 5.1 obtient 90.2, la moyenne la plus élevée des 16 modèles. Opus 5 suit avec 89.1 et GLM 5.3 avec 81.0.
- GLM 5.3 a obtenu entre 79.6 et 83.3 sur les trois cibles. Claude Sonnet 5 a obtenu 90.8 sur l’une et 0.0 sur une autre, et Gemini 3.8 Flash a obtenu 87.0 et 9.2. Des moyennes de 48.0 et 60.7 ne décrivent les exécutions d’aucun des deux modèles.
Difficulté des cibles
Les scores médians sont de 64.3 sur la première cible, 59.2 sur la deuxième et 87.0 sur la troisième. Dix des 16 modèles obtiennent au moins 84 sur la troisième, dont le corrigé comporte 18 clients, si bien qu’un client correct vaut 5.6 des 100 points de couverture qui représentent la moitié du score.
Le score de chaque modèle est la moyenne des trois cibles. Supprimer une cible facile après avoir vu les scores biaiserait la comparaison. La prochaine manche a besoin d’entreprises cibles plus difficiles.
Comparaison des coûts et des scores
- Fable 5.1 affiche une moyenne de 90.2 pour $4,38 par tâche. Opus 5 affiche une moyenne de 89.1 pour $8,51, le coût le plus élevé des 15 modèles avec des montants en dollars. GLM 5.3 affiche une moyenne de 81.0 pour $1.40.
- Grok 4.6 affiche une moyenne de 80.5 pour $0,42 par tâche, soit un vingtième du coût d’Opus 5 pour 8.6 points de moins.
- GPT 6 Astra affiche une moyenne de 74.2. Ses trois tâches par abonnement ont utilisé 279 253 tokens, et Codex CLI n’enregistre aucun coût en dollars, si bien que le graphique des coûts l’omet.
Pourquoi le travail sur les listes de clients teste-t-il les agents IA ?
Une liste de clients exige un nom et une preuve de la relation commerciale. Une liste plausible peut toujours citer des pages qui ne font que comparer des produits.
Des sources publiques peuvent confirmer une relation client individuelle. Ce benchmark ne vérifie pas si une liste est complète.
Un véritable client peut être absent du corrigé. Une soumission obtient un crédit pour un client lorsque la page citée établit la relation, et perd des points de couverture pour une entreprise supplémentaire non étayée.
Méthodologie
Couverture des modèles
Le graphique des scores utilise les 16 modèles sélectionnés pour cette campagne de benchmark. Cinq modèles remplacés restent dans les données historiques et ne sont pas représentés. Les scores vont de 0 à 100 et les étiquettes des barres arrondissent aux points entiers.
Le benchmark IT agentique utilise une échelle différente, ses scores ne sont donc pas comparables.
Tâches et soumissions
La première cible est AIMultiple, l’éditeur de ce benchmark, et son corrigé a été établi par un analyste d’AIMultiple. La deuxième cible est un site d’avis sur les logiciels et la troisième un cabinet d’études d’analystes.
Les trois corrigés contiennent 45, 65 et 18 clients et ont été cachés aux modèles testés. L’exécution couvre 48 affectations modèle-entreprise et 47 listes de clients non vides ; Inkling Small n’a produit aucune ligne de client pour la deuxième entreprise et y a obtenu un score de zéro.
Chaque score utilise une soumission par entreprise. Les soumissions s’étendent de juillet à septembre, et certaines remplacent des tentatives antérieures.
La repondération des trois cibles sur l’ensemble des 27 tirages ordonnés avec remise place la tranche centrale de 95 % des moyennes de Fable 5.1 entre 86.0 et 94.8 et celle d’Opus 5 entre 82.4 et 96.1, si bien que l’intervalle de Fable 5.1 se situe à l’intérieur de celui d’Opus 5. Nous avons repondéré uniquement ces trois cibles et nous n’avons pas mesuré la variation d’une exécution à l’autre.
Coûts et exécution
Le coût par tâche est la moyenne des trois exécutions d’un modèle, y compris celle qui n’a produit aucune ligne de client. Une tâche correspond à une entreprise cible. Les coûts en dollars couvrent 15 des 16 modèles et les données de temps écoulé couvrent 13.
Les montants en dollars ne sont pas tous mesurés de la même manière. Les exécutions sur opencode supportent les frais OpenRouter de cette session. Les exécutions sur Claude Code et Grok Build s’authentifient via un abonnement, de sorte que leurs montants correspondent aux prix catalogue appliqués aux tokens signalés par le programme. Codex CLI n’enregistre aucun coût en dollars.
Chaque modèle a reçu un prompt figé indiquant le nom de l’entreprise et demandant un CSV avec les noms d’entreprises, les URL LinkedIn, les URL de preuves et les dates de preuves. Grok Build a utilisé la recherche web native ; les autres programmes d’agents ont accédé au web via Bright Data, l’un des outils de web scraping que nous comparons.
Un programme d’agent donne au modèle un shell et un accès web, de sorte qu’un score reflète à la fois le modèle et le programme dans lequel il a été exécuté. Les prix catalogue des fournisseurs figurent dans notre comparateur de LLM tarification.
Notation et preuves
La couverture des clients représente 50 % du score, l’exactitude LinkedIn 17 %, la qualité des preuves 17 % et l’actualité des preuves 16 %.
La notation a été exécutée le 10 septembre 2026. Elle accepte les preuves datées du 10 septembre 2025 au 12 septembre 2026, soit les 12 mois précédant la notation plus deux jours. Une URL citée renvoyant une erreur 404 ou 410 plafonne la soumission à 40, et aucune soumission n’a atteint le plafond lors de ce passage.
Le code vérifie la mise en forme, les noms, les doublons, les dates et le statut des URL. Claude Sonnet 5 lit un extrait de chaque page citée et juge s’il confirme la relation. Claude Sonnet 5 est aussi l’un des 16 modèles évalués, et les modèles d’Anthropic occupent les deux premières places. Nous n’avons pas testé si un juge d’Anthropic favorise les modèles d’Anthropic.
Le prompt du juge indique si l’entreprise figure dans le corrigé, de sorte que le verdict du juge n’est pas indépendant du corrigé. Nous avons relancé l’évaluateur en retirant une entreprise d’un corrigé, et sur la même page et le même extrait, son verdict est passé de client à mention.
L’équipe du benchmark a enregistré une décision à la place du verdict du juge sur 58 lignes, dont 30 en défaveur du modèle et 28 en sa faveur. Cinquante-quatre proviennent d’un examen du texte de page conservé daté du 9 septembre 2026 et quatre sont des décisions éditoriales enregistrées le 10 septembre.
L’évaluation accepte 140 lignes en dehors des corrigés, dont 125 sur la deuxième cible. Les lignes étayées rapportent les mêmes points que les entrées du corrigé.
Lectures complémentaires
- Benchmark AIM Agentic Marketing
- Trading boursier basé sur l’IA : quel outil d’IA générative est le meilleur
- Benchmark Agentic IA Finance
FAQ
Ce test a vérifié des relations clients individuelles à partir de preuves publiques. Il n’a pas évalué si une liste était complète.
Une simple comparaison ne le fait pas. Une page doit également établir une relation commerciale, par exemple un client nommé ou un abonné aux services du cabinet d’études.
Les valeurs de couverture proviennent du corrigé. Le juge vérifie la page citée par un modèle, de sorte qu’une soumission obtient un crédit pour des clients étayés en dehors du corrigé.
Le test couvre la recherche de listes de clients. Il n’évalue pas la sélection des investissements, la valorisation ni la qualité des décisions d’un fonds.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{IA VC Benchmark: 16 agents IA sur l'identification des clients}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Consulté le 10 septembre 2026}
}Résultats et horodatages de 13 points de données. Téléchargez les données de synthèse présentées dans les graphiques et les tableaux de cet article sous forme de fichier ZIP contenant un fichier CSV et un README.
Vous voulez les données détaillées derrière ? Rejoindre Premium
Journal des modifications
1 mises à jourA remplacé le benchmark de sourcing de deals et de cartographie concurrentielle par un benchmark d'identification de clients à 14 agents.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.