Nous présentons le Benchmark AIM de marketing agentique, qui mesure la performance des agents dans l'analyse des écarts concurrentiels et la préparation de listes de cibles ABM.
Nous avons testé les performances de 11 modèles et mesuré la performance d'exécution de bout en bout :
Résultats du benchmark de marketing agentique
Les scores des tâches sont normalisés sur une échelle de 0 à 100.
- Pour l'analyse concurrentielle, le score est égal à : 100 × MAX(0, écarts vérifiés trouvés − écarts incorrects) / 10
- Pour la préparation de la liste de comptes, le score est le pourcentage des 71 points de la grille disponibles obtenus par le modèle.
Le score global est la moyenne arithmétique des deux scores de tâche, donnant à chaque tâche un poids égal malgré la différence de taille des grilles. Les soumissions invalides ou manquantes comptent pour zéro dans le calcul global, bien que le tableau les distingue des soumissions valides qui obtiennent un score de zéro.
Lisez la méthodologie pour plus d'informations sur l'évaluation des tâches.
Fable 5 est arrivé en tête dans les deux tâches
Fable 5 a obtenu le score global le plus élevé avec 75.15, dont 70 en analyse concurrentielle et 80.3 en préparation de liste de comptes. Son avance provient de la production du meilleur résultat valide sur les deux flux de travail et de l'absence de zéro qui suit une soumission invalide ou manquante.
Les scores agrégés ne révèlent pas quelle capacité sous-jacente a créé cet avantage. La conformité au format, la sélection des sources, la couverture de recherche et l'application répétée des règles pourraient toutes contribuer ; les séparer nécessiterait une comparaison au niveau des critères des fichiers de chaque modèle.
GLM 5.2 s'est classé deuxième avec 68.05 et a également été deuxième dans les deux tâches. Fable 5 devance de 10 points en analyse concurrentielle et de 4.2 points en préparation de liste de comptes.
L'analyse concurrentielle a donné des scores plus faibles
Lorsque la soumission invalide est comptée comme zéro, la moyenne du score d'analyse concurrentielle est de 40.9. Fable 5 est en tête avec 70, tandis que les scores valides allaient de 30 à 70.
Ces chiffres doivent être interprétés en tenant compte de la formule de notation. Comme la tâche utilise dix écarts attendus, chaque trouvaille nette correcte supplémentaire modifie le score de dix points. Un modèle qui trouve six écarts valides et aucun faux obtient 60 ; un modèle qui trouve sept écarts valides et ajoute une affirmation incorrecte obtient le même résultat.
La grille décrit également cette tâche comme un faible discriminateur parmi les modèles de pointe. Sa principale valeur réside dans la séparation des systèmes plus faibles qui manquent plusieurs écarts, ajoutent de fausses affirmations d'absence ou échouent au format de sortie requis. Les petites différences de score en haut du classement doivent donc recevoir moins de poids que les échecs plus importants ou les soumissions invalides.
La préparation de la liste de comptes a offert une meilleure résolution des scores
La tâche de liste de comptes utilise une grille de 71 points, ce qui produit des résultats plus granulaires. Les scores valides allaient de 32.4 à 80.3, et Fable 5 et GLM 5.2 ont dépassé 70.
Sol, Terra, Sonnet 5 et Opus 4.8 ont formé un groupe intermédiaire serré, avec des scores compris entre 66.2 et 69. Gemini 3.1 Pro a rendu la soumission valide la plus basse à 32.4. Kimi K3 n'a pas produit de résultat noté, tandis que MiniMax M3 a échoué à une condition structurelle obligatoire.
La moyenne était de 51.5 après que les exécutions invalides et manquantes ont été converties en zéro. Comme le flux de travail nécessitait une carte de couverture et 100 comptes qualifiés, le score reflétait la performance sur des centaines de réclamations et classifications individuelles plutôt que sur une courte liste de constats.
La performance variait selon le flux de travail
Kimi K3 a obtenu 60 en analyse concurrentielle et n'a pas rendu de liste de comptes valide. Sonnet 5 a montré le schéma inverse : sa sortie d'analyse concurrentielle était invalide, tandis que sa soumission de liste de comptes a obtenu 67.6.
Ces cas montrent pourquoi les résultats au niveau des tâches sont importants. L'analyse concurrentielle met l'accent sur la comparaison sémantique et la vérification des absences ; la préparation de la liste de comptes exige davantage de recherches soutenues, de résolution d'entités, de gestion des sources et de construction de fichiers.
Pour les équipes marketing, l'implication pratique est claire : choisissez les modèles en fonction du flux de travail à automatiser, puis testez-les par rapport au format de sortie requis et au standard de preuves.
Les tâches réelles utilisées dans le benchmark
Ces tâches de marketing agentique incluent la couverture stratégique et de contenu, la croissance et la recherche commerciale. Chacune nécessite une recherche sur le web, une validation des sources, une qualification basée sur des règles et une sortie structurée.
Tâche 1 : Analyse des écarts concurrentiels
Le modèle agit comme un analyste stratégique comparant AIMultiple à d'autres plateformes de recherche et de benchmarking.
L'agent examine les deux sites web et identifie les offres que l'autre plateforme propose mais que AIMultiple ne possède pas. Les catégories valides sont arena, benchmark, evaluation_format, content, methodology, dataset, et other.
La tâche autorise jusqu'à dix écarts. Chaque ligne CSV contient l'écart, sa catégorie, une explication, une page en direct prouvant que l'offre concurrente existe, les pages AIMultiple vérifiées, et un score de priorité.
Lorsque AIMultiple propose une offre connexe, le modèle doit la nommer et expliquer la différence restante. Un chevauchement de catégories larges ne suffit pas à établir l'équivalence.
Comment nous avons noté la tâche
La clé de réponse cachée contient dix écarts vérifiés et un ensemble de fausses affirmations d'absence connues. Chaque écart étayé ajoute un à A_found, tandis que chaque écart incorrect ajoute un à B_wrong. Le score est : MAX(0, A_found − B_wrong) / 10
Une URL fabriquée, inaccessible ou non étayée retire le crédit de l'écart associé et ajoute une pénalité de précision. Cette conception rend coûteuse l'expansion spéculative de la liste, car l'ajout d'une affirmation plausible peut abaisser le score final.
La sortie doit également passer des vérifications structurelles au niveau de l'exécution. Le CSV doit avoir le nom de fichier et les colonnes corrects, entre 1 et 10 lignes, des valeurs de catégorie acceptées, des domaines valides, des cellules atomiques, et un ordre décroissant de priorité. L'échec à l'une de ces vérifications rend la soumission invalide.
Tâche 2 : Préparation d'une liste de comptes les mieux adaptés
Le modèle agit comme un spécialiste du marketing de croissance préparant une liste de marketing basé sur les comptes pour AIMultiple.
Le travail commence par une carte de couverture des pages en direct de AIMultiple. L'agent enregistre les pages de catégorie, les benchmarks et les pages de comparaison de fournisseurs, ainsi que les fournisseurs mentionnés dans le corps des articles et dans les déclarations de sponsors.
Il prépare ensuite une liste priorisée de 100 comptes. Chaque entreprise doit être un fournisseur de technologie B2B avec un chiffre d'affaires annuel compris entre 100 millions de dollars et 1 milliard de dollars, avoir son siège aux États-Unis, en Europe ou en Israël, et être active dans une catégorie couverte par AIMultiple. L'entreprise doit également avoir un signal de marketing de croissance actuel et au moins une page AIMultiple où elle représente une véritable opportunité commerciale.
Le fichier de comptes enregistre le domaine de l'entreprise, sa page LinkedIn, son siège, sa catégorie, son chiffre d'affaires et sa source, le nombre d'employés, l'année de création, le statut de financement ou de propriété, les pages AIMultiple pertinentes, le signal marketing et le score d'adéquation.
Les sociétés mères et les filiales ne peuvent pas apparaître toutes les deux pour la même opportunité de fournisseur. Les règles excluent également les entreprises de services, les entreprises grand public, les sociétés d'analyse ou d'évaluation, et les candidats qui ne répondent pas aux exigences de chiffre d'affaires ou de siège.
Comment nous avons noté la tâche
La grille contient 71 points répartis sur sept sections. La section de la carte de couverture vérifie si le modèle a examiné au moins 30 pages en direct de AIMultiple et inclus chaque type de page requis. Les examinateurs échantillonnent des lignes pour confirmer que les fournisseurs nommés et les déclarations de sponsors correspondent aux pages en direct.
La section du fichier de comptes exige exactement 100 domaines distincts, les colonnes spécifiées, les classifications acceptées, des scores d'adéquation décroissants et des champs de preuve complets. Un échantillon fixe de 20 comptes est ensuite utilisé pour des vérifications détaillées couvrant le chiffre d'affaires, l'identité LinkedIn, le vrai siège, l'adéquation de la catégorie, la preuve de marketing de croissance et le statut de fournisseur B2B.
Les autres sections testent si les pages proposées sont de véritables ouvertures, pénalisent les comptes disqualifiés ou fabriqués, récompensent l'inclusion d'entreprises vérifiées à fort potentiel, et vérifient si les modèles évitent les quasi-erreurs connues.
Un fichier de comptes manquant, des colonnes incorrectes ou tout nombre de lignes autre que 100 rend l'exécution invalide.
Méthodologie du benchmark de marketing agentique
Nous avons construit les deux benchmarks à partir des flux de travail utilisés par nos équipes stratégie et croissance.
La tâche d'analyse concurrentielle soutient les décisions concernant la couverture des produits, les priorités de contenu et le positionnement. La tâche de liste de comptes soutient le marketing basé sur les comptes et la recherche commerciale.
Pour chaque flux de travail, nous avons créé un fichier de tâche qui définit :
- le rôle du modèle
- les outils disponibles
- les exigences de preuve
- les règles de qualification
- les sorties requises
- la limite de temps
Nous avons conçu les tâches autour de nos propres pages et flux de travail commerciaux, et nos données font partie de la clé de réponse. Cela facilite la vérification des preuves, bien que cela limite également la généralisation des résultats à d'autres entreprises et environnements marketing.
Instructions de tâche et grilles de notation
Pour l'analyse concurrentielle, les modèles pouvaient rechercher sur le web en direct via le Bright Data MCP. Nous avons désactivé l'exécution de code et fixé une limite de 90 minutes.
Pour la préparation de la liste de comptes, les modèles ont utilisé le même accès web, avec l'exécution de code activée. Nous avons autorisé jusqu'à 240 minutes car la tâche nécessitait deux fichiers de sortie et 100 comptes qualifiés.
Nous avons donné à chaque modèle les instructions de tâche et le schéma de sortie, tout en gardant la grille de notation cachée.
Les modèles devaient utiliser des sources actuelles
Les deux tâches dépendent d'informations qui évoluent dans le temps, notamment les offres de sites web, les inventaires de benchmarks, les pages produits, le chiffre d'affaires des entreprises, les sièges sociaux, la propriété, les déclarations de sponsors et l'activité marketing.
Nous avons compté une URL lorsqu'elle se résolvait et soutenait l'affirmation associée. Une page d'accueil d'entreprise ne pouvait pas étayer un chiffre d'affaires spécifique, et une base de données marketing générique ne pouvait pas prouver qu'une plateforme offrait un format de benchmark particulier. Nous avons vérifié les clés de réponse pour la dernière fois le 7 juillet 2026.
Les sorties ont été conçues pour une utilisation opérationnelle
Les deux tâches nécessitent des fichiers CSV avec des colonnes fixes et des cellules atomiques. Ce format nous permet de vérifier automatiquement les champs manquants, les doublons, les catégories invalides, les domaines non pris en charge, les nombres de lignes incorrects, les valeurs mal formées et les erreurs de tri.
Cela reflète également la manière dont les équipes marketing utilisent ces sorties. Les listes de comptes et les analyses concurrentielles passent souvent dans des feuilles de calcul, des flux de travail CRM, des bases de données internes ou des outils d'automatisation. Un fichier structurellement invalide peut bloquer l'étape suivante même lorsque certaines parties de la recherche sont correctes.
Nous rapportons des scores d'exécution unique sans variance
Les résultats incluent un score rapporté par modèle. Nous ne rapportons actuellement pas d'exécutions répétées, de graines, d'intervalles de confiance ou de barres d'erreur.
Les lecteurs doivent donc interpréter les petites différences de score avec prudence. En analyse concurrentielle, un écart net correct supplémentaire modifie le score de dix points. En préparation de liste de comptes, quelques lignes échantillonnées peuvent déterminer si un critère basé sur un seuil entier est franchi.
Nous avons combiné des vérifications déterministes avec un juge LLM
Des scripts déterministes ont traité tout ce que le logiciel peut régler directement : existence du fichier, analyse CSV, ordre des colonnes, nombre de lignes, valeurs acceptées, domaines URL, doublons et tri. Les scripts ont également récupéré chaque URL citée, suivi les redirections et transmis le contenu de la page résolue au juge.
Un juge LLM a évalué les critères sémantiques, si deux offres sont équivalentes, si une affirmation d'absence tient, si une entreprise correspond à une catégorie, si une page récupérée soutient l'affirmation qui lui est attachée, et si une page proposée est une véritable ouverture.
Le juge a noté une ligne ou un écart à la fois par rapport aux règles de réussite ou d'échec de la grille, et les scripts ont agrégé ces jugements dans les critères de seuil (par exemple, ≥18 sur 20 lignes échantillonnées). Il n'a jamais attribué de note de qualité générale. Nos propres analystes ont construit et figé la clé de réponse : les comptes de référence, les pièges et les transcriptions des déclarations de sponsors, le 7 juillet 2026 ; le juge a appliqué cette clé plutôt que de se faire sa propre opinion de ce qui devrait compter.
Cela nous a permis de noter deux longs fichiers chargés de preuves, mais cela comporte un risque : un juge peut accepter une source qu'il a lue de manière trop généreuse, ce qui est le même mode d'échec que la grille pénalise chez les modèles. Ces résultats utilisent un seul passage de jugement, sans vérification d'accord entre plusieurs juges et sans calibrage par rapport à un échantillon noté par un humain.
FAQ
Le marketing agentique consiste à utiliser des agents alimentés par l'IA pour planifier et réaliser des tâches marketing en plusieurs étapes avec une intervention humaine minimale. Ces agents utilisent les données clients, les règles métier, le contexte en temps réel et les instructions en langage naturel pour prendre des décisions tout au long des flux de travail marketing.
L'automatisation marketing traditionnelle exécute des règles prédéfinies, telles que l'envoi d'un e-mail après une soumission de formulaire ou le déplacement d'un lead entre des segments d'audience. Les systèmes agentiques peuvent interpréter un objectif commercial, sélectionner les outils nécessaires, effectuer la configuration de la campagne, surveiller les performances de la campagne et ajuster les actions pour optimiser les performances.
Une plateforme de marketing agentique peut prendre en charge des tâches telles que :
– analyser le comportement des clients et identifier les segments d'audience ;
– adapter les parcours clients en fonction de nouveaux signaux ;
– allouer les dépenses publicitaires entre les campagnes marketing ;
– générer du contenu dans le respect des directives de la marque ;
– coordonner les flux de travail créatifs et préserver la direction créative ;
– produire des informations générées par l'IA pour l'optimisation des parcours ;
– déplacer des données entre des outils déconnectés dans un cloud marketing ;
– attribuer des tâches spécifiques à plusieurs agents.
L'analyse des écarts concurrentiels nécessite des preuves des deux côtés de chaque constat. Le modèle doit confirmer que la plateforme concurrente propose une offre spécifique. Il doit ensuite inspecter les pages pertinentes de AIMultiple et déterminer s'il existe un équivalent.
La deuxième étape nécessite une exploration plus large du site. Des preuves pertinentes peuvent apparaître sur une page de benchmark, une page de catégorie, un article, une page d'outil ou une entrée de plan du site.
La similarité sémantique ajoute un autre défi. Deux offres peuvent s'adresser au même vaste marché tout en utilisant des formats d'évaluation ou des méthodologies différents. L'agent doit décider si la différence crée un écart significatif.
La grille pénalise également les constats spéculatifs. Un comportement de recherche large peut améliorer le rappel et augmenter le nombre de fausses affirmations d'absence. Un comportement conservateur peut protéger la précision et manquer des écarts attendus.
Les deux tâches testent différentes combinaisons de capacités. L'analyse concurrentielle nécessite une recherche comparative, un jugement sémantique et une vérification minutieuse de l'absence.
La préparation de la liste de comptes nécessite une recherche web soutenue, une qualification répétée, une résolution d'entités, une gestion des sources et un contrôle précis de la sortie.
Un modèle peut bien performer sur une tâche de comparaison courte mais échouer à compléter un fichier volumineux et structuré. Un autre modèle peut gérer la recherche répétée de comptes et échouer à une vérification structurelle en analyse concurrentielle.
La sélection des modèles pour le marketing agentique doit donc prendre en compte les flux de travail marketing spécifiques qu'une équipe prévoit d'automatiser.
Citer cette recherche
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark AIM de marketing agentique}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Consulté le 17 Juillet 2026}
}
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.