Services
Contactez-nous

Benchmark marketing agentique AIM

Sıla Ermut
Sıla Ermut
mis à jour le 5 août 2026

Nous introduisons le Benchmark marketing agentique AIM, qui mesure les performances des agents sur trois flux de travail marketing : analyse des écarts concurrentiels, préparation d'une liste de cibles ABM et présentation commerciale personnalisée.

Nous avons testé les performances de 11 models dans trois tâches réelles et mesuré les performances d'exécution de bout en bout :

Résultats du benchmark marketing agentique

Loading Chart

Les scores des tâches sont normalisés sur une échelle de 0 à 100.

  • Pour l'analyse concurrentielle, le score est égal à : 100 × MAX(0, écarts vérifiés trouvés − écarts incorrects) / 10
  • Pour la préparation de la liste de comptes, le score est le pourcentage des 71 points de la grille d'évaluation disponibles obtenus par le model.
  • Pour la tâche de présentation commerciale, le score est la somme de 5 sections de 20 points.

Le score global est la moyenne arithmétique des trois scores de tâche, donnant à chaque tâche un poids égal malgré leurs différentes tailles de grille. Les soumissions non valides comptent comme zéro dans le calcul global, à deux exceptions près : Kimi K3 et Gemini 3.5 Flash n'ont pas de score global car ils n'ont pas exécuté la tâche de présentation commerciale.

Lisez la méthodologie pour plus d'informations sur l'évaluation des tâches.

Aucun model n'était fiable dans les trois flux de travail

Fable 5 à 84,4 % et Sol à 74 % sont les seuls models à s'être classés dans le top trois de chaque tâche. En dessous, l'ordre est proche d'un remaniement. GLM 5.2 a obtenu 80 % et 76,1 % sur les deux premières tâches puis n'a rédigé aucune présentation du tout. Sonnet 5 a échoué complètement à l'analyse concurrentielle et a produit la troisième meilleure présentation. MiniMax M3 s'est classé dernier des neuf models avec un score sur les trois tâches, tout en détenant le quatrième meilleur score de présentation.

Un classement issu d'un flux de travail marketing ne se transfère pas au suivant. Testez donc un model sur le flux de travail que vous prévoyez d'automatiser avant de le choisir

Chaque zéro est venu de la livraison, pas de la recherche

Cinq exécutions ont obtenu zéro, et aucune n'a été jugée médiocre sur le contenu. Sonnet 5 a soumis onze lignes contre une limite de dix lignes. Kimi K3 et MiniMax M3 n'ont jamais produit un fichier de compte valide. GLM 5.2 et Opus 4.8 ont terminé l'exécution de la présentation sans écrire un fichier.

Dans chaque cas, la recherche n'a jamais été lue. Si vous déployez un agent, cela peut être la contrainte qui compte plus que la qualité de la recherche : un agent qui ne peut pas produire un fichier bien formé à temps n'obtient aucun point.

Les présentations commerciales se sont bien vendues et n'ont rien prouvé

Sur les sept présentations produites par les models, elles ont obtenu 83 % des points disponibles pour expliquer ce que vaut AIMultiple pour le destinataire, 36 % pour avoir cité les benchmarks pertinents pour ce destinataire, et 20 % pour avoir proposé ce qu'il faudrait rechercher ensuite.

Rédiger un argumentaire persuasif s'est avéré être la moitié facile. L'ancrer dans des travaux publiés, ce que vend une société de recherche, est là où les présentations ont échoué.

Les tâches réelles utilisées dans le benchmark

Ces tâches de marketing agentique couvrent la stratégie et la couverture de contenu, la croissance et la recherche commerciale. Chacune nécessite une recherche web, une validation des sources, une qualification basée sur des règles et une sortie structurée.

Tâche 1 : Analyse des écarts concurrentiels

Le model agit en tant qu'analyste stratégique chez AIMultiple et le compare à une plateforme concurrente de benchmarking d'IA. L'exécution permet 90 minutes et un accès web en direct via le MCP de Bright Data, avec l'exécution de code désactivée.

La sortie est un fichier unique et contient jusqu'à dix lignes classées par priorité. Chaque ligne nomme une offre que le concurrent publie et que AIMultiple ne propose pas, explique la différence en une ou deux phrases, cite une page concurrente que le model a ouverte, et liste les pages AIMultiple qu'il a examinées avant d'affirmer l'absence.

L'affirmation de l'absence est la moitié la plus difficile de chaque résultat. Identifier une fonctionnalité sur le site du concurrent nécessite une seule page. Établir que AIMultiple ne la fournit pas nécessite de passer en revue les pages de catégories, les benchmarks, les articles et le plan du site.

Lorsque AIMultiple publie une offre voisine, le model doit nommer cette page et préciser en quoi la version du concurrent diffère. La couverture d'un même sujet général ne constitue pas une offre équivalente.

Comment nous avons noté la tâche

La notation compare les exécutions à un corrigé compilé manuellement : dix écarts vérifiés sur les deux sites, ainsi que les affirmations d'absence que les pages AIMultiple en direct réfutent.

Chaque écart vérifié ajoute un point, et chaque affirmation d'absence incorrecte en retire un. Une affirmation incorrecte inclut toute ligne dont l'URL est fabriquée, inaccessible ou ne soutient pas l'affirmation associée.

Le corrigé contient dix écarts, mais un model peut en trouver un réel qui n'y figure pas. Un évaluateur lit ces résultats manuellement et accorde le point si la page citée montre l'offre, qu'aucune page AIMultiple en direct ne contredit l'affirmation, et que l'offre est véritablement absente de AIMultiple.

Deux règles limitent ces points supplémentaires :

  • Un résultat qui répète l'un des dix existants avec des mots différents ne rapporte rien de plus. Il est crédité sous l'écart listé à la place.
  • Un résultat qui échoue à l'examen coûte un point. Si AIMultiple publie déjà l'offre, ou si le concurrent ne l'a pas, la ligne obtient zéro, la même pénalité que toute autre affirmation erronée.

Cela empêche le corrigé de pénaliser un résultat que les analystes n'ont pas enregistré, tout en refusant le crédit aux affirmations spéculatives.

En dernière partie de l'évaluation, l'évaluateur effectue des vérifications de liens. Les vérifications de liens suivent les redirections et évaluent la destination finale, donc un 301 ne fait pas échouer une ligne à lui seul. Un nom de fichier incorrect, des colonnes manquantes ou réorganisées, un nombre de lignes en dehors de un à dix, une priorité en dehors de 1 à 10, une URL de preuve sur le mauvais domaine, ou des lignes dans le désordre rendent chacun l'exécution invalide, et une exécution invalide ne reçoit aucun score numérique.

Tâche 2 : Préparation de la liste de comptes les plus adaptés

Le model agit en tant que spécialiste du marketing de croissance préparant une liste de comptes basée sur le marketing pour AIMultiple.

Le travail commence par une cartographie des pages en direct de AIMultiple. L'agent enregistre les pages de catégories, les benchmarks et les pages de comparaison de fournisseurs, ainsi que les fournisseurs mentionnés dans le corps des articles et dans les divulgations de parrainage.

Il prépare ensuite une liste priorisée de 100 comptes. Chaque entreprise doit être un fournisseur technologique B2B avec un revenu annuel compris entre 100 millions et 1 milliard de dollars, dont le siège est aux États-Unis, en Europe ou en Israël, et active dans une catégorie couverte par AIMultiple. L'entreprise a également besoin d'un signal actuel de marketing de croissance et d'au moins une page AIMultiple où elle représente une véritable opportunité commerciale.

Le fichier de compte enregistre le domaine de l'entreprise, sa page LinkedIn, le siège, la catégorie, le revenu et sa source, le nombre d'employés, l'année de fondation, le statut de financement ou de propriété, les pages AIMultiple pertinentes, le signal marketing et le score d'adéquation.

Les sociétés mères et les filiales ne peuvent pas toutes deux apparaître pour la même opportunité fournisseur. Les règles excluent également les entreprises de services, les entreprises grand public, les sociétés d'analyse ou d'évaluation, et les candidats qui ne répondent pas aux exigences de revenu ou de siège.

Comment nous avons noté la tâche

La grille contient 71 points répartis dans sept sections. La section de cartographie vérifie si le model a examiné au moins 30 pages AIMultiple en direct et a inclus chaque type de page requis. Les évaluateurs échantillonnent des lignes pour confirmer que les fournisseurs nommés et les divulgations de parrainage correspondent aux pages en direct.

La section du fichier de comptes exige exactement 100 domaines distincts, les colonnes spécifiées, des classifications acceptées, des scores d'adéquation décroissants et des champs de preuves complets. Un échantillon fixe de 20 comptes est ensuite utilisé pour des vérifications détaillées couvrant le revenu, l'identité LinkedIn, le vrai siège, l'adéquation de la catégorie, la preuve de marketing de croissance et le statut de fournisseur B2B.

D'autres sections testent si les pages proposées sont de véritables ouvertures, pénalisent les comptes disqualifiés ou fabriqués, récompensent l'inclusion d'entreprises à haute adéquation vérifiées et vérifient si les models évitent les quasi-échecs connus.

Un fichier de compte manquant, des colonnes incorrectes, ou tout nombre de lignes autre que 100 rend l'exécution invalide.

Tâche 3 : Présentation commerciale personnalisée

Note : Nous avons exclu Kimi K3 et Gemini 3.5 Flash car chacun a demandé l'accès à un répertoire en dehors de son dossier de travail ; le harnais a refusé automatiquement la demande, et les deux exécutions se sont arrêtées là. Aucun n'a produit de présentation, et aucun n'a échoué à la tâche, puisque rien de ce qu'ils ont produit n'a été jugé. Un zéro mettrait un problème d'infrastructure sur le dossier du model, donc les deux sont marqués comme non exécutés et exclus de la moyenne.

Le model agit en tant qu'analyste avant-vente chez AIMultiple et construit une présentation destinée à un cadre supérieur en marketing produit. L'exécution permet 90 minutes, un accès web en direct via le MCP de Bright Data, l'exécution de code, et un dossier d'actifs de marque contenant les logos et les polices.

L'essentiel de la recherche porte sur le cadre plutôt que sur l'entreprise. Ce cadre dirige le marketing pour une seule gamme de produits et a déclaré publiquement ce qui compte pour juger du matériel : combien de tokens un dollar achète, si quelqu'un d'indépendant a vérifié les chiffres, et si le test ressemblait à une charge de travail réelle ou à une démo.

Un autre argument récurrent est qu'un rack est une unité de comparaison plus juste qu'une puce. Comme ces arguments sont publics et peuvent être trouvés dans des interviews, des conférences et des publications, la tâche consiste à les lire puis à trouver les benchmarks AIMultiple qui y répondent. Une présentation peut être exacte à propos de AIMultiple et passer complètement à côté de la personne, et c'est cette version qui obtient un mauvais score.

Voici quelques sorties de Fable 5, Gemini 3-1 pro-preview, et GPT 5.6 Sol :

Comment nous avons noté la tâche

La présentation est notée sur cinq aspects, chacun valant 20 points : si elle suit l'identité visuelle de AIMultiple, si elle cite les bons benchmarks, si elle propose des études futures utiles, si elle explique ce que AIMultiple vaut pour le destinataire, et si les diapositives sont claires. Chacun des cinq se décompose en petites vérifications avec des réponses fixes.

L'identité visuelle est la seule partie qu'un model peut réussir sans faire de recherche. Les fichiers de logo, la valeur hexadécimale de la couleur d'accent, les couleurs de texte, la police de caractères et l'orthographe du nom de l'entreprise sont tous soit corrects, soit non. Par exemple, une présentation en Calibri perd les points.

La deuxième partie évalue ce vers quoi la présentation pointe aujourd'hui. AIMultiple publie de nombreux articles sur le matériel, et seuls certains d'entre eux testent le type de puces que cette personne vend. Par conséquent, les points vont à une présentation citant des études de GPU de centre de données plutôt que les pages de matériel apparues en premier.

La troisième section concerne le travail que AIMultiple pourrait faire ensuite. Une suggestion compte ici si elle nomme l'étude et le chiffre qu'elle produirait. Par exemple, ré-exécuter une comparaison existante sur les puces de cette année ou ajouter le matériel de l'entreprise à un benchmark qui l'exclut actuellement rapporte un point. En revanche, proposer que les deux entreprises examinent ensemble les performances d'inference ne nomme ni une étude ni une mesure, donc ne donne aucun point.

La quatrième partie concerne ce que AIMultiple vaut pour le destinataire. Des points sont attribués pour trois affirmations selon lesquelles :

  • AIMultiple est indépendant
  • Son lectorat est d'une taille indiquée, étayée par une source nommée
  • Ce lectorat sert un objectif spécifique pour l'activité du destinataire, comme atteindre les acheteurs au stade de la liste restreinte

Une présentation qui énumère ce que AIMultiple publie sans rien relier aux propres produits du destinataire ne rapporte pas de points.

La cinquième partie couvre la lisibilité de la présentation. Deux vérifications importent plus que les autres : les titres doivent énoncer une conclusion plutôt que d'étiqueter la diapositive, et les chiffres doivent dire d'où ils viennent, en gardant les chiffres de l'entreprise séparés des mesures propres de AIMultiple. Le reste est mécanique, comme l'évaluation du nombre de diapositives, le débordement de texte, les étiquettes de graphiques, le remplissage.

Quatre des cinq parties entraînent également des pénalités. Un benchmark inventé, un chiffre fabriqué, un lien mort, ou la présentation de l'affirmation marketing de l'entreprise comme une mesure AIMultiple coûte des points. Promettre des résultats favorables, un classement préférentiel, ou une évaluation avant publication coûte également des points, puisque AIMultiple n'offre rien de tout cela. La présentation doit persuader sans fabriquer de preuves et sans offrir quoi que ce soit que l'entreprise ne vend pas.

Laissez notre équipe automatiser l'un de vos processus métier avec des agents IA, gratuitement.
Automatiser un processus

Méthodologie du benchmark marketing agentique

Nous avons construit le benchmark à partir de trois flux de travail que nos équipes de stratégie, de croissance et de ventes exécutent.

La tâche d'analyse concurrentielle soutient les décisions concernant la couverture des produits, les priorités de contenu et le positionnement. La tâche de liste de comptes soutient le marketing basé sur les comptes et la recherche commerciale. La présentation commerciale soutient la prospection avant-vente : choisir un prospect, déterminer quels benchmarks publiés sont pertinents et construire le document.

Pour chaque flux de travail, nous avons créé un fichier de tâche qui définit :

  • le rôle du model
  • les outils disponibles
  • les exigences en matière de preuves
  • les règles de qualification
  • les sorties requises
  • la limite de temps

Nous avons conçu les tâches autour de nos propres pages et flux de travail commerciaux, et nos données font partie du corrigé. Cela rend les preuves plus faciles à vérifier, bien que cela limite également l'applicabilité des résultats à d'autres entreprises et environnements marketing.

Instructions de la tâche et grilles de notation

Pour l'analyse concurrentielle, les models pouvaient rechercher sur le web en direct via le MCP de Bright Data. Nous avons désactivé l'exécution de code et fixé une limite de 90 minutes.

Pour la préparation de la liste de comptes, les models utilisaient le même accès web, avec l'exécution de code activée. Nous avons autorisé jusqu'à 240 minutes car la tâche nécessitait deux fichiers de sortie et 100 comptes qualifiés.

Pour la préparation de la présentation commerciale, nous avons activé le même accès web avec exécution de code. La durée était de 90 minutes, avec un dossier d'actifs de marque dans le répertoire de travail.

Nous avons donné à chaque model les instructions de la tâche et le schéma de sortie, tout en gardant la grille de notation cachée.

Les models devaient utiliser des sources actuelles

Les trois tâches dépendent d'informations qui changent : les offres du site, les inventaires de benchmarks, les pages produits, le chiffre d'affaires des entreprises, le siège social, la propriété, les divulgations de parrainage, l'activité marketing et les déclarations publiques d'une personne nommée.

Nous avons compté une URL lorsqu'elle se résolvait et étayait l'affirmation qui lui était attachée. Une page d'accueil d'entreprise ne peut pas étayer un chiffre de revenu spécifique, et une base de données marketing ne peut pas prouver qu'une plateforme offre un format de benchmark particulier.

Les corrigés des deux premières tâches ont été vérifiés pour la dernière fois le 7 juillet 2026. La grille de la présentation commerciale a été vérifiée le 25 juillet 2026, et les présentations ont été notées le lendemain.

Les sorties ont été conçues pour une utilisation opérationnelle

Les deux premières tâches nécessitent des fichiers CSV avec des colonnes fixes et des cellules atomiques, ce qui nous permet de vérifier automatiquement les champs manquants, les doublons, les domaines non pris en charge, le nombre de lignes incorrect, les valeurs mal formées et les erreurs de tri. La troisième nécessite un fichier PowerPoint qui s'ouvre sans invite de réparation en 16:9.

Les listes de comptes et les analyses concurrentielles entrent dans des feuilles de calcul, des flux de travail CRM et des outils d'automatisation, et une présentation va à un client. Un fichier structurellement invalide bloque l'étape suivante même lorsque la recherche qu'il contient est intacte. C'est pourquoi deux models ont obtenu zéro à la tâche de présentation sans que personne ne lise leurs arguments.

Nous rapportons des scores d'exécution unique sans variance

Les résultats incluent un score rapporté par model. Nous ne rapportons actuellement pas d'exécutions répétées, de graines, d'intervalles de confiance ou de barres d'erreur.

Les lecteurs doivent donc traiter les petites différences de score avec prudence. Dans l'analyse concurrentielle, un écart net correct supplémentaire modifie le score de dix points. Dans la préparation de la liste de comptes, quelques lignes échantillonnées peuvent déterminer si un critère basé sur un seuil est respecté.

Nous avons combiné des vérifications déterministes avec un juge LLM

Des scripts déterministes ont géré tout ce que le logiciel peut régler directement : existence des fichiers, parsing CSV, ordre des colonnes, nombre de lignes, valeurs acceptées, domaines d'URL, doublons, tri, et pour la présentation, l'intégrité de l'archive, les dimensions des diapositives et les déclarations de police. Les scripts ont également récupéré chaque URL citée, suivi les redirections et transmis le contenu de la page résolue au juge.

Un juge LLM a noté les critères sémantiques une ligne, un écart ou un critère à la fois selon des règles de réussite/échec, et n'a jamais attribué de note de qualité générale. Nos analystes ont construit les corrigés, et le juge les a appliqués.

L'analyse concurrentielle ajoute une étape humaine. Un model peut signaler un écart réel que le corrigé ne liste pas, donc ces résultats sont transmis à un analyste, qui ne les crédite qu'après avoir vérifié les deux sites.

FAQ

Le marketing agentique implique l'utilisation d'agents alimentés par l'IA pour planifier et exécuter des tâches marketing en plusieurs étapes avec une intervention humaine minimale. Ces agents utilisent les données clients, les règles métier, le contexte en temps réel et des instructions en langage naturel pour prendre des décisions tout au long des flux de travail marketing.

L'automatisation marketing traditionnelle exécute des règles prédéfinies, comme l'envoi d'un e-mail après la soumission d'un formulaire ou le déplacement d'un lead entre des segments d'audience. Les systèmes agentiques peuvent interpréter un objectif commercial, sélectionner les outils nécessaires, configurer une campagne, surveiller ses performances et ajuster les actions pour optimiser les performances.

Une plateforme de marketing agentique peut prendre en charge des tâches telles que :
– analyser le comportement des clients et identifier les segments d'audience ;
– adapter les parcours clients en fonction de nouveaux signaux ;
– répartir les dépenses publicitaires entre les campagnes marketing ;
– générer du contenu conforme aux directives de la marque ;
– coordonner les flux de travail créatifs et préserver la direction créative ;
– produire des informations générées par l'IA pour l'optimisation des parcours ;
– déplacer des données entre des outils déconnectés dans un cloud marketing ;
– attribuer des tâches spécifiques à plusieurs agents.

Les trois tâches testent des capacités différentes.

L'analyse concurrentielle récompense la recherche comparative, le jugement sémantique et la vérification minutieuse de l'absence.

La préparation de la liste de comptes récompense la recherche web soutenue, la qualification répétée, la résolution d'entités et le contrôle exact de la sortie.

La présentation commerciale récompense la lecture des positions publiques d'une personne et leur mise en relation avec des travaux publiés, dans un format de fichier qui doit survivre à PowerPoint.

Un model peut gérer une courte comparaison et ne pas réussir à terminer un grand fichier structuré. GLM 5.2 a obtenu 80 et 76,1 aux deux premières tâches puis n'a produit aucune présentation. Sonnet 5 a fait l'inverse : son fichier d'analyse concurrentielle a enfreint une règle de formatage et a obtenu zéro, et sa présentation s'est classée troisième.

Ne manquez pas nos benchmarks et analyses basées sur les données. Le bouton ouvre Google ; sélectionner AIMultiple confirme que vous souhaitez voir AIMultiple plus souvent dans les résultats de recherche Google.
GoogleAjouter comme source préférée

Citer cette recherche

Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.

Sıla Ermut and Berk Kalelioğlu (2026) - "Benchmark marketing agentique AIM". Publié en ligne sur AIMultiple.com. Consulté le 5 Août 2026, à : https://aimultiple.com/agentic-marketing [Ressource en ligne]

Ermut, S., & Kalelioğlu, B. (2026, 5 Août). Benchmark marketing agentique AIM. AIMultiple. https://aimultiple.com/agentic-marketing

@misc{ermut2026,
  author = {Ermut, Sıla and Kalelioğlu, Berk},
  title  = {{Benchmark marketing agentique AIM}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-marketing}},
  note   = {AIMultiple. Consulté le 5 Août 2026}
}
Sıla Ermut
Sıla Ermut
Analyste Sectorielle
Sıla Ermut est analyste sectorielle chez AIMultiple, spécialisée dans le marketing par email et les vidéos de vente. Elle a précédemment travaillé comme recruteuse dans des cabinets de gestion de projet et de conseil. Sıla est titulaire d'un Master of Science en psychologie sociale et d'un Bachelor of Arts en relations internationales.
Voir le profil complet
Recherche effectuée par
Berk Kalelioğlu
Berk Kalelioğlu
Chercheur en IA
Berk est chercheur en IA chez AIMultiple, se concentrant sur les systèmes d'IA agentique et les language models.
Voir le profil complet

Soyez le premier à commenter

Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.

0/450