Nous présentons le Benchmark Agentic Marketing AIM, qui mesure les performances des agents sur trois workflows marketing : analyse des lacunes concurrentielles, préparation de listes de cibles ABM et un deck de vente personnalisé.
Nous avons également mené un audit séparé de la réputation du site web dans lequel les agents ont examiné le contenu en anglais de AIMultiple et signalé des problèmes vérifiables de précision factuelle, de citations, de cohérence, d'actualité, de fonctionnalité, de grammaire et de formatage qui pourraient miner la confiance des lecteurs.
Résultats du benchmark marketing agentic
Les scores des tâches sont normalisés sur une échelle de 0 à 100.
- Pour l'analyse concurrentielle, le score est égal à : 100 × MAX(0, lacunes vérifiées trouvées − lacunes incorrectes) / 10
- Pour la préparation de liste de comptes, le score est le pourcentage des 71 points de la grille d'évaluation disponibles obtenus par le modèle.
- Pour la tâche de deck de vente, le score est la somme de 5 sections de 20 points.
- Le score global est la moyenne arithmétique des scores de l'analyse concurrentielle, de la liste de comptes et du deck de vente. L'audit de réputation du site web ne contribue pas à ce score global. L'audit est rapporté selon ses propres axes au lieu d'un score unique.
Contrairement aux trois tâches normalisées, l'audit n'a pas de score maximum fixe. Nous avons donc inclus les résultats dans une évaluation séparée et ne les avons pas combinés avec le benchmark global.
Lisez la méthodologie pour plus d'informations sur l'évaluation des tâches.
Les tâches réelles utilisées dans le benchmark
Ces workflows marketing agentic couvrent la couverture stratégique et de contenu, la croissance, la recherche commerciale, la création de contenu personnalisé et l'assurance qualité du site web. Chacun nécessite une recherche en direct, une validation des sources, un jugement basé sur des règles et une sortie qui peut être intégrée dans un flux de travail opérationnel.
Tâche 1 : Analyse des lacunes concurrentielles
Le modèle travaille comme analyste stratégique chez AIMultiple et le compare à une plateforme de benchmarking IA concurrente. L'exécution autorise 90 minutes de temps d'exécution et un accès web en direct via le Bright Data MCP, avec l'exécution de code désactivée.
Le résultat est un fichier unique contenant jusqu'à 10 lignes, classées par priorité. Chaque ligne nomme une offre que le concurrent publie mais que AIMultiple ne propose pas, explique la différence en une ou deux phrases, cite la page du concurrent que le modèle a ouverte et liste les pages AIMultiple qu'il a examinées avant d'affirmer l'absence.
L'affirmation d'absence est la moitié la plus difficile de chaque constatation. Identifier une fonctionnalité sur le site du concurrent nécessite une seule page. Établir que AIMultiple ne la fournit pas nécessite d'examiner les pages de catégorie, les benchmarks, les articles et le plan du site.
Lorsque AIMultiple publie une offre adjacente, le modèle doit nommer cette page et préciser en quoi la version du concurrent fait différemment. La couverture du même vaste sujet ne constitue pas une offre équivalente.
Comment nous avons noté la tâche
La notation s'effectue par rapport à une clé de réponse compilée manuellement : dix lacunes vérifiées sur les deux sites, accompagnées des affirmations d'absence que les pages AIMultiple en direct réfutent.
Chaque lacune vérifiée ajoute un point, et chaque affirmation d'absence incorrecte en retire un. Une affirmation incorrecte inclut toute ligne dont l'URL est fabriquée, inaccessible ou ne soutient pas l'affirmation qui y est attachée.
La clé contient dix lacunes, mais un modèle peut en trouver une réelle qui n'y figure pas. Un évaluateur lit ces constatations manuellement et accorde le point si la page citée montre l'offre, si aucune page AIMultiple en direct ne contredit l'affirmation et si l'offre est véritablement absente de AIMultiple.
Deux règles limitent ces points supplémentaires :
- Une constatation qui répète l'une des dix lacunes existantes avec des mots différents ne rapporte rien de plus. Elle est créditée sous la lacune listée à la place.
- Une constatation qui échoue à l'examen coûte un point. Si AIMultiple publie l'offre, ou si le concurrent ne l'a pas, la ligne obtient zéro, la même pénalité que toute autre affirmation erronée.
Cela empêche la clé de pénaliser une constatation que les analystes n'ont pas enregistrée, tout en refusant le crédit aux affirmations spéculatives.
Dans la dernière partie de l'évaluation, l'évaluateur effectue des vérifications de liens. Les vérifications de liens suivent les redirections et évaluent la destination finale, donc un 301 ne fait pas échouer une ligne à lui seul. Un nom de fichier incorrect, des colonnes manquantes ou réorganisées, un nombre de lignes en dehors de un à dix, une priorité en dehors de 1 à 10, une URL de preuve sur le mauvais domaine, ou des lignes dans le désordre rendent l'exécution invalide, et une exécution invalide ne reçoit aucun score numérique.
Tâche 2 : Préparation de liste de comptes les mieux adaptés
Le modèle agit comme un marketeur de croissance préparant une liste de marketing basé sur les comptes pour AIMultiple.
Le travail commence par une carte de couverture des pages en direct de AIMultiple. L'agent enregistre les pages de catégorie, les benchmarks et les pages de comparaison de fournisseurs, ainsi que les fournisseurs mentionnés dans les corps d'articles et dans les divulgations de sponsors.
Il prépare ensuite une liste priorisée de 100 comptes. Chaque entreprise doit être un fournisseur de technologie B2B avec un chiffre d'affaires annuel entre $100 millions et $1 milliard, ayant son siège aux États-Unis, en Europe ou en Israël, et active dans une catégorie couverte par AIMultiple. L'entreprise a également besoin d'un signal de marketing de croissance actuel et d'au moins une page AIMultiple où elle représente une véritable opportunité commerciale.
Le fichier de comptes enregistre le domaine de l'entreprise, sa page LinkedIn, son siège social, sa catégorie, son chiffre d'affaires et sa source, le nombre d'employés, l'année de fondation, le statut de financement ou de propriété, les pages AIMultiple pertinentes, le signal marketing et le score d'adéquation.
Les maisons mères et les filiales ne peuvent pas apparaître toutes les deux pour la même opportunité de fournisseur. Les règles excluent également les sociétés de services, les entreprises grand public, les sociétés d'analystes ou d'évaluation, et les candidats qui ne répondent pas aux exigences de chiffre d'affaires ou de siège social.
Comment nous avons noté la tâche
La grille d'évaluation contient 71 points répartis sur sept sections. La section de la carte de couverture vérifie si le modèle a examiné au moins 30 pages AIMultiple en direct et a inclus chaque type de page requis. Les évaluateurs échantillonnent les lignes pour confirmer que les fournisseurs nommés et les divulgations de sponsors correspondent aux pages en direct.
La section du fichier de comptes exige exactement 100 domaines distincts, les colonnes spécifiées, les classifications acceptées, des scores d'adéquation décroissants et des champs de preuve complets. Un échantillon fixe de 20 comptes est ensuite utilisé pour des vérifications détaillées couvrant le chiffre d'affaires, l'identité LinkedIn, le véritable siège social, l'adéquation de la catégorie, les preuves de marketing de croissance et le statut de fournisseur B2B.
D'autres sections testent si les pages proposées sont de véritables opportunités, pénalisent les comptes disqualifiés ou fabriqués, récompensent l'inclusion d'entreprises vérifiées à forte adéquation et vérifient si les modèles évitent les quasi-accidents connus.
Un fichier de comptes manquant, des colonnes incorrectes ou tout nombre de lignes autre que 100 rend l'exécution invalide.
Tâche 3 : Deck de vente personnalisé
Remarque : Nous avons exclu Kimi K3 et Gemini 3.5 Flash car chacun a demandé l'accès à un répertoire en dehors de son dossier de travail ; le harnais a automatiquement refusé la demande, et les deux exécutions se sont arrêtées là. Aucun n'a produit de deck, et aucun n'a échoué à la tâche, car rien de ce qu'ils ont produit n'a été jugé. Un zéro mettrait un problème d'infrastructure sur le dossier du modèle, donc les deux sont marqués comme non exécutés et exclus de la moyenne.
Le modèle sert d'analyste pré-vente chez AIMultiple et construit un deck de présentation pour un cadre dirigeant du marketing produit. L'exécution comprend 90 minutes, un accès web en direct via le Bright Data MCP, l'exécution de code et un dossier d'actifs de marque contenant les logos et les polices.
La majeure partie de la recherche porte sur le cadre dirigeant plutôt que sur l'entreprise. Ce cadre dirigeant gère le marketing pour une seule ligne de produits et a déclaré publiquement ce qui compte lorsqu'on juge le matériel : combien de tokens un dollar achète, si un tiers indépendant a vérifié les chiffres et si le test ressemblait à une charge de travail réelle ou à une démo.
Un autre argument récurrent est qu'un rack est une unité de comparaison plus juste qu'une puce. Comme ces arguments sont publics et peuvent être trouvés dans des interviews, des conférences et des publications, la tâche consiste à les lire puis à trouver les benchmarks AIMultiple qui y répondent. Un deck peut être précis sur AIMultiple et passer complètement à côté de la personne, et c'est cette version qui obtient un mauvais score.
Voici quelques résultats de Fable 5, Gemini 3-1 pro-preview et GPT 5.6 Sol :
Comment nous avons noté la tâche
Le deck est noté sur cinq aspects, chacun valant 20 points : s'il suit l'identité visuelle de AIMultiple, s'il cite les bons benchmarks, s'il propose des prochaines étapes utiles, s'il explique ce que AIMultiple vaut pour le destinataire et si les diapositives sont claires. Chacun des cinq se décompose en petites vérifications avec des réponses fixes.
L'identité visuelle est la seule partie qu'un modèle peut réussir sans faire aucune recherche. Les fichiers de logo, la valeur hexadécimale de la couleur d'accent, les couleurs du texte, la police de caractères et l'orthographe du nom de l'entreprise sont tous soit corrects, soit non. Par exemple, un deck composé en Calibri perd les points.
La deuxième partie évalue ce vers quoi le deck pointe aujourd'hui. AIMultiple publie de nombreux articles sur le matériel, et certains d'entre eux testent le type de puces que cette personne vend. Par conséquent, les points vont à un deck citant des études de GPU de centre de données plutôt que les pages matérielles qui sont apparues en premier.
La troisième section concerne le travail que AIMultiple pourrait faire ensuite. Une suggestion compte ici si elle nomme l'étude et le chiffre qu'elle produirait. Par exemple, réexécuter une comparaison existante sur les puces de cette année ou ajouter le matériel de l'entreprise à un benchmark qui l'exclut actuellement rapporte un point. En revanche, proposer que les deux entreprises examinent ensemble les performances d'inférence ne nomme ni étude ni mesure, donc ne rapporte aucun point.
La quatrième partie concerne ce que AIMultiple vaut pour le destinataire. Des points sont attribués pour trois déclarations selon lesquelles :
- AIMultiple est indépendant
- Son lectorat est d'une taille déclarée étayée par une source nommée
- Ce lectorat sert un objectif spécifique pour l'activité du destinataire, comme atteindre les acheteurs au stade de la liste restreinte
Un deck qui énumère ce que AIMultiple publie sans relier aucun de ces éléments aux propres produits du destinataire ne gagne pas de points.
La cinquième partie couvre la lisibilité du deck. Deux vérifications comptent plus que les autres : les titres doivent énoncer un point clé plutôt que d'étiqueter la diapositive, et les chiffres doivent indiquer d'où ils proviennent, les chiffres de l'entreprise étant séparés des mesures propres de AIMultiple. Le reste est mécanique, comme l'évaluation du nombre de diapositives, du débordement de texte, des étiquettes de graphique, du remplissage.
Quatre des cinq parties comportent également des pénalités. Un benchmark inventé, un chiffre fabriqué, un lien mort ou la présentation de l'affirmation marketing de l'entreprise comme une mesure AIMultiple coûte des points. Promettre des résultats favorables, un classement préférentiel ou une révision avant publication coûte également des points, car AIMultiple n'offre rien de tout cela. Le deck doit persuader sans fabriquer de preuves et sans offrir quoi que ce soit que l'entreprise ne vend pas.
Tâche 4 : Audit de réputation du site web
Le modèle agit comme un auditeur de la qualité et de la réputation du site web pour AIMultiple. L'exécution autorise 120 minutes, un accès web en direct via le Bright Data MCP et l'exécution de code.
L'agent commence par récupérer le plan du site des articles de AIMultiple et exclut les URL avec des préfixes de langue allemande, espagnole, française, italienne, portugaise ou turque. Il doit examiner au moins 100 URL restantes en anglais.
Pour chaque page, l'agent recherche des problèmes qui pourraient nuire à la crédibilité de AIMultiple. Ceux-ci peuvent inclure des informations incohérentes entre les pages, des liens brisés, des affirmations obsolètes, des erreurs factuelles, une mauvaise grammaire ou un mauvais formatage, des citations manquantes, des affirmations trompeuses, des fonctionnalités cassées et du remplissage générique généré par l'IA.
Le résultat est un fichier Results.csv ne contenant pas plus de 50 lignes. Chaque ligne doit décrire un problème distinct et dédupliqué et regrouper toutes les URL où ce problème se produit.
Chaque ligne enregistre :
- l'ID du problème ;
- la priorité ;
- la gravité ;
- le nombre d'URL impactées ;
- les URL impactées ;
- la citation exacte de la preuve ;
- une explication du problème de réputation ;
- et une correction recommandée.
Le fichier doit être classé par priorité de la plus élevée à la plus basse.
Comment nous avons noté la tâche
La priorité est calculée comme suit : Priorité = Gravité × Nombre d'URL impactées
La gravité utilise quatre niveaux :
- 4 : Erreurs factuelles, fonctionnalités cassées ou autres problèmes pouvant causer un préjudice réputationnel important.
- 3 : Incohérences entre pages, informations obsolètes, sources manquantes, liens brisés ou remplissage de type IA.
- 2 : Problèmes majeurs de grammaire ou de formatage.
- 1 : Problèmes mineurs de grammaire, de formatage ou de style qui n'affectent pas la lisibilité.
Une ligne compte lorsque chaque vérification applicable est réussie. Des scripts déterministes s'exécutent en premier. Ils vérifient la structure du fichier et la cohérence interne de chaque ligne, et ils résolvent chaque preuve de ligne par rapport à la page à laquelle elle est attribuée.
Un panel de modèles de trois fournisseurs examine ensuite les lignes que les scripts ont conservées. Le panel travaille à partir d'une copie datée de chaque page plutôt que du site en direct, de sorte qu'un défaut que le site a corrigé depuis n'est pas compté contre le modèle qui l'a trouvé.
Enfin, la soumission complète est vérifiée pour les constatations en double et les problèmes trop généraux pour être vérifiés. Par exemple, « problèmes de citation » est trop général pour une ligne, tandis que « liens de citation cassés » est un problème suffisamment spécifique.
L'audit indique combien de lignes d'un modèle ont survécu à la vérification, ainsi que la part de ses lignes soumises qui ont survécu. Un modèle qui soumet un fichier invalide ou aucune ligne de données valide est enregistré comme n'ayant rien livré. Voyez ci-dessous comment chaque modèle a performé :
Méthodologie du benchmark marketing agentic
Nous avons construit le benchmark original à partir de trois workflows utilisés par nos équipes de stratégie, de croissance et de ventes. Nous avons ensuite ajouté un audit de réputation du site web proxy l'assurance qualité du contenu et la gouvernance éditoriale.
La tâche d'analyse concurrentielle soutient les décisions concernant la couverture des produits, les priorités de contenu et le positionnement. La tâche de liste de comptes soutient le marketing basé sur les comptes et la recherche commerciale. Le deck de vente soutient la prospection pré-vente : sélectionner un prospect, déterminer quels benchmarks publiés importent et construire le document.
L'audit de réputation du site web soutient la maintenance du contenu et la confiance. Il identifie les preuves brisées, les informations périmées, les incohérences entre pages, les problèmes factuels, les défaillances fonctionnelles et les défauts éditoriaux.
Pour chaque workflow, nous avons créé un fichier de tâche qui définit :
- le rôle du modèle
- les outils disponibles
- les exigences en matière de preuves
- les règles de qualification
- les sorties requises
- la limite de temps
Nous avons conçu les tâches autour de nos propres pages et flux de travail commerciaux, et nos données font partie de la clé de réponse. Cela facilite la vérification des preuves, bien que cela limite également la généralisation des résultats à d'autres entreprises et environnements marketing.
Instructions des tâches et grilles d'évaluation
Pour l'analyse concurrentielle, les modèles pouvaient rechercher sur le web en direct via le Bright Data MCP. Nous avons désactivé l'exécution de code et fixé une limite de 90 minutes.
Pour la préparation de liste de comptes, les modèles utilisaient le même accès web, avec l'exécution de code activée. Nous avons autorisé jusqu'à 240 minutes car la tâche nécessitait deux fichiers de sortie et 100 comptes qualifiés.
Pour la préparation du deck de vente, nous avons activé le même accès web avec l'exécution de code. La durée était de 90 minutes, avec un dossier d'actifs de marque dans le répertoire de travail.
Pour l'audit de réputation du site web, les modèles ont utilisé l'accès web en direct via le Bright Data MCP avec l'exécution de code activée. Nous avons autorisé jusqu'à 120 minutes car la tâche nécessitait de crawler et d'analyser au moins 100 pages. La sortie requise était un seul CSV contenant au maximum 50 groupes de problèmes dédupliqués.
Nous avons donné à chaque modèle les instructions de la tâche et le schéma de sortie, tout en gardant la grille d'évaluation cachée.
Les modèles devaient utiliser des sources actuelles
Les quatre workflows dépendent d'informations qui peuvent changer. Cela inclut les offres du site, les inventaires de benchmarks, les pages produits, le chiffre d'affaires des entreprises, les sièges sociaux, la propriété, les divulgations de sponsors, l'activité marketing, les déclarations publiques, le contenu des articles, les citations et les destinations des liens.
Nous avons compté une URL lorsqu'elle résolvait et soutenait l'affirmation qui y était attachée. Une page d'accueil d'entreprise ne peut pas soutenir un chiffre d'affaires spécifique, et une page contenant une phrase similaire ne peut pas soutenir une constatation d'audit à moins que la citation soumise et le défaut décrit ne soient présents.
Les clés de réponse pour les tâches d'analyse concurrentielle et de liste de comptes ont été vérifiées pour la dernière fois le 7 juillet 2026. La grille du deck de vente a été vérifiée le 25 juillet 2026, et les decks ont été notés le jour suivant.
L'audit de réputation du site web n'a pas utilisé de liste fixe de problèmes attendus. Chaque constatation soumise a été vérifiée par rapport aux pages en direct de AIMultiple au moment de la notation. Cela est nécessaire car le site web est continuellement mis à jour, et un problème qui existait pendant une exécution peut être corrigé ultérieurement.
Les sorties ont été conçues pour une utilisation opérationnelle
Les tâches d'analyse concurrentielle, de liste de comptes et de réputation du site web nécessitent des fichiers CSV avec des colonnes fixes et des cellules atomiques. Cela nous permet de vérifier automatiquement les champs manquants, les doublons, les domaines non pris en charge, le nombre incorrect de lignes, les valeurs malformées, les erreurs arithmétiques et les problèmes de tri.
La tâche de deck de vente nécessite un fichier PowerPoint 16:9 qui s'ouvre sans invite de réparation.
Les analyses concurrentielles et les listes de comptes peuvent être transférées dans des feuilles de calcul, des workflows CRM et des outils d'automatisation. La sortie de l'audit de réputation peut être déplacée vers un outil de suivi des problèmes éditoriaux ou d'ingénierie. Le deck peut être envoyé à un prospect après examen.
Un fichier structurellement invalide bloque l'étape opérationnelle suivante même si une partie de la recherche qu'il contient est utile. Pour cette raison, la livraison du fichier et la conformité au schéma font partie du benchmark plutôt que des exigences administratives extérieures.
Nous rapportons des scores d'une seule exécution sans variance
Les résultats incluent un score rapporté par modèle. Nous ne rapportons actuellement pas d'exécutions répétées, de graines, d'intervalles de confiance ou de barres d'erreur.
Les lecteurs doivent donc traiter les petites différences de score avec prudence. Dans l'analyse concurrentielle, une lacune correcte nette supplémentaire modifie le score de dix points. Dans la préparation de liste de comptes, quelques lignes échantillonnées peuvent déterminer si un critère entier basé sur un seuil est franchi.
Nous avons combiné des vérifications déterministes avec un juge LLM
Les scripts déterministes ont géré tout ce que le logiciel peut régler directement : existence du fichier, analyse CSV, ordre des colonnes, nombre de lignes, valeurs acceptées, domaines des URL, doublons, tri, et pour le deck, intégrité de l'archive, dimensions des diapositives et déclarations de polices. Les scripts ont également récupéré chaque URL citée, suivi les redirections et transmis le contenu de la page résolue au juge.
Un juge LLM a noté les critères sémantiques une ligne, une lacune ou un critère à la fois selon des règles de réussite/échec, et n'a jamais attribué de note de qualité générale. Nos analystes ont construit les clés de réponse, et le juge les a appliquées.
L'analyse concurrentielle ajoute une étape humaine. Un modèle peut signaler une lacune réelle que la clé ne liste pas, donc ces constatations vont à un analyste, qui les crédite après avoir vérifié les deux sites.
Citez ce benchmark
Choisissez le format qui correspond à votre lieu de publication. Coller la version avec lien dans votre CMS préserve le lien retour.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark Agentic Marketing AIM}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Consulté le 5 Août 2026}
}Résultats et horodatages de 11 points de données. Téléchargez les données utilisées dans cet article sous forme de fichier ZIP contenant un fichier CSV.
Elle a précédemment travaillé comme recruteuse dans des cabinets de gestion de projet et de conseil. Sıla est titulaire d’un master en psychologie sociale et d’une licence en relations internationales.
Soyez le premier à commenter
Votre adresse courriel ne sera pas publiée. Tous les champs sont obligatoires. Les commentaires sont laissés dans leur langue d'origine.