Servizi
Contattaci

Benchmark di Marketing Agentic di AIM

Sıla Ermut
Sıla Ermut
aggiornato il 5 ago. 2026

Presentiamo il Benchmark di Marketing Agentic di AIM, che misura le prestazioni degli agenti su tre flussi di lavoro di marketing: analisi del gap competitivo, preparazione della lista di target ABM e un deck di vendita personalizzato.

Abbiamo anche eseguito un audit separato della reputazione del sito web in cui gli agenti hanno esaminato i contenuti in lingua inglese di AIMultiple e hanno segnalato problemi verificabili di accuratezza fattuale, citazioni, coerenza, aggiornamento, funzionalità, grammatica e formattazione che potrebbero minare la fiducia dei lettori.

Risultati del benchmark di marketing agentic

Loading Chart

I punteggi dei task sono normalizzati su una scala 0–100.

  • Per l'analisi competitiva, il punteggio è uguale a: 100 × MAX(0, gap verificati trovati − gap errati) / 10
  • Per la preparazione della lista di account, il punteggio è la percentuale di 71 punti della griglia di valutazione disponibili ottenuti dal modello.
  • Per il task del deck di vendita, il punteggio è la somma di 5 sezioni da 20 punti ciascuna.
  • Il punteggio complessivo è la media aritmetica dei punteggi dell'analisi competitiva, della lista di account e del deck di vendita. L'audit della reputazione del sito web non contribuisce a questo punteggio complessivo. L'audit viene riportato con i propri assi anziché con un unico punteggio.

A differenza dei tre task normalizzati, l'audit non ha un punteggio massimo fisso. Pertanto, abbiamo incluso i risultati in una valutazione separata e non li abbiamo combinati con il benchmark complessivo.

Leggi la metodologia per maggiori informazioni sulla valutazione dei task.

I task reali utilizzati nel benchmark

Questi flussi di lavoro di marketing agentic coprono strategia e copertura dei contenuti, crescita, ricerca sulle vendite, creazione di contenuti personalizzati e controllo della qualità del sito web. Ciascuno richiede ricerca dal vivo, validazione delle fonti, giudizio basato su regole e un output che possa essere integrato in un flusso di lavoro operativo.

Task 1: Analisi del gap competitivo

Il modello svolge il ruolo di analista strategico presso AIMultiple e lo confronta con una piattaforma concorrente di benchmarking IA. L'esecuzione consente 90 minuti di runtime e accesso web in tempo reale tramite il Bright Data MCP, con esecuzione del codice disabilitata.

L'output è un singolo file contenente fino a 10 righe, ordinate per priorità. Ogni riga indica un'offerta che il concorrente pubblica ma che AIMultiple non ha, spiega la differenza in una o due frasi, cita la pagina del concorrente che il modello ha aperto ed elenca le pagine di AIMultiple che ha esaminato prima di dichiarare l'assenza.

La dichiarazione di assenza è la metà più difficile di ogni scoperta. Identificare una funzionalità sul sito del concorrente richiede una sola pagina. Stabilire che AIMultiple non la fornisce richiede di rivedere le pagine delle categorie, i benchmark, gli articoli e la sitemap.

Nel caso in cui AIMultiple pubblichi un'offerta adiacente, il modello deve indicare quella pagina e specificare cosa fa la versione del concorrente in modo diverso. La copertura dello stesso argomento generale non costituisce un'offerta equivalente.

Come abbiamo valutato il task

Il punteggio viene assegnato confrontando l'esecuzione con una chiave di risposta compilata manualmente: dieci gap verificati su entrambi i siti, insieme alle dichiarazioni di assenza che le pagine live di AIMultiple smentiscono.

Ogni gap verificato aggiunge un punto e ogni dichiarazione di assenza errata ne sottrae uno. Una dichiarazione errata include qualsiasi riga il cui URL sia inventato, non raggiungibile o non supporti l'affermazione allegata.

La chiave contiene dieci gap, ma un modello può trovarne uno reale che non è presente. Un revisore legge quelle scoperte manualmente e assegna il punto se la pagina citata mostra l'offerta, nessuna pagina live di AIMultiple contraddice l'affermazione e l'offerta è effettivamente assente da AIMultiple.

Due regole limitano questi punti extra:

  • Una scoperta che ripete una delle dieci esistenti con parole diverse non guadagna alcun punto extra. Viene invece accreditata sotto il gap elencato.
  • Una scoperta che non supera la revisione costa un punto. Se AIMultiple pubblica l'offerta, o il concorrente non ce l'ha, la riga ottiene zero punti, la stessa penalità di qualsiasi altra dichiarazione errata.

Ciò impedisce che la chiave penalizzi una scoperta che gli analisti non hanno registrato, negando al contempo credito a dichiarazioni speculative.

Come ultima parte della valutazione, il revisore esegue controlli sui link. I controlli sui link seguono i reindirizzamenti e valutano la destinazione finale, quindi un 301 non fa fallire automaticamente una riga. Un nome file errato, colonne mancanti o riordinate, un numero di righe diverso da uno a dieci, una priorità diversa da 1 a 10, un URL di prova su un dominio sbagliato o righe non ordinate rendono ogni esecuzione non valida, e un'esecuzione non valida non riceve alcun punteggio numerico.

Task 2: Preparazione della lista di account più adatti

Il modello agisce come un marketer della crescita che prepara una lista di account per il marketing basato sugli account per AIMultiple.

Il lavoro inizia con una mappa di copertura delle pagine live di AIMultiple. L'agente registra le pagine delle categorie, i benchmark e le pagine di confronto tra fornitori, nonché i fornitori menzionati nei corpi degli articoli e nelle informative sugli sponsor.

Prepara quindi una lista prioritaria di 100 account. Ogni azienda deve essere un fornitore di tecnologia B2B con un fatturato annuo compreso tra $100 milioni e 1 miliardo di dollari, con sede negli Stati Uniti, in Europa o in Israele, e attiva in una categoria coperta da AIMultiple. L'azienda deve inoltre avere un segnale di marketing della crescita attuale e almeno una pagina di AIMultiple in cui rappresenti una reale opportunità commerciale.

Il file degli account registra il dominio dell'azienda, la pagina LinkedIn, la sede, la categoria, il fatturato e la fonte, il numero di dipendenti, l'anno di fondazione, lo stato di finanziamento o di proprietà, le pagine rilevanti di AIMultiple, il segnale di marketing e il punteggio di adattamento.

Le società madri e le filiali non possono apparire entrambe per la stessa opportunità di fornitore. Le regole escludono anche società di servizi, aziende di consumo, società di analisi o recensioni e candidati che non soddisfano i requisiti di fatturato o di sede.

Come abbiamo valutato il task

La griglia di valutazione contiene 71 punti suddivisi in sette sezioni. La sezione della mappa di copertura verifica se il modello ha esaminato almeno 30 pagine live di AIMultiple e ha incluso ogni tipo di pagina richiesto. I revisori campionano le righe per confermare che i fornitori nominati e le informative sugli sponsor corrispondano alle pagine live.

La sezione del file degli account richiede esattamente 100 domini distinti, le colonne specificate, le classificazioni accettate, punteggi di adattamento in ordine decrescente e campi di evidenza completi. Un campione fisso di 20 account viene quindi utilizzato per controlli dettagliati che coprono fatturato, identità LinkedIn, sede effettiva, adattamento alla categoria, prove di marketing della crescita e stato di fornitore B2B.

Altre sezioni verificano se le pagine proposte rappresentano vere opportunità, penalizzano account squalificati o inventati, premiano l'inclusione di aziende ad alta adattabilità verificate e controllano se i modelli evitano i mancati successi noti.

Un file degli account mancante, colonne errate o un numero di righe diverso da 100 rendono l'esecuzione non valida.

Task 3: Deck di vendita personalizzato

Nota: Abbiamo escluso Kimi K3 e Gemini 3.5 Flash perché ciascuno ha richiesto l'accesso a una directory al di fuori della propria cartella di lavoro; l'harness ha rifiutato automaticamente la richiesta ed entrambe le esecuzioni si sono interrotte lì. Nessuno dei due ha prodotto un deck e nessuno dei due ha fallito il task, poiché non è stato giudicato nulla di ciò che hanno prodotto. Uno zero metterebbe un problema infrastrutturale nel record del modello, quindi entrambi sono contrassegnati come non eseguiti ed esclusi dalla media.

Il modello funge da analista pre-vendita presso AIMultiple e costruisce un deck di presentazione per un dirigente senior di product marketing. L'esecuzione include 90 minuti, accesso web in tempo reale tramite il Bright Data MCP, esecuzione del codice e una cartella di asset del marchio contenente i loghi e i caratteri.

La maggior parte della ricerca si concentra sul dirigente piuttosto che sull'azienda. Questo dirigente gestisce il marketing per una singola linea di prodotti e ha dichiarato pubblicamente cosa conta quando si valuta l'hardware: quanti token acquista un dollaro, se una terza parte indipendente ha controllato i numeri e se il test assomigliava a un carico di lavoro reale o a una demo.

Un altro argomento ricorrente è che un rack è un'unità di confronto più equa di un chip. Poiché queste argomentazioni sono pubbliche e possono essere trovate in interviste, discorsi a conferenze e post, il compito è leggerle e poi trovare i benchmark di AIMultiple che rispondono ad esse. Un deck può essere accurato su AIMultiple e tuttavia non centrare affatto la persona, e quella è la versione che ottiene un punteggio basso.

Ecco alcuni output di Fable 5, Gemini 3-1 pro-preview e GPT 5.6 Sol:

Come abbiamo valutato il task

Il deck viene valutato su cinque aspetti, ciascuno del valore di 20 punti: se segue l'identità visiva di AIMultiple, se cita i benchmark giusti, se propone passi successivi utili, se spiega cosa vale AIMultiple per il destinatario e se le diapositive sono chiare. Ciascuno dei cinque si suddivide in piccoli controlli con risposte fisse.

L'identità visiva è l'unica parte che un modello può ottenere correttamente senza fare alcuna ricerca. I file dei loghi, il valore esadecimale del colore d'accento, i colori del testo, il carattere tipografico e l'ortografia del nome dell'azienda sono tutti o corretti o meno. Ad esempio, un deck impostato in Calibri perde i punti.

La seconda parte valuta ciò a cui il deck rimanda oggi. AIMultiple pubblica molti articoli sull'hardware, e alcuni di essi testano il tipo di chip che questa persona vende. Pertanto, i punti vanno a un deck che cita studi sulle GPU per data center piuttosto che alle pagine hardware che sono apparse per prime.

La terza sezione riguarda il lavoro che AIMultiple potrebbe fare successivamente. Un suggerimento conta qui se nomina lo studio e il numero che produrrebbe. Ad esempio, rieseguire un confronto esistente sui chip di quest'anno o aggiungere l'hardware dell'azienda a un benchmark che attualmente lo esclude guadagna un punto. D'altra parte, proporre che le due aziende valutino insieme le prestazioni di inferenza non nomina né uno studio né una misurazione, quindi non guadagna punti.

La quarta parte riguarda ciò che AIMultiple vale per il destinatario. I punti vengono assegnati per tre affermazioni che:

  • AIMultiple è indipendente
  • Il suo pubblico ha una dimensione dichiarata supportata da una fonte nominata
  • Questo pubblico ha uno scopo specifico per l'attività del destinatario, come raggiungere gli acquirenti nella fase di selezione finale

Un deck che elenca ciò che pubblica AIMultiple senza collegarlo ai prodotti del destinatario non guadagna punti.

La quinta parte riguarda la leggibilità del deck. Due controlli contano più degli altri: i titoli devono enunciare un concetto chiave anziché etichettare la diapositiva, e i numeri devono indicare da dove provengono, tenendo separati i dati dell'azienda dalle misurazioni proprie di AIMultiple. Il resto è meccanico, come la valutazione del numero di diapositive, il testo che fuoriesce, le etichette dei grafici, il testo di riempimento.

Quattro delle cinque parti comportano anche penalità. Un benchmark inventato, una cifra inventata, un link non funzionante o la presentazione di un'affermazione di marketing dell'azienda come una misurazione di AIMultiple costa punti. Promettere risultati favorevoli, un posizionamento preferenziale o una revisione prima della pubblicazione costa anch'esso punti, poiché AIMultiple non offre nulla di tutto ciò. Il deck deve persuadere senza fabbricare prove e senza offrire nulla che l'azienda non venda.

Task 4: Audit della reputazione del sito web

Il modello agisce come un revisore della qualità e della reputazione del sito web per AIMultiple. L'esecuzione consente 120 minuti, accesso web in tempo reale tramite il Bright Data MCP e l'esecuzione del codice.

L'agente inizia recuperando la sitemap dei post di AIMultiple ed escludendo gli URL con prefissi di lingua tedesca, spagnola, francese, italiana, portoghese o turca. Deve esaminare almeno 100 URL in lingua inglese rimanenti.

Per ogni pagina, l'agente cerca problemi che potrebbero danneggiare la credibilità di AIMultiple. Questi possono includere informazioni incoerenti tra le pagine, link non funzionanti, affermazioni obsolete, errori fattuali, grammatica o formattazione scadenti, citazioni mancanti, affermazioni fuorvianti, funzionalità non funzionanti e contenuti generici generati dall'IA.

L'output è un file Results.csv contenente non più di 50 righe. Ogni riga deve descrivere un problema distinto e deduplicato e aggregare tutti gli URL in cui tale problema si verifica.

Ogni riga registra:

  • l'ID del problema;
  • la priorità;
  • la gravità;
  • il numero di URL interessati;
  • gli URL interessati;
  • la prova testuale esatta citata;
  • una spiegazione del problema reputazionale;
  • e una correzione consigliata.

Il file deve essere ordinato per priorità dalla più alta alla più bassa.

Come abbiamo valutato il task

La priorità è calcolata come: Priorità = Gravità × Numero di URL interessati

La gravità utilizza quattro livelli:

  • 4: Errori fattuali, funzionalità non funzionanti o altri problemi che possono causare un danno reputazionale significativo.
  • 3: Incoerenze tra le pagine, informazioni obsolete, fonti mancanti, link non funzionanti o contenuti generici da IA.
  • 2: Problemi grammaticali o di formattazione importanti.
  • 1: Problemi grammaticali, di formattazione o di stile minori che non influiscono sulla leggibilità.

Una riga viene conteggiata quando tutti i controlli applicabili vengono superati. Gli script deterministici vengono eseguiti per primi. Controllano la struttura del file e la coerenza interna di ogni riga, e verificano le prove di ogni riga rispetto alla pagina a cui è attribuita.

Un panel di modelli di tre fornitori esamina quindi le righe che gli script hanno mantenuto. Il panel lavora su una copia datata di ogni pagina anziché sul sito live, in modo che un difetto che il sito ha nel frattempo corretto non venga conteggiato a sfavore del modello che l'ha trovato.

Infine, l'intera presentazione viene controllata per risultati duplicati e problemi troppo ampi per essere verificati. Ad esempio, "problemi di citazione" è troppo generico per una riga, mentre "link di citazione non funzionanti" è un problema sufficientemente specifico.

L'audit riporta quante righe del modello hanno superato la verifica, insieme alla percentuale di righe inviate che hanno superato. Un modello che presenta un file non valido o nessuna riga di dati valida viene registrato come se non avesse prodotto nulla. Di seguito, come si è comportato ciascun modello:

Lascia che il nostro team automatizzi uno dei tuoi processi aziendali con agenti IA, gratuitamente.
Automatizza un processo

Metodologia del benchmark di marketing agentic

Abbiamo costruito il benchmark originale a partire da tre flussi di lavoro utilizzati dai nostri team di strategia, crescita e vendite. Abbiamo poi aggiunto un audit della reputazione del sito web che rappresenta la garanzia di qualità dei contenuti e la governance editoriale.

Il task di analisi competitiva supporta le decisioni sulla copertura dei prodotti, le priorità dei contenuti e il posizionamento. Il task della lista di account supporta il marketing basato sugli account e la ricerca sulle vendite. Il deck di vendita supporta l'attività di pre-vendita: selezionare un potenziale cliente, determinare quali benchmark pubblicati sono rilevanti e costruire il documento.

L'audit della reputazione del sito web supporta la manutenzione dei contenuti e la fiducia. Identifica prove non funzionanti, informazioni obsolete, incoerenze tra le pagine, problemi fattuali, malfunzionamenti e difetti editoriali.

Per ogni flusso di lavoro, abbiamo creato un file di task che definisce:

  • il ruolo del modello
  • gli strumenti disponibili
  • i requisiti di prova
  • le regole di qualificazione
  • gli output richiesti
  • il limite di tempo

Abbiamo progettato i task attorno alle nostre pagine e ai flussi di lavoro commerciali, e i nostri dati fanno parte della chiave di risposta. Ciò rende le prove più facili da verificare, sebbene limiti anche l'applicabilità dei risultati ad altre aziende e ambienti di marketing.

Istruzioni per i task e griglie di valutazione

Per l'analisi competitiva, i modelli potevano fare ricerche sul web in tempo reale tramite il Bright Data MCP. Abbiamo disabilitato l'esecuzione del codice e impostato un limite di 90 minuti.

Per la preparazione della lista di account, i modelli hanno utilizzato lo stesso accesso web, con l'esecuzione del codice abilitata. Abbiamo consentito fino a 240 minuti perché il task richiedeva due file di output e 100 account qualificati.

Per la preparazione del deck di vendita, abbiamo abilitato lo stesso accesso web con esecuzione del codice. La durata era di 90 minuti, con una cartella di asset del marchio nella directory di lavoro.

Per l'audit della reputazione del sito web, i modelli hanno utilizzato l'accesso web in tempo reale tramite il Bright Data MCP con esecuzione del codice abilitata. Abbiamo consentito fino a 120 minuti poiché il task richiedeva la scansione e l'analisi di almeno 100 pagine. L'output richiesto era un singolo CSV contenente non più di 50 gruppi di problemi deduplicati.

Abbiamo fornito a ciascun modello le istruzioni del task e lo schema di output, mantenendo nascosta la griglia di valutazione.

I modelli dovevano utilizzare fonti aggiornate

Tutti e quattro i flussi di lavoro dipendono da informazioni che possono cambiare. Ciò include offerte del sito, inventari di benchmark, pagine di prodotto, fatturato aziendale, sede legale, proprietà, informative sugli sponsor, attività di marketing, dichiarazioni pubbliche, contenuti degli articoli, citazioni e destinazioni dei link.

Abbiamo conteggiato un URL quando veniva risolto e supportava l'affermazione ad esso collegata. Una homepage aziendale non può supportare una cifra specifica di fatturato e una pagina contenente una frase simile non può supportare un risultato di audit a meno che la citazione inviata e il difetto descritto non siano presenti.

Le chiavi di risposta per i task di analisi competitiva e lista di account sono state verificate l'ultima volta il 7 luglio 2026. La griglia di valutazione del deck di vendita è stata verificata il 25 luglio 2026, e i deck sono stati valutati il giorno successivo.

L'audit della reputazione del sito web non ha utilizzato un elenco fisso di problemi previsti. Ogni risultato inviato è stato verificato rispetto alle pagine live di AIMultiple al momento della valutazione. Ciò è necessario perché il sito web viene costantemente aggiornato e un problema che esisteva durante un'esecuzione potrebbe essere risolto in seguito.

Gli output sono stati progettati per un uso operativo

I task di analisi competitiva, lista di account e reputazione del sito web richiedono file CSV con colonne fisse e celle atomiche. Ciò ci consente di verificare automaticamente campi mancanti, duplicati, domini non supportati, conteggi di righe errati, valori malformati, errori aritmetici e problemi di ordinamento.

Il task del deck di vendita richiede un file PowerPoint 16:9 che si apra senza un prompt di riparazione.

Le analisi competitive e le liste di account possono essere trasferite in fogli di calcolo, flussi di lavoro CRM e strumenti di automazione. L'output dell'audit di reputazione può essere trasferito in un tracker di problemi editoriali o ingegneristici. Il deck può essere inviato a un potenziale cliente dopo la revisione.

Un file strutturalmente non valido blocca il successivo passo operativo anche quando parte della ricerca al suo interno è utile. Per questo motivo, la consegna del file e la conformità allo schema fanno parte del benchmark piuttosto che essere requisiti amministrativi esterni.

Riportiamo punteggi di singole esecuzioni senza varianza

I risultati includono un punteggio riportato per modello. Al momento non riportiamo esecuzioni ripetute, semi, intervalli di confidenza o barre di errore.

I lettori dovrebbero quindi trattare con cautela le piccole differenze di punteggio. Nell'analisi competitiva, un gap netto corretto in più modifica il punteggio di dieci punti. Nella preparazione della lista di account, poche righe campionate possono determinare se un intero criterio basato su soglia viene superato.

Abbiamo combinato controlli deterministici con un giudice LLM

Gli script deterministici hanno gestito tutto ciò che il software può risolvere direttamente: esistenza del file, parsing CSV, ordine delle colonne, numero di righe, valori accettati, domini URL, duplicati, ordinamento e, per il deck, integrità dell'archivio, dimensioni delle diapositive e dichiarazioni dei caratteri. Gli script hanno anche recuperato ogni URL citato, seguito i reindirizzamenti e passato il contenuto della pagina risolta al giudice.

Un giudice LLM ha valutato i criteri semantici una riga, un gap o un criterio alla volta in base a regole di superamento o fallimento, e non ha mai assegnato una valutazione di qualità generale. I nostri analisti hanno costruito le chiavi di risposta, e il giudice le ha applicate.

L'analisi competitiva aggiunge un passaggio umano. Un modello può segnalare un gap reale che la chiave non elenca, quindi quei risultati vanno a un analista, che li accredita dopo aver verificato entrambi i siti.

Cita questa ricerca

Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.

Sıla Ermut and Berk Kalelioğlu (2026) - "Benchmark di Marketing Agentic di AIM". Pubblicato online su AIMultiple.com. Consultato il 5 Agosto 2026, da: https://aimultiple.com/agentic-marketing [Risorsa online]

Ermut, S., & Kalelioğlu, B. (2026, 5 Agosto). Benchmark di Marketing Agentic di AIM. AIMultiple. https://aimultiple.com/agentic-marketing

@misc{ermut2026,
  author = {Ermut, Sıla and Kalelioğlu, Berk},
  title  = {{Benchmark di Marketing Agentic di AIM}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-marketing}},
  note   = {AIMultiple. Consultato il 5 Agosto 2026}
}
Sıla Ermut
Sıla Ermut
Analista di Settore
Sıla Ermut è un'analista di settore presso AIMultiple e si occupa di modelli di IA, infrastrutture di IA, governance dell'IA e applicazioni aziendali dell'IA. La sua ricerca si concentra principalmente sull'uso dell'IA nel marketing, nella sanità, nelle catene di approvvigionamento e nella sostenibilità. In precedenza ha lavorato come recruiter in società di project management e consulenza. Sıla possiede un Master of Science in Psicologia Sociale e un Bachelor of Arts in Relazioni Internazionali.
Visualizza il profilo completo
Ricercato da
Berk Kalelioğlu
Berk Kalelioğlu
Ricercatore di IA
Berk è un Ricercatore di IA presso AIMultiple, concentrandosi su sistemi di IA agentica e modelli linguistici.
Visualizza il profilo completo

Sii il primo a commentare

Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.

0/450