Stiamo introducendo il Benchmark di Marketing Agentico AIM, che misura le prestazioni degli agenti su tre flussi di lavoro di marketing: analisi dei gap competitivi, preparazione di un elenco target ABM e un mazzo di vendita personalizzato.
Abbiamo testato le prestazioni di 11 modelli su tre compiti reali e misurato le prestazioni di esecuzione end-to-end:
Risultati del benchmark di marketing agentico
I punteggi dei compiti sono normalizzati su una scala da 0 a 100.
- Per l'analisi competitiva, il punteggio è pari a: 100 × MAX(0, gap verificati trovati − gap errati) / 10
- Per la preparazione dell'elenco account, il punteggio è la percentuale dei 71 punti della rubrica disponibili ottenuti dal modello.
- Per il compito del deck di vendita, il punteggio è la somma di 5 sezioni da 20 punti ciascuna.
Il punteggio complessivo è la media aritmetica dei tre punteggi dei compiti, assegnando a ciascun compito lo stesso peso nonostante le diverse dimensioni delle rubriche. Le consegne non valide contano come zero nel calcolo complessivo, con due eccezioni: Kimi K3 e Gemini 3.5 Flash non hanno un punteggio complessivo poiché entrambi non hanno eseguito il compito del deck di vendita.
Leggi la metodologia per maggiori informazioni sulla valutazione dei compiti.
Nessun modello è stato affidabile in tutti e tre i flussi di lavoro
Fable 5 con 84,4% e Sol con 74% sono gli unici modelli che si sono classificati tra i primi tre in ogni compito. Al di sotto di essi, l'ordine si avvicina a un rimescolamento. GLM 5.2 ha ottenuto 80% e 76,1% nei primi due compiti e poi non ha scritto alcun deck. Sonnet 5 ha fallito completamente l'analisi competitiva e ha prodotto il terzo miglior deck. MiniMax M3 è arrivato ultimo tra i nove modelli con un punteggio su tre compiti, pur detenendo il quarto miglior punteggio del deck.
Una classifica da un flusso di lavoro di marketing non si trasferisce a quello successivo. Quindi testa un modello sul flusso di lavoro che intendi automatizzare prima di sceglierlo.
Ogni zero è derivato dalla consegna, non dalla ricerca
Cinque esecuzioni hanno totalizzato zero, e nessuna di esse è stata giudicata male per il contenuto. Sonnet 5 ha inviato undici righe contro un limite di dieci righe. Kimi K3 e MiniMax M3 non hanno mai prodotto un file di account valido. GLM 5.2 e Opus 4.8 hanno terminato l'esecuzione del deck senza scrivere un file.
In ogni caso, la ricerca non è mai stata letta. Se stai implementando un agente, questo può essere il vincolo che conta più della qualità della ricerca: un agente che non riesce a produrre un file ben formato in tempo non ottiene alcun punteggio.
I deck di vendita hanno venduto bene ma non hanno dimostrato nulla
Tra i sette deck prodotti dai modelli, hanno guadagnato 83% dei punti disponibili per spiegare cosa vale AIMultiple per il destinatario, 36% per citare i benchmark pertinenti a quel destinatario e 20% per proporre cosa ricercare successivamente.
Scrivere un pitch persuasivo si è rivelato la metà facile. Ancorarlo a lavori pubblicati, che è ciò che vende un'azienda di ricerca, è dove i deck hanno fallito.
I compiti reali utilizzati nel benchmark
Questi compiti di marketing agentico includono strategia e copertura dei contenuti, crescita e ricerca per le vendite. Ciascuno richiede ricerca sul web, validazione delle fonti, qualificazione basata su regole e output strutturato.
Compito 1: Analisi dei gap competitivi
Il modello lavora come analista strategico presso AIMultiple e lo confronta con una piattaforma concorrente di benchmarking IA. L'esecuzione consente 90 minuti e l'accesso al web live tramite Bright Data MCP, con l'esecuzione del codice disabilitata.
L'output è un singolo file e contiene fino a dieci righe ordinate per priorità. Ogni riga nomina un'offerta pubblicata dalla concorrenza e che AIMultiple non ha, spiega la differenza in una o due frasi, cita una pagina della concorrenza aperta dal modello ed elenca le pagine di AIMultiple esaminate prima di dichiarare l'assenza.
La dichiarazione di assenza è la metà più difficile di ogni risultato. Identificare una funzionalità sul sito del concorrente richiede una sola pagina. Stabilire che AIMultiple non la fornisce richiede l'esame delle pagine delle categorie, dei benchmark, degli articoli e della mappa del sito.
Laddove AIMultiple pubblica un'offerta adiacente, il modello deve nominare quella pagina e specificare cosa fa di diverso la versione del concorrente. La copertura dello stesso argomento generale non costituisce un'offerta equivalente.
Come abbiamo valutato il compito
Il punteggio delle esecuzioni viene confrontato con una chiave di risposta compilata a mano: dieci gap verificati su entrambi i siti, insieme alle dichiarazioni di assenza che le pagine live di AIMultiple smentiscono.
Ogni gap verificato aggiunge un punto e ogni dichiarazione di assenza errata ne sottrae uno. Una dichiarazione errata include qualsiasi riga il cui URL è inventato, irraggiungibile o non supporta la dichiarazione allegata.
La chiave contiene dieci gap, ma un modello può trovarne uno reale che non è presente. Un revisore legge quei risultati a mano e assegna il punto se la pagina citata mostra l'offerta, nessuna pagina live di AIMultiple contraddice la dichiarazione e l'offerta è effettivamente assente da AIMultiple.
Due regole limitano questi punti extra:
- Un risultato che ripete uno dei dieci esistenti con parole diverse non guadagna punti extra. Viene invece accreditato sotto il gap elencato.
- Un risultato che non supera la revisione costa un punto. Se AIMultiple pubblica già l'offerta, o il concorrente non ce l'ha, la riga totalizza zero, la stessa penalità di qualsiasi altra dichiarazione errata.
Ciò impedisce alla chiave di penalizzare un risultato che gli analisti non hanno registrato, pur negando il credito alle dichiarazioni speculative.
Come ultima parte della valutazione, il revisore esegue i controlli dei link. I controlli dei link seguono i reindirizzamenti e valutano la destinazione finale, quindi un 301 non fa fallire una riga da solo. Un nome file errato, colonne mancanti o riordinate, un numero di righe diverso da uno a dieci, una priorità al di fuori di 1-10, un URL di prova sul dominio sbagliato o righe non in ordine rendono l'esecuzione non valida, e un'esecuzione non valida non riceve alcun punteggio numerico.
Compito 2: Preparazione dell'elenco di account più adatti
Il modello agisce come un marketer della crescita che prepara un elenco di marketing basato sugli account per AIMultiple.
Il lavoro inizia con una mappa di copertura delle pagine live di AIMultiple. L'agente registra le pagine delle categorie, i benchmark, le pagine di confronto tra fornitori, nonché i fornitori menzionati nei corpi degli articoli e nelle informative sugli sponsor.
Prepara quindi un elenco prioritario di 100 account. Ogni azienda deve essere un fornitore di tecnologia B2B con ricavi annuali compresi tra $100 milioni e $1 miliardo, con sede negli Stati Uniti, in Europa o in Israele, e attiva in una categoria coperta da AIMultiple. L'azienda necessita inoltre di un segnale di marketing orientato alla crescita attuale e di almeno una pagina di AIMultiple in cui rappresenti una genuina opportunità commerciale.
Il file degli account registra il dominio dell'azienda, la pagina LinkedIn, la sede centrale, la categoria, i ricavi e la fonte, il numero di dipendenti, l'anno di fondazione, lo stato di finanziamento o proprietà, le pagine AIMultiple pertinenti, il segnale di marketing e il punteggio di idoneità.
Le società madri e le filiali non possono entrambe apparire per la stessa opportunità di fornitore. Le regole escludono inoltre le società di servizi, le imprese rivolte ai consumatori, le società di analisi o recensioni e i candidati che non soddisfano i requisiti di ricavi o sede centrale.
Come abbiamo valutato il compito
La rubrica contiene 71 punti suddivisi in sette sezioni. La sezione della mappa di copertura verifica se il modello ha esaminato almeno 30 pagine live di AIMultiple e ha incluso ogni tipo di pagina richiesta. I revisori campionano le righe per confermare che i fornitori nominati e le informative sugli sponsor corrispondano alle pagine live.
La sezione del file degli account richiede esattamente 100 domini distinti, le colonne specificate, classificazioni accettate, punteggi di idoneità decrescenti e campi di prova completi. Un campione fisso di 20 account viene quindi utilizzato per controlli dettagliati riguardanti ricavi, identità LinkedIn, sede centrale effettiva, idoneità di categoria, prove di marketing della crescita e stato di fornitore B2B.
Altre sezioni verificano se le pagine proposte siano aperture genuine, penalizzano gli account squalificati o inventati, premiano l'inclusione di aziende verificate ad alta idoneità e controllano se i modelli evitino i noti casi di quasi-qualificazione.
Un file di account mancante, colonne errate o qualsiasi conteggio di righe diverso da 100 rende l'esecuzione non valida.
Compito 3: Deck di vendita personalizzato
Nota: Abbiamo escluso Kimi K3 e Gemini 3.5 Flash perché ciascuno ha richiesto l'accesso a una directory al di fuori della propria cartella di lavoro; l'harness ha rifiutato automaticamente la richiesta ed entrambe le esecuzioni si sono concluse lì. Nessuno dei due ha prodotto un deck e nessuno dei due ha fallito il compito, poiché nulla di ciò che hanno prodotto è stato giudicato. Uno zero avrebbe attribuito un problema di infrastruttura al record del modello, quindi entrambi sono contrassegnati come non eseguiti ed esclusi dalla media.
Il modello lavora come analista pre-vendita presso AIMultiple e costruisce un deck di presentazione rivolto a un dirigente senior del marketing di prodotto. L'esecuzione consente 90 minuti, l'accesso al web live tramite Bright Data MCP, l'esecuzione del codice e una cartella di risorse del marchio contenente i loghi e i font.
La maggior parte della ricerca si concentra sul dirigente piuttosto che sull'azienda. Questo dirigente gestisce il marketing per una singola linea di prodotti e ha dichiarato pubblicamente cosa conta quando si giudica l'hardware: quanti token si ottengono per un dollaro, se qualcuno di indipendente ha verificato i numeri e se il test somigliasse a un carico di lavoro reale o a una demo.
Un altro argomento ricorrente è che un rack è un'unità di confronto più equa di un chip. Poiché queste argomentazioni sono pubbliche e possono essere trovate in interviste, discorsi a conferenze e post, il compito è leggerle e poi trovare i benchmark di AIMultiple che rispondono ad esse. Un deck può essere accurato riguardo a AIMultiple e tuttavia mancare completamente la persona, ed è questa la versione che ottiene un punteggio basso.
Ecco alcuni output di Fable 5, Gemini 3-1 pro-preview e GPT 5.6 Sol:
Come abbiamo valutato il compito
Il deck viene valutato su cinque aspetti, del valore di 20 punti ciascuno: se segue l'identità visiva di AIMultiple, se cita i benchmark giusti, se propone studi successivi utili, se spiega cosa vale AIMultiple per il destinatario e se le diapositive sono chiare. Ciascuno dei cinque si suddivide in piccoli controlli con risposte fisse.
L'identità visiva è l'unica parte che un modello può fare correttamente senza fare alcuna ricerca. I file dei loghi, il valore esadecimale del colore di accento, i colori del testo, il carattere tipografico e l'ortografia del nome dell'azienda sono tutti o corretti o meno. Ad esempio, un deck impostato in Calibri perde i punti.
La seconda parte valuta ciò a cui il deck punta oggi. AIMultiple pubblica molti articoli sull'hardware e solo alcuni di essi testano il tipo di chip che questa persona vende. Pertanto, i punti vanno a un deck che cita studi sulle GPU per data center piuttosto che le prime pagine hardware apparse.
La terza sezione riguarda il lavoro che AIMultiple potrebbe fare in futuro. Un suggerimento qui conta se nomina lo studio e il numero che produrrebbe. Ad esempio, rieseguire un confronto esistente sui chip di quest'anno o aggiungere l'hardware dell'azienda a un benchmark che attualmente lo esclude guadagna un punto. D'altra parte, proporre che le due aziende esaminino insieme le prestazioni di inferenza non nomina né uno studio né una misurazione, quindi non guadagna punti.
La quarta parte riguarda ciò che AIMultiple vale per il destinatario. I punti vengono assegnati per tre affermazioni che:
- AIMultiple è indipendente
- Il suo pubblico è di una dimensione dichiarata e supportata da una fonte nominata
- Questo pubblico serve a uno scopo specifico per il business del destinatario, come raggiungere gli acquirenti nella fase di selezione
Un deck che elenca ciò che AIMultiple pubblica senza collegare nulla ai prodotti del destinatario non guadagna punti.
La quinta parte riguarda se il deck può essere letto. Due controlli contano più degli altri: i titoli devono esprimere un concetto chiave piuttosto che etichettare la diapositiva, e i numeri devono indicare da dove provengono, tenendo separate le cifre dell'azienda dalle misurazioni di AIMultiple. Il resto è meccanico, come valutare il numero di diapositive, il testo in eccesso, le etichette dei grafici, il riempitivo.
Quattro delle cinque parti comportano anche penalità. Un benchmark inventato, una cifra inventata, un link morto o la presentazione di una dichiarazione di marketing dell'azienda come una misurazione di AIMultiple costa punti. Promettere risultati favorevoli, un posizionamento preferenziale o una revisione prima della pubblicazione costa punti anche, poiché AIMultiple non offre nulla di tutto ciò. Il deck deve persuadere senza fabbricare prove e senza offrire nulla che l'azienda non venda.
Metodologia del benchmark di marketing agentico
Abbiamo costruito il benchmark a partire da tre flussi di lavoro eseguiti dai nostri team di strategia, crescita e vendite.
Il compito di analisi competitiva supporta le decisioni sulla copertura dei prodotti, le priorità dei contenuti e il posizionamento. Il compito dell'elenco account supporta il marketing basato sugli account e la ricerca per le vendite. Il deck di vendita supporta l'attività di pre-vendita: scegliere un potenziale cliente, capire quali benchmark pubblicati sono rilevanti e costruire il documento.
Per ogni flusso di lavoro, abbiamo creato un file di attività che definisce:
- il ruolo del modello
- gli strumenti disponibili
- i requisiti di prova
- le regole di qualificazione
- gli output richiesti
- il limite di tempo
Abbiamo progettato i compiti attorno alle nostre pagine e ai flussi di lavoro commerciali, e i nostri dati fanno parte della chiave di risposta. Ciò rende più facile verificare le prove, sebbene limiti anche l'applicabilità dei risultati ad altre aziende e ambienti di marketing.
Istruzioni per i compiti e rubriche di valutazione
Per l'analisi competitiva, i modelli potevano ricercare il web live tramite Bright Data MCP. Abbiamo disabilitato l'esecuzione del codice e impostato un limite di 90 minuti.
Per la preparazione dell'elenco account, i modelli hanno utilizzato lo stesso accesso web, con l'esecuzione del codice abilitata. Abbiamo consentito fino a 240 minuti perché il compito richiedeva due file di output e 100 account qualificati.
Per la preparazione del deck di vendita, abbiamo abilitato lo stesso accesso web con l'esecuzione del codice. La durata era di 90 minuti, con una cartella di risorse del marchio nella directory di lavoro.
Abbiamo fornito a ciascun modello le istruzioni del compito e lo schema di output, mantenendo nascosta la rubrica di valutazione.
I modelli dovevano utilizzare fonti attuali
Tutti e tre i compiti dipendono da informazioni che cambiano: offerte del sito, inventari dei benchmark, pagine dei prodotti, ricavi delle aziende, sede centrale, proprietà, informative sugli sponsor, attività di marketing e le dichiarazioni pubbliche di un individuo nominato.
Abbiamo conteggiato un URL quando si risolveva e supportava la dichiarazione ad esso collegata. Una homepage aziendale non può supportare una cifra specifica sui ricavi e un database di marketing non può dimostrare che una piattaforma offra un particolare formato di benchmark.
Le chiavi di risposta per i primi due compiti sono state verificate l'ultima volta il 7 luglio 2026. La rubrica del deck di vendita è stata verificata il 25 luglio 2026 e i deck sono stati valutati il giorno successivo.
Gli output sono stati progettati per un uso operativo
I primi due compiti richiedono file CSV con colonne fisse e celle atomiche, il che ci consente di verificare automaticamente campi mancanti, duplicati, domini non supportati, conteggi errati delle righe, valori malformati ed errori di ordinamento. Il terzo richiede un file PowerPoint che si apra senza una richiesta di riparazione in 16:9.
Gli elenchi account e le analisi competitive confluiscono in fogli di calcolo, flussi di lavoro CRM e strumenti di automazione, e un deck va a un cliente. Un file strutturalmente non valido blocca il passaggio successivo anche quando la ricerca al suo interno è intatta. Ecco perché due modelli hanno totalizzato zero nel compito del deck senza che nessuno leggesse le loro argomentazioni.
Riportiamo punteggi di singole esecuzioni senza varianza
I risultati includono un punteggio riportato per modello. Al momento non riportiamo esecuzioni ripetute, semi, intervalli di confidenza o barre d'errore.
I lettori dovrebbero quindi considerare con cautela le piccole differenze di punteggio. Nell'analisi competitiva, un ulteriore gap netto corretto modifica il punteggio di dieci punti. Nella preparazione dell'elenco account, poche righe campionate possono determinare il superamento di un intero criterio basato su soglia.
Abbiamo combinato controlli deterministici con un giudice LLM
Gli script deterministici hanno gestito tutto ciò che il software può risolvere direttamente: esistenza dei file, parsing CSV, ordine delle colonne, conteggio delle righe, valori accettati, domini URL, duplicati, ordinamento e, per il deck, integrità dell'archivio, dimensioni delle diapositive e dichiarazioni dei font. Gli script hanno anche recuperato ogni URL citato, seguito i reindirizzamenti e passato il contenuto della pagina risolta al giudice.
Un giudice LLM ha valutato i criteri semantici una riga, un gap o un criterio alla volta rispetto a regole di superamento/fallimento e non ha mai assegnato una valutazione generale di qualità. I nostri analisti hanno costruito le chiavi di risposta e il giudice le ha applicate.
L'analisi competitiva aggiunge un passaggio umano. Un modello può segnalare un gap reale che la chiave non elenca, quindi quei risultati vanno a un analista, che li accredita solo dopo aver verificato entrambi i siti.
FAQ
Il marketing agentico prevede l'utilizzo di agenti basati sull'IA per pianificare e completare compiti di marketing a più fasi con un input umano minimo. Questi agenti utilizzano dati dei clienti, regole aziendali, contesto in tempo reale e istruzioni in linguaggio naturale per prendere decisioni durante i flussi di lavoro di marketing.
L'automazione del marketing tradizionale esegue regole predefinite, come l'invio di un'email dopo l'invio di un modulo o lo spostamento di un lead tra segmenti di pubblico. I sistemi agentici possono interpretare un obiettivo aziendale, selezionare gli strumenti necessari, completare l'impostazione della campagna, monitorare le prestazioni della campagna e regolare le azioni per ottimizzare le prestazioni.
Una piattaforma di marketing agentico può supportare compiti quali:
– analizzare il comportamento dei clienti e identificare i segmenti di pubblico;
– adattare i percorsi dei clienti in base a nuovi segnali;
– allocare la spesa pubblicitaria tra le campagne di marketing;
– generare contenuti nel rispetto delle linee guida del marchio;
– coordinare i flussi di lavoro creativi e preservare la direzione creativa;
– produrre approfondimenti generati dall'IA per l'ottimizzazione del percorso;
– spostare i dati tra strumenti disconnessi in un cloud di marketing;
– assegnare compiti specifici a più agenti.
I tre compiti testano capacità diverse.
L'analisi competitiva premia la ricerca comparativa, il giudizio semantico e l'attenta verifica dell'assenza.
La preparazione dell'elenco account premia la ricerca web sostenuta, la qualificazione ripetuta, la risoluzione delle entità e il controllo esatto dell'output.
Il deck di vendita premia la lettura delle posizioni pubbliche di una persona e il collegamento al lavoro pubblicato, all'interno di un formato di file che deve sopravvivere a PowerPoint.
Un modello può gestire un breve confronto e non riuscire a completare un file strutturato di grandi dimensioni. GLM 5.2 ha ottenuto 80 e 76,1 nei primi due compiti e poi non ha prodotto alcun deck. Sonnet 5 ha fatto il contrario: il suo file di analisi competitiva ha infranto una regola di formattazione e ha totalizzato zero, e il suo deck si è classificato terzo.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark di Marketing Agentico AIM}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Consultato il 5 Agosto 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.