Presentiamo il benchmark di marketing agentic AIM che misura le prestazioni degli agenti nell'analisi dei gap competitivi e nella preparazione di liste di target ABM.
Abbiamo testato le prestazioni di 11 modelli e misurato le prestazioni di esecuzione end-to-end:
Risultati del benchmark di marketing agentic
I punteggi dei task sono normalizzati su una scala da 0 a 100.
- Per l'analisi competitiva, il punteggio è pari a: 100 × MAX(0, gap verificati trovati − gap errati) / 10
- Per la preparazione dell'elenco account, il punteggio è la percentuale dei 71 punti di valutazione disponibili ottenuti dal modello.
Il punteggio complessivo è la media aritmetica dei due punteggi dei task, assegnando lo stesso peso a ciascun task nonostante le diverse dimensioni delle rubriche di valutazione. Le consegne non valide o mancanti contano come zero nel calcolo complessivo, sebbene la tabella le distingua separatamente dalle consegne valide che ottengono un punteggio pari a zero.
Leggi la metodologia per maggiori informazioni sulla valutazione dei task.
Fable 5 si è classificato primo in entrambi i task
Fable 5 ha ottenuto il punteggio complessivo più alto, pari a 75.15, con 70 nell'analisi competitiva e 80.3 nella preparazione dell'elenco account. Il suo vantaggio è derivato dal produrre il miglior risultato valido su entrambi i flussi di lavoro e dall'evitare lo zero che segue una consegna non valida o mancante.
I punteggi aggregati non rivelano quale capacità sottostante abbia creato questo vantaggio. La conformità del formato, la selezione delle fonti, la copertura della ricerca e l'applicazione ripetuta delle regole potrebbero tutte contribuire; separarle richiederebbe un confronto a livello di criterio dei file di ciascun modello.
GLM 5.2 si è classificato secondo con 68.05 e si è anche posizionato secondo in entrambi i task. Fable 5 ha guidato di 10 punti nell'analisi competitiva e di 4.2 punti nella preparazione dell'elenco account.
L'analisi competitiva ha restituito punteggi più bassi
Quando la consegna non valida viene inclusa come zero, il punteggio medio dell'analisi competitiva è 40.9. Fable 5 ha guidato con 70, mentre i punteggi validi variavano da 30 a 70.
Questi valori devono essere interpretati insieme alla formula di punteggio. Poiché il task utilizza dieci gap previsti, ogni ulteriore rilevamento netto corretto modifica il punteggio di dieci punti. Un modello che trova sei gap validi e nessun falso ottiene 60; un modello che trova sette gap validi e aggiunge un'affermazione errata riceve lo stesso risultato.
La rubrica descrive anche questo task come un debole discriminatore tra i modelli di frontiera. Il suo valore principale risiede nel separare i sistemi più deboli che non rilevano diversi gap, aggiungono false affermazioni di assenza o non rispettano il formato di output richiesto. Piccole differenze di punteggio vicino alla cima dovrebbero quindi ricevere meno peso rispetto a fallimenti più grandi o consegne non valide.
La preparazione dell'elenco account ha fornito una maggiore risoluzione del punteggio
Il task di preparazione dell'elenco account utilizza una rubrica a 71 punti, che produce risultati più granulari. I punteggi validi variavano da 32.4 a 80.3, e Fable 5 e GLM 5.2 hanno superato 70.
Sol, Terra, Sonnet 5 e Opus 4.8 hanno formato un gruppo intermedio compatto, con punteggi tra 66.2 e 69. Gemini 3.1 Pro ha restituito la consegna valida più bassa a 32.4. Kimi K3 non ha prodotto un risultato valutato, mentre MiniMax M3 non ha soddisfatto una condizione strutturale obbligatoria.
La media è stata di 51.5 dopo che le esecuzioni non valide e mancanti sono state convertite a zero. Poiché il flusso di lavoro richiedeva una mappa di copertura e 100 account qualificati, il punteggio rifletteva le prestazioni su centinaia di affermazioni e classificazioni individuali piuttosto che su un breve elenco di risultati.
Le prestazioni sono variate in base al flusso di lavoro
Kimi K3 ha ottenuto 60 nell'analisi competitiva e non ha restituito un elenco account valido. Sonnet 5 ha mostrato il modello opposto: il suo output di analisi competitiva era non valido, mentre la sua consegna dell'elenco account ha ottenuto 67.6.
Questi casi mostrano perché i risultati a livello di task sono importanti. L'analisi competitiva enfatizza il confronto semantico e la verifica dell'assenza; la preparazione dell'elenco account richiede maggiormente ricerca sostenuta, risoluzione delle entità, gestione delle fonti e costruzione di file.
Per i team di marketing, l'implicazione pratica è chiara: scegli i modelli in base al flusso di lavoro che viene automatizzato, quindi testali rispetto al formato di output e allo standard di evidenza richiesti.
I compiti reali utilizzati nel benchmark
Questi compiti di marketing agentic includono strategia e copertura dei contenuti, crescita e ricerca sulle vendite. Ognuno richiede ricerca web, convalida delle fonti, qualificazione basata su regole e output strutturato.
Task 1: Analisi dei gap competitivi
Il modello agisce come analista strategico confrontando AIMultiple con altre piattaforme di ricerca e benchmarking.
L'agente esamina entrambi i siti web e identifica le offerte che l'altra piattaforma fornisce ma che AIMultiple non ha. Le categorie valide sono arena, benchmark, evaluation_format, content, methodology, dataset e other.
Il task consente fino a dieci gap. Ogni riga del CSV contiene il gap, la sua categoria, una spiegazione, una pagina live che dimostra l'esistenza dell'offerta concorrente, le pagine AIMultiple verificate e un punteggio di priorità.
Quando AIMultiple fornisce un'offerta correlata, il modello deve nominarla e spiegare la differenza residua. Una semplice sovrapposizione di categoria ampia non stabilisce l'equivalenza.
Come abbiamo valutato il task
La chiave di risposta nascosta contiene dieci gap verificati e un insieme di affermazioni di assenza false note. Ogni gap supportato aggiunge uno a A_found, mentre ogni gap errato aggiunge uno a B_wrong. Il punteggio è: MAX(0, A_found − B_wrong) / 10
Un URL fabbricato, non raggiungibile o non supportato rimuove il credito per il relativo gap e aggiunge una penalità di precisione. Questo design rende costosa l'espansione speculativa dell'elenco, poiché aggiungere un'affermazione plausibile può abbassare il punteggio finale.
L'output deve anche superare i controlli strutturali a livello di esecuzione. Il CSV deve avere il nome file e le colonne corretti, tra 1 e 10 righe, valori di categoria accettati, domini validi, celle atomiche e ordine discendente di priorità. Il mancato superamento di qualsiasi controllo rende la consegna non valida.
Task 2: Preparazione dell'elenco account best-fit
Il modello agisce come un growth marketer che prepara un elenco di account-based marketing per AIMultiple.
Il lavoro inizia con una mappa di copertura delle pagine live di AIMultiple. L'agente registra pagine di categorie, benchmark e pagine di confronto tra fornitori, nonché i fornitori menzionati nei corpi degli articoli e nelle informative sugli sponsor.
Quindi prepara un elenco prioritario di 100 account. Ogni azienda deve essere un fornitore di tecnologia B2B con un fatturato annuo compreso tra $100 milioni e $1 miliardo, con sede negli Stati Uniti, in Europa o in Israele e attiva in una categoria coperta da AIMultiple. L'azienda deve anche avere un segnale di growth marketing attuale e almeno una pagina AIMultiple in cui rappresenta un'opportunità commerciale genuina.
Il file dell'account registra il dominio dell'azienda, la pagina LinkedIn, la sede, la categoria, il fatturato e la fonte, il numero di dipendenti, l'anno di fondazione, lo stato di finanziamento o proprietà, le pagine AIMultiple pertinenti, il segnale di marketing e il punteggio di adattamento.
Le società madri e le filiali non possono apparire entrambe per la stessa opportunità di fornitore. Le regole escludono anche società di servizi, aziende di consumo, società di analisi o recensioni e candidati che non soddisfano i requisiti di fatturato o sede.
Come abbiamo valutato il task
La rubrica contiene 71 punti suddivisi in sette sezioni. La sezione della mappa di copertura verifica se il modello ha esaminato almeno 30 pagine live di AIMultiple e ha incluso ogni tipo di pagina richiesto. I revisori campionano le righe per confermare che i fornitori nominati e le informative sugli sponsor corrispondano alle pagine live.
La sezione del file account richiede esattamente 100 domini distinti, le colonne specificate, classificazioni accettate, punteggi di adattamento discendenti e campi di prova completi. Un campione fisso di 20 account viene quindi utilizzato per controlli dettagliati riguardanti fatturato, identità LinkedIn, sede effettiva, adattamento di categoria, prove di growth marketing e stato di fornitore B2B.
Altre sezioni verificano se le pagine proposte rappresentano reali aperture, penalizzano account squalificati o fabbricati, premiano l'inclusione di aziende ad alto adattamento verificate e controllano se i modelli evitano errori noti.
Un file account mancante, colonne errate o qualsiasi conteggio di righe diverso da 100 rende non valida l'esecuzione.
Metodologia del benchmark di marketing agentic
Abbiamo costruito entrambi i benchmark a partire dai flussi di lavoro utilizzati dai nostri team di strategia e crescita.
Il task di analisi competitiva supporta le decisioni sulla copertura dei prodotti, le priorità dei contenuti e il posizionamento. Il task di preparazione dell'elenco account supporta l'account-based marketing e la ricerca sulle vendite.
Per ogni flusso di lavoro, abbiamo creato un file di task che definisce:
- il ruolo del modello
- gli strumenti disponibili
- i requisiti di evidenza
- le regole di qualificazione
- gli output richiesti
- il limite di tempo
Abbiamo progettato i task attorno alle nostre pagine e ai nostri flussi di lavoro commerciali, e i nostri dati costituiscono parte della chiave di risposta. Ciò rende le prove più facili da verificare, sebbene limiti anche la generalizzabilità dei risultati ad altre aziende e ambienti di marketing.
Istruzioni dei task e rubriche di valutazione
Per l'analisi competitiva, i modelli potevano effettuare ricerche sul web live tramite Bright Data MCP. Abbiamo disabilitato l'esecuzione di codice e impostato un limite di 90 minuti.
Per la preparazione dell'elenco account, i modelli hanno utilizzato lo stesso accesso web, con l'esecuzione di codice abilitata. Abbiamo consentito fino a 240 minuti perché il task richiedeva due file di output e 100 account qualificati.
Abbiamo fornito a ciascun modello le istruzioni del task e lo schema di output, mantenendo nascosta la rubrica di valutazione.
I modelli dovevano utilizzare fonti aggiornate
Entrambi i task dipendono da informazioni che cambiano nel tempo, incluse offerte dei siti web, inventari di benchmark, pagine prodotto, fatturato aziendale, sedi, proprietà, informative sugli sponsor e attività di marketing.
Abbiamo considerato valido un URL quando è stato risolto e supportava l'affermazione allegata. La homepage di un'azienda non poteva supportare un dato specifico sul fatturato, e un database di marketing generico non poteva dimostrare che una piattaforma offrisse un particolare formato di benchmark. Abbiamo verificato per l'ultima volta le chiavi di risposta il 7 luglio 2026.
Gli output sono stati progettati per l'uso operativo
Entrambi i task richiedono file CSV con colonne fisse e celle atomiche. Questo formato ci consente di verificare automaticamente campi mancanti, duplicati, categorie non valide, domini non supportati, conteggi di righe errati, valori malformati ed errori di ordinamento.
Riflette anche il modo in cui i team di marketing utilizzano questi output. Gli elenchi account e le analisi competitive spesso confluiscono in fogli di calcolo, flussi di lavoro CRM, database interni o strumenti di automazione. Un file strutturalmente non valido può bloccare il passaggio successivo anche quando parti della ricerca sono corrette.
Riportiamo i punteggi di singole esecuzioni senza varianza
I risultati includono un punteggio riportato per modello. Al momento non riportiamo esecuzioni ripetute, semi, intervalli di confidenza o barre d'errore.
I lettori dovrebbero quindi interpretare con cautela le piccole differenze di punteggio. Nell'analisi competitiva, un ulteriore gap netto corretto modifica il punteggio di dieci punti. Nella preparazione dell'elenco account, poche righe campionate possono determinare se un intero criterio basato su soglie viene superato.
Abbiamo combinato controlli deterministici con un giudice LLM
Script deterministici hanno gestito tutto ciò che il software può risolvere direttamente: esistenza del file, parsing CSV, ordine delle colonne, conteggi delle righe, valori accettati, domini URL, duplicati e ordinamento. Gli script hanno anche recuperato ogni URL citato, seguito i reindirizzamenti e passato il contenuto della pagina risolta al giudice.
Un giudice LLM ha valutato i criteri semantici: se due offerte sono equivalenti, se un'affermazione di assenza è valida, se un'azienda rientra in una categoria, se una pagina recuperata supporta l'affermazione ad essa collegata e se una pagina proposta è un'apertura reale.
Il giudice ha valutato una riga o un gap alla volta in base alle regole di superamento o fallimento della rubrica, e gli script hanno aggregato tali giudizi nei criteri di soglia (ad esempio, ≥18 su 20 righe campionate). Non ha mai assegnato una valutazione generale della qualità. I nostri analisti hanno costruito e congelato la chiave di risposta: gli account gold, le trappole e le trascrizioni delle informative sugli sponsor, il 7 luglio 2026; il giudice ha applicato quella chiave anziché formare una propria opinione su cosa dovesse contare.
Questo ci ha permesso di valutare due file lunghi e ricchi di prove, ma comporta un rischio: un giudice può accettare una fonte che ha letto in modo troppo generoso, che è la stessa modalità di fallimento che la rubrica penalizza nei modelli. Questi risultati utilizzano un singolo passaggio di valutazione, senza verifica di accordo tra più giudici e senza calibrazione rispetto a un campione valutato da umani.
FAQ
Il marketing agentic implica l'uso di agenti IA per pianificare e completare attività di marketing a più fasi con un input umano minimo. Questi agenti utilizzano dati sui clienti, regole aziendali, contesto in tempo reale e istruzioni in linguaggio naturale per prendere decisioni durante i flussi di lavoro di marketing.
L'automazione del marketing tradizionale esegue regole predefinite, come l'invio di un'email dopo l'invio di un modulo o lo spostamento di un lead tra segmenti di pubblico. I sistemi agentic possono interpretare un obiettivo aziendale, selezionare gli strumenti necessari, completare la configurazione della campagna, monitorare le prestazioni della campagna e regolare le azioni per ottimizzare le prestazioni.
Una piattaforma di marketing agentic può supportare attività quali:
– analizzare il comportamento dei clienti e identificare segmenti di pubblico;
– adattare i percorsi dei clienti in base a nuovi segnali;
– allocare la spesa pubblicitaria tra le campagne di marketing;
– generare contenuti nel rispetto delle linee guida del brand;
– coordinare i flussi di lavoro creativi e preservare la direzione creativa;
– produrre insight generati dall'IA per l'ottimizzazione dei percorsi;
– spostare dati tra strumenti disconnessi in un cloud di marketing;
– assegnare compiti specifici a più agenti.
L'analisi dei gap competitivi richiede prove da entrambi i lati di ogni risultato. Il modello deve confermare che la piattaforma concorrente offra un'offerta specifica. Deve quindi esaminare le pagine pertinenti di AIMultiple e determinare se esista un equivalente.
Il secondo passo richiede un'esplorazione più ampia del sito. Le prove pertinenti possono apparire su una pagina di benchmark, una pagina di categoria, un articolo, una pagina di strumenti o una voce della sitemap.
La similarità semantica aggiunge un'altra sfida. Due offerte possono rivolgersi allo stesso ampio mercato utilizzando formati di valutazione o metodologie diverse. L'agente deve decidere se la differenza crei un gap significativo.
La rubrica penalizza anche i risultati speculativi. Un comportamento di ricerca ampio può migliorare il richiamo e aumentare il numero di false affermazioni di assenza. Un comportamento conservativo può proteggere la precisione e far perdere i gap attesi.
I due task testano diverse combinazioni di capacità. L'analisi competitiva richiede ricerca comparativa, giudizio semantico e un'attenta verifica dell'assenza.
La preparazione dell'elenco account richiede una ricerca web sostenuta, qualificazione ripetuta, risoluzione delle entità, gestione delle fonti e un controllo preciso dell'output.
Un modello può funzionare bene su un compito di confronto breve ma non riuscire a completare un file ampio e strutturato. Un altro modello può gestire la ricerca ripetuta sugli account e fallire un controllo strutturale nell'analisi competitiva.
La selezione del modello per il marketing agentic dovrebbe quindi considerare gli specifici flussi di lavoro di marketing che un team intende automatizzare.
Cita questa ricerca
Scegli il formato adatto a dove pubblicherai. Incollare la versione con link nel tuo CMS preserva il backlink.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{AIM Benchmark di Marketing Agentic}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Consultato il 17 Luglio 2026}
}
Sii il primo a commentare
Il tuo indirizzo email non verrà pubblicato. Tutti i campi sono obbligatori. I commenti vengono lasciati nella loro lingua originale.