Estamos a apresentar o Benchmark AIM de Marketing Agêntico, que mede o desempenho dos agentes em três fluxos de trabalho de marketing: análise de lacunas competitivas, preparação de listas de alvos ABM e um deck de vendas personalizado.
Também realizámos uma auditoria de reputação do site separada, na qual os agentes examinaram o conteúdo em inglês da AIMultiple e reportaram problemas verificáveis de exatidão factual, citações, consistência, atualidade, funcionalidade, gramática e formatação que poderiam minar a confiança dos leitores.
Resultados do benchmark de marketing agêntico
As pontuações das tarefas são normalizadas para uma escala de 0–100.
- Para a análise competitiva, a pontuação é igual a: 100 × MAX(0, lacunas verificadas encontradas − lacunas incorretas) / 10
- Para a preparação da lista de contas, a pontuação é a percentagem de 71 pontos da grelha de avaliação disponíveis ganhos pelo modelo.
- Para a tarefa do deck de vendas, a pontuação é a soma de 5 secções de 20 pontos.
- A pontuação global é a média aritmética das pontuações da análise competitiva, da lista de contas e do deck de vendas. A auditoria de reputação do site não contribui para esta pontuação global. A auditoria é reportada nos seus próprios eixos em vez de uma única pontuação.
Ao contrário das três tarefas normalizadas, a auditoria não tem uma pontuação máxima fixa. Por isso, incluímos os resultados numa avaliação separada e não os combinámos com o benchmark global.
Leia a metodologia para mais informações sobre a avaliação das tarefas.
As tarefas da vida real usadas no benchmark
Estes fluxos de trabalho de marketing agêntico abrangem estratégia e cobertura de conteúdo, crescimento, pesquisa de vendas, criação de conteúdo personalizado e garantia de qualidade do site. Cada um exige pesquisa em direto, validação de fontes, julgamento baseado em regras e uma saída que possa ser integrada num fluxo de trabalho operacional.
Tarefa 1: Análise de lacunas competitivas
O modelo atua como um analista de estratégia na AIMultiple e compara-a com uma plataforma concorrente de benchmarking de IA. A execução permite 90 minutos de tempo de execução e acesso à web em direto através do Bright Data MCP, com a execução de código desativada.
O resultado é um único ficheiro contendo até 10 linhas, ordenadas por prioridade. Cada linha nomeia uma oferta que o concorrente publica mas a AIMultiple não, explica a diferença numa ou duas frases, cita a página do concorrente que o modelo abriu e lista as páginas da AIMultiple que examinou antes de reivindicar a ausência.
A alegação de ausência é a metade mais difícil de cada descoberta. Identificar uma funcionalidade no site do concorrente requer uma única página. Estabelecer que a AIMultiple não a fornece exige rever as páginas de categoria, benchmarks, artigos e mapa do site.
Quando a AIMultiple publica uma oferta adjacente, o modelo deve nomear essa página e especificar o que a versão do concorrente faz de diferente. A cobertura do mesmo assunto amplo não estabelece uma oferta equivalente.
Como pontuámos a tarefa
A pontuação é feita com base numa chave de resposta compilada manualmente: dez lacunas verificadas em ambos os sites, juntamente com as alegações de ausência que as páginas ativas da AIMultiple refutam.
Cada lacuna verificada adiciona um ponto, e cada alegação de ausência incorreta deduz um. Uma alegação incorreta inclui qualquer linha cujo URL seja fabricado, inacessível ou não suporte a alegação anexada.
A chave contém dez lacunas, mas um modelo pode encontrar uma real que não esteja na lista. Um revisor lê essas descobertas manualmente e concede o ponto se a página citada mostrar a oferta, nenhuma página ativa da AIMultiple contradizer a alegação e a oferta estiver realmente em falta na AIMultiple.
Duas regras limitam estes pontos extra:
- Uma descoberta que repita uma das dez existentes com palavras diferentes não ganha nada extra. É creditada na lacuna listada em vez disso.
- Uma descoberta que falhe na revisão custa um ponto. Se a AIMultiple publicar a oferta, ou o concorrente não a tiver, a linha pontua zero, a mesma penalização que qualquer outra alegação errada.
Isto impede que a chave penalize uma descoberta que os analistas não registaram, ao mesmo tempo que retém crédito de alegações especulativas.
Como última parte da avaliação, o revisor realiza verificações de links. As verificações de links seguem redirecionamentos e avaliam o destino final, pelo que um 301 não reprova uma linha por si só. Um nome de ficheiro incorreto, colunas em falta ou reordenadas, uma contagem de linhas fora de uma a dez, uma prioridade fora de 1 a 10, um URL de evidência no domínio errado ou linhas fora de ordem tornam a execução inválida, e uma execução inválida não recebe pontuação numérica.
Tarefa 2: Preparação da lista de contas mais adequadas
O modelo atua como um profissional de marketing de crescimento a preparar uma lista de marketing baseado em contas para a AIMultiple.
O trabalho começa com um mapa de cobertura das páginas ativas da AIMultiple. O agente regista páginas de categoria, benchmarks e páginas de comparação de fornecedores, bem como fornecedores mencionados nos corpos dos artigos e nas divulgações de patrocinadores.
Em seguida, prepara uma lista priorizada de 100 contas. Cada empresa deve ser um fornecedor de tecnologia B2B com uma receita anual entre $100 milhões e $1 mil milhões, com sede nos EUA, Europa ou Israel, e ativa numa categoria coberta pela AIMultiple. A empresa também precisa de um sinal atual de marketing de crescimento e de pelo menos uma página da AIMultiple onde represente uma oportunidade comercial genuína.
O ficheiro de contas regista o domínio da empresa, página do LinkedIn, sede, categoria, receita e fonte, número de funcionários, ano de fundação, estatuto de financiamento ou propriedade, páginas relevantes da AIMultiple, sinal de marketing e pontuação de adequação.
Empresas-mãe e subsidiárias não podem ambas aparecer para a mesma oportunidade de fornecedor. As regras também excluem empresas de serviços, negócios de consumo, empresas de análise ou revisão e candidatos que não cumpram os requisitos de receita ou sede.
Como pontuámos a tarefa
A grelha de avaliação contém 71 pontos distribuídos por sete secções. A secção do mapa de cobertura verifica se o modelo reviu pelo menos 30 páginas ativas da AIMultiple e incluiu todos os tipos de página exigidos. Os revisores amostram linhas para confirmar que os fornecedores nomeados e as divulgações de patrocinadores correspondem às páginas ativas.
A secção do ficheiro de contas exige exatamente 100 domínios distintos, as colunas especificadas, classificações aceites, pontuações de adequação decrescentes e campos de evidência completos. Uma amostra fixa de 20 contas é depois usada para verificações detalhadas que abrangem receita, identidade do LinkedIn, sede real, adequação da categoria, evidência de marketing de crescimento e estatuto de fornecedor B2B.
Outras secções testam se as páginas propostas são aberturas genuínas, penalizam contas desqualificadas ou fabricadas, recompensam a inclusão de empresas verificadas de alta adequação e verificam se os modelos evitam quase-acertos conhecidos.
Um ficheiro de contas em falta, colunas incorretas ou qualquer contagem de linhas diferente de 100 torna a execução inválida.
Tarefa 3: Deck de vendas personalizado
Nota: Excluímos o Kimi K3 e o Gemini 3.5 Flash porque cada um solicitou acesso a um diretório fora da sua pasta de trabalho; o harness recusou o pedido automaticamente e ambas as execuções terminaram aí. Nenhum produziu um deck, e nenhum falhou a tarefa, pois nada do que produziram foi avaliado. Um zero colocaria um problema de infraestrutura no registo do modelo, por isso ambos são marcados como não executados e excluídos da média.
O modelo atua como um analista de pré-vendas na AIMultiple e constrói um deck de apresentação para um executivo sénior de marketing de produto. A execução inclui 90 minutos, acesso à web em direto através do Bright Data MCP, execução de código e uma pasta de ativos de marca contendo os logótipos e as fontes.
A maior parte da pesquisa concentra-se no executivo e não na empresa. Este executivo gere o marketing de uma única linha de produtos e declarou publicamente o que conta ao avaliar hardware: quantos tokens um dólar compra, se um terceiro independente verificou os números e se o teste se assemelhou a uma carga de trabalho real ou a uma demonstração.
Outro argumento recorrente é que um rack é uma unidade de comparação mais justa do que um chip. Como estes argumentos são públicos e podem ser encontrados em entrevistas, palestras em conferências e publicações, a tarefa é lê-los e depois encontrar os benchmarks da AIMultiple que lhes respondem. Um deck pode ser preciso sobre a AIMultiple e ainda assim falhar completamente a pessoa, e é essa a versão que pontua mal.
Aqui estão alguns resultados do Fable 5, Gemini 3-1 pro-preview e GPT 5.6 Sol:
Como pontuámos a tarefa
O deck é pontuado em cinco aspetos, cada um valendo 20 pontos: se segue a identidade visual da AIMultiple, se cita os benchmarks certos, se propõe próximos passos úteis, se explica o que a AIMultiple vale para o destinatário e se os diapositivos são claros. Cada um dos cinco divide-se em pequenas verificações com respostas fixas.
A identidade visual é a única parte que um modelo pode acertar sem fazer qualquer pesquisa. Os ficheiros de logótipo, o valor hexadecimal da cor de destaque, as cores do texto, o tipo de letra e a grafia do nome da empresa estão todos corretos ou não. Por exemplo, um deck configurado em Calibri perde os pontos.
A segunda parte avalia para onde o deck aponta hoje. A AIMultiple publica muitos artigos sobre hardware, e alguns deles testam o tipo de chips que esta pessoa vende. Portanto, os pontos vão para um deck que cite estudos de GPU para centros de dados em vez de quaisquer páginas de hardware que tenham aparecido primeiro.
A terceira secção é sobre o trabalho que a AIMultiple poderia fazer a seguir. Uma sugestão conta aqui se nomear o estudo e o número que produziria. Por exemplo, repetir uma comparação existente nos chips deste ano ou adicionar o hardware da empresa a um benchmark que atualmente a exclui ganha um ponto. Por outro lado, propor que as duas empresas analisem juntas o desempenho de inferência não nomeia nem um estudo nem uma medição, portanto não ganha pontos.
A quarta parte diz respeito ao que a AIMultiple vale para o destinatário. Os pontos são atribuídos a três afirmações que:
- AIMultiple é independente
- A sua audiência é de um tamanho declarado apoiado por uma fonte nomeada
- Esta audiência serve um propósito específico para o negócio do destinatário, como alcançar compradores na fase de lista curta
Um deck que lista o que a AIMultiple publica sem ligar nada disso aos produtos do próprio destinatário não ganha pontos.
A quinta parte cobre se o deck pode ser lido. Duas verificações importam mais do que as restantes: os títulos têm de declarar uma conclusão em vez de rotular o diapositivo, e os números têm de dizer de onde vieram, com os números da empresa mantidos separados das medições próprias da AIMultiple. O resto é mecânico, como avaliar a contagem de diapositivos, transbordo de texto, rótulos de gráficos, texto de preenchimento.
Quatro das cinco partes também acarretam penalizações. Um benchmark inventado, um número fabricado, um link morto ou apresentar a alegação de marketing da própria empresa como uma medição da AIMultiple custa pontos. Prometer resultados favoráveis, classificação preferencial ou uma revisão antes da publicação também custa pontos, uma vez que a AIMultiple não oferece nada disso. O deck tem de persuadir sem fabricar provas e sem oferecer nada que o negócio não venda.
Tarefa 4: Auditoria de reputação do site
O modelo atua como um auditor de qualidade e reputação do site para a AIMultiple. A execução permite 120 minutos, acesso à web em direto através do Bright Data MCP e execução de código.
O agente começa por obter o mapa do site de publicações da AIMultiple e excluir URLs com prefixos de idioma alemão, espanhol, francês, italiano, português ou turco. Deve examinar pelo menos 100 URLs restantes em inglês.
Para cada página, o agente procura problemas que possam prejudicar a credibilidade da AIMultiple. Estes podem incluir informações inconsistentes entre páginas, links quebrados, alegações desatualizadas, erros factuais, gramática ou formatação deficientes, citações em falta, alegações enganosas, funcionalidade quebrada e texto de preenchimento genérico gerado por IA.
O resultado é um ficheiro Results.csv contendo não mais de 50 linhas. Cada linha deve descrever um problema distinto e deduplicado e agregar todos os URLs onde esse problema ocorre.
Cada linha regista:
- o ID do problema;
- prioridade;
- gravidade;
- número de URLs afetados;
- URLs afetados;
- evidência exata citada;
- uma explicação do problema de reputação;
- e uma correção recomendada.
O ficheiro deve ser ordenado por prioridade da mais alta para a mais baixa.
Como pontuámos a tarefa
A prioridade é calculada como: Prioridade = Gravidade × Número de URLs afetados
A gravidade usa quatro níveis:
- 4: Erros factuais, funcionalidade quebrada ou outros problemas que podem causar danos reputacionais significativos.
- 3: Inconsistências entre páginas, informações desatualizadas, fontes em falta, links quebrados ou texto de preenchimento ao estilo de IA.
- 2: Problemas graves de gramática ou formatação.
- 1: Problemas menores de gramática, formatação ou estilo que não afetam a legibilidade.
Uma linha conta quando todas as verificações aplicáveis passam. Os scripts determinísticos são executados primeiro. Verificam a estrutura do ficheiro e a consistência interna de cada linha, e resolvem a evidência de cada linha em relação à página a que é atribuída.
Um painel de modelos de três fornecedores revê depois as linhas que os scripts mantiveram. O painel trabalha a partir de uma cópia datada de cada página, em vez do site em direto, para que um defeito que o site já tenha corrigido não seja contabilizado contra o modelo que o encontrou.
Por fim, a submissão completa é verificada quanto a descobertas duplicadas e problemas demasiado amplos para verificar. Por exemplo, "problemas de citação" é demasiado geral para uma linha, enquanto "links de citação quebrados" é um problema suficientemente específico.
A auditoria relata quantas linhas de um modelo sobreviveram à verificação, juntamente com a percentagem das suas linhas submetidas que sobreviveram. Um modelo que submeta um ficheiro inválido ou nenhuma linha de dados válida é registado como não tendo entregue nada. Veja abaixo o desempenho de cada modelo:
Metodologia do benchmark de marketing agêntico
Construímos o benchmark original a partir de três fluxos de trabalho usados pelas nossas equipas de estratégia, crescimento e vendas. Adicionámos depois uma auditoria de reputação do site representando a garantia de qualidade do conteúdo e a governação editorial.
A tarefa de análise competitiva apoia decisões sobre cobertura de produtos, prioridades de conteúdo e posicionamento. A tarefa da lista de contas apoia o marketing baseado em contas e a pesquisa de vendas. O deck de vendas apoia o contacto de pré-vendas: selecionar um potencial cliente, determinar quais os benchmarks publicados que importam e construir o documento.
A auditoria de reputação do site apoia a manutenção de conteúdo e a confiança. Identifica provas quebradas, informações obsoletas, inconsistências entre páginas, problemas factuais, falhas de funcionalidade e defeitos editoriais.
Para cada fluxo de trabalho, criámos um ficheiro de tarefa que define:
- o papel do modelo
- ferramentas disponíveis
- requisitos de evidência
- regras de qualificação
- saídas exigidas
- limite de tempo
Concebemos as tarefas em torno das nossas próprias páginas e fluxos de trabalho comerciais, e os nossos dados fazem parte da chave de resposta. Isto facilita a verificação das provas, embora também limite a amplitude com que os resultados se aplicam a outras empresas e ambientes de marketing.
Instruções das tarefas e grelhas de pontuação
Para a análise competitiva, os modelos podiam pesquisar a web em direto através do Bright Data MCP. Desativámos a execução de código e definimos um limite de 90 minutos.
Para a preparação da lista de contas, os modelos usaram o mesmo acesso à web, com a execução de código ativada. Permitimos até 240 minutos porque a tarefa exigia dois ficheiros de saída e 100 contas qualificadas.
Para a preparação do deck de vendas, ativámos o mesmo acesso à web com execução de código. A duração foi de 90 minutos, com uma pasta de ativos de marca no diretório de trabalho.
Para a auditoria de reputação do site, os modelos usaram acesso à web em direto através do Bright Data MCP com execução de código ativada. Permitimos até 120 minutos, uma vez que a tarefa exigia rastrear e analisar pelo menos 100 páginas. A saída exigida era um único CSV contendo não mais de 50 grupos de problemas deduplicados.
Demos a cada modelo as instruções da tarefa e o esquema de saída, mantendo a grelha de pontuação oculta.
Os modelos tiveram de usar fontes atuais
Todos os quatro fluxos de trabalho dependem de informações que podem mudar. Isto inclui ofertas do site, inventários de benchmarks, páginas de produtos, receita da empresa, sede, propriedade, divulgações de patrocinadores, atividade de marketing, declarações públicas, conteúdo de artigos, citações e destinos de links.
Contámos um URL quando este resolvia e suportava a alegação a ele anexada. Uma página inicial de empresa não pode suportar um valor de receita específico, e uma página que contenha uma frase semelhante não pode suportar uma descoberta de auditoria a menos que a citação submetida e o defeito descrito estejam presentes.
As chaves de resposta para as tarefas de análise competitiva e lista de contas foram verificadas pela última vez em 7 de julho de 2026. A grelha do deck de vendas foi verificada em 25 de julho de 25, 2026, e os decks foram pontuados no dia seguinte.
A auditoria de reputação do site não usou uma lista fixa de problemas esperados. Cada descoberta submetida foi verificada em relação às páginas ativas da AIMultiple no momento da pontuação. Isto é necessário porque o site é continuamente atualizado, e um problema que existia durante uma execução pode ser corrigido mais tarde.
As saídas foram concebidas para uso operacional
As tarefas de análise competitiva, lista de contas e reputação do site exigem ficheiros CSV com colunas fixas e células atómicas. Isto permite-nos verificar automaticamente campos em falta, duplicados, domínios não suportados, contagens de linhas incorretas, valores mal formados, erros aritméticos e problemas de ordenação.
A tarefa do deck de vendas exige um ficheiro PowerPoint 16:9 que abra sem um aviso de reparação.
As análises competitivas e as listas de contas podem ser transferidas para folhas de cálculo, fluxos de trabalho de CRM e ferramentas de automação. O resultado da auditoria de reputação pode ser movido para um rastreador de problemas editorial ou de engenharia. O deck pode ser enviado a um potencial cliente após revisão.
Um ficheiro estruturalmente inválido bloqueia o passo operacional seguinte, mesmo quando parte da pesquisa nele contida é útil. Por esta razão, a entrega do ficheiro e a conformidade com o esquema fazem parte do benchmark, em vez de requisitos administrativos externos.
Relatamos pontuações de uma única execução sem variância
Os resultados incluem uma pontuação reportada por modelo. Atualmente, não reportamos execuções repetidas, sementes, intervalos de confiança ou barras de erro.
Os leitores devem, portanto, tratar as pequenas diferenças de pontuação com cautela. Na análise competitiva, uma lacuna correta líquida adicional altera a pontuação em dez pontos. Na preparação da lista de contas, algumas linhas amostradas podem determinar se um critério inteiro baseado em limiares é aprovado.
Combinámos verificações determinísticas com um juiz LLM
Os scripts determinísticos trataram de tudo o que o software pode resolver diretamente: existência de ficheiros, análise de CSV, ordem das colunas, contagens de linhas, valores aceites, domínios de URL, duplicados, ordenação e, para o deck, integridade do arquivo, dimensões dos diapositivos e declarações de fontes. Os scripts também foram buscar cada URL citado, seguiram redirecionamentos e passaram o conteúdo da página resolvida ao juiz.
Um juiz LLM pontuou os critérios semânticos uma linha, lacuna ou critério de cada vez com base em regras de aprovação/reprovação, e nunca atribuiu uma classificação geral de qualidade. Os nossos analistas construíram as chaves de resposta e o juiz aplicou-as.
A análise competitiva acrescenta um passo humano. Um modelo pode reportar uma lacuna real que a chave não lista, pelo que essas descobertas vão para um analista, que as credita após verificar ambos os sites.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{ermut2026,
author = {Ermut, Sıla and Kalelioğlu, Berk},
title = {{Benchmark AIM de Marketing Agêntico}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-marketing}},
note = {AIMultiple. Acessado em 5 Agosto 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.