Serviços
Contate-nos

Benchmark AIM Agentic Marketing

Sıla Ermut
Sıla Ermut
atualizado em 5 ago. 2026

Estamos apresentando o Benchmark AIM Agentic Marketing, que mede o desempenho de agentes em três fluxos de trabalho de marketing: análise de gap competitivo, preparação de lista de alvos ABM e um deck de vendas personalizado.

Testamos o desempenho de 11 modelos em três tarefas reais e medimos o desempenho de execução ponta a ponta:

Resultados do benchmark de marketing agentic

Loading Chart

As pontuações das tarefas são normalizadas para uma escala de 0 a 100.

  • Para análise competitiva, a pontuação é igual a: 100 × MÁX(0, gaps verificados encontrados − gaps incorretos) / 10
  • Para preparação de lista de contas, a pontuação é a porcentagem dos 71 pontos de rubrica disponíveis obtidos pelo modelo.
  • Para a tarefa de deck de vendas, a pontuação é a soma de 5 seções de 20 pontos cada.

A pontuação geral é a média aritmética das três pontuações das tarefas, dando a cada tarefa peso igual apesar de diferentes tamanhos de rubrica. Submissões inválidas contam como zero no cálculo geral, com duas exceções: Kimi K3 e Gemini 3.5 Flash não têm pontuação geral, pois ambos não executaram a tarefa do deck de vendas.

Leia a metodologia para mais informações sobre a avaliação das tarefas.

Nenhum modelo foi confiável em todos os três fluxos de trabalho

Fable 5 com 84.4% e Sol com 74% são os únicos modelos que ficaram entre os três primeiros em cada tarefa. Abaixo deles, a ordem é praticamente um embaralhamento. GLM 5.2 marcou 80% e 76.1% nas duas primeiras tarefas, e depois não escreveu deck algum. Sonnet 5 falhou totalmente na análise competitiva e produziu o terceiro melhor deck. MiniMax M3 terminou em último entre os nove modelos com pontuação em três tarefas, enquanto detinha a quarta melhor pontuação de deck.

Um ranking de um fluxo de trabalho de marketing não se transfere para o próximo. Portanto, teste um modelo no fluxo de trabalho que você planeja automatizar antes de escolhê-lo

Cada zero veio da entrega, não da pesquisa

Cinco execuções receberam zero, e nenhuma delas foi julgada mal no conteúdo. Sonnet 5 submeteu onze linhas contra um limite de dez linhas. Kimi K3 e MiniMax M3 nunca produziram um arquivo de conta válido. GLM 5.2 e Opus 4.8 terminaram a execução do deck sem escrever um arquivo.

Em cada caso, a pesquisa nunca foi lida. Se você estiver implantando um agente, essa pode ser a restrição que importa mais do que a qualidade da pesquisa: um agente que não consegue produzir um arquivo bem formado a tempo não pontua nada.

Os decks de vendas venderam bem e não provaram nada

Entre os sete decks que os modelos produziram, eles obtiveram 83% dos pontos disponíveis para explicar o que a AIMultiple vale para o destinatário, 36% por citar os benchmarks relevantes para aquele destinatário, e 20% por propor o que pesquisar em seguida.

Escrever um argumento de venda persuasivo acabou sendo a metade fácil. Fundamentá-lo em trabalho publicado, que é o que uma empresa de pesquisa vende, é onde os decks falharam.

As tarefas reais usadas no benchmark

Essas tarefas de marketing agentic incluem cobertura de estratégia e conteúdo, crescimento e pesquisa de vendas. Cada uma requer pesquisa na web, validação de fontes, qualificação baseada em regras e saída estruturada.

Tarefa 1: Análise de gap competitivo

O modelo trabalha como analista de estratégia na AIMultiple e a compara com uma plataforma de benchmarking de IA concorrente. A execução permite 90 minutos e acesso à web ao vivo por meio do Bright Data MCP, com execução de código desativada.

A saída é um único arquivo e contém até dez linhas ordenadas por prioridade. Cada linha nomeia uma oferta que o concorrente publica e a AIMultiple não, explica a diferença em uma ou duas frases, cita uma página do concorrente que o modelo abriu e lista as páginas da AIMultiple que examinou antes de alegar a ausência.

A alegação de ausência é a metade mais difícil de cada descoberta. Identificar um recurso no site do concorrente requer uma única página. Estabelecer que a AIMultiple não o fornece requer revisar as páginas de categoria, benchmarks, artigos e mapa do site.

Onde a AIMultiple publica uma oferta adjacente, o modelo deve nomear essa página e especificar o que a versão do concorrente faz de diferente. A cobertura do mesmo assunto amplo não estabelece uma oferta equivalente.

Como pontuamos a tarefa

A pontuação das execuções é comparada com uma chave de respostas compilada manualmente: dez gaps verificados em ambos os sites, juntamente com as alegações de ausência que as páginas ativas da AIMultiple refutam.

Cada gap verificado adiciona um ponto, e cada alegação de ausência incorreta deduz um. Uma alegação incorreta inclui qualquer linha cujo URL seja fabricado, inacessível ou não suporte a alegação anexada.

A chave contém dez gaps, mas um modelo pode encontrar um real que não esteja nela. Um revisor lê essas descobertas manualmente e concede o ponto se a página citada mostrar a oferta, nenhuma página ativa da AIMultiple contradizer a alegação e a oferta realmente estiver ausente da AIMultiple.

Duas regras limitam esses pontos extras:

  • Uma descoberta que repete um dos dez gaps existentes com palavras diferentes não ganha nada extra. É creditada sob o gap listado em vez disso.
  • Uma descoberta que falha na revisão custa um ponto. Se a AIMultiple já publica a oferta, ou o concorrente não a tem, a linha pontua zero, a mesma penalidade que qualquer outra alegação errada.

Isso impede que a chave penalize uma descoberta que os analistas não registraram, ao mesmo tempo que retém crédito de alegações especulativas.

Como última parte da avaliação, o revisor realiza verificações de links. As verificações de links seguem redirecionamentos e avaliam o destino final, então um 301 não reprova uma linha por si só. Um nome de arquivo incorreto, colunas ausentes ou fora de ordem, uma contagem de linhas fora de um a dez, uma prioridade fora de 1 a 10, um URL de evidência em domínio errado ou linhas fora de ordem tornam a execução inválida, e uma execução inválida não recebe pontuação numérica.

Tarefa 2: Preparação de lista de contas de melhor ajuste

O modelo atua como um profissional de marketing de crescimento preparando uma lista de marketing baseado em contas para a AIMultiple.

O trabalho começa com um mapa de cobertura das páginas ativas da AIMultiple. O agente registra páginas de categoria, benchmarks e páginas de comparação de fornecedores, bem como fornecedores mencionados em corpos de artigos e em divulgações de patrocinadores.

Em seguida, prepara uma lista priorizada de 100 contas. Cada empresa deve ser um fornecedor de tecnologia B2B com receita anual entre $100 milhões e $1 bilhão, com sede nos EUA, Europa ou Israel, e ativa em uma categoria coberta pela AIMultiple. A empresa também precisa de um sinal de marketing de crescimento atual e pelo menos uma página da AIMultiple onde represente uma oportunidade comercial genuína.

O arquivo de conta registra o domínio da empresa, página do LinkedIn, sede, categoria, receita e fonte, número de funcionários, ano de fundação, status de financiamento ou propriedade, páginas relevantes da AIMultiple, sinal de marketing e pontuação de ajuste.

Empresas-mãe e subsidiárias não podem ambas aparecer para a mesma oportunidade de fornecedor. As regras também excluem empresas de serviços, negócios de consumo, empresas de análise ou avaliação e candidatos que não atendam aos requisitos de receita ou sede.

Como pontuamos a tarefa

A rubrica contém 71 pontos em sete seções. A seção de mapa de cobertura verifica se o modelo revisou pelo menos 30 páginas ativas da AIMultiple e incluiu todos os tipos de página obrigatórios. Os revisores amostram linhas para confirmar que os fornecedores nomeados e as divulgações de patrocinadores correspondem às páginas ativas.

A seção de arquivo de conta requer exatamente 100 domínios distintos, as colunas especificadas, classificações aceitas, pontuações de ajuste decrescentes e campos de evidência completos. Uma amostra fixa de 20 contas é então usada para verificações detalhadas abrangendo receita, identidade no LinkedIn, sede verdadeira, adequação de categoria, evidência de marketing de crescimento e status de fornecedor B2B.

Outras seções testam se as páginas propostas são oportunidades genuínas, penalizam contas desqualificadas ou fabricadas, recompensam a inclusão de empresas verificadas de alto ajuste e verificam se os modelos evitam quase-acertos conhecidos.

Um arquivo de conta ausente, colunas incorretas ou qualquer contagem de linhas diferente de 100 torna a execução inválida.

Tarefa 3: Deck de vendas personalizado

Nota: Excluímos Kimi K3 e Gemini 3.5 Flash porque cada um solicitou acesso a um diretório fora de sua pasta de trabalho; o harness recusou a solicitação automaticamente e ambas as execuções terminaram ali. Nenhum produziu deck, e nenhum falhou na tarefa, já que nada que produziram foi julgado. Um zero colocaria um problema de infraestrutura no registro do modelo, então ambos estão marcados como não executados e excluídos da média.

O modelo trabalha como analista de pré-vendas na AIMultiple e constrói um deck de apresentação direcionado a um executivo sênior de marketing de produto. A execução permite 90 minutos, acesso à web ao vivo por meio do Bright Data MCP, execução de código e uma pasta de ativos de marca contendo os logotipos e fontes.

A maior parte da pesquisa vai para o executivo, não para a empresa. Esse executivo gerencia o marketing de uma única linha de produtos e declarou publicamente o que conta ao julgar hardware: quantos tokens um dólar compra, se alguém independente verificou os números e se o teste pareceu uma carga de trabalho real ou uma demonstração.

Outro argumento recorrente é que um rack é uma unidade de comparação mais justa do que um chip. Como esses argumentos são públicos e podem ser encontrados em entrevistas, palestras e postagens, a tarefa é lê-los e depois encontrar os benchmarks da AIMultiple que os respondem. Um deck pode ser preciso sobre a AIMultiple e ainda assim errar completamente a pessoa, e essa é a versão que pontua mal.

Aqui estão algumas saídas do Fable 5, Gemini 3-1 pro-preview e GPT 5.6 Sol:

Como pontuamos a tarefa

O deck é pontuado em cinco aspectos, valendo 20 pontos cada: se segue a identidade visual da AIMultiple, se cita os benchmarks certos, se propõe próximos estudos úteis, se explica o que a AIMultiple vale para o destinatário e se os slides são claros. Cada um dos cinco se divide em pequenas verificações com respostas fixas.

Identidade visual é a única parte que um modelo pode acertar sem fazer nenhuma pesquisa. Os arquivos de logotipo, o valor hexadecimal da cor de destaque, as cores do texto, a tipografia e a grafia do nome da empresa estão todos corretos ou não. Por exemplo, um deck configurado em Calibri perde os pontos.

A segunda parte avalia o que o deck aponta hoje. A AIMultiple publica muitos artigos sobre hardware, e apenas alguns deles testam o tipo de chip que essa pessoa vende. Portanto, os pontos vão para um deck que cita estudos de GPU de data center, em vez de quaisquer páginas de hardware que apareceram primeiro.

A terceira seção trata do trabalho que a AIMultiple poderia fazer a seguir. Uma sugestão conta aqui se nomeia o estudo e o número que produziria. Por exemplo, repetir uma comparação existente nos chips deste ano ou adicionar o hardware da empresa a um benchmark que atualmente a omite ganha um ponto. Por outro lado, propor que as duas empresas analisem juntas o desempenho de inferência não nomeia nem um estudo nem uma medida, portanto não ganha pontos.

A quarta parte diz respeito ao que a AIMultiple vale para o destinatário. Pontos são concedidos por três declarações que:

  • A AIMultiple é independente
  • Sua audiência tem um tamanho declarado apoiado por uma fonte nomeada
  • Essa audiência serve a um propósito específico para os negócios do destinatário, como alcançar compradores na fase de lista curta

Um deck que lista o que a AIMultiple publica sem conectar nada disso aos produtos do próprio destinatário não ganha pontos.

A quinta parte cobre se o deck pode ser lido. Duas verificações importam mais que o resto: os títulos devem declarar uma conclusão em vez de rotular o slide, e os números devem dizer de onde vieram, com os números da empresa mantidos separados das medições da AIMultiple. O resto é mecânico, como avaliar a contagem de slides, transbordamento de texto, rótulos de gráficos, enchimento.

Quatro das cinco partes também carregam penalidades. Um benchmark inventado, um número fabricado, um link quebrado ou apresentar a própria alegação de marketing da empresa como uma medição da AIMultiple custa pontos. Prometer resultados favoráveis, classificação preferencial ou uma revisão antes da publicação custa pontos também, já que a AIMultiple não oferece nada disso. O deck deve persuadir sem fabricar evidências e sem oferecer nada que o negócio não venda.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Metodologia do benchmark de marketing agentic

Construímos o benchmark a partir de três fluxos de trabalho que nossas equipes de estratégia, crescimento e vendas executam.

A tarefa de análise competitiva apoia decisões sobre cobertura de produtos, prioridades de conteúdo e posicionamento. A tarefa de lista de contas apoia o marketing baseado em contas e a pesquisa de vendas. O deck de vendas apoia o alcance de pré-vendas: escolher um prospect, descobrir quais benchmarks publicados importam e construir o documento.

Para cada fluxo de trabalho, criamos um arquivo de tarefa que define:

  • o papel do modelo
  • ferramentas disponíveis
  • requisitos de evidência
  • regras de qualificação
  • saídas obrigatórias
  • limite de tempo

Projetamos as tarefas em torno de nossas próprias páginas e fluxos de trabalho comerciais, e nossos dados fazem parte da chave de respostas. Isso torna a evidência mais fácil de verificar, embora também limite quão amplamente os resultados se aplicam a outras empresas e ambientes de marketing.

Instruções da tarefa e rubricas de pontuação

Para análise competitiva, os modelos puderam pesquisar a web ao vivo por meio do Bright Data MCP. Desativamos a execução de código e definimos um limite de 90 minutos.

Para preparação de lista de contas, os modelos usaram o mesmo acesso à web, com execução de código ativada. Permitimos até 240 minutos porque a tarefa exigia dois arquivos de saída e 100 contas qualificadas.

Para preparação de deck de vendas, ativamos o mesmo acesso à web com execução de código. A duração foi de 90 minutos, com uma pasta de ativos de marca no diretório de trabalho.

Fornecemos a cada modelo as instruções da tarefa e o esquema de saída, mantendo a rubrica de pontuação oculta.

Os modelos tiveram que usar fontes atuais

Todas as três tarefas dependem de informações que mudam: ofertas do site, inventários de benchmarks, páginas de produtos, receita da empresa, sede, propriedade, divulgações de patrocinadores, atividade de marketing e as declarações públicas de um indivíduo nomeado.

Contamos um URL quando ele resolveu e apoiou a alegação anexada a ele. Uma página inicial de empresa não pode apoiar um número de receita específico, e um banco de dados de marketing não pode provar que uma plataforma oferece um formato de benchmark específico.

As chaves de respostas para as duas primeiras tarefas foram verificadas pela última vez em 7 de julho de 2026. A rubrica do deck de vendas foi verificada em 25 de julho de 2026, e os decks foram pontuados no dia seguinte.

As saídas foram projetadas para uso operacional

As duas primeiras tarefas exigem arquivos CSV com colunas fixas e células atômicas, o que nos permite verificar automaticamente campos ausentes, duplicatas, domínios não suportados, contagens de linhas incorretas, valores malformados e erros de ordenação. A terceira exige um arquivo PowerPoint que abra sem aviso de reparo em 16:9.

Listas de contas e análises competitivas vão para planilhas, fluxos de trabalho de CRM e ferramentas de automação, e um deck vai para um cliente. Um arquivo estruturalmente inválido bloqueia o próximo passo mesmo quando a pesquisa dentro dele está intacta. É por isso que dois modelos pontuaram zero na tarefa do deck sem que ninguém lesse seus argumentos.

Relatamos pontuações de execução única sem variância

Os resultados incluem uma pontuação relatada por modelo. Atualmente, não relatamos execuções repetidas, sementes, intervalos de confiança ou barras de erro.

Os leitores devem, portanto, tratar pequenas diferenças de pontuação com cautela. Na análise competitiva, um gap líquido correto adicional muda a pontuação em dez pontos. Na preparação de lista de contas, algumas linhas amostradas podem determinar se um critério inteiro baseado em limite é aprovado.

Combinamos verificações determinísticas com um juiz LLM

Scripts determinísticos lidaram com tudo o que o software pode resolver diretamente: existência de arquivo, análise CSV, ordem das colunas, contagens de linhas, valores aceitos, domínios de URL, duplicatas, ordenação e, para o deck, integridade do arquivo, dimensões do slide e declarações de fonte. Os scripts também buscaram cada URL citado, seguiram redirecionamentos e passaram o conteúdo da página resolvida para o juiz.

Um juiz LLM pontuou os critérios semânticos uma linha, gap ou critério por vez, com base em regras de aprovação ou reprovação, e nunca atribuiu uma classificação de qualidade geral. Nossos analistas construíram as chaves de respostas, e o juiz as aplicou.

A análise competitiva adiciona uma etapa humana. Um modelo pode relatar um gap real que a chave não lista, então essas descobertas vão para um analista, que as credita somente após verificar ambos os sites.

Perguntas frequentes

Marketing agentic envolve o uso de agentes alimentados por IA para planejar e completar tarefas de marketing de várias etapas com mínima intervenção humana. Esses agentes usam dados de clientes, regras de negócios, contexto em tempo real e instruções em linguagem natural para tomar decisões ao longo dos fluxos de trabalho de marketing.

A automação de marketing tradicional executa regras predefinidas, como enviar um e-mail após o envio de um formulário ou mover um lead entre segmentos de audiência. Sistemas agentic podem interpretar um objetivo de negócio, selecionar as ferramentas necessárias, concluir a configuração da campanha, monitorar o desempenho da campanha e ajustar ações para otimizar o desempenho.

Uma plataforma de marketing agentic pode apoiar tarefas como:
– analisar o comportamento do cliente e identificar segmentos de audiência;
– adaptar jornadas do cliente com base em novos sinais;
– alocar gastos com anúncios entre campanhas de marketing;
– gerar conteúdo dentro das diretrizes da marca;
– coordenar fluxos de trabalho criativos e preservar a direção criativa;
– produzir insights gerados por IA para otimização de jornada;
– mover dados entre ferramentas desconectadas em uma nuvem de marketing;
– atribuir tarefas específicas a múltiplos agentes.

As três tarefas testam capacidades diferentes.

A análise competitiva recompensa pesquisa comparativa, julgamento semântico e verificação cuidadosa de ausência.

A preparação de lista de contas recompensa pesquisa web sustentada, qualificação repetida, resolução de entidades e controle exato da saída.

O deck de vendas recompensa a leitura das posições públicas de uma pessoa e a conexão delas com o trabalho publicado, dentro de um formato de arquivo que precisa sobreviver ao PowerPoint.

Um modelo pode lidar com uma comparação curta e falhar em terminar um arquivo estruturado grande. GLM 5.2 pontuou 80 e 76.1 nas duas primeiras tarefas e depois não produziu deck algum. Sonnet 5 fez o inverso: seu arquivo de análise competitiva quebrou uma regra de formatação e pontuou zero, e seu deck ficou em terceiro lugar.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sıla Ermut and Berk Kalelioğlu (2026) - "Benchmark AIM Agentic Marketing". Publicado on-line em AIMultiple.com. Acessado em 5 Agosto 2026, em: https://aimultiple.com/agentic-marketing [Recurso on-line]

Ermut, S., & Kalelioğlu, B. (2026, 5 Agosto). Benchmark AIM Agentic Marketing. AIMultiple. https://aimultiple.com/agentic-marketing

@misc{ermut2026,
  author = {Ermut, Sıla and Kalelioğlu, Berk},
  title  = {{Benchmark AIM Agentic Marketing}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-marketing}},
  note   = {AIMultiple. Acessado em 5 Agosto 2026}
}
Sıla Ermut
Sıla Ermut
Analista do Setor
Sıla Ermut é analista do setor na AIMultiple com foco em marketing por email e vídeos de vendas. Anteriormente, trabalhou como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Ver perfil completo
Pesquisado por
Berk Kalelioğlu
Berk Kalelioğlu
Pesquisador de IA
Berk é um Pesquisador de IA na AIMultiple, com foco em sistemas de IA agentiva e modelos de linguagem.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450