Serviços
Contate-nos

AIM Benchmark de Marketing Agentic

Sıla Ermut
Sıla Ermut
atualizado em 17 jul. 2026

Estamos apresentando o AIM Benchmark de Marketing Agentic, que mede o desempenho de agentes na análise de lacunas competitivas e na preparação de listas de alvos ABM.

Testamos o desempenho de 11 modelos e medimos o desempenho de execução ponta a ponta:

Loading Chart

Resultados do benchmark de marketing agentic

As pontuações das tarefas são normalizadas em uma escala de 0 a 100.

  • Para análise competitiva, a pontuação é igual a: 100 × MAX(0, lacunas verificadas encontradas − lacunas incorretas) / 10
  • Para a preparação da lista de contas, a pontuação é a porcentagem dos 71 pontos de rubrica disponíveis obtidos pelo modelo.

A pontuação geral é a média aritmética das duas pontuações das tarefas, atribuindo peso igual a cada tarefa, apesar dos diferentes tamanhos de rubrica. Envios inválidos ou ausentes contam como zero no cálculo geral, embora a tabela os marque separadamente de envios válidos que por acaso obtêm zero.

Leia a metodologia para mais informações sobre a avaliação das tarefas.

Fable 5 ficou em primeiro lugar em ambas as tarefas

O Fable 5 alcançou a pontuação geral mais alta, com 75,15, sendo 70 na análise competitiva e 80,3 na preparação de lista de contas. Sua liderança veio de produzir o melhor resultado válido em ambos os fluxos de trabalho e evitar o zero que resulta de um envio inválido ou ausente.

As pontuações agregadas não revelam qual capacidade subjacente criou essa vantagem. Conformidade de formato, seleção de fontes, cobertura de pesquisa e aplicação repetida de regras poderiam todos contribuir; separá-los exigiria uma comparação em nível de critério dos arquivos de cada modelo.

GLM 5.2 ficou em segundo lugar com 68,05 e também ficou em segundo em ambas as tarefas. Fable 5 liderou por 10 pontos na análise competitiva e por 4,2 pontos na preparação de lista de contas.

Análise competitiva obteve pontuações mais baixas

Quando o envio inválido é incluído como zero, a pontuação média da análise competitiva é 40,9. Fable 5 liderou com 70, enquanto as pontuações válidas variaram de 30 a 70.

Esses números precisam ser interpretados em conjunto com a fórmula de pontuação. Como a tarefa usa dez lacunas esperadas, cada descoberta adicional líquida correta altera a pontuação em dez pontos. Um modelo que encontra seis lacunas válidas e nenhuma falsa obtém 60; um modelo que encontra sete lacunas válidas e adiciona uma alegação incorreta recebe o mesmo resultado.

A rubrica também descreve esta tarefa como um discriminador fraco entre modelos de fronteira. Seu valor principal está em separar sistemas mais fracos que perdem várias lacunas, adicionam alegações de ausência falsas ou falham no formato de saída exigido. Pequenas diferenças de pontuação perto do topo devem, portanto, receber menos peso do que falhas maiores ou envios inválidos.

Preparação de lista de contas forneceu mais resolução de pontuação

A tarefa de lista de contas usa uma rubrica de 71 pontos, o que produz resultados mais granulares. As pontuações válidas variaram de 32,4 a 80,3, e Fable 5 e GLM 5.2 excederam 70.

Sol, Terra, Sonnet 5 e Opus 4.8 formaram um grupo intermediário próximo, pontuando entre 66,2 e 69. Gemini 3.1 Pro retornou o envio válido mais baixo, com 32,4. Kimi K3 não produziu um resultado pontuado, enquanto MiniMax M3 falhou em uma condição estrutural obrigatória.

A média foi 51,5 após as execuções inválidas e ausentes serem convertidas para zero. Como o fluxo de trabalho exigia um mapa de cobertura e 100 contas qualificadas, a pontuação refletiu o desempenho em centenas de alegações e classificações individuais, em vez de uma lista curta de descobertas.

Desempenho variou de acordo com o fluxo de trabalho

Kimi K3 pontuou 60 na análise competitiva e não retornou uma lista de contas válida. Sonnet 5 mostrou o padrão inverso: sua saída de análise competitiva foi inválida, enquanto sua submissão de lista de contas pontuou 67,6.

Esses casos mostram por que os resultados em nível de tarefa são importantes. A análise competitiva enfatiza a comparação semântica e a verificação de ausência; a preparação da lista de contas impõe demandas mais pesadas em pesquisa contínua, resolução de entidades, gerenciamento de fontes e construção de arquivos.

Para equipes de marketing, a implicação prática é clara: escolha modelos com base no fluxo de trabalho que está sendo automatizado e, em seguida, teste-os em relação ao formato de saída exigido e ao padrão de evidência.

As tarefas da vida real usadas no benchmark

Essas tarefas de marketing agentic incluem estratégia e cobertura de conteúdo, crescimento e pesquisa de vendas. Cada uma exige pesquisa na web, validação de fontes, qualificação baseada em regras e saída estruturada.

Tarefa 1: Análise de lacunas competitivas

O modelo atua como um analista de estratégia comparando AIMultiple com outras plataformas de pesquisa e benchmarking.

O agente revisa ambos os sites e identifica ofertas que a outra plataforma fornece, mas que o AIMultiple não possui. As categorias válidas são arena, benchmark, evaluation_format, content, methodology, dataset e other.

A tarefa permite até dez lacunas. Cada linha do CSV contém a lacuna, sua categoria, uma explicação, uma página ativa que comprove a existência da oferta concorrente, as páginas do AIMultiple verificadas e uma pontuação de prioridade.

Quando o AIMultiple fornece uma oferta relacionada, o modelo deve nomeá-la e explicar a diferença restante. Apenas uma sobreposição ampla de categoria não estabelece equivalência.

Como pontuamos a tarefa

A chave de resposta oculta contém dez lacunas verificadas e um conjunto de alegações de ausência falsas conhecidas. Cada lacuna comprovada adiciona um a A_found, enquanto cada lacuna incorreta adiciona um a B_wrong. A pontuação é: MAX(0, A_found − B_wrong) / 10

Uma URL fabricada, inacessível ou sem suporte remove o crédito da lacuna relacionada e adiciona uma penalidade de precisão. Esse design torna a expansão especulativa da lista cara, pois adicionar uma alegação plausível pode reduzir a pontuação final.

A saída também deve passar por verificações estruturais em nível de execução. O CSV precisa ter o nome de arquivo e as colunas corretos, entre 1 e 10 linhas, valores de categoria aceitos, domínios válidos, células atômicas e ordem decrescente de prioridade. A falha em qualquer verificação torna o envio inválido.

Tarefa 2: Preparação de lista de contas de melhor ajuste

O modelo atua como um profissional de marketing de crescimento preparando uma lista de marketing baseado em contas para o AIMultiple.

O trabalho começa com um mapa de cobertura das páginas ativas do AIMultiple. O agente registra páginas de categoria, benchmarks e páginas de comparação de fornecedores, bem como fornecedores mencionados nos corpos dos artigos e nas divulgações de patrocinadores.

Em seguida, prepara uma lista priorizada de 100 contas. Cada empresa deve ser um fornecedor de tecnologia B2B com receita anual entre US$ 100 milhões e US$ 1 bilhão, com sede nos EUA, Europa ou Israel, e ativa em uma categoria coberta pelo AIMultiple. A empresa também precisa de um sinal de marketing de crescimento atual e pelo menos uma página do AIMultiple onde ela represente uma oportunidade comercial genuína.

O arquivo de contas registra o domínio da empresa, página do LinkedIn, sede, categoria, receita e fonte, número de funcionários, ano de fundação, status de financiamento ou propriedade, páginas relevantes do AIMultiple, sinal de marketing e pontuação de adequação.

Empresas-mãe e subsidiárias não podem ambas aparecer para a mesma oportunidade de fornecedor. As regras também excluem empresas de serviços, negócios de consumo, empresas de análise ou avaliação, e candidatos que não atendem aos requisitos de receita ou sede.

Como pontuamos a tarefa

A rubrica contém 71 pontos distribuídos em sete seções. A seção do mapa de cobertura verifica se o modelo revisou pelo menos 30 páginas ativas do AIMultiple e incluiu todos os tipos de página exigidos. Os avaliadores amostram linhas para confirmar que os fornecedores nomeados e as divulgações de patrocinadores correspondem às páginas ativas.

A seção do arquivo de contas exige exatamente 100 domínios distintos, as colunas especificadas, classificações aceitas, pontuações de adequação em ordem decrescente e campos de evidência completos. Uma amostra fixa de 20 contas é então usada para verificações detalhadas que cobrem receita, identidade no LinkedIn, sede real, adequação de categoria, evidência de marketing de crescimento e status de fornecedor B2B.

Outras seções testam se as páginas propostas são oportunidades genuínas, penalizam contas desqualificadas ou fabricadas, recompensam a inclusão de empresas verificadas de alto ajuste e verificam se os modelos evitam erros conhecidos por pouco.

Um arquivo de contas ausente, colunas incorretas ou qualquer contagem de linhas diferente de 100 torna a execução inválida.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Metodologia do benchmark de marketing agentic

Construímos ambos os benchmarks a partir de fluxos de trabalho usados por nossas equipes de estratégia e crescimento.

A tarefa de análise competitiva apoia decisões sobre cobertura de produtos, prioridades de conteúdo e posicionamento. A tarefa de lista de contas apoia o marketing baseado em contas e a pesquisa de vendas.

Para cada fluxo de trabalho, criamos um arquivo de tarefa que define:

  • o papel do modelo
  • ferramentas disponíveis
  • requisitos de evidência
  • regras de qualificação
  • saídas exigidas
  • limite de tempo

Projetamos as tarefas com base em nossas próprias páginas e fluxos de trabalho comerciais, e nossos dados fazem parte da chave de resposta. Isso torna a evidência mais fácil de verificar, embora também limite a generalização dos resultados para outras empresas e ambientes de marketing.

Instruções da tarefa e rubricas de pontuação

Para análise competitiva, os modelos podiam pesquisar a web ao vivo através do Bright Data MCP. Desabilitamos a execução de código e definimos um limite de 90 minutos.

Para a preparação da lista de contas, os modelos usaram o mesmo acesso à web, com execução de código habilitada. Permitimos até 240 minutos porque a tarefa exigia dois arquivos de saída e 100 contas qualificadas.

Demos a cada modelo as instruções da tarefa e o esquema de saída, mantendo a rubrica de pontuação oculta.

Modelos tiveram que usar fontes atuais

Ambas as tarefas dependem de informações que mudam com o tempo, incluindo ofertas de sites, inventários de benchmarks, páginas de produtos, receita da empresa, sede, propriedade, divulgações de patrocinadores e atividade de marketing.

Contamos uma URL quando ela resolvia e sustentava a alegação associada. Uma página inicial da empresa não poderia sustentar um valor específico de receita, e um banco de dados genérico de marketing não poderia provar que uma plataforma oferecia um formato específico de benchmark. Verificamos as chaves de resposta pela última vez em 7 de julho de 2026.

As saídas foram projetadas para uso operacional

Ambas as tarefas exigem arquivos CSV com colunas fixas e células atômicas. Esse formato nos permite verificar automaticamente campos ausentes, duplicatas, categorias inválidas, domínios sem suporte, contagens de linhas incorretas, valores malformados e erros de ordenação.

Também reflete como as equipes de marketing usam essas saídas. Listas de contas e análises competitivas muitas vezes vão para planilhas, fluxos de trabalho de CRM, bancos de dados internos ou ferramentas de automação. Um arquivo estruturalmente inválido pode bloquear a próxima etapa mesmo quando partes da pesquisa estão corretas.

Relatamos pontuações de execução única sem variância

Os resultados incluem uma pontuação relatada por modelo. Atualmente, não relatamos execuções repetidas, sementes, intervalos de confiança ou barras de erro.

Os leitores devem, portanto, tratar pequenas diferenças de pontuação com cautela. Na análise competitiva, uma lacuna correta líquida adicional altera a pontuação em dez pontos. Na preparação da lista de contas, algumas linhas amostradas podem determinar se um critério inteiro baseado em limiar é aprovado.

Combinamos verificações determinísticas com um juiz LLM

Scripts determinísticos trataram de tudo que o software pode resolver diretamente: existência do arquivo, parsing de CSV, ordem das colunas, contagens de linhas, valores aceitos, domínios de URL, duplicatas e ordenação. Os scripts também buscaram cada URL citada, seguiram redirecionamentos e passaram o conteúdo da página resolvida para o juiz.

Um juiz LLM pontuou os critérios semânticos, se duas ofertas são equivalentes, se uma alegação de ausência se sustenta, se uma empresa se encaixa em uma categoria, se uma página buscada sustenta a alegação associada a ela e se uma página proposta é uma oportunidade genuína.

O juiz pontuou uma linha ou uma lacuna por vez em relação às regras de aprovação ou reprovação da rubrica, e os scripts agregaram esses julgamentos nos critérios de limiar (por exemplo, ≥18 de 20 linhas amostradas). Ele nunca atribuiu uma classificação geral de qualidade. Nossos próprios analistas construíram e congelaram a chave de resposta: as contas de ouro, as armadilhas e as transcrições de divulgação de patrocinadores, em 7 de julho de 2026; o juiz aplicou essa chave em vez de formar sua própria visão do que deveria contar.

Isso nos permitiu pontuar dois arquivos longos e ricos em evidências, mas traz um risco: um juiz pode aceitar uma fonte que leu de forma muito generosa, que é o mesmo modo de falha que a rubrica penaliza nos modelos. Esses resultados usam uma única passagem de julgamento, sem verificação de concordância entre múltiplos juízes e sem calibração em relação a uma amostra pontuada por humanos.

Perguntas frequentes

O marketing agentic envolve o uso de agentes com tecnologia de IA para planejar e concluir tarefas de marketing de várias etapas com mínima intervenção humana. Esses agentes usam dados de clientes, regras de negócios, contexto em tempo real e instruções de linguagem natural para tomar decisões ao longo dos fluxos de trabalho de marketing.

A automação de marketing tradicional executa regras predefinidas, como enviar um e-mail após o envio de um formulário ou mover um lead entre segmentos de público. Os sistemas agentic podem interpretar um objetivo de negócio, selecionar as ferramentas necessárias, concluir a configuração da campanha, monitorar o desempenho da campanha e ajustar as ações para otimizar o desempenho.

Uma plataforma de marketing agentic pode suportar tarefas como:
– analisar o comportamento do cliente e identificar segmentos de público;
– adaptar as jornadas do cliente com base em novos sinais;
– alocar gastos com anúncios em campanhas de marketing;
– gerar conteúdo dentro das diretrizes da marca;
– coordenar fluxos de trabalho criativos e preservar a direção criativa;
– produzir insights gerados por IA para otimização de jornadas;
– mover dados entre ferramentas desconectadas em uma nuvem de marketing;
– atribuir tarefas específicas a múltiplos agentes.

A análise de lacunas competitivas exige evidências de ambos os lados de cada descoberta. O modelo deve confirmar que a plataforma concorrente fornece uma oferta específica. Em seguida, deve inspecionar as páginas relevantes do AIMultiple e determinar se existe um equivalente.

O segundo passo exige uma exploração mais ampla do site. Evidências relevantes podem aparecer em uma página de benchmark, uma página de categoria, um artigo, uma página de ferramenta ou uma entrada de mapa do site.

A similaridade semântica acrescenta outro desafio. Duas ofertas podem abordar o mesmo mercado amplo, mas usando diferentes formatos de avaliação ou metodologias. O agente deve decidir se a diferença cria uma lacuna significativa.

A rubrica também penaliza descobertas especulativas. Um comportamento de pesquisa amplo pode melhorar a revocação e aumentar o número de alegações de ausência falsas. Um comportamento conservador pode proteger a precisão e perder lacunas esperadas.

As duas tarefas testam diferentes combinações de capacidades. A análise competitiva requer pesquisa comparativa, julgamento semântico e verificação cuidadosa da ausência.

A preparação da lista de contas requer pesquisa sustentada na web, qualificação repetida, resolução de entidades, gerenciamento de fontes e controle exato da saída.

Um modelo pode ter um bom desempenho em uma tarefa de comparação curta, mas falhar ao concluir um arquivo grande e estruturado. Outro modelo pode lidar com pesquisa repetida de contas e falhar em uma verificação estrutural na análise competitiva.

A seleção de modelos para marketing agentic deve, portanto, considerar os fluxos de trabalho de marketing específicos que uma equipe planeja automatizar.

Veja mais dos nossos benchmarks e insights baseados em dados na Pesquisa Google.
GoogleAdicionar como fonte preferencial

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sıla Ermut and Berk Kalelioğlu (2026) - "AIM Benchmark de Marketing Agentic". Publicado on-line em AIMultiple.com. Acessado em 17 Julho 2026, em: https://aimultiple.com/agentic-marketing [Recurso on-line]

Ermut, S., & Kalelioğlu, B. (2026, 17 Julho). AIM Benchmark de Marketing Agentic. AIMultiple. https://aimultiple.com/agentic-marketing

@misc{ermut2026,
  author = {Ermut, Sıla and Kalelioğlu, Berk},
  title  = {{AIM Benchmark de Marketing Agentic}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/agentic-marketing}},
  note   = {AIMultiple. Acessado em 17 Julho 2026}
}
Sıla Ermut
Sıla Ermut
Analista do Setor
Sıla Ermut é analista do setor na AIMultiple com foco em marketing por email e vídeos de vendas. Anteriormente, trabalhou como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Ver perfil completo
Pesquisado por
Berk Kalelioğlu
Berk Kalelioğlu
Pesquisador de IA
Berk é um pesquisador de IA no AIMultiple, com foco em sistemas de IA agentivos e modelos de linguagem.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450