Benchmark de VC com IA: 16 agentes de IA na identificação de clientes
A identificação de clientes faz parte da due diligence comercial. Testamos 16 modelos em pesquisas de listas de clientes para três sites de pesquisa e avaliação, um deles o AIMultiple, pontuando suas submissões em relação às chaves de resposta que compilamos e às páginas citadas.
Resultados do benchmark de identificação de clientes
Não definimos esforço de raciocínio para nenhum modelo. Cada um rodou com o padrão do seu programa agente, e o modelo de pontuação foi chamado com temperatura 0.
- Fable 5.1 pontua 90.2, a média mais alta entre os 16 modelos. O Opus 5 vem em seguida com 89.1 e o GLM 5.3 com 81.0.
- GLM 5.3 pontuou entre 79.6 e 83.3 nos três alvos. Claude Sonnet 5 pontuou 90.8 em um e 0.0 em outro, e o Gemini 3.8 Flash pontuou 87.0 e 9.2. Médias de 48.0 e 60.7 não descrevem as execuções de nenhum dos dois modelos.
Dificuldade dos alvos
As pontuações medianas são 64.3 no primeiro alvo, 59.2 no segundo e 87.0 no terceiro. Dez dos 16 modelos pontuam pelo menos 84 no terceiro, cuja chave de resposta tem 18 clientes, então um cliente correto vale 5.6 dos 100 pontos de cobertura que representam metade da pontuação.
A pontuação de cada modelo é a média dos três alvos. Descartar um alvo fácil depois de ver as pontuações enviesaria a comparação. A próxima rodada precisa de empresas-alvo mais difíceis.
Comparação de custo e pontuação
- Fable 5.1 tem média de 90.2 a $4,38 por tarefa. O Opus 5 tem média de 89.1 a $8,51, o custo mais alto entre os 15 modelos com valores em dólar. O GLM 5.3 tem média de 81.0 a $1.40.
- Grok 4.6 tem média de 80.5 a $0,42 por tarefa, um vigésimo do que o Opus 5 custa por 8.6 pontos a menos.
- O GPT 6 Astra tem média de 74.2. Suas três tarefas de assinatura usaram 279.253 tokens, e o Codex CLI não registra custo em dólar, então o gráfico de custo o omite.
Por que o trabalho com listas de clientes testa agentes de IA?
Uma lista de clientes exige um nome e evidências da relação comercial. Uma lista plausível ainda pode citar páginas que apenas comparam produtos.
Fontes públicas podem confirmar a relação com um cliente individual. Este benchmark não testa se uma lista está completa.
Um cliente genuíno pode estar ausente da chave de resposta. Uma submissão ganha crédito por um cliente quando a página citada estabelece a relação e perde pontos de cobertura por uma empresa extra sem suporte.
Metodologia
Cobertura de modelos
O gráfico de pontuação usa os 16 modelos selecionados para esta campanha de benchmark. Cinco modelos substituídos permanecem nos dados históricos e não são exibidos no gráfico. As pontuações vão de 0 a 100 e os rótulos das barras arredondam para pontos inteiros.
O benchmark de TI agêntica usa uma escala diferente, portanto suas pontuações não são comparáveis.
Tarefas e submissões
O primeiro alvo é o AIMultiple, publicador deste benchmark, e sua chave de resposta foi compilada por um analista do AIMultiple. O segundo alvo é um site de avaliação de software e o terceiro, uma empresa de pesquisa de analistas.
As três chaves de resposta contêm 45, 65 e 18 clientes e foram ocultadas dos modelos testados. A execução abrange 48 atribuições modelo-empresa e 47 listas de clientes não vazias; o Inkling Small não produziu linhas de clientes na segunda empresa e pontuou zero nela.
Cada pontuação usa uma submissão por empresa. As submissões abrangem de julho a setembro, e algumas substituem tentativas anteriores.
Reponderar os três alvos em todas as 27 extrações ordenadas com reposição coloca os 95% centrais das médias do Fable 5.1 entre 86.0 e 94.8 e as do Opus 5 entre 82.4 e 96.1, portanto o intervalo do Fable 5.1 cai dentro do intervalo do Opus 5. Reponderamos apenas esses três alvos e não medimos a variação entre execuções.
Custos e execução
O custo por tarefa é a média das três execuções de um modelo, incluindo a execução que não produziu linhas de clientes. Uma tarefa é uma empresa-alvo. Os custos em dólar cobrem 15 dos 16 modelos, e os dados de tempo decorrido cobrem 13.
Os valores em dólar não são todos medidos da mesma forma. As execuções no opencode carregam a cobrança do OpenRouter daquela sessão. As execuções no Claude Code e no Grok Build autenticam por assinatura, portanto seus valores são preços de tabela aplicados aos tokens que o programa relatou. O Codex CLI não registra custo em dólar.
Cada modelo recebeu um prompt congelado indicando o nome da empresa e solicitando um CSV com nomes de empresas, URLs do LinkedIn, URLs de evidências e datas de evidências. O Grok Build usou busca nativa na web; os outros programas agente acessaram a web por meio da Bright Data, uma das ferramentas de web scraping que comparamos.
Um programa agente dá ao modelo um shell e acesso à web, portanto uma pontuação reflete tanto o modelo quanto o programa em que ele rodou. Os preços de tabela dos provedores estão em nossa comparação de preços de LLM.
Pontuação e evidências
A cobertura de clientes vale 50% da pontuação, a precisão do LinkedIn 17%, a qualidade das evidências 17% e a atualidade das evidências 16%.
A pontuação foi executada em 10 de setembro de 2026. Ela aceita evidências datadas de 10 de setembro de 2025 a 12 de setembro de 2026, os 12 meses anteriores à pontuação mais dois dias. Uma URL citada que retorne 404 ou 410 limita essa submissão a 40, e nenhuma submissão atingiu o limite nesta passagem.
O código verifica formatação, nomes, duplicatas, datas e status da URL. O Claude Sonnet 5 lê um trecho de cada página citada e julga se ele confirma a relação. O Claude Sonnet 5 também é um dos 16 modelos pontuados, e os modelos da Anthropic ocupam as duas primeiras posições. Não testamos se um juiz da Anthropic favorece os modelos da Anthropic.
O prompt do juiz informa se a empresa está na chave de resposta, portanto o veredito do juiz não é independente da chave. Executamos novamente o avaliador com uma empresa removida de uma chave e, na mesma página e no mesmo trecho, o veredito mudou de cliente para menção.
A equipe do benchmark registrou uma decisão no lugar do veredito do juiz em 58 linhas, 30 contra o modelo e 28 a favor dele. Cinquenta e quatro vêm de uma revisão em 9 de setembro de 2026 do texto retido da página, e quatro são decisões editoriais registradas em 10 de setembro.
A avaliação aceita 140 linhas fora das chaves de resposta, 125 delas no segundo alvo. As linhas com suporte ganham os mesmos pontos que as entradas da chave.
Leituras adicionais
- Benchmark AIM de Marketing Agêntico
- Negociação de ações baseada em IA: qual ferramenta de IA generativa é melhor?
- Benchmark de Finanças com IA Agêntica
Perguntas frequentes
Este teste verificou relações individuais com clientes a partir de evidências públicas. Ele não avaliou se uma lista está completa.
Uma comparação isolada não estabelece. Uma página também deve estabelecer uma relação comercial, como um cliente nomeado ou um assinante dos serviços da empresa de pesquisa.
Os valores de cobertura vêm da chave de resposta. O juiz verifica a página que um modelo citou, portanto uma submissão ganha crédito por clientes com suporte fora da chave.
O teste cobre a pesquisa de listas de clientes. Ele não avalia a seleção de investimentos, a avaliação de ativos nem a qualidade das decisões de um fundo.
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{Benchmark de VC com IA: 16 agentes de IA na identificação de clientes}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Acessado em 10 setembro 2026}
}Resultados e carimbos de data/hora de 13 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo um arquivo CSV e um README.
Quer os dados granulares por trás disso? Assine o Premium
Registro de alterações
1 atualizaçõesSubstituiu o benchmark de deal sourcing e mapeamento de concorrentes por um benchmark de identificação de clientes com 14 agentes.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.