Serviços
Contate-nos

Benchmark de IA e VC: 11 agentes de IA em tarefas reais de capital de risco

Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
atualizado em 19 jul. 2026

Em parceria com VCs em estágio inicial, convertemos dois fluxos de trabalho de analistas em benchmarks com verdade absoluta verificada por humanos e pontuamos 11 agentes de IA neles. Veja as tarefas, os resultados e o método de pontuação:

Resultados do benchmark de capital de risco

Loading Chart

Cada um dos 11 modelos executou cada tarefa uma vez. As pontuações são de 0 a 100. O Kimi K3 não produziu nenhuma execução pontuável de sourcing de negócios e foi registrado como 0.

Ambas as tarefas exigem acesso a dados recentes e habilidades de raciocínio:

  • Deal sourcing: VCs têm critérios específicos e nossos parceiros queriam identificar empresas de IA em estágio inicial fundadas por empreendedores de um país específico
  • Identificação de concorrentes durante a due diligence

Resultados do sourcing de negócios da diáspora

A maioria dos participantes conseguiu metade dos pontos e ficou em uma ampla faixa intermediária, com uma grande diferença entre o líder e o final da tabela. A rubrica explica o formato. Uma linha ganha pontos quando cada critério possui evidência, então um agente pontua no ritmo em que pode verificar a origem do fundador, o ano de fundação e o financiamento, não no ritmo em que pode listar nomes plausíveis. As empresas qualificadas foram fundadas nos últimos 18 meses, o que as coloca fora do alcance dos dados de treinamento, de modo que a dispersão reflete a profundidade da pesquisa e a disciplina de verificação, em vez de conhecimento memorizado. Mesmo o agente líder deixou uma parcela substancial dos pontos na mesa, o que significa que a recuperação completa de um conjunto de referência recente, restrito a evidências, permanece fora do alcance dos agentes atuais que trabalham sob um orçamento de tempo.

Resultados do mapeamento de concorrentes

A distribuição é dividida em três camadas, cada uma mapeada para um mecanismo de pontuação. A dupla superior cobriu várias das categorias de concorrentes do alvo e capturou parte do grupo de pares próximos. A faixa intermediária é o que a rubrica produz quando um agente mapeia bem os nomes conhecidos de analistas e análises e perde os pares pequenos e recentes mais próximos do alvo: uma execução sólida, penalizada duas vezes, por pontos de recall perdidos e por penalidades por omissão. A extremidade inferior, quase zero, é a mais instrutiva, porque uma pontuação tão baixa não exige um arquivo vazio. Penalidades por pares ausentes e por não concorrentes retornados podem anular tudo o que um CSV arrumado ganha, de modo que um mapa confiante e bem formatado das empresas erradas acaba valendo o mesmo que nenhum mapa.

Por que os resultados das duas tarefas divergem

O sourcing recompensa a verificação mecânica de cinco critérios declarados; o mapeamento de concorrentes exige um julgamento sobre onde termina o mercado de uma empresa de pesquisa de nicho, sem uma lista de critérios para verificação. Esse julgamento separou os participantes muito mais do que a formatação ou a velocidade, e é a razão pela qual o líder mudou entre colunas enquanto vários agentes trocaram de posição abruptamente. A força em um fluxo de trabalho de pesquisa diz pouco sobre o próximo, então as equipes que selecionam um agente devem testá-lo no fluxo de trabalho que planejam automatizar, em vez de se basear em uma única tabela de classificação.

Metodologia do benchmark de capital de risco

Cada tarefa é fornecida como um arquivo de especificação que elaboramos, o qual fixa o papel do analista, o arquivo de saída, o acesso às ferramentas e o orçamento de tempo antes de qualquer execução começar. A tabela resume essas especificações:

O limite de tempo limita cada execução: um agente deve pesquisar, verificar e entregar seu CSV dentro desse prazo, e o sourcing de negócios recebe o orçamento maior porque verifica dezenas de empresas candidatas contra cinco critérios, enquanto o mapeamento de concorrentes investiga um único alvo.

Ambos colocam o agente no papel que um analista júnior ocupa em um fundo de capital de risco, e ambos exigem um CSV com células atômicas, URLs de origem resolvidas e sem comentários. Todos os fatos são julgados a partir de uma data de retrato congelada, e os conjuntos de referência são verificados novamente a cada trimestre porque os dados de financiamento mudam.

Tarefa 1: Sourcing de negócios da diáspora

O agente atua como analista de sourcing de negócios em um fundo em estágio inicial focado em fundadores da diáspora turca. Ele deve retornar empresas de IA que atendam a todos estes critérios de investimento na data do retrato:

  • Financiamento abaixo de US$ 5M. Capital total divulgado captado, não uma avaliação ou valor de receita. Se o financiamento não for divulgado, a empresa se qualifica se evidências positivas mostrarem que o montante está abaixo do limite. Caso contrário, deve ser excluída.
  • Fundada em 2025 ou 2026. Qualquer ano anterior falha.
  • Origem do fundador com evidência pública. Pelo menos um fundador nasceu na Turquia, foi educado em uma instituição turca ou nasceu de pais turcos. Um sobrenome que soa turco não é evidência.
  • Sede no exterior. A própria empresa está fora da Turquia.
  • Focada em IA. Empresas de camada de infraestrutura e de camada de aplicação se qualificam.

Cada linha associa cada número a uma URL de origem que o agente abriu. Uma URL fabricada ou inacessível invalida a linha que apoia.

Como é pontuado

A pontuação é feita contra uma verdade absoluta oculta: um conjunto de referência de empresas qualificadas verificadas que o modelo nunca vê. Quatro dimensões se aplicam:

  • Recall em relação a um conjunto de referência verificado de empresas qualificadas.
  • Precisão em relação a um conjunto de armadilhas de quase acertos, cada uma falhando exatamente em um critério. Desqualificadores nomeados carregam penalidades fixas.
  • Precisão dos dados em uma amostra aleatória fixa de linhas extraídas com uma semente registrada, de modo que uma passagem de pontuação possa ser reproduzida: sede, ano de fundação, financiamento dentro da tolerância e fontes que apoiam a alegação ao lado delas.
  • Conformidade de formato: ordem das colunas, células atômicas, financiamento numérico, CSV válido.

Preencher uma lista com empresas plausíveis mas não verificadas perde mais em precisão do que ganha em recall. O design recompensa menos linhas, totalmente verificadas.

Tarefa 2: Mapeamento de concorrentes

O agente realiza due diligence comercial em uma empresa-alvo para um potencial investidor. Para a execução pontuada, direcionamos os agentes para nossa própria empresa: o alvo é o próprio AIMultiple, o que nos permitiu verificar a verdade absoluta com conhecimento em primeira mão de quem compete conosco. A tarefa: identificar os concorrentes diretos do alvo, evidenciar cada um com dados públicos e retorná-los como um documento CSV.

As regras de escopo definem o que conta como concorrente:

  • Substituibilidade. Uma empresa se qualifica quando oferece um produto ou serviço substituível para clientes sobrepostos, em qualquer categoria onde o alvo compete.
  • Cobertura total de categorias. O alvo opera em várias categorias. O agente deve cobrir concorrentes em cada uma delas, não apenas na mais óbvia.
  • Exclusões. Empresas sobre as quais o alvo escreve, com as quais faz parceria ou lista, mas não compete. Players adjacentes em uma categoria vizinha. O próprio alvo.

Um mapa completo para um alvo dessa amplitude varia de 8 a 15 concorrentes. Cada linha inclui a página do LinkedIn do concorrente, financiamento total divulgado (ou Não Divulgado), país da sede, ano de fundação e número de funcionários no LinkedIn, com uma URL de origem ao lado de cada métrica. Duas colunas de raciocínio ficam ao lado das métricas: um diferencial em relação ao alvo e uma justificativa para inclusão, cada uma exigida para ser específica, não genérica. Um valor de financiamento deve ser apoiado por uma fonte de financiamento.

Como é pontuado

A pontuação é feita contra uma verdade absoluta oculta, organizada por categoria de concorrente. Cinco dimensões se aplicam:

  • Precisão. Cada não concorrente retornado reduz a pontuação. Desqualificadores nomeados, como ferramentas de SEO e fornecedores de modelos de IA, que o alvo apenas usa como referência, carregam penalidades fixas. Um protetor suave contra preenchimento reduz o peso excessivo quando uma única categoria representa a maior parte do conjunto encontrado. Os concorrentes têm dois níveis de peso. Um pequeno conjunto de pares imperdíveis, as empresas mais próximas do trabalho principal do alvo, pesam três vezes uma entrada padrão. Um concorrente genuíno ausente da verdade absoluta ainda ganha crédito após revisão de especialistas, de modo que um conjunto de referência incompleto não penaliza um achado correto.
  • Penalidades graduadas. Independentemente do peso do recall, cada par imperdível que o agente não retornar subtrai uma penalidade fixa dimensionada pela proximidade. Perder os pares mais próximos do alvo é tratado como uma falha central de due diligence, não como uma lacuna de recall de rotina.
  • Precisão do financiamento. Linhas amostradas verificadas dentro da tolerância, com Não Divulgado e N/A (público) aceitos como respostas corretas quando aplicáveis.
  • Evidência de métricas e raciocínio. Métricas exigidas presentes, atômicas, com fontes e precisas dentro da tolerância. As células de diferencial e justificativa são pontuadas pela especificidade em relação ao genérico.
Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Por que os critérios resistem ao reconhecimento de padrões

Ambas as tarefas são construídas para bloquear os atalhos que os agentes tomam sob pressão de tempo:

  • Adivinhar falha. Onde um valor não é público, a resposta pontuada é uma lacuna evidenciada, não uma estimativa. Um número inventado custa pontos duas vezes, uma na precisão e outra na exatidão, então admitir o desconhecido supera preenchê-lo.
  • As respostas estão além da primeira página de busca. Ambos os conjuntos de referência contam com empresas jovens ou pouco documentadas que os dados de treinamento não alcançaram, de modo que as pontuações dependem de pesquisa ao vivo e em camadas, não de recall.
  • Evidência supera inferência. Um sinal plausível, um nome que soa familiar ou uma página de alta classificação não estabelece um fato; um registro citável sim. Ambas as rubricas pontuam a fonte ao lado da alegação, não a alegação por si só.
  • Completude e precisão puxam uma contra a outra. Preencher com nomes não verificados custa mais do que ganha, enquanto uma lista excessivamente cautelosa perde recall. A pontuação empurra os agentes em direção ao equilíbrio que um fundo espera de um analista: cada descoberta verificada, nenhuma descoberta genuína omitida.

Construindo as tarefas

Cada benchmark começou como um fluxo de trabalho real dentro de nossas operações de desenvolvimento de negócios e pesquisa. Convertemos as especificações originais dos analistas em arquivos de tarefa com uma estrutura fixa: papel, regras de elegibilidade, colunas de saída exatas, acesso a ferramentas e um limite de tempo. As rubricas ficam em arquivos separados com pontos por critério: formato e aritmética passam por verificações automatizadas, e as decisões de julgamento vão para um revisor humano.

Três regras de design aplicadas em ambas as tarefas:

  • Todo número precisa de uma fonte que o agente abriu. Páginas iniciais simples e páginas de resultados de busca não contam.
  • Não divulgado supera inventado. Escrever Não Divulgado para uma rodada privada de pré-seed pontua; inventar um número custa pontos duas vezes, uma pela precisão e outra pela exatidão.
  • Saída atômica. Um valor por célula, ordem exata das colunas. Violações de estrutura custam pontos antes que o conteúdo seja julgado.

Controle de vazamento

As primeiras execuções nos ensinaram a lição mais importante em metodologia. Quando o arquivo de rubrica estava acessível a partir do diretório de trabalho do modelo, o modelo o leu e copiou a verdade absoluta. As pontuações subiram por razões não relacionadas à capacidade de pesquisa.

Toda rubrica agora carrega um requisito de isolamento de harness: o modelo recebe o arquivo de prompt, e nada mais, e o avaliador aplica a rubrica depois. Qualquer execução em que a rubrica estava acessível é tratada como inválida. Os construtores de benchmarks que ignorarem esse controle superestimarão o que seus agentes podem fazer.

O que as rubricas medem

As rubricas compartilham uma filosofia de pontuação em ambas as tarefas:

  • Recall em relação à verdade absoluta verificada. Cada empresa ou concorrente qualificado no conjunto de referência foi confirmado por um pesquisador humano contra registros públicos antes que qualquer modelo fosse pontuado.
  • Precisão com armadilhas nomeadas. Ambos os conjuntos de verdade absoluta carregam quase acertos que falham exatamente em um critério e são desqualificadores nomeados com penalidades fixas, de modo que o reconhecimento de padrões sem verificação é pego.
  • Pontos negativos por fabricação. Um valor de financiamento alucinado ou uma URL de origem inativa subtrai pontos em vez de pontuar zero. Lacunas honestas superam erros confiantes.
  • Gestão de deriva. Financiamento, avaliações e número de funcionários mudam. Cada rubrica carrega uma data de retrato, marca dados propensos a deriva e exige reverificação antes de cada passagem de pontuação.
  • Verificação mista. Recall, precisão e verificações de formato são executadas automaticamente. Evidência de origem do fundador e justificativas de inclusão vão para um revisor humano.

Pontuações baixas vêm de tornar a tarefa genuinamente difícil, não de esmagar boas respostas com limites. Recall, precisão, exatidão e honestidade cada uma puxa um modo de falha diferente, de modo que um modelo não pode compensar uma pesquisa fraca com formatação confiante.

Veja mais dos nossos benchmarks e insights baseados em dados na Pesquisa Google.
GoogleAdicionar como fonte preferencial

Por que o trabalho de capital de risco testa bem os agentes de IA

As empresas de capital de risco funcionam com trabalho de analista. A triagem de fluxo de negócios e a due diligence são tarefas de pesquisa em várias etapas. Cada uma requer pesquisa na web, verificação de fontes e saída estruturada. Cada uma também produz respostas erradas com aparência plausível, o que as torna difíceis de falsificar e úteis para pontuar.

Essas propriedades tornam o trabalho de analista de VC um domínio forte para benchmarks:

  • Verdade absoluta verificável. Rodadas de financiamento, anos de fundação e número de funcionários podem ser verificados contra registros públicos.
  • Pressão de fabricação. Modelos que não conseguem encontrar um valor tendem a inventar um. As tarefas expõem isso diretamente.
  • Valor econômico real. Um fundo que automatiza partes da due diligence muda sua própria estrutura de custos. O benchmark mede um trabalho pelo qual alguém paga hoje.

Leituras adicionais

Perguntas frequentes

Não. As tarefas correspondem ao trabalho que analistas juniores fazem: sourcing, mapeamento de concorrentes, comparáveis. Decisões de investimento, julgamento de parceiros e relacionamentos com fundadores estão fora de seu escopo. A IA comprime o tempo de pesquisa; os humanos tomam a decisão.

Empresas públicas têm finanças auditadas, o que torna a avaliação um exercício de consulta. Startups privadas em estágio inicial forçam o agente a estimar, declarar uma base e rotular a incerteza. É aí que a pressão de fabricação é mais alta e onde o verdadeiro esforço de due diligence é aplicado.

Esses benchmarks mostram a IA substituindo analistas de capital de risco?
Não. As tarefas correspondem ao trabalho que analistas juniores fazem: sourcing, mapeamento de concorrentes, comparáveis. Decisões de investimento, julgamento de parceiros e relacionamentos com fundadores estão fora de seu escopo. A IA comprime o tempo de pesquisa; os humanos tomam a decisão.
Por que as tarefas visam empresas privadas?
Empresas públicas têm finanças auditadas, o que torna a avaliação um exercício de consulta. Startups privadas em estágio inicial forçam o agente a estimar, declarar uma base e rotular a incerteza. É aí que a pressão de fabricação é mais alta e onde o verdadeiro esforço de due diligence é aplicado.

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Ezgi Arslan, PhD. and Berk Kalelioğlu (2026) - "Benchmark de IA e VC: 11 agentes de IA em tarefas reais de capital de risco". Publicado on-line em AIMultiple.com. Acessado em 19 Julho 2026, em: https://aimultiple.com/ai-vc [Recurso on-line]

PhD., E. A., & Kalelioğlu, B. (2026, 19 Julho). Benchmark de IA e VC: 11 agentes de IA em tarefas reais de capital de risco. AIMultiple. https://aimultiple.com/ai-vc

@misc{phd2026,
  author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
  title  = {{Benchmark de IA e VC: 11 agentes de IA em tarefas reais de capital de risco}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/ai-vc}},
  note   = {AIMultiple. Acessado em 19 Julho 2026}
}
Ezgi Arslan, PhD.
Ezgi Arslan, PhD.
Analista de Indústria
Ezgi possui um doutorado em Administração de Empresas com especialização em finanças e atua como Analista de Indústria na AIMultiple. Ela impulsiona pesquisas e insights na interseção entre tecnologia e negócios, com experiência em sustentabilidade, análise de pesquisas e sentimentos, aplicações de agentes de IA em finanças, otimização de mecanismos de resposta, gerenciamento de firewall e tecnologias de procurement.
Ver perfil completo
Revisado tecnicamente por
Berk Kalelioğlu
Berk Kalelioğlu
Pesquisador de IA
Berk é um pesquisador de IA no AIMultiple, com foco em sistemas de IA agentivos e modelos de linguagem.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450