Benchmark de IA para VC: 11 Agentes de IA em Tarefas Reais de Capital de Risco
Em parceria com VCs em estágio inicial, convertemos dois fluxos de trabalho de analistas em benchmarks com verdade de campo verificada por humanos e avaliámos 11 agentes de IA neles. Veja as tarefas, os resultados e o método de pontuação:
Resultados do benchmark de capital de risco
Cada um dos 11 modelos executou cada tarefa uma vez. As pontuações são em 100. Kimi K3 não produziu uma execução pontuável de prospeção de negócios e é registado como 0.
Ambas as tarefas exigem acesso a dados recentes e competências de raciocínio:
- Prospeção de negócios: Os VCs têm critérios específicos e os nossos parceiros queriam identificar empresas de IA em estágio inicial construídas por fundadores de um país específico
- Identificação de concorrentes durante a diligência devida
Resultados da prospeção de negócios da diáspora
A maior parte do campo obteve metade dos pontos e ficou numa ampla faixa intermédia, com uma grande diferença entre o líder e a cauda. A rubrica explica a forma. Uma linha ganha pontos quando cada critério tem evidência, portanto, um agente pontua ao ritmo a que consegue verificar a origem do fundador, o ano de fundação e o financiamento, não ao ritmo a que consegue listar nomes plausíveis. As empresas qualificadas foram fundadas nos 18 meses anteriores, o que as coloca além do alcance dos dados de treino, pelo que a dispersão reflete a profundidade da pesquisa e a disciplina de verificação, e não o conhecimento memorizado. Mesmo o agente líder deixou uma parte substancial dos pontos na mesa, o que significa que a recuperação total de um conjunto de referência novo e com provas documentais continua fora do alcance dos agentes atuais que trabalham com um orçamento de tempo.
Resultados do mapeamento de concorrentes
A distribuição divide-se em três níveis, cada um mapeado para um mecanismo de pontuação. O par de topo cobriu várias das categorias de concorrentes do alvo e capturou parte do grupo de pares próximos. A faixa intermédia é o que a rubrica produz quando um agente mapeia bem os nomes conhecidos de analistas e análises e falha os pares pequenos e recentes mais próximos do alvo: execução sólida, penalizada duplamente através de pontos de recall perdidos e penalizações diretas por falhas. A cauda perto do zero é a mais instrutiva, porque uma pontuação tão baixa não requer um ficheiro vazio. As penalizações por pares não identificados e por não concorrentes devolvidos podem anular tudo o que um CSV bem formatado ganha, pelo que um mapa confiante e bem formatado das empresas erradas acaba por valer o mesmo que nenhum mapa.
Por que razão os resultados das duas tarefas divergem
A prospeção recompensa a verificação mecânica de cinco critérios declarados; o mapeamento de concorrentes exige um julgamento sobre onde termina o mercado de uma empresa de investigação de nicho, sem uma lista de critérios para verificar. Esse julgamento separou o campo muito mais do que a formatação ou a velocidade, e é a razão pela qual o líder mudou entre colunas enquanto vários agentes trocaram de posições de forma acentuada. A força num fluxo de trabalho de investigação diz pouco sobre o seguinte, pelo que as equipas que selecionam um agente devem testá-lo no fluxo de trabalho que planeiam automatizar, em vez de confiarem numa única tabela de classificação.
Metodologia do benchmark de capital de risco
Cada tarefa é fornecida como um ficheiro de especificações que criámos, que fixa o papel do analista, o ficheiro de saída, o acesso às ferramentas e o orçamento de tempo antes de qualquer execução começar. A tabela resume essas especificações:
O limite de tempo limita cada execução: um agente deve pesquisar, verificar e entregar o seu CSV dentro dessa janela, e a prospeção de negócios recebe o orçamento mais longo porque verifica dezenas de empresas candidatas em relação a cinco critérios, enquanto o mapeamento de concorrentes investiga um único alvo.
Ambos colocam o agente num papel que um analista júnior ocupa num fundo de capital de risco, e ambos exigem um CSV com células atómicas, URLs de origem resolvidas e sem comentários. Todos os factos são avaliados a partir de uma data de referência fixa, e os conjuntos de referência são revalidados trimestralmente porque os dados de financiamento se desviam.
Tarefa 1: Prospeção de negócios da diáspora
O agente atua como analista de prospeção de negócios num fundo em fase inicial focado em fundadores da diáspora. Deve devolver empresas de IA que cumpram todos estes critérios de investimento a partir da data de referência:
- Financiamento abaixo de $5M. Capital total divulgado captado, não uma avaliação ou valor de receita. Se o financiamento não for divulgado, a empresa qualifica-se houver evidência positiva de que o montante está abaixo do limite. Caso contrário, deve ser excluída.
- Fundada em 2025 ou 2026. Qualquer ano anterior falha.
- Origem do fundador com evidência pública. Pelo menos um fundador nasceu num país específico, foi educado numa instituição neste país, ou nasceu com uma nacionalidade específica.
- Sede no estrangeiro. A empresa propriamente dita está situada fora da Türkiye.
- Focada em IA. Empresas da camada de infraestrutura e da camada de aplicação qualificam-se ambas.
Cada linha associa cada valor a um URL de origem que o agente abriu. Um URL fabricado ou inacessível invalida a linha que suporta.
Como é pontuado
A pontuação é feita contra uma verdade de campo oculta: um conjunto de referência (gold set) de empresas qualificadas verificadas que o modelo nunca vê. Aplicam-se quatro dimensões:
- Recall contra um conjunto de referência verificado de empresas qualificadas.
- Precisão contra um conjunto de armadilhas de casos quase certos, cada um falhando exatamente um critério. Os desqualificadores nomeados têm penalizações fixas.
- Exatidão dos dados numa amostra aleatória fixa de linhas extraída com uma semente registada, para que uma passagem de pontuação possa ser reproduzida: sede, ano de fundação, financiamento dentro da tolerância e fontes que suportam a afirmação ao lado.
- Conformidade do formato: ordem das colunas, células atómicas, financiamento numérico, CSV válido.
Encher uma lista com empresas plausíveis mas não verificadas perde mais em precisão do que ganha em recall. O design recompensa menos linhas, mas totalmente verificadas.
Tarefa 2: Mapeamento de concorrentes
O agente conduz a diligência devida comercial sobre uma empresa-alvo para um potencial investidor. Para a execução pontuada, apontámos os agentes para a nossa própria empresa: o alvo é a própria AIMultiple, o que nos permitiu verificar a verdade de campo contra o conhecimento em primeira mão de quem compete connosco. A tarefa: identificar os concorrentes diretos do alvo, comprovar cada um com dados públicos e devolvê-los como um documento CSV.
As regras de âmbito definem o que conta como concorrente:
- Substituibilidade. Uma empresa qualifica-se quando oferece um produto ou serviço substituível a clientes sobrepostos, em qualquer categoria onde o alvo concorre.
- Cobertura total da categoria. O alvo opera em várias categorias. O agente deve cobrir concorrentes em cada uma delas, não apenas na mais óbvia.
- Exclusões. Empresas sobre as quais o alvo escreve, com as quais faz parceria ou que lista, mas com as quais não compete. Intervenientes adjacentes numa categoria vizinha. O próprio alvo.
Um mapa completo para um alvo desta amplitude varia entre 8 a 15 concorrentes. Cada linha inclui a página LinkedIn do concorrente, o financiamento total divulgado (ou Não Divulgado), o país da sede, o ano de fundação e o número de funcionários no LinkedIn, com um URL de origem ao lado de cada métrica. Duas colunas de raciocínio acompanham as métricas: um diferenciador em relação ao alvo e uma justificação para inclusão, cada um devendo ser específico e não genérico. Um valor de financiamento deve ser suportado por uma fonte de financiamento.
Como é pontuado
A pontuação é feita contra uma verdade de campo oculta, organizada por categoria de concorrente. Aplicam-se cinco dimensões:
- Precisão. Cada não-concorrente devolvido reduz a pontuação. Desqualificadores nomeados, como ferramentas de SEO e fornecedores de modelos de IA, que o alvo meramente avalia, têm penalizações fixas. Um mecanismo suave anti-enchimento reduz o peso quando uma única categoria representa a maior parte do conjunto encontrado. Os concorrentes têm dois níveis de peso. Um pequeno conjunto de pares imperdíveis, as empresas mais próximas do trabalho central do alvo, pesa três vezes mais do que uma entrada padrão. Um concorrente genuíno ausente da verdade de campo ainda ganha crédito após revisão especializada, pelo que um conjunto de referência incompleto não penaliza uma descoberta correta.
- Penalizações graduadas. Independentemente do peso do recall, cada par imperdível que o agente não devolve subtrai uma penalização fixa dimensionada pela proximidade. A falta dos pares mais próximos do alvo é tratada como uma falha central de diligência devida, não uma lacuna de recall rotineira.
- Exatidão do financiamento. Linhas amostradas verificadas dentro da tolerância, sendo Não Divulgado e N/A (público) aceites como respostas corretas quando aplicáveis.
- Evidência de métricas e raciocínio. Métricas obrigatórias presentes, atómicas, com fonte e exatas dentro da tolerância. As células de diferenciador e justificação são pontuadas quanto à especificidade em relação a texto padrão.
Por que razão os critérios resistem ao reconhecimento de padrões
Ambas as tarefas são construídas para bloquear os atalhos que os agentes tomam sob pressão de tempo:
- Adivinhar falha. Quando um valor não é público, a resposta pontuada é uma lacuna comprovada, não uma estimativa. Um número inventado custa pontos duas vezes, uma em exatidão e outra em precisão, pelo que admitir o desconhecido supera preenchê-lo.
- As respostas estão além da primeira página de pesquisa. Ambos os conjuntos de referência se baseiam em empresas jovens ou pouco documentadas que os dados de treino ainda não alcançaram, pelo que as pontuações dependem de pesquisa viva e em camadas, em vez de memorização.
- Evidência supera inferência. Um sinal plausível, um nome familiar ou uma página de alta classificação, não estabelece um facto; um registo citável estabelece. Ambas as rubricas pontuam a fonte ao lado da afirmação, não a afirmação isoladamente.
- Completude e precisão puxam uma contra a outra.Encher com nomes não verificados custa mais do que rende, enquanto uma lista curta excessivamente cautelosa perde recall. A pontuação empurra os agentes para o equilíbrio que um fundo espera de um analista: cada descoberta verificada, nenhuma descoberta genuína ignorada.
Construção das tarefas
Cada benchmark começou como um fluxo de trabalho real nas nossas operações de desenvolvimento de negócios e investigação. Convertemos as especificações originais dos analistas em ficheiros de tarefas com uma estrutura fixa: papel, regras de elegibilidade, colunas de saída exatas, acesso às ferramentas e um limite de tempo. As rubricas residem em ficheiros separados com pontos por critério: formato e aritmética passam por verificações automatizadas, e os juízos de valor vão para um revisor humano.
Três regras de design aplicaram-se a ambas as tarefas:
- Cada valor precisa de uma fonte que o agente tenha aberto. Páginas iniciais simples e páginas de resultados de pesquisa não contam.
- Não Divulgado supera Inventado. Escrever Não Divulgado para uma ronda pré-seed privada pontua; inventar um número custa pontos duas vezes, uma por exatidão e outra por precisão.
- Saída atómica. Um valor por célula, ordem exata das colunas. As violações de estrutura custam pontos antes de o conteúdo ser avaliado.
Controlo de fugas
As primeiras execuções ensinaram-nos a lição mais importante da metodologia. Quando o ficheiro da rubrica era acessível a partir do diretório de trabalho do modelo, o modelo lia-o e copiava a verdade de campo. As pontuações subiram por razões não relacionadas com a capacidade de pesquisa.
Cada rubrica agora inclui um requisito de isolamento do harness: o modelo recebe o ficheiro de prompt e nada mais, e o avaliador aplica a rubrica posteriormente. Qualquer execução em que a rubrica estava acessível é tratada como inválida. Os construtores de benchmarks que ignorarem este controlo irão sobrestimar o que os seus agentes conseguem fazer.
O que as rubricas medem
As rubricas partilham uma filosofia de pontuação em ambas as tarefas:
- Recall contra a verdade de campo verificada. Cada empresa ou concorrente qualificado no conjunto de referência foi confirmado por um investigador humano contra registos públicos antes de qualquer modelo ser pontuado.
- Precisão com armadilhas nomeadas. Ambos os conjuntos de verdade de campo contêm casos quase certos que falham exatamente um critério e são desqualificadores nomeados com penalizações fixas, para que o reconhecimento de padrões sem verificação seja detetado.
- Pontos negativos por fabricação. Um valor de financiamento alucinado ou um URL de origem morto subtrai pontos em vez de pontuar zero. Lacunas honestas batem erros confiantes.
- Gestão de desvios. Financiamento, avaliações e número de funcionários mudam. Cada rubrica contém uma data de referência, marca dados propensos a desvios e exige reverificação antes de cada passagem de pontuação.
- Verificação mista. Recall, precisão e verificações de formato são executadas automaticamente. A evidência de origem do fundador e as justificações de inclusão vão para um revisor humano.
As pontuações baixas resultam de tornar a tarefa genuinamente difícil, não de esmagar boas respostas com limites. O recall, a precisão, a exatidão e a honestidade puxam cada um por um modo de falha diferente, pelo que um modelo não pode compensar uma pesquisa fraca com uma formatação confiante.
Por que razão o trabalho de capital de risco testa bem os agentes de IA
As empresas de capital de risco funcionam com o trabalho dos analistas. A triagem de fluxo de negócios (deal flow) e a diligência devida são tarefas de pesquisa em várias etapas. Cada uma requer pesquisa na web, verificação de fontes e saída estruturada. Cada uma produz também respostas erradas de aparência plausível, o que as torna difíceis de fingir e úteis para pontuar.
Estas propriedades tornam o trabalho de analista de VC um domínio de benchmark forte:
- Verdade de campo verificável. As rondas de financiamento, os anos de fundação e o número de funcionários podem ser verificados contra registos públicos.
- Pressão de fabricação. Modelos que não conseguem encontrar um valor tendem a inventar um. As tarefas expõem isso diretamente.
- Valor económico real. Um fundo que automatiza partes da diligência devida altera a sua própria estrutura de custos. O benchmark mede o trabalho que alguém paga hoje.
Leituras adicionais
- AIM Agentic Marketing Benchmark
- Negociação de Ações Baseada em IA: Qual Ferramenta de IA Generativa é Melhor
- Agentic IA Finance Benchmark
Perguntas frequentes
Não. As tarefas mapeiam o trabalho que os analistas juniores fazem: prospeção, mapeamento de concorrentes, comparáveis. Decisões de investimento, julgamento de parceiros e relações com fundadores estão fora do seu âmbito. A IA comprime o tempo de pesquisa; os humanos tomam a decisão.
As empresas públicas têm finanças auditadas, o que torna a avaliação um exercício de consulta. As startups privadas em fase inicial forçam o agente a estimar, declarar uma base e rotular a incerteza. É aí que a pressão de fabricação é maior e onde o verdadeiro esforço de diligência devida é aplicado.
Estes benchmarks mostram a IA a substituir os analistas de capital de risco?
Não. As tarefas mapeiam o trabalho que os analistas juniores fazem: prospeção, mapeamento de concorrentes, comparáveis. Decisões de investimento, julgamento de parceiros e relações com fundadores estão fora do seu âmbito. A IA comprime o tempo de pesquisa; os humanos tomam a decisão.
Por que razão as tarefas visam empresas privadas?
As empresas públicas têm finanças auditadas, o que torna a avaliação um exercício de consulta. As startups privadas em fase inicial forçam o agente a estimar, declarar uma base e rotular a incerteza. É aí que a pressão de fabricação é maior e onde o verdadeiro esforço de diligência devida é aplicado.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{phd2026,
author = {PhD., Ezgi Arslan, and Kalelioğlu, Berk},
title = {{Benchmark de IA para VC: 11 Agentes de IA em Tarefas Reais de Capital de Risco}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-vc}},
note = {AIMultiple. Acessado em 21 Julho 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.