Serviços
Contate-nos

AIM Enterprise: Benchmark Empresarial Agêntico

Berk Kalelioğlu
Berk Kalelioğlu
atualizado em 24 ago. 2026

As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs mais econômicos, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações.

Resultados do benchmark

Loading Chart
  • Claude Opus 5 (66.4) e GPT 5.6 Sol (62.4) terminaram mais de 7 pontos à frente do terceiro lugar e mantiveram as duas primeiras posições em todas as 4.000 repontuações em re-seleções aleatórias das tarefas.
  • Opus 5 venceu 43 das 69 tarefas e Sol venceu 13. Nenhum outro modelo venceu mais de quatro.
  • O Opus 5 também teve a maior média nas 17 tarefas mais difíceis, 66.2 contra 62.3 do Sol.
  • Os seis modelos seguintes pontuaram entre 51.4 e 55.2. Isso é mais próximo do que 69 tarefas conseguem separar, então a ordem deles muda com a seleção de tarefas.

Custo e pontuação

  • GPT 5.6 Luna pontuou 55.2 a US$ 0.040 por tarefa. Isso é 7 pontos abaixo do melhor modelo no gráfico por um décimo sétimo do custo dele.
  • Entre os 11 modelos com preço, o custo por tarefa e a pontuação têm correlação de 0.71.
  • Em todas as 16 configurações, a correlação entre tempo por tarefa e pontuação é de 0.55. Os quatro mais rápidos foram quatro dos cinco com menor pontuação, e o Inkling Small terminou uma tarefa em 49 segundos para ficar em penúltimo lugar.
  • Kimi K3 a US$0,652 e Qwen 3.8 Max a US$0,628 custam aproximadamente o mesmo que o GPT 5.6 Sol custa a US$0,670, e pontuam 8 e 11 pontos a menos.

Divergência entre os juízes

Dois modelos juízes pontuaram todos os arquivos e frequentemente discordaram. Em cerca de um terço das pontuações individuais, os dois ficaram mais de um quarto da escala de distância, e ninguém revisou essas linhas.

Eles concordaram nos extremos e não no meio. Ambos colocaram o Opus 5 e o GPT 5.6 Sol acima de todos os outros, mas 11 das 16 configurações ficam em uma posição diferente dependendo de qual modelo de pontuação você segue.

Os dois também discordaram sobre qual líder vem primeiro, cada um colocando o modelo de sua empresa no topo. A ordem publicada combina os dois rankings.

Benchmark AIM Marketing

O mesmo método é aplicado ao trabalho de marketing: encontrar ofertas que um concorrente publica e o AIMultiple não, criar uma lista de contas com melhor ajuste e produzir um deck de vendas personalizado. Cada tarefa pontua de 0 a 100 e a pontuação geral é a média das três. Uma auditoria de reputação do site é executada ao lado delas e é relatada em seus próprios eixos, porque não tem pontuação máxima fixa.

Resultados completos: o benchmark de marketing agêntico.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Benchmark AIM IT

Doze modelos executaram uma tarefa de design de benchmark duas vezes cada, inventando um benchmark, construindo-o e executando quatro modelos por meio dele. Nenhuma das 24 tentativas passou em todos os critérios, e seis verificações da rubrica não foram aprovadas por nenhum deles. Claude Opus 5 liderou em texto-para-SQL com 78.2 e Kimi K3 em chamada de ferramentas com 74.3.

Resultados completos: os LLMs podem projetar um benchmark.

Benchmark AIM VC

Treze modelos listados foram solicitados a nomear os clientes de uma empresa com evidências datadas, em três empresas-alvo. O Claude Opus 5 pontuou 89.1 de 100 e o Claude Fable 5 85.0, e esses dois foram os únicos que permaneceram acima de 76 em todos os três alvos conforme pontuados. A maioria dos outros pontuou mais baixo no alvo cujos clientes aparecem em publicidade de podcast em vez de em páginas indexadas.

Resultados completos: o benchmark de lista de clientes.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Metodologia

As 69 tarefas foram escritas pelo fundador do AIMultiple com base em decisões reais de empresas e mapeadas para os IDs do APQC Process Classification Framework.1

Elas cobrem estratégia (16 tarefas), marketing (15), RH (7), vendas (6), operações (5), TI e finanças (4 cada) e sete áreas menores. Cada tarefa nomeia o arquivo que deseja: um results.csv com uma lista fixa de colunas, normalmente 10 linhas e 8 colunas, com uma regra explícita para cada campo inteiro.

Como os modelos executaram

Treze modelos executaram em 16 configurações, sendo uma configuração um modelo sob um programa de agente. Onze executaram no opencode 1.15.13 por meio do OpenRouter. Os demais executaram nos programas de agente fornecidos pelos próprios fornecedores, Claude Code e Codex, cobrados contra assinaturas.

Cada configuração recebeu o mesmo prompt congelado, acesso à web ao vivo por meio de uma scraping API e um limite de duas horas. Os prompts nunca foram ajustados para cada modelo, e as rubricas de pontuação nunca chegaram à máquina que executou as tarefas.

Ninguém escolheu um nível de raciocínio. Cada configuração executou no padrão do seu programa de agente, e os padrões não são um só nível:

Claude Code 2.1.220 vem configurado como alto para os dois modelos que executou e o Codex registrou alto em todas as execuções. O opencode não escolhe nada e deixa o nível a cargo do provedor, então esses oito ficam no padrão de cada modelo.

Um padrão de raciocínio mais alto não resultou em uma pontuação mais alta. Os dois modelos que têm como padrão acima do alto, Kimi K3 no máximo e Qwen 3.8 Max no muito alto, terminaram em 4 e 8 de 13. Os três modelos que executaram tanto em uma CLI de fornecedor quanto no opencode ficam dentro de 0.83 pontos de si mesmos.

Cada valor de custo aqui é recalculado a partir dos tokens que uma execução realmente movimentou, aos preços de tabela do OpenRouter lidos em 19 de agosto de 2026, com entrada em cache cobrada à taxa de cache.

A cobrança dos próprios programas de agente não seria comparável. O opencode cobra por sua própria lista de preços integrada, e as execuções do Claude Code e do Codex cobram contra assinaturas que não registram cobrança por execução. As duas configurações do Claude Code não mantiveram registro de uso e não podem ser precificadas de forma alguma.

Isso produziu 1.104 arquivos, um por configuração por tarefa. Seis configurações do opencode perderam 25 execuções na primeira passagem porque a busca de arquivos do agente percorreu caminhos que seu próprio sandbox se recusou a abrir, o que travou a execução. Executar novamente essas 25 em um diretório isolado recuperou todas, então a entrega é relatada tanto como taxa de primeira passagem quanto como taxa final. Cada tarefa foi executada uma vez e pontuada uma vez. Um modelo que não produziu nenhum arquivo foi executado novamente, mas nenhum arquivo foi pontuado duas vezes, então nenhum resultado veio da escolha da melhor de duas tentativas.

Uma septuagésima tarefa, um manual de tratamento de consultas, fica de fora de todos os números aqui. Seu arquivo de entrada estava ausente no momento da execução e apenas uma configuração produziu um arquivo para ela. Contando cada reinicialização, 83 das 759 execuções com registros de uso exigiram mais de uma tentativa.

Como funcionam as verificações e os juízes

As verificações determinísticas rodam primeiro, e nenhum juiz vê um arquivo que falhe nelas: conjunto de colunas e contagem de linhas, parsing RFC 4180,2

formatação de inteiros, nenhuma célula vazia, nenhuma linha duplicada e ordem de classificação onde a tarefa exige uma.

Um arquivo que falha pontua zero em vez de ser descartado. O DeepSeek V4 Flash falhou em 6 de seus 69 arquivos, o Inkling Small em 2, o MiniMax M3 e o GPT 5.6 Terra em um cada. Remover todas as tarefas em que alguma configuração falhou deixa os dois líderes no lugar.

Os 1.094 arquivos que passaram foram para dois juízes: GPT 5.6 Sol por meio do Codex CLI e Claude Opus 5 por meio do Claude Code CLI, ambos com alto esforço de raciocínio e acesso à web ao vivo.

Cada coluna do arquivo vai para seu próprio subagente, que vê as respostas dessa coluna de todos os modelos e nada mais, sob IDs de linha anônimos embaralhados separadamente para cada juiz. O juiz classifica essas respostas entre si e não pode considerar duas iguais. As duas classificações são então combinadas somando a posição de cada resposta sob cada juiz. Isso produziu 90.530 pontuações.

Medido com os nomes dos modelos visíveis, o Sol classificou as respostas do GPT 8.4 percentis acima de onde o Opus as classificou, e o Opus classificou as respostas da Anthropic 4.9 percentis acima de onde o Sol as classificou. A anonimização não remove o efeito. As execuções por trás deste leaderboard foram anonimizadas, e cada juiz ainda colocou a configuração da própria empresa em primeiro lugar.

Como a pontuação funciona

A pontuação de um modelo é a soma das médias de suas colunas, redimensionada para que o total mais alto possível seja 100. Esse teto depende de quantos modelos passaram nas verificações, e é por isso que essas pontuações comparam dentro deste benchmark e em nenhum outro lugar.

Para testar o quanto a classificação depende da seleção de tarefas, repontuamos o leaderboard 4.000 vezes, cada vez em uma re-seleção aleatória das 69 tarefas. Isso mede apenas a sensibilidade à tarefa. Não mede o quanto uma nova execução da mesma tarefa moveria uma pontuação, porque nenhuma tarefa foi pontuada duas vezes.

O quarto mais difícil é o das 17 tarefas com a menor pontuação média em todas as 16 configurações. Essa regra foi fixada antes de a posição de qualquer modelo nessas tarefas ser calculada.

Doze dos 13 modelos também aparecem nos benchmarks acima. Suas pontuações não são transferidas, porque cada benchmark define sua própria escala.

Cada pontuação aqui é uma posição relativa aos modelos contra os quais foi executada, então remover uma configuração repontuaria todo o restante em vez de remover uma barra. Qwen 3.8 Max executa apenas este benchmark e permanece no gráfico por esse motivo.

Perguntas frequentes

Não com essas evidências. A escala é relativa, então mesmo a pontuação máxima de 66.4 diz apenas que as respostas de um modelo ficaram acima das outras, e as linhas em que os dois modelos de pontuação divergem substancialmente não foram revisadas. Os fornecedores que constroem esse tipo de agente estão listados em nosso detalhamento de empresas de IA empresarial, e o AIMultiple automatiza processos como esses.

Porque seis deles estão genuinamente próximos, e 69 tarefas não conseguem separar diferenças abaixo de cerca de 1.5 pontos. O benchmark separa modelos fortes de fracos. A reamostragem de tarefas reordena os seis do meio.

Não para a qualidade da saída, nos três casos que pudemos testar. Três modelos executaram cada um sob dois programas de agente e nenhum par diferiu em mais de 0.83 pontos, mesmo que as CLIs dos fornecedores raciocinassem em alto e as execuções no opencode usassem o padrão do provedor. Os gráficos usam o programa do próprio fornecedor para esses três. A diferença apareceu nas operações: apenas as configurações do opencode perderam execuções para um conflito de sandbox, e apenas o Claude Code não deixou registro de uso.

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Berk Kalelioğlu (2026) - "AIM Enterprise: Benchmark Empresarial Agêntico". Publicado on-line em AIMultiple.com. Acessado em 24 Agosto 2026, em: https://aimultiple.com/agentic-enterprise [Recurso on-line]

Kalelioğlu, B. (2026, 24 Agosto). AIM Enterprise: Benchmark Empresarial Agêntico. AIMultiple. https://aimultiple.com/agentic-enterprise

@misc{kalelioglu2026,
  author = {Kalelioğlu, Berk},
  title  = {{AIM Enterprise: Benchmark Empresarial Agêntico}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/agentic-enterprise}},
  note   = {AIMultiple. Acessado em 24 Agosto 2026}
}
Berk Kalelioğlu
Berk Kalelioğlu
Pesquisador de IA
Berk é um Pesquisador de IA na equipe de benchmark da AIMultiple, com foco em IA agêntica, aprendizado de máquina e grandes e pequenos language models (LLMs e SLMs).
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450