As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs mais econômicos, criamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais em diferentes categorias.
Resultados do benchmark de tarefas empresariais
Cada modelo entregou um arquivo por tarefa. As pontuações são relativas: os juízes classificam cada resposta em relação às outras respostas da mesma tarefa, portanto a pontuação média é 50 por definição. Um 55 significa que as respostas de um modelo ficaram acima da maioria das outras, não que 55% do seu trabalho estava correto.
Dois modelos terminaram claramente à frente. O Claude Opus 5 marcou 66.4 e o GPT 5.6 Sol 62.4, mais de 7 pontos acima da configuração em terceiro lugar. Sua liderança não depende de quais tarefas escolhemos: repontuamos o leaderboard 4.000 vezes em re-seleções aleatórias das 69 tarefas, e esses dois mantiveram o primeiro e o segundo lugar em todas as vezes.
Os próximos nove modelos marcaram entre 51.4 e 55.3. Sessenta e nove tarefas não conseguem separar pontuações tão próximas, portanto a ordem deles muda dependendo de quais tarefas são contadas. O Kimi K3 é a exceção nesse grupo, terminando acima do Claude Sonnet 5 em 94% das repontuações.
O Opus 5 também venceu as tarefas mais difíceis. Pegamos as 17 tarefas com a menor pontuação média entre todas as 16 configurações, fixadas por essa regra antes que a posição de qualquer um nelas fosse calculada, e o Opus 5 superou todas as outras 15 configurações nesse subconjunto.
O Opus 5 não tem tarefas fracas. Sua melhor pontuação, 80.6, é a mais alta já publicada, e a pior, 52.9, ainda supera uma resposta média. Ele marcou acima de 60 em 62 das 69 tarefas e terminou em primeiro em 43 delas. O GPT 5.6 Sol venceu 13 tarefas e nenhum outro modelo venceu mais de quatro.
Os dois modelos de pontuação discordaram sobre qual dos líderes deveria ficar em primeiro. Cada um colocou o modelo da própria empresa no topo, então a ordem publicada combina as duas classificações.
Custo e pontuação
O custo cobre as 11 configurações cobradas por execução. Cinco configurações, incluindo as duas líderes, rodaram em assinaturas que não registram cobrança por execução.
A configuração paga com melhor pontuação também é a mais barata. O GPT 5.6 Luna marcou 55.3 a $0.032 por tarefa, logo abaixo do DeepSeek V4 Flash a $0.033. O Claude Sonnet 5 marcou 53.2 a $1.46, o que é 46 vezes o custo e 2.1 pontos a menos.
Pagar mais compra pouco aqui. Entre as 11 configurações pagas, a correlação entre custo por tarefa e pontuação é de 0.48. O Kimi K3 a $0.92 e o Qwen 3.8 Max a $0.74 pontuaram na mesma faixa que o Luna a $0.03.
Uma execução rápida é um sinal de alerta, mas uma lenta não prova nada. Entre todas as 16 configurações, a correlação entre tempo por tarefa e pontuação é de 0.55, e as quatro mais rápidas estavam entre as cinco menores pontuações. O Inkling Small terminou uma tarefa em 49 segundos e ficou em penúltimo lugar. Entre os nove modelos agrupados no meio, que levaram entre 127 e 569 segundos, essa correlação cai para −0.06.
Os custos são o que o harness cobrou em sua lista de preços agrupada, não uma cotação. Os preços de lista dos provedores estão em nossa comparação de preços de LLM. Tentativas falhas contam no total de um modelo, mas não no valor por tarefa, e os dois diferem mais para o Grok 4.5: $26.14 gastos contra $22.84 de execuções entregues.
Discordância dos juízes
Dois modelos pontuaram cada arquivo e frequentemente discordaram. Em cerca de um terço das pontuações individuais, os dois ficaram separados por mais de um quarto da escala, e ninguém revisou essas linhas.
Eles concordaram nas extremidades e não no meio. Ambos colocaram o Opus 5 e o GPT 5.6 Sol acima de todos os outros, mas 11 das 16 configurações ficam em uma posição diferente dependendo de qual modelo de pontuação você segue.
Cada tarefa rodou uma vez e foi pontuada uma vez. Um modelo que não produziu arquivo foi executado novamente, mas nenhum arquivo foi pontuado duas vezes, portanto nenhum resultado veio de escolher a melhor de duas tentativas.
Uma septuagésima tarefa, um playbook de tratamento de consultas, ficou de fora de todas as figuras aqui. Seu arquivo de entrada estava ausente no momento da execução e apenas uma configuração produziu um arquivo para ela.
Benchmark de Marketing da AIM
O mesmo método roda no trabalho de marketing: encontrar ofertas que um concorrente publica e a AIMultiple não, construir uma lista de contas com melhor ajuste e produzir uma apresentação de vendas personalizada. Cada tarefa pontua de 0 a 100 e a pontuação geral é a média das três. Uma auditoria de reputação do site roda junto com elas e é reportada em seus próprios eixos, porque não tem pontuação máxima fixa.
Resultados completos: o benchmark de marketing agêntico.
Benchmark de TI da AIM
Doze modelos foram instruídos a inventar um benchmark, construí-lo e rodar quatro modelos nele, duas vezes cada. Nenhuma das 24 tentativas passou em todos os critérios, e seis das verificações da rubrica não foram aprovadas por nenhum deles. O Claude Opus 5 liderou em texto-para-SQL com 78.2 e o Kimi K3 em chamada de ferramenta com 74.3.
Resultados completos: os LLMs podem projetar um benchmark.
Benchmark de VC da AIM
Treze modelos foram solicitados a nomear os clientes de uma empresa com evidências datadas, em três empresas-alvo. O Claude Opus 5 marcou 89.1 de 100 e o Claude Fable 5 85.0, e esses dois foram os únicos que permaneceram acima de 76 em todos os três alvos. A maioria dos outros colapsou no alvo cujos clientes são citados em leituras de patrocinadores de podcast e não em páginas indexadas.
Resultados completos: o benchmark de lista de clientes.
Metodologia
As 69 tarefas foram escritas pelo fundador da AIMultiple com base em decisões reais de empresas e mapeadas para os IDs do APQC Process Classification Framework.
1Eles cobrem estratégia (16 tarefas), marketing (15), RH (7), vendas (6), operações (5), TI e finanças (4 cada) e sete áreas menores. Cada tarefa nomeia sua entrega: um results.csv com uma lista fixa de colunas, normalmente 10 linhas e 8 colunas, com uma regra explícita para cada campo inteiro.
Como os modelos rodaram
Treze modelos rodaram em 16 configurações, sendo uma configuração um modelo sob um programa de agente. Onze rodaram no opencode 1.15.13 através do OpenRouter. Os demais rodaram nos programas de agente que seus próprios fornecedores enviam, Claude Code e Codex, cobrados em assinaturas.
Cada configuração recebeu o mesmo prompt congelado, acesso à web ao vivo por meio de uma API de scraping e um limite de duas horas. Os prompts nunca foram ajustados por modelo, e as rubricas de pontuação nunca chegaram à máquina que rodou as tarefas.
Isso produziu 1.104 arquivos, um por modelo por tarefa. Seis configurações opencode perderam 25 células na primeira passada porque a busca de arquivo do agente percorreu caminhos que sua própria sandbox depois se recusou a abrir, o que travou a execução. Reexecutar essas 25 em um diretório isolado recuperou todas elas, portanto a entrega é relatada tanto como uma taxa de primeira passada quanto final. Contando cada reinício, 83 das 759 células com registros de uso levaram mais de uma tentativa.
Como as verificações e os juízes funcionam
As verificações determinísticas rodam primeiro e nenhum juiz vê um arquivo que falhe nelas: conjunto de colunas e contagem de linhas, análise RFC 4180,
2formatação de inteiros, sem células vazias, sem linhas duplicadas e ordem de classificação onde a tarefa exigir.
Um arquivo que falha pontua zero em vez de ser descartado, porque um arquivo que ninguém consegue analisar é um resultado. O DeepSeek V4 Flash falhou em 6 de seus 69 arquivos, o Inkling Small em 2, o MiniMax M3 e o GPT 5.6 Terra em um cada. Remover cada tarefa em que qualquer configuração falhou deixa os dois líderes e a forma geral intactos.
Os 1.094 arquivos que passaram foram para dois juízes: GPT 5.6 Sol através do Codex CLI e Claude Opus 5 através do Claude Code CLI, ambos com alto esforço de raciocínio e acesso à web ao vivo.
Cada coluna da entrega vai para seu próprio subagente, que vê as respostas daquela coluna de cada modelo e nada mais, sob IDs de linha anônimos embaralhados separadamente para cada juiz. O juiz classifica essas respostas entre si e não pode considerar duas iguais. As duas classificações são então combinadas somando a posição de cada resposta sob cada juiz. Isso produziu 90.530 pontuações.
A anonimização não é cosmética. Medido com os nomes dos modelos visíveis, o Sol classificou as respostas do GPT 8.4 percentis acima de onde o Opus as classificou, e o Opus classificou as respostas da Anthropic 4.9 percentis acima de onde o Sol as classificou. Isso não remove o efeito: as execuções por trás deste leaderboard foram anonimizadas e cada juiz ainda colocou a configuração de sua própria empresa em primeiro.
Como a pontuação funciona
A pontuação de um modelo é a soma das médias de suas colunas, reescalonada para que o total mais alto possível seja 100. Esse teto depende de quantos modelos passaram nas verificações, e é por isso que essas pontuações se comparam dentro deste benchmark e em nenhum outro lugar.
Para testar o quanto a classificação depende da seleção de tarefas, repontuamos o leaderboard 4.000 vezes, cada vez em uma re-seleção aleatória das 69 tarefas. Isso mede apenas a sensibilidade à tarefa. Não mede o quanto uma reexecução da mesma tarefa moveria uma pontuação, porque nenhuma tarefa foi pontuada duas vezes.
O quarto mais difícil são as 17 tarefas com a menor pontuação média entre todas as 16 configurações. Essa regra foi fixada antes que a posição de qualquer modelo nessas tarefas fosse calculada.
Doze dos 13 modelos aqui também rodam nos outros benchmarks acima, então sua ordenação se mantém na série. Os números não, porque cada benchmark define sua própria escala.
Este benchmark não pode ser podado da maneira que os outros podem. Cada pontuação é uma posição relativa aos modelos contra os quais rodou, portanto remover uma configuração repontuaria todo o restante em vez de remover uma barra. O Qwen 3.8 Max roda apenas este benchmark e permanece no gráfico por esse motivo.
Perguntas frequentes
Não com base nessas evidências. A escala é relativa, portanto mesmo a pontuação máxima de 66.4 diz apenas que as respostas de um modelo ficaram acima das outras, e as linhas em que os dois modelos de pontuação discordam substancialmente não foram revisadas. Fornecedores que constroem esse tipo de agente estão listados em nosso detalhamento de empresas de IA empresarial, e a AIMultiple automatiza processos como esses.
Porque nove deles estão genuinamente próximos, e 69 tarefas não conseguem separar diferenças abaixo de cerca de 1.5 pontos. O benchmark distingue modelos fortes de fracos, não um modelo do meio da tabela do próximo.
Não para a qualidade da saída, nos três casos que pudemos testar. Três modelos rodaram cada um sob dois programas de agente e nenhum par diferiu em mais de 0.83 pontos. A diferença apareceu nas operações: apenas as configurações opencode perderam células para um conflito de sandbox, e apenas os programas cobrados por assinatura não deixaram registro de uso.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Benchmark Empresarial Agêntico}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Acessado em 14 Agosto 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.