As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, no qual usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações.
Resultados do benchmark
- O Opus 5 pontuou mais em 39 tarefas e o Astra em 30. Os quatro primeiros, com Claude Fable 5.1 e Grok 4.6, têm uma diferença de 2.9 pontos.
- Astra liderou em 23 tarefas, Opus 5 em 22, e Fable 5.1 em 16.
- Claude Fable 5.1 venceu Claude Fable 5 em 63 de 69 tarefas e teve média de 7.2 pontos a mais. O GPT 6 Astra teve média de 8.8 pontos a mais que o GPT 5.6 Sol e o venceu em 61.
- Claude Sonnet 5 custa $1,23 por tarefa. O Gemini 3.8 Flash pontuou 1.5 pontos a mais a $0,61, e o Grok 4.6 pontuou 13 pontos a mais a $1.09.
Custo e pontuação
- O GPT 6 Astra e o Claude Opus 5 custam quase o mesmo, $1,76 e $1,73 por tarefa, e têm uma diferença de 1.6 pontos.
- O GPT 5.6 Luna pontuou 45.2 a $0,016 por tarefa, 18.7 pontos abaixo do Claude Opus 5 por menos de um por cento do seu custo.
- O GPT 5.6 Sol pontua 53.5 a $0,167 por tarefa. O Grok 4.6 pontua 7.5 pontos a mais e custa 6.5 vezes mais.
- Claude Fable 5.1 é o modelo mais caro do gráfico a $3,19 por tarefa e pontua 1.8 pontos abaixo do Claude Opus 5, que custa $1.73.
- Entre os 16 modelos do gráfico, o custo por tarefa e a pontuação se correlacionam em 0.68. O tempo mediano por tarefa e a pontuação se correlacionam em 0.04. O modelo mais rápido, Inkling Small com 66 segundos por tarefa, fica em último lugar.
Divergência entre os juízes
Dois modelos juízes pontuaram cada arquivo que passou nas verificações. Em 32,7% das pontuações individuais, os dois divergiram em mais de um quarto da escala, e ninguém revisou essas linhas.
Ambos os juízes colocaram as mesmas quatro configurações no topo e as mesmas duas no fim; 12 das 17 configurações ficam classificadas de forma diferente por cada juiz.
Cada juiz colocou o modelo da própria empresa em primeiro. O GPT 5.6 Sol classificou o GPT 6 Astra em primeiro e o Claude Opus 5 em segundo; o Opus 5 classificou a si mesmo em primeiro e o Astra em quarto. A ordem publicada combina as duas classificações.
Benchmark AIM Marketing
O mesmo método é aplicado ao trabalho de marketing: encontrar ofertas que um concorrente publica e a AIMultiple não publica, criar uma lista de contas com melhor aderência e produzir uma apresentação de vendas personalizada. Cada tarefa pontua de 0 a 100 e a pontuação geral é a média das três. Uma auditoria de reputação do site é executada junto com elas e é relatada em seus próprios eixos, pois não tem pontuação máxima fixa.
Resultados completos: o benchmark de marketing agêntico.
Benchmark AIM IT
Doze modelos executaram duas vezes uma tarefa de criação de benchmark, inventando um benchmark, construindo-o e passando quatro modelos por ele. Nenhuma das 24 tentativas passou em todos os critérios, e seis das verificações da rubrica não foram aprovadas por nenhum deles. O Claude Opus 5 liderou em texto-para-SQL com 78.2 e o Kimi K3 em chamada de ferramentas com 74.3.
Resultados completos: podem LLMs projetar um benchmark.
Benchmark AIM VC
Treze modelos listados foram solicitados a nomear os clientes de uma empresa com evidências datadas, em três empresas-alvo. O Claude Opus 5 pontuou 89.1 de 100 e o Claude Fable 5 85.0, e esses dois foram os únicos que ficaram acima de 76 em todos os três alvos conforme pontuado. A maioria dos outros pontuou mais baixo no alvo cujos clientes aparecem em publicidade de podcast e não em páginas indexadas.
Resultados completos: o benchmark de lista de clientes.
Plataformas empresariais agênticas
As empresas também podem usar LLMs por meio de software empresarial. As plataformas abaixo conectam modelos de provedores como OpenAI, Anthropic e Google a registros de CRM, fluxos de trabalho e agentes pré-criados.
Creatio
O Creatio é uma plataforma de CRM e fluxo de trabalho com agentes de IA pré-criados.
Agentes por departamento: Os agentes disponíveis dependem dos aplicativos que uma empresa instalou. Exemplos:
- Agente de Vendas: enriquece os dados da conta, preenche os campos de oportunidade após reuniões do Zoom e se prepara para novas reuniões.
- Agente de Conhecimento: redige artigos da base de conhecimento a partir de casos resolvidos.
- Agente de Segmentação: transforma descrições de público em linguagem simples em segmentos de marketing.
Um modelo separado por agente, incluindo os auto-hospedados: Cada agente ou subagente pode usar seu próprio modelo. As opções suportadas são OpenAI, Azure OpenAI e provedores compatíveis com LiteLLM, incluindo modelos na própria infraestrutura da empresa. Os cenários de agente exigem pelo menos uma janela de contexto de 40.000 tokens e chamada de funções.
Salesforce Agentforce
O Agentforce é a camada de agentes do CRM da Salesforce.
Modelos: Os agentes usam modelos habilitados para Salesforce de parceiros, incluindo Anthropic, Google e OpenAI. As empresas também podem conectar sua própria conta de LLM, e o modelo padrão de um agente pode ser alterado.
Einstein Trust Layer: As chamadas de modelos passam por uma camada que, segundo a Salesforce, inclui detecção de toxicidade, acordos de zero retenção de dados e defesa contra prompt-injection.
Transferência para uma pessoa: “Transferir para agente humano” é uma das ações que um agente pode escolher. Isso permite que uma conversa vá para uma pessoa quando um processo não pode tolerar erros.
Microsoft Copilot Studio
O Copilot Studio é a ferramenta da Microsoft para criar agentes para o Microsoft 365 e o Power Platform.
Modelos: Os modelos da OpenAI são o padrão. Os criadores também podem adicionar modelos externos da Anthropic, xAI ou Mistral.
Rótulos de produção: A Microsoft marca alguns modelos como experimentais ou de pré-visualização e desaconselha usá-los em produção. Os agentes publicados que usam esses modelos continuam sendo cobrados às taxas padrão.
Fallback: Se um administrador desativar os modelos da Anthropic, os agentes criados com eles mudam automaticamente para o modelo padrão da OpenAI.
Metodologia
As 69 tarefas foram escritas pelo fundador da AIMultiple com base em decisões reais de empresas e mapeadas para os IDs do APQC Process Classification Framework.1
Elas cobrem estratégia (16 tarefas), marketing (15), RH (7), vendas (6), operações (5), TI e finanças (4 cada) e sete áreas menores. Cada tarefa especifica o arquivo desejado: um results.csv com uma lista fixa de colunas, normalmente 10 linhas e 8 colunas, com uma regra explícita para cada campo inteiro.
Como os modelos rodaram
Dezesseis modelos rodaram em 17 configurações, cada configuração sendo um modelo sob um programa de agente. Oito rodaram no opencode 1.15.13 por meio da OpenRouter. Os outros nove usaram o Claude Code, o Codex ou o Grok Build, os programas de agente dos próprios fornecedores. Todos foram cobrados por assinatura.
O Fable 5.1 rodou no Claude Code 2.1.258, enquanto as outras três configurações do Claude rodaram no 2.1.220; o Astra rodou no Codex 0.153.4, enquanto as três configurações do GPT 5.6 rodaram no 0.146.0. O Gemini 3.8 Flash rodou na mesma versão do opencode que os demais.
Cada configuração recebeu o mesmo prompt congelado, acesso à web ao vivo por meio de uma scraping API e um limite de uma hora. Os prompts nunca foram ajustados por modelo, e as rubricas de pontuação nunca chegaram à máquina que executou as tarefas.
Ninguém escolheu um nível de raciocínio. Cada configuração rodou no padrão de seu programa de agente, e os padrões não são um nível único:
O Claude Code adota o nível alto por padrão em todos os modelos que executou. O Codex envia o padrão do catálogo de cada modelo. Isso é baixo para o GPT 5.6 Sol e médio para o Luna, o Terra e o GPT 6 Astra. O Grok Build rodou o Grok 4.6 em nível alto. O opencode deixa o nível a cargo do provedor, então suas oito configurações rodaram no padrão do OpenRouter de cada modelo.
Um padrão de raciocínio mais alto não veio acompanhado de uma pontuação mais alta. No gráfico de 16 modelos, os três modelos cujo padrão fica acima de alto ficaram em 9, 11 e 14: GLM 5.3 em max, Qwen 3.8 Max em xhigh e Kimi K3 em max. O Claude Sonnet 5 rodou tanto em uma CLI do fornecedor quanto no opencode e pontuou 47.9 e 47.5.
Cada valor de custo aqui é recalculado a partir do uso registrado de tokens aos preços de tabela da OpenRouter congelados em 27 de agosto de 2026. Os tokens de raciocínio são precificados como tokens de saída, que é como a OpenRouter os cobra. O GPT 6 Astra e o Gemini 3.8 Flash entraram depois e usam as tarifas da OpenRouter lidas em 5 de setembro de 2026; o Claude Fable 5.1 usa as tarifas publicadas da Anthropic na mesma data, porque a OpenRouter não o lista.
Os custos do Claude Code também aplicam três regras publicadas pela Anthropic que uma tabela de preços fixa não tem. O cache de prompt de uma hora custa o dobro da taxa de entrada, enquanto um cache de cinco minutos custa 1.25 vezes a taxa de entrada. A pesquisa na web custa $10 por mil solicitações. O subagente Haiku 4.5 que o Claude Code executa junto com o modelo principal está incluído.
Os valores de custo dos próprios programas de agente não são comparáveis. Cada execução foi por assinatura, então nenhuma configuração tem uma fatura por execução. Quando um programa informa um custo, ele precifica seus próprios tokens com base em sua própria tabela. O opencode usa uma tabela de preços agrupada. O Grok Build usa uma tabela da xAI a cerca de um terço da tarifa pública. O Codex não informa nada. O Claude Code precificou o Sonnet 5 a $3 e $15 por milhão de tokens, a tarifa do Claude Sonnet 4.6, enquanto o Sonnet 5 custa $2 e $10.
As execuções produziram 1.140 arquivos de 1.173 pares configuração-tarefa. Um arquivo ausente tem pontuação zero e não é executado novamente, a menos que a execução tenha atingido o limite de uma hora ou terminado com um erro do provedor do modelo; cada exceção permite uma nova tentativa.
Cinco execuções travaram e quatro entregaram na nova tentativa. Dezoito execuções terminaram em erro do provedor, um 502 ou 504 da API ou uma resposta corrompida. Uma já havia gravado seu arquivo; as outras 17 foram executadas novamente, e 16 entregaram. Uma execução atingiu tanto o limite de tempo quanto um erro do provedor.
Oito execuções do Qwen 3.8 Max terminaram quando o guardião de loop do opencode impediu o modelo de repetir a mesma chamada de ferramenta pela terceira vez. Nenhuma outra configuração acionou o guardião. Essas execuções não foram repetidas, e quatro delas não produziram nenhum arquivo. Cada arquivo foi pontuado uma vez, então nenhum resultado veio da escolha da melhor de duas tentativas.
Como funcionam as verificações e os juízes
Verificações determinísticas são executadas primeiro, e nenhum juiz vê um arquivo que falhe nelas: conjunto de colunas e contagem de linhas, análise RFC 4180,2
formatação de inteiros, ausência de células vazias, ausência de linhas duplicadas e ordem de classificação quando a tarefa exigir uma.
Um arquivo que falha recebe pontuação zero em vez de ser descartado. O MiniMax M3 falhou em 8 dos 64 arquivos que entregou, seis deles porque o CSV não pôde ser analisado, e o GPT 5.6 Luna e o GPT 5.6 Terra falharam em um cada. Remover todas as tarefas em que qualquer configuração obteve zero deixa 38 tarefas e o mesmo líder.
Os 1.130 arquivos que passaram foram para dois juízes: o GPT 5.6 Sol por meio da CLI do Codex e o Claude Opus 5 por meio da CLI do Claude Code, ambos com alto esforço de raciocínio e acesso à web ao vivo.
Cada coluna do arquivo vai para seu próprio subagente, que vê as respostas daquela coluna de todos os modelos e nada mais, sob IDs de linha anônimos embaralhados separadamente para cada juiz. O juiz classifica essas respostas entre si e não pode considerar duas iguais. As duas classificações são então combinadas somando a posição de cada resposta em cada juiz. Isso produziu 93.490 pontuações.
Medido com nomes de modelo visíveis, o Sol classificou as respostas do GPT 8.4 pontos percentis acima de onde o Opus as classificou, e o Opus classificou as respostas da Anthropic 4.9 pontos percentis acima de onde o Sol as classificou. Na execução anônima por trás desta tabela de classificação, o Sol classificou o GPT 6 Astra em primeiro e o Opus classificou o Claude Opus 5 em primeiro.
Como a pontuação funciona
A pontuação de um modelo é a soma das médias de suas colunas, reescalada para que o total mais alto possível seja 100. Esse teto depende de quantos modelos passaram nas verificações, e é por isso que essas pontuações se comparam apenas dentro deste benchmark e em nenhum outro lugar.
Para testar o quanto a classificação depende da seleção de tarefas, repontuamos a tabela de classificação 4.000 vezes, cada vez com uma nova seleção aleatória das 69 tarefas. Isso mede apenas a sensibilidade às tarefas. Não mede o quanto uma nova execução da mesma tarefa moveria uma pontuação, porque nenhuma tarefa foi pontuada duas vezes.
O quarto mais difícil tem 17 tarefas, aquelas com a menor pontuação média entre todas as 17 configurações. Cinco tarefas empatam nas últimas quatro posições, e o Opus 5 tem a maior média em todas as cinco seleções possíveis. Essa regra foi fixada antes que a posição de qualquer modelo nessas tarefas fosse calculada.
Dez dos 16 modelos também aparecem nos benchmarks acima. Suas pontuações não são comparáveis entre benchmarks, porque cada um define sua própria escala.
Cada configuração aqui é pontuada por sua posição em relação aos modelos contra os quais rodou, portanto remover uma configuração altera todas as outras pontuações. Pelo mesmo motivo, essas pontuações não se comparam com a execução anterior deste benchmark, que pontuou um campo diferente. Apenas a ordem das configurações pode ser comparada entre execuções.
O Gemini 3.7 Flash rodou neste campo e foi removido quando o Gemini 3.8 Flash concluiu, sob a regra de que um modelo sai depois que seu sucessor tiver rodado. A mesma regra aposentou o Grok 4.5 e o GLM 5.2.
Perguntas frequentes
Não com base nessas evidências. A escala é relativa, então mesmo a pontuação máxima de 63.9 significa apenas que as respostas de um modelo ficaram acima das outras, e as linhas em que os dois modelos de pontuação divergem substancialmente não foram revisadas. Os fornecedores que criam esse tipo de agente estão listados em nossa análise de empresas de IA empresarial, e a AIMultiple automatiza processos como esses.
Sete deles pontuam entre 45.2 e 49.4, mais próximos do que 69 tarefas conseguem separar. Os quatro primeiros também estão a menos de 2.9 pontos entre si. O benchmark separa modelos fortes de fracos; reamostrar as tarefas reordena ambos os grupos.
Um modelo rodou sob ambos os programas nesta execução, e pontuou 47.9 no Claude Code e 47.5 no opencode. Uma comparação não dá uma resposta geral. Os gráficos mostram o resultado do Claude Code. A configuração do opencode leu 4.5 vezes mais contexto em cache e produziu 1.2 vezes mais tokens de saída, incluindo raciocínio. Ela custou $1,59 por tarefa, em comparação com $1,23 do Claude Code, cujo valor já inclui um subagente que o opencode não executa.
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{kalelioglu2026,
author = {Kalelioğlu, Berk},
title = {{AIM Enterprise: Benchmark Empresarial Agêntico}},
year = {2026},
month = sep,
howpublished = {\url{https://aimultiple.com/agentic-enterprise}},
note = {AIMultiple. Acessado em 17 setembro 2026}
}Resultados e carimbos de data/hora de 33 pontos de dados. Baixe os dados resumidos exibidos nos gráficos e tabelas deste artigo como um arquivo ZIP contendo 2 arquivos CSV e um README.
Quer os dados granulares por trás disso? Assine o Premium
Registro de alterações
1 atualizaçõesAdicionada à seção de metodologia uma tabela do esforço de raciocínio por modelo e programa agente.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.