Serviços
Contate-nos

800+ Principais Benchmarks de IA

Sıla Ermut
Sıla Ermut
atualizado em 17 ago. 2026

Reunimos uma lista com mais de 800 benchmarks de IA para LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança que ainda não estão saturados.

Crescimento dos benchmarks de IA

Loading Chart

Observe que a maior parte do pico de maio a junho corresponde ao período durante o qual realizamos nossa pesquisa. Benchmarks que são atualizados continuamente são datados com a última vez em que os verificamos, portanto tendem a se agrupar em torno dos meses em que estávamos coletando dados, em vez de apontar para um aumento real de novos benchmarks.

Benchmarks de IA por categorias

Listamos os benchmarks de IA com base em suas categorias principais. Os benchmarks de LLM lideram em termos de maior número.

Benchmarks de IA por subcategorias

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Lista de benchmarks de IA

Para simplificar, incluímos os 250 benchmarks mais recentes da nossa lista completa de 809 benchmarks. Leia nossa metodologia para saber como reunimos esta lista.

Notas sobre como ler a lista:

As quatro colunas com indicadores booleanos (T = verdadeiro, F = falso) indicam qual dimensão de avaliação cada benchmark cobre. Cada indicador responde a uma pergunta de sim/não sobre o escopo do benchmark:

  • Desempenho (T/F): O benchmark avalia capacidade ou qualidade, como precisão da saída, conclusão de tarefas ou inteligência? Isso é marcado como T para quase todos os benchmarks, já que a maioria avalia o desempenho de um modelo ou sistema. É marcado como F para benchmarks que se concentram apenas em custo ou velocidade e não avaliam a qualidade da saída.
  • Preço (T/F): O benchmark inclui fatores relacionados a custo, como dólares por token, preço por throughput ou custo por tarefa?
  • Latência (T/F): O benchmark mede velocidade, como tokens por segundo, tempo até o primeiro token, throughput ou tempo de resposta? É F para benchmarks que avaliam correção, independentemente de quanto tempo a resposta leva.
  • Confiabilidade (T/F): O benchmark avalia consistência ou dependabilidade, como variação entre execuções, estabilidade das taxas de sucesso ou robustez? Este é o indicador menos comum. É T para benchmarks projetados para esse fim, incluindo HAL Reliability, tau-bench/tau2-bench, METR Time Horizons e vários benchmarks de agentes em que a consistência da taxa de aprovação é central. É F para a maioria das tabelas de liderança que relatam uma única pontuação geral.
  • Resistente à contaminação (T/F): Indica se o benchmark é projetado para reduzir o risco de contaminação de dados, em que perguntas de teste aparecem nos dados de treinamento de um modelo e o modelo alcança pontuações altas por memorização em vez de capacidade genuína. T significa que o benchmark tem uma defesa significativa, como um conjunto de validação oculto, perguntas recém-geradas ou rotativas, atualizações mensais, itens autogerados ou problemas de competição liberados após o corte de treinamento de um modelo. F significa que o benchmark é um conjunto de dados público fixo que está online há anos e pode ter sido absorvido pelos corpora de treinamento. Nesses casos, pontuações altas devem ser interpretadas com maior cautela.

Na prática, uma linha marcada como T/F/F/F representa um benchmark puramente de qualidade. Em contraste, um benchmark marcado como T/T/T/T/F avalia qualidade, custo e velocidade em conjunto. Esses indicadores fornecem uma taxonomia compacta que mostra quais dos quatro eixos de avaliação cada benchmark cobre.

Por que algumas células estão em branco?

Resistente à contaminação e fonte de contaminação: Esses dois campos geralmente ficam em branco para os mesmos tipos de linhas, especialmente GPU, cloud GPU, benchmarks de velocidade e de precificação. A resistência à contaminação é relevante para benchmarks de conhecimento e raciocínio, nos quais um modelo pode ter memorizado as perguntas de teste a partir dos dados de treinamento. Para benchmarks de throughput de hardware, latência ou precificação, não há perguntas de teste a serem contaminadas, portanto o campo é deixado vazio em vez de ser marcado como T ou F.

Metodologia dos benchmarks de IA

Coletamos os dados dos benchmarks por meio de um processo online de pesquisa e validação. O objetivo foi criar uma lista estruturada de benchmarks de tecnologia que continuam úteis para comparar os atuais sistemas e infraestrutura de IA, abrangendo LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança.

Começamos definindo o escopo do conjunto de dados. Concentramo-nos em benchmarks que medem capacidade de modelo, desempenho de infraestrutura, custo, latência, confiabilidade ou resistência à contaminação. A lista inicial de fontes incluiu os principais provedores de benchmark e análise, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple e Epoch IA, além de sites oficiais de benchmarks, repositórios do GitHub, artigos acadêmicos, páginas de leaderboards e agregadores relevantes de benchmarks de terceiros.

Para cada benchmark, registramos tanto campos descritivos quanto avaliativos. Os campos descritivos capturam o que é o benchmark, o que ele mede, quais produtos ou modelos são avaliados e com que frequência é atualizado. Os campos avaliativos classificam se o benchmark mede desempenho, preço, latência ou confiabilidade. Também coletamos informações sobre a estrutura do benchmark e a integridade dos dados.

Priorizamos fontes primárias sempre que possível. Elas incluíram páginas oficiais de metodologia de benchmark, páginas de leaderboards, repositórios do GitHub, artigos de benchmark e documentação de provedores. Quando uma fonte primária não fornecia um campo específico, usamos fontes secundárias respeitáveis ou agregadores para preencher lacunas, especialmente para as melhores pontuações, cobertura atual de modelos e datas de medição recentes. Colunas de fonte foram incluídas em todo o conjunto de dados para que a evidência de cada valor pudesse ser rastreada até sua origem.

Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

Cite esta pesquisa

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Sıla Ermut (2026) - "800+ Principais Benchmarks de IA". Publicado on-line em AIMultiple.com. Acessado em 17 Agosto 2026, em: https://aimultiple.com/ai-benchmarks [Recurso on-line]

Ermut, S. (2026, 17 Agosto). 800+ Principais Benchmarks de IA. AIMultiple. https://aimultiple.com/ai-benchmarks

@misc{ermut2026,
  author = {Ermut, Sıla},
  title  = {{800+ Principais Benchmarks de IA}},
  year   = {2026},
  month  = aug,
  howpublished    = {\url{https://aimultiple.com/ai-benchmarks}},
  note   = {AIMultiple. Acessado em 17 Agosto 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 250 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV.

Última atualização: 17 Agosto 2026
Baixar
Sıla Ermut
Sıla Ermut
Analista do Setor
Sıla Ermut é analista do setor na AIMultiple, cobrindo models de IA, infraestrutura de IA, governança de IA e aplicações empresariais de IA. Sua pesquisa se concentra principalmente no uso de IA em marketing, saúde, cadeias de suprimentos e sustentabilidade.
Ela trabalhou anteriormente como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450