Reunimos uma lista com mais de 800 benchmarks de IA para LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança que ainda não estão saturados.
Crescimento dos benchmarks de IA
Observe que a maior parte do pico de maio a junho corresponde ao período durante o qual realizamos nossa pesquisa. Benchmarks que são atualizados continuamente são datados com a última vez em que os verificamos, portanto tendem a se agrupar em torno dos meses em que estávamos coletando dados, em vez de apontar para um aumento real de novos benchmarks.
Benchmarks de IA por categorias
Listamos os benchmarks de IA com base em suas categorias principais. Os benchmarks de LLM lideram em termos de maior número.
Benchmarks de IA por subcategorias
Lista de benchmarks de IA
Para simplificar, incluímos os 250 benchmarks mais recentes da nossa lista completa de 809 benchmarks. Leia nossa metodologia para saber como reunimos esta lista.
Notas sobre como ler a lista:
As quatro colunas com indicadores booleanos (T = verdadeiro, F = falso) indicam qual dimensão de avaliação cada benchmark cobre. Cada indicador responde a uma pergunta de sim/não sobre o escopo do benchmark:
- Desempenho (T/F): O benchmark avalia capacidade ou qualidade, como precisão da saída, conclusão de tarefas ou inteligência? Isso é marcado como T para quase todos os benchmarks, já que a maioria avalia o desempenho de um modelo ou sistema. É marcado como F para benchmarks que se concentram apenas em custo ou velocidade e não avaliam a qualidade da saída.
- Preço (T/F): O benchmark inclui fatores relacionados a custo, como dólares por token, preço por throughput ou custo por tarefa?
- Latência (T/F): O benchmark mede velocidade, como tokens por segundo, tempo até o primeiro token, throughput ou tempo de resposta? É F para benchmarks que avaliam correção, independentemente de quanto tempo a resposta leva.
- Confiabilidade (T/F): O benchmark avalia consistência ou dependabilidade, como variação entre execuções, estabilidade das taxas de sucesso ou robustez? Este é o indicador menos comum. É T para benchmarks projetados para esse fim, incluindo HAL Reliability, tau-bench/tau2-bench, METR Time Horizons e vários benchmarks de agentes em que a consistência da taxa de aprovação é central. É F para a maioria das tabelas de liderança que relatam uma única pontuação geral.
- Resistente à contaminação (T/F): Indica se o benchmark é projetado para reduzir o risco de contaminação de dados, em que perguntas de teste aparecem nos dados de treinamento de um modelo e o modelo alcança pontuações altas por memorização em vez de capacidade genuína. T significa que o benchmark tem uma defesa significativa, como um conjunto de validação oculto, perguntas recém-geradas ou rotativas, atualizações mensais, itens autogerados ou problemas de competição liberados após o corte de treinamento de um modelo. F significa que o benchmark é um conjunto de dados público fixo que está online há anos e pode ter sido absorvido pelos corpora de treinamento. Nesses casos, pontuações altas devem ser interpretadas com maior cautela.
Na prática, uma linha marcada como T/F/F/F representa um benchmark puramente de qualidade. Em contraste, um benchmark marcado como T/T/T/T/F avalia qualidade, custo e velocidade em conjunto. Esses indicadores fornecem uma taxonomia compacta que mostra quais dos quatro eixos de avaliação cada benchmark cobre.
Por que algumas células estão em branco?
Resistente à contaminação e fonte de contaminação: Esses dois campos geralmente ficam em branco para os mesmos tipos de linhas, especialmente GPU, cloud GPU, benchmarks de velocidade e de precificação. A resistência à contaminação é relevante para benchmarks de conhecimento e raciocínio, nos quais um modelo pode ter memorizado as perguntas de teste a partir dos dados de treinamento. Para benchmarks de throughput de hardware, latência ou precificação, não há perguntas de teste a serem contaminadas, portanto o campo é deixado vazio em vez de ser marcado como T ou F.
Metodologia dos benchmarks de IA
Coletamos os dados dos benchmarks por meio de um processo online de pesquisa e validação. O objetivo foi criar uma lista estruturada de benchmarks de tecnologia que continuam úteis para comparar os atuais sistemas e infraestrutura de IA, abrangendo LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança.
Começamos definindo o escopo do conjunto de dados. Concentramo-nos em benchmarks que medem capacidade de modelo, desempenho de infraestrutura, custo, latência, confiabilidade ou resistência à contaminação. A lista inicial de fontes incluiu os principais provedores de benchmark e análise, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple e Epoch IA, além de sites oficiais de benchmarks, repositórios do GitHub, artigos acadêmicos, páginas de leaderboards e agregadores relevantes de benchmarks de terceiros.
Para cada benchmark, registramos tanto campos descritivos quanto avaliativos. Os campos descritivos capturam o que é o benchmark, o que ele mede, quais produtos ou modelos são avaliados e com que frequência é atualizado. Os campos avaliativos classificam se o benchmark mede desempenho, preço, latência ou confiabilidade. Também coletamos informações sobre a estrutura do benchmark e a integridade dos dados.
Priorizamos fontes primárias sempre que possível. Elas incluíram páginas oficiais de metodologia de benchmark, páginas de leaderboards, repositórios do GitHub, artigos de benchmark e documentação de provedores. Quando uma fonte primária não fornecia um campo específico, usamos fontes secundárias respeitáveis ou agregadores para preencher lacunas, especialmente para as melhores pontuações, cobertura atual de modelos e datas de medição recentes. Colunas de fonte foram incluídas em todo o conjunto de dados para que a evidência de cada valor pudesse ser rastreada até sua origem.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{800+ Principais Benchmarks de IA}},
year = {2026},
month = aug,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Acessado em 17 Agosto 2026}
}Resultados e carimbos de data/hora de 250 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV.
Ela trabalhou anteriormente como recrutadora em empresas de gerenciamento de projetos e consultoria. Sıla possui mestrado em Psicologia Social e bacharelado em Relações Internacionais.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.