Curamos uma lista com mais de 200 benchmarks de IA para LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança que ainda não estão saturados.
Crescimento dos benchmarks de IA
Constatamos que a atividade de benchmarking se manteve bastante baixa e estável ao longo de 2024–2025, aumentando depois no início de 2026. Isto reflete o rápido crescimento dos sistemas de IA que requerem avaliação, especialmente à medida que os modelos se tornaram mais capazes em programação, raciocínio, tarefas multimodais, capacidades de agentes e casos de uso empresarial.
Benchmarks de IA por categorias
Listamos os benchmarks de IA com base nas suas categorias principais. Os benchmarks de LLM são os líderes em termos do maior número de benchmarks.
Benchmarks de IA por subcategorias
Lista de benchmarks de IA
Leia a nossa metodologia para saber como compilamos esta lista.
Notas sobre como ler a lista:
As quatro colunas com indicadores booleanos (V = verdadeiro, F = falso) indicam qual a dimensão de avaliação que cada benchmark abrange. Cada indicador responde a uma pergunta de sim/não sobre o âmbito do benchmark:
- Desempenho (V/F): O benchmark avalia a capacidade ou qualidade, como a precisão do output, a conclusão de tarefas ou a inteligência? Está marcado como V para quase todos os benchmarks, uma vez que a maioria avalia o quão bem um modelo ou sistema executa. Está marcado como F para benchmarks focados puramente no custo ou velocidade e que não avaliam a qualidade do output.
- Preço (V/F): O benchmark inclui fatores relacionados com o custo, como dólares por token, preço por débito ou custo por tarefa?
- Latência (V/F): O benchmark mede a velocidade, como tokens por segundo, tempo até ao primeiro token, débito ou tempo de resposta? É F para benchmarks que avaliam a correção, independentemente do tempo que a resposta demora.
- Confiabilidade (V/F): O benchmark avalia a consistência ou a fiabilidade, como a variância entre execuções, a estabilidade das taxas de sucesso ou a robustez? Este é o indicador menos comum. É V para benchmarks concebidos para este fim, incluindo HAL Reliability, tau-bench/tau2-bench, METR Time Horizons e vários benchmarks de agentes nos quais a consistência da taxa de aprovação é central. É F para a maioria das tabelas de classificação que reportam uma única pontuação geral.
- Resistente a contaminação (V/F): Indica se o benchmark foi concebido para reduzir o risco de contaminação de dados, onde as perguntas de teste aparecem nos dados de treino de um modelo e o modelo alcança pontuações elevadas por memorização e não por capacidade genuína. V significa que o benchmark tem uma defesa significativa, como um conjunto oculto, perguntas recentemente geradas ou rotativas, atualizações mensais, itens autogerados ou problemas de competição publicados após o fim do período de treino do modelo. F significa que o benchmark é um conjunto de dados público fixo que está online há anos e pode ter sido absorvido pelos corpora de treino. Nestes casos, as pontuações elevadas devem ser interpretadas com maior cautela.
Na prática, uma linha marcada como V/F/F/F representa um benchmark puro de qualidade. Em contrapartida, um benchmark marcado como V/V/V/V/F avalia a qualidade, o custo e a velocidade em conjunto. Estes indicadores fornecem uma taxonomia compacta que mostra quais dos quatro eixos de avaliação cada benchmark abrange.
Por que razão algumas células estão em branco?
Resistente a contaminação e Fonte de contaminação: Estes dois campos estão geralmente em branco para os mesmos tipos de linhas, especialmente benchmarks de GPU, GPU em nuvem, velocidade e preço. A resistência à contaminação é relevante para benchmarks de conhecimento e raciocínio, nos quais um modelo pode ter memorizado perguntas de teste dos dados de treino. Para benchmarks de débito de hardware, latência ou preço, não há perguntas de teste para contaminar, pelo que o campo é deixado em branco em vez de ser marcado como V ou F.
Metodologia dos benchmarks de IA
Recolhemos os dados dos benchmarks através de um processo de pesquisa e validação online. O objetivo era construir uma lista estruturada de benchmarks tecnológicos que permanecessem úteis para comparar sistemas e infraestruturas de IA atuais, abrangendo LLMs, GPUs, GPUs em nuvem, agentes de IA, IA tabular e cibersegurança.
Começamos por definir o âmbito do conjunto de dados. Focamo-nos em benchmarks que medem a capacidade do modelo, o desempenho da infraestrutura, o custo, a latência, a confiabilidade ou a resistência à contaminação. A lista inicial de fontes incluiu os principais fornecedores de benchmarks e análises, como Artificial Analysis, SemiAnalysis, Vals IA, LMArena, AIMultiple e Epoch IA, bem como websites oficiais de benchmarks, repositórios do GitHub, artigos académicos, páginas de tabelas de classificação e agregadores de benchmarks de terceiros relevantes.
Para cada benchmark, registamos campos descritivos e avaliativos. Os campos descritivos capturam o que o benchmark é, o que mede, quais produtos ou modelos são avaliados e com que frequência é atualizado. Os campos avaliativos classificam se o benchmark mede desempenho, preço, latência ou confiabilidade. Também recolhemos informações sobre a estrutura do benchmark e a integridade dos dados.
Sempre que possível, demos prioridade às fontes primárias. Estas incluíam páginas oficiais de metodologia dos benchmarks, páginas de tabelas de classificação, repositórios do GitHub, artigos dos benchmarks e documentação dos fornecedores. Quando uma fonte primária não fornecia um campo específico, utilizámos fontes secundárias ou agregadores de renome para preencher as lacunas, especialmente para as pontuações máximas, a cobertura atual de modelos e as datas de medição recentes. Foram incluídas colunas de origem em todo o conjunto de dados para que a evidência de cada valor pudesse ser rastreada até à sua fonte.
Cite esta pesquisa
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{ermut2026,
author = {Ermut, Sıla},
title = {{200+ Principais Benchmarks de IA}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/ai-benchmarks}},
note = {AIMultiple. Acessado em 8 Julho 2026}
}
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.