Premium
Serviços
Premium

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Como o índice é construído

MELHOR MODELO
Claude Opus 5.5
Índice 100
Melhor custo-benefício
Qwen3.8 Flash
$0.23 / 1M
Mais rápido
MiniMax M2.7
0.15s TTFT
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Página 1 de 13

Custo$8.00
Latência2.81s
Contexto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Custo$20.00
Latência6.31s
Contexto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Custo$20.00
Latência3.84s
Contexto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Custo$0.23
Latência0.85s
Contexto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Custo$0.60
Latência-
Contexto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Custo$0.54
Latência43.98s
Contexto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Custo$2.00
Latência5.26s
Contexto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Custo$20.00
Latência4.35s
Contexto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Custo$10.00
Latência4.03s
Contexto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Custo$4.00
Latência1.36s
Contexto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Página 1 de 13
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados

Como o índice é construído

Cada benchmark é lido como uma posição, não como uma pontuação bruta. Dentro de um benchmark o melhor resultado fica em 100, o pior em 0, e todos os outros modelos caem em algum ponto intermediário. O índice é a média ponderada dessas posições sobre os benchmarks que um modelo realmente executou: um benchmark que ele nunca executou não conta como zero, simplesmente não está lá. Os benchmarks não contam por igual, e o peso de cada um é indicado ao lado dele. Um modelo precisa de resultados em pelo menos dois benchmarks do índice para ser classificado, de modo que um único resultado coloca o modelo na linha daquele benchmark sem lhe dar uma posição própria. Usam-se posições em vez de precisão bruta porque os benchmarks diferem fortemente em dificuldade e escala, e pontuações de benchmarks diferentes não podem partilhar uma média. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmarks que usamos

Público
AA-LCRRaciocinio de contexto longo sobre entradas de multiplos documentos.
AIMultiple
AIM-A-CODE-LLM BenchProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
AIMultiple
AIM-Agentic-RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AIM-FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
AIMultiple
AIM-RELC-BenchRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AIM-Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
Público
APEX-Agents-AATarefas de longo horizonte e multiaplicacao escritas por banqueiros de investimento, consultores e advogados corporativos.
Público
ARC-AGI-1Raciocinio abstrato com poucos exemplos sobre transformacoes de grades; o primeiro benchmark do ARC Prize.
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
ARC-AGI-3Raciocinio interativo: os agentes exploram ambientes de jogo ineditos, definem objetivos ao longo do caminho e aprendem ao longo dos passos. 100% equivale a eficiencia de aprendizagem humana.
Público
ArxivMathProblemas matematicos recentes do arXiv, executados logo apos a publicacao para limitar a contaminacao.
Público
AutomationBench-AATarefas de automacao de escritorio ponta a ponta, pontuadas por conclusao parcial.
Público
BioMysteryBenchBenchmark da Anthropic sobre se agentes conseguem resolver misterios reais de bioinformatica a partir de dados brutos.
Público
BrowseCompFactos dificeis de encontrar na web: perguntas curtas que exigem navegacao persistente.
Público
Convex Coding EvalsEscrita de backends Convex e integracoes de cliente sem diretrizes especificas do framework no prompt.
Público
CritPtProblemas de fisica de nivel de pesquisa que exigem derivacoes em varias etapas.
Público
Crosby RedlineBenchTarefas de revisao contratual pontuadas turno a turno face as edicoes de advogados.
Público
DeepSWE 1.1Tarefas de engenharia de longo horizonte de repositorios open source ativos, avaliadas sobre o codigo submetido num ambiente limpo.
Público
EnterpriseOps-Gym-AAPlaneamento agentico com estado e uso de ferramentas em oito sistemas empresariais.
Público
Frontier-BenchTarefas de software agenticas em repositorios de fronteira, pontuadas por taxa de resolucao.
Público
FrontierCodeSe uma alteracao e integravel, nao apenas se passa nos testes: seguranca contra regressoes, ambito e manutencao avaliados por rubrica.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
GDPvalEntregaveis reais de 44 profissoes nos nove maiores setores do PIB dos EUA, avaliados as cegas por profissionais experientes face a uma referencia humana.
Público
GPQA DiamondQuestoes cientificas de pos-graduacao, a prova de busca, que exigem raciocinio profundo.
Público
Harvey LAB-AAO benchmark de agentes juridicos da Harvey, pontuado por sucesso com todas as etapas aprovadas.
Público
HealthBench ProfessionalConversas escritas por medicos avaliadas com rubricas escritas por medicos, na particao profissional.
Público
HieroglyphBenchLeitura de hieroglifos egipcios a partir de imagens, pontuada pela precisao dos sinais.
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
IFBenchCumprimento preciso de instrucoes em 58 restricoes de saida verificaveis ineditas.
Público
ITBench-AACenarios reais de automacao de TI em confiabilidade de sistemas, FinOps e operacoes de seguranca.
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
Público
MMMU-ProCompreensao multimodal de nivel universitario entre disciplinas, endurecida contra atalhos apenas textuais.
Público
ObviousBenchQuestoes de resposta obvia que os modelos ainda assim erram; pontuacao pass ao cubo.
Público
Opus Magnum BenchProjeto de maquinas funcionais no jogo de puzzles Opus Magnum.
Público
ReactBenchConstrucao e correcao de componentes React, pontuado com pass@1.
Público
RuneBenchLeitura e raciocinio sobre uma escrita runica inventada que o modelo nunca viu, pontuado em escala logaritmica.
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
SimpleBenchQuestoes de raciocinio cotidiano em que humanos superam consistentemente os modelos de fronteira.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
Tau2-Bench TelecomAgentes de suporte ao cliente que usam ferramentas no dominio de telecomunicacoes, avaliados por sucesso na tarefa.
Público
Tau3-BankingAgentes que usam ferramentas em fluxos realistas de atendimento bancario.
Público
Terminal-Bench 2.1Tarefas agenticas de terminal em engenharia de software, dados e administracao de sistemas.
Público
Terminal-Bench 4.0A geracao atual do Terminal-Bench: tarefas agenticas de terminal pontuadas por taxa de resolucao.
Público
Terminal-Bench HardO subconjunto dificil do Terminal-Bench: tarefas de software em varias etapas resolvidas num terminal real.
Público
Terminal-Bench-ScienceTarefas de terminal extraidas de fluxos reais de computacao cientifica.

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Anthropic

Claude Opus 5.5

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Luna

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Cronologia de lançamentos de LLMO ritmo da inovação em IA
Laboratórios de IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 maisQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 maisQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 maisQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 maisQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 maisGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 maisGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 jul 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 maisGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 maisMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 maisMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Explore Casos de uso, análises e benchmarks do LLM

LLM Parameters: GPT-5 High, Medium, Low and Minimal

LLM
Análise
21 ago

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…

Leia mais
LLM
Comparação de Recursos
21 ago

Principais ferramentas de LLMOps e comparação com MLOps

As plataformas de LLMOps cuidam do lado operacional da execução de grandes modelos de linguagem: implantação, monitoramento, avaliação e gestão de custos. Examinamos as principais ferramentas de LLMOps, seus recursos principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Um detalhamento de…

LLM
Análise
19 ago

50+ Casos de Uso do ChatGPT com Exemplos da Vida Real

O ChatGPT alcançou aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 A OpenAI ultrapassou US$ 20 bilhões em receita anual em 2025, confirmado pela CFO Sarah Friar.2 O Índice Econômico da Anthropic distingue dois modos de uso: aumento, em que um humano interage com a IA,…

LLM
Análise
19 ago

ChatGPT para Atendimento ao Cliente: Os 10 Principais Casos de Uso

O ChatGPT passou de novidade a infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir os tempos de resposta, lidar com o volume que suas equipes não conseguem absorver e diminuir o custo das interações rotineiras. Mas os resultados variam bastante dependendo de como ele é implementado. OpenAI lançou GPT-5.6, um modelo consideravelmente…

LLM
Benchmark
16 ago

Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos

Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference). Para calcular a densidade de inteligência, executamos as seguintes etapas: Consulte a…

LLM
Benchmark
12 ago

LLM Benchmark de Latência por Casos de Uso

Fizemos o benchmark de 11 dos principais modelos de linguagem de grande escala com um total de 1.320 pedidos, dividindo modelos de raciocínio e não-raciocínio, e medimos a latência do primeiro token, a latência por token e o tempo total de resposta. Pode encontrar detalhes sobre como medimos a latência aqui. Relatamos modelos de raciocínio…

LLM
Benchmark
15 abr

LLM Quantização: BF16 vs FP8 vs INT4

Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…