Premium
Serviços
Premium

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Como o índice é construído

MELHOR MODELO
Claude Opus 5.5
Índice 100
Melhor custo-benefício
Qwen3.8 Flash
$0.23 / 1M
Mais rápido
MiniMax M2.7
0.15s TTFT
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Página 1 de 13

Custo$8.00
Latência2.81s
Contexto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Custo$20.00
Latência6.31s
Contexto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Custo$20.00
Latência3.84s
Contexto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Custo$0.23
Latência0.85s
Contexto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Custo$0.60
Latência-
Contexto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Custo$0.54
Latência43.98s
Contexto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Custo$2.00
Latência5.26s
Contexto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Custo$20.00
Latência4.35s
Contexto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Custo$10.00
Latência4.03s
Contexto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Custo$4.00
Latência1.36s
Contexto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Página 1 de 13
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados

Como o índice é construído

Cada benchmark é lido como uma posição, não como uma pontuação bruta. Dentro de um benchmark o melhor resultado fica em 100, o pior em 0, e todos os outros modelos caem em algum ponto intermediário. O índice é a média ponderada dessas posições sobre os benchmarks que um modelo realmente executou: um benchmark que ele nunca executou não conta como zero, simplesmente não está lá. Os benchmarks não contam por igual, e o peso de cada um é indicado ao lado dele. Um modelo precisa de resultados em pelo menos dois benchmarks do índice para ser classificado, de modo que um único resultado coloca o modelo na linha daquele benchmark sem lhe dar uma posição própria. Usam-se posições em vez de precisão bruta porque os benchmarks diferem fortemente em dificuldade e escala, e pontuações de benchmarks diferentes não podem partilhar uma média. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmarks que usamos

Público
AA-LCRRaciocinio de contexto longo sobre entradas de multiplos documentos.
AIMultiple
AIM-A-CODE-LLM BenchProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
AIMultiple
AIM-Agentic-RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AIM-FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
AIMultiple
AIM-RELC-BenchRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AIM-Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
Público
APEX-Agents-AATarefas de longo horizonte e multiaplicacao escritas por banqueiros de investimento, consultores e advogados corporativos.
Público
ARC-AGI-1Raciocinio abstrato com poucos exemplos sobre transformacoes de grades; o primeiro benchmark do ARC Prize.
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
ARC-AGI-3Raciocinio interativo: os agentes exploram ambientes de jogo ineditos, definem objetivos ao longo do caminho e aprendem ao longo dos passos. 100% equivale a eficiencia de aprendizagem humana.
Público
ArxivMathProblemas matematicos recentes do arXiv, executados logo apos a publicacao para limitar a contaminacao.
Público
AutomationBench-AATarefas de automacao de escritorio ponta a ponta, pontuadas por conclusao parcial.
Público
BioMysteryBenchBenchmark da Anthropic sobre se agentes conseguem resolver misterios reais de bioinformatica a partir de dados brutos.
Público
BrowseCompFactos dificeis de encontrar na web: perguntas curtas que exigem navegacao persistente.
Público
Convex Coding EvalsEscrita de backends Convex e integracoes de cliente sem diretrizes especificas do framework no prompt.
Público
CritPtProblemas de fisica de nivel de pesquisa que exigem derivacoes em varias etapas.
Público
Crosby RedlineBenchTarefas de revisao contratual pontuadas turno a turno face as edicoes de advogados.
Público
DeepSWE 1.1Tarefas de engenharia de longo horizonte de repositorios open source ativos, avaliadas sobre o codigo submetido num ambiente limpo.
Público
EnterpriseOps-Gym-AAPlaneamento agentico com estado e uso de ferramentas em oito sistemas empresariais.
Público
Frontier-BenchTarefas de software agenticas em repositorios de fronteira, pontuadas por taxa de resolucao.
Público
FrontierCodeSe uma alteracao e integravel, nao apenas se passa nos testes: seguranca contra regressoes, ambito e manutencao avaliados por rubrica.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
GDPvalEntregaveis reais de 44 profissoes nos nove maiores setores do PIB dos EUA, avaliados as cegas por profissionais experientes face a uma referencia humana.
Público
GPQA DiamondQuestoes cientificas de pos-graduacao, a prova de busca, que exigem raciocinio profundo.
Público
Harvey LAB-AAO benchmark de agentes juridicos da Harvey, pontuado por sucesso com todas as etapas aprovadas.
Público
HealthBench ProfessionalConversas escritas por medicos avaliadas com rubricas escritas por medicos, na particao profissional.
Público
HieroglyphBenchLeitura de hieroglifos egipcios a partir de imagens, pontuada pela precisao dos sinais.
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
IFBenchCumprimento preciso de instrucoes em 58 restricoes de saida verificaveis ineditas.
Público
ITBench-AACenarios reais de automacao de TI em confiabilidade de sistemas, FinOps e operacoes de seguranca.
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
Público
MMMU-ProCompreensao multimodal de nivel universitario entre disciplinas, endurecida contra atalhos apenas textuais.
Público
ObviousBenchQuestoes de resposta obvia que os modelos ainda assim erram; pontuacao pass ao cubo.
Público
Opus Magnum BenchProjeto de maquinas funcionais no jogo de puzzles Opus Magnum.
Público
ReactBenchConstrucao e correcao de componentes React, pontuado com pass@1.
Público
RuneBenchLeitura e raciocinio sobre uma escrita runica inventada que o modelo nunca viu, pontuado em escala logaritmica.
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
SimpleBenchQuestoes de raciocinio cotidiano em que humanos superam consistentemente os modelos de fronteira.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
Tau2-Bench TelecomAgentes de suporte ao cliente que usam ferramentas no dominio de telecomunicacoes, avaliados por sucesso na tarefa.
Público
Tau3-BankingAgentes que usam ferramentas em fluxos realistas de atendimento bancario.
Público
Terminal-Bench 2.1Tarefas agenticas de terminal em engenharia de software, dados e administracao de sistemas.
Público
Terminal-Bench 4.0A geracao atual do Terminal-Bench: tarefas agenticas de terminal pontuadas por taxa de resolucao.
Público
Terminal-Bench HardO subconjunto dificil do Terminal-Bench: tarefas de software em varias etapas resolvidas num terminal real.
Público
Terminal-Bench-ScienceTarefas de terminal extraidas de fluxos reais de computacao cientifica.

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Anthropic

Claude Opus 5.5

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Luna

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Cronologia de lançamentos de LLMO ritmo da inovação em IA
Laboratórios de IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 maisQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 maisQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 maisQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 maisQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 maisGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 maisGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 jul 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 maisGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 maisMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 maisMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Explore Casos de uso, análises e benchmarks do LLM

Text-to-SQL: Comparação da precisão de LLM

LLM
Benchmark
25 set

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…

Leia mais
LLM
Análise
25 set

LLM Participação de Mercado: Compare Uso e Adoção

Analisámos a participação de mercado dos LLMs combinando dados baseados em uso e estimativas de visitas web para mostrar como a procura por grandes modelos de linguagem está distribuída pelos laboratórios de IA e aplicações de IA: Leia a metodologia para ver como medimos e calculámos estes resultados. Os Estados Unidos dominaram as visitas web…

LLM
Benchmark
24 set

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e de múltiplas etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…

LLM
Benchmark
21 set

Comparar Modelos de IA Multimodais em Raciocínio Visual

Avaliámos 15 modelos de IA multimodais líderes em raciocínio visual utilizando 200 perguntas baseadas em imagens. A avaliação consistiu em duas pistas: 100 perguntas de compreensão de gráficos testando a interpretação de visualizações de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e o raciocínio espacial. Cada pergunta foi executada 5…

LLM
Análise
21 set

Modelos Multimodais Grandes (LMMs) vs LLMs

Avaliamos o desempenho de Modelos Multimodais Grandes (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Ao analisar um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos no processamento e raciocínio com dados multimodais no domínio financeiro. A seção de metodologia fornece percepções detalhadas sobre o dataset e o…

LLM
Análise
21 set

LLM Calculadora de VRAM para Auto-Hospedagem

Auto-hospedar um LLM significa executar a inferência em hardware que o operador controla, em vez de via uma API de terceiros, o que altera o custo, o controle de dados e o perfil de privacidade. O fato de um modelo executar ou não depende da memória. A calculadora estima a VRAM ou memória unificada que…

LLM
Benchmark
18 set

TI Agêntica: Podem os Agentes de IA Conceber um Benchmark

Testámos 16 models na conceção de um benchmark em text-to-SQL e chamada de ferramentas. Cada model criou um benchmark por tópico, num total de 32 submissões. Nenhuma submissão passou em todos os critérios da rubrica. Os agentes conseguiram criar e executar testes, mas nenhum demonstrou simultaneamente um teste de resposta em branco e um teste…

LLM
Benchmark
17 set

AIM Enterprise: Benchmark Empresarial Agêntico

As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, projetamos o AIM Enterprise, um benchmark empresarial agêntico, no qual usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram cada arquivo que passou nas verificações. Em 32,7% das pontuações individuais,…

LLM
Análise
17 set

O Futuro dos Large Language Models

Veja o futuro dos large language models explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam resolver as limitações do LLM. Comparação da taxa de sucesso dos LLM’s Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas até a terceira casa…

LLM
Benchmark
15 set

Grandes Modelos de Linguagem em Cibersegurança

Avaliamos 7 grandes modelos de linguagem em 9 domínios de cibersegurança usando o SecBench, um benchmark de grande escala e multiformato para tarefas de segurança. Testamos cada modelo em 44.823 perguntas de múltipla escolha (MCQs) e 3.087 perguntas de resposta curta (SAQs), abrangendo segurança de dados, gerenciamento de identidade e acesso, segurança de rede, gerenciamento…

LLM
Análise
15 set

Leis de Escala de LLM: Análise de Pesquisadores de IA

Grandes models de linguagem preveem o próximo token com base em padrões aprendidos a partir de dados de texto. O termo LLM leis de escala refere-se a regularidades empíricas que vinculam o desempenho do model à quantidade de computação, dados de treinamento e parâmetros do model usados durante o treinamento. Para entender como essas relações…