Premium
Serviços
Premium

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Como o índice é construído

MELHOR MODELO
Claude Opus 5.5
Índice 100
Melhor custo-benefício
Qwen3.8 Flash
$0.23 / 1M
Mais rápido
MiniMax M2.7
0.15s TTFT
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Página 1 de 13

Custo$8.00
Latência2.81s
Contexto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Custo$20.00
Latência6.31s
Contexto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Custo$20.00
Latência3.84s
Contexto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Custo$0.23
Latência0.85s
Contexto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Custo$0.60
Latência-
Contexto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Custo$0.54
Latência43.98s
Contexto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Custo$2.00
Latência5.26s
Contexto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Custo$20.00
Latência4.35s
Contexto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Custo$10.00
Latência4.03s
Contexto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Custo$4.00
Latência1.36s
Contexto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Página 1 de 13
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados

Como o índice é construído

Cada benchmark é lido como uma posição, não como uma pontuação bruta. Dentro de um benchmark o melhor resultado fica em 100, o pior em 0, e todos os outros modelos caem em algum ponto intermediário. O índice é a média ponderada dessas posições sobre os benchmarks que um modelo realmente executou: um benchmark que ele nunca executou não conta como zero, simplesmente não está lá. Os benchmarks não contam por igual, e o peso de cada um é indicado ao lado dele. Um modelo precisa de resultados em pelo menos dois benchmarks do índice para ser classificado, de modo que um único resultado coloca o modelo na linha daquele benchmark sem lhe dar uma posição própria. Usam-se posições em vez de precisão bruta porque os benchmarks diferem fortemente em dificuldade e escala, e pontuações de benchmarks diferentes não podem partilhar uma média. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmarks que usamos

Público
AA-LCRRaciocinio de contexto longo sobre entradas de multiplos documentos.
AIMultiple
AIM-A-CODE-LLM BenchProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
AIMultiple
AIM-Agentic-RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AIM-FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
AIMultiple
AIM-RELC-BenchRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AIM-Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
Público
APEX-Agents-AATarefas de longo horizonte e multiaplicacao escritas por banqueiros de investimento, consultores e advogados corporativos.
Público
ARC-AGI-1Raciocinio abstrato com poucos exemplos sobre transformacoes de grades; o primeiro benchmark do ARC Prize.
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
ARC-AGI-3Raciocinio interativo: os agentes exploram ambientes de jogo ineditos, definem objetivos ao longo do caminho e aprendem ao longo dos passos. 100% equivale a eficiencia de aprendizagem humana.
Público
ArxivMathProblemas matematicos recentes do arXiv, executados logo apos a publicacao para limitar a contaminacao.
Público
AutomationBench-AATarefas de automacao de escritorio ponta a ponta, pontuadas por conclusao parcial.
Público
BioMysteryBenchBenchmark da Anthropic sobre se agentes conseguem resolver misterios reais de bioinformatica a partir de dados brutos.
Público
BrowseCompFactos dificeis de encontrar na web: perguntas curtas que exigem navegacao persistente.
Público
Convex Coding EvalsEscrita de backends Convex e integracoes de cliente sem diretrizes especificas do framework no prompt.
Público
CritPtProblemas de fisica de nivel de pesquisa que exigem derivacoes em varias etapas.
Público
Crosby RedlineBenchTarefas de revisao contratual pontuadas turno a turno face as edicoes de advogados.
Público
DeepSWE 1.1Tarefas de engenharia de longo horizonte de repositorios open source ativos, avaliadas sobre o codigo submetido num ambiente limpo.
Público
EnterpriseOps-Gym-AAPlaneamento agentico com estado e uso de ferramentas em oito sistemas empresariais.
Público
Frontier-BenchTarefas de software agenticas em repositorios de fronteira, pontuadas por taxa de resolucao.
Público
FrontierCodeSe uma alteracao e integravel, nao apenas se passa nos testes: seguranca contra regressoes, ambito e manutencao avaliados por rubrica.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
GDPvalEntregaveis reais de 44 profissoes nos nove maiores setores do PIB dos EUA, avaliados as cegas por profissionais experientes face a uma referencia humana.
Público
GPQA DiamondQuestoes cientificas de pos-graduacao, a prova de busca, que exigem raciocinio profundo.
Público
Harvey LAB-AAO benchmark de agentes juridicos da Harvey, pontuado por sucesso com todas as etapas aprovadas.
Público
HealthBench ProfessionalConversas escritas por medicos avaliadas com rubricas escritas por medicos, na particao profissional.
Público
HieroglyphBenchLeitura de hieroglifos egipcios a partir de imagens, pontuada pela precisao dos sinais.
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
IFBenchCumprimento preciso de instrucoes em 58 restricoes de saida verificaveis ineditas.
Público
ITBench-AACenarios reais de automacao de TI em confiabilidade de sistemas, FinOps e operacoes de seguranca.
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
Público
MMMU-ProCompreensao multimodal de nivel universitario entre disciplinas, endurecida contra atalhos apenas textuais.
Público
ObviousBenchQuestoes de resposta obvia que os modelos ainda assim erram; pontuacao pass ao cubo.
Público
Opus Magnum BenchProjeto de maquinas funcionais no jogo de puzzles Opus Magnum.
Público
ReactBenchConstrucao e correcao de componentes React, pontuado com pass@1.
Público
RuneBenchLeitura e raciocinio sobre uma escrita runica inventada que o modelo nunca viu, pontuado em escala logaritmica.
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
SimpleBenchQuestoes de raciocinio cotidiano em que humanos superam consistentemente os modelos de fronteira.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
Tau2-Bench TelecomAgentes de suporte ao cliente que usam ferramentas no dominio de telecomunicacoes, avaliados por sucesso na tarefa.
Público
Tau3-BankingAgentes que usam ferramentas em fluxos realistas de atendimento bancario.
Público
Terminal-Bench 2.1Tarefas agenticas de terminal em engenharia de software, dados e administracao de sistemas.
Público
Terminal-Bench 4.0A geracao atual do Terminal-Bench: tarefas agenticas de terminal pontuadas por taxa de resolucao.
Público
Terminal-Bench HardO subconjunto dificil do Terminal-Bench: tarefas de software em varias etapas resolvidas num terminal real.
Público
Terminal-Bench-ScienceTarefas de terminal extraidas de fluxos reais de computacao cientifica.

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Anthropic

Claude Opus 5.5

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-6 Luna

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Cronologia de lançamentos de LLMO ritmo da inovação em IA
Laboratórios de IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 maisQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 maisQwen3.8 2.4T A95BQwen3.8 27B
03 set 2026
Qwen3.8 Flash +1 maisQwen3.8 FlashQwen3.8 Max (0902)
23 set 2026
Qwen3.8 Max Prime +1 maisQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 maisGLM 5.3GLM 5.3 Flash
23 set 2026
GLM 5.3 FlashX +1 maisGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 jul 2026
Claude Opus 5
01 set 2026
Claude Fable 5.1
22 set 2026
Claude Opus 5.5
OpenAI
OpenAI
22 set 2026
GPT-6 Astra +2 maisGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 set 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 set 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 maisMuse Glimmer 30BMuse Spark 1.2
02 set 2026
Muse Spark 1.2 Contributor +2 maisMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 set 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Explore Casos de uso, análises e benchmarks do LLM

Compare 9 grandes modelos de linguagem na saúde

LLM
Comparação de Recursos
15 set

Avaliamos 9 LLMs usando o dataset MedQA, um benchmark de exame clínico de nível de pós-graduação derivado das perguntas do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha usando um prompt padronizado, permitindo a comparação direta da precisão. Também registramos a latência por pergunta dividindo o tempo total de execução pelo número…

Leia mais
LLM
Benchmark
15 set

Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?

Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…

LLM
Benchmark
15 set

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…

LLM
Benchmark
15 set

Gateways de IA para OpenAI: OpenRouter Alternativas

Avaliamos OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API em três indicadores (latência do primeiro token, latência total e contagem de tokens de saída), com 300 testes usando prompts curtos (aprox. 18 tokens) e prompts longos (aprox. 203 tokens) para latência total. Se você planeja usar um desses gateways de IA, você pode: Neste benchmark, comparamos…

LLM
Análise
2 set

LLM Ferramentas de Observabilidade: Weights & Biases, Langsmith

Aplicações de LLM expandiram-se de chats de turno único para agentes de várias etapas que usam ferramentas, consultam bancos de dados e coordenam com outros modelos, tornando seu comportamento mais difícil de interpretar. A observabilidade de LLM fornece visibilidade contínua nesses fluxos de trabalho complexos, ajudando as organizações a monitorar a qualidade, detectar falhas, solucionar…

LLM
Comparação de Recursos
2 set

Cloud LLM vs Local LLMs: Exemplos & Benefícios

Os LLMs na nuvem, alimentados por modelos avançados como GPT-5.5 e Claude Opus 4.7, oferecem escalabilidade e acessibilidade. Por outro lado, os LLMs locais, impulsionados por modelos de código aberto como Llama 4, DeepSeek V4 e Qwen3.6-Plus, garantem maior privacidade e personalização. Explore o que são LLMs na nuvem, pontos fortes e fracos, estudos de…

LLM
Análise
1 set

LLM Guia de Fine‑Tuning para Empresas

Siga os links para soluções específicas para seus desafios de saída de LLM. Se o seu LLM: A ampla adoção de large language models (LLMs) melhorou nossa capacidade de processar a linguagem humana. No entanto, seu treinamento genérico frequentemente resulta em desempenho abaixo do ideal para tarefas específicas. Para superar essa limitação, métodos de fine‑tuning…

LLM
Análise
1 set

10+ Exemplos de Grandes Modelos de Linguagem

Reunimos benchmarks de código aberto para comparar os principais grandes modelos de linguagem proprietários e de código aberto. Escolha o seu caso de uso para encontrar o modelo certo. Você pode avaliar grandes modelos de linguagem examinando o seu desempenho em benchmarks e a latência no mundo real (disponível ao clicar no nome de cada…

LLM
Comparação de Recursos
27 ago

Preços de LLM: Top 15+ provedores comparados

A precificação de LLM abrange quatro ordens de magnitude: os modelos mais baratos foram lançados abaixo de US$ 0.03 por milhão de tokens, enquanto os níveis de raciocínio de fronteira foram lançados por até US$ 262.50. O gráfico abaixo acompanha os preços de lançamento: cada ponto é o preço médio dos modelos de uma classe…

LLM
Análise
27 ago

LLM Automação: 7 principais ferramentas e 8 estudos de caso

A automação de LLM refere-se à mudança para ferramentas de automação inteligente que utilizam LLMs, incluindo agentes de IA, LLMs com fine-tuning e RAG models para automatizar e coordenar tarefas. Explore o que é a automação de LLM, suas principais aplicações na vida real e as principais ferramentas: A utilização de Large language models na…

LLM
Avaliação em Mundo Aberto
26 ago

Orquestração de LLM: 22 Frameworks e Gateways

Otimizar a orquestração de LLM é essencial para melhorar o desempenho mantendo o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração se comportam na prática, realizamos benchmarks: Descubra ferramentas selecionadas de orquestração de LLM, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar vários Large…