Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.

MELHOR MODELO
Claude Opus 5
Índice 86
Melhor custo-benefício
DeepSeek V4 Flash 0731
$0.11 / 1M
Mais rápido
Trinity Large Thinking
0.12s TTFT
Cobertura
151 modelos
12 benchmarks · 697 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Página 1 de 16

Custo$10.00
Latência3.83s
Contexto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Custo$8.00
Latência4.43s
Contexto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Custo$20.00
Latência5.28s
Contexto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Custo$4.50
Latência1.92s
Contexto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Custo$10.00
Latência4.53s
Contexto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Custo$20.00
Latência5.44s
Contexto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Custo$1.50
Latência6.05s
Contexto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Custo$33.75
Latência3.65s
Contexto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Custo$5.44
Latência0.93s
Contexto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Custo$2.00
Latência10.25s
Contexto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Página 1 de 16
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

Cada benchmark torna-se uma posição numa escala de 0 a 100, e o índice é a média ponderada dessas posições. Um benchmark em que o modelo não foi avaliado conta como a média do campo, para que as pontuações continuem comparáveis. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
Público
ARC-AGI-1Raciocinio abstrato com poucos exemplos sobre transformacoes de grades; o primeiro benchmark do ARC Prize.
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
ArxivMathProblemas matematicos recentes do arXiv, executados logo apos a publicacao para limitar a contaminacao.
Público
BioMysteryBenchBenchmark da Anthropic sobre se agentes conseguem resolver misterios reais de bioinformatica a partir de dados brutos.
Público
CritPtProblemas de fisica de nivel de pesquisa que exigem derivacoes em varias etapas.
AIMultiple
FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
Público
Frontier-BenchTarefas de software agenticas em repositorios de fronteira, pontuadas por taxa de resolucao.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
MMMU-ProCompreensao multimodal de nivel universitario entre disciplinas, endurecida contra atalhos apenas textuais.
Público
Terminal-Bench 2.1Tarefas agenticas de terminal em engenharia de software, dados e administracao de sistemas.
Público
Terminal-Bench HardO subconjunto dificil do Terminal-Bench: tarefas de software em varias etapas resolvidas num terminal real.
Público
Terminal-Bench-ScienceTarefas de terminal extraidas de fluxos reais de computacao cientifica.
AIMultiple
Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Google

Gemini 3.8 Flash

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Anthropic

Claude Fable 5.1

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Tencent

Hy4 preview

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Z AI

GLM 5.3 Flash

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Cronologia de lançamentos de modelos de IAÚltimos 12 modelos em 23 dias

Principais lançamentos de modelos de IA dos fornecedores líderes nos últimos 23 dias.

Fornecedor
OpenAI
OpenAI
04 Set 2026
GPT-6 Astra +1 maisGPT-6 AstraGPT-6 Astra Pro
Google
Google
02 Set 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Set 2026
Muse Spark 1.3 +1 maisMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Set 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Alibaba Cloud
Alibaba Cloud
14 Ago 2026
Qwen3.8 27B
26 Ago 2026
Qwen3.8 Flash
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Explore Casos de uso, análises e benchmarks do LLM

LLM Automação: 7 principais ferramentas e 8 estudos de caso

LLM
Análise
27 Ago

A automação de LLM refere-se à mudança para ferramentas de automação inteligente que utilizam LLMs, incluindo agentes de IA, LLMs com fine-tuning e RAG models para automatizar e coordenar tarefas. Explore o que é a automação de LLM, suas principais aplicações na vida real e as principais ferramentas: A utilização de Large language models na…

Leia mais
LLM
Avaliação em Mundo Aberto
26 Ago

Orquestração de LLM: 22 Frameworks e Gateways

Otimizar a orquestração de LLM é essencial para melhorar o desempenho mantendo o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração se comportam na prática, realizamos benchmarks: Descubra ferramentas selecionadas de orquestração de LLM, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar vários Large…

LLM
Benchmark
24 Ago

AIM Enterprise: Benchmark Empresarial Agêntico

As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs mais econômicos, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram todos os arquivos e frequentemente discordaram. Em cerca de um terço das pontuações…

LLM
Benchmark
24 Ago

Text-to-SQL: Comparação da precisão de LLM

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…

LLM
Análise
21 Ago

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…

LLM
Benchmark
21 Ago

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…

LLM
Comparação de Recursos
21 Ago

Principais ferramentas de LLMOps e comparação com MLOps

As plataformas de LLMOps cuidam do lado operacional da execução de grandes modelos de linguagem: implantação, monitoramento, avaliação e gestão de custos. Examinamos as principais ferramentas de LLMOps, seus recursos principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Um detalhamento de…

LLM
Análise
19 Ago

50+ Casos de Uso do ChatGPT com Exemplos da Vida Real

O ChatGPT alcançou aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 A OpenAI ultrapassou US$ 20 bilhões em receita anual em 2025, confirmado pela CFO Sarah Friar.2 O Índice Econômico da Anthropic distingue dois modos de uso: aumento, em que um humano interage com a IA,…

LLM
Análise
19 Ago

ChatGPT para Atendimento ao Cliente: Os 10 Principais Casos de Uso

O ChatGPT passou de novidade a infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir os tempos de resposta, lidar com o volume que suas equipes não conseguem absorver e diminuir o custo das interações rotineiras. Mas os resultados variam bastante dependendo de como ele é implementado. OpenAI lançou GPT-5.6, um modelo consideravelmente…

LLM
Análise
18 Ago

O Futuro dos Grandes Modelos de Linguagem

Veja o futuro dos grandes modelos de linguagem explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam lidar com as limitações dos LLM. Comparação da taxa de sucesso dos LLMs Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas até três…

LLM
Benchmark
16 Ago

Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos

Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference). Para calcular a densidade de inteligência, executamos as seguintes etapas: Consulte a…