Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.

MELHOR MODELO
Claude Fable 5
Índice 92
Melhor custo-benefício
MiniMax M3
$0.42 / 1M
Mais rápido
GPT OSS 120B
0.23s TTFT
Cobertura
64 modelos
8 benchmarks · 336 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Custo$20.00
Latência4.02s
Contexto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Custo$6.00
Latência2.93s
Contexto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Custo$11.25
Latência4.31s
Contexto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Custo$3.00
Latência7.25s
Contexto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Custo$11.25
Latência0.70s
Contexto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Custo$4.50
Latência1.62s
Contexto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Custo$11.25
Latência11.11s
Contexto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Custo$10.00
Latência1.71s
Contexto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Custo$4.50
Latência-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Custo$4.50
Latência22.02s
Contexto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

AIMultiple
FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
AIMultiple
Agentic RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AI MemoryRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AI HallucinationResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
AIMultiple
Agentic LLM BenchmarkProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Moonshot AI

Kimi K3

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Terra

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Explore Casos de uso, análises e benchmarks do LLM

LLM Participação de Mercado: Compare Uso e Adoção

LLM
Análise
2 Jul

Analisámos a participação de mercado dos LLMs combinando dados baseados em uso e estimativas de visitas web para mostrar como a procura por grandes modelos de linguagem está distribuída pelos laboratórios de IA e aplicações de IA: Leia a metodologia para ver como medimos e calculámos estes resultados. Os Estados Unidos dominaram as visitas web…

Leia mais
LLM
Análise
26 Jun

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…

LLM
Análise
25 Jun

O Futuro dos Grandes Modelos de Linguagem

Veja o futuro dos grandes modelos de linguagem explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam resolver as limitações dos LLM. Comparação da taxa de sucesso dos LLM’s Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas em três casas…

LLM
Análise
22 Jun

10+ Exemplos de Grandes Modelos de Linguagem

Reunimos benchmarks de código aberto para comparar os principais grandes modelos de linguagem proprietários e de código aberto. Escolha o seu caso de uso para encontrar o modelo certo. Você pode avaliar grandes modelos de linguagem examinando o seu desempenho em benchmarks e a latência no mundo real (disponível ao clicar no nome de cada…

LLM
Comparação de Recursos
22 Jun

Cloud LLM vs Local LLMs: Exemplos & Benefícios

Os LLMs na nuvem, alimentados por modelos avançados como GPT-5.5 e Claude Opus 4.7, oferecem escalabilidade e acessibilidade. Por outro lado, os LLMs locais, impulsionados por modelos de código aberto como Llama 4, DeepSeek V4 e Qwen3.6-Plus, garantem maior privacidade e personalização. Explore o que são LLMs na nuvem, pontos fortes e fracos, estudos de…

LLM
Benchmark
5 Jun

Modelos de Linguagem Grandes em Cibersegurança

Avaliamos 7 modelos de linguagem grandes em 9 domínios de cibersegurança usando o SecBench, um benchmark de grande escala e multi-formato para tarefas de segurança. Testamos cada modelo em 44.823 perguntas de múltipla escolha (MCQs) e 3.087 perguntas de resposta curta (SAQs), cobrindo áreas como segurança de dados, gestão de identidade e acesso, segurança de…

LLM
Benchmark
15 Abr

LLM Quantização: BF16 vs FP8 vs INT4

Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…