Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple.

Última atualização Jun 2026
MELHOR MODELO
Claude Fable 5
Índice 92
Melhor custo-benefício
MiniMax M3
$0.42 / 1M
Mais rápido
GPT OSS 120B
0.19s TTFT
Cobertura
64 modelos
8 benchmarks · 336 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Custo$20.00
Latência3.98s
Contexto1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Custo$6.00
Latência252.11s
Contexto1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Custo$11.25
Latência2.47s
Contexto1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Custo$3.00
Latência10.26s
Contexto500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Custo$11.25
Latência1.03s
Contexto272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Custo$5.63
Latência1.92s
Contexto1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Custo$11.25
Latência11.46s
Contexto1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Custo$10.00
Latência1.75s
Contexto1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Custo$4.50
Latência-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Custo$4.50
Latência33.83s
Contexto1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7

Gráficos

Modelos seguindo "Melhor desempenho"

Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Moonshot AI

Kimi K3

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Terra

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Explore Casos de uso, análises e benchmarks do LLM

Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?

LLM
Benchmark
22 Jun

No marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar a sua eficácia na antecipação das necessidades da audiência e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de audiências virtuais, ajudando as organizações a antecipar reações…

Leia mais
LLM
Benchmark
15 Jun

Gateways de IA para OpenAI: Alternativas ao OpenRouter

Realizamos um benchmark de OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API em três indicadores (latência do primeiro token, latência total e contagem de tokens de saída), com 300 testes utilizando prompts curtos (aprox. 18 tokens) e prompts longos (aprox. 203 tokens) para a latência total. Se planeia utilizar um destes gateways de IA, pode: Neste…

LLM
Benchmark
5 Jun

Modelos de Linguagem Grandes em Cibersegurança

Avaliamos 7 modelos de linguagem grandes em 9 domínios de cibersegurança usando o SecBench, um benchmark de grande escala e multi-formato para tarefas de segurança. Testamos cada modelo em 44.823 perguntas de múltipla escolha (MCQs) e 3.087 perguntas de resposta curta (SAQs), cobrindo áreas como segurança de dados, gestão de identidade e acesso, segurança de…

LLM
Análise
26 Mai

ChatGPT para Atendimento ao Cliente: Top 10 Casos de Uso

ChatGPT passou de novidade para infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir tempos de resposta, lidar com volumes que suas equipes não conseguem absorver e reduzir o custo de interações rotineiras. Mas os resultados variam drasticamente dependendo de como é implementado. OpenAI lançou GPT-5.2, um modelo materialmente mais capaz que é…

LLM
Benchmark
15 Abr

LLM Quantização: BF16 vs FP8 vs INT4

Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…