Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.

MELHOR MODELO
Claude Fable 5
Índice 92
Melhor custo-benefício
MiniMax M3
$0.42 / 1M
Mais rápido
GPT OSS 120B
0.23s TTFT
Cobertura
64 modelos
8 benchmarks · 336 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Custo$20.00
Latência4.02s
Contexto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Custo$6.00
Latência2.93s
Contexto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Custo$11.25
Latência4.31s
Contexto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Custo$3.00
Latência7.25s
Contexto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Custo$11.25
Latência0.70s
Contexto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Custo$4.50
Latência1.62s
Contexto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Custo$11.25
Latência11.11s
Contexto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Custo$10.00
Latência1.71s
Contexto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Custo$4.50
Latência-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Custo$4.50
Latência22.02s
Contexto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

AIMultiple
FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
AIMultiple
Agentic RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AI MemoryRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AI HallucinationResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
AIMultiple
Agentic LLM BenchmarkProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Moonshot AI

Kimi K3

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Terra

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Explore Casos de uso, análises e benchmarks do LLM

LLM Preços: Comparação dos Mais de 15 Principais Provedores

LLM
11 Ago

O preço de LLM abrange três ordens de grandeza: os modelos comuns mais baratos custam menos de $0,20 por milhão de tokens, enquanto os níveis de raciocínio de ponta foram lançados por até $262,50. O gráfico abaixo acompanha como os preços de lançamento evoluíram: cada modelo está na sua data de lançamento com o preço…

Leia mais
LLM
Análise
11 Ago

LLM Automação: 7 Principais Ferramentas e 8 Estudos de Caso 

A automação com LLM refere-se à mudança para ferramentas de automação inteligente que utilizam LLMs, incluindo agentes de IA, LLMs ajustados e modelos RAG para automatizar e coordenar tarefas. Explore o que é a automação com LLM, as suas principais aplicações reais e as principais ferramentas: Os modelos de linguagem de grande dimensão na automação…

LLM
Benchmark
11 Ago

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

LLM
Benchmark
9 Ago

Text-to-SQL: Comparação da Precisão de LLM

Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que ele mesmo teve de identificar dentre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o da consulta de referência do BIRD. Consultas ausentes,…

LLM
Avaliação em Mundo Aberto
6 Ago

LLM Orquestração: 22 Frameworks e Gateways

Otimizar a orquestração de LLM é fundamental para melhorar o desempenho enquanto mantém o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração funcionam na prática, fizemos benchmarks de: Descubra ferramentas de orquestração de LLM selecionadas, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar múltiplos…

LLM
Benchmark
4 Ago

HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo

HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…

LLM
Benchmark
4 Ago

Comparar Modelos de IA Multimodais em Raciocínio Visual

Avaliámos 15 modelos de IA multimodais líderes em raciocínio visual utilizando 200 perguntas baseadas em imagens. A avaliação consistiu em duas pistas: 100 perguntas de compreensão de gráficos testando a interpretação de visualizações de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e o raciocínio espacial. Cada pergunta foi executada 5…

LLM
Benchmark
4 Ago

Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?

Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…

LLM
Benchmark
2 Ago

Gateways de IA para OpenAI: Alternativas ao OpenRouter

Avaliamos OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API em três indicadores (latência do primeiro token, latência total e contagem de tokens de saída), com 300 testes usando prompts curtos (aprox. 18 tokens) e prompts longos (aprox. 203 tokens) para a latência total. Se planeia utilizar um destes gateways de IA, pode: Neste benchmark, comparámos o…

LLM
Análise
16 Jul

LLM Guia de Fine‑Tuning para Empresas

Siga os links para soluções específicas para seus desafios de saída de LLM. Se o seu LLM: A ampla adoção de large language models (LLMs) melhorou nossa capacidade de processar a linguagem humana. No entanto, seu treinamento genérico frequentemente resulta em desempenho abaixo do ideal para tarefas específicas. Para superar essa limitação, métodos de fine‑tuning…

LLM
Análise
12 Jul

LLM Calculadora de VRAM para Auto-hospedagem

Auto-hospedar um LLM significa executar a inferência em hardware controlado pelo operador, em vez de via uma API de terceiros, o que altera o custo, o controlo dos dados e o perfil de privacidade. O facto de um modelo conseguir sequer correr depende da memória. A calculadora estima a VRAM ou a memória unificada de…