Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.

MELHOR MODELO
Claude Fable 5
Índice 92
Melhor custo-benefício
MiniMax M3
$0.42 / 1M
Mais rápido
GPT OSS 120B
0.23s TTFT
Cobertura
64 modelos
8 benchmarks · 336 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Custo$20.00
Latência4.02s
Contexto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Custo$6.00
Latência2.93s
Contexto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Custo$11.25
Latência4.31s
Contexto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Custo$3.00
Latência7.25s
Contexto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Custo$11.25
Latência0.70s
Contexto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Custo$4.50
Latência1.62s
Contexto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Custo$11.25
Latência11.11s
Contexto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Custo$10.00
Latência1.71s
Contexto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Custo$4.50
Latência-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Custo$4.50
Latência22.02s
Contexto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7
Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

AIMultiple
FinanceReasoningRaciocínio financeiro complexo de várias etapas em 238 perguntas difíceis do FinanceReasoning.
AIMultiple
Text-to-SQLPrecisão na geração de consultas SQL a partir de linguagem natural em mais de 35 LLMs.
AIMultiple
Agentic RAGRoteamento multibanco de dados e geração de consultas SQL em 5 bancos de dados (BIRD-SQL, 500 perguntas).
AIMultiple
AI MemoryRecuperação de dados numéricos em contextos longos em diferentes posições do documento (100 itens, 14 transcrições).
AIMultiple
AI HallucinationResistência a inventar métricas não mencionadas em documentos de contexto longo (204 armadilhas, 14 transcrições).
Público
Humanity's Last ExamRaciocínio de nível especialista sem consulta em mais de 100 disciplinas acadêmicas (2,5 mil perguntas).
Público
SciCodeProgramação científica de nível de pesquisa em física, matemática, biologia e química (338 subproblemas)
Público
LegalBenchRaciocínio jurídico colaborativo em 162 tarefas criadas por profissionais do direito.
Público
FrontierMathProblemas de matemática de pesquisa inéditos, escritos por especialistas (níveis 1–4).
Público
ARC-AGI-2Novos quebra-cabeças de raciocínio visual que testam a generalização, não a memorização.
Público
Swe-BenchIssues reais do GitHub resolvidos de ponta a ponta (conjunto completo de 2.294 instâncias).
Público
LiveCodeBenchProblemas de programação competitiva sem contaminação e atualizados continuamente.
AIMultiple
Agentic LLM BenchmarkProgramação agêntica em 10 tarefas de desenvolvimento de software via ferramenta CLI (~3.500 etapas de validação).
Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Moonshot AI

Kimi K3

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Terra

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Explore Casos de uso, análises e benchmarks do LLM

Grandes Modelos Multimodais (LMMs) vs LLMs

LLM
Análise
17 Ago

Avaliamos o desempenho de Grandes Modelos Multimodais (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Ao analisar um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos em processar e raciocinar com dados multimodais no domínio financeiro. A seção de metodologia fornece insights detalhados sobre o dataset e o…

Leia mais
LLM
Comparação de Recursos
17 Ago

Compare 9 Modelos de Linguagem de Grande Escala na Área da Saúde

Avaliamos 9 LLMs usando o conjunto de dados MedQA, um benchmark de exame clínico de nível de pós-graduação derivado de questões do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha usando um prompt padronizado, permitindo a comparação direta da precisão. Também registramos a latência por pergunta, dividindo o tempo total de execução…

LLM
Benchmark
16 Ago

Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos

Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference). Para calcular a densidade de inteligência, executamos as seguintes etapas: Consulte a…

LLM
Análise
14 Ago

50+ Casos de Uso do ChatGPT com Exemplos da Vida Real

O ChatGPT alcançou aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 A OpenAI ultrapassou US$ 20 bilhões em receita anual em 2025, confirmado pela CFO Sarah Friar.2 O Índice Econômico da Anthropic distingue dois modos de uso: aumento, em que um humano interage com a IA,…

LLM
Benchmark
14 Ago

Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol

Avaliamos LLMs em 238 questões difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e em várias etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…

LLM
Benchmark
14 Ago

AIM Enterprise: Benchmark Empresarial Agêntico

As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, criamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais em diferentes categorias. Cada model entregou um arquivo por tarefa. As pontuações são relativas: os juízes classificam cada resposta em relação às outras respostas…

LLM
Análise
13 Ago

Leis de Escala de LLM: Análise de Pesquisadores de IA

Grandes models de linguagem preveem o próximo token com base em padrões aprendidos a partir de dados de texto. O termo LLM leis de escala refere-se a regularidades empíricas que vinculam o desempenho do model à quantidade de computação, dados de treinamento e parâmetros do model usados durante o treinamento. Para entender como essas relações…

LLM
Análise
13 Ago

LLM Ferramentas de Observabilidade: Weights & Biases, Langsmith

Aplicações de LLM expandiram-se de chats de turno único para agentes de várias etapas que usam ferramentas, consultam bancos de dados e coordenam com outros modelos, tornando seu comportamento mais difícil de interpretar. A observabilidade de LLM fornece visibilidade contínua nesses fluxos de trabalho complexos, ajudando as organizações a monitorar a qualidade, detectar falhas, solucionar…

LLM
Análise
12 Ago

ChatGPT para Atendimento ao Cliente: Top 10 Casos de Uso

O ChatGPT passou de novidade a infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir tempos de resposta, lidar com volumes que suas equipes não conseguem absorver e diminuir o custo das interações rotineiras. Mas os resultados variam drasticamente dependendo de como é implementado. OpenAI lançou o GPT-5.6, um modelo substancialmente mais capaz…

LLM
Benchmark
12 Ago

LLM Benchmark de Latência por Casos de Uso

Fizemos o benchmark de 11 dos principais modelos de linguagem de grande escala com um total de 1.320 pedidos, dividindo modelos de raciocínio e não-raciocínio, e medimos a latência do primeiro token, a latência por token e o tempo total de resposta. Pode encontrar detalhes sobre como medimos a latência aqui. Relatamos modelos de raciocínio…

LLM
Comparação de Recursos
12 Ago

Principais Ferramentas LLMOps & Compará-las com MLOPs

As plataformas LLMOps gerenciam o lado operacional da execução de modelos de linguagem grandes: implantação, monitoramento, avaliação e gerenciamento de custos. Examinamos as principais ferramentas LLMOps, suas funcionalidades principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Uma análise detalhada de cada…