Serviços
Contate-nos

Benchmarks de LLM

Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple.

Última atualização Jun 2026
MELHOR MODELO
Claude Fable 5
Índice 92
Melhor custo-benefício
MiniMax M3
$0.42 / 1M
Mais rápido
GPT OSS 120B
0.19s TTFT
Cobertura
64 modelos
8 benchmarks · 336 avaliações
Índice de Inteligência da AIMultiple

Classificação

Os modelos com maior pontuação em todos os benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Custo$20.00
Latência3.98s
Contexto1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Custo$6.00
Latência252.11s
Contexto1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Custo$11.25
Latência2.47s
Contexto1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Custo$3.00
Latência10.26s
Contexto500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Custo$11.25
Latência1.03s
Contexto272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Custo$5.63
Latência1.92s
Contexto1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Custo$11.25
Latência11.46s
Contexto1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Custo$10.00
Latência1.75s
Contexto1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Custo$4.50
Latência-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Custo$4.50
Latência33.83s
Contexto1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7

Gráficos

Modelos seguindo "Melhor desempenho"

Evolução ao longo do tempo
Índice de Inteligência por data de lançamento do modelo
Custo vs desempenho
Custo combinado em relação ao Índice de Inteligência
Modelo × Benchmark
Melhores modelos nos benchmarks selecionados
Metodologia

Como o índice é construído

O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.

Atualizações recentes

Atualizações recentes

Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.

Moonshot AI

Kimi K3

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Terra

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Novo modelo adicionado ao Índice de Inteligência da AIMultiple.

Explore Casos de uso, análises e benchmarks do LLM

50+ Casos de Uso do ChatGPT com Exemplos da Vida Real

LLM
Análise
6 Jul

O ChatGPT atingiu aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 OpenAI superou US$ 20 bilhões em receita anual para 2025, confirmado pelo CFO Sarah Friar.2 O Índice Econômico do Anthropic distingue dois modos de uso: aprimoramento, no qual um humano interage com a IA, e…

Leia mais
LLM
Benchmark
2 Jul

Comparar Modelos de IA Multimodais em Raciocínio Visual

Realizamos um benchmark de 15 modelos de IA multimodais líderes em raciocínio visual usando 200 perguntas baseadas em visão. A avaliação consistiu em duas faixas: 100 perguntas de compreensão de gráficos testando a interpretação de visualização de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e raciocínio espacial. Cada pergunta foi…

LLM
Análise
2 Jul

LLM Participação de Mercado: Compare Uso e Adoção

Analisámos a participação de mercado dos LLMs combinando dados baseados em uso e estimativas de visitas web para mostrar como a procura por grandes modelos de linguagem está distribuída pelos laboratórios de IA e aplicações de IA: Leia a metodologia para ver como medimos e calculámos estes resultados. Os Estados Unidos dominaram as visitas web…

LLM
Comparação de Recursos
2 Jul

Principais Ferramentas LLMOps & Compará-las com MLOPs

As plataformas LLMOps gerenciam o lado operacional da execução de modelos de linguagem grandes: implantação, monitoramento, avaliação e gerenciamento de custos. Examinamos as principais ferramentas LLMOps, suas funcionalidades principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Uma análise detalhada de cada…

LLM
Comparação de Recursos
29 Jun

Comparar 9 Grandes Modelos de Linguagem na Assistência Médica

Avaliamos 9 LLMs utilizando o conjunto de dados MedQA, um benchmark de exame clínico de nível de pós‑graduação derivado das questões do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha com um prompt padronizado, permitindo a comparação direta da precisão. Também registramos a latência por pergunta, dividindo o tempo total de execução…

LLM
Análise
26 Jun

LLM Parameters: GPT-5 High, Medium, Low and Minimal

Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…

LLM
Avaliação em Mundo Aberto
25 Jun

LLM Orquestração: 22 Frameworks e Gateways

Otimizar a orquestração de LLM é fundamental para melhorar o desempenho mantendo o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração se comportam na prática, fizemos benchmarks: Descubra ferramentas de orquestração de LLM selecionadas, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar múltiplos Modelos…

LLM
Análise
25 Jun

O Futuro dos Grandes Modelos de Linguagem

Veja o futuro dos grandes modelos de linguagem explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam resolver as limitações dos LLM. Comparação da taxa de sucesso dos LLM’s Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas em três casas…

LLM
Análise
22 Jun

Modelos Multimodais Grandes (LMMs) vs LLMs

Avaliamos o desempenho de Modelos Multimodais Grandes (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Analisando um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos em processar e raciocinar com dados multimodais no domínio financeiro. A seção de metodologia fornece insights detalhados sobre o dataset e o framework…

LLM
Análise
22 Jun

10+ Exemplos de Grandes Modelos de Linguagem

Reunimos benchmarks de código aberto para comparar os principais grandes modelos de linguagem proprietários e de código aberto. Escolha o seu caso de uso para encontrar o modelo certo. Você pode avaliar grandes modelos de linguagem examinando o seu desempenho em benchmarks e a latência no mundo real (disponível ao clicar no nome de cada…

LLM
Comparação de Recursos
22 Jun

Cloud LLM vs Local LLMs: Exemplos & Benefícios

Os LLMs na nuvem, alimentados por modelos avançados como GPT-5.5 e Claude Opus 4.7, oferecem escalabilidade e acessibilidade. Por outro lado, os LLMs locais, impulsionados por modelos de código aberto como Llama 4, DeepSeek V4 e Qwen3.6-Plus, garantem maior privacidade e personalização. Explore o que são LLMs na nuvem, pontos fortes e fracos, estudos de…