Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Gráficos
Modelos seguindo "Melhor desempenho"
Como o índice é construído
O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Kimi K3
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Terra
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol Pro
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Explore Casos de uso, análises e benchmarks do LLM
Gateways de IA para OpenAI: Alternativas ao OpenRouter
Realizamos um benchmark de OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API em três indicadores (latência do primeiro token, latência total e contagem de tokens de saída), com 300 testes utilizando prompts curtos (aprox. 18 tokens) e prompts longos (aprox. 203 tokens) para a latência total. Se planeia utilizar um destes gateways de IA, pode: Neste…
Modelos de Linguagem Grandes em Cibersegurança
Avaliamos 7 modelos de linguagem grandes em 9 domínios de cibersegurança usando o SecBench, um benchmark de grande escala e multi-formato para tarefas de segurança. Testamos cada modelo em 44.823 perguntas de múltipla escolha (MCQs) e 3.087 perguntas de resposta curta (SAQs), cobrindo áreas como segurança de dados, gestão de identidade e acesso, segurança de…
ChatGPT para Atendimento ao Cliente: Top 10 Casos de Uso
ChatGPT passou de novidade para infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir tempos de resposta, lidar com volumes que suas equipes não conseguem absorver e reduzir o custo de interações rotineiras. Mas os resultados variam drasticamente dependendo de como é implementado. OpenAI lançou GPT-5.2, um modelo materialmente mais capaz que é…
LLM Quantização: BF16 vs FP8 vs INT4
Realizamos o benchmark do Qwen3-32B em 4 níveis de precisão (BF16, FP8, GPTQ-Int8, GPTQ-Int4) em uma única NVIDIA H100 80GB GPU. Cada configuração foi avaliada em 2 benchmarks (~12,2 mil perguntas) cobrindo conhecimento e geração de código, além de mais de 2.000 execuções de inferência para medir a vazão. O Int4 é 2,7x mais rápido…