Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Gráficos
Modelos seguindo "Melhor desempenho"
Como o índice é construído
O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Kimi K3
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Terra
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol Pro
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Explore Casos de uso, análises e benchmarks do LLM
LLM Preços: Top 15+ Provedores Comparados
LLM preços abrangem três ordens de grandeza: os modelos commodity mais baratos custam menos de $0.20 por milhão de tokens, enquanto os níveis de raciocínio de ponta foram lançados por até $262.50. O gráfico abaixo acompanha como os preços de lançamento evoluíram: cada modelo está colocado na sua data de lançamento com o seu preço…
Texto-para-SQL: Comparação da Precisão de LLMs
Eu dependo do SQL para análise de dados há 18 anos, desde os meus tempos de consultor. Traduzir perguntas em linguagem natural para SQL torna os dados mais acessíveis, permitindo que qualquer pessoa, mesmo aquelas sem habilidades técnicas, trabalhe diretamente com bancos de dados. Utilizámos a nossa metodologia de benchmark de texto-para-SQL em mais de…
LLM Guia de Fine‑Tuning para Empresas
Siga os links para soluções específicas para seus desafios de saída de LLM. Se o seu LLM: A ampla adoção de large language models (LLMs) melhorou nossa capacidade de processar a linguagem humana. No entanto, seu treinamento genérico frequentemente resulta em desempenho abaixo do ideal para tarefas específicas. Para superar essa limitação, métodos de fine‑tuning…
Ferramentas de Observabilidade LLM: Weights & Biases, Langsmith
LLM aplicações se expandiram de chats de turno único para agentes de múltiplas etapas que usam ferramentas, consultam bancos de dados e coordenam com outros modelos, tornando seu comportamento mais difícil de interpretar. A observabilidade de LLM fornece visibilidade contínua sobre esses fluxos de trabalho complexos, ajudando as organizações a monitorar a qualidade, detectar falhas,…
LLM Calculadora de VRAM para Auto-hospedagem
Auto-hospedar um LLM significa executar a inferência em hardware controlado pelo operador, em vez de via uma API de terceiros, o que altera o custo, o controlo dos dados e o perfil de privacidade. O facto de um modelo conseguir sequer correr depende da memória. A calculadora estima a VRAM ou a memória unificada de…
Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol
Avaliamos 40+ LLMs em finanças em 238 perguntas difíceis do benchmark FinanceReasoning para identificar quais modelos se destacam em tarefas complexas de raciocínio financeiro, como análise de demonstrações, previsões e cálculos de índices. Avaliamos LLMs em 238 perguntas difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro…
LLM Automação: 7 Principais Ferramentas e 8 Estudos de Caso
A automação com LLM refere-se à mudança para ferramentas de automação inteligente que utilizam LLMs, incluindo agentes de IA, LLMs ajustados e modelos RAG para automatizar e coordenar tarefas. Explore o que é a automação com LLM, as suas principais aplicações reais e as principais ferramentas: Os modelos de linguagem de grande dimensão na automação…
LLM Benchmark de Latência por Casos de Uso
Analisámos 11 dos melhores modelos de linguagem de grande escala com um total de 1.320 pedidos, separando modelos de raciocínio e que não usam raciocínio, e medimos a latência do primeiro token, a latência por token e o tempo total de resposta. Pode encontrar aqui os detalhes sobre como medimos a latência. Relatamos os modelos…
HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Longo Contexto
HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Longo Contexto) mede a resistência de um modelo de linguagem grande a fabricar evidências para uma métrica que não existe no documento alvo usando 3 palheiros colocados no início, no meio e no final da janela de contexto do modelo, com 204 perguntas. claude-fable-5 respondeu corretamente a…
Densidade de Inteligência de 71 LLMs: Modelos Mais Inteligentes e Densos
Acompanhámos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e recolhemos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o modelo consome (parâmetros ativos, computação de treino e preço de inferência). Para calcular a densidade de inteligência, executámos os seguintes passos: Consulte a…