O modelo mais recente do Índice de Inteligência da AIMultiple é Kimi K3.
Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Como o índice é construído
O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Kimi K3
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Terra
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol Pro
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Explore Casos de uso, análises e benchmarks do LLM
LLM Automação: 7 Principais Ferramentas e 8 Estudos de Caso
A automação com LLM refere-se à mudança para ferramentas de automação inteligente que utilizam LLMs, incluindo agentes de IA, LLMs ajustados e modelos RAG para automatizar e coordenar tarefas. Explore o que é a automação com LLM, as suas principais aplicações reais e as principais ferramentas: Os modelos de linguagem de grande dimensão na automação…
Agentic IT: Can LLMs Design a Benchmark
We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…
Text-to-SQL: Comparação da Precisão de LLM
Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que ele mesmo teve de identificar dentre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o da consulta de referência do BIRD. Consultas ausentes,…
LLM Orquestração: 22 Frameworks e Gateways
Otimizar a orquestração de LLM é fundamental para melhorar o desempenho enquanto mantém o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração funcionam na prática, fizemos benchmarks de: Descubra ferramentas de orquestração de LLM selecionadas, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar múltiplos…
HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo
HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…
Comparar Modelos de IA Multimodais em Raciocínio Visual
Avaliámos 15 modelos de IA multimodais líderes em raciocínio visual utilizando 200 perguntas baseadas em imagens. A avaliação consistiu em duas pistas: 100 perguntas de compreensão de gráficos testando a interpretação de visualizações de dados, e 100 perguntas de lógica visual avaliando o reconhecimento de padrões e o raciocínio espacial. Cada pergunta foi executada 5…
Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?
Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…
Gateways de IA para OpenAI: Alternativas ao OpenRouter
Avaliamos OpenRouter, SambaNova, TogetherAI, Groq e IA/ML API em três indicadores (latência do primeiro token, latência total e contagem de tokens de saída), com 300 testes usando prompts curtos (aprox. 18 tokens) e prompts longos (aprox. 203 tokens) para a latência total. Se planeia utilizar um destes gateways de IA, pode: Neste benchmark, comparámos o…
LLM Guia de Fine‑Tuning para Empresas
Siga os links para soluções específicas para seus desafios de saída de LLM. Se o seu LLM: A ampla adoção de large language models (LLMs) melhorou nossa capacidade de processar a linguagem humana. No entanto, seu treinamento genérico frequentemente resulta em desempenho abaixo do ideal para tarefas específicas. Para superar essa limitação, métodos de fine‑tuning…
LLM Calculadora de VRAM para Auto-hospedagem
Auto-hospedar um LLM significa executar a inferência em hardware controlado pelo operador, em vez de via uma API de terceiros, o que altera o custo, o controlo dos dados e o perfil de privacidade. O facto de um modelo conseguir sequer correr depende da memória. A calculadora estima a VRAM ou a memória unificada de…