O modelo mais recente do Índice de Inteligência da AIMultiple é Kimi K3.
Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Como o índice é construído
O Índice de Inteligência normaliza cada benchmark em uma escala de 0 a 100 e calcula a média da posição relativa de um modelo nos benchmarks em que foi avaliado. Cada benchmark abaixo alimenta essa pontuação.
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Kimi K3
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Terra
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GPT-5.6 Sol Pro
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Explore Casos de uso, análises e benchmarks do LLM
Compare 9 Modelos de Linguagem de Grande Escala na Área da Saúde
Avaliamos 9 LLMs usando o conjunto de dados MedQA, um benchmark de exame clínico de nível de pós-graduação derivado de questões do USMLE. Cada modelo respondeu aos mesmos cenários clínicos de múltipla escolha usando um prompt padronizado, permitindo a comparação direta da precisão. Também registramos a latência por pergunta, dividindo o tempo total de execução…
Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos
Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference). Para calcular a densidade de inteligência, executamos as seguintes etapas: Consulte a…
50+ Casos de Uso do ChatGPT com Exemplos da Vida Real
O ChatGPT alcançou aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 A OpenAI ultrapassou US$ 20 bilhões em receita anual em 2025, confirmado pela CFO Sarah Friar.2 O Índice Econômico da Anthropic distingue dois modos de uso: aumento, em que um humano interage com a IA,…
Benchmark de 40+ LLMs em Finanças: Claude Fable 5 & GPT-5.6 Sol
Avaliamos LLMs em 238 questões difíceis do benchmark FinanceReasoning (Tang et al.).1 Este subconjunto tem como alvo as tarefas de raciocínio financeiro mais desafiadoras, avaliando raciocínio quantitativo complexo e em várias etapas envolvendo conceitos e fórmulas financeiras. Nossa avaliação empregou um design de prompt personalizado e critérios de pontuação de precisão e consumo de tokens.…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias para suas tarefas regulares. Para encontrar os LLMs com melhor custo-benefício, criamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais em diferentes categorias. Cada model entregou um arquivo por tarefa. As pontuações são relativas: os juízes classificam cada resposta em relação às outras respostas…
Leis de Escala de LLM: Análise de Pesquisadores de IA
Grandes models de linguagem preveem o próximo token com base em padrões aprendidos a partir de dados de texto. O termo LLM leis de escala refere-se a regularidades empíricas que vinculam o desempenho do model à quantidade de computação, dados de treinamento e parâmetros do model usados durante o treinamento. Para entender como essas relações…
LLM Ferramentas de Observabilidade: Weights & Biases, Langsmith
Aplicações de LLM expandiram-se de chats de turno único para agentes de várias etapas que usam ferramentas, consultam bancos de dados e coordenam com outros modelos, tornando seu comportamento mais difícil de interpretar. A observabilidade de LLM fornece visibilidade contínua nesses fluxos de trabalho complexos, ajudando as organizações a monitorar a qualidade, detectar falhas, solucionar…
ChatGPT para Atendimento ao Cliente: Top 10 Casos de Uso
O ChatGPT passou de novidade a infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir tempos de resposta, lidar com volumes que suas equipes não conseguem absorver e diminuir o custo das interações rotineiras. Mas os resultados variam drasticamente dependendo de como é implementado. OpenAI lançou o GPT-5.6, um modelo substancialmente mais capaz…
LLM Benchmark de Latência por Casos de Uso
Fizemos o benchmark de 11 dos principais modelos de linguagem de grande escala com um total de 1.320 pedidos, dividindo modelos de raciocínio e não-raciocínio, e medimos a latência do primeiro token, a latência por token e o tempo total de resposta. Pode encontrar detalhes sobre como medimos a latência aqui. Relatamos modelos de raciocínio…
Principais Ferramentas LLMOps & Compará-las com MLOPs
As plataformas LLMOps gerenciam o lado operacional da execução de modelos de linguagem grandes: implantação, monitoramento, avaliação e gerenciamento de custos. Examinamos as principais ferramentas LLMOps, suas funcionalidades principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Uma análise detalhada de cada…