O modelo mais recente do Índice de Inteligência da AIMultiple é Gemini 3.8 Flash.
Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 67 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Como o índice é construído
Cada benchmark torna-se uma posição numa escala de 0 a 100, e o índice é a média ponderada dessas posições. Um benchmark em que o modelo não foi avaliado conta como a média do campo, para que as pontuações continuem comparáveis. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Gemini 3.8 Flash
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Claude Fable 5.1
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Hy4 preview
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GLM 5.3 Flash
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Principais lançamentos de modelos de IA dos fornecedores líderes nos últimos 23 dias.
Explore Casos de uso, análises e benchmarks do LLM
Orquestração de LLM: 22 Frameworks e Gateways
Otimizar a orquestração de LLM é essencial para melhorar o desempenho mantendo o uso de recursos sob controle. Para avaliar como diferentes abordagens de orquestração se comportam na prática, realizamos benchmarks: Descubra ferramentas selecionadas de orquestração de LLM, incluindo frameworks para desenvolvedores e gateways empresariais: A orquestração de LLM envolve gerenciar e integrar vários Large…
AIM Enterprise: Benchmark Empresarial Agêntico
As empresas usam LLMs todos os dias em suas tarefas regulares. Para encontrar os LLMs mais econômicos, projetamos o AIM Enterprise, um benchmark empresarial agêntico, onde usamos 69 tarefas empresariais reais em estratégia, marketing, RH, vendas e operações. Dois modelos juízes pontuaram todos os arquivos e frequentemente discordaram. Em cerca de um terço das pontuações…
Text-to-SQL: Comparação da precisão de LLM
Executamos 36 grandes modelos de linguagem em 759 perguntas do BIRD-SQL, cada modelo escrevendo SQL contra um banco de dados que precisava identificar por si mesmo entre 11 candidatos. Toda consulta analisável foi executada no banco de dados real e seu conjunto de resultados comparado com o conjunto de resultados da consulta gold do BIRD.…
LLM Parameters: GPT-5 High, Medium, Low and Minimal
Alguns LLMs, como a família GPT-5 da OpenAI, vêm em diferentes versões (por exemplo, GPT-5, GPT-5-mini e GPT-5-nano) e com várias configurações de parâmetros, incluindo alta, média, baixa e mínima. Abaixo, exploramos as diferenças entre essas versões de modelo reunindo seu desempenho em benchmarks e os custos para executá-los. Usamos a família GPT-5 em nossa…
HALC-Bench: LLM Alucinação em Benchmark de Recuperação de Contexto Longo
HALC-Bench (LLM Alucinação em Benchmark de Recuperação de Contexto Longo) mede a resistência de um modelo de linguagem grande a fabricar evidência para uma métrica que não existe no documento alvo, usando 3 palheiros colocados no início, meio e fim da janela de contexto do modelo, com 204 questões. claude-fable-5 respondeu corretamente a todas as…
Principais ferramentas de LLMOps e comparação com MLOps
As plataformas de LLMOps cuidam do lado operacional da execução de grandes modelos de linguagem: implantação, monitoramento, avaliação e gestão de custos. Examinamos as principais ferramentas de LLMOps, seus recursos principais, modelos de preços e como elas diferem entre si para ajudar a identificar a melhor opção para vários casos de uso. Um detalhamento de…
50+ Casos de Uso do ChatGPT com Exemplos da Vida Real
O ChatGPT alcançou aproximadamente 1 bilhão de usuários ativos semanais no início de 2026, cerca de 10% da população mundial.1 A OpenAI ultrapassou US$ 20 bilhões em receita anual em 2025, confirmado pela CFO Sarah Friar.2 O Índice Econômico da Anthropic distingue dois modos de uso: aumento, em que um humano interage com a IA,…
ChatGPT para Atendimento ao Cliente: Os 10 Principais Casos de Uso
O ChatGPT passou de novidade a infraestrutura no atendimento ao cliente. As empresas estão usando-o para reduzir os tempos de resposta, lidar com o volume que suas equipes não conseguem absorver e diminuir o custo das interações rotineiras. Mas os resultados variam bastante dependendo de como ele é implementado. OpenAI lançou GPT-5.6, um modelo consideravelmente…
O Futuro dos Grandes Modelos de Linguagem
Veja o futuro dos grandes modelos de linguagem explorando abordagens promissoras, como autotreinamento, verificação de fatos e especialização esparsa, que poderiam lidar com as limitações dos LLM. Comparação da taxa de sucesso dos LLMs Claude Sonnet 4.6 liderou o benchmark com uma pontuação geral de 0.748, com as variantes base e thinking empatadas até três…
Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos
Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference). Para calcular a densidade de inteligência, executamos as seguintes etapas: Consulte a…