O modelo mais recente do Índice de Inteligência da AIMultiple é Gemini 3.8 Flash.
Benchmarks de LLM
Um único Índice de Inteligência transparente que combina benchmarks públicos com as próprias avaliações agênticas, de RAG e de raciocínio empresarial da AIMultiple. Ver a metodologia.
Classificação
Os modelos com maior pontuação em todos os benchmarks.
# | Modelo | Índice | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 67 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Como o índice é construído
Cada benchmark torna-se uma posição numa escala de 0 a 100, e o índice é a média ponderada dessas posições. Um benchmark em que o modelo não foi avaliado conta como a média do campo, para que as pontuações continuem comparáveis. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Atualizações recentes
Últimas alterações no Índice de Inteligência, na cobertura de modelos e na metodologia de benchmarks da AIMultiple.
Gemini 3.8 Flash
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Claude Fable 5.1
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Hy4 preview
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
GLM 5.3 Flash
Novo modelo adicionado ao Índice de Inteligência da AIMultiple.
Principais lançamentos de modelos de IA dos fornecedores líderes nos últimos 23 dias.
Explore Casos de uso, análises e benchmarks do LLM
Modelos Multimodais Grandes (LMMs) vs LLMs
Avaliamos o desempenho de Modelos Multimodais Grandes (LMMs) em tarefas de raciocínio financeiro usando um dataset cuidadosamente selecionado. Ao analisar um subconjunto de amostras financeiras de alta qualidade, avaliamos as capacidades dos modelos no processamento e raciocínio com dados multimodais no domínio financeiro. A seção de metodologia fornece percepções detalhadas sobre o dataset e o…
Leis de Escala de LLM: Análise de Pesquisadores de IA
Grandes models de linguagem preveem o próximo token com base em padrões aprendidos a partir de dados de texto. O termo LLM leis de escala refere-se a regularidades empíricas que vinculam o desempenho do model à quantidade de computação, dados de treinamento e parâmetros do model usados durante o treinamento. Para entender como essas relações…
LLM Ferramentas de Observabilidade: Weights & Biases, Langsmith
Aplicações de LLM expandiram-se de chats de turno único para agentes de várias etapas que usam ferramentas, consultam bancos de dados e coordenam com outros modelos, tornando seu comportamento mais difícil de interpretar. A observabilidade de LLM fornece visibilidade contínua nesses fluxos de trabalho complexos, ajudando as organizações a monitorar a qualidade, detectar falhas, solucionar…
Cloud LLM vs Local LLMs: Exemplos & Benefícios
Os LLMs na nuvem, alimentados por modelos avançados como GPT-5.5 e Claude Opus 4.7, oferecem escalabilidade e acessibilidade. Por outro lado, os LLMs locais, impulsionados por modelos de código aberto como Llama 4, DeepSeek V4 e Qwen3.6-Plus, garantem maior privacidade e personalização. Explore o que são LLMs na nuvem, pontos fortes e fracos, estudos de…
Simulação de Audiência: LLMs Podem Prever o Comportamento Humano?
Em marketing, avaliar com que precisão os LLMs preveem o comportamento humano é crucial para avaliar sua eficácia em antecipar as necessidades do público e reconhecer os riscos de desalinhamento, comunicação ineficaz ou influência não intencional. A simulação de audiência com LLMs permite a modelagem de públicos virtuais, ajudando as organizações a antecipar reações a…
LLM Guia de Fine‑Tuning para Empresas
Siga os links para soluções específicas para seus desafios de saída de LLM. Se o seu LLM: A ampla adoção de large language models (LLMs) melhorou nossa capacidade de processar a linguagem humana. No entanto, seu treinamento genérico frequentemente resulta em desempenho abaixo do ideal para tarefas específicas. Para superar essa limitação, métodos de fine‑tuning…
LLM Participação de Mercado: Compare Uso e Adoção
Analisámos a participação de mercado dos LLMs combinando dados baseados em uso e estimativas de visitas web para mostrar como a procura por grandes modelos de linguagem está distribuída pelos laboratórios de IA e aplicações de IA: Leia a metodologia para ver como medimos e calculámos estes resultados. Os Estados Unidos dominaram as visitas web…
10+ Exemplos de Grandes Modelos de Linguagem
Reunimos benchmarks de código aberto para comparar os principais grandes modelos de linguagem proprietários e de código aberto. Escolha o seu caso de uso para encontrar o modelo certo. Você pode avaliar grandes modelos de linguagem examinando o seu desempenho em benchmarks e a latência no mundo real (disponível ao clicar no nome de cada…
LLM Calculadora de VRAM para Auto-Hospedagem
Auto-hospedar um LLM significa executar a inferência em hardware que o operador controla, em vez de via uma API de terceiros, o que altera o custo, o controle de dados e o perfil de privacidade. O fato de um modelo executar ou não depende da memória. A calculadora estima a VRAM ou memória unificada que…
Preços de LLM: Top 15+ provedores comparados
A precificação de LLM abrange quatro ordens de magnitude: os modelos mais baratos foram lançados abaixo de US$ 0.03 por milhão de tokens, enquanto os níveis de raciocínio de fronteira foram lançados por até US$ 262.50. O gráfico abaixo acompanha os preços de lançamento: cada ponto é o preço médio dos modelos de uma classe…