Densidade de Inteligência de 71 LLMs: Modelos Mais Inteligentes e Densos
Acompanhámos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e recolhemos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o modelo consome (parâmetros ativos, computação de treino e preço de inferência).
Visão geral da densidade de inteligência dos LLM
Para calcular a densidade de inteligência, executámos os seguintes passos:
- Eficiência de recursos: Dividimos a capacidade de cada modelo por duas métricas de recurso:
- Parâmetros ativos: Um proxy do custo de memória e de serviço (apenas modelos de peso aberto).
- Preço de inferência: Eficiência de custo de mercado baseada no preço misto da API por milhão de tokens.
- Nota sobre computação de treino (FLOP): Inicialmente incluímos um terceiro eixo, computação de treino (FLOP), mas removemo-lo porque a sua inclinação negativa nos benchmarks Standard saturados arrastou o composto de 2023–2024 para uma queda contraintuitiva.
- Agrupamento de benchmarks: Para evitar que a saturação das pontuações mascare os ganhos de eficiência, avaliámos as capacidades em duas eras distintas de benchmarks:
- Benchmarks Standard (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks Avançados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indexação encadeada: Calculámos o crescimento ano após ano dentro de grupos de benchmark correspondentes e encadeámo-los multiplicativamente a partir de uma linha de base de 2023 de 100 para traçar a tendência acumulada.
Consulte a metodologia para a abordagem de pontuação e as discriminações por recurso.
Resultados da densidade de inteligência dos LLM
Em meados de 2026, o ecossistema de IA proporcionou quase 15× mais inteligência por unidade de recurso (parâmetros e dólares) do que a linha de base de 2023. Duas coisas a notar ao ler a tendência:
- O salto de 2024–2025 (+362%) exagera o ganho real: Os benchmarks Avançados eram novos em 2024 e apenas um punhado de modelos tinha pontuações neles, pelo que a linha de base de 2024 é artificialmente baixa. A maior parte do "surto" é o preenchimento do painel, não um salto de eficiência num ano.
- O ganho de 2025–2026 (+105%) é onde reside a verdadeira história: É medido em muitos mais modelos e é impulsionado por lançamentos pequenos de peso aberto como Qwen 3.6-35B-A3B e DeepSeek V4 Flash, que igualam a capacidade dos modelos fechados de fronteira com uma fração do tamanho e do custo.
Capacidade dos LLM
O gráfico de densidade mostra a eficiência. Para contextualizar, também medimos a capacidade bruta no mesmo período: até que ponto estes modelos se tornaram realmente mais inteligentes antes de qualquer ajuste de recursos?
Capacidade indexada a 100 em 2023, média de todos os modelos lançados em cada ano.
Os eixos e a tooltip funcionam da mesma forma que no gráfico de densidade, com o eixo Y a acompanhar o desempenho bruto nos benchmarks em vez da densidade.
Uma pontuação de capacidade de 100 em 2023 cresceu para 468 em 2026, aproximadamente uma melhoria de 4.7×. Ano a ano:
- 2024 (+88%): Progresso rápido nos benchmarks standard antes de saturarem.
- 2025 (+105%): O mesmo progresso rápido, medido nos benchmarks avançados mais difíceis que substituíram os standard.
- 2026 (+22%): O abrandamento é um sinal precoce de que os benchmarks avançados também estão a começar a saturar.
Colocando os dois gráficos lado a lado:
- A capacidade cresceu 4.7× enquanto a densidade de inteligência cresceu 8.9×.
- Os modelos ficaram mais inteligentes e mais eficientes ao mesmo tempo. Não precisam de proporcionalmente mais parâmetros, computação de treino ou dinheiro para funcionar.
Note-se que: O valor de 4.7× de capacidade é uma magnitude credível. O valor de 8.9× de densidade é mais frágil (o grupo Avançado de 2024 tem menos pontos de dados, o que amplifica a taxa de crescimento desse ano), por isso encare-o como um sinal direcional em vez de um multiplicador preciso.
Qual LLM tem a maior densidade de inteligência?
A densidade de inteligência depende do recurso que medimos e do grupo de benchmarks em que pontuamos. O líder muda para cada combinação.
Densidade por parâmetro ativo (apenas peso aberto)
Esta visão mede a eficiência com que um modelo concentra capacidade nos seus pesos. Os parâmetros ativos são importantes porque os modelos Mixture-of-Experts (MoE) encaminham cada token através de uma fração dos pesos totais. O DeepSeek V3 tem 671B parâmetros totais, mas 37B ativos por token, e o valor de 37B reflete o custo efetivo de serviço.
Líderes nos benchmarks Standard
- LLaMA 3.1 8B (jul 2024): 100.0
- LLaMA 3 8B (abr 2024): 85.0
- LLaMA 4 Maverick (abr 2025): 55.9
- Mixtral 8x7B (dez 2023): 47.4
- Mistral 7B (set 2023): 46.3
Líderes nos benchmarks Avançados
- Qwen 3.6-35B-A3B (abr 2026): 100.0 (3B parâmetros ativos; a pontuação baseia-se num único benchmark, SWE-bench Verified com 73.4%, por isso leia em conformidade)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parâmetros ativos)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parâmetros ativos)
- Qwen 3.5 9B (mar 2026): 35.2 (9B parâmetros densos)
- DeepSeek V4 Flash (abr 2026): 26.0
A classificação nos benchmarks Standard deixou de se mover desde finais de 2024 porque os benchmarks saturaram, e não porque o progresso parou. O GPT-4 obteve 90.2 nos benchmarks Standard no início de 2023, mas 17.3 nos benchmarks Avançados.
Densidade por FLOP de treino (apenas peso aberto)
Esta visão recompensa a curadoria de dados, as escolhas de arquitetura e as receitas de treino em vez do gasto bruto.
Nota: a densidade por FLOP nos benchmarks Standard parece estar a cair com o tempo. Isto é um artefacto de saturação, não uma queda na eficiência de treino. Os benchmarks mais antigos já não medem os ganhos recentes, pelo que as pontuações de capacidade se comprimem enquanto a computação de treino continua a crescer.
Líderes nos benchmarks Standard
- Mistral 7B (set 2023): 100.0 (ainda a âncora do painel, passados mais de dois anos)
- LLaMA 3 8B (abr 2024): 40.8
- LLaMA 1 (fev 2023): 37.0
- DeepSeek V2 (mai 2024): 32.6
- Mixtral 8x7B (dez 2023): 27.1
Líderes nos benchmarks Avançados
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (abr 2026): 28.4
- DeepSeek V4 Flash (abr 2026): 6.4
O resultado do Qwen 3.5 (9B) é notável: um modelo denso de 9B treinado com aproximadamente 1.5 × 10²³ FLOP que obtém 81.2 de capacidade nos benchmarks Avançados. A sua computação de treino é cerca de uma ordem de grandeza inferior à do DeepSeek V4 Pro, mas a diferença de capacidade é menor.
Densidade por dólar de inferência
A densidade por dólar é o eixo onde os modelos de peso aberto e os modelos fechados de fronteira podem ser diretamente comparados, porque o preço da API é publicamente verificável. Utilizamos os preços estabelecidos para o cabeçalho, pelo que os cortes pós-lançamento são refletidos.
Líderes nos benchmarks Standard
- Mistral Small 3 24B (jan 2025): 100.0 a $0.10 / $0.30 por milhão de tokens via Mistral primeira API
- Gemini 1.5 Flash (mai 2024): 99.3 (modelo de peso fechado com a pontuação mais alta após o corte de preço de agosto de 2024)
- DeepSeek V2 (mai 2024): 66.0 a $0.27 / $1.10 por milhão de tokens
- DeepSeek V3 (dez 2024): 30.9
- DeepSeek R1 (jan 2025): 17.8
Líderes nos benchmarks Avançados
- GPT-OSS 120B (ago 2025): 100.0 (referência de preço é a mediana entre fornecedores do OpenRouter, uma vez que a OpenAI não alojou o modelo numa API de primeira parte)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (abr 2026): 44.0 a $0.06 / $0.42 por milhão de tokens via DeepSeek primeira API
- DeepSeek V3.2 (dez 2025): 22.5
- Mistral Small 3 24B (jan 2025): 20.9
- DeepSeek V4 Pro (abr 2026): 16.0 a $0.54 misto, com 97.8 de capacidade nos benchmarks Avançados. Isso coloca o V4 Pro a 2.2 pontos de capacidade do Claude Opus 4.7 por cerca de 1/18 do preço misto ($0.54 vs $10.00).
A lacuna dos modelos fechados de fronteira não diminuiu
Os modelos de raciocínio fechados da Anthropic, OpenAI e Google agrupam-se entre 0 e 6 na densidade por dólar nos benchmarks Avançados ao longo de todo o período do painel. O GPT-4 em março de 2023 pontuou 0.0. O Claude Opus 4.7 em abril de 2026 pontuou 0.9.
Os laboratórios fechados reduziram os preços absolutos:
- O Claude Opus baixou de $30 para $10 por milhão de tokens entre o Opus 4 e o Opus 4.5.
- O o3 da OpenAI baixou de $10/$40 no lançamento para $2/$8 estabelecido.
- O Gemini 1.5 Flash baixou cerca de 78%.
Mas a diferença relativa para os líderes de densidade de peso aberto manteve-se aproximadamente 30 a 50× ao longo do período. O DeepSeek precificou perto de $0.18 por milhão em 2024 (V2) e perto de $0.18 por milhão em 2026 (V4 Flash). O piso de preço do peso aberto não se moveu, e o piso emblemático fechado não se moveu o suficiente para fechar a lacuna. A concorrência de preços está a acontecer no escalão da geração anterior, onde modelos fechados mais antigos são mantidos vivos como alternativas baratas, não na fronteira.
A nova direção: Benchmarks Agentic
Os benchmarks avançados utilizados para medir o desempenho da IA estão a começar a perder a sua eficácia, tal como os conjuntos de testes mais antigos que substituíram. Os laboratórios começaram a reportar benchmarks agentic (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) em vez dos testes de raciocínio mais antigos. Começámos a construir um painel para acompanhar esta mudança.
Por exemplo, o mais recente modelo de fronteira, Claude Opus 4.8, reporta os seus resultados quase inteiramente nestes benchmarks agentic LLM, sem pontuações nos benchmarks de raciocínio que o nosso painel principal acompanha.
Taxa de resolução do SWE-Bench Pro por data de lançamento, pontuada no harness padronizado SEAL da Scale. Entre os modelos representados:
- Os melhores desempenhos de peso fechado: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%), e Gemini 3 Pro Preview (43.3%).
- Os melhores desempenhos de peso aberto: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%), e Qwen3-235B-A22B (21.4%).
Explore os benchmarks Agentic consultando benchmarks de codificação agentic, pesquisa agentic, e monitorização agentic.
Desafios na comparação do desempenho agentic
A avaliação e comparação dos resultados dos benchmarks agentic apresentam várias dificuldades fundamentais:
- Foco nas métricas de capacidade: Podemos exibir pontuações de capacidade, porque os dados de recursos necessários para medir a densidade (contagens de parâmetros, computação de treino e preços verificados por modelo) permanecem incompletos ou não divulgados pelos laboratórios fechados.
- Sensibilidade ao nível do sistema: As pontuações dos benchmarks medem todo o sistema, não apenas o modelo de IA. Como as pontuações dependem fortemente do "scaffolding" (a estrutura de software envolvente), o mesmo modelo pode produzir resultados muito diferentes consoante o agente harness específico utilizado.
- Protocolo de padronização: Para garantir uma comparação justa, este relatório representa exclusivamente os dados do SWE-Bench Pro provenientes de um ambiente único e padronizado (a tabela de classificação SEAL da Scale). Outras pontuações reportadas pelos laboratórios utilizam harnesses diferentes e não são diretamente comparáveis.
- Exclusão do Claude Opus 4.8: Embora o Opus 4.8 auto-reporte um recorde de 69.2% no SWE-Bench Pro, foi testado no harness interno da Anthropic e ainda não foi avaliado pela SEAL da Scale. Para manter uma consistência rigorosa dos dados, anotamos a sua pontuação aqui em vez de a representar graficamente.
SWE-Bench Pro do harness padronizado SEAL da Scale. Outras colunas são reportadas pelos laboratórios em harnesses variáveis e não são diretamente comparáveis entre linhas. Os travessões significam que não foi encontrada uma pontuação verificada.
Estes três correram no harness mini-swe-agent, pelo que são excluídos do gráfico de dispersão para o manter comparável.
Metodologia da densidade de inteligência
Cobertura do painel
- Modelos: 71 LLMs lançados entre fevereiro de 2023 e abril de 2026. 37 modelos têm pontuações nos benchmarks Standard e 54 têm pontuações nos benchmarks Avançados. Os modelos sem um grupo de benchmark completo são excluídos cálculos de densidade desse grupo.
- Benchmarks: 10 benchmarks públicos, todos reportados pelos laboratórios e rastreáveis a uma fonte primária. Não re-executámos nenhum benchmark.
- Recursos: Para cada modelo, dividimos a sua pontuação de capacidade por três recursos de forma independente:
- Parâmetros ativos: Um proxy do custo de memória e de serviço. Restrito a modelos de peso aberto, porque os laboratórios de peso fechado (OpenAI, Anthropic, Google) não divulgam contagens de parâmetros.
- Computação de treino (FLOP): Um proxy da eficiência de treino. Também restrito a modelos de peso aberto. Os valores de FLOP são maioritariamente estimativas da Epoch IA e devem ser lidos como direcionais.
- Preço de inferência: O preço que um comprador efetivamente paga na API. A capacidade é dividida pelo preço misto por milhão de tokens numa proporção de input para output de 3:1. Tanto os modelos abertos como os fechados participam, porque o preço da API é publicamente verificável.
Porquê dois grupos de benchmarks?
Os modelos lançados em 2024 saturaram os benchmarks Standard que os laboratórios de IA utilizavam desde 2020. Quando os modelos de fronteira atingem 90% ou mais num benchmark, o teste deixa de distinguir os modelos fortes dos mais fortes. Os laboratórios responderam introduzindo benchmarks mais difíceis.
Tratamos esta mudança como uma rutura clara por duas razões:
- Em primeiro lugar, misturar benchmarks fáceis e difíceis numa única pontuação de capacidade permitiria que uma pontuação saturada num benchmark fácil mascarasse uma pontuação baixa num benchmark difícil. Um modelo que obtém 85 no MMLU-Pro é mais forte do que um que obtém 85 no MMLU. Tratar os dois como equivalentes comprime o intervalo de pontuação e recompensa os benchmarks mais antigos.
- Em segundo lugar, as duas suites têm distribuições de pontuação diferentes: os benchmarks Standard concentram-se no topo (a maioria dos modelos de fronteira acima de 85), enquanto os benchmarks Avançados têm uma dispersão mais ampla (modelos de topo por volta de 90, nível intermédio por volta de 50, modelos mais fracos abaixo de 30). Fazer um z-score de ambos ao mesmo tempo distorceria a estimativa de variância.
Calculamos a capacidade de cada grupo de forma independente:
- Benchmarks Standard (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks Avançados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Uma pontuação de 90 nos benchmarks Standard não é equivalente a 90 nos benchmarks Avançados. Para qualquer modelo lançado a partir de finais de 2024, os benchmarks Avançados são a referência relevante.
Fórmula da capacidade
Para cada benchmark b e cada modelo m:
Utilizamos o desvio padrão populacional (divide por N, não por N−1). Isto corresponde ao cálculo original do pandas com ddof=0 e garante que a adição de um único novo modelo não altera retroativamente a estimativa de variância.
De seguida, calculamos a média dos z-scores disponíveis por modelo dentro de cada grupo de benchmark e reescalamos min-max para uma pontuação relativa ao painel de 0–100.
Fórmula da densidade
Para cada visão de densidade:
O denominador muda consoante a visão: parâmetros ativos em milhares de milhões, FLOP de treino dividido por 10²⁴, ou preço misto por milhão de tokens.
Metodologia do índice encadeado
Os dois gráficos de índice no topo do artigo (Densidade de Inteligência e Capacidade) mostram um crescimento acumulado de linha única indexado a 100 em 2023, modelado no formato de retorno acumulado do S&P 500. Encadeamos as taxas de crescimento ano após ano ao longo da transição de benchmark em vez de representar valores absolutos.
Passo 1. Calcular a média anual da métrica para cada grupo de benchmark:
Para o Índice de Densidade de Inteligência, a métrica é a média por linha das três pontuações de densidade por modelo (Densidade Combinada A ou B). Para o Índice de Capacidade, a métrica é a pontuação de capacidade relativa ao painel (Capacidade_A ou Capacidade_B).
Passo 2. Para cada transição ano a ano, calcular o crescimento dentro de um único grupo de benchmark. Ambos os anos devem pertencer ao mesmo grupo:
Passo 3. Encadear multiplicativamente a partir de uma linha de base de 2023 de 100:
Seleção de grupo por transição:
- 2023 – 2024: Benchmarks Standard (Avançado tem 1 modelo em 2023, demasiado escasso para calcular uma média estável)
- 2024 – 2025: Benchmarks Avançados (Standard saturado no final de 2024; Avançado tem 16 modelos em 2024 e 27 em 2025)
- 2025 – 2026: Benchmarks Avançados (Standard não reportado para 2026)
O índice encadeado pressupõe que as populações subjacentes são comparáveis ao longo dos anos dentro de um grupo. O nosso painel é heterogéneo (modelos diferentes em cada ano, com cobertura de benchmark diferente), pelo que os valores encadeados são melhor lidos como um resumo direcional do que como um multiplicador preciso.
Princípios fundamentais de avaliação para a medição da densidade de inteligência
- Benchmarks padrão da indústria: Não introduzimos nenhum benchmark personalizado.
- Origem de fonte primária: Cada pontuação de benchmark é rastreável ao artigo de lançamento do modelo, cartão de modelo ou anúncio oficial. Quando a fonte primária não reportou um benchmark, a célula fica em branco em vez de ser imputada.
- Indicadores de cobertura (N): Para cada modelo, reportamos o número de benchmarks que contribuem para a sua pontuação de capacidade em cada grupo. Modelos com N=1 recebem uma pontuação mais ruidosa do que modelos com N=5. O caso N=1 aplica-se ao Qwen 3.6 35B A3B (apenas SWE-bench Verified) e a alguns lançamentos emblemáticos fechados de 2026.
Fontes de preços para modelos de peso fechado
O preço é a parte do índice mais sensível à coorte. Utilizamos a seguinte hierarquia:
- Anúncio de lançamento do laboratório (preferencial): Preço citado no post de lançamento do laboratório, documentação da API ou cobertura jornalística contemporânea.
- Mediana entre fornecedores do Artificial Analysis (alternativa para modelos apenas de pesos): Utilizada para três linhas do Llama 3.1 (8B, 70B, 405B) e para as linhas do GPT-OSS, porque não existe uma API de primeira parte.
- Apenas pesos sem cobertura: 22 das 69 linhas não têm preço por dólar registado. Aparecem nos gráficos de capacidade e de densidade por parâmetro, mas estão ausentes dos gráficos por dólar.
Acompanhamos duas vias de preço: preço de lançamento (preço de primeira parte no dia do lançamento) e preço estabelecido (preço atual de primeira parte, ou o último antes da depreciação). Seis modelos no painel foram re-precificados após o lançamento:
- Gemini 1.5 Pro: $3.50/$10.50 para $1.25/$5.00 (outubro de 2024)
- GPT-4o: $5.00/$15.00 para $2.50/$10.00 (outubro de 2024)
- Gemini 1.5 Flash: $0.35/$1.05 para $0.075/$0.30 (agosto de 2024)
- Claude 3.5 Haiku: $1.00/$5.00 para $0.80/$4.00 (dezembro de 2024)
- o3: $10.00/$40.00 para $2.00/$8.00 (junho de 2025)
A densidade por dólar no cabeçalho utiliza o preço estabelecido. Para 37 das 43 linhas com preço, os preços de lançamento e estabelecido são idênticos.
Frequência de atualização
Atualizamos o índice mensalmente. Cada atualização adiciona novas linhas de modelos para qualquer lançamento de fronteira ou notável no mês anterior, atualiza os preços quando os laboratórios ajustam as suas tarifas, preenche retroativamente benchmarks recentemente reportados para linhas existentes e recalcula os z-scores em todo o painel. Novas entradas de modelos deslocam a média e o desvio padrão de cada benchmark, pelo que as pontuações 0–100 existentes se movem com o painel. As capturas históricas são preservadas.
Limitações da avaliação da densidade de inteligência
- Otimismo reportado pelos laboratórios: As pontuações dos benchmarks provêm dos próprios laboratórios. Re-execuções independentes costumam ficar 5 a 13 pontos abaixo. As linhas de tendência são direcionalmente informativas, mas não precisas ao ponto.
- Modos de raciocínio e não raciocínio não separados: Os modelos lançados em 2025 e 2026 suportam opções de pensamento alargado que podem alterar as pontuações de matemática e codificação em 5 a 15 pontos. Utilizamos as pontuações do modo padrão quando identificáveis.
- Os valores de FLOP de treino são maioritariamente estimativas: Um punhado de linhas tem FLOP confirmado pelo laboratório. As restantes são extrapoladas dos parâmetros divulgados e tokens de treino, principalmente via Epoch IA.
- Contagens de parâmetros de modelos fechados desconhecidas: A densidade por parâmetro e por FLOP está em branco para as linhas de fronteira fechadas. Os modelos fechados participam apenas na densidade por dólar.
- Pontuações relativas ao painel: As pontuações de densidade são reescaladas min-max dentro do painel. Um novo modelo com uma razão bruta mais alta desloca a pontuação 0–100 de todos os modelos existentes. Para comparar versões do painel, utilize as razões brutas subjacentes em vez das pontuações reescaladas.
O que é a densidade de inteligência?
A densidade de inteligência representa uma nova métrica para avaliar quanto conhecimento e capacidade de raciocínio um modelo consegue concentrar numa única unidade de memória ou computação. Mede a arquitetura do modelo avaliando a eficácia com que utiliza cada parâmetro para gerar valor.
Neste quadro, o eixo x representa frequentemente o número de parâmetros do modelo, enquanto o eixo y acompanha o desempenho em tarefas desafiantes. A alta densidade ocorre quando os modelos demonstram capacidades superiores sem exigir o custo computacional maciço associado a modelos maiores. Este processo prova que a inteligência não depende unicamente da quantidade de dados ou da escala do treino, mas sim da forma como o software e os algoritmos organizam essa informação.
Anteriormente, a comunidade de IA dependia do escalonamento dos parâmetros dos modelos para alcançar maior desempenho, o que resultava em sistemas maciços e intensivos em recursos. Com esta mudança de foco, a otimização algorítmica é priorizada em detrimento do volume bruto para produzir mais inteligência a partir de modelos mais pequenos.
Porque é importante medir a densidade de inteligência?
Os sistemas eficientes devem otimizar o tempo de inferência e o uso de memória. Identificar o ponto em que mais tokens ou computação adicional já não produzem ganhos significativos ajuda a indústria a compreender os limites superiores dos atuais modelos de linguagem de grande escala. As principais razões para medir a densidade de inteligência podem ser resumidas como:
- A comunidade de IA subestima a sobrecarga a longo prazo de manter modelos sobredimensionados em centros de dados.
- A criação de valor em aplicações práticas depende da razão entre a qualidade do output e a energia necessária para o produzir.
- A Lei de Moore para o hardware não consegue sustentar o crescimento dos modelos de linguagem sem um progresso correspondente na forma como os otimizamos.
- A aprendizagem por reforço e uma melhor distribuição dos dados permitem que as ferramentas da próxima geração atinjam benchmarks antes reservados apenas a humanos. Saiba mais sobre aprendizagem por reforço e outros tipos de fine-tuning de LLM.
Embora os modelos maiores ainda sejam importantes para explorar novas fronteiras, a densidade de um sistema determina a sua utilidade real no mundo real. Este contexto ajuda a ver a inteligência como um resultado concentrado do treino, e não como um subproduto do tamanho bruto.
Leitura adicional
A densidade de inteligência é uma forma de comparar LLMs. Outras dimensões são abordadas em análises separadas:
- Benchmarks de latência: Para o tempo até ao primeiro token e tokens por segundo, consulte o nosso benchmark de latência de LLM.
- Benchmarks por tarefa: Para raciocínio financeiro, veja o nosso benchmark de LLM financeiro. Para codificação, veja o nosso benchmark de codificação de IA.
Cite este benchmark
Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Densidade de Inteligência de 71 LLMs: Modelos Mais Inteligentes e Densos}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Acessado em 7 Julho 2026}
}Resultados e carimbos de data/hora de 69 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo um arquivo CSV e um README.
Seja o primeiro a comentar
Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.