Serviços
Contate-nos

Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos

Hazal Şimşek
Hazal Şimşek
atualizado em 7 jul. 2026

Acompanhamos 71 LLMs lançados entre fevereiro de 2023 e maio de 2026 e coletamos 10 benchmarks públicos para medir a densidade de inteligência. Dividimos a pontuação de capacidade pelo recurso que o model consome (parâmetros ativos, computação de treinamento e preço de inference).

Loading Chart

LLM visão geral da densidade de inteligência

Para calcular a densidade de inteligência, executamos as seguintes etapas:

  • Eficiência de recursos: Dividimos a capacidade de cada model por duas métricas de recursos:
    • Parâmetros ativos: Um proxy para custo de memória e serviço (para models de peso aberto).
    • Preço de inference: Eficiência de custo de mercado com base no preço combinado de API por milhão de tokens.
    • Nota sobre computação de treinamento (FLOP): Inicialmente incluímos um terceiro eixo, computação de treinamento (FLOP), mas o removemos porque sua inclinação negativa nos benchmarks padrão saturados arrastou o composto de 2023–2024 para uma queda contraintuitiva.
  • Agrupamento de benchmarks: Para evitar que a saturação de pontuação mascare os ganhos de eficiência, avaliamos as capacidades em duas eras distintas de benchmarks:
    • Benchmarks padrão (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
    • Benchmarks avançados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
  • Indexação encadeada: Calculamos o crescimento ano a ano dentro de grupos de benchmarks correspondentes e os encadeamos multiplicativamente a partir de uma linha de base de 2023 de 100 para traçar a tendência cumulativa.

Consulte a metodologia para a abordagem de pontuação e os detalhamentos por recurso.

LLM resultados da densidade de inteligência

Em meados de 2026, o ecossistema de IA entregou quase 15× mais inteligência por unidade de recurso (parâmetros e dólares) do que a linha de base de 2023. Duas observações ao ler a tendência:

  • O salto de 2024–2025 (+362%) exagera o ganho real: Os benchmarks avançados eram novos em 2024 e apenas alguns models tinham pontuações neles, então a linha de base de 2024 está artificialmente baixa. A maior parte do “aumento” é o painel se preenchendo, não um salto de eficiência de um ano.
  • O ganho de 2025–2026 (+105%) é onde está a história real: Ele é medido em muitos mais models e é impulsionado por lançamentos abertos de pequeno porte, como Qwen 3.6-35B-A3B e DeepSeek V4 Flash, igualando a capacidade de models fechados de fronteira a uma fração do tamanho e do custo.

LLM capacidade

O gráfico de densidade mostra eficiência. Para contextualizar, também medimos a capacidade bruta no mesmo período: quão mais inteligentes esses models realmente ficaram antes de qualquer ajuste de recursos?

Capacidade indexada em 100 em 2023, com média de todos os models lançados a cada ano.

Os eixos e a dica de ferramenta funcionam da mesma forma que o gráfico de densidade, com o eixo Y acompanhando o desempenho bruto em benchmarks, em vez da densidade.

Uma pontuação de capacidade de 100 em 2023 cresceu para 468 em 2026, aproximadamente uma melhoria de 4.7×. Ano a ano:

  • 2024 (+88%): Progresso rápido nos benchmarks padrão antes de saturarem.
  • 2025 (+105%): O mesmo progresso rápido, medido nos benchmarks avançados mais difíceis que substituíram os padrão.
  • 2026 (+22%): A desaceleração é um sinal precoce de que os benchmarks avançados também estão começando a saturar.

Colocando os dois gráficos lado a lado:

  • A capacidade cresceu 4.7×, enquanto a densidade de inteligência cresceu 8.9×.
  • Os models ficaram mais inteligentes e mais eficientes ao mesmo tempo. Eles não precisam de proporcionalmente mais parâmetros, computação de treinamento ou dinheiro para funcionar.

Observe que: O valor de capacidade de 4.7× é uma magnitude credível. O valor de densidade de 8.9× é mais frágil (o grupo avançado de 2024 tem menos pontos de dados, o que amplifica a taxa de crescimento daquele ano), então trate-o como um sinal direcional, em vez de um multiplicador preciso.

Qual LLM tem a maior densidade de inteligência?

A densidade de inteligência depende de qual recurso medimos e de qual grupo de benchmarks usamos para pontuar. O líder muda a cada combinação.

Densidade por parâmetro ativo (peso aberto)

Esta visão mede a eficiência com que um model compacta capacidade em seus pesos. Os parâmetros ativos importam porque os models Mixture-of-Experts (MoE) roteiam cada token através de uma fração do total de pesos. O DeepSeek V3 tem 671B de parâmetros totais, mas 37B ativos por token, e o valor de 37B reflete o custo efetivo de serviço.

Líderes dos benchmarks padrão

  • LLaMA 3.1 8B (jul. 2024): 100.0
  • LLaMA 3 8B (abr. 2024): 85.0
  • LLaMA 4 Maverick (abr. 2025): 55.9
  • Mixtral 8x7B (dez. 2023): 47.4
  • Mistral 7B (set. 2023): 46.3

Líderes dos benchmarks avançados

  • Qwen 3.6-35B-A3B (abr. 2026): 100.0 (3B parâmetros ativos; a pontuação se baseia em um único benchmark, SWE-bench Verified com 73.4%, então leia com ressalvas)
  • GPT-OSS 20B (ago. 2025): 85.2 (3.6B parâmetros ativos)
  • GPT-OSS 120B (ago. 2025): 64.4 (5.1B parâmetros ativos)
  • Qwen 3.5 9B (mar. 2026): 35.2 (9B parâmetros densos)
  • DeepSeek V4 Flash (abr. 2026): 26.0

O ranking dos benchmarks padrão parou de se mover desde o final de 2024 porque os benchmarks saturaram, não porque o progresso parou. O GPT-4 marcou 90.2 nos benchmarks padrão no início de 2023, mas 17.3 nos benchmarks avançados.

Densidade por FLOP de treinamento (peso aberto)

Esta visão recompensa a curadoria de dados, as escolhas de arquitetura e as receitas de treinamento, em vez do gasto bruto.

Nota: a densidade por FLOP nos benchmarks padrão parece estar caindo com o tempo. Isso é um artefato de saturação, não uma queda na eficiência de treinamento. Os benchmarks mais antigos não medem mais os ganhos recentes, então as pontuações de capacidade se comprimem enquanto a computação de treinamento continua crescendo.

Líderes dos benchmarks padrão

  • Mistral 7B (set. 2023): 100.0 (ainda a âncora do painel, mais de dois anos depois)
  • LLaMA 3 8B (abr. 2024): 40.8
  • LLaMA 1 (fev. 2023): 37.0
  • DeepSeek V2 (mai. 2024): 32.6
  • Mixtral 8x7B (dez. 2023): 27.1

Líderes dos benchmarks avançados

  • Qwen 3.5 9B (mar. 2026): 100.0
  • Qwen 3.6-35B-A3B (abr. 2026): 28.4
  • DeepSeek V4 Flash (abr. 2026): 6.4

O resultado do Qwen 3.5 (9B) é notável: um model denso de 9B treinado com cerca de 1.5 × 10²³ FLOP que atinge 81.2 de capacidade nos benchmarks avançados. Sua computação de treinamento é cerca de uma ordem de grandeza menor que a do DeepSeek V4 Pro, mas a diferença de capacidade é menor.

Densidade por dólar de inference

A densidade por dólar é o eixo em que models abertos e fechados de fronteira podem ser diretamente comparados, porque o preço da API é publicamente verificável. Usamos preços consolidados para o valor principal, para que os cortes pós-lançamento sejam refletidos.

Líderes dos benchmarks padrão

  • Mistral Small 3 24B (jan. 2025): 100.0 a $0,10 / $0,30 por milhão de tokens via a Mistral’s própria API
  • Gemini 1.5 Flash (mai. 2024): 99.3 (model de peso fechado com maior pontuação após o corte de preço de agosto de 2024)
  • DeepSeek V2 (mai. 2024): 66.0 a $0,27 / $1,10 por milhão de tokens
  • DeepSeek V3 (dez. 2024): 30.9
  • DeepSeek R1 (jan. 2025): 17.8

Líderes dos benchmarks avançados

  • GPT-OSS 120B (ago. 2025): 100.0 (a referência de preço é a mediana entre provedores do OpenRouter, já que a OpenAI não hospedou o model em uma API própria)
  • GPT-OSS 20B (ago. 2025): 80.0
  • DeepSeek V4 Flash (abr. 2026): 44.0 a $0,06 / $0,42 por milhão de tokens via a DeepSeek’s própria API
  • DeepSeek V3.2 (dez. 2025): 22.5
  • Mistral Small 3 24B (jan. 2025): 20.9
  • DeepSeek V4 Pro (abr. 2026): 16.0 a $0,54 combinados, com 97.8 de capacidade em benchmarks avançados. Isso coloca o V4 Pro a 2.2 pontos de capacidade do Claude Opus 4.7 por cerca de 1/18 do preço combinado ($0,54 vs $10,00).

A lacuna da fronteira fechada não diminuiu

Models de raciocínio fechados da Anthropic, da OpenAI e do Google se concentram entre 0 e 6 na densidade por dólar em benchmarks avançados durante todo o período do painel. O GPT-4 em março de 2023 marcou 0.0. O Claude Opus 4.7 em abril de 2026 marcou 0.9.

Os laboratórios fechados reduziram os preços absolutos:

  • Claude Opus caiu de $30 para $10 por milhão de tokens entre o Opus 4 e o Opus 4.5.
  • o3 da OpenAI caiu de $10/$40 no lançamento para $2/$8 consolidados.
  • Gemini 1.5 Flash caiu cerca de 78%.

Mas a lacuna relativa para os líderes de densidade de peso aberto permaneceu em cerca de 30 a 50× ao longo do período. A DeepSeek precificou perto de $0,18 por milhão em 2024 (V2) e perto de $0,18 por milhão em 2026 (V4 Flash). O piso de preço de peso aberto não se moveu, e o piso dos principais models fechados não se moveu o suficiente para fechar a lacuna. A concorrência de preços está ocorrendo no nível da geração anterior, onde models fechados mais antigos são mantidos vivos como alternativas baratas, não na fronteira.

A nova direção: benchmarks agênticos

Os benchmarks avançados usados para medir o desempenho da IA estão começando a perder eficácia, como as suítes de teste mais antigas que substituíram. Os laboratórios começaram a relatar benchmarks agênticos (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) em vez dos testes de raciocínio mais antigos. Começamos a construir um painel para acompanhar essa mudança.

Por exemplo, o mais novo model de fronteira, Claude Opus 4.8, relata seus resultados quase inteiramente nesses agentic LLM benchmarks, sem pontuações nos benchmarks de raciocínio que nosso painel principal acompanha.

Taxa de resolução do SWE-Bench Pro por data de lançamento, pontuada no harness padronizado SEAL da Scale. Entre os models plotados:

  • Principais models de peso fechado: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%) e Gemini 3 Pro Preview (43.3%).
  • Principais models de peso aberto: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%) e Qwen3-235B-A22B (21.4%).

Explore benchmarks Agentic conferindo benchmarks de codificação agentic, busca agentic e monitoramento agentic.

Desafios na comparação do desempenho agentic

Avaliar e comparar resultados de benchmarks agentic apresenta várias dificuldades importantes:

  • Foco em métricas de capacidade: Podemos exibir pontuações de capacidade porque os dados de recursos necessários para medir a densidade (contagem de parâmetros, computação de treinamento e preços verificados por model) permanecem incompletos ou não divulgados pelos laboratórios fechados.
  • Sensibilidade em nível de sistema: As pontuações de benchmark medem todo o sistema, não apenas o model de IA. Como as pontuações dependem muito do “andaime” (o framework de software ao redor), o mesmo model pode produzir resultados muito diferentes dependendo do agent harness específico usado.
  • Protocolo de padronização: Para garantir uma comparação justa, este relatório plota exclusivamente dados do SWE-Bench Pro de um único ambiente padronizado (o leaderboard SEAL da Scale). Outras pontuações relatadas por laboratórios usam harnesses diferentes e não são diretamente comparáveis.
  • Exclusão do Claude Opus 4.8: Embora o Opus 4.8 autorrelate um recorde de 69.2% no SWE-Bench Pro, ele foi testado no harness interno da Anthropic e ainda não foi avaliado pelo SEAL da Scale. Para manter a consistência estrita dos dados, anotamos sua pontuação aqui em vez de plotá-la.

SWE-Bench Pro do harness padronizado Scale SEAL. Outras colunas são relatadas por laboratórios em harnesses variados e não são diretamente comparáveis entre linhas. Traços significam que nenhuma pontuação verificada foi encontrada.

Esses três rodaram no harness mini-swe-agent, portanto foram excluídos do gráfico de dispersão para manter a comparabilidade.

Deixe nossa equipe automatizar um dos seus processos de negócio com agentes de IA, gratuitamente.
Automatizar um processo

Metodologia da densidade de inteligência

Cobertura do painel

  • Models: 71 LLMs lançados de fevereiro de 2023 a abril de 2026. 37 models têm pontuações de benchmarks padrão e 54 têm pontuações de benchmarks avançados. Models sem um grupo completo de benchmarks são excluídos cálculos de densidade daquele grupo.
  • Benchmarks: 10 benchmarks públicos, todos relatados por laboratórios e rastreáveis até uma fonte primária. Não executamos novamente nenhum benchmark.
  • Recursos: Para cada model, dividimos sua pontuação de capacidade por três recursos independentemente:
    • Parâmetros ativos: Um proxy para custo de memória e serviço. Restrito a models de peso aberto, porque os laboratórios de peso fechado (OpenAI, Anthropic, Google) não divulgam contagens de parâmetros.
    • Computação de treinamento (FLOP): Um proxy para eficiência de treinamento. Também restrito a models de peso aberto. Os números de FLOP são, em sua maioria, estimativas da Epoch IA e devem ser lidos como direcionais.
    • Preço de inference: O preço que o comprador realmente paga na API. A capacidade é dividida pelo preço combinado por milhão de tokens em uma proporção de 3:1 entrada-saída. Tanto models abertos quanto fechados participam, porque o preço da API é publicamente verificável.

Por que dois grupos de benchmarks?

Os models lançados em 2024 saturaram os benchmarks padrão que os laboratórios de IA usavam desde 2020. Quando os models de fronteira atingem 90% ou mais em um benchmark, o teste não separa mais models fortes de models mais fortes. Os laboratórios responderam introduzindo benchmarks mais difíceis.

Tratamos essa mudança como uma ruptura clara por dois motivos:

  • Primeiro, misturar benchmarks fáceis e difíceis em uma única pontuação de capacidade permitiria que uma pontuação saturada em um benchmark fácil mascarasse uma pontuação baixa em um difícil. Um model que pontua 85 no MMLU-Pro é mais forte do que um que pontua 85 no MMLU. Tratar os dois como equivalentes comprime o intervalo de pontuação e recompensa benchmarks mais antigos.
  • Segundo, as duas suítes têm distribuições de pontuação diferentes: os benchmarks padrão se agrupam no topo (a maioria dos models de fronteira acima de 85), enquanto os benchmarks avançados têm dispersão mais ampla (principais models em torno de 90, nível intermediário em torno de 50, models mais fracos abaixo de 30). Pontuar com Z-score em ambos ao mesmo tempo distorceria a estimativa de variância.

Calculamos a capacidade de cada grupo de forma independente:

  • Benchmarks padrão (2023–2024): MMLU (5-shot), GSM8K (8-shot cadeia de pensamento), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
  • Benchmarks avançados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.

Uma pontuação de 90 nos benchmarks padrão não é equivalente a 90 nos benchmarks avançados. Para qualquer model lançado do final de 2024 em diante, os benchmarks avançados são a referência significativa.

Fórmula de capacidade

Para cada benchmark b e cada model m:

Usamos o desvio padrão populacional (divide por N, não N−1). Isso corresponde ao cálculo original do pandas com ddof=0 e garante que adicionar um único novo model não altere retroativamente a estimativa de variância.

Em seguida, calculamos a média dos z-scores disponíveis por model dentro de cada grupo de benchmarks e redimensionamos por min-max para uma pontuação relativa ao painel de 0–100.

Fórmula de densidade

Para cada visão de densidade:

O denominador muda conforme a visão: parâmetros ativos em bilhões, FLOP de treinamento dividido por 10²⁴ ou preço combinado por milhão de tokens.

Metodologia do índice encadeado

Os dois gráficos de índice no topo do artigo (Densidade de Inteligência e Capacidade) mostram um crescimento cumulativo de linha única indexado em 100 em 2023, modelado no formato de retorno cumulativo do S&P 500. Encadeamos taxas de crescimento ano a ano ao longo da transição de benchmarks em vez de plotar valores absolutos.

Etapa 1. Calcule a média anual da métrica para cada grupo de benchmarks:

Para o Índice de Densidade de Inteligência, a métrica é a média por linha das três pontuações de densidade por model (Densidade Combinada A ou B). Para o Índice de Capacidade, a métrica é a pontuação de capacidade relativa ao painel (Capability_A ou Capability_B).

Etapa 2. Para cada transição ano a ano, calcule o crescimento dentro de um único grupo de benchmarks. Ambos os anos devem vir do mesmo grupo:

Etapa 3. Encadeie multiplicativamente a partir de uma linha de base de 2023 de 100:

Seleção de grupo por transição:

  • 2023 – 2024: Benchmarks padrão (Avançados têm 1 model em 2023, insuficiente para calcular uma média estável)
  • 2024 – 2025: Benchmarks avançados (Padrão saturado no final de 2024; Avançados têm 16 models em 2024 e 27 em 2025)
  • 2025 – 2026: Benchmarks avançados (Padrão não relatado para 2026)

O índice encadeado pressupõe que as populações subjacentes são comparáveis entre anos dentro de um grupo. Nosso painel é heterogêneo (models diferentes a cada ano, com cobertura de benchmarks diferente), então os valores encadeados são melhor interpretados como um resumo direcional do que como um multiplicador preciso.

Princípios centrais de avaliação para medição da densidade de inteligência

  • Benchmarks padrão do setor: Não introduzimos nenhum benchmark personalizado.
  • Fonte primária: Cada pontuação de benchmark é rastreável até o artigo de lançamento do model, o model card ou o anúncio oficial. Quando a fonte primária não relatou um benchmark, a célula fica vazia em vez de ser imputada.
  • Sinalizadores de cobertura (N): Para cada model, relatamos o número de benchmarks que contribuem para sua pontuação de capacidade em cada grupo. Models com N=1 recebem uma pontuação mais ruidosa do que models com N=5. O caso N=1 se aplica a Qwen 3.6 35B A3B (SWE-bench Verified) e a alguns lançamentos principais fechados de 2026.

Fontes de preços para models de peso fechado

O preço é a parte do índice mais sensível à coorte. Usamos a seguinte hierarquia:

  1. Anúncio de lançamento do laboratório (preferido): Preço citado na publicação de lançamento do laboratório, na documentação da API ou na cobertura de imprensa contemporânea.
  2. Mediana entre provedores da Artificial Analysis (alternativa para models de pesos): Usada para três linhas Llama 3.1 (8B, 70B, 405B) e para as linhas GPT-OSS, porque não existe API própria.
  3. Pesos sem cobertura: 22 das 69 linhas não têm preço por dólar registrado. Elas aparecem nos gráficos de capacidade e por parâmetro, mas estão ausentes dos gráficos por dólar.

Acompanhamos duas trilhas de preço: preço de lançamento (preço próprio no dia do lançamento) e preço consolidado (preço próprio atual ou o último antes da descontinuação). Seis models no painel foram reprecificados após o lançamento:

  • Gemini 1.5 Pro: de $3,50/$10,50 para $1,25/$5,00 (outubro de 2024)
  • GPT-4o: de $5,00/$15,00 para $2,50/$10,00 (outubro de 2024)
  • Gemini 1.5 Flash: de $0,35/$1,05 para $0,075/$0,30 (agosto de 2024)
  • Claude 3.5 Haiku: de $1,00/$5,00 para $0,80/$4,00 (dezembro de 2024)
  • o3: de $10,00/$40,00 para $2,00/$8,00 (junho de 2025)

A densidade por dólar em destaque usa preços consolidados. Para 37 das 43 linhas precificadas, os preços de lançamento e consolidados são idênticos.

Periodicidade de atualização

Atualizamos o índice mensalmente. Cada atualização adiciona novas linhas de models para qualquer lançamento de fronteira ou notável do mês anterior, atualiza os preços quando os laboratórios ajustam suas taxas, preenche retrospectivamente benchmarks recém-relatados para linhas existentes e recalcula os z-scores em todo o painel. Novas entradas de models alteram a média e o desvio padrão de cada benchmark, de modo que as pontuações existentes de 0–100 se movem com o painel. Instantâneos históricos são preservados.

Limitações da avaliação da densidade de inteligência

  • Otimismo relatado por laboratórios: As pontuações de benchmark vêm dos próprios laboratórios. Reexecuções independentes geralmente resultam de 5 a 13 pontos mais baixas. As linhas de tendência são informativas direcionalmente, mas não precisas ponto a ponto.
  • Modos de raciocínio e não raciocínio não separados: Models lançados em 2025 e 2026 suportam opções de pensamento estendido que podem alterar pontuações de matemática e codificação em 5 a 15 pontos. Usamos pontuações em modo padrão quando identificáveis.
  • Números de FLOP de treinamento são, em sua maioria, estimativas: Um punhado de linhas tem FLOP confirmado pelo laboratório. O restante é extrapolado de parâmetros divulgados e tokens de treinamento, principalmente via Epoch IA.
  • Contagens de parâmetros de models fechados desconhecidas: As densidades por parâmetro e por FLOP ficam vazias para linhas de fronteira fechadas. Models fechados participam da densidade por dólar.
  • Pontuações relativas ao painel: As pontuações de densidade são redimensionadas por min-max dentro do painel. Um novo model com uma razão bruta maior desloca a pontuação 0–100 de todos os models existentes. Para comparar versões do painel, use as razões brutas subjacentes em vez das pontuações redimensionadas.
Não perca os nossos benchmarks e insights baseados em dados. O botão abre o Google; selecionar a AIMultiple confirma que deseja ver a AIMultiple com mais frequência nos resultados de pesquisa do Google.
GoogleAdicionar como fonte preferencial

O que é densidade de inteligência?

A densidade de inteligência representa uma nova métrica para avaliar quanto conhecimento e capacidade de raciocínio um model pode compactar em uma única unidade de memória ou computação. Ela mede a arquitetura do model avaliando a eficácia com que ele usa cada parâmetro para gerar valor.

Nesse framework, o eixo x geralmente representa o número de parâmetros do model, enquanto o eixo y acompanha o desempenho em tarefas desafiadoras. Alta densidade ocorre quando os models demonstram capacidades superiores sem exigir o enorme custo computacional associado a models maiores. Esse processo prova que a inteligência não depende apenas da quantidade de dados ou da escala do treinamento, mas sim de como o software e os algoritmos organizam essas informações.

Anteriormente, a comunidade de IA dependia do escalonamento de parâmetros do model para alcançar maior desempenho, o que resultava em sistemas massivos e intensivos em recursos. Com essa mudança de foco, a otimização algorítmica é priorizada em relação ao volume bruto para produzir mais inteligência a partir de models menores.

Por que é importante medir a densidade de inteligência?

Sistemas eficientes devem otimizar o tempo de inference e o uso de memória. Identificar o ponto em que mais tokens ou computação adicional não geram mais ganhos significativos ajuda o setor a entender os limites superiores dos atuais large language models. As principais razões para medir a densidade de inteligência podem ser resumidas em:

  • A comunidade de IA subestima a sobrecarga de longo prazo da manutenção de models superdimensionados em centros de dados.
  • Criação de valor em aplicações práticas depende da relação entre a qualidade da saída e a energia necessária para produzi-la.
  • A Lei de Moore para hardware não pode sustentar o crescimento dos language models sem um progresso correspondente na forma como os otimizamos.
  • Reinforcement learning e melhor distribuição de dados permitem que ferramentas da próxima geração alcancem benchmarks antes reservados apenas a humanos. Saiba mais sobre reinforcement learning e outros tipos de técnicas de LLM fine-tuning .

Embora models maiores ainda importem para explorar novas fronteiras, a densidade de um sistema determina sua utilidade real no mundo real. Esse contexto ajuda a ver a inteligência como um resultado concentrado do treinamento, e não como um subproduto do tamanho puro.

Leitura adicional

A densidade de inteligência é uma forma de comparar LLMs. Outras dimensões são abordadas em análises separadas:

Cite este benchmark

Escolha o formato adequado ao local onde você vai publicar. Colar a versão com link no seu CMS preserva o backlink.

Hazal Şimşek (2026) - "Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos". Publicado on-line em AIMultiple.com. Acessado em 7 Julho 2026, em: https://aimultiple.com/intelligence-density [Recurso on-line]

Şimşek, H. (2026, 7 Julho). Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos. AIMultiple. https://aimultiple.com/intelligence-density

@misc{simsek2026,
  author = {Şimşek, Hazal},
  title  = {{Densidade de Inteligência de 71 LLMs para Models Mais Inteligentes e Densos}},
  year   = {2026},
  month  = jul,
  howpublished    = {\url{https://aimultiple.com/intelligence-density}},
  note   = {AIMultiple. Acessado em 7 Julho 2026}
}
Baixar todos os dados

Resultados e carimbos de data/hora de 91 pontos de dados. Baixe os dados utilizados neste artigo como um arquivo ZIP contendo 3 arquivos CSV e um README.

Última atualização: 17 Agosto 2026
Baixar
Hazal Şimşek
Hazal Şimşek
Analista do Setor
Hazal é analista do setor na AIMultiple, com foco em inteligência de processos (incluindo mineração de processos) e automação empresarial (incluindo automação de TI e automação low-code/no-code).
Ver perfil completo

Seja o primeiro a comentar

Seu endereço de e-mail não será publicado. Todos os campos são obrigatórios. Os comentários são deixados em seu idioma original.

0/450