Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos
Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference).
Descripción general de la densidad de inteligencia de LLM
Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos:
- Eficiencia de recursos: Dividimos la capacidad de cada modelo por dos métricas de recursos:
- Parámetros activos: Un proxy para el costo de memoria y servicio (para modelos de pesos abiertos).
- Precio de inference: Eficiencia de costes de mercado basada en precios combinados de API por millón de tokens.
- Nota sobre el cómputo de entrenamiento (FLOP): Inicialmente incluimos un tercer eje, el cómputo de entrenamiento (FLOP), pero lo eliminamos porque su pendiente negativa en los benchmarks estándar saturados arrastró el compuesto 2023-2024 a una caída contraintuitiva.
- Agrupación de benchmarks: Para evitar que la saturación de puntuaciones enmascare las ganancias de eficiencia, evaluamos las capacidades en dos eras de benchmarks distintas:
- Benchmarks estándar (2023-2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avanzados (2024-2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indexación encadenada: Calculamos el crecimiento interanual dentro de grupos de benchmarks coincidentes y los encadenamos multiplicativamente desde una línea base de 2023 de 100 para trazar la tendencia acumulada.
Consulte la metodología para conocer el enfoque de puntuación y los desgloses por recurso.
Resultados de la densidad de inteligencia de LLM
A mediados de 2026, el ecosistema de IA entregó casi 15 veces más inteligencia por unidad de recurso (parámetros y dólares) que la línea base de 2023. Dos cosas a tener en cuenta al leer la tendencia:
- El salto de 2024-2025 (+362 %) exagera la ganancia real: Los benchmarks avanzados eran nuevos en 2024 y solo un puñado de modelos tenía puntuaciones en ellos, por lo que la línea base de 2024 es artificialmente baja. La mayor parte del “aumento” se debe a que el panel se está completando, no a un salto de eficiencia de un año.
- La ganancia de 2025-2026 (+105 %) es donde está la historia real: Se mide en muchos más modelos y está impulsada por lanzamientos de pesos abiertos de pequeño tamaño como Qwen 3.6-35B-A3B y DeepSeek V4 Flash, que igualan la capacidad de los modelos cerrados de frontera a una fracción del tamaño y el costo.
Capacidad de LLM
El gráfico de densidad muestra la eficiencia. Para contextualizarlo, también medimos la capacidad bruta durante el mismo período: ¿cuánto más inteligentes se han vuelto realmente estos modelos antes de cualquier ajuste por recursos?
Capacidad indexada a 100 en 2023, promediada entre todos los modelos lanzados cada año.
Los ejes y la información sobre herramientas funcionan igual que el gráfico de densidad, con el eje Y siguiendo el rendimiento bruto en benchmarks en lugar de la densidad.
Una puntuación de capacidad de 100 en 2023 creció a 468 en 2026, aproximadamente una mejora de 4.7×. Año por año:
- 2024 (+88 %): Progreso rápido en los benchmarks estándar antes de que se saturaran.
- 2025 (+105 %): El mismo progreso rápido, medido en los benchmarks avanzados más difíciles que reemplazaron a los estándar.
- 2026 (+22 %): La desaceleración es una señal temprana de que los benchmarks avanzados también están empezando a saturarse.
Al poner los dos gráficos uno al lado del otro:
- La capacidad creció 4.7× mientras que la densidad de inteligencia creció 8.9×.
- Los modelos se volvieron más inteligentes y más eficientes al mismo tiempo. No necesitan proporcionalmente más parámetros, cómputo de entrenamiento ni dinero para funcionar.
Tenga en cuenta que: La cifra de capacidad de 4.7× es una magnitud creíble. La cifra de densidad de 8.9× es más frágil (el grupo avanzado de 2024 tiene menos puntos de datos, lo que amplifica la tasa de crecimiento de ese año), así que trátela como una señal direccional en lugar de un multiplicador preciso.
¿Qué LLM tiene la mayor densidad de inteligencia?
La densidad de inteligencia depende de qué recurso medimos y de en qué grupo de benchmarks puntuamos. El líder cambia en cada combinación.
Densidad por parámetro activo (pesos abiertos)
Esta vista mide la eficiencia con la que un modelo concentra capacidad en sus pesos. Los parámetros activos importan porque los modelos de mezcla de expertos (MoE) enrutan cada token a través de una fracción del total de pesos. DeepSeek V3 tiene 671B de parámetros totales, pero 37B activos por token, y la cifra de 37B refleja el costo efectivo de servicio.
Líderes en benchmarks estándar
- LLaMA 3.1 8B (jul 2024): 100.0
- LLaMA 3 8B (abr 2024): 85.0
- LLaMA 4 Maverick (abr 2025): 55.9
- Mixtral 8x7B (dic 2023): 47.4
- Mistral 7B (sep 2023): 46.3
Líderes en benchmarks avanzados
- Qwen 3.6-35B-A3B (abr 2026): 100.0 (3B parámetros activos; la puntuación se basa en un único benchmark, SWE-bench Verified con 73,4 %, así que léalo en consecuencia)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parámetros activos)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parámetros activos)
- Qwen 3.5 9B (mar 2026): 35.2 (9B parámetros densos)
- DeepSeek V4 Flash (abr 2026): 26.0
El ranking de benchmarks estándar ha dejado de moverse desde finales de 2024 porque los benchmarks se han saturado, no porque el progreso se haya detenido. GPT-4 obtuvo 90.2 en los benchmarks estándar a principios de 2023, pero 17.3 en los benchmarks avanzados.
Densidad por FLOP de entrenamiento (pesos abiertos)
Esta vista premia la curación de datos, las decisiones de arquitectura y las recetas de entrenamiento en lugar del gasto bruto.
Nota: la densidad por FLOP en los benchmarks estándar parece estar cayendo con el tiempo. Esto es un artefacto de saturación, no una disminución de la eficiencia de entrenamiento. Los benchmarks más antiguos ya no miden las ganancias recientes, por lo que las puntuaciones de capacidad se comprimen mientras el cómputo de entrenamiento sigue creciendo.
Líderes en benchmarks estándar
- Mistral 7B (sep 2023): 100.0 (sigue siendo el ancla del panel, más de dos años después)
- LLaMA 3 8B (abr 2024): 40.8
- LLaMA 1 (feb 2023): 37.0
- DeepSeek V2 (may 2024): 32.6
- Mixtral 8x7B (dic 2023): 27.1
Líderes en benchmarks avanzados
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (abr 2026): 28.4
- DeepSeek V4 Flash (abr 2026): 6.4
El resultado de Qwen 3.5 (9B) es notable: un modelo denso de 9B entrenado con aproximadamente 1.5 × 10²³ FLOP que obtiene 81.2 en la capacidad de los benchmarks avanzados. Su cómputo de entrenamiento es aproximadamente un orden de magnitud menor que el de DeepSeek V4 Pro, pero la brecha de capacidad es menor.
Densidad por dólar de inference
La densidad por dólar es el eje donde los modelos de pesos abiertos y de frontera cerrados se pueden comparar directamente, porque los precios de la API son verificables públicamente. Usamos los precios establecidos para el titular, de modo que se reflejen las reducciones posteriores al lanzamiento.
Líderes en benchmarks estándar
- Mistral Small 3 24B (ene 2025): 100.0 a $0,10 / $0,30 por millón de tokens a través de la API de primera parte de Mistral
- Gemini 1.5 Flash (may 2024): 99.3 (el modelo de pesos cerrados con mayor puntuación después de su recorte de precios de agosto de 2024)
- DeepSeek V2 (may 2024): 66.0 a $0,27 / $1,10 por millón de tokens
- DeepSeek V3 (dic 2024): 30.9
- DeepSeek R1 (ene 2025): 17.8
Líderes en benchmarks avanzados
- GPT-OSS 120B (ago 2025): 100.0 (la referencia de precio es la mediana entre proveedores de OpenRouter, ya que OpenAI no alojó el modelo en una API de primera parte)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (abr 2026): 44.0 a $0,06 / $0,42 por millón de tokens a través de la API de primera parte de DeepSeek
- DeepSeek V3.2 (dic 2025): 22.5
- Mistral Small 3 24B (ene 2025): 20.9
- DeepSeek V4 Pro (abr 2026): 16.0 a $0,54 combinado, con una capacidad de 97.8 en benchmarks avanzados. Eso sitúa a V4 Pro a 2.2 puntos de capacidad de Claude Opus 4.7 a aproximadamente 1/18 del precio combinado ($0,54 frente a $10,00).
La brecha de la frontera cerrada no se ha reducido
Los modelos de razonamiento cerrados de Anthropic, OpenAI y Google se agrupan entre 0 y 6 en la densidad por dólar de los benchmarks avanzados durante todo el período del panel. GPT-4 en marzo de 2023 obtuvo 0.0. Claude Opus 4.7 en abril de 2026 obtuvo 0.9.
Los laboratorios cerrados han recortado los precios absolutos:
- Claude Opus bajó de $30 a $10 por millón de tokens entre Opus 4 y Opus 4.5.
- El o3 de OpenAI bajó de $10/$40 en el lanzamiento a $2/$8 establecidos.
- Gemini 1.5 Flash bajó aproximadamente 78 %.
Pero la brecha relativa con los líderes de densidad de pesos abiertos se mantuvo aproximadamente entre 30 y 50× durante todo el período. DeepSeek fijó precios cerca de $0,18 por millón en 2024 (V2) y cerca de $0,18 por millón en 2026 (V4 Flash). El piso de precios de los pesos abiertos no se ha movido, y el piso del buque insignia cerrado no se ha movido lo suficiente para cerrar la brecha. La competencia de precios está ocurriendo en el nivel de la generación anterior, donde los modelos cerrados más antiguos se mantienen vivos como alternativas baratas, no en la frontera.
La nueva dirección: benchmarks agénticos
Los benchmarks avanzados utilizados para medir el rendimiento de la IA están empezando a perder su eficacia, al igual que las suites de pruebas más antiguas que reemplazaron. Los laboratorios han empezado a informar benchmarks agénticos (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) en lugar de las pruebas de razonamiento más antiguas. Comenzamos a construir un panel para seguir este cambio.
Por ejemplo, el modelo de frontera más nuevo, Claude Opus 4.8, informa sus resultados casi exclusivamente en estos benchmarks agénticos de LLM benchmarks, sin puntuaciones en los benchmarks de razonamiento que sigue nuestro panel principal.
Tasa de resolución de SWE-Bench Pro por fecha de lanzamiento, puntuada en el arnés estandarizado SEAL de Scale. Entre los modelos representados:
- Los mejores modelos de pesos cerrados: Claude Fable 5 (80,3 %),Claude Opus 4.5 (45,9 %), Claude Sonnet 4.5 (43,6 %) y Gemini 3 Pro Preview (43,3 %).
- Los mejores modelos de pesos abiertos: GLM 5.2 (62,1 %), Qwen3-Coder-480B-A35B (38,7 %), Kimi K2 Instruct (27,7 %) y Qwen3-235B-A22B (21,4 %).
Explore los benchmarks agénticos consultando los benchmarks de codificación agéntica, la búsqueda agéntica y el monitoreo agéntico.
Desafíos al comparar el rendimiento agéntico
Evaluar y comparar los resultados de benchmarks agénticos presenta varias dificultades clave:
- Enfoque en las métricas de capacidad: Podemos mostrar puntuaciones de capacidad, porque los datos de recursos necesarios para medir la densidad (recuentos de parámetros, cómputo de entrenamiento y precios verificados por modelo) siguen incompletos o no divulgados por los laboratorios cerrados.
- Sensibilidad a nivel de sistema: Las puntuaciones de los benchmarks miden todo el sistema, no solo el modelo de IA. Dado que las puntuaciones dependen en gran medida del “andamiaje” (el framework de software circundante), el mismo modelo puede producir resultados muy diferentes según el arnés de agente específico utilizado.
- Protocolo de estandarización: Para garantizar una comparación justa, este informe representa exclusivamente datos de SWE-Bench Pro de un único entorno estandarizado (la tabla de clasificación SEAL de Scale). Otras puntuaciones informadas por laboratorios utilizan arneses diferentes y no son directamente comparables.
- Exclusión de Claude Opus 4.8: Aunque Opus 4.8 autoinforma un 69,2 % récord en SWE-Bench Pro, fue probado en el arnés interno de Anthropic y aún no ha sido evaluado por el SEAL de Scale. Para mantener una estricta coherencia de datos, anotamos su puntuación aquí en lugar de representarla.
SWE-Bench Pro del arnés estandarizado SEAL de Scale. Otras columnas son informadas por laboratorios en arneses variables y no son directamente comparables entre filas. Los guiones significan que no se encontró una puntuación verificada.
Estos tres se ejecutaron en el arnés mini-swe-agent, por lo que se excluyen del gráfico de dispersión para mantenerlo comparable.
Metodología de la densidad de inteligencia
Cobertura del panel
- Modelos: 71 LLMs lanzados entre febrero de 2023 y abril de 2026. 37 modelos tienen puntuaciones en benchmarks estándar y 54 tienen puntuaciones en benchmarks avanzados. Los modelos sin un grupo completo de benchmarks se excluyen de los cálculos de densidad de ese grupo.
- Benchmarks: 10 benchmarks públicos, todos informados por laboratorios y rastreables a una fuente primaria. No volvimos a ejecutar ningún benchmark.
- Recursos: Para cada modelo, dividimos su puntuación de capacidad por tres recursos de forma independiente:
- Parámetros activos: Un proxy para el costo de memoria y servicio. Restringido a modelos de pesos abiertos, porque los laboratorios de pesos cerrados (OpenAI, Anthropic, Google) no divulgan los recuentos de parámetros.
- Cómputo de entrenamiento (FLOP): Un proxy para la eficiencia de entrenamiento. También restringido a modelos de pesos abiertos. Las cifras de FLOP son en su mayoría estimaciones de Epoch IA y deben interpretarse como direccionales.
- Precio de inference: El precio que un comprador realmente paga en la API. La capacidad se divide por el precio combinado por millón de tokens en una proporción de entrada a salida de 3:1. Participan tanto modelos abiertos como cerrados, porque los precios de la API son verificables públicamente.
¿Por qué dos grupos de benchmarks?
Los modelos lanzados en 2024 saturaron los benchmarks estándar que los laboratorios de IA habían utilizado desde 2020. Una vez que los modelos de frontera alcanzan 90 % o más en un benchmark, la prueba ya no separa a los modelos fuertes de los más fuertes. Los laboratorios respondieron introduciendo benchmarks más difíciles.
Tratamos este cambio como una ruptura limpia por dos razones:
- Primero, mezclar benchmarks fáciles y difíciles dentro de una única puntuación de capacidad permitiría que una puntuación saturada en un benchmark fácil enmascarara una puntuación baja en uno difícil. Un modelo que obtiene 85 en MMLU-Pro es más fuerte que uno que obtiene 85 en MMLU. Tratar los dos como equivalentes comprime el rango de puntuaciones y premia a los benchmarks más antiguos.
- Segundo, las dos suites tienen distribuciones de puntuación diferentes: los benchmarks estándar se agrupan en la parte superior (la mayoría de los modelos de frontera por encima de 85), mientras que los benchmarks avanzados tienen una dispersión más amplia (los mejores modelos alrededor de 90, el nivel medio alrededor de 50, los modelos más débiles por debajo de 30). La puntuación Z en ambos a la vez distorsionaría la estimación de la varianza.
Calculamos la capacidad para cada grupo de forma independiente:
- Benchmarks estándar (2023-2024): MMLU (5-shot), GSM8K (8-shot cadena de pensamiento), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avanzados (2024-2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Una puntuación de 90 en los benchmarks estándar no es equivalente a 90 en los benchmarks avanzados. Para cualquier modelo lanzado desde finales de 2024 en adelante, los benchmarks avanzados son la referencia significativa.
Fórmula de capacidad
Para cada benchmark b y cada modelo m:
Utilizamos la desviación estándar poblacional (divide por N, no por N−1). Esto coincide con el cálculo original de pandas con ddof=0 y garantiza que agregar un solo modelo nuevo no desplace retroactivamente la estimación de la varianza.
Luego promediamos las puntuaciones z disponibles por modelo dentro de cada grupo de benchmarks y reescalamos con min-max a una puntuación relativa al panel de 0 a 100.
Fórmula de densidad
Para cada vista de densidad:
El denominador cambia según la vista: parámetros activos en miles de millones, FLOP de entrenamiento dividido por 10²⁴, o precio combinado por millón de tokens.
Metodología del índice encadenado
Los dos gráficos de índice en la parte superior del artículo (Densidad de inteligencia y Capacidad) muestran un crecimiento acumulativo de una sola línea indexado a 100 en 2023, inspirado en el formato de rendimiento acumulado del S&P 500. Encadenamos las tasas de crecimiento interanual a través de la transición de benchmarks en lugar de representar valores absolutos.
Paso 1. Calcula la media anual de la métrica para cada grupo de benchmarks:
Para el Índice de Densidad de Inteligencia, la métrica es el promedio por fila de las tres puntuaciones de densidad por modelo (Densidad combinada A o B). Para el Índice de Capacidad, la métrica es la puntuación de capacidad relativa al panel (Capability_A o Capability_B).
Paso 2. Para cada transición de un año a otro, calcula el crecimiento dentro de un único grupo de benchmarks. Ambos años deben provenir del mismo grupo:
Paso 3. Encadena multiplicativamente desde una línea base de 2023 de 100:
Selección de grupo por transición:
- 2023 - 2024: Benchmarks estándar (Avanzados tiene 1 modelo en 2023, demasiado poco para calcular una media estable)
- 2024 - 2025: Benchmarks avanzados (Estándar se saturó a finales de 2024; Avanzados tiene 16 modelos en 2024 y 27 en 2025)
- 2025 - 2026: Benchmarks avanzados (Estándar no informado para 2026)
El índice encadenado asume que las poblaciones subyacentes son comparables entre años dentro de un grupo. Nuestro panel es heterogéneo (diferentes modelos cada año, con diferente cobertura de benchmarks), por lo que los valores encadenados se interpretan mejor como un resumen direccional que como un multiplicador preciso.
Principios básicos de evaluación para la medición de la densidad de inteligencia
- Benchmarks estándar de la industria: No introducimos ningún benchmark personalizado.
- Obtención de fuentes primarias: Cada puntuación de benchmark es rastreable al artículo de lanzamiento del modelo, a la tarjeta del modelo o al anuncio oficial. Cuando la fuente primaria no informó un benchmark, la celda está en blanco en lugar de imputada.
- Indicadores de cobertura (N): Para cada modelo informamos el número de benchmarks que contribuyen a su puntuación de capacidad en cada grupo. Los modelos con N=1 reciben una puntuación más ruidosa que los modelos con N=5. El caso N=1 se aplica a Qwen 3.6 35B A3B (SWE-bench Verified) y a algunos lanzamientos insignia cerrados de 2026.
Fuentes de precios para modelos de pesos cerrados
Los precios son la parte del índice más sensible a la cohorte. Utilizamos la siguiente jerarquía:
- Anuncio de lanzamiento del laboratorio (preferido): Precio citado en la publicación de lanzamiento del laboratorio, en la documentación de la API o en la cobertura de prensa contemporánea.
- Mediana entre proveedores de Artificial Analysis (alternativa para modelos de pesos): Se utiliza para tres filas de Llama 3.1 (8B, 70B, 405B) y para las filas de GPT-OSS, porque no existe una API de primera parte.
- Pesos sin cobertura: 22 de 69 filas no tienen precio por dólar registrado. Aparecen en los gráficos de capacidad y por parámetro, pero están ausentes de los gráficos por dólar.
Realizamos un seguimiento de dos pistas de precios: precio de lanzamiento (precio de primera parte el día del lanzamiento) y precio establecido (precio actual de primera parte, o el último antes de la descontinuación). Seis modelos del panel cambiaron de precio después del lanzamiento:
- Gemini 1.5 Pro: de $3,50/$10,50 a $1,25/$5,00 (octubre de 2024)
- GPT-4o: de $5,00/$15,00 a $2,50/$10,00 (octubre de 2024)
- Gemini 1.5 Flash: de $0,35/$1,05 a $0,075/$0,30 (agosto de 2024)
- Claude 3.5 Haiku: de $1,00/$5,00 a $0,80/$4,00 (diciembre de 2024)
- o3: de $10,00/$40,00 a $2,00/$8,00 (junio de 2025)
La densidad por dólar del titular utiliza precios establecidos. Para 37 de 43 filas con precio, los precios de lanzamiento y establecidos son idénticos.
Cadencia de actualización
Actualizamos el índice mensualmente. Cada actualización agrega nuevas filas de modelos para cualquier lanzamiento frontera o notable del mes anterior, actualiza los precios donde los laboratorios han ajustado sus tarifas, rellena los benchmarks recién informados para las filas existentes y recalcula las puntuaciones z en todo el panel. Las nuevas entradas de modelos desplazan la media y la desviación estándar de cada benchmark, por lo que las puntuaciones existentes de 0 a 100 se mueven con el panel. Se conservan las instantáneas históricas.
Limitaciones de la evaluación de la densidad de inteligencia
- Optimismo reportado por laboratorios: Las puntuaciones de los benchmarks provienen de los propios laboratorios. Las repeticiones independientes suelen ser de 5 a 13 puntos más bajas. Las líneas de tendencia son informativas direccionalmente, pero no precisas en puntos.
- Modos de razonamiento y no razonamiento no separados: Los modelos lanzados en 2025 y 2026 admiten interruptores de pensamiento extendido que pueden desplazar las puntuaciones de matemáticas y codificación entre 5 y 15 puntos. Utilizamos las puntuaciones en modo predeterminado cuando son identificables.
- Las cifras de FLOP de entrenamiento son en su mayoría estimaciones: Un puñado de filas tiene FLOP confirmados por laboratorio. El resto se extrapola a partir de los parámetros divulgados y los tokens de entrenamiento, principalmente a través de Epoch IA.
- Recuentos de parámetros de modelos cerrados desconocidos: La densidad por parámetro y por FLOP está en blanco para las filas de frontera cerradas. Los modelos cerrados participan en la densidad por dólar.
- Puntuaciones relativas al panel: Las puntuaciones de densidad se reescalan con min-max dentro del panel. Un nuevo modelo con una relación bruta más alta desplaza la puntuación de 0 a 100 de cada modelo existente. Para comparar versiones del panel, utilice las relaciones brutas subyacentes en lugar de las puntuaciones reescaladas.
¿Qué es la densidad de inteligencia?
La densidad de inteligencia representa una nueva métrica para evaluar cuánto conocimiento y capacidad de razonamiento puede concentrar un modelo en una sola unidad de memoria o cómputo. Mide la arquitectura del modelo evaluando con qué eficacia utiliza cada parámetro para generar valor.
En este framework, el eje x a menudo representa el número de parámetros del modelo mientras que el eje y sigue el rendimiento en tareas desafiantes. Se produce una alta densidad cuando los modelos demuestran capacidades superiores sin requerir el enorme costo computacional asociado con modelos más grandes. Este proceso demuestra que la inteligencia no depende únicamente de la cantidad de datos ni de la escala del entrenamiento, sino de cómo el software y los algoritmos organizan esa información.
Anteriormente, la comunidad de IA había dependido de escalar los parámetros de los modelos para lograr un mayor rendimiento, lo que resultaba en sistemas masivos y con gran consumo de recursos. Con este cambio de enfoque, se prioriza la optimización algorítmica sobre el volumen bruto para producir más inteligencia a partir de modelos más pequeños.
¿Por qué es importante medir la densidad de inteligencia?
Los sistemas eficientes deben optimizar el tiempo de inference y el uso de memoria. Identificar el punto en el que más tokens o cómputo adicional ya no producen ganancias significativas ayuda a la industria a comprender los límites superiores de los modelos de lenguaje grandes actuales. Las principales razones para medir la densidad de inteligencia se pueden resumir de la siguiente manera:
- La comunidad de IA subestima los gastos generales a largo plazo de mantener modelos sobredimensionados en centros de datos.
- La creación de valor en aplicaciones prácticas depende de la relación entre la calidad de salida y la potencia necesaria para producirla.
- La ley de Moore para el hardware no puede sostener el crecimiento de los modelos de lenguaje sin un progreso correspondiente en cómo los optimizamos.
- El aprendizaje por refuerzo y una mejor distribución de datos permiten que las herramientas de próxima generación alcancen benchmarks que antes estaban reservados solo para humanos. Obtenga más información sobre el aprendizaje por refuerzo y otros tipos de técnicas de LLM fine-tuning.
Si bien los modelos más grandes siguen siendo importantes para explorar nuevas fronteras, la densidad de un sistema determina su utilidad real en el mundo real. Este contexto ayuda a ver la inteligencia como un resultado concentrado del entrenamiento más que como un subproducto del tamaño puro.
Lecturas adicionales
La densidad de inteligencia es una forma de comparar LLMs. Otras dimensiones se cubren en análisis separados:
- Benchmarks de latencia: Para el tiempo hasta el primer token y tokens por segundo, consulte nuestro benchmark de latencia de LLM.
- Benchmarks por tarea: Para el razonamiento financiero, consulte nuestro benchmark financiero de LLM. Para codificación, consulte nuestro benchmark de codificación de IA.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Recuperado el 7 de julio de 2026}
}Resultados y marcas de tiempo de 91 puntos de datos. Descargue los datos resumidos que se muestran en los gráficos y las tablas de este artículo como un archivo ZIP que contiene 3 archivos CSV y un README.
¿Quieres los datos granulares que hay detrás? Únete a Premium
Registro de cambios
3 actualizacionesSe añadieron Claude Fable 5 y GLM 5.2 a la clasificación de benchmarks agénticos.
Se eliminó el cómputo de entrenamiento (FLOP) como métrica de recursos de densidad de inteligencia.
Reemplazó el comentario de los resultados de densidad de inteligencia por la metodología de cálculo y advertencias sobre las bases 2024-2025.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.