Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inferencia).
Descripción general de la densidad de inteligencia de LLM
Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos:
- Eficiencia de recursos: Dividimos la capacidad de cada modelo por dos métricas de recursos:
- Parámetros activos: Un proxy para el costo de memoria y servicio (solo modelos de pesos abiertos).
- Precio de inferencia: Eficiencia de costo de mercado basada en precios combinados de API por millón de tokens.
- Nota sobre el cómputo de entrenamiento (FLOP): Inicialmente incluíamos un tercer eje, el cómputo de entrenamiento (FLOP), pero lo eliminamos porque su pendiente negativa en los benchmarks estándar saturados arrastraba el compuesto 2023-2024 a una caída contraintuitiva.
- Agrupación de benchmarks: Para evitar que la saturación de puntuaciones oculte las ganancias de eficiencia, evaluamos las capacidades en dos eras de benchmarks distintas:
- Benchmarks estándar (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avanzados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indexación encadenada: Calculamos el crecimiento interanual dentro de grupos de benchmarks coincidentes y los encadenamos multiplicativamente desde una línea base de 100 en 2023 para trazar la tendencia acumulativa.
Consulte la metodología para el enfoque de puntuación y los desgloses por recursos.
Resultados de la densidad de inteligencia de LLM
A mediados de 2026, el ecosistema de IA había entregado casi 15× más inteligencia por unidad de recurso (parámetros y dólares) que la línea base de 2023. Dos cosas a tener en cuenta al leer la tendencia:
- El salto de 2024-2025 (+362%) exagera la ganancia real: Los benchmarks avanzados eran nuevos en 2024 y solo un puñado de modelos tenían puntuaciones en ellos, por lo que la línea base de 2024 se sitúa artificialmente baja. La mayor parte del "aumento" se debe a que el panel se completa, no a un salto de eficiencia de un año.
- La ganancia de 2025-2026 (+105%) es donde está la verdadera historia: Se mide en muchos más modelos y está impulsada por lanzamientos pequeños de pesos abiertos como Qwen 3.6-35B-A3B y DeepSeek V4 Flash, que igualan la capacidad de los modelos cerrados de vanguardia a una fracción del tamaño y costo.
Capacidad de LLM
El gráfico de densidad muestra la eficiencia. Para ponerlo en contexto, también medimos la capacidad bruta durante el mismo período: ¿cuánto más inteligentes se han vuelto estos modelos antes de cualquier ajuste de recursos?
Capacidad indexada a 100 en 2023, promediada entre todos los modelos lanzados cada año.
Los ejes y la información sobre herramientas funcionan igual que el gráfico de densidad, con el eje Y rastreando el rendimiento bruto en los benchmarks en lugar de la densidad.
Una puntuación de capacidad de 100 en 2023 creció a 468 en 2026, aproximadamente una mejora de 4,7×. Año por año:
- 2024 (+88%): Progreso rápido en los benchmarks estándar antes de que se saturaran.
- 2025 (+105%): El mismo progreso rápido, medido en los benchmarks avanzados más difíciles que reemplazaron a los estándar.
- 2026 (+22%): La desaceleración es una señal temprana de que los benchmarks avanzados también están comenzando a saturarse.
Comparando los dos gráficos lado a lado:
- La capacidad creció 4,7× mientras que la densidad de inteligencia creció 8,9×.
- Los modelos se volvieron más inteligentes y eficientes al mismo tiempo. No necesitan proporcionalmente más parámetros, cómputo de entrenamiento o dinero para funcionar.
Nota: La cifra de capacidad de 4,7× es una magnitud creíble. La cifra de densidad de 8,9× es más frágil (el grupo avanzado de 2024 tiene menos puntos de datos, lo que amplifica la tasa de crecimiento de ese año), así que trátela como una señal direccional en lugar de un multiplicador preciso.
¿Qué LLM tiene la mayor densidad de inteligencia?
La densidad de inteligencia depende de qué recurso midamos y en qué grupo de benchmarks puntuemos. El líder cambia para cada combinación.
Densidad por parámetro activo (solo pesos abiertos)
Esta vista mide cuán eficientemente un modelo empaqueta la capacidad en sus pesos. Los parámetros activos importan porque los modelos Mixture-of-Experts (MoE) enrutan cada token a través de una fracción de los pesos totales. DeepSeek V3 tiene 671B parámetros totales pero 37B activos por token, y la cifra de 37B refleja el costo de servicio efectivo.
Líderes en benchmarks estándar
- LLaMA 3.1 8B (jul 2024): 100.0
- LLaMA 3 8B (abr 2024): 85.0
- LLaMA 4 Maverick (abr 2025): 55.9
- Mixtral 8x7B (dic 2023): 47.4
- Mistral 7B (sep 2023): 46.3
Líderes en benchmarks avanzados
- Qwen 3.6-35B-A3B (abr 2026): 100.0 (3B parámetros activos; la puntuación se basa en un solo benchmark, SWE-bench Verified con un 73,4%, así que léalo en consecuencia)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parámetros activos)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parámetros activos)
- Qwen 3.5 9B (mar 2026): 35.2 (parámetros densos 9B)
- DeepSeek V4 Flash (abr 2026): 26.0
La clasificación de los benchmarks estándar dejó de moverse desde finales de 2024 porque los benchmarks se han saturado, no porque el progreso se haya detenido. GPT-4 obtuvo 90.2 en los benchmarks estándar a principios de 2023, pero 17.3 en los benchmarks avanzados.
Densidad por FLOP de entrenamiento (solo pesos abiertos)
Esta vista recompensa la curación de datos, las elecciones de arquitectura y las recetas de entrenamiento en lugar del gasto bruto.
Nota: la densidad por FLOP en los benchmarks estándar parece estar disminuyendo con el tiempo. Este es un artefacto de saturación, no una disminución de la eficiencia del entrenamiento. Los benchmarks más antiguos ya no miden las ganancias recientes, por lo que las puntuaciones de capacidad se comprimen mientras el cómputo de entrenamiento sigue creciendo.
Líderes en benchmarks estándar
- Mistral 7B (sep 2023): 100.0 (sigue siendo el ancla del panel, más de dos años después)
- LLaMA 3 8B (abr 2024): 40.8
- LLaMA 1 (feb 2023): 37.0
- DeepSeek V2 (may 2024): 32.6
- Mixtral 8x7B (dic 2023): 27.1
Líderes en benchmarks avanzados
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (abr 2026): 28.4
- DeepSeek V4 Flash (abr 2026): 6.4
El resultado de Qwen 3.5 (9B) es notable: un modelo denso de 9B entrenado con aproximadamente 1,5 × 10²³ FLOP que obtiene 81.2 en capacidad de benchmarks avanzados. Su cómputo de entrenamiento es aproximadamente un orden de magnitud menor que DeepSeek V4 Pro, pero la brecha de capacidad es más pequeña.
Densidad por dólar de inferencia
La densidad por dólar es el eje donde los modelos abiertos y cerrados de vanguardia pueden compararse directamente, porque los precios de API son verificables públicamente. Usamos precios establecidos para el titular, de modo que se reflejen los recortes posteriores al lanzamiento.
Líderes en benchmarks estándar
- Mistral Small 3 24B (ene 2025): 100.0 a $0,10 / $0,30 por millón de tokens a través de la API de primera parte de Mistral
- Gemini 1.5 Flash (may 2024): 99.3 (el modelo de pesos cerrados con mayor puntuación después de su reducción de precio de agosto de 2024)
- DeepSeek V2 (may 2024): 66.0 a $0,27 / $1,10 por millón de tokens
- DeepSeek V3 (dic 2024): 30.9
- DeepSeek R1 (ene 2025): 17.8
Líderes en benchmarks avanzados
- GPT-OSS 120B (ago 2025): 100.0 (la referencia de precio es la mediana entre proveedores de OpenRouter, ya que OpenAI no alojó el modelo en una API de primera parte)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (abr 2026): 44.0 a $0,06 / $0,42 por millón de tokens a través de la API de primera parte de DeepSeek
- DeepSeek V3.2 (dic 2025): 22.5
- Mistral Small 3 24B (ene 2025): 20.9
- DeepSeek V4 Pro (abr 2026): 16.0 a $0,54 combinado, con una capacidad en benchmarks avanzados de 97.8. Eso sitúa a V4 Pro a 2.2 puntos de capacidad de Claude Opus 4.7 a aproximadamente 1/18 del precio combinado ($0,54 frente a $10.00).
La brecha con los modelos cerrados de vanguardia no se ha reducido
Los modelos cerrados de razonamiento de Anthropic, OpenAI y Google se agrupan entre 0 y 6 en la densidad por dólar de los benchmarks avanzados durante todo el período del panel. GPT-4 en marzo de 2023 obtuvo 0.0. Claude Opus 4.7 en abril de 2026 obtuvo 0.9.
Los laboratorios cerrados han reducido los precios absolutos:
- Claude Opus pasó de $30 a $10 por millón de tokens entre Opus 4 y Opus 4.5.
- o3 de OpenAI pasó de $10/$40 en el lanzamiento a $2/$8 establecido.
- Gemini 1.5 Flash se redujo aproximadamente un 78%.
Pero la brecha relativa con los líderes de densidad de pesos abiertos se mantuvo aproximadamente entre 30 y 50× durante todo el período. DeepSeek rondó los $0,18 por millón en 2024 (V2) y cerca de $0,18 por millón en 2026 (V4 Flash). El precio mínimo de los modelos abiertos no se ha movido, y el precio mínimo de los modelos cerrados insignia no se ha movido lo suficiente para cerrar la brecha. La competencia de precios está ocurriendo en el nivel de la generación anterior, donde los modelos cerrados más antiguos se mantienen vivos como alternativas baratas, no en la vanguardia.
La nueva dirección: benchmarks agénticos
Los benchmarks avanzados que se utilizaban para medir el rendimiento de la IA están empezando a perder su eficacia, como las antiguas suites de pruebas que reemplazaron. Los laboratorios han comenzado a informar benchmarks agénticos (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) en lugar de las pruebas de razonamiento más antiguas. Comenzamos a construir un panel para rastrear este cambio.
Por ejemplo, el modelo de vanguardia más nuevo, Claude Opus 4.8, reporta sus resultados casi en su totalidad en estos benchmarks de LLM agénticos, sin puntuaciones en los benchmarks de razonamiento que rastrea nuestro panel principal.
Tasa de resolución de SWE-Bench Pro por fecha de lanzamiento, puntuada en el arnés estandarizado SEAL de Scale. Entre los modelos trazados:
- Los mejores modelos cerrados: Claude Fable 5 (80,3%),Claude Opus 4.5 (45,9%), Claude Sonnet 4.5 (43,6%), y Gemini 3 Pro Preview (43,3%).
- Los mejores modelos abiertos: GLM 5.2 (62,1%), Qwen3-Coder-480B-A35B (38,7%), Kimi K2 Instruct (27,7%), y Qwen3-235B-A22B (21,4%).
Explore los benchmarks agénticos consultando benchmarks de codificación agéntica, búsqueda agéntica y monitoreo agéntico.
Dificultades para comparar el rendimiento agéntico
Evaluar y comparar los resultados de los benchmarks agénticos presenta varias dificultades clave:
- Enfoque en métricas de capacidad: Podemos mostrar las puntuaciones de capacidad, porque los datos de recursos necesarios para medir la densidad (recuento de parámetros, cómputo de entrenamiento y precios verificados por modelo) permanecen incompletos o no son revelados por los laboratorios cerrados.
- Sensibilidad a nivel de sistema: Las puntuaciones de los benchmarks miden todo el sistema, no solo el modelo de IA. Debido a que las puntuaciones dependen en gran medida del "andamiaje" (el framework de software circundante), el mismo modelo puede arrojar resultados muy diferentes según el arnés de agente específico utilizado.
- Protocolo de estandarización: Para garantizar una comparación justa, este informe traza exclusivamente datos de SWE-Bench Pro de un único entorno estandarizado (la tabla de clasificación SEAL de Scale). Otras puntuaciones informadas por laboratorios utilizan diferentes arneses y no son directamente comparables.
- Exclusión de Claude Opus 4.8: Aunque Opus 4.8 auto-reporta un récord del 69,2% en SWE-Bench Pro, fue probado en el arnés interno de Anthropic y aún no ha sido evaluado por SEAL de Scale. Para mantener una estricta coherencia de datos, anotamos su puntuación aquí en lugar de trazarla.
SWE-Bench Pro del arnés estandarizado SEAL de Scale. Las otras columnas son informadas por los laboratorios en arneses variables y no son directamente comparables entre filas. Los guiones significan que no se encontró una puntuación verificada.
Estos tres se ejecutaron en el arnés mini-swe-agent, por lo que se excluyen del gráfico de dispersión para mantener la comparabilidad.
Metodología de la densidad de inteligencia
Cobertura del panel
- Modelos: 71 LLMs lanzados desde febrero de 2023 hasta abril de 2026. 37 modelos tienen puntuaciones de benchmarks estándar y 54 tienen puntuaciones de benchmarks avanzados. Los modelos sin un grupo completo de benchmarks se excluyen de los cálculos de densidad de ese grupo.
- Benchmarks: 10 benchmarks públicos, todos informados por los laboratorios y rastreables a una fuente primaria. No volvimos a ejecutar ningún benchmark.
- Recursos: Para cada modelo, dividimos su puntuación de capacidad por tres recursos de forma independiente:
- Parámetros activos: Un proxy para el costo de memoria y servicio. Limitado a modelos de pesos abiertos, porque los laboratorios de pesos cerrados (OpenAI, Anthropic, Google) no revelan los recuentos de parámetros.
- Cómputo de entrenamiento (FLOP): Un proxy para la eficiencia del entrenamiento. También limitado a modelos de pesos abiertos. Las cifras de FLOP son en su mayoría estimaciones de Epoch IA y deben leerse como direccionales.
- Precio de inferencia: El precio que un comprador realmente paga en la API. La capacidad se divide por el precio combinado por millón de tokens a una relación entrada-salida de 3:1. Participan tanto modelos abiertos como cerrados, porque los precios de API son verificables públicamente.
¿Por qué dos grupos de benchmarks?
Los modelos lanzados en 2024 saturaron los benchmarks estándar que los laboratorios de IA habían utilizado desde 2020. Una vez que los modelos de vanguardia alcanzan el 90% o más en un benchmark, la prueba ya no separa los modelos fuertes de los más fuertes. Los laboratorios respondieron introduciendo benchmarks más difíciles.
Tratamos este cambio como una ruptura limpia por dos razones:
- Primero, mezclar benchmarks fáciles y difíciles dentro de una única puntuación de capacidad permitiría que una puntuación saturada en un benchmark fácil enmascarara una puntuación baja en uno difícil. Un modelo que obtiene 85 en MMLU-Pro es más fuerte que uno que obtiene 85 en MMLU. Tratar los dos como equivalentes comprime el rango de puntuación y recompensa los benchmarks más antiguos.
- Segundo, las dos suites tienen diferentes distribuciones de puntuación: los benchmarks estándar se agrupan en la parte superior (la mayoría de los modelos de vanguardia por encima de 85), mientras que los benchmarks avanzados tienen una dispersión más amplia (los mejores modelos alrededor de 90, el nivel medio alrededor de 50, los modelos más débiles por debajo de 30). Hacer una puntuación Z en ambos a la vez distorsionaría la estimación de la varianza.
Calculamos la capacidad para cada grupo de forma independiente:
- Benchmarks estándar (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks avanzados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Una puntuación de 90 en los benchmarks estándar no equivale a 90 en los benchmarks avanzados. Para cualquier modelo lanzado a partir de finales de 2024, los benchmarks avanzados son la referencia significativa.
Fórmula de capacidad
Para cada benchmark b y cada modelo m:
Utilizamos la desviación estándar de la población (divide por N, no por N−1). Esto coincide con el cálculo original de pandas con ddof=0 y garantiza que añadir un solo modelo nuevo no desplace retroactivamente la estimación de la varianza.
Luego promediamos las puntuaciones z disponibles por modelo dentro de cada grupo de benchmarks y reescalamos con min-max a una puntuación relativa al panel de 0 a 100.
Fórmula de densidad
Para cada vista de densidad:
El denominador cambia según la vista: parámetros activos en miles de millones, FLOP de entrenamiento dividido por 10²⁴, o precio combinado por millón de tokens.
Metodología del índice encadenado
Los dos gráficos de índice en la parte superior del artículo (Densidad de inteligencia y Capacidad) muestran un crecimiento acumulativo de una sola línea indexado a 100 en 2023, siguiendo el formato de retorno acumulativo del S&P 500. Encadenamos las tasas de crecimiento interanual a través de la transición de benchmarks en lugar de trazar valores absolutos.
Paso 1. Calcular la media anual de la métrica para cada grupo de benchmarks:
Para el Índice de Densidad de Inteligencia, la métrica es el promedio por fila de las tres puntuaciones de densidad por modelo (Densidad Combinada A o B). Para el Índice de Capacidad, la métrica es la puntuación de capacidad relativa al panel (Capability_A o Capability_B).
Paso 2. Para cada transición de año a año, calcular el crecimiento dentro de un solo grupo de benchmarks. Ambos años deben provenir del mismo grupo:
Paso 3. Encadenar multiplicativamente desde una línea base de 100 en 2023:
Selección de grupo por transición:
- 2023 – 2024: Benchmarks estándar (Avanzado tiene 1 modelo en 2023, demasiado escaso para calcular una media estable)
- 2024 – 2025: Benchmarks avanzados (Estándar saturado a finales de 2024; Avanzado tiene 16 modelos en 2024 y 27 en 2025)
- 2025 – 2026: Benchmarks avanzados (Estándar no informado para 2026)
El índice encadenado asume que las poblaciones subyacentes son comparables a lo largo de los años dentro de un grupo. Nuestro panel es heterogéneo (diferentes modelos cada año, con diferente cobertura de benchmarks), por lo que los valores encadenados se leen mejor como un resumen direccional en lugar de un multiplicador preciso.
Principios básicos de evaluación para la medición de la densidad de inteligencia
- Benchmarks estándar de la industria: No introducimos ningún benchmark personalizado.
- Fuentes primarias: Cada puntuación de benchmark es rastreable hasta el artículo de lanzamiento del modelo, la tarjeta del modelo o el anuncio oficial. Cuando la fuente primaria no informó un benchmark, la celda queda en blanco en lugar de imputarse.
- Indicadores de cobertura (N): Para cada modelo informamos el número de benchmarks que contribuyen a su puntuación de capacidad en cada grupo. Los modelos con N=1 reciben una puntuación más ruidosa que los modelos con N=5. El caso N=1 se aplica a Qwen 3.6 35B A3B (solo SWE-bench Verified) y a algunos lanzamientos insignia cerrados de 2026.
Fuentes de precios para modelos de pesos cerrados
El precio es la parte del índice más sensible a la cohorte. Utilizamos la siguiente jerarquía:
- Anuncio de lanzamiento del laboratorio (preferido): Precio citado en la publicación de lanzamiento del laboratorio, la documentación de la API o la cobertura de prensa contemporánea.
- Mediana entre proveedores de Artificial Analysis (alternativa para modelos solo de pesos): Se utiliza para tres filas de Llama 3.1 (8B, 70B, 405B) y las filas de GPT-OSS, porque no existe una API de primera parte.
- Solo pesos sin cobertura: 22 de 69 filas no tienen precio por dólar registrado. Aparecen en los gráficos de capacidad y por parámetro, pero están ausentes en los gráficos por dólar.
Seguimos dos pistas de precios: precio de lanzamiento (precio de primera parte el día del lanzamiento) y precio establecido (precio actual de primera parte, o el último antes de la descontinuación). Seis modelos en el panel fueron revalorizados después del lanzamiento:
- Gemini 1.5 Pro: $3,50/$10,50 a $1,25/$5,00 (octubre de 2024)
- GPT-4o: $5,00/$15.00 a $2,50/$10.00 (octubre de 2024)
- Gemini 1.5 Flash: $0,35/$1,05 a $0,075/$0,30 (agosto de 2024)
- Claude 3.5 Haiku: $1,00/$5,00 a $0,80/$4,00 (diciembre de 2024)
- o3: $10.00/$40.00 a $2,00/$8,00 (junio de 2025)
La densidad por dólar del titular utiliza precios establecidos. Para 37 de las 43 filas con precio, los precios de lanzamiento y establecidos son idénticos.
Frecuencia de actualización
Actualizamos el índice mensualmente. Cada actualización agrega nuevas filas de modelos para cualquier lanzamiento de vanguardia o notable en el mes anterior, actualiza los precios donde los laboratorios han ajustado sus tarifas, rellena los benchmarks recién informados para las filas existentes y recalcula las puntuaciones z en todo el panel. Las nuevas entradas de modelos desplazan la media y la desviación estándar de cada benchmark, por lo que las puntuaciones existentes de 0 a 100 se mueven con el panel. Se conservan las instantáneas históricas.
Limitaciones de la evaluación de la densidad de inteligencia
- Optimismo informado por los laboratorios: Las puntuaciones de los benchmarks provienen de los propios laboratorios. Las repeticiones independientes suelen ser de 5 a 13 puntos más bajas. Las líneas de tendencia son direccionalmente informativas pero no precisas en puntos.
- Modos de razonamiento y no razonamiento no separados: Los modelos lanzados en 2025 y 2026 admiten conmutadores de pensamiento extendido que pueden cambiar las puntuaciones de matemáticas y codificación entre 5 y 15 puntos. Utilizamos puntuaciones en modo predeterminado cuando son identificables.
- Las cifras de FLOP de entrenamiento son en su mayoría estimaciones: Un puñado de filas tienen FLOP confirmado por el laboratorio. El resto se extrapola a partir de parámetros revelados y tokens de entrenamiento, principalmente a través de Epoch IA.
- Recuento de parámetros de modelos cerrados desconocido: La densidad por parámetro y por FLOP está en blanco para las filas de modelos cerrados de vanguardia. Los modelos cerrados solo participan en la densidad por dólar.
- Puntuaciones relativas al panel: Las puntuaciones de densidad se reescalan con min-max dentro del panel. Un nuevo modelo con una proporción bruta más alta desplaza la puntuación de 0 a 100 de cada modelo existente. Para comparar versiones del panel, utilice las proporciones brutas subyacentes en lugar de las puntuaciones reescaladas.
¿Qué es la densidad de inteligencia?
La densidad de inteligencia representa una nueva métrica para evaluar cuánto conocimiento y capacidad de razonamiento puede empaquetar un modelo en una sola unidad de memoria o cómputo. Mide la arquitectura del modelo evaluando cuán efectivamente utiliza cada parámetro para generar valor.
En este marco, el eje x a menudo representa el número de parámetros del modelo, mientras que el eje y rastrea el rendimiento en tareas desafiantes. La alta densidad ocurre cuando los modelos demuestran capacidades superiores sin requerir el enorme costo computacional asociado con modelos más grandes. Este proceso demuestra que la inteligencia no depende únicamente de la cantidad de datos o la escala del entrenamiento, sino más bien de cómo el software y los algoritmos organizan esa información.
Anteriormente, la comunidad de IA se había basado en escalar los parámetros del modelo para alcanzar un mayor rendimiento, lo que resultó en sistemas masivos y con grandes recursos. Con este cambio de enfoque, se prioriza la optimización algorítmica sobre el volumen bruto para producir más inteligencia a partir de modelos más pequeños.
¿Por qué es importante medir la densidad de inteligencia?
Los sistemas eficientes deben optimizar el tiempo de inferencia y el uso de memoria. Identificar el punto en el que más tokens o cómputo adicional ya no producen ganancias significativas ayuda a la industria a comprender los límites superiores de los modelos de lenguaje grandes actuales. Las principales razones para medir la densidad de inteligencia se pueden resumir como:
- La comunidad de IA subestima los gastos generales a largo plazo de mantener modelos sobredimensionados en centros de datos.
- La creación de valor en aplicaciones prácticas depende de la relación entre la calidad de salida y la potencia requerida para producirla.
- La Ley de Moore para el hardware no puede sostener el crecimiento de los modelos de lenguaje sin un progreso correspondiente en cómo los optimizamos.
- El aprendizaje por refuerzo y una mejor distribución de datos permiten que las herramientas de próxima generación alcancen benchmarks que antes estaban reservados solo para humanos. Más información sobre el aprendizaje por refuerzo y otros tipos de técnicas de fine-tuning de LLM.
Si bien los modelos más grandes aún importan para explorar nuevas fronteras, la densidad de un sistema determina su utilidad real en el mundo real. Este contexto ayuda a ver la inteligencia como un resultado concentrado del entrenamiento en lugar de un subproducto del mero tamaño.
Lecturas adicionales
La densidad de inteligencia es una forma de comparar LLMs. Otras dimensiones se cubren en análisis separados:
- Benchmarks de latencia: Para el tiempo hasta el primer token y tokens por segundo, consulte nuestro benchmark de latencia de LLM.
- Benchmarks por tarea: Para razonamiento financiero, consulte nuestro benchmark de LLM financiero. Para codificación, consulte nuestro benchmark de codificación de IA.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{imek2026,
author = {Şimşek, Hazal},
title = {{Densidad de inteligencia de 71 LLMs: Modelos más inteligentes y densos}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Recuperado el 7 de Julio de 2026}
}Resultados y marcas de tiempo de 69 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV y un README.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.