Densidad de inteligencia de 71 LLMs: Modelos más inteligentes y densos
Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inferencia).
Visión general de la densidad de inteligencia de los LLM
Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos:
- Eficiencia de recursos: Dividimos la capacidad de cada modelo por dos métricas de recursos:
- Parámetros activos: Un proxy para la memoria y el costo de servicio (solo modelos de peso abierto).
- Precio de inferencia: Eficiencia de costos del mercado basada en un precio combinado de API por millón de tokens.
- Nota sobre el cómputo de entrenamiento (FLOP): Inicialmente incluimos un tercer eje, cómputo de entrenamiento (FLOP), pero lo eliminamos porque su pendiente negativa en los benchmarks Estándar saturados arrastraba el compuesto 2023–2024 a una caída contraintuitiva.
- Agrupación de benchmarks: Para evitar que la saturación de puntuaciones enmascarara las ganancias de eficiencia, evaluamos las capacidades en dos eras de benchmarks distintas:
- Benchmarks Estándar (2023–2024): MMLU (5-shot), GSM8K (8-shot CoT), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks Avanzados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
- Indexación encadenada: Calculamos el crecimiento año tras año dentro de grupos de benchmarks coincidentes y los encadenamos multiplicativamente desde una línea base de 2023 de 100 para trazar la tendencia acumulada.
Consulte la metodología para conocer el enfoque de puntuación y los desgloses por recurso.
Resultados de densidad de inteligencia de LLM
A mediados de 2026, el ecosistema de IA ofreció casi 15× más inteligencia por unidad de recurso (parámetros y dólares) que la línea base de 2023. Dos cosas a tener en cuenta al leer la tendencia:
- El salto de 2024–2025 (+362%) exagera la ganancia real: Los benchmarks Avanzados eran nuevos en 2024 y un puñado de modelos tenían puntuaciones en ellos, por lo que la línea base de 2024 se encuentra artificialmente baja. La mayor parte del «auge» es la cobertura del panel, no un salto de eficiencia de un año.
- La ganancia de 2025–2026 (+105%) es donde reside la verdadera historia: Se mide en muchos más modelos y está impulsada por lanzamientos pequeños de peso abierto como Qwen 3.6-35B-A3B y DeepSeek V4 Flash que igualan la capacidad de modelos cerrados de frontera a una fracción del tamaño y costo.
Capacidad de los LLM
El gráfico de densidad muestra la eficiencia. Para ponerlo en contexto, también medimos la capacidad bruta durante el mismo período: ¿cuánto más inteligentes se han vuelto realmente estos modelos antes de cualquier ajuste por recurso?
Capacidad indexada a 100 en 2023, promediada entre todos los modelos lanzados cada año.
Los ejes y la información emergente funcionan igual que el gráfico de densidad, con el eje Y siguiendo el rendimiento bruto en los benchmarks en lugar de la densidad.
Una puntuación de capacidad de 100 en 2023 creció a 468 para 2026, aproximadamente una mejora de 4.7×. Año por año:
- 2024 (+88%): Progreso rápido en los benchmarks estándar antes de que se saturaran.
- 2025 (+105%): El mismo progreso rápido, medido en los benchmarks avanzados más difíciles que reemplazaron a los estándar.
- 2026 (+22%): La desaceleración es una señal temprana de que los benchmarks avanzados también están empezando a saturarse.
Colocando los dos gráficos uno al lado del otro:
- La capacidad creció 4.7× mientras que la densidad de inteligencia creció 8.9×.
- Los modelos se volvieron más inteligentes y más eficientes al mismo tiempo. No necesitan proporcionalmente más parámetros, cómputo de entrenamiento ni dinero para funcionar.
Tenga en cuenta que: La cifra de 4.7× de capacidad es una magnitud creíble. La cifra de 8.9× de densidad es más frágil (el grupo avanzado de 2024 tiene menos puntos de datos, lo que amplifica la tasa de crecimiento de ese año), así que trátela como una señal direccional en lugar de un multiplicador preciso.
¿Qué LLM tiene la mayor densidad de inteligencia?
La densidad de inteligencia depende de qué recurso midamos y en qué grupo de benchmarks puntuemos. El líder cambia para cada combinación.
Densidad por parámetro activo (solo pesos abiertos)
Esta vista mide cuán eficientemente un modelo concentra la capacidad en sus pesos. Los parámetros activos importan porque los modelos de Mezcla de Expertos (MoE) enrutan cada token a través de una fracción de los pesos totales. DeepSeek V3 tiene 671B de parámetros totales pero 37B activos por token, y la cifra de 37B refleja el costo de servicio efectivo.
Líderes en benchmarks estándar
- LLaMA 3.1 8B (jul 2024): 100.0
- LLaMA 3 8B (abr 2024): 85.0
- LLaMA 4 Maverick (abr 2025): 55.9
- Mixtral 8x7B (dic 2023): 47.4
- Mistral 7B (sep 2023): 46.3
Líderes en benchmarks avanzados
- Qwen 3.6-35B-A3B (abr 2026): 100.0 (3B parámetros activos; la puntuación se basa en un único benchmark, SWE-bench Verified al 73.4%, por lo tanto, léala en consecuencia)
- GPT-OSS 20B (ago 2025): 85.2 (3.6B parámetros activos)
- GPT-OSS 120B (ago 2025): 64.4 (5.1B parámetros activos)
- Qwen 3.5 9B (mar 2026): 35.2 (9B parámetros densos)
- DeepSeek V4 Flash (abr 2026): 26.0
La clasificación de los benchmarks estándar ha dejado de moverse desde finales de 2024 porque los benchmarks se han saturado, no porque el progreso se haya detenido. GPT-4 puntuó 90.2 en benchmarks estándar a principios de 2023 pero 17.3 en benchmarks avanzados.
Densidad por FLOP de entrenamiento (solo pesos abiertos)
Esta vista premia la curación de datos, las elecciones de arquitectura y las recetas de entrenamiento en lugar del gasto bruto.
Nota: la densidad por FLOP en los benchmarks estándar parece estar cayendo con el tiempo. Esto es un artefacto de saturación, no una disminución de la eficiencia del entrenamiento. Los benchmarks más antiguos ya no miden las ganancias recientes, por lo que las puntuaciones de capacidad se comprimen mientras el cómputo de entrenamiento sigue creciendo.
Líderes en benchmarks estándar
- Mistral 7B (sep 2023): 100.0 (sigue siendo el ancla del panel, más de dos años después)
- LLaMA 3 8B (abr 2024): 40.8
- LLaMA 1 (feb 2023): 37.0
- DeepSeek V2 (may 2024): 32.6
- Mixtral 8x7B (dic 2023): 27.1
Líderes en benchmarks avanzados
- Qwen 3.5 9B (mar 2026): 100.0
- Qwen 3.6-35B-A3B (abr 2026): 28.4
- DeepSeek V4 Flash (abr 2026): 6.4
El resultado de Qwen 3.5 (9B) es notable: un modelo denso de 9B entrenado con aproximadamente 1.5 × 10²³ FLOP que puntúa 81.2 en capacidad de los benchmarks avanzados. Su cómputo de entrenamiento es aproximadamente un orden de magnitud inferior al de DeepSeek V4 Pro, pero la brecha de capacidad es menor.
Densidad por dólar de inferencia
La densidad por dólar es el eje donde se pueden comparar directamente los modelos de peso abierto y los cerrados de frontera, porque el precio de la API es verificable públicamente. Usamos los precios asentados para el titular, de modo que se reflejen los recortes posteriores al lanzamiento.
Líderes en benchmarks estándar
- Mistral Small 3 24B (ene 2025): 100.0 a $0.10 / $0.30 por millón de tokens vía la API de primera parte de Mistral
- Gemini 1.5 Flash (may 2024): 99.3 (modelo de peso cerrado con mayor puntuación después de su recorte de precio de agosto de 2024)
- DeepSeek V2 (may 2024): 66.0 a $0.27 / $1.10 por millón de tokens
- DeepSeek V3 (dic 2024): 30.9
- DeepSeek R1 (ene 2025): 17.8
Líderes en benchmarks avanzados
- GPT-OSS 120B (ago 2025): 100.0 (la referencia de precio es la mediana entre proveedores de OpenRouter, ya que OpenAI no hospedó el modelo en una API de primera parte)
- GPT-OSS 20B (ago 2025): 80.0
- DeepSeek V4 Flash (abr 2026): 44.0 a $0.06 / $0.42 por millón de tokens vía la API de primera parte de DeepSeek
- DeepSeek V3.2 (dic 2025): 22.5
- Mistral Small 3 24B (ene 2025): 20.9
- DeepSeek V4 Pro (abr 2026): 16.0 a $0.54 combinados, con 97.8 de capacidad en benchmarks avanzados. Eso sitúa a V4 Pro a 2.2 puntos de capacidad de Claude Opus 4.7 a aproximadamente 1/18 del precio combinado ($0.54 vs $10.00).
La brecha de la frontera cerrada no se ha reducido
Los modelos de razonamiento cerrados de Anthropic, OpenAI y Google se agrupan entre 0 y 6 en densidad por dólar en los benchmarks avanzados durante todo el período del panel. GPT-4 en marzo de 2023 puntuó 0.0. Claude Opus 4.7 en abril de 2026 puntuó 0.9.
Los laboratorios cerrados han reducido los precios absolutos:
- Claude Opus bajó de $30 a $10 por millón de tokens entre Opus 4 y Opus 4.5.
- o3 de OpenAI bajó de $10/$40 en el lanzamiento a $2/$8 asentados.
- Gemini 1.5 Flash bajó aproximadamente 78%.
Pero la brecha relativa con los líderes de densidad de peso abierto se mantuvo aproximadamente entre 30 y 50× durante el período. DeepSeek se cotizó cerca de $0.18 por millón en 2024 (V2) y cerca de $0.18 por millón en 2026 (V4 Flash). El suelo de precios de peso abierto no se ha movido, y el suelo de los buques insignia cerrados no se ha movido lo suficiente como para cerrar la brecha. La competencia de precios está ocurriendo en el nivel de la generación anterior, donde los modelos cerrados más antiguos se mantienen como alternativas baratas, no en la frontera.
La nueva dirección: Benchmarks agénticos
Los benchmarks avanzados utilizados para medir el rendimiento de la IA están empezando a perder su efectividad, al igual que las suites de pruebas más antiguas a las que reemplazaron. Los laboratorios han comenzado a reportar benchmarks agénticos (SWE-Bench Pro, SWE-bench Verified, Terminal-Bench, OSWorld-Verified, Finance Agent) en lugar de las anteriores pruebas de razonamiento. Comenzamos a construir un panel para seguir este cambio.
Por ejemplo, el modelo de frontera más nuevo, Claude Opus 4.8, reporta sus resultados casi en su totalidad en estos benchmarks de LLM agénticos, sin puntuaciones en los benchmarks de razonamiento que rastrea nuestro panel principal.
Tasa de resolución de SWE-Bench Pro por fecha de lanzamiento, puntuada en el arnés estandarizado SEAL de Scale. Entre los modelos trazados:
- Los mejores de peso cerrado: Claude Fable 5 (80.3%),Claude Opus 4.5 (45.9%), Claude Sonnet 4.5 (43.6%), y Gemini 3 Pro Preview (43.3%).
- Los mejores de peso abierto: GLM 5.2 (62.1%), Qwen3-Coder-480B-A35B (38.7%), Kimi K2 Instruct (27.7%), y Qwen3-235B-A22B (21.4%).
Explore los benchmarks agénticos consultando los benchmarks de codificación agéntica, la búsqueda agéntica y la monitorización agéntica.
Desafíos al comparar el rendimiento agéntico
Evaluar y comparar los resultados de los benchmarks agénticos presenta varias dificultades clave:
- Enfoque en métricas de capacidad: Podemos mostrar puntuaciones de capacidad, porque los datos de recursos necesarios para medir la densidad (recuentos de parámetros, cómputo de entrenamiento y precios verificados por modelo) siguen siendo incompletos o no revelados por los laboratorios cerrados.
- Sensibilidad a nivel de sistema: Las puntuaciones de los benchmarks miden todo el sistema, no solo el modelo de IA. Debido a que las puntuaciones dependen en gran medida del «scaffolding» (el marco de software que lo rodea), el mismo modelo puede generar resultados muy diferentes dependiendo del arnés de agente específico utilizado.
- Protocolo de estandarización: Para garantizar una comparación justa, este informe grafica exclusivamente datos de SWE-Bench Pro de un único entorno estandarizado (el tablero SEAL de Scale). Otras puntuaciones reportadas por laboratorios utilizan diferentes arneses y no son directamente comparables.
- Exclusión de Claude Opus 4.8: Aunque Opus 4.8 autoinforma un récord de 69.2% en SWE-Bench Pro, fue probado en el arnés interno de Anthropic y aún no ha sido evaluado por SEAL de Scale. Para mantener una estricta consistencia de datos, anotamos su puntuación aquí en lugar de graficarla.
SWE-Bench Pro del arnés estandarizado SEAL de Scale. Las demás columnas son reportadas por los laboratorios en diferentes arneses y no son directamente comparables entre filas. Los guiones significan que no se encontró una puntuación verificada.
Estos tres se ejecutaron en el arnés mini-swe-agent, por lo que se excluyen del gráfico de dispersión para mantenerlo comparable.
Metodología de la densidad de inteligencia
Cobertura del panel
- Modelos: 71 LLMs lanzados entre febrero de 2023 y abril de 2026. 37 modelos tienen puntuaciones de los benchmarks estándar y 54 tienen puntuaciones de los benchmarks avanzados. Los modelos sin un grupo de benchmarks completo se excluyen de los cálculos de densidad de ese grupo.
- Benchmarks: 10 benchmarks públicos, todos reportados por los laboratorios y rastreables a una fuente primaria. No volvimos a ejecutar ningún benchmark.
- Recursos: Para cada modelo, dividimos su puntuación de capacidad por tres recursos de forma independiente:
- Parámetros activos: Un proxy para la memoria y el costo de servicio. Restringido a modelos de peso abierto, porque los laboratorios de peso cerrado (OpenAI, Anthropic, Google) no revelan el recuento de parámetros.
- Cómputo de entrenamiento (FLOP): Un proxy para la eficiencia del entrenamiento. También restringido a modelos de peso abierto. Las cifras de FLOP son en su mayoría estimaciones de Epoch IA y deben leerse como direccionales.
- Precio de inferencia: El precio que un comprador realmente paga en la API. La capacidad se divide por el precio combinado por millón de tokens a una relación de 3:1 de entrada a salida. Tanto los modelos abiertos como los cerrados participan, porque el precio de la API es verificable públicamente.
¿Por qué dos grupos de benchmarks?
Los modelos lanzados en 2024 saturaron los benchmarks estándar que los laboratorios de IA habían utilizado desde 2020. Una vez que los modelos de frontera alcanzan 90% o más en un benchmark, la prueba ya no separa los modelos fuertes de los más fuertes. Los laboratorios respondieron introduciendo benchmarks más difíciles.
Tratamos este cambio como una ruptura limpia por dos razones:
- En primer lugar, mezclar benchmarks fáciles y difíciles dentro de una única puntuación de capacidad permitiría que una puntuación saturada en un benchmark fácil enmascarara una puntuación baja en uno difícil. Un modelo que puntúa 85 en MMLU-Pro es más fuerte que uno que puntúa 85 en MMLU. Tratar los dos como equivalentes comprime el rango de puntuaciones y premia los benchmarks más antiguos.
- En segundo lugar, las dos suites tienen diferentes distribuciones de puntuación: los benchmarks estándar se agrupan en la parte superior (la mayoría de los modelos de frontera por encima de 85), mientras que los benchmarks avanzados tienen una dispersión más amplia (los mejores modelos alrededor de 90, el nivel medio alrededor de 50, los modelos más débiles por debajo de 30). Hacer una puntuación Z de ambos a la vez distorsionaría la estimación de la varianza.
Calculamos la capacidad para cada grupo de forma independiente:
- Benchmarks Estándar (2023–2024): MMLU (5-shot), GSM8K (8-shot chain of thought), HellaSwag (10-shot), ARC Challenge (25-shot), HumanEval (0-shot pass@1).
- Benchmarks Avanzados (2024–2026): MMLU-Pro, GPQA Diamond, AIME 2025, LiveCodeBench, SWE-bench Verified.
Una puntuación de 90 en los benchmarks estándar no es equivalente a 90 en los benchmarks avanzados. Para cualquier modelo lanzado a partir de finales de 2024, los benchmarks avanzados son la referencia significativa.
Fórmula de capacidad
Para cada benchmark b y cada modelo m:
Usamos la desviación estándar poblacional (divide por N, no por N−1). Esto coincide con el cálculo original de pandas con ddof=0 y asegura que añadir un único modelo nuevo no desplace retroactivamente la estimación de la varianza.
A continuación, promediamos las puntuaciones Z disponibles por modelo dentro de cada grupo de benchmarks y reescalamos min-max a una puntuación de 0–100 relativa al panel.
Fórmula de densidad
Para cada vista de densidad:
El denominador cambia según la vista: parámetros activos en miles de millones, FLOP de entrenamiento dividido por 10²⁴, o precio combinado por millón de tokens.
Metodología del índice encadenado
Los dos gráficos de índice al principio del artículo (Densidad de Inteligencia y Capacidad) muestran un crecimiento acumulado de una sola línea indexado a 100 en 2023, inspirado en el formato de rendimiento acumulado del S&P 500. Encadenamos las tasas de crecimiento año tras año a lo largo de la transición de los benchmarks en lugar de graficar valores absolutos.
Paso 1. Calcule la media anual de la métrica para cada grupo de benchmarks:
Para el Índice de Densidad de Inteligencia, la métrica es el promedio por fila de las tres puntuaciones de densidad por modelo (Densidad Combinada A o B). Para el Índice de Capacidad, la métrica es la puntuación de capacidad relativa al panel (Capacidad_A o Capacidad_B).
Paso 2. Para cada transición año a año, calcule el crecimiento dentro de un único grupo de benchmarks. Ambos años deben pertenecer al mismo grupo:
Paso 3. Encadene multiplicativamente desde una línea base de 2023 de 100:
Selección de grupo por transición:
- 2023 – 2024: Benchmarks estándar (Avanzado tiene 1 modelo en 2023, demasiado escaso para calcular una media estable)
- 2024 – 2025: Benchmarks avanzados (Estándar saturado a finales de 2024; Avanzado tiene 16 modelos en 2024 y 27 en 2025)
- 2025 – 2026: Benchmarks avanzados (Estándar no reportado para 2026)
El índice encadenado asume que las poblaciones subyacentes son comparables a través de los años dentro de un grupo. Nuestro panel es heterogéneo (diferentes modelos cada año, con diferente cobertura de benchmarks), por lo que los valores encadenados se leen mejor como un resumen direccional en lugar de un multiplicador preciso.
Principios fundamentales de evaluación para la medición de la densidad de inteligencia
- Benchmarks estándar de la industria: No introducimos ningún benchmark personalizado.
- Obtención de fuentes primarias: Cada puntuación de benchmark es rastreable al artículo de lanzamiento del modelo, la tarjeta del modelo o el anuncio oficial. Cuando la fuente primaria no reportó un benchmark, la celda se deja en blanco en lugar de imputarse.
- Indicadores de cobertura (N): Para cada modelo reportamos el número de benchmarks que contribuyen a su puntuación de capacidad en cada grupo. Los modelos con N=1 reciben una puntuación más ruidosa que los modelos con N=5. El caso N=1 se aplica a Qwen 3.6 35B A3B (solo SWE-bench Verified) y a algunos lanzamientos insignia cerrados de 2026.
Fuentes de precios para modelos de peso cerrado
El precio es la parte más sensible a la cohorte del índice. Utilizamos la siguiente jerarquía:
- Anuncio de lanzamiento del laboratorio (preferido): Precio citado en la publicación de lanzamiento del laboratorio, la documentación de la API o la cobertura de prensa contemporánea.
- Mediana entre proveedores de Artificial Analysis (alternativa para modelos solo de pesos): Se utiliza para tres filas de Llama 3.1 (8B, 70B, 405B) y las filas de GPT-OSS, porque no existe una API de primera parte.
- Solo pesos sin cobertura: 22 de 69 filas no tienen precio por dólar registrado. Aparecen en los gráficos de capacidad y por parámetro, pero están ausentes de los gráficos por dólar.
Seguimos dos pistas de precios: precio de lanzamiento (precio de primera parte el día del lanzamiento) y precio asentado (precio actual de primera parte, o el último antes de la descontinuación). Seis modelos en el panel fueron reajustados de precio después del lanzamiento:
- Gemini 1.5 Pro: $3.50/$10.50 a $1.25/$5.00 (octubre de 2024)
- GPT-4o: $5.00/$15.00 a $2.50/$10.00 (octubre de 2024)
- Gemini 1.5 Flash: $0.35/$1.05 a $0.075/$0.30 (agosto de 2024)
- Claude 3.5 Haiku: $1.00/$5.00 a $0.80/$4.00 (diciembre de 2024)
- o3: $10.00/$40.00 a $2.00/$8.00 (junio de 2025)
La densidad por dólar del titular utiliza precios asentados. Para 37 de 43 filas con precio, los precios de lanzamiento y asentados son idénticos.
Cadencia de actualización
Actualizamos el índice mensualmente. Cada actualización añade nuevas filas de modelos para cualquier lanzamiento de frontera o notable del mes anterior, actualiza los precios cuando los laboratorios han ajustado sus tarifas, rellena retroactivamente los benchmarks recién reportados para las filas existentes y recalcula las puntuaciones Z en todo el panel. Las nuevas entradas de modelos desplazan la media y la desviación estándar de cada benchmark, por lo que las puntuaciones existentes de 0–100 se mueven con el panel. Se conservan las instantáneas históricas.
Limitaciones de la evaluación de la densidad de inteligencia
- Optimismo reportado por los laboratorios: Las puntuaciones de los benchmarks provienen de los propios laboratorios. Las repeticiones independientes suelen ser de 5 a 13 puntos más bajas. Las líneas de tendencia son direccionalmente informativas pero no precisas en puntos.
- Modos de razonamiento y no razonamiento no separados: Los modelos lanzados en 2025 y 2026 admiten alternancias de pensamiento extendido que pueden cambiar las puntuaciones de matemáticas y codificación entre 5 y 15 puntos. Usamos las puntuaciones en modo predeterminado cuando son identificables.
- Las cifras de FLOP de entrenamiento son en su mayoría estimaciones: Un puñado de filas tienen FLOP confirmados por el laboratorio. El resto se extrapolan a partir de los parámetros y tokens de entrenamiento revelados, principalmente a través de Epoch IA.
- Recuento de parámetros de modelos cerrados desconocido: La densidad por parámetro y por FLOP está en blanco para las filas de frontera cerradas. Los modelos cerrados participan solo en la densidad por dólar.
- Puntuaciones relativas al panel: Las puntuaciones de densidad se reescalan min-max dentro del panel. Un nuevo modelo con una relación bruta más alta desplaza la puntuación de 0–100 de cada modelo existente. Para comparar versiones del panel, use las relaciones brutas subyacentes en lugar de las puntuaciones reescaladas.
¿Qué es la densidad de inteligencia?
La densidad de inteligencia representa una nueva métrica para evaluar cuánto conocimiento y capacidad de razonamiento puede concentrar un modelo en una sola unidad de memoria o cómputo. Mide la arquitectura del modelo evaluando cuán efectivamente utiliza cada parámetro para generar valor.
En este marco, el eje x a menudo representa el número de parámetros del modelo mientras que el eje y sigue el rendimiento en tareas desafiantes. Se produce una alta densidad cuando los modelos demuestran capacidades superiores sin requerir el costo computacional masivo asociado con modelos más grandes. Este proceso demuestra que la inteligencia no depende únicamente de la cantidad de datos o la escala del entrenamiento, sino más bien de cómo el software y los algoritmos organizan esa información.
Anteriormente, la comunidad de IA había dependido de escalar los parámetros del modelo para alcanzar un mayor rendimiento, lo que resultó en sistemas masivos y de gran consumo de recursos. Con este cambio de enfoque, se prioriza la optimización algorítmica sobre el volumen bruto para producir más inteligencia a partir de modelos más pequeños.
¿Por qué es importante medir la densidad de inteligencia?
Los sistemas eficientes deben optimizar el tiempo de inferencia y el uso de memoria. Identificar el punto en el que más tokens o cómputo adicional ya no generan ganancias significativas ayuda a la industria a comprender los límites superiores de los grandes modelos de lenguaje actuales. Las principales razones para medir la densidad de inteligencia se pueden resumir en:
- La comunidad de IA subestima los costos generales a largo plazo de mantener modelos sobredimensionados en los centros de datos.
- La creación de valor en aplicaciones prácticas depende de la relación entre la calidad de la salida y la potencia necesaria para producirla.
- La Ley de Moore para el hardware no puede sostener el crecimiento de los modelos de lenguaje sin el correspondiente progreso en cómo los optimizamos.
- El aprendizaje por refuerzo y la mejora en la distribución de datos permiten que las herramientas de la próxima generación alcancen benchmarks que antes estaban reservados solo para humanos. Obtenga más información sobre el aprendizaje por refuerzo y otros tipos de técnicas de ajuste fino de LLM.
Si bien los modelos más grandes siguen siendo importantes para explorar nuevas fronteras, la densidad de un sistema determina su utilidad real en el mundo real. Este contexto ayuda a ver la inteligencia como un resultado concentrado del entrenamiento en lugar de un subproducto del tamaño absoluto.
Lectura adicional
La densidad de inteligencia es una forma de comparar LLMs. Otras dimensiones se tratan en análisis separados:
- Benchmarks de latencia: Para el tiempo hasta el primer token y los tokens por segundo, consulte nuestro benchmark de latencia de LLM.
- Benchmarks por tarea: Para razonamiento financiero, consulte nuestro benchmark de LLM financiero. Para codificación, consulte nuestro benchmark de codificación de IA.
Cita este benchmark
Elige el formato que se ajuste al lugar donde vas a publicar. Pegar la versión con enlace en tu CMS conserva el enlace de retroceso.
@misc{simsek2026,
author = {Şimşek, Hazal},
title = {{Densidad de inteligencia de 71 LLMs: Modelos más inteligentes y densos}},
year = {2026},
month = jul,
howpublished = {\url{https://aimultiple.com/intelligence-density}},
note = {AIMultiple. Recuperado el 7 de Julio de 2026}
}Resultados y marcas de tiempo de 69 puntos de datos. Descargue los datos utilizados en este artículo como un archivo ZIP que contiene un archivo CSV y un README.
Sé el primero en comentar
Tu dirección de correo electrónico no será publicada. Todos los campos son obligatorios. Los comentarios se dejan en su idioma original.