Premium
Servicios
Premium

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Cómo se construye el índice

MEJOR MODELO
Claude Opus 5.5
Índice 76
Mejor relación calidad-precio
Qwen3.8 Flash
$0.23 / 1M
Más rápido
Command A+
0.22s TTFT
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-Text-to-SQL
ARC-AGI-3
CritPt
FrontierMath
IFBench
MMMU-Pro
SciCode
Terminal-Bench 2.1
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
76
909288-32--8867-
2
GPT-6 Astra
GPT-6 Astra
OpenAI
74
848766633298-875690
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
73
849067-3188--6391
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
71
------81-4786
5
Muse Spark 1.1
Muse Spark 1.1
Meta
68
--------5878
6
Claude Opus 5
Claude Opus 5
Anthropic
67
859064302973-855689
7
Qwen3.8 Max
Qwen3.8 Max
Alibaba Cloud
66
83-51--46-825381
8
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
65
7790548328373835790
9
Kimi K3
Kimi K3
Moonshot AI
63
838848-2339-815985
10
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
63
85-72-1437-866086
Página 1 de 4

Costo$8.00
Latencia1.16s
Contexto1M
TTFT1.16s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
MMMU-Pro
88
SciCode
67

Costo$20.00
Latencia4.75s
Contexto524k
TTFT4.75s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-3
63
CritPt
32
FrontierMath
98
MMMU-Pro
87
SciCode
56
Terminal-Bench 2.1
90

Costo$20.00
Latencia1.93s
Contexto1M
TTFT1.93s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
CritPt
31
FrontierMath
88
SciCode
63
Terminal-Bench 2.1
91

Costo$0.23
Latencia1.72s
Contexto1M
TTFT1.72s
IFBench
81
SciCode
47
Terminal-Bench 2.1
86

Costo$2.00
Latencia1.47s
Contexto1M
TTFT1.47s
SciCode
58
Terminal-Bench 2.1
78

Costo$10.00
Latencia2.58s
Contexto1M
TTFT2.58s
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-3
30
CritPt
29
FrontierMath
73
MMMU-Pro
85
SciCode
56
Terminal-Bench 2.1
89

Costo$3.00
Latencia56.57s
Contexto1M
TTFT56.57s
AIM-Agentic-RAG
83
AIM-Text-to-SQL
51
FrontierMath
46
MMMU-Pro
82
SciCode
53
Terminal-Bench 2.1
81

Costo$8.00
Latencia3.06s
Contexto1M
TTFT3.06s
AIM-Agentic-RAG
77
AIM-FinanceReasoning
90
AIM-Text-to-SQL
54
ARC-AGI-3
8
CritPt
32
FrontierMath
83
IFBench
73
MMMU-Pro
83
SciCode
57
Terminal-Bench 2.1
90

Costo$3.00
Latencia2.70s
Contexto1M
TTFT2.70s
AIM-Agentic-RAG
83
AIM-FinanceReasoning
88
AIM-Text-to-SQL
48
CritPt
23
FrontierMath
39
MMMU-Pro
81
SciCode
59
Terminal-Bench 2.1
85

Costo$0.76
Latencia6.15s
Contexto1M
TTFT6.15s
AIM-Agentic-RAG
85
AIM-Text-to-SQL
72
CritPt
14
FrontierMath
37
MMMU-Pro
86
SciCode
60
Terminal-Bench 2.1
86
Página 1 de 4
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados

Cómo se construye el índice

El índice es la media de las puntuaciones de un modelo en los benchmarks listados abajo, sobre los que realmente ha ejecutado: un benchmark que nunca ejecutó no cuenta como cero, simplemente no está. Todos los benchmarks del índice cuentan por igual. Un benchmark que ya da un porcentaje de 0 a 100 se usa tal cual; uno en otra escala se reescala primero a 0-100. Un modelo necesita resultados en al menos dos benchmarks del índice para ser clasificado, de modo que un único resultado no le da una posición propia. Como las puntuaciones se usan tal cual, un benchmark que todo el campo encuentra difícil baja todas las puntuaciones en él, y un modelo medido en benchmarks más difíciles lo arrastra a su media.

Benchmarks que usamos

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Anthropic

Claude Opus 5.5

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Luna

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

X

Grok 4.7

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de LLMEl ritmo de la innovación en IA
Laboratorios de IA
Alibaba Cloud
Alibaba Cloud
27 jul 2026
Qwen3.7 Flash
03 ago 2026
Qwen3.8 Max
12 ago 2026
Qwen3.8 2.4T A95B
14 ago 2026
Qwen3.8 27B
26 ago 2026
Qwen3.8 Flash
03 sep 2026
Qwen3.8 Max (0902)
21 sep 2026
Qwen3.8 Omni Flash
23 sep 2026
Qwen3.8 Max Prime
Z AI
Z AI
18 ago 2026
GLM 5.3
26 ago 2026
GLM 5.3 Flash
18 sep 2026
GLM 5.3 FlashX
23 sep 2026
GLM 5.3 Prime
Anthropic
Anthropic
30 jun 2026
Claude Sonnet 5
24 jul 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
09 jul 2026
GPT-5.6 Luna +2 másGPT-5.6 LunaGPT-5.6 SolGPT-5.6 Terra
04 sep 2026
GPT-6 Astra
22 sep 2026
GPT-6 Luna +1 másGPT-6 LunaGPT-6 Sol
Cohere
Cohere
22 sep 2026
Command A+
X
X
08 jul 2026
Grok 4.5
12 ago 2026
Grok 4.6
21 sep 2026
Grok 4.7
DeepSeek
DeepSeek
31 jul 2026
DeepSeek V4 Flash 0731
12 ago 2026
DeepSeek V4 Pro 0813
21 ago 2026
DeepSeek V4 Flash Vision Exp
10 sep 2026
DeepSeek V4.1 Flash
Meta
Meta
16 jul 2026
Muse Spark 1.1
05 ago 2026
Muse Spark 1.2
09 ago 2026
Muse Glimmer 30B
21 ago 2026
Muse Spark 1.2 Contributor
02 sep 2026
Muse Spark 1.3 +1 másMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
30 jun 2026
Nano Banana 2 Lite
21 jul 2026
Gemini 3.5 Flash Lite +1 másGemini 3.5 Flash LiteGemini 3.6 Flash
13 ago 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
06 jul 2026
Hy3
19 ago 2026
Hy-MT2-7B
20 ago 2026
Hy-MT2-1.8B +1 másHy-MT2-1.8BHy-MT2-30B-A3B
28 ago 2026
Hy4 +1 másHy4Hy4 preview
Moonshot AI
Moonshot AI
16 jul 2026
Kimi K3

Explorar Casos de uso, análisis y comparativas del programa LLM

Text-to-SQL: Comparación de la precisión de los LLM

LLM
Benchmark
25 de sep

Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…

Leer más
LLM
Análisis
25 de sep

LLM Cuota de mercado: compara uso y adopción

Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo se distribuye la demanda de modelos de lenguaje de gran tamaño entre los laboratorios de IA y las aplicaciones de IA. Lee la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó…

LLM
Benchmark
24 de sep

Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando razonamiento cuantitativo complejo de múltiples pasos que implica conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de exactitud y consumo de tokens. Para una…

LLM
Benchmark
21 de sep

Comparativa de Models de IA Multimodal en Razonamiento Visual

Realizamos un benchmark de 15 models de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos áreas: 100 preguntas de comprensión de gráficos que evaluaban la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evaluaban el reconocimiento de patrones y el razonamiento espacial.…

LLM
Análisis
21 de sep

Grandes models multimodales (LMMs) vs LLMs

Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología ofrece información detallada sobre el…

LLM
Análisis
21 de sep

LLM Calculadora de VRAM para alojamiento propio

Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…

LLM
Benchmark
18 de sep

TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?

Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…

LLM
Benchmark
17 de sep

AIM Enterprise: Benchmark empresarial agéntico

Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales,…

LLM
Análisis
17 de sep

El futuro de los Large Language Models

Vea el futuro de los large language models profundizando en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa, que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…

LLM
Benchmark
15 de sep

Modelos de lenguaje de gran tamaño en ciberseguridad

Evaluamos 7 grandes modelos de lenguaje en 9 dominios de ciberseguridad usando SecBench, un benchmark a gran escala y multiformato para tareas de seguridad. Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), que abarcan seguridad de datos, gestión de identidades y accesos, seguridad de redes, gestión…

LLM
Análisis
15 de sep

LLM leyes de escalado: análisis de investigadores de IA

Los modelos de lenguaje de gran tamaño predicen el siguiente token basándose en patrones aprendidos de los datos de texto. El término LLM leyes de escalado se refiere a las regularidades empíricas que vinculan el rendimiento del modelo con la cantidad de cómputo, los datos de entrenamiento y los parámetros del modelo utilizados durante el…