Premium
Servicios
Premium

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Cómo se construye el índice

MEJOR MODELO
Claude Opus 5.5
Índice 100
Mejor relación calidad-precio
Qwen3.8 Flash
$0.23 / 1M
Más rápido
MiniMax M2.7
0.15s TTFT
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Página 1 de 13

Costo$8.00
Latencia2.81s
Contexto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Costo$20.00
Latencia6.31s
Contexto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Costo$20.00
Latencia3.84s
Contexto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Costo$0.23
Latencia0.85s
Contexto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Costo$0.60
Latencia-
Contexto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Costo$0.54
Latencia43.98s
Contexto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Costo$2.00
Latencia5.26s
Contexto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Costo$20.00
Latencia4.35s
Contexto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Costo$10.00
Latencia4.03s
Contexto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Costo$4.00
Latencia1.36s
Contexto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Página 1 de 13
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados

Cómo se construye el índice

Cada benchmark se lee como una posición, no como una puntuación bruta. Dentro de un benchmark el mejor resultado se sitúa en 100, el peor en 0, y el resto de los modelos cae en algún punto intermedio. El índice es la media ponderada de esas posiciones sobre los benchmarks que un modelo ha ejecutado realmente: un benchmark que nunca ejecutó no cuenta como cero, simplemente no está. Los benchmarks no cuentan por igual, y el peso que lleva cada uno se indica junto a él. Un modelo necesita resultados en al menos dos benchmarks del índice para ser clasificado, de modo que un único resultado sitúa al modelo en la línea de ese benchmark sin darle una posición propia. Se usan posiciones en lugar de precisión bruta porque los benchmarks difieren mucho en dificultad y escala, y las puntuaciones de benchmarks distintos no pueden compartir una media. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmarks que usamos

Público
AA-LCRRazonamiento de contexto largo sobre entradas de multiples documentos.
AIMultiple
AIM-A-CODE-LLM BenchProgramación agéntica en 10 tareas de desarrollo de software mediante una herramienta CLI (~3.500 pasos de validación).
AIMultiple
AIM-Agentic-RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
AIMultiple
AIM-FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistencia a inventar métricas no mencionadas en documentos de contexto largo (204 trampas, 14 transcripciones).
AIMultiple
AIM-RELC-BenchRecuperación de datos numéricos en contextos largos según la posición en el documento (100 elementos, 14 transcripciones).
AIMultiple
AIM-Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
Público
APEX-Agents-AATareas de largo horizonte y multiaplicacion escritas por banqueros de inversion, consultores y abogados corporativos.
Público
ARC-AGI-1Razonamiento abstracto con pocos ejemplos sobre transformaciones de cuadriculas; el primer benchmark de ARC Prize.
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
ARC-AGI-3Razonamiento interactivo: los agentes exploran entornos de juego nuevos, fijan objetivos sobre la marcha y aprenden a lo largo de los pasos. El 100% equivale a la eficiencia de aprendizaje humana.
Público
ArxivMathProblemas matematicos recientes de arXiv, ejecutados poco despues de su publicacion para limitar la contaminacion.
Público
AutomationBench-AATareas de automatizacion de oficina de extremo a extremo, puntuadas por finalizacion parcial.
Público
BioMysteryBenchBenchmark de Anthropic sobre si los agentes pueden resolver misterios bioinformaticos reales a partir de datos brutos.
Público
BrowseCompHechos dificiles de encontrar en la web: preguntas breves que exigen navegacion persistente.
Público
Convex Coding EvalsEscritura de backends Convex e integraciones de cliente sin directrices especificas del framework en el prompt.
Público
CritPtProblemas de fisica de nivel de investigacion que requieren derivaciones de varios pasos.
Público
Crosby RedlineBenchTareas de revision de contratos puntuadas turno a turno frente a las ediciones de abogados.
Público
DeepSWE 1.1Tareas de ingenieria de largo horizonte de repositorios de codigo abierto activos, evaluadas sobre el codigo confirmado en un entorno limpio.
Público
EnterpriseOps-Gym-AAPlanificacion agentica con estado y uso de herramientas en ocho sistemas empresariales.
Público
Frontier-BenchTareas de software agenticas sobre repositorios de frontera, puntuadas por tasa de resolucion.
Público
FrontierCodeSi un cambio es fusionable, no solo si pasa las pruebas: seguridad ante regresiones, alcance y mantenibilidad segun rubrica.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
GDPvalEntregables reales de 44 ocupaciones en los nueve mayores sectores del PIB de EE. UU., evaluados a ciegas por profesionales expertos frente a una referencia humana.
Público
GPQA DiamondPreguntas cientificas de nivel de posgrado, a prueba de busquedas, que exigen razonamiento profundo.
Público
Harvey LAB-AAEl benchmark de agentes juridicos de Harvey, puntuado por exito con todas las pruebas superadas.
Público
HealthBench ProfessionalConversaciones escritas por medicos evaluadas con rubricas escritas por medicos, en la particion profesional.
Público
HieroglyphBenchLectura de jeroglificos egipcios a partir de imagenes, puntuada por precision de signos.
Público
Humanity's Last ExamRazonamiento a libro cerrado de nivel experto en más de 100 materias académicas (2,5k preguntas).
Público
IFBenchSeguimiento preciso de instrucciones sobre 58 restricciones de salida verificables no vistas.
Público
ITBench-AAEscenarios reales de automatizacion de TI en fiabilidad de sistemas, FinOps y operaciones de seguridad.
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
LiveCodeBenchProblemas de programación competitiva sin contaminación y actualizados continuamente.
Público
MMMU-ProComprension multimodal de nivel universitario entre disciplinas, reforzada contra atajos de solo texto.
Público
ObviousBenchPreguntas de respuesta obvia que aun asi los modelos fallan; puntuadas con pass al cubo.
Público
Opus Magnum BenchDiseno de maquinas funcionales en el juego de puzles Opus Magnum.
Público
ReactBenchConstruccion y correccion de componentes React, puntuado con pass@1.
Público
RuneBenchLectura y razonamiento sobre una escritura runica inventada que el modelo nunca ha visto, puntuado en escala logaritmica.
Público
SciCodeProgramación científica de nivel de investigación en física, matemáticas, biología y química (338 subproblemas)
Público
SimpleBenchPreguntas de razonamiento cotidiano en las que los humanos superan de forma constante a los modelos de frontera.
Público
Swe-BenchIssues reales de GitHub resueltos de principio a fin (conjunto completo de 2.294 instancias).
Público
Tau2-Bench TelecomAgentes de atencion al cliente que usan herramientas en el ambito de telecomunicaciones, evaluados por exito de tarea.
Público
Tau3-BankingAgentes que usan herramientas para gestionar flujos realistas de atencion al cliente bancaria.
Público
Terminal-Bench 2.1Tareas agenticas de terminal en ingenieria de software, datos y administracion de sistemas.
Público
Terminal-Bench 4.0La generacion actual de Terminal-Bench: tareas agenticas de terminal puntuadas por tasa de resolucion.
Público
Terminal-Bench HardEl subconjunto dificil de Terminal-Bench: tareas de software de varios pasos resueltas en una terminal real.
Público
Terminal-Bench-ScienceTareas de terminal extraidas de flujos de trabajo reales de computacion cientifica.

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Anthropic

Claude Opus 5.5

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Luna

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de LLMEl ritmo de la innovación en IA
Laboratorios de IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 másQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 másQwen3.8 2.4T A95BQwen3.8 27B
03 sep 2026
Qwen3.8 Flash +1 másQwen3.8 FlashQwen3.8 Max (0902)
23 sep 2026
Qwen3.8 Max Prime +1 másQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 másGLM 5.3GLM 5.3 Flash
23 sep 2026
GLM 5.3 FlashX +1 másGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 jul 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
22 sep 2026
GPT-6 Astra +2 másGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 sep 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 sep 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 másMuse Glimmer 30BMuse Spark 1.2
02 sep 2026
Muse Spark 1.2 Contributor +2 másMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Explorar Casos de uso, análisis y comparativas del programa LLM

Parámetros de LLM: GPT-5 High, Medio, Bajo y Mínimo

LLM
Análisis
21 de ago

Algunos LLMs, como la familia OpenAI GPT-5, vienen en diferentes versiones (p. ej., GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluidos alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de model recopilando su rendimiento en benchmarks y los costes de ejecutar los benchmarks. Usamos la familia GPT-5…

Leer más
LLM
Comparación de Funciones
21 de ago

Principales herramientas de LLMOps y compáralas con MLOps

Las plataformas de LLMOps se encargan del aspecto operativo de la ejecución de LLMs: despliegue, monitoreo, evaluación y gestión de costes. Analizamos las principales herramientas de LLMOps, sus funciones clave, sus esquemas de precios y en qué se diferencian entre sí para ayudar a identificar la mejor opción para distintos casos de uso. A continuación…

LLM
Análisis
19 de ago

50+ Casos de uso de ChatGPT con ejemplos reales

ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, aproximadamente el 10 % de la población mundial.1 OpenAI superó los $20 mil millones en ingresos anuales en 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: el aumento, en el que un humano…

LLM
Análisis
19 de ago

ChatGPT para Atención al Cliente: Los 10 Principales Casos de Uso

ChatGPT ha pasado de ser una novedad a ser infraestructura en atención al cliente. Las empresas lo utilizan para reducir los tiempos de respuesta, gestionar el volumen que sus equipos no pueden absorber y reducir el coste de las interacciones rutinarias. Pero los resultados varían enormemente según cómo se implemente. OpenAI lanzó GPT-5.6, un model…

LLM
Benchmark
16 de ago

Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos

Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference). Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos: Consulte…

LLM
Benchmark
12 de ago

LLM Comparativa de latencia por casos de uso

Evaluamos 11 modelos de lenguaje grandes principales con un total de 1.320 solicitudes, dividiendo modelos de razonamiento y no razonamiento, y medimos la latencia del primer token, la latencia por token y el tiempo de respuesta total. Puede encontrar detalles sobre cómo medimos la latencia aquí. Presentamos por separado los modelos con razonamiento y sin…

LLM
Benchmark
15 de abr

LLM Cuantización: BF16 vs FP8 vs INT4

Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2.000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…