Premium
Servicios
Premium

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Cómo se construye el índice

MEJOR MODELO
Claude Opus 5.5
Índice 100
Mejor relación calidad-precio
Qwen3.8 Flash
$0.23 / 1M
Más rápido
MiniMax M2.7
0.15s TTFT
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
AA-LCR
AIM-A-CODE-LLM Bench
AIM-Agentic-RAG
AIM-FinanceReasoning
AIM-HALC-Bench
AIM-RELC-Bench
AIM-Text-to-SQL
APEX-Agents-AA
ARC-AGI-1
ARC-AGI-2
ARC-AGI-3
ArxivMath
AutomationBench-AA
BioMysteryBench
BrowseComp
Convex Coding Evals
CritPt
Crosby RedlineBench
DeepSWE 1.1
EnterpriseOps-Gym-AA
Frontier-Bench
FrontierCode
FrontierMath
GDPval
GPQA Diamond
Harvey LAB-AA
HealthBench Professional
HieroglyphBench
Humanity's Last Exam
IFBench
ITBench-AA
LegalBench
LiveCodeBench
MMMU-Pro
ObviousBench
Opus Magnum Bench
ReactBench
RuneBench
SciCode
SimpleBench
Swe-Bench
Tau2-Bench Telecom
Tau3-Banking
Terminal-Bench 2.1
Terminal-Bench 4.0
Terminal-Bench Hard
Terminal-Bench-Science
1
Claude Opus 5.5
Claude Opus 5.5
Anthropic
100
--9092--88---------32------1846--------------67--------
2
GPT-6 Astra
GPT-6 Astra
OpenAI
92
--8487--66--9563-41-928532-74--5398154296-70----------756----9058--
3
Claude Fable 5.1
Claude Fable 5.1
Anthropic
91
80-8490--67-9890--31--8131-67--5188173594-62-59--89-----663---479156--
4
Qwen3.8 Flash
Qwen3.8 Flash
Alibaba Cloud
87
77----------------------174392---3881--------47---4586---
5
Command A+
Command A+
Cohere
87
----------------30------------74-61---------81---25-
6
MiMo-V2.6-Pro
MiMo-V2.6-Pro
Xiaomi
87
----------------27------1673--------------61--------
7
Muse Spark 1.1
Muse Spark 1.1
Meta
86
81-----------------53----138190-59-46--85--99-23658---3278---
8
Claude Fable 5
Claude Fable 5
Anthropic
85
77698290--66599989-7917-878429-70-3454901741931463235664-89-8199224766182-993885426321
9
Claude Opus 5
Claude Opus 5
Anthropic
83
79-8590--64-989030915079918229-74-445373170894-60-55--87-85100--656---458952-30
10
GPT-6 Sol
GPT-6 Sol
OpenAI
79
--82---54---------31------1487--------------58--------
Página 1 de 13

Costo$8.00
Latencia2.81s
Contexto1M
TTFT2.81s
AIM-Agentic-RAG
90
AIM-FinanceReasoning
92
AIM-Text-to-SQL
88
CritPt
32
GDPval
1846
SciCode
67

Costo$20.00
Latencia6.31s
Contexto1M
TTFT6.31s
AIM-Agentic-RAG
84
AIM-FinanceReasoning
87
AIM-Text-to-SQL
66
ARC-AGI-2
95
ARC-AGI-3
63
AutomationBench-AA
41
BrowseComp
92
Convex Coding Evals
85
CritPt
32
DeepSWE 1.1
74
FrontierCode
53
FrontierMath
98
GDPval
1542
GPQA Diamond
96
HealthBench Professional
70
RuneBench
7
SciCode
56
Terminal-Bench 2.1
90
Terminal-Bench 4.0
58

Costo$20.00
Latencia3.84s
Contexto1M
TTFT3.84s
AA-LCR
80
AIM-Agentic-RAG
84
AIM-FinanceReasoning
90
AIM-Text-to-SQL
67
ARC-AGI-1
98
ARC-AGI-2
90
AutomationBench-AA
31
Convex Coding Evals
81
CritPt
31
DeepSWE 1.1
67
FrontierCode
51
FrontierMath
88
GDPval
1735
GPQA Diamond
94
HealthBench Professional
62
Humanity's Last Exam
59
LegalBench
89
RuneBench
6
SciCode
63
Tau3-Banking
47
Terminal-Bench 2.1
91
Terminal-Bench 4.0
56

Costo$0.23
Latencia0.85s
Contexto1M
TTFT0.85s
AA-LCR
77
GDPval
1743
GPQA Diamond
92
Humanity's Last Exam
38
IFBench
81
SciCode
47
Tau3-Banking
45
Terminal-Bench 2.1
86

Costo$0.60
Latencia-
Contexto200k
TTFT
CritPt
30
IFBench
74
LegalBench
61
Tau2-Bench Telecom
81
Terminal-Bench Hard
25

Costo$0.54
Latencia43.98s
Contexto1M
TTFT43.98s
CritPt
27
GDPval
1673
SciCode
61

Costo$2.00
Latencia5.26s
Contexto1M
TTFT5.26s
AA-LCR
81
DeepSWE 1.1
53
GDPval
1381
GPQA Diamond
90
HealthBench Professional
59
Humanity's Last Exam
46
LegalBench
85
ObviousBench
99
ReactBench
23
RuneBench
6
SciCode
58
Tau3-Banking
32
Terminal-Bench 2.1
78

Costo$20.00
Latencia4.35s
Contexto1M
TTFT4.35s
AA-LCR
77
AIM-A-CODE-LLM Bench
69
AIM-Agentic-RAG
82
AIM-FinanceReasoning
90
AIM-Text-to-SQL
66
APEX-Agents-AA
59
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
AutomationBench-AA
17
BrowseComp
87
Convex Coding Evals
84
CritPt
29
DeepSWE 1.1
70
Frontier-Bench
34
FrontierCode
54
FrontierMath
90
GDPval
1741
GPQA Diamond
93
Harvey LAB-AA
14
HealthBench Professional
63
HieroglyphBench
23
Humanity's Last Exam
56
IFBench
64
LegalBench
89
MMMU-Pro
81
ObviousBench
99
Opus Magnum Bench
22
ReactBench
47
RuneBench
6
SciCode
61
SimpleBench
82
Tau2-Bench Telecom
99
Tau3-Banking
38
Terminal-Bench 2.1
85
Terminal-Bench 4.0
42
Terminal-Bench Hard
63
Terminal-Bench-Science
21

Costo$10.00
Latencia4.03s
Contexto1M
TTFT4.03s
AA-LCR
79
AIM-Agentic-RAG
85
AIM-FinanceReasoning
90
AIM-Text-to-SQL
64
ARC-AGI-1
98
ARC-AGI-2
90
ARC-AGI-3
30
ArxivMath
91
AutomationBench-AA
50
BioMysteryBench
79
BrowseComp
91
Convex Coding Evals
82
CritPt
29
DeepSWE 1.1
74
Frontier-Bench
44
FrontierCode
53
FrontierMath
73
GDPval
1708
GPQA Diamond
94
HealthBench Professional
60
Humanity's Last Exam
55
LegalBench
87
MMMU-Pro
85
ObviousBench
100
RuneBench
6
SciCode
56
Tau3-Banking
45
Terminal-Bench 2.1
89
Terminal-Bench 4.0
52
Terminal-Bench-Science
30

Costo$4.00
Latencia1.36s
Contexto1M
TTFT1.36s
AIM-Agentic-RAG
82
AIM-Text-to-SQL
54
CritPt
31
GDPval
1487
SciCode
58
Página 1 de 13
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados

Cómo se construye el índice

Cada benchmark se lee como una posición, no como una puntuación bruta. Dentro de un benchmark el mejor resultado se sitúa en 100, el peor en 0, y el resto de los modelos cae en algún punto intermedio. El índice es la media ponderada de esas posiciones sobre los benchmarks que un modelo ha ejecutado realmente: un benchmark que nunca ejecutó no cuenta como cero, simplemente no está. Los benchmarks no cuentan por igual, y el peso que lleva cada uno se indica junto a él. Un modelo necesita resultados en al menos dos benchmarks del índice para ser clasificado, de modo que un único resultado sitúa al modelo en la línea de ese benchmark sin darle una posición propia. Se usan posiciones en lugar de precisión bruta porque los benchmarks difieren mucho en dificultad y escala, y las puntuaciones de benchmarks distintos no pueden compartir una media. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).

Benchmarks que usamos

Público
AA-LCRRazonamiento de contexto largo sobre entradas de multiples documentos.
AIMultiple
AIM-A-CODE-LLM BenchProgramación agéntica en 10 tareas de desarrollo de software mediante una herramienta CLI (~3.500 pasos de validación).
AIMultiple
AIM-Agentic-RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
AIMultiple
AIM-FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
AIMultiple
AIM-HALC-BenchResistencia a inventar métricas no mencionadas en documentos de contexto largo (204 trampas, 14 transcripciones).
AIMultiple
AIM-RELC-BenchRecuperación de datos numéricos en contextos largos según la posición en el documento (100 elementos, 14 transcripciones).
AIMultiple
AIM-Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
Público
APEX-Agents-AATareas de largo horizonte y multiaplicacion escritas por banqueros de inversion, consultores y abogados corporativos.
Público
ARC-AGI-1Razonamiento abstracto con pocos ejemplos sobre transformaciones de cuadriculas; el primer benchmark de ARC Prize.
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
ARC-AGI-3Razonamiento interactivo: los agentes exploran entornos de juego nuevos, fijan objetivos sobre la marcha y aprenden a lo largo de los pasos. El 100% equivale a la eficiencia de aprendizaje humana.
Público
ArxivMathProblemas matematicos recientes de arXiv, ejecutados poco despues de su publicacion para limitar la contaminacion.
Público
AutomationBench-AATareas de automatizacion de oficina de extremo a extremo, puntuadas por finalizacion parcial.
Público
BioMysteryBenchBenchmark de Anthropic sobre si los agentes pueden resolver misterios bioinformaticos reales a partir de datos brutos.
Público
BrowseCompHechos dificiles de encontrar en la web: preguntas breves que exigen navegacion persistente.
Público
Convex Coding EvalsEscritura de backends Convex e integraciones de cliente sin directrices especificas del framework en el prompt.
Público
CritPtProblemas de fisica de nivel de investigacion que requieren derivaciones de varios pasos.
Público
Crosby RedlineBenchTareas de revision de contratos puntuadas turno a turno frente a las ediciones de abogados.
Público
DeepSWE 1.1Tareas de ingenieria de largo horizonte de repositorios de codigo abierto activos, evaluadas sobre el codigo confirmado en un entorno limpio.
Público
EnterpriseOps-Gym-AAPlanificacion agentica con estado y uso de herramientas en ocho sistemas empresariales.
Público
Frontier-BenchTareas de software agenticas sobre repositorios de frontera, puntuadas por tasa de resolucion.
Público
FrontierCodeSi un cambio es fusionable, no solo si pasa las pruebas: seguridad ante regresiones, alcance y mantenibilidad segun rubrica.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
GDPvalEntregables reales de 44 ocupaciones en los nueve mayores sectores del PIB de EE. UU., evaluados a ciegas por profesionales expertos frente a una referencia humana.
Público
GPQA DiamondPreguntas cientificas de nivel de posgrado, a prueba de busquedas, que exigen razonamiento profundo.
Público
Harvey LAB-AAEl benchmark de agentes juridicos de Harvey, puntuado por exito con todas las pruebas superadas.
Público
HealthBench ProfessionalConversaciones escritas por medicos evaluadas con rubricas escritas por medicos, en la particion profesional.
Público
HieroglyphBenchLectura de jeroglificos egipcios a partir de imagenes, puntuada por precision de signos.
Público
Humanity's Last ExamRazonamiento a libro cerrado de nivel experto en más de 100 materias académicas (2,5k preguntas).
Público
IFBenchSeguimiento preciso de instrucciones sobre 58 restricciones de salida verificables no vistas.
Público
ITBench-AAEscenarios reales de automatizacion de TI en fiabilidad de sistemas, FinOps y operaciones de seguridad.
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
LiveCodeBenchProblemas de programación competitiva sin contaminación y actualizados continuamente.
Público
MMMU-ProComprension multimodal de nivel universitario entre disciplinas, reforzada contra atajos de solo texto.
Público
ObviousBenchPreguntas de respuesta obvia que aun asi los modelos fallan; puntuadas con pass al cubo.
Público
Opus Magnum BenchDiseno de maquinas funcionales en el juego de puzles Opus Magnum.
Público
ReactBenchConstruccion y correccion de componentes React, puntuado con pass@1.
Público
RuneBenchLectura y razonamiento sobre una escritura runica inventada que el modelo nunca ha visto, puntuado en escala logaritmica.
Público
SciCodeProgramación científica de nivel de investigación en física, matemáticas, biología y química (338 subproblemas)
Público
SimpleBenchPreguntas de razonamiento cotidiano en las que los humanos superan de forma constante a los modelos de frontera.
Público
Swe-BenchIssues reales de GitHub resueltos de principio a fin (conjunto completo de 2.294 instancias).
Público
Tau2-Bench TelecomAgentes de atencion al cliente que usan herramientas en el ambito de telecomunicaciones, evaluados por exito de tarea.
Público
Tau3-BankingAgentes que usan herramientas para gestionar flujos realistas de atencion al cliente bancaria.
Público
Terminal-Bench 2.1Tareas agenticas de terminal en ingenieria de software, datos y administracion de sistemas.
Público
Terminal-Bench 4.0La generacion actual de Terminal-Bench: tareas agenticas de terminal puntuadas por tasa de resolucion.
Público
Terminal-Bench HardEl subconjunto dificil de Terminal-Bench: tareas de software de varios pasos resueltas en una terminal real.
Público
Terminal-Bench-ScienceTareas de terminal extraidas de flujos de trabajo reales de computacion cientifica.

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Anthropic

Claude Opus 5.5

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-6 Luna

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Xiaomi

MiMo-V2.6-Pro

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de LLMEl ritmo de la innovación en IA
Laboratorios de IA
Alibaba Cloud
Alibaba Cloud
03 ago 2026
Qwen3.7 Flash +1 másQwen3.7 FlashQwen3.8 Max
14 ago 2026
Qwen3.8 2.4T A95B +1 másQwen3.8 2.4T A95BQwen3.8 27B
03 sep 2026
Qwen3.8 Flash +1 másQwen3.8 FlashQwen3.8 Max (0902)
23 sep 2026
Qwen3.8 Max Prime +1 másQwen3.8 Max PrimeQwen3.8 Omni Flash
Z AI
Z AI
26 ago 2026
GLM 5.3 +1 másGLM 5.3GLM 5.3 Flash
23 sep 2026
GLM 5.3 FlashX +1 másGLM 5.3 FlashXGLM 5.3 Prime
Anthropic
Anthropic
24 jul 2026
Claude Opus 5
01 sep 2026
Claude Fable 5.1
22 sep 2026
Claude Opus 5.5
OpenAI
OpenAI
22 sep 2026
GPT-6 Astra +2 másGPT-6 AstraGPT-6 LunaGPT-6 Sol
Xiaomi
Xiaomi
21 sep 2026
MiMo-V2.6-Pro
X
X
12 ago 2026
Grok 4.6
21 sep 2026
Grok 4.7
Meta
Meta
09 ago 2026
Muse Glimmer 30B +1 másMuse Glimmer 30BMuse Spark 1.2
02 sep 2026
Muse Spark 1.2 Contributor +2 másMuse Spark 1.2 ContributorMuse Spark 1.3Muse Spark 1.3 Contributor
Google
Google
13 ago 2026
Gemini 3.7 Flash
02 sep 2026
Gemini 3.8 Flash
Tencent
Tencent
28 ago 2026
Hy4

Explorar Casos de uso, análisis y comparativas del programa LLM

Comparativa de 9 grandes modelos de lenguaje en atención médica

LLM
Comparación de Funciones
15 de sep

Evaluamos comparativamente 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permite una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo de…

Leer más
LLM
Benchmark
15 de sep

Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?

En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…

LLM
Benchmark
15 de sep

HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…

LLM
Benchmark
15 de sep

Puertas de enlace de IA para OpenAI: alternativas a OpenRouter

Comparamos OpenRouter, SambaNova, TogetherAI, Groq y IA/ML API en tres indicadores (latencia del primer token, latencia total y número de tokens de salida), con 300 pruebas usando prompts cortos (aprox. 18 tokens) y prompts largos (aprox. 203 tokens) para la latencia total. Si planea usar una de estas puertas de enlace de IA, puede: En…

LLM
Análisis
2 de sep

LLM Herramientas de observabilidad: Weights & Biases, Langsmith

Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…

LLM
Comparación de Funciones
2 de sep

Nube LLM vs Local LLMs: Ejemplos y beneficios

Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…

LLM
Análisis
1 de sep

LLM Guía de Fine-Tuning para Empresas

Siga los enlaces para encontrar soluciones específicas a los desafíos de salida de su LLM. Si su LLM: La adopción generalizada de modelos de lenguaje grandes (LLMs) ha mejorado nuestra capacidad para procesar el lenguaje humano. Sin embargo, su entrenamiento genérico a menudo resulta en un rendimiento subóptimo para tareas específicas. Para superar esta limitación,…

LLM
Análisis
1 de sep

10+ Ejemplos de modelos de lenguaje grandes

Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…

LLM
Comparación de Funciones
27 de ago

Precios de LLM: Comparativa de 15+ proveedores principales

Los precios de LLM abarcan cuatro órdenes de magnitud: los models más baratos se lanzaron por menos de $0,03 por millón de tokens, mientras que los niveles de razonamiento frontera se lanzaron hasta $262.50. El gráfico siguiente rastrea los precios de lanzamiento: cada punto es el precio promedio de los models de una clase de…

LLM
Análisis
27 de ago

LLM Automatización: Top 7 herramientas y 8 casos de estudio

La automatización de LLM se refiere al cambio hacia herramientas de automatización inteligentes que aprovechan LLMs, incluidos los agentes de IA, los LLMs ajustados y los modelos RAG para automatizar y coordinar tareas. Descubra qué es la automatización de LLM, sus principales aplicaciones en la vida real y las principales herramientas: Los grandes modelos de…

LLM
Evaluación en Mundo Abierto
26 de ago

LLM Orquestación: 22 frameworks y pasarelas

Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los distintos enfoques de orquestación, realizamos benchmarks: Descubra herramientas seleccionadas de orquestación de LLM, incluidos los frameworks para desarrolladores y las pasarelas empresariales: La orquestación de LLM consiste en…