Premium
Servicios
Premium

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.

MEJOR MODELO
Claude Opus 5
Índice 86
Mejor relación calidad-precio
DeepSeek V4 Flash 0731
$0.11 / 1M
Más rápido
Trinity Large Thinking
0.12s TTFT
Cobertura
151 modelos
12 benchmarks · 697 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Página 1 de 16

Costo$10.00
Latencia3.83s
Contexto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Costo$8.00
Latencia4.43s
Contexto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Costo$20.00
Latencia5.28s
Contexto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Costo$4.50
Latencia1.92s
Contexto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Costo$10.00
Latencia4.53s
Contexto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Costo$20.00
Latencia5.44s
Contexto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Costo$1.50
Latencia6.05s
Contexto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Costo$33.75
Latencia3.65s
Contexto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Costo$5.44
Latencia0.93s
Contexto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Costo$2.00
Latencia10.25s
Contexto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Página 1 de 16
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

Cada benchmark se convierte en una posición de 0 a 100, y el índice es la media ponderada de esas posiciones. Un benchmark en el que un modelo no se ha evaluado cuenta como la media del conjunto, de modo que las puntuaciones siguen siendo comparables. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
Público
ARC-AGI-1Razonamiento abstracto con pocos ejemplos sobre transformaciones de cuadriculas; el primer benchmark de ARC Prize.
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
ArxivMathProblemas matematicos recientes de arXiv, ejecutados poco despues de su publicacion para limitar la contaminacion.
Público
BioMysteryBenchBenchmark de Anthropic sobre si los agentes pueden resolver misterios bioinformaticos reales a partir de datos brutos.
Público
CritPtProblemas de fisica de nivel de investigacion que requieren derivaciones de varios pasos.
AIMultiple
FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
Público
Frontier-BenchTareas de software agenticas sobre repositorios de frontera, puntuadas por tasa de resolucion.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
MMMU-ProComprension multimodal de nivel universitario entre disciplinas, reforzada contra atajos de solo texto.
Público
Terminal-Bench 2.1Tareas agenticas de terminal en ingenieria de software, datos y administracion de sistemas.
Público
Terminal-Bench HardEl subconjunto dificil de Terminal-Bench: tareas de software de varios pasos resueltas en una terminal real.
Público
Terminal-Bench-ScienceTareas de terminal extraidas de flujos de trabajo reales de computacion cientifica.
AIMultiple
Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Google

Gemini 3.8 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Anthropic

Claude Fable 5.1

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Tencent

Hy4 preview

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Z AI

GLM 5.3 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de modelos de IAÚltimos 12 modelos en 21 días

Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 21 días.

Proveedor
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 másGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Ago 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 másMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Explorar Casos de uso, análisis y comparativas del programa LLM

Comparativa de 9 grandes modelos de lenguaje en atención médica

LLM
Comparación de Funciones
4 de Sep

Evaluamos comparativamente 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permite una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo de…

Leer más
LLM
Análisis
3 de Sep

Grandes models multimodales (LMMs) vs LLMs

Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología ofrece información detallada sobre el…

LLM
Análisis
2 de Sep

LLM Leyes de escalado: análisis de investigadores de IA

Large language models predicen el siguiente token a partir de patrones aprendidos de datos de texto. El término leyes de escalado de LLM se refiere a regularidades empíricas que vinculan el rendimiento de los model con la cantidad de cómputo, datos de entrenamiento y parámetros de los model utilizados durante el entrenamiento. Para comprender cómo…

LLM
Análisis
2 de Sep

LLM Herramientas de observabilidad: Weights & Biases, Langsmith

Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…

LLM
Comparación de Funciones
2 de Sep

Nube LLM vs Local LLMs: Ejemplos y beneficios

Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…

LLM
Benchmark
1 de Sep

Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?

En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…

LLM
Análisis
1 de Sep

LLM Guía de Fine-Tuning para Empresas

Siga los enlaces para encontrar soluciones específicas a los desafíos de salida de su LLM. Si su LLM: La adopción generalizada de modelos de lenguaje grandes (LLMs) ha mejorado nuestra capacidad para procesar el lenguaje humano. Sin embargo, su entrenamiento genérico a menudo resulta en un rendimiento subóptimo para tareas específicas. Para superar esta limitación,…

LLM
Análisis
1 de Sep

LLM Cuota de mercado: Comparación de uso y adopción

Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo la demanda de modelos de lenguaje grandes se distribuye entre laboratorios de IA y aplicaciones de IA: Lea la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó las visitas web durante…

LLM
Análisis
1 de Sep

10+ Ejemplos de modelos de lenguaje grandes

Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…

LLM
Análisis
31 de Ago

LLM Calculadora de VRAM para alojamiento propio

Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…

LLM
Comparación de Funciones
27 de Ago

Precios de LLM: Comparativa de 15+ proveedores principales

Los precios de LLM abarcan cuatro órdenes de magnitud: los models más baratos se lanzaron por menos de $0,03 por millón de tokens, mientras que los niveles de razonamiento frontera se lanzaron hasta $262.50. El gráfico siguiente rastrea los precios de lanzamiento: cada punto es el precio promedio de los models de una clase de…