Servicios
Contáctanos

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.

MEJOR MODELO
Claude Opus 5
Índice 86
Mejor relación calidad-precio
DeepSeek V4 Flash 0731
$0.11 / 1M
Más rápido
Trinity Large Thinking
0.12s TTFT
Cobertura
151 modelos
12 benchmarks · 697 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Página 1 de 16

Costo$10.00
Latencia3.83s
Contexto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Costo$8.00
Latencia4.43s
Contexto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Costo$20.00
Latencia5.28s
Contexto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Costo$4.50
Latencia1.92s
Contexto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Costo$10.00
Latencia4.53s
Contexto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Costo$20.00
Latencia5.44s
Contexto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Costo$1.50
Latencia6.05s
Contexto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Costo$33.75
Latencia3.65s
Contexto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Costo$5.44
Latencia0.93s
Contexto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Costo$2.00
Latencia10.25s
Contexto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Página 1 de 16
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

Cada benchmark se convierte en una posición de 0 a 100, y el índice es la media ponderada de esas posiciones. Un benchmark en el que un modelo no se ha evaluado cuenta como la media del conjunto, de modo que las puntuaciones siguen siendo comparables. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
Público
ARC-AGI-1Razonamiento abstracto con pocos ejemplos sobre transformaciones de cuadriculas; el primer benchmark de ARC Prize.
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
ArxivMathProblemas matematicos recientes de arXiv, ejecutados poco despues de su publicacion para limitar la contaminacion.
Público
BioMysteryBenchBenchmark de Anthropic sobre si los agentes pueden resolver misterios bioinformaticos reales a partir de datos brutos.
Público
CritPtProblemas de fisica de nivel de investigacion que requieren derivaciones de varios pasos.
AIMultiple
FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
Público
Frontier-BenchTareas de software agenticas sobre repositorios de frontera, puntuadas por tasa de resolucion.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
MMMU-ProComprension multimodal de nivel universitario entre disciplinas, reforzada contra atajos de solo texto.
Público
Terminal-Bench 2.1Tareas agenticas de terminal en ingenieria de software, datos y administracion de sistemas.
Público
Terminal-Bench HardEl subconjunto dificil de Terminal-Bench: tareas de software de varios pasos resueltas en una terminal real.
Público
Terminal-Bench-ScienceTareas de terminal extraidas de flujos de trabajo reales de computacion cientifica.
AIMultiple
Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Google

Gemini 3.8 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Anthropic

Claude Fable 5.1

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Tencent

Hy4 preview

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Z AI

GLM 5.3 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de modelos de IAÚltimos 12 modelos en 23 días

Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 23 días.

Proveedor
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 másGPT-6 AstraGPT-6 Astra Pro
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 másMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Alibaba Cloud
Alibaba Cloud
14 Ago 2026
Qwen3.8 27B
26 Ago 2026
Qwen3.8 Flash
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Explorar Casos de uso, análisis y comparativas del programa LLM

Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol

LLM
Benchmark
14 de Ago

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de…

Leer más
LLM
Benchmark
12 de Ago

LLM Comparativa de latencia por casos de uso

Evaluamos 11 modelos de lenguaje grandes principales con un total de 1.320 solicitudes, dividiendo modelos de razonamiento y no razonamiento, y medimos la latencia del primer token, la latencia por token y el tiempo de respuesta total. Puede encontrar detalles sobre cómo medimos la latencia aquí. Presentamos por separado los modelos con razonamiento y sin…

LLM
Benchmark
11 de Ago

Agentic IT: Can LLMs Design a Benchmark

We gave 12 large language models the job a benchmark team does: invent a benchmark, build it, run four models through it, and report the results. Each did it twice. None of the 24 attempts passed every criterion, and six of the rubric’s checks were passed by none of them. The two topics are text-to-SQL,…

LLM
Benchmark
4 de Ago

Comparativa de Models de IA Multimodal en Razonamiento Visual

Realizamos un benchmark de 15 models de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos áreas: 100 preguntas de comprensión de gráficos que evaluaban la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evaluaban el reconocimiento de patrones y el razonamiento espacial.…

LLM
Benchmark
2 de Ago

Pasarelas de IA para OpenAI: Alternativas a OpenRouter

Realizamos un benchmark de OpenRouter, SambaNova, TogetherAI, Groq y IA/ML API en tres indicadores (latencia del primer token, latencia total y cantidad de tokens de salida), con 300 pruebas utilizando prompts cortos (aprox. 18 tokens) y prompts largos (aprox. 203 tokens) para la latencia total. Si planea usar una de estas pasarelas de IA, puede:…

LLM
Benchmark
5 de Jun

Modelos de Lenguaje Grandes en Ciberseguridad

Evaluar 7 modelos de lenguaje grandes en 9 dominios de ciberseguridad utilizando SecBench, un benchmark a gran escala y de múltiples formatos para tareas de seguridad. Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), cubriendo áreas como seguridad de datos, gestión de identidad y acceso, seguridad…

LLM
Benchmark
15 de Abr

LLM Cuantización: BF16 vs FP8 vs INT4

Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2.000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…