Servicios
Contáctanos

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.

MEJOR MODELO
Claude Opus 5
Índice 86
Mejor relación calidad-precio
DeepSeek V4 Flash 0731
$0.11 / 1M
Más rápido
Trinity Large Thinking
0.12s TTFT
Cobertura
151 modelos
12 benchmarks · 697 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
Agentic RAG
ARC-AGI-1
ARC-AGI-2
ArxivMath
CritPt
FinanceReasoning
FrontierMath
LegalBench
MMMU-Pro
Terminal-Bench 2.1
Terminal-Bench Hard
Text-to-SQL
1
Claude Opus 5
Claude Opus 5
Anthropic
86
-989091299073878589--
2
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
81
879893-329083878389-74
3
Claude Fable 5
Claude Fable 5
Anthropic
79
989989792990888981856390
4
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
67
919784-308771858187-71
5
Claude Opus 4.8
Claude Opus 4.8
Anthropic
66
100937271-89568479855877
6
Claude Fable 5.1
Claude Fable 5.1
Anthropic
66
-9890-31-8889-91--
7
Gemini 3.7 Flash
Gemini 3.7 Flash
Google
62
-9685-14-37878686--
8
GPT-5.5 Pro
GPT-5.5 Pro
OpenAI
62
-9785-31-78-----
9
Kimi K3
Kimi K3
Moonshot AI
61
939560-238839868285-77
10
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
60
96----9181----79
Página 1 de 16

Costo$10.00
Latencia3.83s
Contexto1M
TTFT3.83s
ARC-AGI-1
98
ARC-AGI-2
90
ArxivMath
91
CritPt
29
FinanceReasoning
90
FrontierMath
73
LegalBench
87
MMMU-Pro
85
Terminal-Bench 2.1
89

Costo$8.00
Latencia4.43s
Contexto1M
TTFT4.43s
Agentic RAG
87
ARC-AGI-1
98
ARC-AGI-2
93
CritPt
32
FinanceReasoning
90
FrontierMath
83
LegalBench
87
MMMU-Pro
83
Terminal-Bench 2.1
89
Text-to-SQL
74

Costo$20.00
Latencia5.28s
Contexto1M
TTFT5.28s
Agentic RAG
98
ARC-AGI-1
99
ARC-AGI-2
89
ArxivMath
79
CritPt
29
FinanceReasoning
90
FrontierMath
88
LegalBench
89
MMMU-Pro
81
Terminal-Bench 2.1
85
Terminal-Bench Hard
63
Text-to-SQL
90

Costo$4.50
Latencia1.92s
Contexto1M
TTFT1.92s
Agentic RAG
91
ARC-AGI-1
97
ARC-AGI-2
84
CritPt
30
FinanceReasoning
87
FrontierMath
71
LegalBench
85
MMMU-Pro
81
Terminal-Bench 2.1
87
Text-to-SQL
71

Costo$10.00
Latencia4.53s
Contexto1M
TTFT4.53s
Agentic RAG
100
ARC-AGI-1
93
ARC-AGI-2
72
ArxivMath
71
FinanceReasoning
89
FrontierMath
56
LegalBench
84
MMMU-Pro
79
Terminal-Bench 2.1
85
Terminal-Bench Hard
58
Text-to-SQL
77

Costo$20.00
Latencia5.44s
Contexto1M
TTFT5.44s
ARC-AGI-1
98
ARC-AGI-2
90
CritPt
31
FrontierMath
88
LegalBench
89
Terminal-Bench 2.1
91

Costo$1.50
Latencia6.05s
Contexto1M
TTFT6.05s
ARC-AGI-1
96
ARC-AGI-2
85
CritPt
14
FrontierMath
37
LegalBench
87
MMMU-Pro
86
Terminal-Bench 2.1
86

Costo$33.75
Latencia3.65s
Contexto1M
TTFT3.65s
ARC-AGI-1
97
ARC-AGI-2
85
CritPt
31
FrontierMath
78

Costo$5.44
Latencia0.93s
Contexto1M
TTFT0.93s
Agentic RAG
93
ARC-AGI-1
95
ARC-AGI-2
60
CritPt
23
FinanceReasoning
88
FrontierMath
39
LegalBench
86
MMMU-Pro
82
Terminal-Bench 2.1
85
Text-to-SQL
77

Costo$2.00
Latencia10.25s
Contexto1M
TTFT10.25s
Agentic RAG
96
FinanceReasoning
91
FrontierMath
81
Text-to-SQL
79
Página 1 de 16
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

Cada benchmark se convierte en una posición de 0 a 100, y el índice es la media ponderada de esas posiciones. Un benchmark en el que un modelo no se ha evaluado cuenta como la media del conjunto, de modo que las puntuaciones siguen siendo comparables. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).

AIMultiple
Agentic RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
Público
ARC-AGI-1Razonamiento abstracto con pocos ejemplos sobre transformaciones de cuadriculas; el primer benchmark de ARC Prize.
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
ArxivMathProblemas matematicos recientes de arXiv, ejecutados poco despues de su publicacion para limitar la contaminacion.
Público
BioMysteryBenchBenchmark de Anthropic sobre si los agentes pueden resolver misterios bioinformaticos reales a partir de datos brutos.
Público
CritPtProblemas de fisica de nivel de investigacion que requieren derivaciones de varios pasos.
AIMultiple
FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
Público
Frontier-BenchTareas de software agenticas sobre repositorios de frontera, puntuadas por tasa de resolucion.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
MMMU-ProComprension multimodal de nivel universitario entre disciplinas, reforzada contra atajos de solo texto.
Público
Terminal-Bench 2.1Tareas agenticas de terminal en ingenieria de software, datos y administracion de sistemas.
Público
Terminal-Bench HardEl subconjunto dificil de Terminal-Bench: tareas de software de varios pasos resueltas en una terminal real.
Público
Terminal-Bench-ScienceTareas de terminal extraidas de flujos de trabajo reales de computacion cientifica.
AIMultiple
Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Google

Gemini 3.8 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Anthropic

Claude Fable 5.1

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Tencent

Hy4 preview

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Z AI

GLM 5.3 Flash

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de modelos de IAÚltimos 12 modelos en 20 días

Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 20 días.

Proveedor
OpenAI
OpenAI
04 Sep 2026
GPT-6 Astra +1 másGPT-6 AstraGPT-6 Astra Pro
Alibaba Cloud
Alibaba Cloud
26 Ago 2026
Qwen3.8 Flash
03 Sep 2026
Qwen3.8 Max (0902)
Google
Google
02 Sep 2026
Gemini 3.8 Flash
Meta
Meta
21 Ago 2026
Muse Spark 1.2 Contributor
02 Sep 2026
Muse Spark 1.3 +1 másMuse Spark 1.3Muse Spark 1.3 Contributor
Anthropic
Anthropic
01 Sep 2026
Claude Fable 5.1
Tencent
Tencent
28 Ago 2026
Hy4 preview
Z AI
Z AI
18 Ago 2026
GLM 5.3
26 Ago 2026
GLM 5.3 Flash

Explorar Casos de uso, análisis y comparativas del programa LLM

LLM Automatización: Top 7 herramientas y 8 casos de estudio

LLM
Análisis
27 de Ago

La automatización de LLM se refiere al cambio hacia herramientas de automatización inteligentes que aprovechan LLMs, incluidos los agentes de IA, los LLMs ajustados y los modelos RAG para automatizar y coordinar tareas. Descubra qué es la automatización de LLM, sus principales aplicaciones en la vida real y las principales herramientas: Los grandes modelos de…

Leer más
LLM
Evaluación en Mundo Abierto
26 de Ago

LLM Orquestación: 22 frameworks y pasarelas

Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los distintos enfoques de orquestación, realizamos benchmarks: Descubra herramientas seleccionadas de orquestación de LLM, incluidos los frameworks para desarrolladores y las pasarelas empresariales: La orquestación de LLM consiste en…

LLM
Benchmark
24 de Ago

AIM Enterprise: Benchmark empresarial agéntico

Las empresas usan LLM a diario para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales reales de estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo y a menudo no coincidieron. En aproximadamente un tercio de las puntuaciones…

LLM
Benchmark
24 de Ago

Text-to-SQL: Comparación de la precisión de los LLM

Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…

LLM
Análisis
21 de Ago

LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo

Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…

LLM
Benchmark
21 de Ago

HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo

HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…

LLM
Comparación de Funciones
21 de Ago

Principales herramientas de LLMOps y compáralas con MLOps

Las plataformas de LLMOps se encargan del aspecto operativo de la ejecución de LLMs: despliegue, monitoreo, evaluación y gestión de costes. Analizamos las principales herramientas de LLMOps, sus funciones clave, sus esquemas de precios y en qué se diferencian entre sí para ayudar a identificar la mejor opción para distintos casos de uso. A continuación…

LLM
Análisis
19 de Ago

50+ Casos de uso de ChatGPT con ejemplos reales

ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, aproximadamente el 10 % de la población mundial.1 OpenAI superó los $20 mil millones en ingresos anuales en 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: el aumento, en el que un humano…

LLM
Análisis
19 de Ago

ChatGPT para Atención al Cliente: Los 10 Principales Casos de Uso

ChatGPT ha pasado de ser una novedad a ser infraestructura en atención al cliente. Las empresas lo utilizan para reducir los tiempos de respuesta, gestionar el volumen que sus equipos no pueden absorber y reducir el coste de las interacciones rutinarias. Pero los resultados varían enormemente según cómo se implemente. OpenAI lanzó GPT-5.6, un model…

LLM
Análisis
18 de Ago

El futuro de los large language models

Vea el futuro de los large language models adentrándose en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…

LLM
Benchmark
16 de Ago

Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos

Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference). Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos: Consulte…