Servicios
Contáctanos

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.

MEJOR MODELO
Claude Fable 5
Índice 92
Mejor relación calidad-precio
MiniMax M3
$0.42 / 1M
Más rápido
GPT OSS 120B
0.23s TTFT
Cobertura
64 modelos
8 benchmarks · 336 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Costo$20.00
Latencia4.02s
Contexto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latencia2.93s
Contexto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latencia4.31s
Contexto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latencia7.25s
Contexto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latencia0.70s
Contexto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$4.50
Latencia1.62s
Contexto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latencia11.11s
Contexto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latencia1.71s
Contexto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latencia-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latencia22.02s
Contexto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.

AIMultiple
FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
AIMultiple
Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
AIMultiple
Agentic RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
AIMultiple
AI MemoryRecuperación de datos numéricos en contextos largos según la posición en el documento (100 elementos, 14 transcripciones).
AIMultiple
AI HallucinationResistencia a inventar métricas no mencionadas en documentos de contexto largo (204 trampas, 14 transcripciones).
Público
Humanity's Last ExamRazonamiento a libro cerrado de nivel experto en más de 100 materias académicas (2,5k preguntas).
Público
SciCodeProgramación científica de nivel de investigación en física, matemáticas, biología y química (338 subproblemas)
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
Swe-BenchIssues reales de GitHub resueltos de principio a fin (conjunto completo de 2.294 instancias).
Público
LiveCodeBenchProblemas de programación competitiva sin contaminación y actualizados continuamente.
AIMultiple
Agentic LLM BenchmarkProgramación agéntica en 10 tareas de desarrollo de software mediante una herramienta CLI (~3.500 pasos de validación).
Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Moonshot AI

Kimi K3

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Terra

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Cronología de lanzamientos de modelos de IAÚltimos 15 modelos en 41 días

Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 41 días.

Proveedor
Google
Google
21 Jul 2026
Gemini 3.5 Flash Lite +1 másGemini 3.5 Flash LiteGemini 3.6 Flash
13 Ago 2026
Gemini 3.7 Flash
Meta
Meta
16 Jul 2026
Muse Spark 1.1
05 Ago 2026
Muse Spark 1.2
09 Ago 2026
Muse Glimmer 30B
Anthropic
Anthropic
24 Jul 2026
Claude Opus 5
Moonshot AI
Moonshot AI
16 Jul 2026
Kimi K3
OpenAI
OpenAI
09 Jul 2026
GPT-5.6 Luna +5 másGPT-5.6 LunaGPT-5.6 Luna ProGPT-5.6 SolGPT-5.6 Sol ProGPT-5.6 TerraGPT-5.6 Terra Pro
X
X
08 Jul 2026
Grok 4.5

Explorar Casos de uso, análisis y comparativas del programa LLM

ChatGPT para Atención al Cliente: Los 10 Principales Casos de Uso

LLM
Análisis
18 de Ago

ChatGPT ha pasado de ser una novedad a ser infraestructura en atención al cliente. Las empresas lo utilizan para reducir los tiempos de respuesta, gestionar el volumen que sus equipos no pueden absorber y reducir el coste de las interacciones rutinarias. Pero los resultados varían enormemente según cómo se implemente. OpenAI lanzó GPT-5.6, un model…

Leer más
LLM
Análisis
17 de Ago

LLM Automatización: Las 7 mejores herramientas y 8 casos prácticos

LLM La automatización se refiere al cambio hacia herramientas de automatización inteligente que aprovechan los LLMs, incluidos los agentes de IA, los LLMs con fine-tuning y los modelos RAG para automatizar y coordinar tareas. Descubra qué es la automatización con LLM, sus principales aplicaciones reales y las principales herramientas: Los grandes modelos de lenguaje en…

LLM
Análisis
17 de Ago

Modelos multimodales grandes (LMMs) frente a LLMs

Evaluamos el rendimiento de los modelos multimodales grandes (LMMs) en tareas de razonamiento financiero utilizando un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los modelos para procesar y razonar con datos multimodales en el ámbito financiero. La sección de metodología ofrece información detallada sobre el…

LLM
Comparación de Funciones
17 de Ago

Comparativa de 9 modelos de lenguaje de gran tamaño en atención médica

Evaluamos 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permitió una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo total de…

LLM
Benchmark
16 de Ago

Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos

Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference). Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos: Consulte…

LLM
Análisis
14 de Ago

50+ Casos de uso de ChatGPT con ejemplos reales

ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, aproximadamente el 10 % de la población mundial.1 OpenAI superó los $20 mil millones en ingresos anuales en 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: el aumento, en el que un humano…

LLM
Benchmark
14 de Ago

Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol

Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de…

LLM
Benchmark
14 de Ago

AIM Enterprise: Benchmark empresarial agéntico

Las empresas utilizan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales en diferentes categorías. Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las demás respuestas de la misma…

LLM
Análisis
13 de Ago

LLM Leyes de escalado: análisis de investigadores de IA

Large language models predicen el siguiente token a partir de patrones aprendidos de datos de texto. El término leyes de escalado de LLM se refiere a regularidades empíricas que vinculan el rendimiento de los model con la cantidad de cómputo, datos de entrenamiento y parámetros de los model utilizados durante el entrenamiento. Para comprender cómo…

LLM
Análisis
13 de Ago

LLM Herramientas de observabilidad: Weights & Biases, Langsmith

Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…

LLM
Benchmark
12 de Ago

LLM Comparativa de latencia por casos de uso

Evaluamos 11 modelos de lenguaje grandes principales con un total de 1.320 solicitudes, dividiendo modelos de razonamiento y no razonamiento, y medimos la latencia del primer token, la latencia por token y el tiempo de respuesta total. Puede encontrar detalles sobre cómo medimos la latencia aquí. Presentamos por separado los modelos con razonamiento y sin…