Servicios
Contáctanos

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.

MEJOR MODELO
Claude Fable 5
Índice 92
Mejor relación calidad-precio
MiniMax M3
$0.42 / 1M
Más rápido
GPT OSS 120B
0.23s TTFT
Cobertura
64 modelos
8 benchmarks · 336 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Costo$20.00
Latencia4.02s
Contexto1M
TTFT4.02s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latencia2.93s
Contexto1M
TTFT2.93s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latencia4.31s
Contexto1M
TTFT4.31s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latencia7.25s
Contexto500k
TTFT7.25s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latencia0.70s
Contexto272k
TTFT0.70s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$4.50
Latencia1.62s
Contexto1M
TTFT1.62s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latencia11.11s
Contexto1M
TTFT11.11s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latencia1.71s
Contexto1M
TTFT1.71s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latencia-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latencia22.02s
Contexto1M
TTFT22.02s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7
Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.

AIMultiple
FinanceReasoningRazonamiento financiero complejo de varios pasos en 238 preguntas difíciles de FinanceReasoning.
AIMultiple
Text-to-SQLPrecisión en la generación de consultas SQL a partir de lenguaje natural en más de 35 LLM.
AIMultiple
Agentic RAGEnrutamiento multibase de datos y generación de consultas SQL en 5 bases de datos (BIRD-SQL, 500 preguntas).
AIMultiple
AI MemoryRecuperación de datos numéricos en contextos largos según la posición en el documento (100 elementos, 14 transcripciones).
AIMultiple
AI HallucinationResistencia a inventar métricas no mencionadas en documentos de contexto largo (204 trampas, 14 transcripciones).
Público
Humanity's Last ExamRazonamiento a libro cerrado de nivel experto en más de 100 materias académicas (2,5k preguntas).
Público
SciCodeProgramación científica de nivel de investigación en física, matemáticas, biología y química (338 subproblemas)
Público
LegalBenchRazonamiento jurídico colaborativo en 162 tareas creadas por profesionales del derecho.
Público
FrontierMathProblemas matemáticos de investigación inéditos, redactados por expertos (niveles 1–4).
Público
ARC-AGI-2Nuevos rompecabezas de razonamiento visual que evalúan la generalización, no la memorización.
Público
Swe-BenchIssues reales de GitHub resueltos de principio a fin (conjunto completo de 2.294 instancias).
Público
LiveCodeBenchProblemas de programación competitiva sin contaminación y actualizados continuamente.
AIMultiple
Agentic LLM BenchmarkProgramación agéntica en 10 tareas de desarrollo de software mediante una herramienta CLI (~3.500 pasos de validación).
Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Moonshot AI

Kimi K3

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Terra

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Explorar Casos de uso, análisis y comparativas del programa LLM

LLM Cuota de mercado: Comparación de uso y adopción

LLM
Análisis
2 de Jul

Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo la demanda de modelos de lenguaje grandes se distribuye entre laboratorios de IA y aplicaciones de IA: Lea la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó las visitas web durante…

Leer más
LLM
Análisis
26 de Jun

LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo

Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…

LLM
Análisis
25 de Jun

El futuro de los modelos de lenguaje grandes

Descubra el futuro de los modelos de lenguaje grandes explorando enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la especialización dispersa, que podrían abordar las limitaciones de los LLM. Comparativa de tasas de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación global de 0.748, con las variantes base…

LLM
Análisis
22 de Jun

10+ Ejemplos de modelos de lenguaje grandes

Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…

LLM
Comparación de Funciones
22 de Jun

Nube LLM vs Local LLMs: Ejemplos y beneficios

Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…

LLM
Benchmark
5 de Jun

Modelos de Lenguaje Grandes en Ciberseguridad

Evaluar 7 modelos de lenguaje grandes en 9 dominios de ciberseguridad utilizando SecBench, un benchmark a gran escala y de múltiples formatos para tareas de seguridad. Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), cubriendo áreas como seguridad de datos, gestión de identidad y acceso, seguridad…

LLM
Benchmark
15 de Abr

LLM Cuantización: BF16 vs FP8 vs INT4

Hemos realizado un benchmark de Qwen3-32B en 4 niveles de precisión (BF16, FP8, GPTQ-Int8, GPTQ-Int4) en una sola NVIDIA H100 80GB GPU. Cada configuración fue evaluada en 2 benchmarks (~12.2K preguntas) que cubren conocimiento y generación de código, además de 2.000+ ejecuciones de inferencia para medir el rendimiento. Int4 es 2.7x más rápido que BF16…