Servicios
Contáctanos

Benchmarks de LLM

Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple.

Última actualización Jun 2026
MEJOR MODELO
Claude Fable 5
Índice 92
Mejor relación calidad-precio
MiniMax M3
$0.42 / 1M
Más rápido
GPT OSS 120B
0.19s TTFT
Cobertura
64 modelos
8 benchmarks · 336 evaluaciones
Índice de Inteligencia de AIMultiple

Clasificación

Los modelos con mayor puntuación en todos los benchmarks.

Filter & Sort
#
Modelo
Índice
LegalBench
FinanceReasoning
Text-to-SQL
Agentic RAG
ARC-AGI-2
Agentic LLM Benchmark
FrontierMath
Swe-Bench
1
Claude Fable 5
Claude Fable 5
Anthropic
92
89909098-69--
2
Kimi K3
Kimi K3
Moonshot AI
88
86887793-73--
3
GPT-5.6 Sol
GPT-5.6 Sol
OpenAI
87
879074879362--
4
Grok 4.5
Grok 4.5
X
86
86887983-73--
5
GPT-5.5
GPT-5.5
OpenAI
83
87---8559--
6
GPT-5.6 Terra
GPT-5.6 Terra
OpenAI
80
858771918461--
7
GPT-5.6 Sol Pro
GPT-5.6 Sol Pro
OpenAI
80
-917996-54--
8
Claude Opus 4.6
Claude Opus 4.6
Anthropic
78
-8868806972--
9
Gemini 3 Pro Preview
Gemini 3 Pro Preview
Google
77
8786608931---
10
Gemini 3.1 Pro Preview
Gemini 3.1 Pro Preview
Google
77
87876589774627-
Página 1 de 7

Costo$20.00
Latencia3.98s
Contexto1M
TTFT3.98s
LegalBench
89
FinanceReasoning
90
Text-to-SQL
90
Agentic RAG
98
Agentic LLM Benchmark
69

Costo$6.00
Latencia252.11s
Contexto1M
TTFT252.11s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
77
Agentic RAG
93
Agentic LLM Benchmark
73

Costo$11.25
Latencia2.47s
Contexto1M
TTFT2.47s
LegalBench
87
FinanceReasoning
90
Text-to-SQL
74
Agentic RAG
87
ARC-AGI-2
93
Agentic LLM Benchmark
62

Costo$3.00
Latencia10.26s
Contexto500k
TTFT10.26s
LegalBench
86
FinanceReasoning
88
Text-to-SQL
79
Agentic RAG
83
Agentic LLM Benchmark
73

Costo$11.25
Latencia1.03s
Contexto272k
TTFT1.03s
LegalBench
87
ARC-AGI-2
85
Agentic LLM Benchmark
59

Costo$5.63
Latencia1.92s
Contexto1M
TTFT1.92s
LegalBench
85
FinanceReasoning
87
Text-to-SQL
71
Agentic RAG
91
ARC-AGI-2
84
Agentic LLM Benchmark
61

Costo$11.25
Latencia11.46s
Contexto1M
TTFT11.46s
FinanceReasoning
91
Text-to-SQL
79
Agentic RAG
96
Agentic LLM Benchmark
54

Costo$10.00
Latencia1.75s
Contexto1M
TTFT1.75s
FinanceReasoning
88
Text-to-SQL
68
Agentic RAG
80
ARC-AGI-2
69
Agentic LLM Benchmark
72

Costo$4.50
Latencia-
Contexto1M
TTFT
LegalBench
87
FinanceReasoning
86
Text-to-SQL
60
Agentic RAG
89
ARC-AGI-2
31

Costo$4.50
Latencia33.83s
Contexto1M
TTFT33.83s
LegalBench
87
FinanceReasoning
87
Text-to-SQL
65
Agentic RAG
89
ARC-AGI-2
77
Agentic LLM Benchmark
46
FrontierMath
27
Página 1 de 7

Gráficos

Modelos siguiendo "Mejor rendimiento"

Evolución en el tiempo
Índice de Inteligencia por fecha de lanzamiento del modelo
Coste frente a rendimiento
Coste combinado frente al Índice de Inteligencia
Modelo × Benchmark
Mejores modelos en los benchmarks seleccionados
Metodología

Cómo se construye el índice

El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.

Actualizaciones recientes

Actualizaciones recientes

Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.

Moonshot AI

Kimi K3

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Terra

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

OpenAI

GPT-5.6 Sol Pro

Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.

Explorar Casos de uso, análisis y comparativas del programa LLM

50+ Casos de uso de ChatGPT con ejemplos de la vida real

LLM
Análisis
6 de Jul

ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, alrededor del 10 % de la población mundial.1 OpenAI superó los 20 mil millones de dólares en ingresos anuales para 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: aumento, en el que un…

Leer más
LLM
Benchmark
2 de Jul

Comparar modelos de IA multimodal en razonamiento visual

Evaluamos 15 modelos de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos pruebas: 100 preguntas de comprensión de gráficos que evalúan la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evalúan el reconocimiento de patrones y el razonamiento espacial. Cada pregunta se…

LLM
Análisis
2 de Jul

LLM Cuota de mercado: Comparación de uso y adopción

Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo la demanda de modelos de lenguaje grandes se distribuye entre laboratorios de IA y aplicaciones de IA: Lea la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó las visitas web durante…

LLM
Comparación de Funciones
2 de Jul

Herramientas de LLMOps principales y comparación con MLOps

Las plataformas de LLMOps gestionan el aspecto operativo de ejecutar modelos de lenguaje grandes: despliegue, monitoreo, evaluación y gestión de costes. Examinamos las principales herramientas de LLMOps, sus funciones centrales, modelos de precios y cómo se diferencian entre sí para ayudar a identificar la opción más adecuada para diversos casos de uso. A continuación se…

LLM
Comparación de Funciones
29 de Jun

Comparar 9 grandes modelos de lenguaje en atención médica

Hemos comparado 9 LLMs usando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple usando una indicación estandarizada, lo que permite una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo total…

LLM
Análisis
26 de Jun

LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo

Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…

LLM
Evaluación en Mundo Abierto
25 de Jun

LLM Orquestación: 22 Frameworks y Puertas de Enlace

Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los diferentes enfoques de orquestación, realizamos pruebas de referencia: Descubre herramientas seleccionadas de orquestación de LLM, incluyendo frameworks para desarrolladores y puertas de enlace empresariales: La orquestación de LLM…

LLM
Análisis
25 de Jun

El futuro de los modelos de lenguaje grandes

Descubra el futuro de los modelos de lenguaje grandes explorando enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la especialización dispersa, que podrían abordar las limitaciones de los LLM. Comparativa de tasas de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación global de 0.748, con las variantes base…

LLM
Análisis
22 de Jun

Modelos Multimodales Grandes (LMMs) vs LLMs

Evaluamos el rendimiento de los Modelos Multimodales Grandes (LMMs) en tareas de razonamiento financiero utilizando un conjunto de datos cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los modelos para procesar y razonar con datos multimodales en el ámbito financiero. La sección de metodología ofrece información detallada…

LLM
Análisis
22 de Jun

10+ Ejemplos de modelos de lenguaje grandes

Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…

LLM
Comparación de Funciones
22 de Jun

Nube LLM vs Local LLMs: Ejemplos y beneficios

Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…