Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple.
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Gráficos
Modelos siguiendo "Mejor rendimiento"
Cómo se construye el índice
El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Kimi K3
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Terra
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol Pro
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Explorar Casos de uso, análisis y comparativas del programa LLM
Comparar modelos de IA multimodal en razonamiento visual
Evaluamos 15 modelos de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos pruebas: 100 preguntas de comprensión de gráficos que evalúan la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evalúan el reconocimiento de patrones y el razonamiento espacial. Cada pregunta se…
LLM Cuota de mercado: Comparación de uso y adopción
Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo la demanda de modelos de lenguaje grandes se distribuye entre laboratorios de IA y aplicaciones de IA: Lea la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó las visitas web durante…
Herramientas de LLMOps principales y comparación con MLOps
Las plataformas de LLMOps gestionan el aspecto operativo de ejecutar modelos de lenguaje grandes: despliegue, monitoreo, evaluación y gestión de costes. Examinamos las principales herramientas de LLMOps, sus funciones centrales, modelos de precios y cómo se diferencian entre sí para ayudar a identificar la opción más adecuada para diversos casos de uso. A continuación se…
Comparar 9 grandes modelos de lenguaje en atención médica
Hemos comparado 9 LLMs usando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple usando una indicación estandarizada, lo que permite una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo total…
LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo
Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…
LLM Orquestación: 22 Frameworks y Puertas de Enlace
Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los diferentes enfoques de orquestación, realizamos pruebas de referencia: Descubre herramientas seleccionadas de orquestación de LLM, incluyendo frameworks para desarrolladores y puertas de enlace empresariales: La orquestación de LLM…
El futuro de los modelos de lenguaje grandes
Descubra el futuro de los modelos de lenguaje grandes explorando enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la especialización dispersa, que podrían abordar las limitaciones de los LLM. Comparativa de tasas de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación global de 0.748, con las variantes base…
Modelos Multimodales Grandes (LMMs) vs LLMs
Evaluamos el rendimiento de los Modelos Multimodales Grandes (LMMs) en tareas de razonamiento financiero utilizando un conjunto de datos cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los modelos para procesar y razonar con datos multimodales en el ámbito financiero. La sección de metodología ofrece información detallada…
10+ Ejemplos de modelos de lenguaje grandes
Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…
Nube LLM vs Local LLMs: Ejemplos y beneficios
Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…