El modelo más reciente del Índice de Inteligencia de AIMultiple es Claude Opus 5.5.
Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Cómo se construye el índice
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-Text-to-SQL | ARC-AGI-3 | CritPt | FrontierMath | IFBench | MMMU-Pro | SciCode | Terminal-Bench 2.1 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 76 | 90 | 92 | 88 | - | 32 | - | - | 88 | 67 | - |
| 2 | GPT-6 Astra OpenAI | 74 | 84 | 87 | 66 | 63 | 32 | 98 | - | 87 | 56 | 90 |
| 3 | Claude Fable 5.1 Anthropic | 73 | 84 | 90 | 67 | - | 31 | 88 | - | - | 63 | 91 |
| 4 | Qwen3.8 Flash Alibaba Cloud | 71 | - | - | - | - | - | - | 81 | - | 47 | 86 |
| 5 | Muse Spark 1.1 Meta | 68 | - | - | - | - | - | - | - | - | 58 | 78 |
| 6 | Claude Opus 5 Anthropic | 67 | 85 | 90 | 64 | 30 | 29 | 73 | - | 85 | 56 | 89 |
| 7 | Qwen3.8 Max Alibaba Cloud | 66 | 83 | - | 51 | - | - | 46 | - | 82 | 53 | 81 |
| 8 | GPT-5.6 Sol OpenAI | 65 | 77 | 90 | 54 | 8 | 32 | 83 | 73 | 83 | 57 | 90 |
| 9 | Kimi K3 Moonshot AI | 63 | 83 | 88 | 48 | - | 23 | 39 | - | 81 | 59 | 85 |
| 10 | Gemini 3.7 Flash Google | 63 | 85 | - | 72 | - | 14 | 37 | - | 86 | 60 | 86 |
Cómo se construye el índice
El índice es la media de las puntuaciones de un modelo en los benchmarks listados abajo, sobre los que realmente ha ejecutado: un benchmark que nunca ejecutó no cuenta como cero, simplemente no está. Todos los benchmarks del índice cuentan por igual. Un benchmark que ya da un porcentaje de 0 a 100 se usa tal cual; uno en otra escala se reescala primero a 0-100. Un modelo necesita resultados en al menos dos benchmarks del índice para ser clasificado, de modo que un único resultado no le da una posición propia. Como las puntuaciones se usan tal cual, un benchmark que todo el campo encuentra difícil baja todas las puntuaciones en él, y un modelo medido en benchmarks más difíciles lo arrastra a su media.
Benchmarks que usamos
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Claude Opus 5.5
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-6 Sol
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-6 Luna
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Grok 4.7
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Explorar Casos de uso, análisis y comparativas del programa LLM
LLM Cuota de mercado: compara uso y adopción
Analizamos la cuota de mercado de LLM combinando datos basados en uso y estimaciones de visitas web para mostrar cómo se distribuye la demanda de modelos de lenguaje de gran tamaño entre los laboratorios de IA y las aplicaciones de IA. Lee la metodología para ver cómo medimos y calculamos estos resultados. Estados Unidos dominó…
Benchmark de 40+ LLMs en finanzas: Claude Fable 5 y GPT-5.6 Sol
Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto aborda las tareas de razonamiento financiero más desafiantes, evaluando razonamiento cuantitativo complejo de múltiples pasos que implica conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de exactitud y consumo de tokens. Para una…
Comparativa de Models de IA Multimodal en Razonamiento Visual
Realizamos un benchmark de 15 models de IA multimodal líderes en razonamiento visual utilizando 200 preguntas basadas en imágenes. La evaluación consistió en dos áreas: 100 preguntas de comprensión de gráficos que evaluaban la interpretación de visualizaciones de datos, y 100 preguntas de lógica visual que evaluaban el reconocimiento de patrones y el razonamiento espacial.…
Grandes models multimodales (LMMs) vs LLMs
Evaluamos el rendimiento de los grandes models multimodales (LMMs) en tareas de razonamiento financiero mediante un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los models para procesar y razonar con datos multimodales en el dominio financiero. La sección de metodología ofrece información detallada sobre el…
LLM Calculadora de VRAM para alojamiento propio
Alojar por tu cuenta un LLM implica ejecutar la inferencia en hardware que controla el operador, en lugar de a través de una API de terceros, lo que cambia el coste, el control de los datos y el perfil de privacidad. El hecho de que un modelo pueda ejecutarse depende de la memoria. La calculadora…
TI agéntica: ¿Pueden los agentes de IA diseñar un benchmark?
Probamos 16 modelos en un diseño de benchmark de texto a SQL y llamada de herramientas. Cada modelo creó un benchmark por tema, para un total de 32 envíos. Ningún envío superó todos los criterios de la rúbrica. Los agentes pudieron construir y ejecutar pruebas, pero ninguno demostró a la vez una prueba de respuesta…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM todos los días para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde usamos 69 tareas empresariales reales en estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo que superó las comprobaciones. En el 32,7 % de las puntuaciones individuales,…
El futuro de los Large Language Models
Vea el futuro de los large language models profundizando en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa, que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…
Modelos de lenguaje de gran tamaño en ciberseguridad
Evaluamos 7 grandes modelos de lenguaje en 9 dominios de ciberseguridad usando SecBench, un benchmark a gran escala y multiformato para tareas de seguridad. Probamos cada modelo con 44.823 preguntas de opción múltiple (MCQs) y 3.087 preguntas de respuesta corta (SAQs), que abarcan seguridad de datos, gestión de identidades y accesos, seguridad de redes, gestión…
LLM leyes de escalado: análisis de investigadores de IA
Los modelos de lenguaje de gran tamaño predicen el siguiente token basándose en patrones aprendidos de los datos de texto. El término LLM leyes de escalado se refiere a las regularidades empíricas que vinculan el rendimiento del modelo con la cantidad de cómputo, los datos de entrenamiento y los parámetros del modelo utilizados durante el…