El modelo más reciente del Índice de Inteligencia de AIMultiple es Kimi K3.
Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | LegalBench | FinanceReasoning | Text-to-SQL | Agentic RAG | ARC-AGI-2 | Agentic LLM Benchmark | FrontierMath | Swe-Bench |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 Anthropic | 92 | 89 | 90 | 90 | 98 | - | 69 | - | - |
| 2 | Kimi K3 Moonshot AI | 88 | 86 | 88 | 77 | 93 | - | 73 | - | - |
| 3 | GPT-5.6 Sol OpenAI | 87 | 87 | 90 | 74 | 87 | 93 | 62 | - | - |
| 4 | Grok 4.5 X | 86 | 86 | 88 | 79 | 83 | - | 73 | - | - |
| 5 | GPT-5.5 OpenAI | 83 | 87 | - | - | - | 85 | 59 | - | - |
| 6 | GPT-5.6 Terra OpenAI | 80 | 85 | 87 | 71 | 91 | 84 | 61 | - | - |
| 7 | GPT-5.6 Sol Pro OpenAI | 80 | - | 91 | 79 | 96 | - | 54 | - | - |
| 8 | Claude Opus 4.6 Anthropic | 78 | - | 88 | 68 | 80 | 69 | 72 | - | - |
| 9 | Gemini 3 Pro Preview Google | 77 | 87 | 86 | 60 | 89 | 31 | - | - | - |
| 10 | Gemini 3.1 Pro Preview Google | 77 | 87 | 87 | 65 | 89 | 77 | 46 | 27 | - |
Página 1 de 7 | ||||||||||
Cómo se construye el índice
El Índice de Inteligencia normaliza cada benchmark a una escala de 0 a 100 y promedia la posición relativa de un modelo en los benchmarks en los que se evaluó. Cada benchmark a continuación alimenta esa puntuación.
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Kimi K3
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Terra
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-5.6 Sol Pro
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 41 días.
Explorar Casos de uso, análisis y comparativas del programa LLM
LLM Automatización: Las 7 mejores herramientas y 8 casos prácticos
LLM La automatización se refiere al cambio hacia herramientas de automatización inteligente que aprovechan los LLMs, incluidos los agentes de IA, los LLMs con fine-tuning y los modelos RAG para automatizar y coordinar tareas. Descubra qué es la automatización con LLM, sus principales aplicaciones reales y las principales herramientas: Los grandes modelos de lenguaje en…
Modelos multimodales grandes (LMMs) frente a LLMs
Evaluamos el rendimiento de los modelos multimodales grandes (LMMs) en tareas de razonamiento financiero utilizando un dataset cuidadosamente seleccionado. Al analizar un subconjunto de muestras financieras de alta calidad, evaluamos las capacidades de los modelos para procesar y razonar con datos multimodales en el ámbito financiero. La sección de metodología ofrece información detallada sobre el…
Comparativa de 9 modelos de lenguaje de gran tamaño en atención médica
Evaluamos 9 LLMs utilizando el dataset MedQA, un benchmark de examen clínico de nivel de posgrado derivado de preguntas del USMLE. Cada modelo respondió los mismos escenarios clínicos de opción múltiple mediante un prompt estandarizado, lo que permitió una comparación directa de la precisión. También registramos la latencia por pregunta dividiendo el tiempo total de…
Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos
Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference). Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos: Consulte…
50+ Casos de uso de ChatGPT con ejemplos reales
ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, aproximadamente el 10 % de la población mundial.1 OpenAI superó los $20 mil millones en ingresos anuales en 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: el aumento, en el que un humano…
Benchmark de 40+ LLMs en Finanzas: Claude Fable 5 y GPT-5.6 Sol
Evaluamos LLMs en 238 preguntas difíciles del benchmark FinanceReasoning (Tang et al.).1 Este subconjunto se centra en las tareas de razonamiento financiero más desafiantes, evaluando el razonamiento cuantitativo complejo de varios pasos que involucra conceptos y fórmulas financieras. Nuestra evaluación empleó un diseño de prompt personalizado y criterios de puntuación de precisión y consumo de…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas utilizan LLMs a diario para sus tareas habituales. Para encontrar los LLMs más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales en diferentes categorías. Cada modelo entregó un archivo por tarea. Las puntuaciones son relativas: los jueces clasifican cada respuesta frente a las demás respuestas de la misma…
LLM Leyes de escalado: análisis de investigadores de IA
Large language models predicen el siguiente token a partir de patrones aprendidos de datos de texto. El término leyes de escalado de LLM se refiere a regularidades empíricas que vinculan el rendimiento de los model con la cantidad de cómputo, datos de entrenamiento y parámetros de los model utilizados durante el entrenamiento. Para comprender cómo…
LLM Herramientas de observabilidad: Weights & Biases, Langsmith
Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…
LLM Comparativa de latencia por casos de uso
Evaluamos 11 modelos de lenguaje grandes principales con un total de 1.320 solicitudes, dividiendo modelos de razonamiento y no razonamiento, y medimos la latencia del primer token, la latencia por token y el tiempo de respuesta total. Puede encontrar detalles sobre cómo medimos la latencia aquí. Presentamos por separado los modelos con razonamiento y sin…