El modelo más reciente del Índice de Inteligencia de AIMultiple es Gemini 3.8 Flash.
Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Ver la metodología.
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | Agentic RAG | ARC-AGI-1 | ARC-AGI-2 | ArxivMath | CritPt | FinanceReasoning | FrontierMath | LegalBench | MMMU-Pro | Terminal-Bench 2.1 | Terminal-Bench Hard | Text-to-SQL |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 Anthropic | 86 | - | 98 | 90 | 91 | 29 | 90 | 73 | 87 | 85 | 89 | - | - |
| 2 | GPT-5.6 Sol OpenAI | 81 | 87 | 98 | 93 | - | 32 | 90 | 83 | 87 | 83 | 89 | - | 74 |
| 3 | Claude Fable 5 Anthropic | 79 | 98 | 99 | 89 | 79 | 29 | 90 | 88 | 89 | 81 | 85 | 63 | 90 |
| 4 | GPT-5.6 Terra OpenAI | 67 | 91 | 97 | 84 | - | 30 | 87 | 71 | 85 | 81 | 87 | - | 71 |
| 5 | Claude Opus 4.8 Anthropic | 66 | 100 | 93 | 72 | 71 | - | 89 | 56 | 84 | 79 | 85 | 58 | 77 |
| 6 | Claude Fable 5.1 Anthropic | 66 | - | 98 | 90 | - | 31 | - | 88 | 89 | - | 91 | - | - |
| 7 | Gemini 3.7 Flash Google | 62 | - | 96 | 85 | - | 14 | - | 37 | 87 | 86 | 86 | - | - |
| 8 | GPT-5.5 Pro OpenAI | 62 | - | 97 | 85 | - | 31 | - | 78 | - | - | - | - | - |
| 9 | Kimi K3 Moonshot AI | 61 | 93 | 95 | 60 | - | 23 | 88 | 39 | 86 | 82 | 85 | - | 77 |
| 10 | GPT-5.6 Sol Pro OpenAI | 60 | 96 | - | - | - | - | 91 | 81 | - | - | - | - | 79 |
Cómo se construye el índice
Cada benchmark se convierte en una posición de 0 a 100, y el índice es la media ponderada de esas posiciones. Un benchmark en el que un modelo no se ha evaluado cuenta como la media del conjunto, de modo que las puntuaciones siguen siendo comparables. Índice = Terminal-Bench-Science (14%) + FrontierMath (12%) + Frontier-Bench (12%) + ArxivMath (10%) + MMMU-Pro (9%) + ARC-AGI-2 (8%) + CritPt (6%) + FinanceReasoning (5%) + Text-to-SQL (5%) + BioMysteryBench (5%) + ARC-AGI-1 (5%) + Terminal-Bench 2.1 (3%) + Agentic RAG (3%) + Terminal-Bench Hard (2%) + LegalBench (1%).
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Gemini 3.8 Flash
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Claude Fable 5.1
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Hy4 preview
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GLM 5.3 Flash
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Principales lanzamientos de modelos de IA de los proveedores líderes en los últimos 20 días.
Explorar Casos de uso, análisis y comparativas del programa LLM
LLM Orquestación: 22 frameworks y pasarelas
Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los distintos enfoques de orquestación, realizamos benchmarks: Descubra herramientas seleccionadas de orquestación de LLM, incluidos los frameworks para desarrolladores y las pasarelas empresariales: La orquestación de LLM consiste en…
AIM Enterprise: Benchmark empresarial agéntico
Las empresas usan LLM a diario para sus tareas habituales. Para encontrar los LLM más rentables, diseñamos AIM Enterprise, un benchmark empresarial agéntico, donde utilizamos 69 tareas empresariales reales de estrategia, marketing, RR. HH., ventas y operaciones. Dos modelos jueces puntuaron cada archivo y a menudo no coincidieron. En aproximadamente un tercio de las puntuaciones…
Text-to-SQL: Comparación de la precisión de los LLM
Ejecutamos 36 grandes modelos de lenguaje sobre 759 preguntas de BIRD-SQL; cada modelo escribió SQL contra una base de datos que tuvo que identificar por sí mismo entre 11 candidatas. Todas las consultas analizables se ejecutaron contra la base de datos real y su conjunto de resultados se comparó con el conjunto de resultados de…
LLM Parámetros: GPT-5 High, Medio, Bajo y Mínimo
Algunos LLM, como la familia GPT-5 de OpenAI, vienen en diferentes versiones (por ejemplo, GPT-5, GPT-5-mini y GPT-5-nano) y con varios ajustes de parámetros, incluyendo alto, medio, bajo y mínimo. A continuación, exploramos las diferencias entre estas versiones de modelo comparando su rendimiento en benchmarks y los costes para ejecutar dichos benchmarks. Utilizamos la familia…
HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…
Principales herramientas de LLMOps y compáralas con MLOps
Las plataformas de LLMOps se encargan del aspecto operativo de la ejecución de LLMs: despliegue, monitoreo, evaluación y gestión de costes. Analizamos las principales herramientas de LLMOps, sus funciones clave, sus esquemas de precios y en qué se diferencian entre sí para ayudar a identificar la mejor opción para distintos casos de uso. A continuación…
50+ Casos de uso de ChatGPT con ejemplos reales
ChatGPT alcanzó aproximadamente 1 mil millones de usuarios activos semanales a principios de 2026, aproximadamente el 10 % de la población mundial.1 OpenAI superó los $20 mil millones en ingresos anuales en 2025, confirmado por la directora financiera Sarah Friar.2 El Anthropic Economic Index distingue dos modos de uso: el aumento, en el que un humano…
ChatGPT para Atención al Cliente: Los 10 Principales Casos de Uso
ChatGPT ha pasado de ser una novedad a ser infraestructura en atención al cliente. Las empresas lo utilizan para reducir los tiempos de respuesta, gestionar el volumen que sus equipos no pueden absorber y reducir el coste de las interacciones rutinarias. Pero los resultados varían enormemente según cómo se implemente. OpenAI lanzó GPT-5.6, un model…
El futuro de los large language models
Vea el futuro de los large language models adentrándose en enfoques prometedores, como el autoentrenamiento, la verificación de hechos y la experiencia dispersa que podrían abordar las limitaciones de los LLM. Comparación de la tasa de éxito de los LLM Claude Sonnet 4.6 lideró el benchmark con una puntuación general de 0.748, con las variantes…
Densidad de inteligencia de 71 LLMs para modelos más inteligentes y densos
Rastreamos 71 LLMs lanzados entre febrero de 2023 y mayo de 2026 y recopilamos 10 benchmarks públicos para medir la densidad de inteligencia. Dividimos la puntuación de capacidad por el recurso que consume el modelo (parámetros activos, cómputo de entrenamiento y precio de inference). Para calcular la densidad de inteligencia, ejecutamos los siguientes pasos: Consulte…