El modelo más reciente del Índice de Inteligencia de AIMultiple es Claude Opus 5.5.
Benchmarks de LLM
Un único Índice de Inteligencia transparente que combina benchmarks públicos con las propias evaluaciones agénticas, de RAG y de razonamiento empresarial de AIMultiple. Cómo se construye el índice
Clasificación
Los modelos con mayor puntuación en todos los benchmarks.
# | Modelo | Índice | AA-LCR | AIM-A-CODE-LLM Bench | AIM-Agentic-RAG | AIM-FinanceReasoning | AIM-HALC-Bench | AIM-RELC-Bench | AIM-Text-to-SQL | APEX-Agents-AA | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | ArxivMath | AutomationBench-AA | BioMysteryBench | BrowseComp | Convex Coding Evals | CritPt | Crosby RedlineBench | DeepSWE 1.1 | EnterpriseOps-Gym-AA | Frontier-Bench | FrontierCode | FrontierMath | GDPval | GPQA Diamond | Harvey LAB-AA | HealthBench Professional | HieroglyphBench | Humanity's Last Exam | IFBench | ITBench-AA | LegalBench | LiveCodeBench | MMMU-Pro | ObviousBench | Opus Magnum Bench | ReactBench | RuneBench | SciCode | SimpleBench | Swe-Bench | Tau2-Bench Telecom | Tau3-Banking | Terminal-Bench 2.1 | Terminal-Bench 4.0 | Terminal-Bench Hard | Terminal-Bench-Science |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5.5 Anthropic | 100 | - | - | 90 | 92 | - | - | 88 | - | - | - | - | - | - | - | - | - | 32 | - | - | - | - | - | - | 1846 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 67 | - | - | - | - | - | - | - | - |
| 2 | GPT-6 Astra OpenAI | 92 | - | - | 84 | 87 | - | - | 66 | - | - | 95 | 63 | - | 41 | - | 92 | 85 | 32 | - | 74 | - | - | 53 | 98 | 1542 | 96 | - | 70 | - | - | - | - | - | - | - | - | - | - | 7 | 56 | - | - | - | - | 90 | 58 | - | - |
| 3 | Claude Fable 5.1 Anthropic | 91 | 80 | - | 84 | 90 | - | - | 67 | - | 98 | 90 | - | - | 31 | - | - | 81 | 31 | - | 67 | - | - | 51 | 88 | 1735 | 94 | - | 62 | - | 59 | - | - | 89 | - | - | - | - | - | 6 | 63 | - | - | - | 47 | 91 | 56 | - | - |
| 4 | Qwen3.8 Flash Alibaba Cloud | 87 | 77 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 1743 | 92 | - | - | - | 38 | 81 | - | - | - | - | - | - | - | - | 47 | - | - | - | 45 | 86 | - | - | - |
| 5 | Command A+ Cohere | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 30 | - | - | - | - | - | - | - | - | - | - | - | - | 74 | - | 61 | - | - | - | - | - | - | - | - | - | 81 | - | - | - | 25 | - |
| 6 | MiMo-V2.6-Pro Xiaomi | 87 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 27 | - | - | - | - | - | - | 1673 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 61 | - | - | - | - | - | - | - | - |
| 7 | Muse Spark 1.1 Meta | 86 | 81 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 53 | - | - | - | - | 1381 | 90 | - | 59 | - | 46 | - | - | 85 | - | - | 99 | - | 23 | 6 | 58 | - | - | - | 32 | 78 | - | - | - |
| 8 | Claude Fable 5 Anthropic | 85 | 77 | 69 | 82 | 90 | - | - | 66 | 59 | 99 | 89 | - | 79 | 17 | - | 87 | 84 | 29 | - | 70 | - | 34 | 54 | 90 | 1741 | 93 | 14 | 63 | 23 | 56 | 64 | - | 89 | - | 81 | 99 | 22 | 47 | 6 | 61 | 82 | - | 99 | 38 | 85 | 42 | 63 | 21 |
| 9 | Claude Opus 5 Anthropic | 83 | 79 | - | 85 | 90 | - | - | 64 | - | 98 | 90 | 30 | 91 | 50 | 79 | 91 | 82 | 29 | - | 74 | - | 44 | 53 | 73 | 1708 | 94 | - | 60 | - | 55 | - | - | 87 | - | 85 | 100 | - | - | 6 | 56 | - | - | - | 45 | 89 | 52 | - | 30 |
| 10 | GPT-6 Sol OpenAI | 79 | - | - | 82 | - | - | - | 54 | - | - | - | - | - | - | - | - | - | 31 | - | - | - | - | - | - | 1487 | - | - | - | - | - | - | - | - | - | - | - | - | - | - | 58 | - | - | - | - | - | - | - | - |
Cómo se construye el índice
Cada benchmark se lee como una posición, no como una puntuación bruta. Dentro de un benchmark el mejor resultado se sitúa en 100, el peor en 0, y el resto de los modelos cae en algún punto intermedio. El índice es la media ponderada de esas posiciones sobre los benchmarks que un modelo ha ejecutado realmente: un benchmark que nunca ejecutó no cuenta como cero, simplemente no está. Los benchmarks no cuentan por igual, y el peso que lleva cada uno se indica junto a él. Un modelo necesita resultados en al menos dos benchmarks del índice para ser clasificado, de modo que un único resultado sitúa al modelo en la línea de ese benchmark sin darle una posición propia. Se usan posiciones en lugar de precisión bruta porque los benchmarks difieren mucho en dificultad y escala, y las puntuaciones de benchmarks distintos no pueden compartir una media. Pesos: AIM-FinanceReasoning (10%) + AIM-Text-to-SQL (10%) + AIM-Agentic-RAG (10%) + SciCode (10%) + FrontierMath (10%) + Terminal-Bench 2.1 (10%) + CritPt (10%) + IFBench (10%) + MMMU-Pro (10%) + ARC-AGI-3 (10%).
Benchmarks que usamos
Actualizaciones recientes
Últimos cambios en el Índice de Inteligencia, la cobertura de modelos y la metodología de benchmarks de AIMultiple.
Claude Opus 5.5
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-6 Sol
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
GPT-6 Luna
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
MiMo-V2.6-Pro
Nuevo modelo añadido al Índice de Inteligencia de AIMultiple.
Explorar Casos de uso, análisis y comparativas del programa LLM
Simulación de audiencia: ¿Pueden los LLMs predecir el comportamiento humano?
En marketing, evaluar con qué precisión los LLMs predicen el comportamiento humano es crucial para valorar su efectividad en la anticipación de las necesidades de la audiencia y reconocer los riesgos de desalineación, comunicación ineficaz o influencia no deseada. La simulación de audiencias con LLMs permite modelar audiencias virtuales, ayudando a las organizaciones a prever…
HALC-Bench: LLM Alucinación en Benchmark de Recuperación de Contexto Largo
HALC-Bench (LLM Hallucination on Long-Context Retrieval Benchmark) mide la resistencia de un LLM a fabricar evidencia para una métrica que no existe en el documento objetivo mediante el uso de 3 pajares colocados al principio, en el medio y al final de la ventana de contexto del modelo, con 204 preguntas. claude-fable-5 respondió correctamente a…
Puertas de enlace de IA para OpenAI: alternativas a OpenRouter
Comparamos OpenRouter, SambaNova, TogetherAI, Groq y IA/ML API en tres indicadores (latencia del primer token, latencia total y número de tokens de salida), con 300 pruebas usando prompts cortos (aprox. 18 tokens) y prompts largos (aprox. 203 tokens) para la latencia total. Si planea usar una de estas puertas de enlace de IA, puede: En…
LLM Herramientas de observabilidad: Weights & Biases, Langsmith
Las aplicaciones de LLM han evolucionado de chats de un solo turno a agentes de varios pasos que usan herramientas, consultan bases de datos y se coordinan con otros modelos, lo que hace que su comportamiento sea más difícil de interpretar. La observabilidad de LLM proporciona visibilidad continua de estos flujos de trabajo complejos, ayudando…
Nube LLM vs Local LLMs: Ejemplos y beneficios
Nube LLMs, impulsados por modelos avanzados como GPT-5.5 y Claude Opus 4.7, ofrecen escalabilidad y accesibilidad. Por el contrario, Local LLMs, impulsados por modelos de código abierto como Llama 4, DeepSeek V4 y Qwen3.6-Plus, garantizan una mayor privacidad y personalización. Explore qué son los Nube LLMs, sus fortalezas y debilidades, los casos de estudio más…
LLM Guía de Fine-Tuning para Empresas
Siga los enlaces para encontrar soluciones específicas a los desafíos de salida de su LLM. Si su LLM: La adopción generalizada de modelos de lenguaje grandes (LLMs) ha mejorado nuestra capacidad para procesar el lenguaje humano. Sin embargo, su entrenamiento genérico a menudo resulta en un rendimiento subóptimo para tareas específicas. Para superar esta limitación,…
10+ Ejemplos de modelos de lenguaje grandes
Hemos recopilado benchmarks de código abierto para comparar los principales modelos de lenguaje grandes propietarios y de código abierto. Elija su caso de uso para encontrar el modelo adecuado. Puede evaluar los modelos de lenguaje grandes examinando su rendimiento en benchmarks y la latencia en el mundo real (disponible al hacer clic en el nombre…
Precios de LLM: Comparativa de 15+ proveedores principales
Los precios de LLM abarcan cuatro órdenes de magnitud: los models más baratos se lanzaron por menos de $0,03 por millón de tokens, mientras que los niveles de razonamiento frontera se lanzaron hasta $262.50. El gráfico siguiente rastrea los precios de lanzamiento: cada punto es el precio promedio de los models de una clase de…
LLM Automatización: Top 7 herramientas y 8 casos de estudio
La automatización de LLM se refiere al cambio hacia herramientas de automatización inteligentes que aprovechan LLMs, incluidos los agentes de IA, los LLMs ajustados y los modelos RAG para automatizar y coordinar tareas. Descubra qué es la automatización de LLM, sus principales aplicaciones en la vida real y las principales herramientas: Los grandes modelos de…
LLM Orquestación: 22 frameworks y pasarelas
Optimizar la orquestación de LLM es clave para mejorar el rendimiento manteniendo el uso de recursos bajo control. Para evaluar cómo se desempeñan en la práctica los distintos enfoques de orquestación, realizamos benchmarks: Descubra herramientas seleccionadas de orquestación de LLM, incluidos los frameworks para desarrolladores y las pasarelas empresariales: La orquestación de LLM consiste en…